Ir al contenido

Conversación en tiempo real

El modo Conversación convierte el chat en una llamada: hablas, el agente te escucha mientras hablas, piensa y te contesta en voz alta. Puedes cortarle a media frase y seguir hablando, como con una persona. No es dictado (grabar → transcribir → enviar): el audio viaja en los dos sentidos a la vez.

Por dentro usa WebRTC con un servidor LiveKit que corre en tu propio equipo, así que el audio no sale de tu máquina más de lo que ya salga el modelo que hayas elegido.

  1. Enciende el interruptor.

    Ve a Configuración → Voz y lectura y activa «Conversación en tiempo real (LiveKit)» (viene apagado). Es voz full-duplex sobre WebRTC local: interrupciones, detección de turno y streaming real.

  2. Elige el micrófono.

    En el compositor del chat, el selector de Micrófono lista los dispositivos detectados (Predeterminado del sistema si no quieres elegir). Si acabas de enchufar unos auriculares, pulsa Volver a detectar.

  3. Elige la voz con la que te va a contestar.

    Es la misma voz de lectura en voz alta (Voz): el motor y la voz que tengas configurados ahí son los que hablarán en la conversación — Edge TTS, Groq, Kokoro, Pocket o Chatterbox. Se puede cambiar en caliente, sin colgar: la siguiente frase ya sale con la voz nueva.

  4. Pulsa el botón de conversación en el chat («Conversación de voz en tiempo real (Modo Conversación)»).

    Desde la 3.6.0 no hay nada que descargar: el motor de voz viene dentro del instalador. Arranca en segundos.

  5. Habla.

    El agente saluda con un «Te escucho.» y la conversación empieza.

El modo Conversación: estado, ondas y subtítulos en vivo de lo que dices y de lo que responde.

La ventana de conversación va diciendo en qué punto está:

EstadoQué significa
Conectando con el agente de voz…Arrancando el servidor local y el agente. Unos segundos.
Escuchándote…El micrófono está abierto y es tu turno.
Procesando…Ya terminaste de hablar y el modelo está pensando.
Hablando…El agente está contestando en voz alta.

Además:

  • Subtítulos en vivo: lo que dices y lo que contesta el agente aparecen escritos según se van produciendo, sin esperar al final de la frase.
  • Interrupción por voz: si empiezas a hablar mientras el agente habla, se calla al instante y pasa a escucharte («Te escucho…»). No hay que pulsar nada.
  • «¿Sigues ahí?»: tras unos 20 segundos sin que digas nada, el agente pregunta si sigues ahí en vez de quedarse mudo.
  • Reintentar: si la conexión falla, el panel no se queda colgado — aparece el botón Reintentar.
  • Finalizar conversación cierra la llamada y devuelve el chat a su modo normal. Lo hablado queda en el chat como cualquier otro mensaje.

Nada que instalar ni que descargar. Desde la 3.6.0 el instalador de Windows, Linux y macOS trae dentro todo el motor de voz:

  • El intérprete de Node y el agente de voz empaquetados para tu plataforma.
  • El servidor LiveKit (versión 1.13.7), que escucha en el puerto 7880 de tu propio equipo.
  • Los modelos: el detector de voz Silero y el detector de fin de turno viajan dentro del paquete. El reconocimiento usa el mismo Whisper local del dictado.

Por eso el modo Conversación funciona sin conexión a internet. Lo único que necesita red es el modelo de IA que conteste (salvo que uses uno local) y, si eliges Edge TTS o Groq como voz, la síntesis de esa voz.

Lo que sí hace falta:

  • Un proveedor de IA conectado: el «cerebro» de la conversación es el mismo modelo del chat. Si no hay proveedor, el modo voz avisa: «El dictado necesita un modelo de IA conectado. Conecta un proveedor y vuelve a intentarlo.»
  • Un motor de TTS configurado para la respuesta hablada — ver Voz.

Funciona en los 17 idiomas de la interfaz: el reconocimiento y el saludo siguen el idioma que tengas puesto en la app.

«el servidor LiveKit no arrancó» : Pulsa Reintentar. Si se repite, algo está ocupando el puerto 7880 o un antivirus está bloqueando el binario del servidor; reinicia la aplicación.

«el agente de voz se cerró antes de registrarse» / «el agente de voz no se registró en 60 s» : Ocurría al arrancar dos veces seguidas o si quedaba un proceso huérfano de un intento anterior. Cierra la conversación, espera unos segundos y pulsa Reintentar; si persiste, reinicia la aplicación.

«esta plataforma no tiene build oficial de livekit-server» : El modo Conversación necesita un binario oficial de LiveKit para tu sistema y arquitectura. En esa máquina quedan el dictado y la lectura en voz alta de siempre.

Se activa solo con el ruido del teclado : El detector de voz está calibrado para ignorar los clics de un teclado mecánico (una palabra real dura más de 250 ms, un clic no). Si aun así se dispara, aleja el micrófono del teclado o usa unos auriculares con micro.

El micrófono aparece pero no entra audio : Micrófonos «virtuales» (los de una tarjeta de captura, algunos de software) publican silencio. Elige otro dispositivo en el selector de Micrófono. En Windows, si el acceso está bloqueado, la app lo dice: «Windows bloqueó el acceso al micrófono. Ve a Configuración → Privacidad y seguridad → Micrófono…».

Elegí una voz de Groq y responde con otra voz : Algunas voces de Groq requieren aceptar sus términos en la consola de Groq antes de poder usarse. Si el motor configurado falla, la app no cuelga la llamada: sintetiza esa frase con Edge TTS para que puedas seguir hablando. Acepta los términos en tu cuenta de Groq y la voz elegida volverá a sonar.

El micrófono está en uso por otra aplicación : Ciérrala (otra videollamada suele ser la culpable) e inténtalo de nuevo.