Agentes de voz en tiempo real: un problema de latencia
El chat de texto puede tomarse su tiempo. Una voz que se queda en silencio varios segundos antes de cada respuesta, o que habla por encima de ti, se siente rota incluso con un modelo perfecto.
La idea que hay dentro
La voz es un bucle en tiempo real con un presupuesto de latencia estricto: transmite la transcripción, empieza a responder pronto, permite la interrupción y respeta los turnos, o se siente lento y maleducado.
Después de esta lección
Puedes explicar por qué la voz en tiempo real es un problema de sistemas: streaming, presupuesto de latencia, turnos e interrupción (barge-in), no solo speech-to-text más un LLM más text-to-speech.
Adónde lleva
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
La voz es un bucle en tiempo real con un presupuesto de latencia estricto: transmite la transcripción, empieza a responder pronto, permite la interrupción y respeta los turnos, o se siente lento y maleducado.
La pregunta con la que abre
El chat de texto puede tomarse su tiempo. Una voz que se queda en silencio varios segundos antes de cada respuesta, o que habla por encima de ti, se siente rota incluso con un modelo perfecto.
El recorrido, en palabras de la propia lección
- Activa los toggles. Baja el silencio muerto del presupuesto y deja que el usuario interrumpa.
- Esperar a que el usuario termine del todo parece más prolijo. Predice cómo se siente.
- La voz es un bucle en tiempo real e interrumpible con presupuesto de latencia, no una línea recta.
- Deja que el usuario corte y el agente deja de hablar.
- El silencio muerto está dentro del presupuesto y el usuario puede interrumpir. El turno se siente como hablar con una persona, no como esperar a una máquina.
- Demasiado silencio muerto. El pipeline en serie hace que el usuario espere en silencio. Haz streaming de la transcripción y empieza a responder antes para solapar el trabajo.
- Ágil ahora, pero el usuario aún no puede interrumpir una respuesta larga. Activa barge-in para que pueda cortar.
- Apagado por defecto es la línea ingenua: speech-to-text, luego el modelo, luego text-to-speech, uno estrictamente tras otro, sin forma de interrumpir. Activa streaming y responder-antes para que los pasos se solapen en vez de apilarse, y luego activa barge-in para que el usuario siga teniendo el control.
- El eslabón débil es el paso de speech-to-text. Los acentos, el ruido de fondo y el code-switching (saltar entre español e inglés a mitad de frase) suben los errores de transcripción, y cada palabra mal transcrita entra al modelo como si el usuario la hubiera dicho de verdad. Súmalo al ida y vuelta de escuchar, pensar y hablar, y un agente de voz tiene mucho menos margen de error que un chat.
- Los tiempos aquí son milisegundos ilustrativos, no números medidos, pero el trade-off es real.
- Esperar a que el usuario termine por completo antes de que el modelo empiece parece más limpio. ¿Hace que la conversación se sienta mejor o peor?
- Esperar a terminar del todo añade silencio muerto. La gente espera turnos por debajo del segundo, así que hacer streaming de la transcripción y responder antes es lo que se siente humano, aunque el pipeline haga más cosas a la vez.
- Una llamada a herramienta (buscar algo, pegarle a una API) añade latencia que no puedes solapar, porque la respuesta depende del resultado. Los agentes de voz reales la enmascaran: el agente dice un relleno corto como "déjame revisar eso" para que la línea nunca quede en silencio mientras corre la herramienta.
- La IA de voz es solo speech-to-text, luego un LLM, luego text-to-speech, en línea.
- Es un bucle en tiempo real e interrumpible con un presupuesto estricto de latencia: streaming, responder antes, permitir barge-in y tomar turnos.
- Los agentes de voz más nuevos cambian todo el pipeline por un solo modelo nativo de voz (speech-to-speech: entra audio, sale audio, sin texto en medio). Eso recorta aún más el silencio muerto, y conserva la prosodia, el tono, las pausas y la emoción que una transcripción descarta, así que el agente puede oír que estás frustrado y suavizar su respuesta. El precio: cuesta bastante más por minuto, y sin una transcripción en medio es más difícil de registrar, depurar y controlar. Muchos equipos en producción siguen usando el pipeline que acabas de ajustar exactamente por esa razón.
- Un asistente de voz habla por encima de ti, o deja un silencio largo e incómodo antes de responder. ¿Qué está fallando en realidad?
- Un fallo de turnos y de presupuesto de latencia, no un modelo tonto. El silencio significa que el pipeline es en serie en vez de streaming, y que hable por encima de ti significa que el barge-in y la detección de fin de turno están apagados. La inteligencia del modelo está bien; el bucle en tiempo real a su alrededor está mal construido.
- Puedes leer un agente de voz como un bucle en tiempo real con presupuesto de latencia: streaming, responder antes, permitir barge-in y tomar turnos, en vez de una línea recta de speech-to-text a LLM a text-to-speech.
La idea clave
Convertiste un intercambio lento y robótico en uno ágil transmitiendo, respondiendo pronto y permitiendo interrupciones, todo dentro de un presupuesto de latencia fijo.
Qué puedes hacer después de esta lección
Puedes explicar por qué la voz en tiempo real es un problema de sistemas: streaming, presupuesto de latencia, turnos e interrupción (barge-in), no solo speech-to-text más un LLM más text-to-speech.
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.