Take Sales
Volver al blogVoz

La latencia es lo que decide si la voz del agente suena humana

En texto, dos segundos de espera pasan desapercibidos: la persona mira la pantalla y sabe que algo se está escribiendo. En voz, dos segundos de silencio son un problema. Quien está del otro lado asume que se cortó la llamada, repite la pregunta, y ahora el agente tiene dos preguntas superpuestas que responder.

En una conversación por voz, el presupuesto entre la última sílaba del usuario y el primer sonido del agente es de unos 500 a 800 milisegundos. Por encima de un segundo deja de sonar a conversación. Ese presupuesto tiene que cubrir detectar el final del habla, transcribir, recuperar el contexto, generar la respuesta y sintetizar el audio, y por eso las arquitecturas encadenadas rara vez caben dentro.

Adónde se va el tiempo

  • Detectar que la persona terminó de hablar. Parece gratis y no lo es: esperar demasiado silencio suena lento, esperar poco hace que el agente corte la frase del cliente.
  • Transcribir el audio a texto.
  • Encontrar el fragmento correcto en la base de conocimiento.
  • Generar la respuesta.
  • Convertir la respuesta en audio.

Sumados en serie, cada uno con su ida y vuelta de red, esos cinco pasos superan los dos segundos con facilidad. Por eso la voz en tiempo real usa modelos que procesan audio de extremo a extremo en streaming, en lugar de una cadena de llamadas separadas. No es una preferencia de arquitectura, es la única forma de caber en el presupuesto.

Lo que la persona percibe no es la latencia total, es el tiempo hasta el primer sonido. Una respuesta que empieza en 400 ms y dura seis segundos suena mejor que una que empieza en dos segundos y dura tres.

Primer token, no respuesta completa

Esta es la métrica que conviene pedirle a un proveedor, y la que rara vez aparece en el material de ventas. La latencia mediana hasta la respuesta completa esconde justo lo que importa. Pide la mediana y el percentil 95 hasta el primer token, porque es la cola la que arruina la llamada: si una de cada veinte respuestas tarda cuatro segundos, el cliente va a encontrar esa una.

800 ms

El techo en el que una respuesta por voz todavía suena a conversación. Por encima, la persona empieza a repetir la pregunta.

La prueba de treinta segundos

Hay una prueba que deja al descubierto cualquier arquitectura encadenada en medio minuto: habla por encima del agente mientras responde. Un sistema en streaming de verdad se detiene, escucha y retoma. Un sistema encadenado termina la frase entera, porque el audio ya se había generado antes de que abrieras la boca.

Qué hacer con el margen

La latencia baja no es el objetivo final, es espacio. Cada 100 ms ahorrados en el transporte son 100 ms que pueden convertirse en una mejor búsqueda sobre la base o en una verificación más antes de responder. Los equipos que optimizan la latencia solo para cumplir una cifra acaban con un agente rápido y superficial; la ganancia real es gastar el margen en responder mejor dentro del mismo tiempo percibido.

La otra cara es que la voz no tolera las mismas comprobaciones que el texto. Una verificación completa de fidelidad cuesta un tiempo que la conversación no tiene, así que en voz queda lo barato y obligatorio: enmascarar el dato sensible antes de que salga. Conviene ver latencia de respuesta y enmascaramiento de PII en el glosario, y la comparación con una IVR si el escenario es telefonía.

#Voz#Latencia#Arquitectura

Inicia la conversación hoy

Lanza un agente de IA que califica leads y agenda reuniones las 24 horas. En marcha en menos de diez minutos.

Demo guiada · tu agente en marcha en menos de 10 minutos