Glosario
Agente de voz
Agente de IA que conversa por audio en tiempo real, transcribiendo el habla y respondiendo con voz sintetizada. El requisito técnico principal es la latencia: por encima de un segundo aproximado, la conversación deja de sonar natural.
La voz añade una restricción que el texto no tiene: la respuesta debe empezar antes de que el silencio incomode. En texto, dos segundos de espera se leen como reflexión. En audio se leen como llamada caída.
Ese presupuesto de tiempo tiene que cubrir transcribir el habla, buscar la respuesta, generarla y sintetizarla de vuelta en audio. Las arquitecturas que funcionan bien en chat (una cadena de llamadas separadas) suelen pasarse, y por eso los modelos de voz en tiempo real transmiten todo de una vez.
El resto es el mismo producto: misma base de conocimiento, mismos guardrails, mismo traspaso. Solo el techo de latencia y los modos de fallo (ruido de fondo, gente hablando encima, acentos poco frecuentes) son propios del audio.
Inicia la conversación hoy
Lanza un agente de IA que califica leads y agenda reuniones las 24 horas. En marcha en menos de diez minutos.
Demo guiada · tu agente en marcha en menos de 10 minutos


