Take Sales
Voltar ao blogVoz

Latência é o que decide se a voz do agente soa humana

6 min de leitura

Em texto, dois segundos de espera passam despercebidos: a pessoa está olhando para a tela e sabe que algo está sendo escrito. Em voz, dois segundos de silêncio são um problema. Quem está do outro lado assume que a ligação caiu, repete a pergunta, e agora o agente tem duas perguntas sobrepostas para responder.

Numa conversa por voz, o orçamento entre a última sílaba do usuário e o primeiro som do agente é de mais ou menos 500 a 800 milissegundos. Acima de um segundo, a conversa deixa de soar como conversa. Esse orçamento precisa cobrir detectar o fim da fala, transcrever, buscar o contexto, gerar a resposta e sintetizar o áudio, e é por isso que arquiteturas encadeadas raramente cabem nele.

Para onde o tempo vai

  • Detectar que a pessoa terminou de falar. Parece grátis e não é: esperar silêncio demais soa lerdo, esperar de menos faz o agente cortar a frase do cliente.
  • Transcrever o áudio em texto.
  • Encontrar o trecho certo na base de conhecimento.
  • Gerar a resposta.
  • Transformar a resposta em áudio.

Somados em série, cada um com a sua ida e volta de rede, esses cinco passos passam de dois segundos com facilidade. É por isso que voz em tempo real usa modelos que processam áudio de ponta a ponta em streaming, em vez de uma cadeia de chamadas separadas. Não é preferência de arquitetura, é o único jeito de caber no orçamento.

O que a pessoa percebe não é a latência total, é o tempo até o primeiro som. Uma resposta que começa em 400 ms e dura seis segundos soa melhor do que uma que começa em dois segundos e dura três.

Primeiro token, não resposta completa

Essa é a métrica que vale perguntar a um fornecedor, e a que raramente aparece no material de vendas. Latência mediana até a resposta completa esconde justamente o que importa. Peça a mediana e o percentil 95 até o primeiro token, porque é a cauda que estraga a ligação: se uma em vinte respostas leva quatro segundos, o cliente vai encontrar essa uma.

800 ms

O teto em que uma resposta por voz ainda soa como conversa. Acima disso, a pessoa começa a repetir a pergunta.

O teste de trinta segundos

Existe um teste que expõe qualquer arquitetura encadeada em meio minuto: fale por cima do agente enquanto ele responde. Um sistema em streaming de verdade para de falar, escuta e retoma. Um sistema encadeado termina a frase inteira, porque o áudio já tinha sido gerado antes de você abrir a boca.

O que fazer com a folga

Latência baixa não é o objetivo final, é espaço. Cada 100 ms economizados no transporte são 100 ms que podem virar uma busca melhor na base ou uma verificação a mais antes de responder. Times que otimizam latência só para bater um número acabam com um agente rápido e raso; o ganho de verdade é usar a folga para responder melhor dentro do mesmo tempo percebido.

O outro lado disso é que voz não aceita as mesmas verificações que o texto aceita. Checagem completa de fidelidade custa tempo que a conversa não tem, então em voz fica o que é barato e obrigatório: mascarar dado sensível antes de sair. Vale ver latência de resposta e mascaramento de PII no glossário, e a comparação com URA se o cenário for telefonia.

#Voz#Latência#Arquitetura

Comece a conversa hoje

Lance um agente de IA que qualifica leads e agenda reuniões a qualquer hora. No ar em menos de dez minutos.

Demonstração guiada · seu agente no ar em menos de 10 minutos