Em texto, dois segundos de espera passam despercebidos: a pessoa está olhando para a tela e sabe que algo está sendo escrito. Em voz, dois segundos de silêncio são um problema. Quem está do outro lado assume que a ligação caiu, repete a pergunta, e agora o agente tem duas perguntas sobrepostas para responder.
Numa conversa por voz, o orçamento entre a última sílaba do usuário e o primeiro som do agente é de mais ou menos 500 a 800 milissegundos. Acima de um segundo, a conversa deixa de soar como conversa. Esse orçamento precisa cobrir detectar o fim da fala, transcrever, buscar o contexto, gerar a resposta e sintetizar o áudio, e é por isso que arquiteturas encadeadas raramente cabem nele.
Para onde o tempo vai
- Detectar que a pessoa terminou de falar. Parece grátis e não é: esperar silêncio demais soa lerdo, esperar de menos faz o agente cortar a frase do cliente.
- Transcrever o áudio em texto.
- Encontrar o trecho certo na base de conhecimento.
- Gerar a resposta.
- Transformar a resposta em áudio.
Somados em série, cada um com a sua ida e volta de rede, esses cinco passos passam de dois segundos com facilidade. É por isso que voz em tempo real usa modelos que processam áudio de ponta a ponta em streaming, em vez de uma cadeia de chamadas separadas. Não é preferência de arquitetura, é o único jeito de caber no orçamento.
O que a pessoa percebe não é a latência total, é o tempo até o primeiro som. Uma resposta que começa em 400 ms e dura seis segundos soa melhor do que uma que começa em dois segundos e dura três.
Primeiro token, não resposta completa
Essa é a métrica que vale perguntar a um fornecedor, e a que raramente aparece no material de vendas. Latência mediana até a resposta completa esconde justamente o que importa. Peça a mediana e o percentil 95 até o primeiro token, porque é a cauda que estraga a ligação: se uma em vinte respostas leva quatro segundos, o cliente vai encontrar essa uma.
800 ms
O teste de trinta segundos
Existe um teste que expõe qualquer arquitetura encadeada em meio minuto: fale por cima do agente enquanto ele responde. Um sistema em streaming de verdade para de falar, escuta e retoma. Um sistema encadeado termina a frase inteira, porque o áudio já tinha sido gerado antes de você abrir a boca.
O que fazer com a folga
Latência baixa não é o objetivo final, é espaço. Cada 100 ms economizados no transporte são 100 ms que podem virar uma busca melhor na base ou uma verificação a mais antes de responder. Times que otimizam latência só para bater um número acabam com um agente rápido e raso; o ganho de verdade é usar a folga para responder melhor dentro do mesmo tempo percebido.
O outro lado disso é que voz não aceita as mesmas verificações que o texto aceita. Checagem completa de fidelidade custa tempo que a conversa não tem, então em voz fica o que é barato e obrigatório: mascarar dado sensível antes de sair. Vale ver latência de resposta e mascaramento de PII no glossário, e a comparação com URA se o cenário for telefonia.



