Conversa por telefone não é um revezamento educado. A pessoa corrige o nome no meio da frase, responde “sim, sim” antes de a pergunta acabar, lembra de outra coisa e fala por cima. Quem atende de verdade para, escuta e retoma. Um agente de voz que segue falando até o fim da frase deixa claro, em dois segundos, que do outro lado tem uma máquina lendo um texto.
Barge-in é a capacidade de o agente de voz parar de falar quando a pessoa começa a falar por cima. Na prática, exige três coisas: perceber a fala do usuário enquanto o áudio do agente ainda toca, descartar o áudio que já estava na fila para sair e registrar no histórico só o trecho que o cliente de fato ouviu. Sem a terceira, o agente “lembra” de ter dito o que ninguém escutou.
Por que parar é mais difícil do que parece
Num pipeline de voz encadeado (transcrição, modelo de linguagem, síntese de fala), a resposta vira áudio antes de chegar ao ouvido do cliente, e parte desse áudio já está no buffer da linha. Parar de gerar não basta: é preciso mandar o provedor de telefonia descartar o que ainda não tocou. E se o sistema só percebe a interrupção quando a transcrição final chega, a pessoa já falou uma frase inteira por cima de uma voz que não parava.
O falso positivo é o inimigo
O microfone do cliente capta tudo: tosse, “aham”, a TV ligada e o eco da própria voz do agente voltando pela linha. Um agente que para a cada ruído fica gago e nunca termina uma frase. Por isso o sinal de “começou a falar” não pode ser o gatilho sozinho.
- A detecção de atividade de voz marca um candidato a interrupção, mas ainda não interrompe.
- A interrupção só acontece quando a transcrição parcial traz palavras de verdade, duas ou mais, depois de um tempo mínimo de fala.
- Logo que o agente começa a falar existe uma janela curta de proteção contra eco, porque é ali que a própria voz volta pela linha.
- Um teto de interrupções por minuto impede que uma linha ruidosa transforme a conversa num loop de começos de frase.
Um agente que nunca para soa como gravação. Um agente que para a qualquer barulho soa pior: parece que a ligação está falhando.
O histórico precisa refletir o que foi ouvido
Esse é o detalhe que mais passa batido. Se o agente ia explicar três planos e foi interrompido no primeiro, o registro da conversa não pode conter os três. Senão, no turno seguinte, o modelo age como se o cliente já conhecesse os outros dois, e o resumo que chega ao time comercial descreve uma conversa que não aconteceu. O certo é cortar o texto no ponto aproximado em que o áudio parou e seguir dali.
O que a interrupção não desfaz
Parar de falar é seguro. Desfazer uma ação, não. Se o agente estava consultando um sistema ou registrando um pedido quando o cliente interrompeu, o áudio para, mas a ação vai até o fim. Vale desenhar as ferramentas do agente pensando nisso: confirmar com o cliente antes de executar o que é irreversível, e não depois.
Como está na Take Sales
Os agentes de voz da Take Sales rodam em dois modos. No modo de áudio nativo em tempo real, o próprio modelo trata a interrupção. No modo pipeline, que combina transcrição, modelo de linguagem e síntese de voz separados, o barge-in está ligado em produção desde setembro de 2026, com os cuidados acima: gatilho confirmado pela transcrição, proteção contra eco, teto por minuto e histórico cortado no trecho falado. Vale tanto para a voz no widget do site quanto para a ligação telefônica.
O teste de trinta segundos continua o mesmo: fale por cima do agente enquanto ele responde. O texto sobre latência explica por que esse teste diz tanto sobre a arquitetura, e a comparação com URA mostra o que muda para quem liga.


