Porque esperam os clientes pelo agente de IA
A pausa depois de o cliente parar de falar é a soma de seis partes. Meça todos os turnos, analise os mais lentos e corrija a parte que mais tempo ocupa.
Em resumo
Quando o cliente acaba de falar e só ouve silêncio, essa pausa raramente tem uma só causa. É a soma de seis partes: Fim de turno, Transcrição, Modelo, Consulta, Início da voz e Linha. A Consulta só existe nos turnos com consulta, em que o agente verifica algo num sistema, por exemplo o estado de uma encomenda. Todos os outros turnos são turnos simples.
Neste guia, chamamos a essa pausa tempo de reação: vai do momento em que o cliente se cala até ao primeiro som do agente, tal como o cliente o ouve. Um tempo de reação médio esconde os turnos de que os clientes se lembram. Por isso, meça todos os turnos, separe os turnos simples dos turnos com consulta e leia a mediana e o percentil 90.
Depois, encontre a parte mais longa em cada um dos turnos mais lentos. A parte que aparece mais vezes como a mais longa é a primeira a corrigir. Mude uma parte de cada vez e vigie o sinal oposto: um agente que espera menos antes de responder pode começar a cortar a palavra aos clientes. Quando não há como evitar a demora, uma frase de espera dá ao cliente um primeiro som mais cedo. Mas não faz a resposta chegar mais cedo.
Não copie um valor-alvo, venha ele de onde vier. Descubra a partir de que tempo de reação os seus próprios clientes começam a dizer «Estou?» no silêncio. Esse é o seu limiar.
O nosso artigo sobre onde o cliente desliga nas chamadas com IA identifica a etapa em que os clientes abandonam a chamada. Este guia desce um nível: porque é que o silêncio é longo e que parte corrigir. Todos os números que se seguem são exemplos, e não dados da DRING nem do setor.
As seis partes do tempo de reação
Entre a última palavra do cliente e o primeiro som do agente, o tempo divide-se em seis partes. Este guia apresenta-as sempre por esta ordem:
| Parte | O que acontece | O que costuma torná-la longa | Como se mede |
|---|---|---|---|
| Fim de turno | O sistema decide que o cliente acabou de falar. | Espera por um silêncio longo antes de decidir. | Do fim da fala do cliente, na sua gravação, até à decisão do sistema |
| Transcrição | O reconhecimento de fala entrega o texto final. | O texto final só chega depois de a frase inteira ser processada. | Da decisão até ao texto final |
| Modelo | O modelo decide o que fazer e escreve a resposta. | Uma primeira frase longa, um prompt extenso, uma longa cadeia de raciocínio antes de falar. | Do texto final até à resposta. Num turno com consulta, há dois blocos: até ao pedido da Consulta, e do resultado da Consulta até à resposta |
| Consulta | Uma verificação num sistema, como o estado de uma encomenda. Só nos turnos com consulta. | Um sistema lento, verificações feitas uma a seguir à outra, sem limite de tempo. | Do pedido até o sistema devolver o resultado |
| Início da voz | A voz produz o primeiro áudio da resposta. | A voz espera pelo texto completo da resposta antes de começar. | Desde que o texto da resposta chega à voz até o primeiro áudio sair do seu sistema |
| Linha | A telefonia e a rede transportam o áudio nos dois sentidos. | Rotas de chamada longas, regiões distantes, redes móveis fracas. | Chamadas de teste a partir de telefones comuns, gravadas do lado do cliente |
Duas partes aparecem em dois blocos. Num turno com consulta, o modelo trabalha antes da Consulta, para decidir o que verificar, e depois dela, para formular a resposta. Os dois blocos contam como Modelo. A Linha aparece em dois blocos em todos os turnos: a voz do cliente a chegar ao seu sistema e a voz do agente a chegar ao cliente. Os dois blocos contam como Linha.
Como medir cada turno
Meça turnos, não chamadas: na média de uma chamada, um turno com consulta lento pode esconder-se entre sete rápidos. Dê a cada turno um registo com os mesmos campos. Os valores de exemplo são os do turno lento apresentado mais à frente neste guia. Exemplo, e não dados reais.
| Campo | O que contém | Valor de exemplo |
|---|---|---|
| ID da chamada | Um único ID, partilhado pela gravação da chamada e pelos logs do sistema | C1047 |
| Número do turno | A posição da resposta do agente na chamada | 4 |
| Tipo de turno | Turno simples ou turno com consulta | Turno com consulta |
| Tempo de reação | Da última palavra do cliente até ao primeiro som do agente, com a Linha incluída | 3,9 s |
| Fim de turno | A sua gravação e as marcas de tempo do sistema | 0,7 s |
| Transcrição | Marcas de tempo do sistema | 0,2 s |
| Modelo | Marcas de tempo do sistema, com os dois blocos num turno com consulta | 0,6 s (0,3 s antes e 0,3 s depois da Consulta) |
| Consulta | Marcas de tempo do sistema, campo vazio num turno simples | 1,9 s |
| Início da voz | Marcas de tempo do sistema | 0,3 s |
| Linha | Chamadas de teste nas redes que os seus clientes usam | 0,2 s |
| Tempo por explicar | O tempo de reação na gravação do seu sistema, menos as partes que regista | 0,0 s |
| Cliente falou no silêncio | Sim, se durante o silêncio o cliente disse «Estou?» ou repetiu o que tinha dito | Sim |
| Resposta precipitada | Sim, se o agente começou a responder quando o cliente ainda estava a falar ou tinha feito apenas uma pausa | Não |
| Tarefa concluída | Por chamada: sim, se o cliente obteve aquilo por que ligou | Sim |
Meça primeiro o tempo de reação na gravação que o seu sistema faz da chamada. O ID partilhado associa cada turno da gravação às respetivas marcas de tempo do sistema, que lhe dão o Fim de turno, a Transcrição, o Modelo, a Consulta e o Início da voz. A Linha soma-se no passo seguinte.
A Linha não aparece na sua gravação. No seu sistema, o relógio arranca quando o áudio do cliente lhe chega e para quando o seu áudio sai. Por isso, faça chamadas de teste a partir de telefones comuns, nas redes que os seus clientes usam, e grave-as do lado de quem liga. O tempo de reação nessa gravação, menos o tempo de reação do mesmo turno na gravação do seu sistema, é a Linha. Some-a aos tempos de reação das suas chamadas reais.
Depois, confirme a soma. O tempo por explicar é o tempo de reação na gravação do seu sistema menos as partes que regista. Se for grande, falta uma marca de tempo. No turno de exemplo, a gravação do seu sistema mostra 3,7 segundos e as partes registadas somam 3,7 segundos, por isso o tempo por explicar é zero. Somando-lhe os 0,2 segundos da Linha, obtém os 3,9 segundos que o cliente ouve.
Porque é que a média esconde o problema
Exemplo, e não dados reais: 400 turnos do agente em 50 chamadas gravadas numa só linha, 300 turnos simples e 100 turnos com consulta. Todos os tempos de reação incluem a Linha, 0,2 segundos medidos com chamadas de teste.
| Tipo de turno | Turnos | Mediana | Média | Percentil 90 |
|---|---|---|---|---|
| Turnos simples | 300 | 1,1 s | 1,2 s | 1,8 s |
| Turnos com consulta | 100 | 2,9 s | 3,2 s | 4,6 s |
| Todos os turnos | 400 | 1,3 s | 1,7 s | 3,4 s |
A média de todos os turnos, 1,7 segundos, fica acima da mediana de 1,3 segundos porque os turnos lentos a puxam para cima. Nenhum dos dois números mostra os turnos de que os clientes se lembram. O percentil 90 (p90) mostra-os: é o tempo de reação que um turno em cada dez atinge ou ultrapassa, aqui 3,4 segundos. Os turnos que ficam nesse valor ou acima dele são os turnos mais lentos.
Separe também por tipo de turno. Os turnos simples têm uma mediana de 1,1 segundos, os turnos com consulta de 2,9 segundos. Uma semana com mais turnos com consulta faz subir os números de todos os turnos, mesmo que nenhuma parte tenha ficado mais lenta.
Agora distribua os mesmos 400 turnos por quatro faixas de tempo de reação: 130 turnos com menos de 1,0 segundo, 180 de 1,0 a 2,0 segundos, 50 de 2,0 a 3,4 segundos e 40 com 3,4 segundos ou mais. Depois, assinale os turnos em que o cliente falou no silêncio: disse «Estou?» ou repetiu o que tinha dito. Isso aconteceu em 31 dos 40 turnos mais lentos e em 7 dos outros 360: 3 vezes nos 310 turnos com menos de 2,0 segundos e 4 vezes nos 50 turnos de 2,0 a 3,4 segundos.
Nesta linha, portanto, é raro o cliente falar no silêncio abaixo de 2,0 segundos, continua a ser pouco frequente de 2,0 a 3,4 segundos e passa a ser comum a partir de 3,4 segundos. O limiar desta linha fica perto dos 3,4 segundos, e não é um objetivo geral. Encontre o seu da mesma forma: distribua os seus turnos por faixas e veja em que ponto isso deixa de ser raro e passa a ser comum. Faixas mais estreitas à volta desse ponto situam-no com mais precisão.
Encontre a parte mais longa nos turnos mais lentos
O percentil 90 mostra quão lentos são os turnos mais lentos, não porquê. Para saber porquê, abra cada turno lento e encontre a sua parte mais longa: a parte que mais tempo ocupou nesse turno.
Exemplo, e não dados reais: um dos 40 turnos mais lentos. O cliente pergunta pelo estado de uma encomenda, por isso é um turno com consulta. O relógio arranca no momento em que o cliente se cala, tal como se ouve do lado do cliente.
Por parte: Fim de turno 0,7 segundos, Transcrição 0,2 segundos, Modelo 0,6 segundos, Consulta 1,9 segundos, Início da voz 0,3 segundos e Linha 0,2 segundos. O Modelo divide-se em dois blocos de 0,3 segundos: um para decidir verificar a encomenda, outro para formular a resposta. A Linha tem 0,1 segundos em cada sentido. Juntas, as partes dão um tempo de reação de 3,9 segundos. A Consulta é a parte mais longa, quase metade do tempo de reação.
Os tempos das partes só se somam desta forma dentro de um turno. Com as medianas e os percentis 90 isso não acontece: as medianas das seis partes, somadas, não dão a mediana do tempo de reação. Por isso, encontre a parte mais longa turno a turno e só depois conte.
Exemplo, e não dados reais: a parte mais longa em cada um dos 40 turnos mais lentos.
| Parte mais longa | Turnos mais lentos |
|---|---|
| Fim de turno | 8 |
| Transcrição | 0 |
| Modelo | 5 |
| Consulta | 27 |
| Início da voz | 0 |
| Linha | 0 |
| Total | 40 |
A Consulta é a parte mais longa com mais frequência, em 27 dos 40. Isto bate certo com os tipos de turno: 36 dos turnos mais lentos são turnos com consulta e 4 são turnos simples. O Fim de turno é a parte mais longa em 8. Na maioria deles, o cliente fez uma pausa enquanto ditava um número, e o sistema esperou mais tempo antes de decidir que tinha acabado. O Modelo é a parte mais longa em 5.
Aqui, a Linha nunca é a parte mais longa, porque nesta linha se mantém estável nos 0,2 segundos. Noutra linha, pode ser. O nosso artigo sobre agentes que correm bem na demo e mal nas chamadas reais dá um teste rápido. Pausas em todos os turnos apontam para a linha. Pausas só nos turnos com consulta apontam para as ferramentas.
Corrija uma parte de cada vez e vigie o sinal oposto
Comece pela parte que aparece mais vezes como a mais longa nos seus turnos mais lentos, aqui a Consulta. Mude uma coisa e volte a medir os mesmos tipos de turno. Com duas alterações ao mesmo tempo, não há forma de saber qual delas mexeu no percentil 90.
Cada correção tem um custo, por isso a tabela indica também, para cada parte, o sinal a vigiar:
| Parte | O que experimentar | O que vigiar |
|---|---|---|
| Fim de turno | Uma espera que depende do que o cliente diz: mais curta depois de respostas curtas, como sim, não ou um nome, e mais longa enquanto o cliente dita um número ou soletra uma palavra. | Respostas precipitadas |
| Transcrição | Reconhecimento de fala em streaming, para que a maior parte do texto já esteja pronta quando o turno acaba. | Palavras e números mal ouvidos |
| Modelo | Uma primeira frase curta. Um plano de resposta simples para as perguntas mais comuns. | Qualidade e completude das respostas |
| Consulta | Fazer ao mesmo tempo as verificações que não dependem umas das outras. Definir um limite de tempo com uma saída segura: passar a chamada a uma pessoa da equipa ou propor uma chamada de retorno. Dizer uma frase de espera antes da verificação. | Respostas desatualizadas ou incompletas. Frases de espera repetidas em todos os turnos. |
| Início da voz | Pôr a voz a falar logo com a primeira frase, enquanto o resto ainda está a ser escrito. | Pausas pouco naturais a meio de uma resposta |
| Linha | Chamadas de teste a partir das redes que os seus clientes usam. Uma revisão da rota com o seu fornecedor de telefonia. | A qualidade do áudio, não só o atraso |
Para cada parte há várias opções. Experimente uma, meça e só depois decida a seguinte.
O custo de um Fim de turno mais curto: respostas precipitadas
Uma resposta precipitada é a falha oposta a um tempo de reação longo: o agente começa a responder quando o cliente ainda está a falar ou fez apenas uma pausa. Exemplo, e não dados reais: os mesmos 400 turnos tiveram 6 respostas precipitadas, 5 delas enquanto o cliente ditava um número de encomenda ou de telefone. Os números ditados estão por trás das duas falhas: o Fim de turno foi a parte mais longa em 8 dos turnos mais lentos, e na maioria deles o cliente também estava a ditar um número. Se encurtar a espera em todos os turnos, conte com mais respostas precipitadas. É por isso que, na tabela, o Fim de turno tem duas esperas. Ainda assim, esperar mais enquanto o cliente dita um número não torna mais rápidos esses 8 turnos lentos. O que ajuda aí é um sinal de que o número está completo: se o sistema souber que um número de encomenda tem cinco algarismos, pode dar o turno por terminado logo a seguir ao quinto algarismo, em vez de esperar pelo silêncio.
Quando não há como evitar a demora: a frase de espera
Algumas consultas continuam lentas, e o sistema por trás delas nem sempre está nas mãos da sua empresa. Nesse caso, dê ao cliente um primeiro som antes da Consulta: uma frase de espera, ou seja, poucas palavras ditas antes de um passo lento. No turno lento acima, viria logo a seguir ao primeiro bloco do Modelo:
- Cliente: «É a encomenda 4 8 1 7 2.»
- Agente, antes da Consulta: «Obrigado, deixe-me ver essa encomenda.»
- Agente, depois da Consulta: «A sua encomenda já está a caminho e chega na quinta-feira.»
O tempo de reação fica mais curto, porque o primeiro som chega agora antes da Consulta. O tempo até à resposta vai do momento em que o cliente se cala até ao início da resposta propriamente dita. Este mantém-se praticamente igual, porque a resposta continua à espera da Consulta. Nestes turnos, registe também o tempo até à resposta, para que uma frase de espera não esconda uma Consulta cada vez mais lenta.
Mantenha as frases de espera curtas e use-as só antes de um passo lento, nunca num pedido de desculpa, num número ou na despedida. Uma frase de espera em todos os turnos também tem um custo: o cliente ouve a mesma frase vezes sem conta.
O que acompanhar todas as semanas
Todas as semanas, acompanhe três sinais, em separado para os turnos simples e para os turnos com consulta:
- Tempo de reação: a mediana e o percentil 90 e, nos turnos com frase de espera, também o tempo até à resposta.
- Cliente falou no silêncio: a percentagem de turnos em que aconteceu.
- Respostas precipitadas: o número e o que o cliente estava a dizer nesse momento.
Junte-lhes um quarto sinal, por chamada: se a tarefa foi concluída. Um tempo de reação mais curto vale pouco se menos chamadas concluírem a tarefa. Se tiver um piloto em curso, conte uma tarefa como concluída da mesma forma que a sua ficha do piloto define uma chamada resolvida.
Compare os mesmos tipos de turno antes e depois de cada alteração. Uma percentagem medida em algumas centenas de turnos pode variar por acaso. O nosso artigo sobre critérios de sucesso de um piloto de IA de voz mostra como calcular a margem de uma taxa.
Onde entra a DRING
Os modelos selecionados de fala para texto, de texto para fala e de raciocínio, a telefonia, os testes e a monitorização fazem parte da base operacional comum de todos os pacotes da DRING. Na DRING, três das seis partes e a frase de espera funcionam assim:
- Fim de turno: um modelo dedicado gere a interrupção (barge-in) e a deteção de fim de turno, para que o agente não fale por cima de uma pausa nem fique calado quando a resposta já terminou.
- Transcrição: a chamada é transcrita em tempo real, com fala para texto em streaming.
- Linha: os sinais de qualidade de áudio e de latência são acompanhados por número, para detetar cedo uma linha em degradação.
- Frase de espera: quando uma ferramenta ou um modelo demora mais, uma expressão de preenchimento curta e natural, do conjunto aprovado pela DRING, mantém o turno a andar. A expressão de preenchimento é a forma que a frase de espera assume na DRING, e nunca aparece num pedido de desculpa, num número ou na despedida.
A nossa página sobre o núcleo de voz mostra como a fala para texto, a gestão de turnos e o texto para fala funcionam como um só processo, e a página de telefonia trata do estado das linhas.
Cada agente da DRING passa por 1 000 a 10 000 conversas simuladas, criadas para a sua empresa, antes da primeira chamada real. As simulações põem à prova a gestão de turnos e as frases de espera antes do arranque. Não medem a Linha das chamadas reais. A Linha vem das chamadas de teste nas redes dos seus clientes.
Se os clientes da sua linha dizem «Estou?» durante os silêncios, peça uma chamada de retorno. Tenha à mão algumas dessas chamadas, com as gravações, se a sua política o permitir. A nossa equipa pode analisar consigo os turnos mais lentos, parte a parte.
Encontre a parte que faz o cliente esperar
Deixe o seu número e a DRING liga-lhe em dois minutos. Diga-nos que linha tem silêncios longos, e a nossa equipa dá seguimento para analisar consigo os turnos mais lentos.