Saltar para o conteúdo
Descreva um processo. A DRING liga-lhe em dois minutos e qualifica a necessidade. Ligamos-lhe em dois minutos
Ligamos-lhe em 2 minutos Ver o Agent Factory
Operações de IA de voz · Medição da latência

Porque esperam os clientes pelo agente de IA

A pausa depois de o cliente parar de falar é a soma de seis partes. Meça todos os turnos, analise os mais lentos e corrija a parte que mais tempo ocupa.

Em resumo

Quando o cliente acaba de falar e só ouve silêncio, essa pausa raramente tem uma só causa. É a soma de seis partes: Fim de turno, Transcrição, Modelo, Consulta, Início da voz e Linha. A Consulta só existe nos turnos com consulta, em que o agente verifica algo num sistema, por exemplo o estado de uma encomenda. Todos os outros turnos são turnos simples.

Neste guia, chamamos a essa pausa tempo de reação: vai do momento em que o cliente se cala até ao primeiro som do agente, tal como o cliente o ouve. Um tempo de reação médio esconde os turnos de que os clientes se lembram. Por isso, meça todos os turnos, separe os turnos simples dos turnos com consulta e leia a mediana e o percentil 90.

Depois, encontre a parte mais longa em cada um dos turnos mais lentos. A parte que aparece mais vezes como a mais longa é a primeira a corrigir. Mude uma parte de cada vez e vigie o sinal oposto: um agente que espera menos antes de responder pode começar a cortar a palavra aos clientes. Quando não há como evitar a demora, uma frase de espera dá ao cliente um primeiro som mais cedo. Mas não faz a resposta chegar mais cedo.

Não copie um valor-alvo, venha ele de onde vier. Descubra a partir de que tempo de reação os seus próprios clientes começam a dizer «Estou?» no silêncio. Esse é o seu limiar.

O nosso artigo sobre onde o cliente desliga nas chamadas com IA identifica a etapa em que os clientes abandonam a chamada. Este guia desce um nível: porque é que o silêncio é longo e que parte corrigir. Todos os números que se seguem são exemplos, e não dados da DRING nem do setor.

As seis partes do tempo de reação

Entre a última palavra do cliente e o primeiro som do agente, o tempo divide-se em seis partes. Este guia apresenta-as sempre por esta ordem:

ParteO que aconteceO que costuma torná-la longaComo se mede
Fim de turnoO sistema decide que o cliente acabou de falar.Espera por um silêncio longo antes de decidir.Do fim da fala do cliente, na sua gravação, até à decisão do sistema
TranscriçãoO reconhecimento de fala entrega o texto final.O texto final só chega depois de a frase inteira ser processada.Da decisão até ao texto final
ModeloO modelo decide o que fazer e escreve a resposta.Uma primeira frase longa, um prompt extenso, uma longa cadeia de raciocínio antes de falar.Do texto final até à resposta. Num turno com consulta, há dois blocos: até ao pedido da Consulta, e do resultado da Consulta até à resposta
ConsultaUma verificação num sistema, como o estado de uma encomenda. Só nos turnos com consulta.Um sistema lento, verificações feitas uma a seguir à outra, sem limite de tempo.Do pedido até o sistema devolver o resultado
Início da vozA voz produz o primeiro áudio da resposta.A voz espera pelo texto completo da resposta antes de começar.Desde que o texto da resposta chega à voz até o primeiro áudio sair do seu sistema
LinhaA telefonia e a rede transportam o áudio nos dois sentidos.Rotas de chamada longas, regiões distantes, redes móveis fracas.Chamadas de teste a partir de telefones comuns, gravadas do lado do cliente

Duas partes aparecem em dois blocos. Num turno com consulta, o modelo trabalha antes da Consulta, para decidir o que verificar, e depois dela, para formular a resposta. Os dois blocos contam como Modelo. A Linha aparece em dois blocos em todos os turnos: a voz do cliente a chegar ao seu sistema e a voz do agente a chegar ao cliente. Os dois blocos contam como Linha.

Como medir cada turno

Meça turnos, não chamadas: na média de uma chamada, um turno com consulta lento pode esconder-se entre sete rápidos. Dê a cada turno um registo com os mesmos campos. Os valores de exemplo são os do turno lento apresentado mais à frente neste guia. Exemplo, e não dados reais.

CampoO que contémValor de exemplo
ID da chamadaUm único ID, partilhado pela gravação da chamada e pelos logs do sistemaC1047
Número do turnoA posição da resposta do agente na chamada4
Tipo de turnoTurno simples ou turno com consultaTurno com consulta
Tempo de reaçãoDa última palavra do cliente até ao primeiro som do agente, com a Linha incluída3,9 s
Fim de turnoA sua gravação e as marcas de tempo do sistema0,7 s
TranscriçãoMarcas de tempo do sistema0,2 s
ModeloMarcas de tempo do sistema, com os dois blocos num turno com consulta0,6 s (0,3 s antes e 0,3 s depois da Consulta)
ConsultaMarcas de tempo do sistema, campo vazio num turno simples1,9 s
Início da vozMarcas de tempo do sistema0,3 s
LinhaChamadas de teste nas redes que os seus clientes usam0,2 s
Tempo por explicarO tempo de reação na gravação do seu sistema, menos as partes que regista0,0 s
Cliente falou no silêncioSim, se durante o silêncio o cliente disse «Estou?» ou repetiu o que tinha ditoSim
Resposta precipitadaSim, se o agente começou a responder quando o cliente ainda estava a falar ou tinha feito apenas uma pausaNão
Tarefa concluídaPor chamada: sim, se o cliente obteve aquilo por que ligouSim

Meça primeiro o tempo de reação na gravação que o seu sistema faz da chamada. O ID partilhado associa cada turno da gravação às respetivas marcas de tempo do sistema, que lhe dão o Fim de turno, a Transcrição, o Modelo, a Consulta e o Início da voz. A Linha soma-se no passo seguinte.

A Linha não aparece na sua gravação. No seu sistema, o relógio arranca quando o áudio do cliente lhe chega e para quando o seu áudio sai. Por isso, faça chamadas de teste a partir de telefones comuns, nas redes que os seus clientes usam, e grave-as do lado de quem liga. O tempo de reação nessa gravação, menos o tempo de reação do mesmo turno na gravação do seu sistema, é a Linha. Some-a aos tempos de reação das suas chamadas reais.

Depois, confirme a soma. O tempo por explicar é o tempo de reação na gravação do seu sistema menos as partes que regista. Se for grande, falta uma marca de tempo. No turno de exemplo, a gravação do seu sistema mostra 3,7 segundos e as partes registadas somam 3,7 segundos, por isso o tempo por explicar é zero. Somando-lhe os 0,2 segundos da Linha, obtém os 3,9 segundos que o cliente ouve.

Porque é que a média esconde o problema

Exemplo, e não dados reais: 400 turnos do agente em 50 chamadas gravadas numa só linha, 300 turnos simples e 100 turnos com consulta. Todos os tempos de reação incluem a Linha, 0,2 segundos medidos com chamadas de teste.

Tipo de turnoTurnosMedianaMédiaPercentil 90
Turnos simples3001,1 s1,2 s1,8 s
Turnos com consulta1002,9 s3,2 s4,6 s
Todos os turnos4001,3 s1,7 s3,4 s

A média de todos os turnos, 1,7 segundos, fica acima da mediana de 1,3 segundos porque os turnos lentos a puxam para cima. Nenhum dos dois números mostra os turnos de que os clientes se lembram. O percentil 90 (p90) mostra-os: é o tempo de reação que um turno em cada dez atinge ou ultrapassa, aqui 3,4 segundos. Os turnos que ficam nesse valor ou acima dele são os turnos mais lentos.

Separe também por tipo de turno. Os turnos simples têm uma mediana de 1,1 segundos, os turnos com consulta de 2,9 segundos. Uma semana com mais turnos com consulta faz subir os números de todos os turnos, mesmo que nenhuma parte tenha ficado mais lenta.

Agora distribua os mesmos 400 turnos por quatro faixas de tempo de reação: 130 turnos com menos de 1,0 segundo, 180 de 1,0 a 2,0 segundos, 50 de 2,0 a 3,4 segundos e 40 com 3,4 segundos ou mais. Depois, assinale os turnos em que o cliente falou no silêncio: disse «Estou?» ou repetiu o que tinha dito. Isso aconteceu em 31 dos 40 turnos mais lentos e em 7 dos outros 360: 3 vezes nos 310 turnos com menos de 2,0 segundos e 4 vezes nos 50 turnos de 2,0 a 3,4 segundos.

Os 400 turnos por tempo de reação. A parte escura de cada barra mostra os turnos em que o cliente falou no silêncio: 0, 3, 4 e 31. Exemplo, e não dados reais.

Nesta linha, portanto, é raro o cliente falar no silêncio abaixo de 2,0 segundos, continua a ser pouco frequente de 2,0 a 3,4 segundos e passa a ser comum a partir de 3,4 segundos. O limiar desta linha fica perto dos 3,4 segundos, e não é um objetivo geral. Encontre o seu da mesma forma: distribua os seus turnos por faixas e veja em que ponto isso deixa de ser raro e passa a ser comum. Faixas mais estreitas à volta desse ponto situam-no com mais precisão.

Encontre a parte mais longa nos turnos mais lentos

O percentil 90 mostra quão lentos são os turnos mais lentos, não porquê. Para saber porquê, abra cada turno lento e encontre a sua parte mais longa: a parte que mais tempo ocupou nesse turno.

Exemplo, e não dados reais: um dos 40 turnos mais lentos. O cliente pergunta pelo estado de uma encomenda, por isso é um turno com consulta. O relógio arranca no momento em que o cliente se cala, tal como se ouve do lado do cliente.

Um turno com consulta lento, parte a parte: um tempo de reação de 3,9 segundos, com a Consulta como parte mais longa. Exemplo, e não dados reais.

Por parte: Fim de turno 0,7 segundos, Transcrição 0,2 segundos, Modelo 0,6 segundos, Consulta 1,9 segundos, Início da voz 0,3 segundos e Linha 0,2 segundos. O Modelo divide-se em dois blocos de 0,3 segundos: um para decidir verificar a encomenda, outro para formular a resposta. A Linha tem 0,1 segundos em cada sentido. Juntas, as partes dão um tempo de reação de 3,9 segundos. A Consulta é a parte mais longa, quase metade do tempo de reação.

Os tempos das partes só se somam desta forma dentro de um turno. Com as medianas e os percentis 90 isso não acontece: as medianas das seis partes, somadas, não dão a mediana do tempo de reação. Por isso, encontre a parte mais longa turno a turno e só depois conte.

Exemplo, e não dados reais: a parte mais longa em cada um dos 40 turnos mais lentos.

Parte mais longaTurnos mais lentos
Fim de turno8
Transcrição0
Modelo5
Consulta27
Início da voz0
Linha0
Total40

A Consulta é a parte mais longa com mais frequência, em 27 dos 40. Isto bate certo com os tipos de turno: 36 dos turnos mais lentos são turnos com consulta e 4 são turnos simples. O Fim de turno é a parte mais longa em 8. Na maioria deles, o cliente fez uma pausa enquanto ditava um número, e o sistema esperou mais tempo antes de decidir que tinha acabado. O Modelo é a parte mais longa em 5.

Aqui, a Linha nunca é a parte mais longa, porque nesta linha se mantém estável nos 0,2 segundos. Noutra linha, pode ser. O nosso artigo sobre agentes que correm bem na demo e mal nas chamadas reais dá um teste rápido. Pausas em todos os turnos apontam para a linha. Pausas só nos turnos com consulta apontam para as ferramentas.

Corrija uma parte de cada vez e vigie o sinal oposto

Comece pela parte que aparece mais vezes como a mais longa nos seus turnos mais lentos, aqui a Consulta. Mude uma coisa e volte a medir os mesmos tipos de turno. Com duas alterações ao mesmo tempo, não há forma de saber qual delas mexeu no percentil 90.

Cada correção tem um custo, por isso a tabela indica também, para cada parte, o sinal a vigiar:

ParteO que experimentarO que vigiar
Fim de turnoUma espera que depende do que o cliente diz: mais curta depois de respostas curtas, como sim, não ou um nome, e mais longa enquanto o cliente dita um número ou soletra uma palavra.Respostas precipitadas
TranscriçãoReconhecimento de fala em streaming, para que a maior parte do texto já esteja pronta quando o turno acaba.Palavras e números mal ouvidos
ModeloUma primeira frase curta. Um plano de resposta simples para as perguntas mais comuns.Qualidade e completude das respostas
ConsultaFazer ao mesmo tempo as verificações que não dependem umas das outras. Definir um limite de tempo com uma saída segura: passar a chamada a uma pessoa da equipa ou propor uma chamada de retorno. Dizer uma frase de espera antes da verificação.Respostas desatualizadas ou incompletas. Frases de espera repetidas em todos os turnos.
Início da vozPôr a voz a falar logo com a primeira frase, enquanto o resto ainda está a ser escrito.Pausas pouco naturais a meio de uma resposta
LinhaChamadas de teste a partir das redes que os seus clientes usam. Uma revisão da rota com o seu fornecedor de telefonia.A qualidade do áudio, não só o atraso

Para cada parte há várias opções. Experimente uma, meça e só depois decida a seguinte.

O custo de um Fim de turno mais curto: respostas precipitadas

Uma resposta precipitada é a falha oposta a um tempo de reação longo: o agente começa a responder quando o cliente ainda está a falar ou fez apenas uma pausa. Exemplo, e não dados reais: os mesmos 400 turnos tiveram 6 respostas precipitadas, 5 delas enquanto o cliente ditava um número de encomenda ou de telefone. Os números ditados estão por trás das duas falhas: o Fim de turno foi a parte mais longa em 8 dos turnos mais lentos, e na maioria deles o cliente também estava a ditar um número. Se encurtar a espera em todos os turnos, conte com mais respostas precipitadas. É por isso que, na tabela, o Fim de turno tem duas esperas. Ainda assim, esperar mais enquanto o cliente dita um número não torna mais rápidos esses 8 turnos lentos. O que ajuda aí é um sinal de que o número está completo: se o sistema souber que um número de encomenda tem cinco algarismos, pode dar o turno por terminado logo a seguir ao quinto algarismo, em vez de esperar pelo silêncio.

Quando não há como evitar a demora: a frase de espera

Algumas consultas continuam lentas, e o sistema por trás delas nem sempre está nas mãos da sua empresa. Nesse caso, dê ao cliente um primeiro som antes da Consulta: uma frase de espera, ou seja, poucas palavras ditas antes de um passo lento. No turno lento acima, viria logo a seguir ao primeiro bloco do Modelo:

  • Cliente: «É a encomenda 4 8 1 7 2.»
  • Agente, antes da Consulta: «Obrigado, deixe-me ver essa encomenda.»
  • Agente, depois da Consulta: «A sua encomenda já está a caminho e chega na quinta-feira.»

O tempo de reação fica mais curto, porque o primeiro som chega agora antes da Consulta. O tempo até à resposta vai do momento em que o cliente se cala até ao início da resposta propriamente dita. Este mantém-se praticamente igual, porque a resposta continua à espera da Consulta. Nestes turnos, registe também o tempo até à resposta, para que uma frase de espera não esconda uma Consulta cada vez mais lenta.

Mantenha as frases de espera curtas e use-as só antes de um passo lento, nunca num pedido de desculpa, num número ou na despedida. Uma frase de espera em todos os turnos também tem um custo: o cliente ouve a mesma frase vezes sem conta.

O que acompanhar todas as semanas

Todas as semanas, acompanhe três sinais, em separado para os turnos simples e para os turnos com consulta:

  • Tempo de reação: a mediana e o percentil 90 e, nos turnos com frase de espera, também o tempo até à resposta.
  • Cliente falou no silêncio: a percentagem de turnos em que aconteceu.
  • Respostas precipitadas: o número e o que o cliente estava a dizer nesse momento.

Junte-lhes um quarto sinal, por chamada: se a tarefa foi concluída. Um tempo de reação mais curto vale pouco se menos chamadas concluírem a tarefa. Se tiver um piloto em curso, conte uma tarefa como concluída da mesma forma que a sua ficha do piloto define uma chamada resolvida.

Compare os mesmos tipos de turno antes e depois de cada alteração. Uma percentagem medida em algumas centenas de turnos pode variar por acaso. O nosso artigo sobre critérios de sucesso de um piloto de IA de voz mostra como calcular a margem de uma taxa.

Onde entra a DRING

Os modelos selecionados de fala para texto, de texto para fala e de raciocínio, a telefonia, os testes e a monitorização fazem parte da base operacional comum de todos os pacotes da DRING. Na DRING, três das seis partes e a frase de espera funcionam assim:

  • Fim de turno: um modelo dedicado gere a interrupção (barge-in) e a deteção de fim de turno, para que o agente não fale por cima de uma pausa nem fique calado quando a resposta já terminou.
  • Transcrição: a chamada é transcrita em tempo real, com fala para texto em streaming.
  • Linha: os sinais de qualidade de áudio e de latência são acompanhados por número, para detetar cedo uma linha em degradação.
  • Frase de espera: quando uma ferramenta ou um modelo demora mais, uma expressão de preenchimento curta e natural, do conjunto aprovado pela DRING, mantém o turno a andar. A expressão de preenchimento é a forma que a frase de espera assume na DRING, e nunca aparece num pedido de desculpa, num número ou na despedida.

A nossa página sobre o núcleo de voz mostra como a fala para texto, a gestão de turnos e o texto para fala funcionam como um só processo, e a página de telefonia trata do estado das linhas.

Cada agente da DRING passa por 1 000 a 10 000 conversas simuladas, criadas para a sua empresa, antes da primeira chamada real. As simulações põem à prova a gestão de turnos e as frases de espera antes do arranque. Não medem a Linha das chamadas reais. A Linha vem das chamadas de teste nas redes dos seus clientes.

Se os clientes da sua linha dizem «Estou?» durante os silêncios, peça uma chamada de retorno. Tenha à mão algumas dessas chamadas, com as gravações, se a sua política o permitir. A nossa equipa pode analisar consigo os turnos mais lentos, parte a parte.

Encontre a parte que faz o cliente esperar

Deixe o seu número e a DRING liga-lhe em dois minutos. Diga-nos que linha tem silêncios longos, e a nossa equipa dá seguimento para analisar consigo os turnos mais lentos.