Skip to content
Descreva um processo. A DRING liga-lhe em dois minutos e qualifica a necessidade. Ligamos-lhe em dois minutos
Ligamos-lhe em 2 minutos Ver o Agent Factory
Guia de arranque · Avaliação do piloto

Como avaliar um piloto de IA de voz de 30 dias

Decida o que conta como sucesso antes da primeira chamada real. Este guia dá-lhe uma ficha do piloto, um modelo de revisão semanal e uma regra para o dia 30: Alargar, Prolongar ou Parar.

Em resumo

Um piloto de IA de voz resultou se, no dia 30, todas as métricas cumprirem o objetivo e nenhuma linha vermelha tiver sido cruzada. Os objetivos e as linhas vermelhas ficam numa ficha do piloto, assinada antes da primeira chamada real. Se definir os critérios depois das chamadas, o dia 30 transforma-se numa discussão sobre que chamadas contam. Se os definir antes, o dia 30 é uma reunião curta.

Meça a referência do mesmo tipo de chamada num período comparável. Ponha cinco métricas numa única ficha do piloto: taxa de resolução, taxa de contactos repetidos, taxa de ações erradas, qualidade das transferências e esforço da equipa. Dê a cada uma delas uma definição exata, um objetivo e uma linha vermelha, e leia a mesma ficha em todas as revisões semanais.

No dia 30, aplique a regra acordada de antemão. Alargar, se todos os objetivos forem cumpridos. Prolongar, uma única vez e por duas semanas, se uma ou duas métricas ficarem aquém do objetivo e uma única causa conhecida explicar a diferença. Parar, se for cruzada uma linha vermelha, se mais de duas métricas ficarem aquém do objetivo ou se nenhuma causa conhecida explicar sozinha a diferença. Para algumas linhas vermelhas basta uma única chamada, como uma ação errada com consequências financeiras ou jurídicas.

Para as etapas de construção antes do piloto, veja o nosso plano de implementação de IA de voz em 90 dias.

Porque é que as impressões não são um veredicto

Ao fim de 30 dias, o gestor lembra-se daquela chamada em que o agente não percebeu um cliente irritado. A equipa do projeto lembra-se das chamadas impecáveis que passou nas reuniões. Nenhuma das duas memórias diz grande coisa sobre as centenas de chamadas que ninguém ouviu.

Os números escolhidos a posteriori têm o mesmo problema: é fácil escolher a métrica que dá melhor imagem, ou esticar a palavra «resolvido» até dar jeito. Por isso, o responsável de operações, o revisor de qualidade, o responsável de sistemas e o patrocinador do projeto assinam a ficha do piloto antes do dia 1. Durante o piloto, os objetivos e as linhas vermelhas não mudam.

Passo 1: medir a referência

A referência é o desempenho atual do mesmo tipo de chamada, medido com as definições do piloto. Sem ela, uma taxa de resolução de 70 % não é boa nem má. Um tipo de chamada é um processo com um resultado esperado. No exemplo deste artigo, os clientes ligam para mudar uma visita técnica já marcada, e a chamada deve terminar com um novo horário aceite pelo cliente.

Meça a referência num período comparável:

  • Os mesmos dias da semana e horários: quatro semanas completas, a cobrir as horas em que o agente vai atender.
  • A mesma época ou campanha: não compare uma semana de promoções com uma semana calma, nem uma semana de feriados com uma semana normal.
  • A mesma combinação de chamadas: o mesmo tipo de chamada, os mesmos idiomas e os mesmos grupos de clientes. Se o piloto só atende as chamadas ao fim do dia, a referência é o que acontecia antes a essas chamadas, mesmo que acabassem no correio de voz.

Não reaproveite os antigos códigos de fecho: um clique em «resolvido» pode querer dizer outra coisa que não um novo horário no sistema de marcações. Volte a classificar com as regras do piloto uma amostra aleatória de chamadas do período de referência, e use-a também para medir as ações erradas da sua equipa. O nosso artigo sobre taxa de contenção vs. taxa de resolução explica porque é que uma chamada sem transferência ainda não é uma chamada resolvida.

Se uma métrica nunca foi medida, escreva «não medida» na ficha, defina o objetivo a partir do que as contas do projeto exigem e não anuncie mais tarde uma melhoria nessa métrica.

Passo 2: escrever a ficha do piloto

A ficha do piloto tem cinco métricas, cada uma a responder a uma pergunta diferente, para que um bom número numa não esconda um mau número noutra. Para cada métrica, escreva o numerador, o denominador e o que fica excluído. Depois, defina dois níveis. O objetivo é o nível a partir do qual as contas do projeto batem certo. A linha vermelha é o ponto em que se para, mostrem o que mostrarem as outras métricas. Uma métrica entre os dois níveis fica aquém do objetivo.

Todos os valores da ficha são um exemplo criado para este artigo, e não dados de uma empresa real.

MétricaDefinição exataReferênciaObjetivoLinha vermelha
Taxa de resoluçãoChamadas que terminam com a visita num horário aceite pelo cliente, visível no sistema de marcações, sem transferência nem chamada de retorno, divididas pelas chamadas elegíveis. Excluídas: chamadas de teste e outros tipos de chamada.74 %70 % ou maisAbaixo de 60 %
Taxa de contactos repetidosClientes que voltam a contactar a empresa sobre a mesma visita no prazo de 7 dias, por qualquer canal, divididos pelos clientes com uma chamada elegível. Só se conta depois de passarem os 7 dias.12 %12 % ou menosAcima de 18 %
Taxa de ações erradasChamadas revistas com um registo errado, uma marcação errada ou informação errada, divididas pelas chamadas revistas. Rever todas as chamadas na semana 1 e, depois, 100 chamadas aleatórias por semana.1,5 % (3 de 200 chamadas revistas)1 % ou menosAcima de 3 %
Qualidade das transferênciasTransferências em que o colega não teve de voltar a perguntar o nome, a marcação ou o motivo, divididas pelo total de transferências.Não medida90 % ou maisAbaixo de 75 %
Esforço da equipaMinutos da equipa por cada 100 chamadas elegíveis, gastos em transferências, chamadas de retorno, revisões e correções, avaliados nas semanas 3 e 4. Referência: minutos gastos a atender as chamadas.640 minutos250 minutos ou menosAcima de 400 minutos

O objetivo da taxa de resolução fica abaixo da referência de propósito. Escreva o motivo na ficha: as contas do projeto batem certo com 70 % se o esforço da equipa descer de 640 para 250 minutos ou menos por cada 100 chamadas. O esforço da equipa só é avaliado nas semanas 3 e 4, porque na semana 1 os revisores analisam todas as chamadas e a primeira correção é feita na semana 2.

Linhas vermelhas de uma só chamada

Algumas falhas custam demasiado para se esperar por uma taxa:

  • Uma ação errada com consequências financeiras ou jurídicas, como uma cobrança, um reembolso ou o cancelamento de uma visita paga.
  • Dados pessoais revelados a alguém que ligou e não passou na verificação de identidade.
  • Alguém que liga a comunicar um perigo, como um cheiro a gás, e não é passado de imediato a uma pessoa.

Basta uma delas para terminar o piloto antes do tempo, e as chamadas voltam à rota anterior no mesmo dia. Recomeçar depois de uma correção é começar um novo piloto, a partir do dia 1. A linha vermelha de uma métrica atua mais devagar: o piloto termina antes do tempo se o valor medido de uma métrica estiver para lá da sua linha vermelha em duas revisões semanais seguidas. Só contam as revisões em que essa métrica é avaliada: o esforço da equipa a partir da semana 3 e os contactos repetidos depois de passarem os respetivos 7 dias.

A amostra aleatória de 100 chamadas por semana deixa escapar a maior parte das falhas indicadas acima, por isso procure-as diretamente. Todas as semanas, reveja todas as chamadas que terminam numa cobrança, num reembolso ou num cancelamento. Reveja também todas as chamadas em que o agente revelou dados pessoais e todas as que um cliente ou um colega assinale como problemáticas. Estas chamadas são revistas para além da amostra aleatória.

Passo 3: fazer a revisão semanal

Na revisão semanal, lê-se a mesma ficha no mesmo dia de cada semana, verificam-se as contagens e escolhe-se, no máximo, uma alteração ao agente.

SemanaO que analisarPergunta a responderQuem decide ou corrige
Semana 1Todas as chamadas que não chegaram ao resultado, todas as transferências e todas as alterações de marcação, confrontadas com o sistema de marcações.As etiquetas correspondem ao que um revisor ouve?O revisor de qualidade analisa. O responsável de operações decide as alterações.
Semana 2A ficha ao lado da referência, com contagens e margens. As chamadas não resolvidas, agrupadas por causa.Que causa explica mais chamadas não resolvidas: o agente, os sistemas ou o negócio?O responsável de operações escolhe uma correção. Aplica-a quem constrói o agente ou o responsável de sistemas.
Semana 3A métrica que a correção devia melhorar, e as outras quatro. Os contactos repetidos das semanas 1 e 2, cujos 7 dias já passaram.A correção melhorou a sua métrica sem prejudicar outra?O responsável de operações, com o revisor de qualidade.
Semana 4A ficha completa, com todas as chamadas desde o dia 1, as linhas vermelhas e a margem de cada taxa.Que decisão do dia 30 a ficha sustenta: Alargar, Prolongar ou Parar?O responsável de operações prepara-a. O patrocinador do projeto assina-a.

Três regras mantêm as semanas comparáveis:

  • Uma alteração por semana, registada com a data. Com duas alterações, não há forma de saber qual delas fez mudar o número.
  • Definições fixas. Se uma definição se revelar errada, mude-a uma única vez, registe o motivo e volte a calcular todas as semanas anteriores.
  • Contagens ao lado das taxas. Escreva «64 % (256 de 400 chamadas)», e não «64 %».

O nosso guia de amostragem de qualidade no call center mostra que chamadas os revisores devem ouvir.

O que os números podem e não podem dizer

Cada taxa do piloto é uma estimativa. Para uma taxa p medida em n chamadas, a margem de erro aproximada a 95 % é 1,96 × √(p(1 - p) / n). Com uma taxa de 70 %, isto dá, em pontos percentuais:

  • 100 chamadas: cerca de ±9,0 pontos
  • 400 chamadas: cerca de ±4,5 pontos
  • 1 000 chamadas: cerca de ±2,8 pontos

Ou seja, um valor semanal com 400 chamadas fica normalmente até cerca de 4,5 pontos acima ou abaixo da taxa real, e uma variação de alguns pontos de uma semana para a outra pode ser puro acaso. A fórmula parte do princípio de que as chamadas são independentes e de que a taxa não está perto de 0 % nem de 100 %. Uma comparação com a referência tem uma margem maior: para duas taxas de cerca de 70 %, com 1 600 chamadas cada, a diferença tem uma margem de cerca de ±3,2 pontos.

Na semana 1 do exemplo, a taxa de resolução é de 64 % em 400 chamadas, com uma margem de cerca de ±4,7 pontos. A taxa real pode estar algures entre cerca de 59,3 % e 68,7 %: o intervalo atravessa a linha vermelha e fica abaixo do objetivo. No dia 30, o exemplo tem 1 600 chamadas a 68 %, com cerca de ±2,3 pontos. O intervalo, de cerca de 65,7 % a 70,3 %, fica claramente acima da linha vermelha e ainda inclui o objetivo, mesmo junto ao limite superior.

Exemplo, e não dados reais: a taxa de resolução face à linha vermelha, ao objetivo e à referência. O intervalo da semana 1 (400 chamadas) atravessa a linha vermelha. O intervalo do dia 30 (1 600 chamadas) é mais estreito e ainda inclui o objetivo, mesmo junto ao limite superior.

Há ainda três limitações:

  • Eventos raros. Zero ações erradas em 300 chamadas revistas continua a ser compatível com uma taxa real de até cerca de 1 %. É a «regra dos três»: sem nenhum evento em n chamadas, o limite superior a 95 % é de cerca de 3 / n. Leia e classifique todas as ações erradas.
  • Segmentos pequenos. Um idioma ou um dia da semana com 60 chamadas tem uma margem de cerca de ±11,6 pontos a 70 %. Ouça essas chamadas em vez de comparar a respetiva taxa.
  • Contactos repetidos recentes. No dia 30, a taxa de contactos repetidos só abrange as chamadas até ao dia 23. As chamadas posteriores ainda não completaram os seus 7 dias.

A decisão do dia 30: Alargar, Prolongar ou Parar

No dia 30, calcule a ficha do piloto com todas as chamadas desde o dia 1. Depois, aplique a regra por esta ordem:

  • Parar se for cruzada uma linha vermelha, se mais de duas métricas ficarem aquém do objetivo ou se nenhuma causa conhecida explicar sozinha a diferença. As chamadas voltam à rota anterior e o motivo fica escrito para o próximo piloto.
  • Alargar se todos os objetivos forem cumpridos e nenhuma linha vermelha for cruzada. Passe ao agente, por fases, mais volume do mesmo tipo de chamada, com a mesma ficha. Um novo tipo de chamada tem a sua própria ficha do piloto.
  • Prolongar se uma ou duas métricas ficarem aquém do objetivo por uma única causa conhecida. O piloto é prolongado uma única vez, por duas semanas, com uma correção para essa causa e a mesma ficha, e o prolongamento é avaliado apenas com as suas próprias chamadas. Se todos os objetivos forem então cumpridos, a decisão é Alargar. Se não, é Parar.
A decisão do dia 30: três caminhos, cada um com uma condição acordada antes do dia 1.

Como ler resultados mistos

No dia 30, é comum um resultado misto: quatro métricas cumprem o objetivo e uma não.

  • Não faça médias. Uma taxa de resolução alta não compensa uma marcação errada.
  • Primeiro, proteja o cliente. A taxa de ações erradas e as linhas vermelhas de uma só chamada nunca se trocam por ganhos na taxa de resolução ou no esforço da equipa. Se a taxa de ações erradas ficar aquém do objetivo, a decisão só pode ser Prolongar se todas as ações erradas tiverem a mesma causa conhecida e a correção a eliminar.
  • Leia a diferença face à margem. Um resultado de 68 % não cumpre um objetivo de 70 %. Mas uma diferença menor do que a margem, com uma causa conhecida, é um caso típico para Prolongar.
  • Veja onde está a causa. Se as chamadas falham porque não há horários livres, um agente melhor não resolve o problema. Se o esforço da equipa ficar aquém do objetivo, verifique se continua a descer da semana 3 para a semana 4.

Exemplo: uma ficha no dia 30

Valores de exemplo, e não dados reais.

MétricaObjetivoResultado no dia 30Leitura
Taxa de resolução70 % ou mais68 % (1 088 de 1 600 chamadas, ±2,3 pontos)Aquém do objetivo, por menos do que a margem
Taxa de contactos repetidos12 % ou menos11 % (chamadas até ao dia 23)Cumprido
Taxa de ações erradas1 % ou menos0,6 % (4 de 700 chamadas revistas)Cumprido, com cada caso lido e classificado
Qualidade das transferências90 % ou mais92 % (230 de 250 transferências)Cumprido
Esforço da equipa250 minutos ou menos230 minutos (semanas 3 e 4)Cumprido
Linhas vermelhas de uma só chamada0 casos0 casosNenhuma linha vermelha cruzada

Uma métrica fica aquém do objetivo e nenhuma linha vermelha é cruzada. No maior grupo de chamadas não resolvidas, o cliente pede um horário ao fim do dia, que o sistema de marcações só mostra à equipa interna. A causa é conhecida e uma única correção resolve-a, por isso a decisão é Prolongar: duas semanas, a mesma ficha e os horários ao fim do dia abertos ao agente. Com cerca de 400 chamadas por semana, o prolongamento dá cerca de 800 chamadas novas para avaliar, com uma margem de cerca de ±3,2 pontos a 70 %.

Onde entra a DRING

Com a DRING, um agente entra em produção numa semana. Use essa semana para voltar a classificar a amostra de chamadas passadas do período de referência e para assinar a ficha do piloto antes da primeira chamada real. Cada agente da DRING passa por 1 000 a 10 000 conversas simuladas, criadas para a sua empresa, antes da primeira chamada real. É um teste antes do arranque, não o piloto. A simulação pode encontrar falhas cedo, mas não dá uma referência nem uma taxa de resolução com clientes reais. O nosso artigo sobre conversas simuladas explica o que cobrem.

Durante o piloto, a análise pós-chamada pode devolver campos adicionais definidos pela sua empresa, como o resultado de cada chamada, pela API, pelo seu CRM, pelo painel e pelos relatórios. Os revisores continuam a ouvir as chamadas, e os campos dão a todas as revisões semanais as mesmas etiquetas. A nossa página de análise de chamadas mostra o painel e os relatórios.

Acorde primeiro os critérios

Deixe o seu número e a DRING liga-lhe em dois minutos. Diga-nos com que tipo de chamada quer fazer o piloto, e a nossa equipa dá seguimento para acordar consigo a ficha do piloto antes da primeira chamada real.