Como avaliar um piloto de IA de voz de 30 dias
Decida o que conta como sucesso antes da primeira chamada real. Este guia dá-lhe uma ficha do piloto, um modelo de revisão semanal e uma regra para o dia 30: Alargar, Prolongar ou Parar.
Em resumo
Um piloto de IA de voz resultou se, no dia 30, todas as métricas cumprirem o objetivo e nenhuma linha vermelha tiver sido cruzada. Os objetivos e as linhas vermelhas ficam numa ficha do piloto, assinada antes da primeira chamada real. Se definir os critérios depois das chamadas, o dia 30 transforma-se numa discussão sobre que chamadas contam. Se os definir antes, o dia 30 é uma reunião curta.
Meça a referência do mesmo tipo de chamada num período comparável. Ponha cinco métricas numa única ficha do piloto: taxa de resolução, taxa de contactos repetidos, taxa de ações erradas, qualidade das transferências e esforço da equipa. Dê a cada uma delas uma definição exata, um objetivo e uma linha vermelha, e leia a mesma ficha em todas as revisões semanais.
No dia 30, aplique a regra acordada de antemão. Alargar, se todos os objetivos forem cumpridos. Prolongar, uma única vez e por duas semanas, se uma ou duas métricas ficarem aquém do objetivo e uma única causa conhecida explicar a diferença. Parar, se for cruzada uma linha vermelha, se mais de duas métricas ficarem aquém do objetivo ou se nenhuma causa conhecida explicar sozinha a diferença. Para algumas linhas vermelhas basta uma única chamada, como uma ação errada com consequências financeiras ou jurídicas.
Para as etapas de construção antes do piloto, veja o nosso plano de implementação de IA de voz em 90 dias.
Porque é que as impressões não são um veredicto
Ao fim de 30 dias, o gestor lembra-se daquela chamada em que o agente não percebeu um cliente irritado. A equipa do projeto lembra-se das chamadas impecáveis que passou nas reuniões. Nenhuma das duas memórias diz grande coisa sobre as centenas de chamadas que ninguém ouviu.
Os números escolhidos a posteriori têm o mesmo problema: é fácil escolher a métrica que dá melhor imagem, ou esticar a palavra «resolvido» até dar jeito. Por isso, o responsável de operações, o revisor de qualidade, o responsável de sistemas e o patrocinador do projeto assinam a ficha do piloto antes do dia 1. Durante o piloto, os objetivos e as linhas vermelhas não mudam.
Passo 1: medir a referência
A referência é o desempenho atual do mesmo tipo de chamada, medido com as definições do piloto. Sem ela, uma taxa de resolução de 70 % não é boa nem má. Um tipo de chamada é um processo com um resultado esperado. No exemplo deste artigo, os clientes ligam para mudar uma visita técnica já marcada, e a chamada deve terminar com um novo horário aceite pelo cliente.
Meça a referência num período comparável:
- Os mesmos dias da semana e horários: quatro semanas completas, a cobrir as horas em que o agente vai atender.
- A mesma época ou campanha: não compare uma semana de promoções com uma semana calma, nem uma semana de feriados com uma semana normal.
- A mesma combinação de chamadas: o mesmo tipo de chamada, os mesmos idiomas e os mesmos grupos de clientes. Se o piloto só atende as chamadas ao fim do dia, a referência é o que acontecia antes a essas chamadas, mesmo que acabassem no correio de voz.
Não reaproveite os antigos códigos de fecho: um clique em «resolvido» pode querer dizer outra coisa que não um novo horário no sistema de marcações. Volte a classificar com as regras do piloto uma amostra aleatória de chamadas do período de referência, e use-a também para medir as ações erradas da sua equipa. O nosso artigo sobre taxa de contenção vs. taxa de resolução explica porque é que uma chamada sem transferência ainda não é uma chamada resolvida.
Se uma métrica nunca foi medida, escreva «não medida» na ficha, defina o objetivo a partir do que as contas do projeto exigem e não anuncie mais tarde uma melhoria nessa métrica.
Passo 2: escrever a ficha do piloto
A ficha do piloto tem cinco métricas, cada uma a responder a uma pergunta diferente, para que um bom número numa não esconda um mau número noutra. Para cada métrica, escreva o numerador, o denominador e o que fica excluído. Depois, defina dois níveis. O objetivo é o nível a partir do qual as contas do projeto batem certo. A linha vermelha é o ponto em que se para, mostrem o que mostrarem as outras métricas. Uma métrica entre os dois níveis fica aquém do objetivo.
Todos os valores da ficha são um exemplo criado para este artigo, e não dados de uma empresa real.
| Métrica | Definição exata | Referência | Objetivo | Linha vermelha |
|---|---|---|---|---|
| Taxa de resolução | Chamadas que terminam com a visita num horário aceite pelo cliente, visível no sistema de marcações, sem transferência nem chamada de retorno, divididas pelas chamadas elegíveis. Excluídas: chamadas de teste e outros tipos de chamada. | 74 % | 70 % ou mais | Abaixo de 60 % |
| Taxa de contactos repetidos | Clientes que voltam a contactar a empresa sobre a mesma visita no prazo de 7 dias, por qualquer canal, divididos pelos clientes com uma chamada elegível. Só se conta depois de passarem os 7 dias. | 12 % | 12 % ou menos | Acima de 18 % |
| Taxa de ações erradas | Chamadas revistas com um registo errado, uma marcação errada ou informação errada, divididas pelas chamadas revistas. Rever todas as chamadas na semana 1 e, depois, 100 chamadas aleatórias por semana. | 1,5 % (3 de 200 chamadas revistas) | 1 % ou menos | Acima de 3 % |
| Qualidade das transferências | Transferências em que o colega não teve de voltar a perguntar o nome, a marcação ou o motivo, divididas pelo total de transferências. | Não medida | 90 % ou mais | Abaixo de 75 % |
| Esforço da equipa | Minutos da equipa por cada 100 chamadas elegíveis, gastos em transferências, chamadas de retorno, revisões e correções, avaliados nas semanas 3 e 4. Referência: minutos gastos a atender as chamadas. | 640 minutos | 250 minutos ou menos | Acima de 400 minutos |
O objetivo da taxa de resolução fica abaixo da referência de propósito. Escreva o motivo na ficha: as contas do projeto batem certo com 70 % se o esforço da equipa descer de 640 para 250 minutos ou menos por cada 100 chamadas. O esforço da equipa só é avaliado nas semanas 3 e 4, porque na semana 1 os revisores analisam todas as chamadas e a primeira correção é feita na semana 2.
Linhas vermelhas de uma só chamada
Algumas falhas custam demasiado para se esperar por uma taxa:
- Uma ação errada com consequências financeiras ou jurídicas, como uma cobrança, um reembolso ou o cancelamento de uma visita paga.
- Dados pessoais revelados a alguém que ligou e não passou na verificação de identidade.
- Alguém que liga a comunicar um perigo, como um cheiro a gás, e não é passado de imediato a uma pessoa.
Basta uma delas para terminar o piloto antes do tempo, e as chamadas voltam à rota anterior no mesmo dia. Recomeçar depois de uma correção é começar um novo piloto, a partir do dia 1. A linha vermelha de uma métrica atua mais devagar: o piloto termina antes do tempo se o valor medido de uma métrica estiver para lá da sua linha vermelha em duas revisões semanais seguidas. Só contam as revisões em que essa métrica é avaliada: o esforço da equipa a partir da semana 3 e os contactos repetidos depois de passarem os respetivos 7 dias.
A amostra aleatória de 100 chamadas por semana deixa escapar a maior parte das falhas indicadas acima, por isso procure-as diretamente. Todas as semanas, reveja todas as chamadas que terminam numa cobrança, num reembolso ou num cancelamento. Reveja também todas as chamadas em que o agente revelou dados pessoais e todas as que um cliente ou um colega assinale como problemáticas. Estas chamadas são revistas para além da amostra aleatória.
Passo 3: fazer a revisão semanal
Na revisão semanal, lê-se a mesma ficha no mesmo dia de cada semana, verificam-se as contagens e escolhe-se, no máximo, uma alteração ao agente.
| Semana | O que analisar | Pergunta a responder | Quem decide ou corrige |
|---|---|---|---|
| Semana 1 | Todas as chamadas que não chegaram ao resultado, todas as transferências e todas as alterações de marcação, confrontadas com o sistema de marcações. | As etiquetas correspondem ao que um revisor ouve? | O revisor de qualidade analisa. O responsável de operações decide as alterações. |
| Semana 2 | A ficha ao lado da referência, com contagens e margens. As chamadas não resolvidas, agrupadas por causa. | Que causa explica mais chamadas não resolvidas: o agente, os sistemas ou o negócio? | O responsável de operações escolhe uma correção. Aplica-a quem constrói o agente ou o responsável de sistemas. |
| Semana 3 | A métrica que a correção devia melhorar, e as outras quatro. Os contactos repetidos das semanas 1 e 2, cujos 7 dias já passaram. | A correção melhorou a sua métrica sem prejudicar outra? | O responsável de operações, com o revisor de qualidade. |
| Semana 4 | A ficha completa, com todas as chamadas desde o dia 1, as linhas vermelhas e a margem de cada taxa. | Que decisão do dia 30 a ficha sustenta: Alargar, Prolongar ou Parar? | O responsável de operações prepara-a. O patrocinador do projeto assina-a. |
Três regras mantêm as semanas comparáveis:
- Uma alteração por semana, registada com a data. Com duas alterações, não há forma de saber qual delas fez mudar o número.
- Definições fixas. Se uma definição se revelar errada, mude-a uma única vez, registe o motivo e volte a calcular todas as semanas anteriores.
- Contagens ao lado das taxas. Escreva «64 % (256 de 400 chamadas)», e não «64 %».
O nosso guia de amostragem de qualidade no call center mostra que chamadas os revisores devem ouvir.
O que os números podem e não podem dizer
Cada taxa do piloto é uma estimativa. Para uma taxa p medida em n chamadas, a margem de erro aproximada a 95 % é 1,96 × √(p(1 - p) / n). Com uma taxa de 70 %, isto dá, em pontos percentuais:
- 100 chamadas: cerca de ±9,0 pontos
- 400 chamadas: cerca de ±4,5 pontos
- 1 000 chamadas: cerca de ±2,8 pontos
Ou seja, um valor semanal com 400 chamadas fica normalmente até cerca de 4,5 pontos acima ou abaixo da taxa real, e uma variação de alguns pontos de uma semana para a outra pode ser puro acaso. A fórmula parte do princípio de que as chamadas são independentes e de que a taxa não está perto de 0 % nem de 100 %. Uma comparação com a referência tem uma margem maior: para duas taxas de cerca de 70 %, com 1 600 chamadas cada, a diferença tem uma margem de cerca de ±3,2 pontos.
Na semana 1 do exemplo, a taxa de resolução é de 64 % em 400 chamadas, com uma margem de cerca de ±4,7 pontos. A taxa real pode estar algures entre cerca de 59,3 % e 68,7 %: o intervalo atravessa a linha vermelha e fica abaixo do objetivo. No dia 30, o exemplo tem 1 600 chamadas a 68 %, com cerca de ±2,3 pontos. O intervalo, de cerca de 65,7 % a 70,3 %, fica claramente acima da linha vermelha e ainda inclui o objetivo, mesmo junto ao limite superior.
Há ainda três limitações:
- Eventos raros. Zero ações erradas em 300 chamadas revistas continua a ser compatível com uma taxa real de até cerca de 1 %. É a «regra dos três»: sem nenhum evento em n chamadas, o limite superior a 95 % é de cerca de 3 / n. Leia e classifique todas as ações erradas.
- Segmentos pequenos. Um idioma ou um dia da semana com 60 chamadas tem uma margem de cerca de ±11,6 pontos a 70 %. Ouça essas chamadas em vez de comparar a respetiva taxa.
- Contactos repetidos recentes. No dia 30, a taxa de contactos repetidos só abrange as chamadas até ao dia 23. As chamadas posteriores ainda não completaram os seus 7 dias.
A decisão do dia 30: Alargar, Prolongar ou Parar
No dia 30, calcule a ficha do piloto com todas as chamadas desde o dia 1. Depois, aplique a regra por esta ordem:
- Parar se for cruzada uma linha vermelha, se mais de duas métricas ficarem aquém do objetivo ou se nenhuma causa conhecida explicar sozinha a diferença. As chamadas voltam à rota anterior e o motivo fica escrito para o próximo piloto.
- Alargar se todos os objetivos forem cumpridos e nenhuma linha vermelha for cruzada. Passe ao agente, por fases, mais volume do mesmo tipo de chamada, com a mesma ficha. Um novo tipo de chamada tem a sua própria ficha do piloto.
- Prolongar se uma ou duas métricas ficarem aquém do objetivo por uma única causa conhecida. O piloto é prolongado uma única vez, por duas semanas, com uma correção para essa causa e a mesma ficha, e o prolongamento é avaliado apenas com as suas próprias chamadas. Se todos os objetivos forem então cumpridos, a decisão é Alargar. Se não, é Parar.
Como ler resultados mistos
No dia 30, é comum um resultado misto: quatro métricas cumprem o objetivo e uma não.
- Não faça médias. Uma taxa de resolução alta não compensa uma marcação errada.
- Primeiro, proteja o cliente. A taxa de ações erradas e as linhas vermelhas de uma só chamada nunca se trocam por ganhos na taxa de resolução ou no esforço da equipa. Se a taxa de ações erradas ficar aquém do objetivo, a decisão só pode ser Prolongar se todas as ações erradas tiverem a mesma causa conhecida e a correção a eliminar.
- Leia a diferença face à margem. Um resultado de 68 % não cumpre um objetivo de 70 %. Mas uma diferença menor do que a margem, com uma causa conhecida, é um caso típico para Prolongar.
- Veja onde está a causa. Se as chamadas falham porque não há horários livres, um agente melhor não resolve o problema. Se o esforço da equipa ficar aquém do objetivo, verifique se continua a descer da semana 3 para a semana 4.
Exemplo: uma ficha no dia 30
Valores de exemplo, e não dados reais.
| Métrica | Objetivo | Resultado no dia 30 | Leitura |
|---|---|---|---|
| Taxa de resolução | 70 % ou mais | 68 % (1 088 de 1 600 chamadas, ±2,3 pontos) | Aquém do objetivo, por menos do que a margem |
| Taxa de contactos repetidos | 12 % ou menos | 11 % (chamadas até ao dia 23) | Cumprido |
| Taxa de ações erradas | 1 % ou menos | 0,6 % (4 de 700 chamadas revistas) | Cumprido, com cada caso lido e classificado |
| Qualidade das transferências | 90 % ou mais | 92 % (230 de 250 transferências) | Cumprido |
| Esforço da equipa | 250 minutos ou menos | 230 minutos (semanas 3 e 4) | Cumprido |
| Linhas vermelhas de uma só chamada | 0 casos | 0 casos | Nenhuma linha vermelha cruzada |
Uma métrica fica aquém do objetivo e nenhuma linha vermelha é cruzada. No maior grupo de chamadas não resolvidas, o cliente pede um horário ao fim do dia, que o sistema de marcações só mostra à equipa interna. A causa é conhecida e uma única correção resolve-a, por isso a decisão é Prolongar: duas semanas, a mesma ficha e os horários ao fim do dia abertos ao agente. Com cerca de 400 chamadas por semana, o prolongamento dá cerca de 800 chamadas novas para avaliar, com uma margem de cerca de ±3,2 pontos a 70 %.
Onde entra a DRING
Com a DRING, um agente entra em produção numa semana. Use essa semana para voltar a classificar a amostra de chamadas passadas do período de referência e para assinar a ficha do piloto antes da primeira chamada real. Cada agente da DRING passa por 1 000 a 10 000 conversas simuladas, criadas para a sua empresa, antes da primeira chamada real. É um teste antes do arranque, não o piloto. A simulação pode encontrar falhas cedo, mas não dá uma referência nem uma taxa de resolução com clientes reais. O nosso artigo sobre conversas simuladas explica o que cobrem.
Durante o piloto, a análise pós-chamada pode devolver campos adicionais definidos pela sua empresa, como o resultado de cada chamada, pela API, pelo seu CRM, pelo painel e pelos relatórios. Os revisores continuam a ouvir as chamadas, e os campos dão a todas as revisões semanais as mesmas etiquetas. A nossa página de análise de chamadas mostra o painel e os relatórios.
Acorde primeiro os critérios
Deixe o seu número e a DRING liga-lhe em dois minutos. Diga-nos com que tipo de chamada quer fazer o piloto, e a nossa equipa dá seguimento para acordar consigo a ficha do piloto antes da primeira chamada real.