Come valutare un pilota di AI vocale da 30 giorni
Stabilite che cosa conta come successo prima di passare alle chiamate reali. Questa guida vi dà una scheda del pilota, un modello per il punto settimanale e una regola per scegliere al giorno 30 tra Ampliamento, Proroga e Stop.
In breve
Un pilota di AI vocale è riuscito quando al giorno 30 ogni metrica raggiunge il suo target e nessuna soglia di stop è stata superata. Target e soglie di stop sono riportati su una scheda del pilota, firmata prima di passare alle chiamate reali. Se fissate i criteri dopo le chiamate, il giorno 30 diventa una discussione su quali chiamate contano. Se li fissate prima, al giorno 30 basta una riunione breve.
Misurate una baseline sullo stesso tipo di chiamata, in un periodo confrontabile. Mettete cinque metriche su un'unica scheda del pilota: tasso di risoluzione, tasso di ricontatto, tasso di azioni errate, qualità dei trasferimenti e impegno del personale. Date a ciascuna una definizione esatta, un target e una soglia di stop, e leggete la stessa scheda a ogni punto settimanale.
Al giorno 30 applicate la regola concordata in anticipo. Se ogni target è raggiunto, si passa all'Ampliamento. Se una o due metriche sono fuori target e un'unica causa nota le spiega, si sceglie la Proroga: una sola volta, di due settimane. Si decide lo Stop se si supera una soglia di stop, se più di due metriche sono fuori target o se lo scarto non ha un'unica causa nota. Per alcune soglie di stop basta una sola chiamata, per esempio un'azione errata con conseguenze economiche o legali.
Per le fasi di realizzazione che precedono il pilota, leggete il nostro piano di 90 giorni per l'AI vocale.
Perché le impressioni non sono un verdetto
Dopo 30 giorni, il responsabile ricorda quell'unica chiamata in cui l'agente ha frainteso un cliente arrabbiato. Il team di progetto ricorda le chiamate filate lisce che ha fatto ascoltare in riunione. Entrambi i ricordi dicono poco delle centinaia di chiamate che nessuno ha sentito.
I numeri scelti a posteriori hanno lo stesso problema: è facile prendere la metrica che fa più bella figura, o allargare il significato di «risolto» finché i conti tornano. Per questo il responsabile operations, il revisore qualità, il responsabile dei sistemi e lo sponsor firmano la scheda del pilota prima del giorno 1. Durante il pilota, target e soglie di stop non cambiano.
Passo 1: misurate la baseline
La baseline è il risultato che lo stesso tipo di chiamata ottiene oggi, misurato con le definizioni del pilota. Senza baseline, un tasso di risoluzione del 70% non è né buono né cattivo. Un tipo di chiamata è un processo con un solo esito atteso. Nell'esempio di questo articolo i clienti chiamano per spostare un appuntamento già fissato con il tecnico, e la chiamata deve chiudersi con un nuovo orario accettato dal cliente.
Prendete la baseline da un periodo confrontabile:
- Stessi giorni e stessi orari: quattro settimane complete, negli orari in cui risponderà l'agente.
- Stessa stagione o campagna: non una settimana di promozioni contro una settimana tranquilla, né la settimana di Ferragosto contro una settimana normale.
- Stesso mix di chiamate: stesso tipo di chiamata, stesse lingue, stessi gruppi di clienti. Se il pilota riguarda solo le chiamate serali, la baseline è quello che succedeva prima alle chiamate serali, anche se finivano in segreteria telefonica.
Non riutilizzate i vecchi codici di esito: un clic su «risolto» può voler dire qualcosa di diverso da un nuovo orario nel sistema di prenotazione. Rietichettate con le regole del pilota un campione casuale di chiamate della baseline, e usatelo anche per misurare le azioni errate del vostro team. Il nostro articolo sul tasso di contenimento e di risoluzione spiega perché una chiamata senza trasferimento non è ancora una chiamata risolta.
Se una metrica non è mai stata misurata, scrivete «non misurata» sulla scheda, fissate il target in base a ciò che serve al business case e in seguito non dichiarate miglioramenti su quella metrica.
Passo 2: scrivete la scheda del pilota
La scheda del pilota contiene cinque metriche e ognuna risponde a una domanda diversa: così un buon numero su una non può nascondere un cattivo numero su un'altra. Per ogni metrica scrivete numeratore, denominatore e che cosa resta escluso. Poi fissate due livelli. Il target è il livello a cui il business case funziona. La soglia di stop è il punto in cui vi fermate, qualunque cosa dicano le altre metriche. Una metrica che sta tra i due livelli è fuori target.
Tutti i valori della scheda sono un esempio inventato per questo articolo, non dati di un'azienda reale.
| Metrica | Definizione esatta | Baseline | Target | Soglia di stop |
|---|---|---|---|---|
| Tasso di risoluzione | Chiamate che si chiudono con l'intervento fissato in un orario accettato dal cliente e visibile nel sistema di prenotazione, senza trasferimento né richiamata, divise per le chiamate idonee. Escluse: chiamate di test e altri tipi di chiamata. | 74% | 70% o più | Sotto il 60% |
| Tasso di ricontatto | Clienti che vi ricontattano per lo stesso intervento entro 7 giorni, su qualsiasi canale, divisi per i clienti con una chiamata idonea. Si conta solo quando i 7 giorni sono passati. | 12% | 12% o meno | Sopra il 18% |
| Tasso di azioni errate | Chiamate riviste con un record errato, una prenotazione errata o un'informazione errata, divise per le chiamate riviste. Nella settimana 1 si rivedono tutte le chiamate, poi 100 chiamate casuali a settimana. | 1,5% (3 su 200 chiamate riviste) | 1% o meno | Sopra il 3% |
| Qualità dei trasferimenti | Trasferimenti in cui il collega non ha dovuto chiedere di nuovo nome, prenotazione o motivo della chiamata, divisi per tutti i trasferimenti. | Non misurata | 90% o più | Sotto il 75% |
| Impegno del personale | Minuti del personale ogni 100 chiamate idonee, spesi in trasferimenti, richiamate, revisioni e correzioni, valutati sulle settimane 3 e 4. Baseline: minuti spesi per gestire le chiamate. | 640 minuti | 250 minuti o meno | Sopra i 400 minuti |
Il target del tasso di risoluzione è volutamente sotto la baseline. Scrivete il motivo sulla scheda: il business case funziona al 70% se l'impegno del personale scende da 640 a 250 minuti o meno ogni 100 chiamate. Per l'impegno del personale contano solo le settimane 3 e 4, perché nella settimana 1 i revisori leggono tutte le chiamate e la prima correzione arriva nella settimana 2.
Soglie di stop che scattano con una sola chiamata
Alcuni errori costano troppo per aspettare che diventino un tasso:
- Un'azione errata con conseguenze economiche o legali, come un addebito, un rimborso o l'annullamento di un intervento a pagamento.
- Dati personali comunicati a chi chiama e non ha superato la verifica d'identità.
- Un cliente che segnala un pericolo, per esempio odore di gas, e non viene passato subito a una persona.
Basta uno solo di questi casi per chiudere il pilota in anticipo, e le chiamate tornano al percorso precedente il giorno stesso. Ripartire dopo una correzione significa iniziare un nuovo pilota dal giorno 1. La soglia di stop di una metrica agisce più lentamente: il pilota si chiude in anticipo se il valore misurato della metrica è oltre la sua soglia di stop in due punti settimanali consecutivi. Contano solo i punti settimanali in cui quella metrica viene valutata: l'impegno del personale dalla settimana 3, i ricontatti solo quando sono passati i loro 7 giorni.
Il campione casuale di 100 chiamate a settimana lascia sfuggire la maggior parte degli errori elencati sopra, quindi andateli a cercare direttamente. Ogni settimana leggete tutte le chiamate che si chiudono con un addebito, un rimborso o un annullamento, tutte quelle in cui l'agente ha comunicato dati personali e tutte quelle che un cliente o un collega segnala come problematiche. Queste letture si aggiungono al campione casuale.
Passo 3: fate il punto settimanale
Al punto settimanale si legge la stessa scheda, lo stesso giorno ogni settimana, si controllano i conteggi e si sceglie al massimo una modifica all'agente.
| Settimana | Cosa leggere | Domanda a cui rispondere | Chi decide o corregge |
|---|---|---|---|
| Settimana 1 | Ogni chiamata senza l'esito atteso, ogni trasferimento e ogni modifica di prenotazione, confrontati con il sistema di prenotazione. | Le etichette corrispondono a quello che sente un revisore? | Il revisore qualità legge. Il responsabile operations decide le modifiche. |
| Settimana 2 | La scheda accanto alla baseline, con conteggi e margini. Le chiamate non risolte, raggruppate per causa. | Quale causa spiega più chiamate non risolte: l'agente, i sistemi o il lato aziendale? | Il responsabile operations sceglie una correzione. La realizza chi sviluppa l'agente o il responsabile dei sistemi. |
| Settimana 3 | La metrica che la correzione dovrebbe spostare, e le altre quattro. I ricontatti delle settimane 1 e 2, per cui i 7 giorni sono passati. | La correzione ha spostato la sua metrica senza peggiorarne un'altra? | Il responsabile operations, insieme al revisore qualità. |
| Settimana 4 | La scheda completa su tutte le chiamate dal giorno 1, le soglie di stop e il margine di ogni tasso. | A quale decisione del giorno 30 porta la scheda: Ampliamento, Proroga o Stop? | La prepara il responsabile operations. La firma lo sponsor. |
Tre regole rendono le settimane confrontabili:
- Una modifica a settimana, registrata con la sua data. Con due modifiche non potete sapere quale ha spostato il numero.
- Definizioni fisse. Se una definizione si rivela sbagliata, cambiatela una volta sola, annotate il motivo e ricalcolate tutte le settimane precedenti.
- Conteggi accanto ai tassi. Scrivete «64% (256 su 400 chiamate)», non «64%».
La nostra guida al campionamento qualità nel call center spiega quali chiamate far leggere ai revisori.
Cosa possono dirvi i numeri, e cosa no
Ogni tasso del pilota è una stima. Per un tasso p misurato su n chiamate, un margine di errore approssimativo al 95% è dato da 1,96 × √(p(1 - p) / n). Con un tasso del 70% si ottiene:
- 100 chiamate: circa ±9,0 punti
- 400 chiamate: circa ±4,5 punti
- 1.000 chiamate: circa ±2,8 punti
Quindi un dato settimanale su 400 chiamate di solito resta entro circa 4,5 punti dal tasso reale, e una variazione di qualche punto da una settimana all'altra può essere puro caso. La formula presuppone chiamate indipendenti e un tasso non vicino allo 0% o al 100%. Il confronto con la baseline ha un margine più ampio: per due tassi intorno al 70% su 1.600 chiamate ciascuno, la differenza ha un margine di circa ±3,2 punti.
Nella settimana 1 dell'esempio il tasso di risoluzione è del 64% su 400 chiamate, circa ±4,7 punti. Il tasso reale potrebbe stare ovunque tra circa il 59,3% e il 68,7%: l'intervallo attraversa la soglia di stop e resta sotto il target. Al giorno 30 l'esempio conta 1.600 chiamate al 68%, circa ±2,3 punti. L'intervallo, da circa il 65,7% al 70,3%, è nettamente sopra la soglia di stop, con il target appena al suo interno.
Valgono altri tre limiti:
- Eventi rari. Nessuna azione errata su 300 chiamate riviste è ancora compatibile con un tasso reale fino a circa l'1%. È la «regola del tre»: con zero eventi su n chiamate, il limite superiore al 95% è circa 3 / n. Leggete e classificate ogni azione errata.
- Sottoinsiemi piccoli. Una lingua o un giorno della settimana con 60 chiamate ha un margine di circa ±11,6 punti al 70%. Ascoltate quelle chiamate invece di confrontarne il tasso.
- Ricontatti recenti. Al giorno 30 il tasso di ricontatto copre solo le chiamate fino al giorno 23. Per le chiamate successive i 7 giorni non sono ancora passati.
La decisione del giorno 30: Ampliamento, Proroga o Stop
Al giorno 30 calcolate i valori della scheda del pilota su tutte le chiamate dal giorno 1. Poi applicate la regola in quest'ordine:
- Stop se si supera una soglia di stop, se più di due metriche sono fuori target o se lo scarto non ha un'unica causa nota. Le chiamate tornano al percorso precedente e il motivo viene messo per iscritto per il pilota successivo.
- Ampliamento se ogni target è raggiunto e nessuna soglia di stop è superata. Spostate gradualmente sull'agente più chiamate dello stesso tipo, con la stessa scheda. Un nuovo tipo di chiamata ha bisogno di una sua scheda del pilota.
- Proroga se una o due metriche sono fuori target per un'unica causa nota. La proroga si concede una sola volta, di due settimane, con una sola correzione per quella causa e la stessa scheda, e si valuta solo sulle sue chiamate. Se a quel punto ogni target è raggiunto, si passa all'Ampliamento. Altrimenti la decisione è Stop.
Come leggere risultati misti
Al giorno 30 capita spesso un risultato misto: quattro metriche raggiungono il target e una no.
- Niente medie. Un tasso di risoluzione alto non compensa una prenotazione sbagliata.
- Prima di tutto il cliente. Il tasso di azioni errate e le soglie di stop che scattano con una sola chiamata non si barattano mai con il tasso di risoluzione o con l'impegno del personale. Se il tasso di azioni errate è fuori target, la Proroga è possibile solo se tutte le azioni errate hanno la stessa causa nota e la correzione la elimina.
- Leggete lo scarto rispetto al margine. Il 68% non raggiunge un target del 70%. Ma uno scarto più piccolo del margine, con una causa nota, è un caso tipico di Proroga.
- Cercate dove sta la causa. Se le chiamate falliscono perché non c'è un orario libero, un agente migliore non risolve il problema. Se l'impegno del personale non raggiunge il target, controllate se sta ancora scendendo dalla settimana 3 alla settimana 4.
Esempio: una scheda al giorno 30
Valori di esempio, non dati reali.
| Metrica | Target | Risultato al giorno 30 | Lettura |
|---|---|---|---|
| Tasso di risoluzione | 70% o più | 68% (1.088 su 1.600 chiamate, ±2,3 punti) | Fuori target, scarto inferiore al margine |
| Tasso di ricontatto | 12% o meno | 11% (chiamate fino al giorno 23) | Raggiunto |
| Tasso di azioni errate | 1% o meno | 0,6% (4 su 700 chiamate riviste) | Raggiunto, ogni caso letto e classificato |
| Qualità dei trasferimenti | 90% o più | 92% (230 su 250 trasferimenti) | Raggiunto |
| Impegno del personale | 250 minuti o meno | 230 minuti (settimane 3 e 4) | Raggiunto |
| Soglie di stop che scattano con una sola chiamata | 0 casi | 0 casi | Nessuna soglia di stop superata |
Una metrica è fuori target e nessuna soglia di stop è superata. Nel gruppo più numeroso di chiamate non risolte il cliente chiede un orario serale, che il sistema di prenotazione mostra solo al personale. La causa è nota e basta una sola correzione, quindi la decisione è Proroga: due settimane, la stessa scheda e gli orari serali aperti all'agente. Con circa 400 chiamate a settimana, la proroga porta circa 800 nuove chiamate da valutare, con un margine di circa ±3,2 punti al 70%.
Dove entra in gioco DRING
Con DRING un agente è operativo in una settimana. Usate quella settimana per rietichettare il campione della baseline preso dalle chiamate passate e firmare la scheda del pilota prima di passare alle chiamate reali. Prima di rispondere a una chiamata reale, ogni agente DRING affronta da 1.000 a 10.000 conversazioni simulate, costruite per la vostra azienda. È un test prima del lancio, non il pilota. La simulazione può far emergere presto le lacune, ma non dà né una baseline né un tasso di risoluzione su clienti veri. Il nostro articolo sulle conversazioni simulate spiega che cosa coprono.
Durante il pilota, l'analisi post-chiamata può restituire campi aggiuntivi definiti da voi, come l'esito di ogni chiamata, tramite API, CRM, dashboard e report. I revisori continuano a leggere le chiamate, e i campi danno a ogni punto settimanale le stesse etichette. La pagina sull'analisi delle chiamate mostra dashboard e report.
Prima di tutto, i criteri
Lasciate il vostro numero e DRING vi chiama in due minuti. Indicate quale tipo di chiamata volete portare nel pilota: il nostro team vi ricontatta per concordare con voi la scheda del pilota prima di passare alle chiamate reali.