Aller au contenu
Décrivez un processus. DRING vous rappelle en deux minutes et qualifie le besoin. Être rappelé en deux minutes
Être rappelé en 2 minutes Voir Agent Factory
Guide de lancement · Évaluation du pilote

Comment évaluer un pilote d'IA vocale de 30 jours

Décidez de ce qui compte comme une réussite avant le premier appel réel. Ce guide vous donne une fiche du pilote, un modèle de revue hebdomadaire et une règle de décision pour le jour 30 : Extension, Prolongation ou Arrêt.

En bref

Un pilote d'IA vocale a réussi quand, au jour 30, chaque indicateur atteint son objectif et qu'aucun seuil d'arrêt n'est franchi. Objectifs et seuils d'arrêt figurent sur une fiche du pilote signée avant le premier appel réel. Si vous fixez les critères après les appels, le jour 30 tourne au débat sur les appels à retenir. Si vous les fixez avant, le jour 30 se règle en une courte réunion.

Mesurez une référence pour le même type d'appel, sur une période comparable. Réunissez cinq indicateurs sur une seule fiche du pilote : taux de résolution, taux de recontact, taux d'actions erronées, qualité des transferts et temps de l'équipe. Donnez à chacun une définition exacte, un objectif et un seuil d'arrêt, et reprenez la même fiche à chaque revue hebdomadaire.

Au jour 30, appliquez la règle convenue à l'avance. Extension si tous les objectifs sont atteints. Prolongation, une seule fois et de deux semaines, si un ou deux indicateurs n'atteignent pas leur objectif et qu'une seule cause connue explique l'écart. Arrêt si un seuil d'arrêt est franchi, si plus de deux indicateurs n'atteignent pas leur objectif ou si l'écart ne s'explique pas par une seule cause connue. Certains seuils d'arrêt sont franchis dès un seul appel, par exemple une action erronée aux conséquences financières ou juridiques.

Pour les étapes de construction qui précèdent le pilote, consultez notre plan de déploiement de l'IA vocale en 90 jours.

Pourquoi les impressions ne font pas un verdict

Au bout de 30 jours, le responsable d'équipe se souvient du seul appel où l'agent a mal compris un client en colère. L'équipe projet se souvient des appels sans accroc qu'elle a fait écouter en réunion. Ni l'un ni l'autre ne dit grand-chose des centaines d'appels que personne n'a écoutés.

Les chiffres choisis après coup posent le même problème : il est facile de retenir l'indicateur le plus flatteur, ou d'étirer le mot « résolu » jusqu'à ce qu'il convienne. C'est pourquoi le responsable des opérations, le référent qualité, le responsable des systèmes et le sponsor signent la fiche du pilote avant le jour 1. Pendant le pilote, les objectifs et les seuils d'arrêt ne bougent pas.

Étape 1 : mesurer la référence

La référence, c'est la performance actuelle du même type d'appel, mesurée avec les définitions du pilote. Sans elle, un taux de résolution de 70 % n'est ni bon ni mauvais. Un type d'appel correspond à un seul parcours, avec un seul résultat attendu. Dans l'exemple de cet article, les clients appellent pour déplacer l'intervention d'un technicien déjà planifiée, et l'appel doit se conclure par un nouveau créneau accepté par le client.

Prenez la référence sur une période comparable :

  • Mêmes jours et mêmes horaires : quatre semaines complètes, sur les plages horaires où l'agent répondra.
  • Même saison ou même campagne : pas une semaine de soldes face à une semaine calme, ni une semaine avec un jour férié face à une semaine normale.
  • Même répartition des appels : le même type d'appel, les mêmes langues et les mêmes groupes de clients. Si le pilote ne prend que les appels du soir, la référence est ce que devenaient auparavant les appels du soir, même s'ils aboutissaient sur la messagerie vocale.

Ne réutilisez pas les anciens codes de qualification : un clic sur « résolu » peut signifier autre chose qu'un nouveau créneau dans l'outil de planification. Requalifiez avec les règles du pilote un échantillon aléatoire d'appels de la période de référence, et servez-vous-en aussi pour mesurer les actions erronées de votre équipe. Notre article sur le taux de prise en charge et le taux de résolution explique pourquoi un appel sans transfert n'est pas encore un appel résolu.

Si un indicateur n'a jamais été mesuré, inscrivez « non mesuré » sur la fiche, fixez son objectif d'après ce qu'exige le business case, et ne revendiquez pas d'amélioration sur cet indicateur par la suite.

Étape 2 : rédiger la fiche du pilote

La fiche du pilote réunit cinq indicateurs qui répondent chacun à une question différente : un bon chiffre sur l'un ne peut pas masquer un mauvais chiffre sur un autre. Pour chaque indicateur, écrivez le numérateur, le dénominateur et ce qui est exclu. Fixez ensuite deux niveaux. L'objectif est le niveau à partir duquel le business case tient. Le seuil d'arrêt est le niveau auquel vous arrêtez le pilote, quels que soient les autres indicateurs. Un indicateur situé entre les deux n'atteint pas son objectif.

Toutes les valeurs de la fiche sont un exemple inventé pour cet article, et non des données d'une entreprise réelle.

IndicateurDéfinition exacteRéférenceObjectifSeuil d'arrêt
Taux de résolutionAppels qui se terminent avec l'intervention placée sur un créneau accepté par le client, visible dans l'outil de planification, sans transfert ni rappel, divisés par les appels éligibles. Exclus : appels de test et autres types d'appel.74 %70 % ou plusMoins de 60 %
Taux de recontactClients qui vous recontactent au sujet de la même intervention dans les 7 jours, par n'importe quel canal, divisés par les clients ayant passé un appel éligible. Compté une fois les 7 jours écoulés.12 %12 % ou moinsPlus de 18 %
Taux d'actions erronéesAppels relus comportant une saisie erronée, un rendez-vous erroné ou une information fausse, divisés par les appels relus. Relisez tous les appels de la semaine 1, puis 100 appels tirés au hasard par semaine.1,5 % (3 appels relus sur 200)1 % ou moinsPlus de 3 %
Qualité des transfertsTransferts pour lesquels le conseiller n'a pas eu à redemander le nom, le rendez-vous ou le motif, divisés par l'ensemble des transferts.Non mesuré90 % ou plusMoins de 75 %
Temps de l'équipeMinutes passées par l'équipe sur les transferts, les rappels, les relectures et les corrections, pour 100 appels éligibles, évaluées sur les semaines 3 et 4. Référence : minutes passées à traiter les appels.640 minutes250 minutes ou moinsPlus de 400 minutes

L'objectif de taux de résolution est volontairement inférieur à la référence. Inscrivez-en la raison sur la fiche : le business case tient à 70 % si le temps de l'équipe passe de 640 à 250 minutes ou moins pour 100 appels. Le temps de l'équipe ne porte que sur les semaines 3 et 4, car les relecteurs relisent tous les appels en semaine 1 et la première correction intervient en semaine 2.

Seuils d'arrêt franchis dès un seul appel

Certaines défaillances coûtent trop cher pour attendre qu'un taux se dessine :

  • Une action erronée aux conséquences financières ou juridiques, comme un débit, un remboursement ou l'annulation d'une intervention payante.
  • Des données personnelles communiquées à un appelant qui n'a pas passé la vérification d'identité.
  • Un appelant qui signale un danger, par exemple une odeur de gaz, et qui n'est pas immédiatement mis en relation avec une personne.

Un seul de ces cas suffit à arrêter le pilote avant terme, et les appels repassent sur l'ancien parcours le jour même. Une reprise après correction est un nouveau pilote, qui repart du jour 1. Pour les indicateurs, le seuil d'arrêt agit plus lentement : le pilote s'arrête avant terme si la valeur mesurée d'un indicateur se situe au-delà de son seuil d'arrêt lors de deux revues hebdomadaires consécutives. Ne comptez que les revues où cet indicateur est évalué : le temps de l'équipe à partir de la semaine 3, et les recontacts une fois leurs 7 jours écoulés.

L'échantillon aléatoire de 100 appels par semaine passera à côté de la plupart des défaillances citées plus haut : allez donc les chercher directement. Chaque semaine, relisez tous les appels qui se terminent par un débit, un remboursement ou une annulation, tous les appels où l'agent a communiqué des données personnelles, et tous les appels pour lesquels un client ou un membre de l'équipe signale un problème. Ces relectures s'ajoutent à l'échantillon aléatoire.

Étape 3 : tenir la revue hebdomadaire

La revue hebdomadaire se tient le même jour chaque semaine : elle reprend la même fiche, vérifie les décomptes et retient au plus une modification de l'agent.

SemaineCe qu'il faut lireQuestion à trancherQui décide ou corrige
Semaine 1Chaque appel sans le résultat attendu, chaque transfert et chaque modification de rendez-vous, vérifiés dans l'outil de planification.Les étiquettes correspondent-elles à ce qu'entend un relecteur ?Le référent qualité relit. Le responsable des opérations décide des modifications.
Semaine 2La fiche à côté de la référence, avec les décomptes et les marges d'erreur. Les appels non résolus, regroupés par cause.Quelle cause explique le plus d'appels non résolus : l'agent, les systèmes ou le métier ?Le responsable des opérations choisit une correction. Le concepteur de l'agent ou le responsable des systèmes la réalise.
Semaine 3L'indicateur que la correction doit faire bouger, et les quatre autres. Les recontacts des semaines 1 et 2, dont les 7 jours sont écoulés.La correction a-t-elle fait bouger son indicateur sans en dégrader un autre ?Le responsable des opérations, avec le référent qualité.
Semaine 4La fiche complète sur tous les appels depuis le jour 1, les seuils d'arrêt et la marge d'erreur de chaque taux.Quelle décision du jour 30 la fiche justifie-t-elle : Extension, Prolongation ou Arrêt ?Le responsable des opérations la prépare. Le sponsor la signe.

Trois règles permettent de comparer les semaines entre elles :

  • Une modification par semaine, consignée avec sa date. Avec deux modifications, impossible de savoir laquelle a fait bouger le chiffre.
  • Des définitions figées. Si une définition se révèle fausse, changez-la une seule fois, notez pourquoi et recalculez toutes les semaines précédentes.
  • Le décompte à côté du taux. Écrivez « 64 % (256 appels sur 400) », pas « 64 % ».

Notre guide sur l'échantillonnage qualité en centre de contacts indique quels appels les relecteurs doivent relire.

Ce que les chiffres disent, et ce qu'ils ne peuvent pas dire

Chaque taux mesuré pendant le pilote est une estimation. Pour un taux p mesuré sur n appels, la marge d'erreur à 95 % vaut environ 1,96 × √(p(1 - p) / n). Pour un taux de 70 %, cela donne :

  • 100 appels : environ ±9,0 points
  • 400 appels : environ ±4,5 points
  • 1 000 appels : environ ±2,8 points

Un chiffre hebdomadaire sur 400 appels se situe donc généralement à moins de 4,5 points environ du vrai taux, et une variation de quelques points d'une semaine à l'autre peut relever du seul hasard. La formule suppose des appels indépendants et un taux qui n'est pas proche de 0 % ou de 100 %. La comparaison avec la référence a une marge plus large : pour deux taux d'environ 70 % mesurés chacun sur 1 600 appels, l'écart entre les deux comporte une marge d'environ ±3,2 points.

En semaine 1 de l'exemple, le taux de résolution est de 64 % sur 400 appels, soit environ ±4,7 points. Le vrai taux peut se situer n'importe où entre 59,3 % et 68,7 % environ : la fourchette chevauche le seuil d'arrêt et reste sous l'objectif. Au jour 30, l'exemple compte 1 600 appels à 68 %, soit environ ±2,3 points. La fourchette, d'environ 65,7 % à 70,3 %, se situe nettement au-dessus du seuil d'arrêt, et l'objectif y est tout juste inclus.

Exemple, données fictives : le taux de résolution face à son seuil d'arrêt, son objectif et sa référence. La fourchette de la semaine 1 (400 appels) chevauche le seuil d'arrêt. Celle du jour 30 (1 600 appels) est plus étroite, et l'objectif y est tout juste inclus.

Trois autres limites s'appliquent :

  • Événements rares. Zéro action erronée sur 300 appels relus reste compatible avec un vrai taux allant jusqu'à environ 1 %. C'est la « règle de trois » des statisticiens : sans aucun événement sur n appels, la borne supérieure à 95 % vaut environ 3 / n. Lisez et classez chaque action erronée.
  • Petits segments. Une langue ou un jour de la semaine qui compte 60 appels a une marge d'environ ±11,6 points à 70 %. Écoutez ces appels au lieu de comparer leur taux.
  • Recontacts récents. Au jour 30, le taux de recontact ne couvre que les appels passés jusqu'au jour 23. Pour les appels suivants, les 7 jours ne sont pas encore écoulés.

La décision du jour 30 : Extension, Prolongation ou Arrêt

Au jour 30, calculez la fiche du pilote sur tous les appels depuis le jour 1. Appliquez ensuite la règle dans cet ordre :

  • Arrêt si un seuil d'arrêt est franchi, si plus de deux indicateurs n'atteignent pas leur objectif, ou si l'écart ne s'explique pas par une seule cause connue. Les appels repassent sur l'ancien parcours, et la raison est consignée pour le prochain pilote.
  • Extension si tous les objectifs sont atteints et qu'aucun seuil d'arrêt n'est franchi. Confiez par étapes à l'agent davantage d'appels du même type, avec la même fiche. Un nouveau type d'appel reçoit sa propre fiche du pilote.
  • Prolongation si un ou deux indicateurs n'atteignent pas leur objectif pour une seule cause connue. Prolongez une seule fois, de deux semaines, avec une correction ciblée sur cette cause et la même fiche, puis évaluez la prolongation sur ses propres appels. Si tous les objectifs sont alors atteints, c'est l'Extension. Sinon, la décision est l'Arrêt.
La décision du jour 30 : trois voies, chacune avec une condition convenue avant le jour 1.

Comment lire des résultats mitigés

Au jour 30, le résultat est souvent mitigé : quatre indicateurs atteignent leur objectif, le cinquième non.

  • Ne faites pas de moyenne. Un taux de résolution élevé ne compense pas un rendez-vous erroné.
  • Protégez d'abord le client. Le taux d'actions erronées et les seuils d'arrêt franchis dès un seul appel ne sont jamais mis en balance avec le taux de résolution ou le temps de l'équipe. Si le taux d'actions erronées n'atteint pas son objectif, la Prolongation n'est possible que si toutes les actions erronées ont la même cause connue et que la correction la supprime.
  • Rapportez l'écart à la marge d'erreur. 68 % n'atteint pas un objectif de 70 %. Mais un écart inférieur à la marge, avec une cause connue, est un cas typique de Prolongation.
  • Situez la cause. Si des appels échouent faute de créneau libre, un meilleur agent n'y changera rien. Si le temps de l'équipe n'atteint pas son objectif, vérifiez s'il baisse encore entre la semaine 3 et la semaine 4.

Exemple : une fiche au jour 30

Valeurs d'exemple, et non des données réelles.

IndicateurObjectifRésultat au jour 30Lecture
Taux de résolution70 % ou plus68 % (1 088 appels sur 1 600, ±2,3 points)Objectif non atteint, avec un écart inférieur à la marge
Taux de recontact12 % ou moins11 % (appels jusqu'au jour 23)Atteint
Taux d'actions erronées1 % ou moins0,6 % (4 appels relus sur 700)Atteint, chaque cas lu et classé
Qualité des transferts90 % ou plus92 % (230 transferts sur 250)Atteint
Temps de l'équipe250 minutes ou moins230 minutes (semaines 3 et 4)Atteint
Seuils d'arrêt franchis dès un seul appel0 cas0 casAucun seuil d'arrêt franchi

Un indicateur n'atteint pas son objectif, et aucun seuil d'arrêt n'est franchi. Dans le plus grand groupe d'appels non résolus, le client demande un créneau en soirée, que l'outil de planification n'affiche qu'aux équipes internes. La cause est connue et une seule correction la traite. La décision est donc la Prolongation : deux semaines, la même fiche, et les créneaux du soir ouverts à l'agent. À environ 400 appels par semaine, la prolongation apporte quelque 800 nouveaux appels à évaluer, avec une marge d'environ ±3,2 points à 70 %.

Où DRING intervient

Avec DRING, un agent est en service en une semaine. Profitez de cette semaine pour requalifier l'échantillon de référence tiré d'appels passés et signer la fiche du pilote avant le premier appel réel. Chaque agent DRING passe par 1 000 à 10 000 conversations simulées, conçues pour votre entreprise, avant son premier appel réel. C'est un test avant le lancement, pas le pilote. La simulation peut révéler tôt des lacunes, mais elle ne fournit ni référence ni taux de résolution sur de vrais clients. Notre article sur les conversations simulées explique ce qu'elles couvrent.

Pendant le pilote, l'analyse post-appel peut restituer des champs supplémentaires que vous définissez, comme le résultat de chaque appel, via l'API, votre CRM, le tableau de bord et les rapports. Les relecteurs continuent de relire les appels, et ces champs donnent les mêmes étiquettes à chaque revue hebdomadaire. Notre page analyse des appels présente le tableau de bord et les rapports.

Commencez par fixer les critères

Laissez votre numéro : DRING vous rappelle en deux minutes. Dites-lui quel type d'appel vous souhaitez tester en pilote, et notre équipe revient vers vous pour établir ensemble la fiche du pilote avant le premier appel réel.