Aller au contenu
Décrivez un processus. DRING vous rappelle en deux minutes et qualifie le besoin. Être rappelé en deux minutes
Être rappelé en 2 minutes Voir Agent Factory
Exploitation de l'IA vocale · Mesure de la latence

Pourquoi l'agent IA fait attendre l'appelant

La pause qui suit la dernière phrase de l'appelant est la somme de six composantes. Mesurez chaque tour de parole, examinez les plus lents et corrigez la composante qui prend le plus de temps.

En bref

Quand un appelant a fini de parler et n'entend que du silence, la pause tient rarement à une seule lenteur. Elle est la somme de six composantes : Fin de tour, Transcription, Génération, Consultation, Mise en voix et Ligne. La Consultation n'a lieu que sur les tours avec consultation, quand l'agent interroge un système, par exemple sur l'état d'une commande. Tous les autres tours sont des tours simples.

Ce guide appelle cette pause le temps de latence : il court du moment où l'appelant cesse de parler jusqu'au premier son de l'agent, tel que l'appelant l'entend. Un temps de latence moyen masque les tours dont les appelants se souviennent. Mesurez donc chaque tour, séparez les tours simples des tours avec consultation, et lisez la médiane et le 90e centile.

Cherchez ensuite la composante la plus longue dans chacun des tours les plus lents. Celle qui est le plus souvent la plus longue est la première à corriger. Changez une composante à la fois et surveillez le signal inverse : un agent qui attend moins avant de répondre peut se mettre à couper la parole aux appelants. Quand une attente est inévitable, une phrase d'attente donne plus tôt un premier son à l'appelant. Elle n'avance pas la réponse pour autant.

Ne reprenez aucun objectif chiffré trouvé ailleurs. Cherchez le temps de latence à partir duquel vos propres appelants se mettent à dire « Allô ? » dans le silence. C'est votre seuil.

Notre article sur les raccrochages face à un agent IA repère l'étape où les appelants abandonnent. Ce guide descend d'un niveau : pourquoi le silence est long, et quelle composante corriger. Tous les chiffres qui suivent sont donnés à titre d'exemple : ce ne sont ni des données DRING, ni des données du secteur.

Les six composantes du temps de latence

Entre le dernier mot de l'appelant et le premier son de l'agent, le temps se répartit en six composantes. Ce guide les présente toujours dans cet ordre :

ComposanteCe qui se passeCe qui l'allonge en généralComment la mesurer
Fin de tourLe système décide que l'appelant a terminé.Il attend un long silence avant de trancher.Sur votre enregistrement, du moment où l'appelant se tait jusqu'à la décision du système
TranscriptionLe texte issu de la reconnaissance vocale est finalisé.Le texte final n'arrive qu'une fois toute la phrase traitée.De la décision au texte final
GénérationLe modèle décide de la marche à suivre et rédige la réponse.Une première phrase longue, un prompt volumineux, un long raisonnement avant de parler.Du texte final à la réponse. Sur un tour avec consultation, en deux segments : jusqu'à la requête de Consultation, puis du retour de la Consultation à la réponse
ConsultationUne vérification dans un système, par exemple l'état d'une commande. Uniquement sur les tours avec consultation.Un système lent, des vérifications lancées l'une après l'autre, aucune limite de temps.De la requête à la réponse du système
Mise en voixLa voix produit le premier son de la réponse.La voix attend tout le texte de la réponse avant de démarrer.Du moment où le texte de la réponse parvient à la voix jusqu'au premier son qui sort de votre système
LigneLa téléphonie et le réseau transportent le son dans les deux sens.Un acheminement long, des régions éloignées, une couverture mobile faible.Des appels de test passés depuis des téléphones ordinaires, enregistrés côté appelant

Deux composantes se divisent en deux segments. Sur un tour avec consultation, le modèle intervient avant la Consultation, pour décider quoi vérifier, et après, pour formuler la réponse. Les deux segments comptent dans la Génération. La Ligne compte deux segments à chaque tour : la voix de l'appelant qui parvient à votre système, et la voix de l'agent qui parvient à l'appelant. Les deux segments comptent dans la Ligne.

Comment mesurer chaque tour

Mesurez des tours, pas des appels : dans la moyenne d'un appel, un tour lent avec consultation peut se cacher parmi sept tours rapides. Attribuez à chaque tour une ligne de votre tableau, avec les mêmes champs. Les valeurs d'exemple sont celles du tour lent présenté plus loin dans ce guide. Exemple, et non des données réelles.

ChampCe qu'il contientValeur d'exemple
Identifiant d'appelUn identifiant commun à l'enregistrement de l'appel et aux journaux du systèmeC1047
Numéro de tourLa position de la réplique de l'agent dans l'appel4
Type de tourTour simple ou tour avec consultationTour avec consultation
Temps de latenceDu dernier mot de l'appelant au premier son de l'agent, Ligne comprise3,9 s
Fin de tourVotre enregistrement et les horodatages du système0,7 s
TranscriptionHorodatages du système0,2 s
GénérationHorodatages du système, les deux segments sur un tour avec consultation0,6 s (0,3 s avant et 0,3 s après la Consultation)
ConsultationHorodatages du système, vide sur un tour simple1,9 s
Mise en voixHorodatages du système0,3 s
LigneAppels de test sur les réseaux de vos appelants0,2 s
Temps inexpliquéLe temps de latence sur l'enregistrement de votre système, moins les composantes que vous consignez0,0 s
Silence rompu par l'appelantOui, si l'appelant a dit « Allô ? » ou s'est répété pendant le silenceOui
Coupure de paroleOui, si l'agent a commencé à répondre alors que l'appelant parlait encore ou n'avait fait qu'une pauseNon
Tâche accompliePar appel : oui, si l'appelant a obtenu ce pour quoi il appelaitOui

Mesurez d'abord le temps de latence sur l'enregistrement d'appel de votre système. L'identifiant d'appel commun relie chaque tour de l'enregistrement aux horodatages du système correspondants, qui vous donnent la Fin de tour, la Transcription, la Génération, la Consultation et la Mise en voix. La Ligne s'ajoute à l'étape suivante.

La Ligne n'apparaît pas sur votre enregistrement. Sur votre système, le chronomètre démarre quand le son de l'appelant vous parvient et s'arrête quand le vôtre repart. Passez donc des appels de test depuis des téléphones ordinaires, sur les réseaux de vos appelants, et enregistrez-les côté appelant. Le temps de latence sur cet enregistrement, moins celui du même tour sur l'enregistrement de votre système, donne la Ligne. Ajoutez-la aux temps de latence de vos appels réels.

Vérifiez ensuite la somme. Le temps inexpliqué est le temps de latence sur l'enregistrement de votre système, moins les composantes que vous consignez. S'il est élevé, il manque un horodatage. Dans le tour d'exemple, l'enregistrement de votre système affiche 3,7 secondes et les composantes consignées totalisent 3,7 secondes : le temps inexpliqué est donc nul. Ajoutez les 0,2 seconde de la Ligne, et l'appelant entend 3,9 secondes.

Pourquoi la moyenne masque le problème

Exemple, et non des données réelles : 400 tours de parole de l'agent, issus de 50 appels enregistrés sur une même ligne, dont 300 tours simples et 100 tours avec consultation. Chaque temps de latence inclut la Ligne, soit 0,2 seconde mesurée par des appels de test.

Type de tourToursMédianeMoyenne90e centile
Tours simples3001,1 s1,2 s1,8 s
Tours avec consultation1002,9 s3,2 s4,6 s
Tous les tours4001,3 s1,7 s3,4 s

La moyenne de tous les tours, 1,7 seconde, dépasse la médiane de 1,3 seconde, parce que les tours lents la tirent vers le haut. Aucun de ces deux chiffres ne montre les tours dont les appelants se souviennent. Le 90e centile (p90), si : c'est le temps de latence qu'un tour sur dix atteint ou dépasse, ici 3,4 secondes. Les tours qui l'atteignent ou le dépassent sont les tours les plus lents.

Séparez aussi les tours par type. Les tours simples ont une médiane de 1,1 seconde, les tours avec consultation de 2,9 secondes. Une semaine qui compte davantage de tours avec consultation fait monter les chiffres de l'ensemble des tours, même si aucune composante n'a ralenti.

Répartissez maintenant les 400 mêmes tours en quatre tranches de temps de latence : 130 tours à moins de 1,0 seconde, 180 de 1,0 à 2,0 secondes, 50 de 2,0 à 3,4 secondes et 40 à 3,4 secondes et plus. Marquez ensuite les tours où l'appelant a rompu le silence : il a dit « Allô ? » ou s'est répété. C'est arrivé dans 31 des 40 tours les plus lents, et dans 7 des 360 autres : 3 fois sur les 310 tours à moins de 2,0 secondes, et 4 fois sur les 50 tours de 2,0 à 3,4 secondes.

Les 400 tours par temps de latence. La partie sombre de chaque barre correspond aux tours où l'appelant a rompu le silence : 0, 3, 4 et 31. Exemple, et non des données réelles.

Sur cette ligne, les silences rompus sont donc rares à moins de 2,0 secondes, encore peu fréquents de 2,0 à 3,4 secondes, et fréquents à 3,4 secondes et plus. Le seuil de cette ligne se situe vers 3,4 secondes, et ce n'est pas un objectif général. Trouvez le vôtre de la même façon : répartissez vos propres tours en tranches, et repérez à partir de quand les silences rompus cessent d'être rares pour devenir fréquents. Des tranches plus fines autour de ce point le situent plus précisément.

Trouver la composante la plus longue des tours les plus lents

Le 90e centile montre à quel point les tours les plus lents sont lents, pas pourquoi. Pour le savoir, ouvrez chaque tour lent et trouvez sa composante la plus longue : celle qui a pris le plus de temps dans ce tour.

Exemple, et non des données réelles : l'un des 40 tours les plus lents. L'appelant demande où en est sa commande, c'est donc un tour avec consultation. Le chronomètre démarre quand l'appelant cesse de parler, et le temps est mesuré côté appelant.

Un tour lent avec consultation, composante par composante : un temps de latence de 3,9 secondes, dont la Consultation est la composante la plus longue. Exemple, et non des données réelles.

Par composante : Fin de tour 0,7 seconde, Transcription 0,2 seconde, Génération 0,6 seconde, Consultation 1,9 seconde, Mise en voix 0,3 seconde et Ligne 0,2 seconde. La Génération se fait en deux segments de 0,3 seconde : l'un pour décider de vérifier la commande, l'autre pour formuler la réponse. La Ligne compte 0,1 seconde dans chaque sens. Ensemble, les composantes forment un temps de latence de 3,9 secondes. La Consultation est la composante la plus longue, près de la moitié du temps de latence.

Les durées des composantes ne s'additionnent ainsi qu'à l'intérieur d'un même tour. Les médianes et les 90es centiles, eux, ne s'additionnent pas : la somme des médianes des six composantes n'est pas la médiane du temps de latence. Cherchez donc la composante la plus longue tour par tour, puis comptez.

Exemple, et non des données réelles : la composante la plus longue de chacun des 40 tours les plus lents.

Composante la plus longueTours les plus lents
Fin de tour8
Transcription0
Génération5
Consultation27
Mise en voix0
Ligne0
Total40

La Consultation est le plus souvent la composante la plus longue : dans 27 cas sur 40. C'est cohérent avec les types de tour, puisque 36 des tours les plus lents sont des tours avec consultation et 4 des tours simples. La Fin de tour est la composante la plus longue dans 8 cas. Dans la plupart d'entre eux, l'appelant a marqué une pause en dictant un numéro, et le système a attendu plus longtemps avant de décider qu'il avait terminé. La Génération est la composante la plus longue dans 5 cas.

Ici, la Ligne n'est jamais la composante la plus longue, car elle reste stable à 0,2 seconde sur cette ligne. Sur une autre ligne, elle pourrait l'être. Notre article sur les démos réussies et les appels réels ratés propose un test rapide. Un blanc à chaque tour renvoie à la ligne. Un blanc seulement quand l'agent consulte un système renvoie aux outils.

Corriger une composante à la fois, en surveillant le signal inverse

Commencez par la composante qui est le plus souvent la plus longue dans vos tours les plus lents, ici la Consultation. Changez une seule chose, puis mesurez à nouveau les mêmes types de tour. Avec deux modifications à la fois, impossible de savoir laquelle a fait bouger le 90e centile.

Chaque correction a un coût, et chaque ligne du tableau indique donc aussi le signal à surveiller :

ComposanteÀ essayerÀ surveiller
Fin de tourUne attente qui dépend de ce que dit l'appelant : plus courte après une réponse brève, comme oui, non ou un nom, et plus longue quand l'appelant dicte un numéro ou épelle un mot.Coupures de parole
TranscriptionUne reconnaissance vocale en flux, pour que l'essentiel du texte soit prêt à la fin du tour.Mots et chiffres mal entendus
GénérationUne première phrase courte. Un plan de réponse simple pour les questions courantes.Qualité et complétude des réponses
ConsultationLancer en même temps les vérifications indépendantes. Fixer une limite de temps et une solution de repli : transférer à un conseiller ou proposer un rappel. Placer une phrase d'attente avant la vérification.Réponses périmées ou partielles. Phrases d'attente répétées à chaque tour.
Mise en voixLancer la voix dès la première phrase, pendant que la suite s'écrit.Pauses peu naturelles au milieu d'une réponse
LigneDes appels de test depuis les réseaux de vos appelants. Une revue de l'acheminement avec votre opérateur télécom.La qualité audio, pas seulement la latence

Chaque ligne du tableau propose plusieurs options. Essayez-en une, mesurez, puis décidez de la suivante.

Le prix d'une Fin de tour plus courte : les coupures de parole

La coupure de parole est le défaut inverse d'un temps de latence trop long : l'agent commence à répondre alors que l'appelant parle encore ou n'a fait qu'une pause. Exemple, et non des données réelles : les 400 mêmes tours comptent 6 coupures de parole, dont 5 pendant que l'appelant dictait un numéro de commande ou de téléphone. Les numéros sont à l'origine des deux défauts : la Fin de tour était la composante la plus longue dans 8 des tours les plus lents, et dans la plupart d'entre eux, l'appelant dictait lui aussi un numéro. Raccourcissez l'attente sur tous les tours, et les coupures de parole augmenteront. C'est pourquoi la ligne Fin de tour du tableau prévoit deux durées d'attente. Allonger l'attente pendant un numéro n'accélère pas pour autant ces 8 tours lents. Ce qui aide dans ce cas, c'est un signal indiquant que le numéro est complet : si le système sait qu'un numéro de commande compte cinq chiffres, il peut considérer le tour comme terminé dès le cinquième chiffre, sans attendre le silence.

Quand l'attente est inévitable : la phrase d'attente

Certaines consultations restent lentes, et le système qui se trouve derrière n'est pas toujours entre vos mains. Donnez alors à l'appelant un premier son avant la Consultation : une phrase d'attente, quelques mots prononcés avant une étape lente. Dans le tour lent présenté plus haut, elle viendrait juste après le premier segment de Génération :

  • Appelant : « Oui, c'est la commande 4 8 1 7 2. »
  • Agent, avant la Consultation : « Merci, je regarde votre commande. »
  • Agent, après la Consultation : « Votre commande est en route, elle arrivera jeudi. »

Le temps de latence raccourcit, car le premier son arrive désormais avant la Consultation. Le délai de réponse effective, lui, court du moment où l'appelant cesse de parler jusqu'au début de la réponse proprement dite. Il reste à peu près le même, car la réponse attend toujours la Consultation. Sur ces tours, consignez aussi le délai de réponse effective, pour qu'une phrase d'attente ne puisse pas masquer une Consultation qui ralentit.

Gardez les phrases d'attente courtes, réservez-les aux étapes lentes, et ne les placez jamais au milieu d'une excuse, d'un chiffre ou de la conclusion. Une phrase d'attente à chaque tour a aussi un coût : les appelants entendent la même phrase en boucle.

Ce qu'il faut suivre chaque semaine

Chaque semaine, lisez trois signaux, séparément pour les tours simples et pour les tours avec consultation :

  • Temps de latence : la médiane et le 90e centile, ainsi que le délai de réponse effective sur les tours avec phrase d'attente.
  • Silence rompu par l'appelant : la part des tours où c'est arrivé.
  • Coupures de parole : leur nombre, et ce que disait l'appelant à ce moment-là.

Lisez un quatrième signal, par appel : la tâche a-t-elle été accomplie ? Un temps de latence plus court ne vaut pas grand-chose si moins de tâches sont accomplies. Si vous menez un pilote, comptez une tâche comme accomplie selon la définition de l'appel résolu inscrite sur votre fiche du pilote.

Comparez les mêmes types de tour avant et après chaque modification. Une part mesurée sur quelques centaines de tours peut varier par hasard. Notre article sur les critères de réussite d'un pilote d'IA vocale montre comment calculer la marge d'erreur d'un taux.

Où DRING intervient

Une sélection de modèles de reconnaissance vocale, de synthèse vocale et de raisonnement, la téléphonie, les tests et la supervision font partie du socle commun de chaque offre DRING. Chez DRING, trois des six composantes et la phrase d'attente fonctionnent ainsi :

  • Fin de tour : un modèle dédié gère l'interruption (barge-in) et la détection de fin de tour, pour que l'agent ne parle pas par-dessus une pause ni ne laisse un blanc après une réponse terminée.
  • Transcription : l'appel est transcrit en temps réel, avec une reconnaissance vocale en flux.
  • Ligne : les signaux de qualité audio et de latence sont suivis numéro par numéro, pour repérer tôt une ligne qui se dégrade.
  • Phrase d'attente : quand un outil ou un modèle met plus de temps, une courte formule d'attente naturelle, tirée du répertoire validé par DRING, fait avancer le tour de parole. Chez DRING, la phrase d'attente prend la forme de cette formule, qui ne s'insère jamais dans une excuse, un chiffre ou la conclusion.

Notre page moteur vocal montre comment reconnaissance vocale, prise de parole et synthèse vocale forment une seule chaîne, et notre page téléphonie traite de l'état des lignes.

Chaque agent DRING passe par 1 000 à 10 000 conversations simulées, conçues pour votre entreprise, avant le premier appel réel. Les simulations testent la prise de parole et les phrases d'attente avant le lancement. Elles ne mesurent pas la Ligne des appels réels : celle-ci se mesure par des appels de test sur les réseaux de vos appelants.

Si, sur votre ligne, des appelants disent « Allô ? » dans les silences, demandez un rappel. Préparez quelques-uns de ces appels, avec les enregistrements si votre politique interne le permet. Notre équipe peut passer en revue avec vous les tours les plus lents, composante par composante.

Trouvez la composante qui fait attendre vos appelants

Laissez votre numéro : DRING vous rappelle en deux minutes. Dites-lui quelle ligne connaît de longs silences, et notre équipe revient vers vous pour examiner ensemble les tours les plus lents.