Pourquoi l'agent IA fait attendre l'appelant
La pause qui suit la dernière phrase de l'appelant est la somme de six composantes. Mesurez chaque tour de parole, examinez les plus lents et corrigez la composante qui prend le plus de temps.
En bref
Quand un appelant a fini de parler et n'entend que du silence, la pause tient rarement à une seule lenteur. Elle est la somme de six composantes : Fin de tour, Transcription, Génération, Consultation, Mise en voix et Ligne. La Consultation n'a lieu que sur les tours avec consultation, quand l'agent interroge un système, par exemple sur l'état d'une commande. Tous les autres tours sont des tours simples.
Ce guide appelle cette pause le temps de latence : il court du moment où l'appelant cesse de parler jusqu'au premier son de l'agent, tel que l'appelant l'entend. Un temps de latence moyen masque les tours dont les appelants se souviennent. Mesurez donc chaque tour, séparez les tours simples des tours avec consultation, et lisez la médiane et le 90e centile.
Cherchez ensuite la composante la plus longue dans chacun des tours les plus lents. Celle qui est le plus souvent la plus longue est la première à corriger. Changez une composante à la fois et surveillez le signal inverse : un agent qui attend moins avant de répondre peut se mettre à couper la parole aux appelants. Quand une attente est inévitable, une phrase d'attente donne plus tôt un premier son à l'appelant. Elle n'avance pas la réponse pour autant.
Ne reprenez aucun objectif chiffré trouvé ailleurs. Cherchez le temps de latence à partir duquel vos propres appelants se mettent à dire « Allô ? » dans le silence. C'est votre seuil.
Notre article sur les raccrochages face à un agent IA repère l'étape où les appelants abandonnent. Ce guide descend d'un niveau : pourquoi le silence est long, et quelle composante corriger. Tous les chiffres qui suivent sont donnés à titre d'exemple : ce ne sont ni des données DRING, ni des données du secteur.
Les six composantes du temps de latence
Entre le dernier mot de l'appelant et le premier son de l'agent, le temps se répartit en six composantes. Ce guide les présente toujours dans cet ordre :
| Composante | Ce qui se passe | Ce qui l'allonge en général | Comment la mesurer |
|---|---|---|---|
| Fin de tour | Le système décide que l'appelant a terminé. | Il attend un long silence avant de trancher. | Sur votre enregistrement, du moment où l'appelant se tait jusqu'à la décision du système |
| Transcription | Le texte issu de la reconnaissance vocale est finalisé. | Le texte final n'arrive qu'une fois toute la phrase traitée. | De la décision au texte final |
| Génération | Le modèle décide de la marche à suivre et rédige la réponse. | Une première phrase longue, un prompt volumineux, un long raisonnement avant de parler. | Du texte final à la réponse. Sur un tour avec consultation, en deux segments : jusqu'à la requête de Consultation, puis du retour de la Consultation à la réponse |
| Consultation | Une vérification dans un système, par exemple l'état d'une commande. Uniquement sur les tours avec consultation. | Un système lent, des vérifications lancées l'une après l'autre, aucune limite de temps. | De la requête à la réponse du système |
| Mise en voix | La voix produit le premier son de la réponse. | La voix attend tout le texte de la réponse avant de démarrer. | Du moment où le texte de la réponse parvient à la voix jusqu'au premier son qui sort de votre système |
| Ligne | La téléphonie et le réseau transportent le son dans les deux sens. | Un acheminement long, des régions éloignées, une couverture mobile faible. | Des appels de test passés depuis des téléphones ordinaires, enregistrés côté appelant |
Deux composantes se divisent en deux segments. Sur un tour avec consultation, le modèle intervient avant la Consultation, pour décider quoi vérifier, et après, pour formuler la réponse. Les deux segments comptent dans la Génération. La Ligne compte deux segments à chaque tour : la voix de l'appelant qui parvient à votre système, et la voix de l'agent qui parvient à l'appelant. Les deux segments comptent dans la Ligne.
Comment mesurer chaque tour
Mesurez des tours, pas des appels : dans la moyenne d'un appel, un tour lent avec consultation peut se cacher parmi sept tours rapides. Attribuez à chaque tour une ligne de votre tableau, avec les mêmes champs. Les valeurs d'exemple sont celles du tour lent présenté plus loin dans ce guide. Exemple, et non des données réelles.
| Champ | Ce qu'il contient | Valeur d'exemple |
|---|---|---|
| Identifiant d'appel | Un identifiant commun à l'enregistrement de l'appel et aux journaux du système | C1047 |
| Numéro de tour | La position de la réplique de l'agent dans l'appel | 4 |
| Type de tour | Tour simple ou tour avec consultation | Tour avec consultation |
| Temps de latence | Du dernier mot de l'appelant au premier son de l'agent, Ligne comprise | 3,9 s |
| Fin de tour | Votre enregistrement et les horodatages du système | 0,7 s |
| Transcription | Horodatages du système | 0,2 s |
| Génération | Horodatages du système, les deux segments sur un tour avec consultation | 0,6 s (0,3 s avant et 0,3 s après la Consultation) |
| Consultation | Horodatages du système, vide sur un tour simple | 1,9 s |
| Mise en voix | Horodatages du système | 0,3 s |
| Ligne | Appels de test sur les réseaux de vos appelants | 0,2 s |
| Temps inexpliqué | Le temps de latence sur l'enregistrement de votre système, moins les composantes que vous consignez | 0,0 s |
| Silence rompu par l'appelant | Oui, si l'appelant a dit « Allô ? » ou s'est répété pendant le silence | Oui |
| Coupure de parole | Oui, si l'agent a commencé à répondre alors que l'appelant parlait encore ou n'avait fait qu'une pause | Non |
| Tâche accomplie | Par appel : oui, si l'appelant a obtenu ce pour quoi il appelait | Oui |
Mesurez d'abord le temps de latence sur l'enregistrement d'appel de votre système. L'identifiant d'appel commun relie chaque tour de l'enregistrement aux horodatages du système correspondants, qui vous donnent la Fin de tour, la Transcription, la Génération, la Consultation et la Mise en voix. La Ligne s'ajoute à l'étape suivante.
La Ligne n'apparaît pas sur votre enregistrement. Sur votre système, le chronomètre démarre quand le son de l'appelant vous parvient et s'arrête quand le vôtre repart. Passez donc des appels de test depuis des téléphones ordinaires, sur les réseaux de vos appelants, et enregistrez-les côté appelant. Le temps de latence sur cet enregistrement, moins celui du même tour sur l'enregistrement de votre système, donne la Ligne. Ajoutez-la aux temps de latence de vos appels réels.
Vérifiez ensuite la somme. Le temps inexpliqué est le temps de latence sur l'enregistrement de votre système, moins les composantes que vous consignez. S'il est élevé, il manque un horodatage. Dans le tour d'exemple, l'enregistrement de votre système affiche 3,7 secondes et les composantes consignées totalisent 3,7 secondes : le temps inexpliqué est donc nul. Ajoutez les 0,2 seconde de la Ligne, et l'appelant entend 3,9 secondes.
Pourquoi la moyenne masque le problème
Exemple, et non des données réelles : 400 tours de parole de l'agent, issus de 50 appels enregistrés sur une même ligne, dont 300 tours simples et 100 tours avec consultation. Chaque temps de latence inclut la Ligne, soit 0,2 seconde mesurée par des appels de test.
| Type de tour | Tours | Médiane | Moyenne | 90e centile |
|---|---|---|---|---|
| Tours simples | 300 | 1,1 s | 1,2 s | 1,8 s |
| Tours avec consultation | 100 | 2,9 s | 3,2 s | 4,6 s |
| Tous les tours | 400 | 1,3 s | 1,7 s | 3,4 s |
La moyenne de tous les tours, 1,7 seconde, dépasse la médiane de 1,3 seconde, parce que les tours lents la tirent vers le haut. Aucun de ces deux chiffres ne montre les tours dont les appelants se souviennent. Le 90e centile (p90), si : c'est le temps de latence qu'un tour sur dix atteint ou dépasse, ici 3,4 secondes. Les tours qui l'atteignent ou le dépassent sont les tours les plus lents.
Séparez aussi les tours par type. Les tours simples ont une médiane de 1,1 seconde, les tours avec consultation de 2,9 secondes. Une semaine qui compte davantage de tours avec consultation fait monter les chiffres de l'ensemble des tours, même si aucune composante n'a ralenti.
Répartissez maintenant les 400 mêmes tours en quatre tranches de temps de latence : 130 tours à moins de 1,0 seconde, 180 de 1,0 à 2,0 secondes, 50 de 2,0 à 3,4 secondes et 40 à 3,4 secondes et plus. Marquez ensuite les tours où l'appelant a rompu le silence : il a dit « Allô ? » ou s'est répété. C'est arrivé dans 31 des 40 tours les plus lents, et dans 7 des 360 autres : 3 fois sur les 310 tours à moins de 2,0 secondes, et 4 fois sur les 50 tours de 2,0 à 3,4 secondes.
Sur cette ligne, les silences rompus sont donc rares à moins de 2,0 secondes, encore peu fréquents de 2,0 à 3,4 secondes, et fréquents à 3,4 secondes et plus. Le seuil de cette ligne se situe vers 3,4 secondes, et ce n'est pas un objectif général. Trouvez le vôtre de la même façon : répartissez vos propres tours en tranches, et repérez à partir de quand les silences rompus cessent d'être rares pour devenir fréquents. Des tranches plus fines autour de ce point le situent plus précisément.
Trouver la composante la plus longue des tours les plus lents
Le 90e centile montre à quel point les tours les plus lents sont lents, pas pourquoi. Pour le savoir, ouvrez chaque tour lent et trouvez sa composante la plus longue : celle qui a pris le plus de temps dans ce tour.
Exemple, et non des données réelles : l'un des 40 tours les plus lents. L'appelant demande où en est sa commande, c'est donc un tour avec consultation. Le chronomètre démarre quand l'appelant cesse de parler, et le temps est mesuré côté appelant.
Par composante : Fin de tour 0,7 seconde, Transcription 0,2 seconde, Génération 0,6 seconde, Consultation 1,9 seconde, Mise en voix 0,3 seconde et Ligne 0,2 seconde. La Génération se fait en deux segments de 0,3 seconde : l'un pour décider de vérifier la commande, l'autre pour formuler la réponse. La Ligne compte 0,1 seconde dans chaque sens. Ensemble, les composantes forment un temps de latence de 3,9 secondes. La Consultation est la composante la plus longue, près de la moitié du temps de latence.
Les durées des composantes ne s'additionnent ainsi qu'à l'intérieur d'un même tour. Les médianes et les 90es centiles, eux, ne s'additionnent pas : la somme des médianes des six composantes n'est pas la médiane du temps de latence. Cherchez donc la composante la plus longue tour par tour, puis comptez.
Exemple, et non des données réelles : la composante la plus longue de chacun des 40 tours les plus lents.
| Composante la plus longue | Tours les plus lents |
|---|---|
| Fin de tour | 8 |
| Transcription | 0 |
| Génération | 5 |
| Consultation | 27 |
| Mise en voix | 0 |
| Ligne | 0 |
| Total | 40 |
La Consultation est le plus souvent la composante la plus longue : dans 27 cas sur 40. C'est cohérent avec les types de tour, puisque 36 des tours les plus lents sont des tours avec consultation et 4 des tours simples. La Fin de tour est la composante la plus longue dans 8 cas. Dans la plupart d'entre eux, l'appelant a marqué une pause en dictant un numéro, et le système a attendu plus longtemps avant de décider qu'il avait terminé. La Génération est la composante la plus longue dans 5 cas.
Ici, la Ligne n'est jamais la composante la plus longue, car elle reste stable à 0,2 seconde sur cette ligne. Sur une autre ligne, elle pourrait l'être. Notre article sur les démos réussies et les appels réels ratés propose un test rapide. Un blanc à chaque tour renvoie à la ligne. Un blanc seulement quand l'agent consulte un système renvoie aux outils.
Corriger une composante à la fois, en surveillant le signal inverse
Commencez par la composante qui est le plus souvent la plus longue dans vos tours les plus lents, ici la Consultation. Changez une seule chose, puis mesurez à nouveau les mêmes types de tour. Avec deux modifications à la fois, impossible de savoir laquelle a fait bouger le 90e centile.
Chaque correction a un coût, et chaque ligne du tableau indique donc aussi le signal à surveiller :
| Composante | À essayer | À surveiller |
|---|---|---|
| Fin de tour | Une attente qui dépend de ce que dit l'appelant : plus courte après une réponse brève, comme oui, non ou un nom, et plus longue quand l'appelant dicte un numéro ou épelle un mot. | Coupures de parole |
| Transcription | Une reconnaissance vocale en flux, pour que l'essentiel du texte soit prêt à la fin du tour. | Mots et chiffres mal entendus |
| Génération | Une première phrase courte. Un plan de réponse simple pour les questions courantes. | Qualité et complétude des réponses |
| Consultation | Lancer en même temps les vérifications indépendantes. Fixer une limite de temps et une solution de repli : transférer à un conseiller ou proposer un rappel. Placer une phrase d'attente avant la vérification. | Réponses périmées ou partielles. Phrases d'attente répétées à chaque tour. |
| Mise en voix | Lancer la voix dès la première phrase, pendant que la suite s'écrit. | Pauses peu naturelles au milieu d'une réponse |
| Ligne | Des appels de test depuis les réseaux de vos appelants. Une revue de l'acheminement avec votre opérateur télécom. | La qualité audio, pas seulement la latence |
Chaque ligne du tableau propose plusieurs options. Essayez-en une, mesurez, puis décidez de la suivante.
Le prix d'une Fin de tour plus courte : les coupures de parole
La coupure de parole est le défaut inverse d'un temps de latence trop long : l'agent commence à répondre alors que l'appelant parle encore ou n'a fait qu'une pause. Exemple, et non des données réelles : les 400 mêmes tours comptent 6 coupures de parole, dont 5 pendant que l'appelant dictait un numéro de commande ou de téléphone. Les numéros sont à l'origine des deux défauts : la Fin de tour était la composante la plus longue dans 8 des tours les plus lents, et dans la plupart d'entre eux, l'appelant dictait lui aussi un numéro. Raccourcissez l'attente sur tous les tours, et les coupures de parole augmenteront. C'est pourquoi la ligne Fin de tour du tableau prévoit deux durées d'attente. Allonger l'attente pendant un numéro n'accélère pas pour autant ces 8 tours lents. Ce qui aide dans ce cas, c'est un signal indiquant que le numéro est complet : si le système sait qu'un numéro de commande compte cinq chiffres, il peut considérer le tour comme terminé dès le cinquième chiffre, sans attendre le silence.
Quand l'attente est inévitable : la phrase d'attente
Certaines consultations restent lentes, et le système qui se trouve derrière n'est pas toujours entre vos mains. Donnez alors à l'appelant un premier son avant la Consultation : une phrase d'attente, quelques mots prononcés avant une étape lente. Dans le tour lent présenté plus haut, elle viendrait juste après le premier segment de Génération :
- Appelant : « Oui, c'est la commande 4 8 1 7 2. »
- Agent, avant la Consultation : « Merci, je regarde votre commande. »
- Agent, après la Consultation : « Votre commande est en route, elle arrivera jeudi. »
Le temps de latence raccourcit, car le premier son arrive désormais avant la Consultation. Le délai de réponse effective, lui, court du moment où l'appelant cesse de parler jusqu'au début de la réponse proprement dite. Il reste à peu près le même, car la réponse attend toujours la Consultation. Sur ces tours, consignez aussi le délai de réponse effective, pour qu'une phrase d'attente ne puisse pas masquer une Consultation qui ralentit.
Gardez les phrases d'attente courtes, réservez-les aux étapes lentes, et ne les placez jamais au milieu d'une excuse, d'un chiffre ou de la conclusion. Une phrase d'attente à chaque tour a aussi un coût : les appelants entendent la même phrase en boucle.
Ce qu'il faut suivre chaque semaine
Chaque semaine, lisez trois signaux, séparément pour les tours simples et pour les tours avec consultation :
- Temps de latence : la médiane et le 90e centile, ainsi que le délai de réponse effective sur les tours avec phrase d'attente.
- Silence rompu par l'appelant : la part des tours où c'est arrivé.
- Coupures de parole : leur nombre, et ce que disait l'appelant à ce moment-là.
Lisez un quatrième signal, par appel : la tâche a-t-elle été accomplie ? Un temps de latence plus court ne vaut pas grand-chose si moins de tâches sont accomplies. Si vous menez un pilote, comptez une tâche comme accomplie selon la définition de l'appel résolu inscrite sur votre fiche du pilote.
Comparez les mêmes types de tour avant et après chaque modification. Une part mesurée sur quelques centaines de tours peut varier par hasard. Notre article sur les critères de réussite d'un pilote d'IA vocale montre comment calculer la marge d'erreur d'un taux.
Où DRING intervient
Une sélection de modèles de reconnaissance vocale, de synthèse vocale et de raisonnement, la téléphonie, les tests et la supervision font partie du socle commun de chaque offre DRING. Chez DRING, trois des six composantes et la phrase d'attente fonctionnent ainsi :
- Fin de tour : un modèle dédié gère l'interruption (barge-in) et la détection de fin de tour, pour que l'agent ne parle pas par-dessus une pause ni ne laisse un blanc après une réponse terminée.
- Transcription : l'appel est transcrit en temps réel, avec une reconnaissance vocale en flux.
- Ligne : les signaux de qualité audio et de latence sont suivis numéro par numéro, pour repérer tôt une ligne qui se dégrade.
- Phrase d'attente : quand un outil ou un modèle met plus de temps, une courte formule d'attente naturelle, tirée du répertoire validé par DRING, fait avancer le tour de parole. Chez DRING, la phrase d'attente prend la forme de cette formule, qui ne s'insère jamais dans une excuse, un chiffre ou la conclusion.
Notre page moteur vocal montre comment reconnaissance vocale, prise de parole et synthèse vocale forment une seule chaîne, et notre page téléphonie traite de l'état des lignes.
Chaque agent DRING passe par 1 000 à 10 000 conversations simulées, conçues pour votre entreprise, avant le premier appel réel. Les simulations testent la prise de parole et les phrases d'attente avant le lancement. Elles ne mesurent pas la Ligne des appels réels : celle-ci se mesure par des appels de test sur les réseaux de vos appelants.
Si, sur votre ligne, des appelants disent « Allô ? » dans les silences, demandez un rappel. Préparez quelques-uns de ces appels, avec les enregistrements si votre politique interne le permet. Notre équipe peut passer en revue avec vous les tours les plus lents, composante par composante.
Trouvez la composante qui fait attendre vos appelants
Laissez votre numéro : DRING vous rappelle en deux minutes. Dites-lui quelle ligne connaît de longs silences, et notre équipe revient vers vous pour examiner ensemble les tours les plus lents.