Por qué su agente de IA tarda en responder
El silencio que se hace cuando quien llama deja de hablar es la suma de seis partes. Mida cada turno, analice los más lentos y corrija la parte que más tiempo se lleva.
La respuesta corta
Cuando quien llama deja de hablar y al otro lado no se oye nada, ese silencio rara vez se debe a una sola cosa lenta. Es la suma de seis partes: Fin de turno, Transcripción, Modelo, Consulta, Inicio de voz y Línea. La Consulta solo aparece en los turnos con consulta, cuando el agente comprueba algo en un sistema, como el estado de un pedido. Todos los demás turnos son turnos sin consulta.
En esta guía, a ese silencio lo llamamos pausa de respuesta: va desde que quien llama deja de hablar hasta el primer sonido del agente, tal como lo oye el cliente. La media de la pausa de respuesta esconde los turnos que el cliente recuerda. Así que mida cada turno, separe los turnos sin consulta de los turnos con consulta y fíjese en la mediana y en el percentil 90.
Después, busque la parte más larga en cada uno de los turnos más lentos. La parte que más veces resulta ser la más larga es lo primero que hay que corregir. Cambie una sola parte cada vez y vigile la señal contraria: un agente que espera menos antes de responder puede empezar a cortar a quien llama. Cuando una espera es inevitable, un aviso hablado adelanta el primer sonido que oye quien llama. La respuesta, en cambio, no llega antes.
No copie un objetivo numérico de ningún sitio. Busque la duración de la pausa a partir de la cual sus propios clientes empiezan a decir «¿Oiga?» en mitad del silencio. Ese es su umbral.
Nuestro artículo sobre dónde cuelgan los clientes en las llamadas con IA localiza la etapa en la que se va la gente. Esta guía baja un nivel más: por qué el silencio es largo y qué parte hay que corregir. Todas las cifras que siguen son un ejemplo, no datos de DRING ni del sector.
Las seis partes de una pausa de respuesta
Entre la última palabra de quien llama y el primer sonido del agente, el tiempo se reparte en seis partes. Esta guía las presenta siempre en este orden:
| Parte | Qué ocurre | Qué suele alargarla | Cómo se mide |
|---|---|---|---|
| Fin de turno | El sistema decide que quien llama ha terminado. | Espera un silencio largo antes de decidirlo. | Desde el final de la voz de quien llama en su grabación hasta la decisión del sistema |
| Transcripción | El reconocimiento de voz entrega el texto definitivo. | El texto definitivo solo llega cuando se ha procesado la frase entera. | Desde la decisión hasta el texto definitivo |
| Modelo | El modelo decide qué hacer y redacta la respuesta. | Una primera frase larga, un prompt muy extenso, una larga cadena de razonamiento antes de hablar. | Desde el texto definitivo hasta la respuesta. En un turno con consulta, dos tramos: hasta la petición de la Consulta, y desde su resultado hasta la respuesta |
| Consulta | Una comprobación en un sistema, como el estado de un pedido. Solo en los turnos con consulta. | Un sistema lento, comprobaciones que se hacen una detrás de otra, sin límite de tiempo. | Desde la petición hasta la respuesta del sistema |
| Inicio de voz | La voz genera el primer audio de la respuesta. | La voz espera a tener todo el texto de la respuesta antes de empezar. | Desde que el texto de la respuesta llega a la voz hasta que el primer audio sale de su sistema |
| Línea | La telefonía y la red llevan el audio en los dos sentidos. | Rutas de llamada largas, regiones lejanas, redes móviles con poca cobertura. | Llamadas de prueba desde teléfonos normales, grabadas del lado de quien llama |
Dos de las partes se dividen en dos tramos. En un turno con consulta, el modelo trabaja antes de la Consulta, para decidir qué comprobar, y después, para formular la respuesta. Los dos tramos cuentan como Modelo. La Línea tiene dos tramos en todos los turnos: el trayecto de la voz de quien llama hasta su sistema y el de la voz del agente hasta quien llama. Los dos tramos cuentan como Línea.
Cómo medir cada turno
Mida turnos, no llamadas: en la media de una llamada, un turno con consulta lento puede quedar escondido entre siete rápidos. Registre cada turno en una fila con los mismos campos. Los valores de ejemplo son los del turno lento que aparece más adelante en esta guía. Ejemplo, no datos reales.
| Campo | Qué contiene | Valor de ejemplo |
|---|---|---|
| ID de llamada | Un único ID que comparten la grabación de la llamada y los logs del sistema | C1047 |
| Número de turno | La posición de la respuesta del agente en la llamada | 4 |
| Tipo de turno | Turno sin consulta o turno con consulta | Turno con consulta |
| Pausa de respuesta | Desde la última palabra de quien llama hasta el primer sonido del agente, con la Línea incluida | 3,9 s |
| Fin de turno | Su grabación y las marcas de tiempo del sistema | 0,7 s |
| Transcripción | Marcas de tiempo del sistema | 0,2 s |
| Modelo | Marcas de tiempo del sistema, los dos tramos en un turno con consulta | 0,6 s (0,3 s antes y 0,3 s después de la Consulta) |
| Consulta | Marcas de tiempo del sistema, vacío en un turno sin consulta | 1,9 s |
| Inicio de voz | Marcas de tiempo del sistema | 0,3 s |
| Línea | Llamadas de prueba en las redes que usan sus clientes | 0,2 s |
| Tiempo sin explicar | La pausa de respuesta en la grabación de su sistema, menos las partes que registra | 0,0 s |
| Quien llama habló en la pausa | Sí, si durante la pausa quien llama dijo «¿Oiga?» o repitió lo que había dicho | Sí |
| Corte | Sí, si el agente empezó a responder cuando quien llama aún estaba hablando o solo se había parado un momento | No |
| Tarea completada | Por llamada: sí, si quien llama consiguió lo que buscaba | Sí |
Mida primero la pausa de respuesta en la grabación de la llamada que guarda su sistema. El ID de llamada compartido relaciona cada turno de la grabación con sus marcas de tiempo del sistema, que le dan el Fin de turno, la Transcripción, el Modelo, la Consulta y el Inicio de voz. La Línea se suma en el paso siguiente.
La Línea no aparece en su grabación. En su sistema, el reloj arranca cuando le llega el audio de quien llama y se para cuando sale el suyo. Por eso, haga llamadas de prueba desde teléfonos normales, en las redes que usan sus clientes, y grábelas del lado de quien llama. La pausa en esa grabación, menos la pausa del mismo turno en la grabación de su sistema, es la Línea. Súmela a las pausas de sus llamadas reales.
Después, compruebe la suma. El tiempo sin explicar es la pausa de respuesta en la grabación de su sistema menos las partes que registra. Si es grande, falta alguna marca de tiempo. En el turno de ejemplo, la grabación de su sistema muestra 3,7 segundos y las partes registradas suman 3,7 segundos, así que el tiempo sin explicar es cero. Sume los 0,2 segundos de la Línea y quien llama oye 3,9 segundos.
Por qué la media esconde el problema
Ejemplo, no datos reales: 400 turnos del agente en 50 llamadas grabadas en una misma línea, 300 turnos sin consulta y 100 turnos con consulta. Todas las pausas incluyen la Línea, 0,2 segundos según las llamadas de prueba.
| Tipo de turno | Turnos | Mediana | Media | Percentil 90 |
|---|---|---|---|---|
| Turnos sin consulta | 300 | 1,1 s | 1,2 s | 1,8 s |
| Turnos con consulta | 100 | 2,9 s | 3,2 s | 4,6 s |
| Todos los turnos | 400 | 1,3 s | 1,7 s | 3,4 s |
La media de todos los turnos, 1,7 segundos, queda por encima de la mediana, 1,3 segundos, porque los turnos lentos tiran de ella hacia arriba. Ninguna de las dos cifras muestra los turnos que recuerda quien llama. El percentil 90 (p90) sí: es la pausa que alcanza o supera uno de cada diez turnos, aquí 3,4 segundos. Los turnos que llegan a esa cifra o la superan son los turnos más lentos.
Separe también por tipo de turno. Los turnos sin consulta tienen una mediana de 1,1 segundos, y los turnos con consulta, de 2,9 segundos. Una semana con más turnos con consulta sube las cifras del conjunto de los turnos, aunque ninguna parte se haya vuelto más lenta.
Ahora reparta esos mismos 400 turnos en cuatro franjas según la pausa de respuesta: 130 turnos de menos de 1,0 segundos, 180 de 1,0 a 2,0 segundos, 50 de 2,0 a 3,4 segundos y 40 de 3,4 segundos o más. Después, marque los turnos en los que quien llama habló en la pausa: dijo «¿Oiga?» o repitió lo que había dicho. Ocurrió en 31 de los 40 turnos más lentos y en 7 de los otros 360: 3 veces en los 310 turnos por debajo de 2,0 segundos y 4 veces en los 50 turnos de 2,0 a 3,4 segundos.
Por tanto, en esta línea, hablar en la pausa es raro por debajo de 2,0 segundos, todavía poco frecuente de 2,0 a 3,4 segundos y habitual a partir de 3,4 segundos. El umbral de esta línea está cerca de 3,4 segundos, y no es un objetivo general. Busque el suyo de la misma manera: reparta sus propios turnos en franjas y fíjese en qué punto hablar en la pausa deja de ser raro y pasa a ser habitual. Con franjas más finas alrededor de ese punto, lo situará con más precisión.
Busque la parte más larga en los turnos más lentos
El percentil 90 muestra lo lentos que son los turnos más lentos, no por qué. Para eso, abra cada turno lento y busque su parte más larga: la parte que más tiempo se llevó en ese turno.
Ejemplo, no datos reales: uno de los 40 turnos más lentos. Quien llama pregunta por el estado de un pedido, así que es un turno con consulta. El reloj arranca en el momento en que quien llama deja de hablar, tal como se oye del lado de quien llama.
Por partes: Fin de turno 0,7 segundos, Transcripción 0,2 segundos, Modelo 0,6 segundos, Consulta 1,9 segundos, Inicio de voz 0,3 segundos y Línea 0,2 segundos. El Modelo se divide en dos tramos de 0,3 segundos: uno para decidir que hay que consultar el pedido y otro para formular la respuesta. La Línea suma 0,1 segundos en cada sentido. En total, las partes dan una pausa de respuesta de 3,9 segundos. La Consulta es la parte más larga: casi la mitad de la pausa.
Los tiempos de las partes solo se suman así dentro de un mismo turno. Las medianas y los percentiles 90 no: las medianas de las seis partes, sumadas, no dan la mediana de la pausa de respuesta. Por eso, busque la parte más larga turno a turno y después haga el recuento.
Ejemplo, no datos reales: la parte más larga en cada uno de los 40 turnos más lentos.
| Parte más larga | Turnos más lentos |
|---|---|
| Fin de turno | 8 |
| Transcripción | 0 |
| Modelo | 5 |
| Consulta | 27 |
| Inicio de voz | 0 |
| Línea | 0 |
| Total | 40 |
La Consulta es la parte más larga con más frecuencia, en 27 de los 40. Encaja con los tipos de turno: 36 de los turnos más lentos son turnos con consulta y 4 son turnos sin consulta. El Fin de turno es la parte más larga en 8. En la mayoría de ellos, quien llama se detuvo un momento mientras dictaba un número, y el sistema esperó más antes de decidir que había terminado. El Modelo es la parte más larga en 5.
Aquí la Línea nunca es la parte más larga, porque en esta línea se mantiene estable en 0,2 segundos. En otra línea podría serlo. Nuestro artículo sobre buenas demos y malas llamadas reales propone una prueba rápida. Las pausas en todos los turnos apuntan a la línea. Las pausas solo en los turnos con consulta apuntan a las herramientas.
Corrija una parte cada vez y vigile la señal contraria
Empiece por la parte que con más frecuencia es la más larga en sus turnos más lentos, aquí la Consulta. Cambie una sola cosa y vuelva a medir los mismos tipos de turno. Con dos cambios a la vez, no sabrá cuál de los dos movió el percentil 90.
Cada corrección tiene un coste, así que cada fila indica también la señal que hay que vigilar:
| Parte | Qué probar | Qué vigilar |
|---|---|---|
| Fin de turno | Una espera que depende de lo que dice quien llama: más corta tras respuestas breves, como sí, no o un nombre, y más larga mientras quien llama dicta un número o deletrea una palabra. | Cortes |
| Transcripción | Reconocimiento de voz en streaming, para que la mayor parte del texto esté lista cuando termina el turno. | Palabras y números mal entendidos |
| Modelo | Una primera frase corta. Un esquema de respuesta sencillo para las preguntas habituales. | Calidad y completitud de las respuestas |
| Consulta | Comprobaciones independientes en paralelo. Un límite de tiempo con una salida: pasar la llamada a una persona u ofrecer una llamada de vuelta. Un aviso hablado antes de la comprobación. | Respuestas desactualizadas o incompletas. Avisos hablados repetidos en cada turno. |
| Inicio de voz | La voz arranca con la primera frase mientras se redacta el resto. | Silencios poco naturales en mitad de una respuesta |
| Línea | Llamadas de prueba desde las redes que usan sus clientes. Una revisión de la ruta con su proveedor de telefonía. | La calidad del audio, no solo el retraso |
Cada fila recoge opciones. Pruebe una, mida y después decida la siguiente.
El precio de un Fin de turno más corto: los cortes
Un corte es el fallo opuesto a una pausa larga: el agente empieza a responder cuando quien llama aún está hablando o solo se ha parado un momento. Ejemplo, no datos reales: en esos mismos 400 turnos hubo 6 cortes, 5 de ellos mientras quien llama dictaba un número de pedido o de teléfono. Detrás de los dos fallos está el dictado de números: el Fin de turno fue la parte más larga en 8 de los turnos más lentos, y en la mayoría de ellos quien llama también estaba dictando un número. Si acorta la espera en todos los turnos, cuente con más cortes. Por eso la fila del Fin de turno tiene dos esperas. Aun así, esperar más durante un número no hace más rápidos esos 8 turnos lentos. Lo que ayuda ahí es una señal de que el número está completo: si el sistema sabe que un número de pedido tiene cinco dígitos, puede dar el turno por terminado tras el quinto dígito en lugar de esperar al silencio.
Cuando la espera es inevitable: un aviso hablado
Algunas consultas siguen siendo lentas, y no siempre está en su mano cambiar el sistema que hay detrás. En ese caso, dé a quien llama un primer sonido antes de la Consulta: un aviso hablado, una frase breve antes de un paso lento. En el turno lento de antes, llegaría justo después del primer tramo del Modelo:
- Cliente: «Es el pedido 4 8 1 7 2».
- Agente, antes de la Consulta: «Gracias, ahora mismo lo compruebo».
- Agente, después de la Consulta: «Su pedido ya está en camino y le llega el jueves».
La pausa de respuesta se acorta, porque el primer sonido llega ahora antes de la Consulta. El tiempo hasta la respuesta va desde que quien llama deja de hablar hasta que empieza la respuesta propiamente dicha. Ese tiempo se queda más o menos igual, porque la respuesta sigue esperando a la Consulta. En estos turnos, registre también el tiempo hasta la respuesta, para que un aviso no pueda esconder una Consulta cada vez más lenta.
Mantenga breves los avisos hablados y úselos solo antes de un paso lento, nunca en una disculpa, en una cifra ni en la despedida. Un aviso en cada turno también tiene un coste: quien llama oye la misma frase una y otra vez.
Qué revisar cada semana
Cada semana, revise tres señales por separado para los turnos sin consulta y los turnos con consulta:
- Pausa de respuesta: la mediana y el percentil 90 y, en los turnos con aviso hablado, también el tiempo hasta la respuesta.
- Quien llama habló en la pausa: el porcentaje de turnos en los que ocurrió.
- Cortes: cuántos hubo y qué estaba diciendo quien llama en ese momento.
Revise una cuarta señal por llamada: si la tarea se completó. Una pausa más corta vale de poco si menos llamadas completan su tarea. Si tiene un piloto en marcha, cuente una tarea como completada según la definición de llamada resuelta de su ficha del piloto.
Compare los mismos tipos de turno antes y después de cada cambio. Un porcentaje medido sobre unos pocos cientos de turnos puede moverse por azar. Nuestro artículo sobre criterios de éxito de un piloto de IA de voz explica cómo calcular el margen de una tasa.
Dónde encaja DRING
Los modelos seleccionados de reconocimiento de voz, síntesis de voz y razonamiento, la telefonía, y las pruebas y la monitorización forman parte de la base común de todos los planes de DRING. En DRING, tres de las seis partes y el aviso hablado funcionan así:
- Fin de turno: un modelo específico gestiona las interrupciones y la detección de fin de turno, para que el agente no hable encima de una pausa ni se quede esperando tras una respuesta ya terminada.
- Transcripción: la llamada se transcribe en tiempo real, con reconocimiento de voz en streaming.
- Línea: las señales de calidad de audio y latencia se controlan por número, para detectar pronto una línea que se degrada.
- Aviso hablado: cuando una herramienta o un modelo tarda más de lo normal, una frase de espera breve y natural del repertorio aprobado por DRING mantiene vivo el turno. La frase de espera es la forma que tiene DRING de dar el aviso hablado, y nunca aparece en una disculpa, en una cifra ni en la despedida.
Nuestra página sobre el núcleo de voz a voz muestra cómo el reconocimiento de voz, los turnos de palabra y la síntesis de voz funcionan como una sola cadena, y nuestra página de telefonía trata el estado de la línea.
Cada agente de DRING pasa por entre 1.000 y 10.000 conversaciones simuladas, creadas para su empresa, antes de la primera llamada real. Las simulaciones ponen a prueba los turnos de palabra y los avisos hablados antes del lanzamiento. No miden la Línea de las llamadas reales. La Línea sale de las llamadas de prueba en las redes de sus clientes.
Si en su línea los clientes dicen «¿Oiga?» en mitad de los silencios, solicite una llamada. Tenga a mano algunas de esas llamadas, con grabaciones si su política lo permite. Nuestro equipo puede revisar con usted los turnos más lentos, parte por parte.
Encuentre la parte que hace esperar a sus clientes
Deje su número y DRING le llama en dos minutos. Dígale qué línea tiene silencios largos, y nuestro equipo se pondrá después en contacto con usted para revisar juntos los turnos más lentos.