Ir al contenido
Comparta un proceso. DRING le llama en dos minutos y cualifica la necesidad. Le llamamos en dos minutos
Le llamamos en 2 minutos Ver Agent Factory
Núcleo de voz a voz

Escucha, decide y responde.

El reconocimiento de voz en streaming, el cerebro del agente, los turnos de palabra y la síntesis de voz funcionan como una sola cadena detrás de cada llamada, probada e intercambiable sin ralentizar la conversación.

Un turno, de principio a fin

La misma cadena, en cada llamada

Los canales entran por la izquierda, el núcleo de voz responde en el centro con la memoria y las herramientas a mano, y el resultado sale por la derecha. Todo el recorrido se prueba y se supervisa versión tras versión.

CANALES LlamadasPSTN · SIP WhatsAppChat de empresa EmailConfirmaciones NÚCLEO DE VOZ A VOZ Memoria Herramientas STTEntra la voz LLMCerebro del agente TTSSale la voz Audio en tiempo real Límites de seguridadPolítica comprobada en directo Agent Factory Mejora en cada versión RESULTADOS Registro de resultadoCada llamada, puntuada ProcesosWebhook · CRM Sus sistemasInformes CLIENTE EMPLEADO DE IA Todos los canales Un solo cerebro Cada llamada, puntuada TEST VERSIÓN MONITORIZAR

Ver cómo se prueba una versión antes de entrar en este recorrido

Dentro del núcleo

Lo que hace de verdad el núcleo de voz

Cada intervención de quien llama recorre cinco pasos, de la línea a la respuesta. En los cinco se cumplen dos garantías.

  1. Entra la llamada

    Las rutas SIP, de centralita virtual y de telefonía conectada llevan la llamada hasta el núcleo, y las reglas de llamada saliente se aplican antes de marcar un número.

    Ver la telefonía en detalle
  2. La voz se convierte en texto

    La llamada se transcribe en tiempo real y se corrige y normaliza antes de que el agente razone, así que un acento, una interrupción o una pausa a mitad de frase no distorsionan lo que se dijo.

  3. El agente razona

    Interpreta la intención con la memoria de turnos anteriores y de otros canales, comprueba los límites de seguridad y la política antes de hablar o actuar, y usa las herramientas que necesita durante la llamada.

  4. Los turnos fluyen con naturalidad

    Un modelo específico gestiona las interrupciones, para que quien llama pueda cortar al agente a mitad de frase, y la detección de fin de turno, para que el agente no hable encima de una pausa ni se quede esperando tras una respuesta ya terminada.

  5. El texto se convierte en voz

    Cada marca elige una voz seleccionada de la biblioteca, con un perfil de voz para el ritmo, la formalidad y el tono, corrección de acento y un diccionario de pronunciación para nombres, lugares y términos de producto.

En cada turno

Respuestas rápidas, sin silencios

Cuando una herramienta o un modelo tarda más de lo normal, una frase de espera breve y natural del repertorio aprobado por DRING mantiene vivo el turno.

  • Las respuestas mantienen un ritmo natural, sea cual sea el proveedor que haya detrás
  • Las frases de espera nunca aparecen en una disculpa, en una cifra ni en la despedida

Enrutamiento y redundancia de modelos

Los modelos de voz, de lenguaje y de síntesis se eligen por agente y por idioma, y un proceso puede pasar a otro modelo sin cambiar de plataforma.

  • Si un proveedor tiene un problema, la llamada puede conmutar a otro que funcione
  • Un servicio mejor solo entra en producción después de superar la batería de regresión por la que pasa todo el sistema
Ver la radiografía de operaciones
Compartido con el chat

El mismo cerebro, hablando o escribiendo

La voz no es un sistema aparte del chat. La memoria, los límites de seguridad y el registro de resultado que hay debajo son los mismos.

Una sola memoria

A quien se reconoce en una llamada se le reconoce también en un mensaje, y una conversación que empieza por teléfono puede seguir por WhatsApp sin que el cliente tenga que repetir nada.

Los mismos límites de seguridad

La defensa frente a prompts, la comprobación de hechos y el enmascaramiento de datos funcionan en una respuesta hablada exactamente igual que en una escrita, no con una versión rebajada de las reglas.

El mismo registro de resultado

Una llamada se cierra con el mismo registro estructurado que un chat: un resultado, una puntuación y los campos que definió su equipo, escritos en su CRM.

Ver el motor de chat que comparte este cerebro

Preguntas frecuentes

Preguntas sobre el núcleo de voz a voz.

¿El núcleo de voz comparte memoria y límites de seguridad con el chat?+

Sí. Una llamada y un mensaje sobre el mismo cliente comparten un único caso y una única memoria, y la defensa frente a prompts, la comprobación de hechos y el enmascaramiento de datos funcionan igual en ambos.

¿Qué pasa si una respuesta tarda en generarse?+

Una frase de espera breve y natural del repertorio aprobado por DRING mantiene vivo el turno mientras la respuesta termina de prepararse, nunca en una disculpa, en una cifra ni en la despedida.

¿Se pueden cambiar los modelos de reconocimiento y de síntesis de voz?+

Sí. Los proveedores de reconocimiento de voz, de lenguaje y de síntesis de voz se pueden cambiar por separado para cada agente y cada idioma, y un proceso puede pasar a otro modelo sin cambiar de plataforma.

¿Cómo sabe el agente cuándo ha terminado de hablar quien llama?+

De eso se encarga un modelo específico de turnos de palabra: quien llama puede interrumpir al agente a mitad de frase, y la detección de fin de turno le indica cuándo ha terminado de verdad, para que no hable encima de una pausa ni se quede esperando tras una respuesta completa.

¿De dónde salen las voces?+

De una biblioteca seleccionada, con voces elegidas por marca y por idioma, un perfil de voz que fija el ritmo, el grado de formalidad y el tono, corrección de acento aplicada a la voz y un diccionario de pronunciación para nombres, lugares y términos de producto.

Ver todas las preguntas

Vea el núcleo de voz en su propio flujo de llamadas

Envíe su caso con su consentimiento y DRING le llamará, se identificará y analizará con usted cómo gestionaría el núcleo de voz su línea con más volumen.