Zum Inhalt springen
Beschreiben Sie einen Workflow. DRING ruft in zwei Minuten an und qualifiziert den Bedarf. Anruf in zwei Minuten erhalten
Anruf in 2 Minuten Agent Factory ansehen
Speech Core

Zuhören, entscheiden, antworten.

Streaming-Spracherkennung, Agenten-Logik, Sprecherwechsel und Sprachausgabe laufen hinter jedem Anruf als eine Pipeline, getestet und austauschbar, ohne das Gespräch zu verlangsamen.

Ein Gesprächszug, komplett

Dieselbe Pipeline, bei jedem Anruf

Links kommen die Kanäle an, in der Mitte antwortet der Speech Core, mit Gedächtnis und Tools an seiner Seite, und rechts geht das Ergebnis hinaus. Der gesamte Weg wird Release für Release getestet und überwacht.

KANÄLE TelefonanrufePSTN · SIP WhatsAppBusiness-Chat EmailBestätigungen SPEECH-TO-SPEECH-KERN Gedächtnis Tools STTSpracheingang LLMAgent-Gehirn TTSSprachausgabe Live-Audiopfad LeitplankenRichtlinien live geprüft Agent Factory Mit jedem Release besser AUSGABEN ErgebnisdatensatzJeder Anruf bewertet WorkflowsWebhook · CRM Ihre SystemeReporting ANRUFER DRING KI-MITARBEITER Jeder Kanal Eine Agenten-Logik Jeder Anruf bewertet TEST RELEASE MONITORING

So wird ein Release getestet, bevor es live geht

Blick in den Kern

Was der Speech Core tatsächlich leistet

Jeder Gesprächszug des Anrufers durchläuft fünf Schritte, von der Leitung bis zur Antwort. Zwei Zusagen gelten in allen fünf Schritten.

  1. Der Anruf wird verbunden

    SIP, virtuelle Telefonanlage und angebundene Telefoniewege bringen den Anruf in den Speech Core. Die Regeln für ausgehende Anrufe greifen, bevor eine Nummer gewählt wird.

    Telefonie im Detail ansehen
  2. Aus Sprache wird Text

    Der Anruf wird in Echtzeit transkribiert, dann korrigiert und normalisiert, bevor der Agent damit arbeitet. So verfälschen ein Akzent, eine Unterbrechung oder eine Pause mitten im Satz nicht, was gesagt wurde.

  3. Der Agent denkt nach

    Er erkennt das Anliegen und erinnert sich dabei an frühere Gesprächszüge und andere Kanäle. Er prüft Leitplanken und Richtlinien, bevor er spricht oder handelt, und nutzt mitten im Anruf die Tools, die er braucht.

  4. Natürliche Sprecherwechsel

    Ein eigenes Modell steuert Barge-in, damit der Anrufer mitten im Satz unterbrechen kann, und erkennt das Ende eines Redebeitrags. So redet der Agent nicht in eine Pause hinein und schweigt nicht weiter, wenn der Anrufer längst fertig ist.

  5. Aus Text wird Stimme

    Jede Marke wählt eine kuratierte Stimme aus der Bibliothek, mit einer Persona für Tempo, Förmlichkeit und Ton, mit Akzentkorrektur und einem Aussprachewörterbuch für Namen, Orte und Produktbegriffe.

In jedem Gesprächszug

Schnelle Antworten, keine Stille

Braucht ein Tool oder Modell länger, hält ein kurzes, natürliches Füllwort aus dem freigegebenen Set von DRING den Gesprächszug in Gang.

  • Antworten behalten ihr natürliches Tempo, egal welcher Anbieter dahintersteht
  • Füllwörter kommen nie in einer Entschuldigung, einer Zahl oder der Verabschiedung vor

Modell-Routing und Failover

Modelle für Spracherkennung, Sprachverständnis und Stimme werden je Agent und je Sprache gewählt. Ein Workflow kann ohne Plattformwechsel auf ein anderes Modell umgeleitet werden.

  • Hat ein Anbieter ein Problem, kann der Anruf auf einen funktionierenden umschalten
  • Ein stärkerer Dienst geht erst live, wenn er die Regressionssuite besteht, die der gesamte Stack durchläuft
Betriebs-Benchmark ansehen
Gemeinsam mit Chat

Dieselbe Logik, gesprochen oder geschrieben

Telefon und Chat sind keine getrennten Systeme. Gedächtnis, Leitplanken und der Ergebnisdatensatz darunter sind dieselben.

Ein Gedächtnis

Wer im Anruf erkannt wird, wird auch in einer Nachricht erkannt. Ein Gespräch, das am Telefon beginnt, kann auf WhatsApp weitergehen, ohne dass der Kunde sich wiederholen muss.

Dieselben Leitplanken

Prompt-Abwehr, Faktenprüfung und Datenmaskierung laufen bei einer gesprochenen Antwort genauso wie bei einer geschriebenen, nicht in einer abgespeckten Version.

Derselbe Ergebnisdatensatz

Ein Anruf endet mit demselben strukturierten Datensatz wie ein Chat: ein Ergebnis, eine Bewertung und die Felder, die Ihr Team festgelegt hat, geschrieben in Ihr CRM.

Die Chat Engine mit derselben Logik ansehen

FAQ

Häufige Fragen zum Speech Core.

Teilt der Speech Core Gedächtnis und Leitplanken mit dem Chat?+

Ja. Ein Anruf und eine Nachricht zum selben Kunden teilen sich einen Vorgang und ein Gedächtnis, und Prompt-Abwehr, Faktenprüfung und Datenmaskierung laufen auf beiden Kanälen gleich.

Was passiert, wenn eine Antwort länger braucht?+

Ein kurzes, natürliches Füllwort aus dem freigegebenen DRING Set hält den Gesprächszug in Gang, während die Antwort im Hintergrund fertig wird, nie in einer Entschuldigung, einer Zahl oder der Verabschiedung.

Lassen sich die Modelle für Spracherkennung und Sprachausgabe wechseln?+

Ja. Anbieter für Spracherkennung, Sprachmodell und Sprachausgabe lassen sich jeweils je Agent und je Sprache austauschen, und ein Workflow kann ohne Plattformwechsel auf ein anderes Modell umgeleitet werden.

Woran erkennt der Agent, dass ein Anrufer fertig gesprochen hat?+

Das übernimmt ein eigenes Sprecherwechsel-Modell: Mit Barge-in kann der Anrufer mitten im Satz unterbrechen, und die Erkennung des Sprecherwechsels zeigt dem Agenten, wann der Anrufer wirklich fertig ist. So redet er nicht in eine Pause hinein und wartet nicht untätig, obwohl die Antwort schon abgeschlossen ist.

Woher kommen die Stimmen?+

Aus einer kuratierten Bibliothek, ausgewählt je Marke und je Sprache, mit einer Persona für Tempo, Förmlichkeit und Ton, einer Akzentkorrektur an der Stimme und einem Aussprachewörterbuch für Namen, Orte und Produktbegriffe.

Alle FAQ anzeigen

Den Speech Core an Ihrem eigenen Anrufablauf sehen

Übermitteln Sie Ihren Kontext mit Einwilligung. DRING ruft an, gibt sich zu erkennen und klärt, wie der Speech Core Ihre meistgenutzte Leitung bewältigen würde.