Zum Inhalt springen
Beschreiben Sie einen Workflow. DRING ruft in zwei Minuten an und qualifiziert den Bedarf. Anruf in zwei Minuten erhalten
Anruf in 2 Minuten Agent Factory ansehen
Voice-KI im Betrieb · Diagnose von Live-Anrufen

Demo gut, live schwach: Wo liegt die Bruchstelle?

Ihr Voice-Agent hat jede Demo bestanden, tut sich bei echten Anrufen aber schwer. Die gescheiterten Anrufe selbst zeigen, welche Ebene versagt und was Sie zuerst beheben sollten.

Die kurze Antwort

Ein Voice-Agent, der die Demo besteht und bei Live-Anrufen scheitert, ist nicht plötzlich schlechter geworden. Live-Anrufe durchlaufen dieselben sieben Ebenen wie die Demo, von Audio und Telefonie über die Spracherkennung bis zu Tools, Übergabe und Messung. Die Demo hat nur die Ebene nie geprüft, die jetzt unter echten Bedingungen versagt.

Schreiben Sie deshalb nicht als Erstes den Prompt um. Nehmen Sie die echten gescheiterten Anrufe, führen Sie jeden der Reihe nach durch die Ebenen und ordnen Sie ihn der ersten Ebene zu, die versagt hat. Die Ebene mit den meisten Anrufen ist Ihre Schwachstelle, und dort setzt die erste Korrektur an. Setzen Sie genau diese eine Korrektur um, spielen Sie dieselben Anrufe erneut durch und vergleichen Sie.

Dieser Artikel gilt für einen Voice-Agent, der bereits live telefoniert. Ist er noch nicht live, beginnen Sie mit unserem Leitfaden zum Testen eines Voice-Agents vor dem Produktivbetrieb.

Warum die Demo gelungen ist

Eine Demo ist ein freundlicher Test. Der Anrufer kennt das Skript, spricht deutlich in einem ruhigen Raum und wartet, bis der Agent ausgeredet hat. Der Testdatensatz ist sauber: Die Bestellung existiert, und der Termin ist frei.

Echte Anrufer fallen ins Wort. Sie rufen aus dem Auto oder aus dem Lager an, benutzen regionale Ausdrücke und Abkürzungen und fragen nach angrenzenden Themen, für die der Ablauf nicht ausgelegt ist. Manchmal sind sie nicht die Person, mit der der Ablauf rechnet: Die Buchhaltung meldet sich statt des Inhabers, ein Angehöriger geht ans Telefon, oder der Anruf erreicht eine andere Abteilung.

Jede dieser Bedingungen prüft eine andere Ebene. Eine gute Demo zeigt, dass die Ebenen bei sauberen Eingaben halten. Sie zeigt nicht, welche Ebene bei echtem Anrufaufkommen zuerst versagt.

Die sieben Ebenen, die jeder Anruf durchläuft

Jeder Anruf durchläuft dieselben Ebenen in derselben Reihenfolge. Ein Bruch in einer frühen Ebene erzeugt Symptome in den späteren. Symptome allein führen deshalb oft an die falsche Stelle.

  • Audio und Telefonie: Der Anruf kommt zustande, der Ton läuft ohne Verzögerung und Echo in beide Richtungen, und das Gespräch endet sauber.
  • Spracherkennung: Was der Anrufer sagt, wird zu Text.
  • Wissen: die Fakten, die der Agent nutzen kann, etwa Richtlinien, Produktangaben und Antworten auf häufige Fragen.
  • Entscheidung: die Gesprächslogik, also was der Agent als Nächstes sagt oder fragt, wann er bestätigt, wann er übergibt und wie er das Gespräch beendet.
  • Tools und Systemaktionen: Abfragen und Schreibvorgänge im CRM, im Buchungs- oder im Ticketsystem.
  • Übergabe an Menschen: die Weiterleitung oder der Rückruf und der Kontext, den die übernehmende Person in Ihrem Team erhält.
  • Messung: Das erfasste Ergebnis entspricht dem, was tatsächlich passiert ist.

Dazu kommt eine Station, die keine KI-Ebene ist. Manche Anrufe scheitern auf Unternehmensseite: Die Ware ist nicht vorrätig, kein Termin ist frei, oder die Daten im eigenen System sind veraltet. Der Agent hat seine Arbeit gemacht, aber das Unternehmen konnte nicht liefern. Zählen Sie diese Anrufe getrennt und geben Sie sie an die Person, die für diesen Prozess zuständig ist.

Jeder Anruf durchläuft die sieben Ebenen der Reihe nach. Ein gescheiterter Anruf wird nur einmal gezählt, an seiner ersten Bruchstelle. Verluste auf Unternehmensseite werden getrennt gezählt.

Bei echten Anrufern beginnen, nicht bei der Testliste

Nehmen Sie alle echten Anrufe aus einem aktuellen Zeitraum, nicht die Szenarien aus Ihrer Testliste. Entfernen Sie dann interne Testanrufe: dieselbe Nummer und dieselben einstudierten Sätze, im Abstand von wenigen Minuten wiederholt. Wer testet, spricht nicht wie ein echter Anrufer.

Prüfen Sie als Nächstes an einer Stichprobe, ob die Ergebnisse richtig erfasst sind. Zählen Anrufe, die an eine Mailbox gingen, als Gespräche oder abgeschlossene Buchungen als gescheitert, stimmt schon die Liste der gescheiterten Anrufe nicht. Die Messung ist die letzte Ebene, aber die erste, die Sie prüfen.

Hören Sie sich zum Schluss die Aufzeichnungen an. Das Transkript zeigt, was die Spracherkennung gehört hat. Was der Anrufer gesagt hat, zeigt nur die Aufzeichnung.

Diagnosetabelle: vom Symptom zur Ebene

Nutzen Sie die Tabelle für jeweils einen gescheiterten Anruf, und suchen Sie den Beleg, bevor Sie die Ebene zuordnen.

SymptomWahrscheinliche EbeneWas Sie prüfenWoran Sie es erkennen
Outbound-Anrufe enden in den ersten SekundenAudio und TelefonieZeit vom Abheben bis zum ersten Wort des AgentenDie Angerufenen legen nach einer stillen Pause auf, bevor der Agent spricht. Legen sie während des Eröffnungssatzes auf, deutet das auf die Entscheidungsebene.
Lange Stille, nachdem der Anrufer zu Ende gesprochen hatAudio und Telefonie oder ToolsDie Pause vor jeder Antwort des AgentenPausen vor jeder Antwort deuten auf Audio und Telefonie. Pausen nur vor Antworten mit einer Abfrage deuten auf die Tools.
Der Agent bricht mitten im Satz ab, obwohl niemand gesprochen hatAudio und TelefonieJeder Abbruch, abgeglichen mit der AufzeichnungEr bricht bei Verkehrslärm, Maschinengeräuschen oder seinem eigenen Echo ab.
Anrufer wiederholen sichSpracherkennungDas Transkript des ersten Versuchs, abgeglichen mit der AufzeichnungAuf der Aufzeichnung ist die Sprache klar, aber das Transkript ist falsch oder leer.
Der Agent beantwortet eine Frage, die niemand gestellt hatSpracherkennungDer erkannte Text, abgeglichen mit der Frage, die der Agent gerade gestellt hatteIm Transkript steht ein Satz, den der Anrufer nie gesagt hat, und der Agent hat darauf geantwortet. Ist das Transkript korrekt, deutet das auf die Entscheidungsebene.
Namen, Produktcodes oder Adressen werden falsch erfasstSpracherkennungDieselben Begriffe über viele Anrufe hinwegDieselben falschen Schreibweisen tauchen bei verschiedenen Anrufern immer wieder auf.
Eine Antwort, die sicher klingt, aber falsch oder veraltet istWissenDie Quelle hinter der Antwort und ihr StandDas Material des Agenten selbst ist falsch oder veraltet. Veraltete Daten in Ihrem eigenen System gehören zur Unternehmensseite.
„Dazu liegen mir keine Informationen vor“ bei einer häufigen FrageWissenOb das Thema im Material des Agenten vorkommtDie Frage kommt in echten Anrufen häufig vor und fehlt im Material.
Der Agent fragt erneut nach Angaben, die der Anrufer schon gemacht hatEntscheidungDie Stelle, an der der Anrufer geantwortet hatDas Transkript ist korrekt, und die nächste Antwort des Agenten ignoriert die Angabe.
Die falsche Person ist am Telefon, und das Skript läuft weiterEntscheidungWie der Ablauf mit der Buchhaltung, einem Angehörigen oder einer anderen Abteilung umgehtDer Agent stellt weiter Fragen, die diese Person nicht beantworten kann, statt zu fragen, mit wem er sprechen sollte.
Der Agent sagt, er habe gebucht, aber im CRM erscheint nichtsTools und SystemaktionenDas Tool-Protokoll zu dieser Stelle: Anfrage, Antwort, Datensatz-IDZurück kam ein Fehler oder keine Datensatz-ID, und der Agent hat trotzdem bestätigt. Wurde gar keine Anfrage gesendet, deutet das auf die Entscheidungsebene.
Nach einer Weiterleitung bittet Ihr Team den Anrufer, von vorn zu beginnenÜbergabe an MenschenWas die übernehmende Person im Moment der Weiterleitung gesehen hatDie Zusammenfassung fehlte oder kam erst an, nachdem die Person den Anruf angenommen hatte.
Anrufer werden am Ende des Gesprächs abrupt getrenntEntscheidungWer das Gespräch beendet hat und der letzte Satz des AnrufersDer Agent hat aufgelegt, bevor der Anrufer sich verabschiedet hat. Hat keine Seite das Gespräch beendet, deutet das auf Audio und Telefonie.
Im Dashboard steht „gelöst“, die Beschwerden sagen etwas anderesMessungEine Stichprobe der als gelöst markierten Anrufe, abgeglichen mit der ErgebnisdefinitionDiese Anrufe haben das vereinbarte Ergebnis nicht erreicht, oder sie gingen an eine Mailbox.

Jeden gescheiterten Anruf nur einmal zählen, an seiner ersten Bruchstelle

So werten wir bei DRING gescheiterte Anrufe aus. Jeder gescheiterte Anruf durchläuft die Ebenen der Reihe nach und bekommt genau eine Zuordnung: die erste Ebene, die versagt hat. Ein falsch verstandener Satz, der zu einer falschen Antwort und dann zu einer gescheiterten Buchung führt, ist eine Bruchstelle in der Spracherkennung, nicht drei Probleme.

Mit einem Wert pro Anruf ergeben die Zahlen zusammen die Gesamtzahl der gescheiterten Anrufe. Die größte Zahl zeigt, wo eine einzige Korrektur die meisten Anrufe retten kann.

Verbreitet ist ein anderer Ansatz: jedes Symptom markieren, wo immer es auftritt. So gezählt, erhielten die 200 gescheiterten Anrufe im Beispiel unten 355 Markierungen. Die meisten davon, 104, entfielen auf die Entscheidungsebene, weil ein falsch verstandener Satz meist auch die nächste Antwort falsch macht. Erste Bruchstelle war die Entscheidungsebene aber nur in 40 Anrufen. Symptom-Markierungen überschneiden sich, ihre Summe passt nicht zur Zahl der gescheiterten Anrufe, und sie lassen jede Ebene dringend erscheinen. Zeigen Sie sie bei Bedarf getrennt, aber legen Sie die Reihenfolge der Korrekturen nach den ersten Bruchstellen fest.

Die Zahlen in diesem Abschnitt sind ein Beispiel für diesen Artikel, keine Daten aus einem echten Einsatz.

Erste Ebene, die versagt hatGescheiterte AnrufeAnteil
Spracherkennung6231 %
Entscheidung4020 %
Tools und Systemaktionen2412 %
Unternehmensseite, kein KI-Fehler2211 %
Audio und Telefonie189 %
Wissen147 %
Übergabe an Menschen126 %
Messung84 %
Gesamt200100 %
Beispiel, keine Daten aus einem echten Einsatz: dieselben 200 gescheiterten Anrufe, auf zwei Arten gezählt. Die Symptom-Markierungen ergeben zusammen 355 und setzen die Entscheidungsebene an die Spitze. Die ersten Bruchstellen ergeben zusammen 200 und setzen die Spracherkennung mit 62 Anrufen auf Platz eins.

In diesem Beispiel setzen Sie zuerst bei der Spracherkennung an: Sie ist in 62 von 200 Anrufen die erste Bruchstelle. Die 22 Anrufe mit Ursache auf Unternehmensseite sind kein KI-Fehler. Keine Änderung am Agenten schafft einen freien Termin oder korrigiert eine veraltete Preisliste in Ihrem eigenen System.

Fehler der Spracherkennung beheben Sie meist in der Entscheidungsebene

Die erste Bruchstelle zeigt, wo ein Anruf aus der Spur geraten ist, aber nicht immer, wo die Korrektur ansetzt. Am Telefon lassen sich viele Erkennungsfehler nicht in der Spracherkennung selbst beheben: Der Ton ist komprimiert, und ein Gabelstapler kann lauter sein als die Stimme. Das Gespräch muss auch dann richtig weiterlaufen, wenn der Text falsch ist. Diese Arbeit geschieht in der Entscheidungsebene:

  • Nicht auf Sätze antworten, die nicht passen. Passt der erkannte Text nicht zur Frage, die der Agent gerade gestellt hat, handelt der Agent nicht danach und eröffnet auch kein neues Thema. Er sagt, dass er das nicht verstanden hat, und fragt noch einmal nach.
  • Eine Liste bekannter Verhörer führen. Wörter, die die Spracherkennung in echten Anrufen falsch erkennt, kommen auf eine Liste. Der Agent bestätigt sie mit einer Rückfrage, statt zu raten.
  • Systemdaten nutzen. Ist die Bestellung oder der Datensatz schon bekannt, liest der Agent die Angaben vor und fragt: „Geht es um diese hier?“
  • Zuletzt eine Begriffsliste ergänzen. Eine Liste mit Namen und Produktbegriffen ist eine günstige Einstellung in der Spracherkennung, kommt aber erst nach den drei Schritten oben.

Ein für diesen Artikel geschriebenes Beispiel, kein echter Anruf: ein falsch verstandener Satz, auf zwei Arten behandelt.

SchrittWas gesagt wird
Agent„Ihre Bestellung kommt am Donnerstag zwischen 9 und 12 Uhr. Passt Ihnen das?“
Anrufer, im Auto„Ja, Donnerstag passt. Können Sie das vor der Tür abstellen?“
Was die Spracherkennung gehört hat„Ja, Donnerstag passt. Können Sie das wieder abbestellen?“
Agent, schlecht gelöst„Natürlich, ich habe Ihre Bestellung storniert. Kann ich sonst noch etwas für Sie tun?“
Agent, gut gelöst„Danke, dann bleibt es bei Donnerstag. Entschuldigung, den letzten Teil habe ich nicht verstanden. Können Sie das noch einmal sagen?“
Anrufer„Können Sie das Paket vor der Tür abstellen, falls ich nicht da bin?“
Agent„Kein Problem. Donnerstag zwischen 9 und 12 Uhr, und falls Sie nicht da sind, stellen wir das Paket vor der Tür ab.“

Die erste Antwort macht aus einem Erkennungsfehler eine stornierte Bestellung. Die zweite behält den Teil, der passt, und fragt beim Rest noch einmal nach. Mehr zu dieser Ebene lesen Sie in unserem Artikel darüber, wie Voice-KI korrigiert, was sie falsch versteht.

Bei Tools und Übergabe zählt das Protokoll, nicht der Satz

Ein Agent, der „Ihr Termin ist gebucht“ sagt, hat einen Satz erzeugt, keine Buchung. Prüfen Sie für jede Aktion das Tool-Protokoll: Wurde die Anfrage gesendet, was kam zurück, und gab es eine Datensatz-ID? Der Agent sollte eine Aktion erst nach einer erfolgreichen Antwort bestätigen. Unser Leitfaden zum Rückschreiben ins CRM zeigt, was ein Anruf hinterlassen sollte.

Übergaben scheitern genauso leise. Die Weiterleitung findet statt, aber die Zusammenfassung kommt spät oder gar nicht an. Hören Sie sich die ersten Sekunden nach jeder Weiterleitung an. Fragt die übernehmende Person in Ihrem Team, worum es geht, ist die Übergabe gescheitert. Was der Kontext enthalten sollte, zeigt unser Leitfaden zur Übergabe an Menschen.

Am Gesprächsende zählt die Verabschiedung

Viele Abläufe beenden das Gespräch nach einer festen Zeit oder sobald die Aufgabe erledigt ist. Bei Live-Anrufen werden Anrufer so mitten in einer Frage oder einem Dankeschön getrennt. Der Agent sollte nicht auflegen, bevor er die Verabschiedung des Anrufers gehört hat.

Lesen Sie für jeden Anruf, den der Agent beendet hat, den letzten Satz des Anrufers vor dem Auflegen. Enthielt er eine Verabschiedung? Der Anteil der Anrufe ohne Verabschiedung ist Ihre Quote zu früh beendeter Gespräche, und sie gehört zur Entscheidungsebene.

Eine Ebene nach der anderen beheben

Die Tabelle der ersten Bruchstellen legt die Reihenfolge der Arbeit fest:

  1. Wählen Sie die KI-Ebene mit der höchsten Zahl. Was auf Unternehmensseite liegt, geht an die zuständige Person.
  2. Nehmen Sie genau eine Änderung vor, die auf diese Anrufe zielt. Bei Bruchstellen in der Spracherkennung liegt diese Änderung meist in der Entscheidungsebene, wie oben beschrieben. Bei zwei Änderungen auf einmal können Sie nicht sagen, welche geholfen hat.
  3. Spielen Sie dieselben gescheiterten Anrufe erneut durch. Sie sind jetzt Ihr Regressionsset: dieselben Sätze der Anrufer und, wo möglich, dieselben akustischen Bedingungen.
  4. Vergleichen Sie die Zählung der ersten Bruchstellen vor und nach der Änderung bei gleichartigem Anrufaufkommen: dieselbe Kampagne, derselbe Listentyp oder dieselben Zeiten für eingehende Anrufe. Mit einer leichteren Liste sieht jede Änderung gut aus.

Rechnen Sie damit, dass sich manche Anrufe verschieben, statt zu verschwinden. Ein Anruf, der jetzt die Spracherkennung besteht, kann später an den Tools scheitern. Das ist Fortschritt: Die nächste Korrektur ist jetzt sichtbar. Die Agent Factory, mit der DRING Agenten entwickelt, testet und verbessert, folgt derselben Regel: eine Änderung nach der anderen, getestet, bevor sie live geht.

Wo DRING hilft

Bleibt ein Ablauf im Live-Betrieb hinter den Erwartungen zurück, besprechen Sie ihn mit uns in einem Rückruf. Halten Sie eine Stichprobe gescheiterter Anrufe bereit, mit Aufzeichnungen, soweit Ihre Richtlinien das erlauben, und mit dem Ergebnis, das jeder Anruf hätte erreichen sollen. Unser Team kann die Anrufe mit Ihnen so durchgehen, wie dieser Artikel es beschreibt, und für jeden die erste Bruchstelle suchen.

Änderungen, die Ihre eigenen Systeme betreffen, werden gesondert vereinbart. Welche Aktionen ein Agent in einem CRM ausführen kann, hängt von Edition, Berechtigungen und API-Zugang des CRM ab. Bei DRING lassen sich zusätzliche Analysefelder definieren und über API, CRM, Dashboard und Berichte zurückgeben. Die erste Ebene, die versagt hat, kann eines dieser Felder sein.

Jeder Agent von DRING durchläuft vor dem ersten echten Anruf 1.000 bis 10.000 simulierte Gespräche, eigens für Ihr Unternehmen erstellt. Live-Anrufe zeigen trotzdem, was die Simulation übersehen hat. Die Verbesserung nach dem Start beginnt deshalb bei echten Anrufern.

Die Ebene finden, die versagt

Hinterlassen Sie Ihre Nummer, und DRING ruft Sie in zwei Minuten an. Sagen Sie DRING, welcher Ablauf hinter den Erwartungen zurückbleibt, und unser Team sagt Ihnen anschließend, wo Sie zuerst ansetzen sollten.