Zum Inhalt springen
Beschreiben Sie einen Workflow. DRING ruft in zwei Minuten an und qualifiziert den Bedarf. Anruf in zwei Minuten erhalten
Anruf in 2 Minuten Agent Factory ansehen
Leitfaden zur Einführung · Pilotbewertung

So bewerten Sie einen Piloten mit Voice-KI an Tag 30

Legen Sie vor dem ersten Live-Anruf fest, was Erfolg bedeutet. Dieser Leitfaden gibt Ihnen einen Pilotbogen, eine Vorlage für die Wochenauswertung und eine Regel für Tag 30: Ausweiten, Verlängern oder Stoppen.

Die kurze Antwort

Ein Voice-KI-Pilot ist erfolgreich, wenn an Tag 30 jede Kennzahl ihr Ziel erreicht und keine Stoppgrenze verletzt ist. Ziele und Stoppgrenzen stehen auf einem Pilotbogen, der vor dem ersten Live-Anruf unterschrieben wird. Legen Sie die Kriterien erst nach den Anrufen fest, wird Tag 30 zum Streit darüber, welche Anrufe zählen. Legen Sie sie vorher fest, ist Tag 30 eine kurze Besprechung.

Messen Sie eine Baseline für dieselbe Anrufart in einem vergleichbaren Zeitraum. Fassen Sie fünf Kennzahlen auf einem Pilotbogen zusammen: Lösungsquote, Quote wiederholter Kontakte, Quote falscher Aktionen, Übergabequalität und manueller Aufwand. Geben Sie jeder Kennzahl eine genaue Definition, ein Ziel und eine Stoppgrenze, und nutzen Sie in jeder Wochenauswertung denselben Bogen.

An Tag 30 wenden Sie die Regel an, die Sie vorab vereinbart haben. Ausweiten, wenn jedes Ziel erreicht ist. Verlängern, einmalig um zwei Wochen, wenn eine oder zwei Kennzahlen ihr Ziel verfehlen und eine einzige bekannte Ursache das erklärt. Stoppen, wenn eine Stoppgrenze verletzt ist, mehr als zwei Kennzahlen ihr Ziel verfehlen oder keine einzelne bekannte Ursache die Abweichung erklärt. Bei manchen Stoppgrenzen genügt ein einziger Anruf, etwa bei einer falschen Aktion mit finanziellen oder rechtlichen Folgen.

Die Schritte vor dem Piloten beschreibt unser 90-Tage-Plan für die Einführung von Voice-KI.

Eindrücke sind kein Urteil

Nach 30 Tagen erinnert sich die Teamleitung an den einen Anruf, in dem der Agent einen verärgerten Kunden missverstanden hat. Das Projektteam erinnert sich an die reibungslosen Anrufe, die es in Besprechungen vorgespielt hat. Beides sagt wenig über die Hunderte von Anrufen, die niemand gehört hat.

Nachträglich gewählte Zahlen haben dasselbe Problem: Man greift leicht zu der Kennzahl, die am besten aussieht, oder dehnt das Wort „gelöst“, bis es passt. Deshalb unterschreiben Betriebsleitung, Qualitätsprüfung, IT und Sponsor den Pilotbogen vor Tag 1. Während des Piloten ändern sich Ziele und Stoppgrenzen nicht.

Schritt 1: die Baseline messen

Die Baseline zeigt, wie dieselbe Anrufart heute abschneidet, gemessen mit den Definitionen des Piloten. Ohne sie ist eine Lösungsquote von 70 % weder gut noch schlecht. Eine Anrufart ist ein Workflow mit genau einem erwarteten Ergebnis. Im Beispiel dieses Artikels rufen Kunden an, um einen gebuchten Technikertermin zu verschieben. Der Anruf soll mit einem neuen Termin enden, den der Kunde angenommen hat.

Nehmen Sie die Baseline aus einem vergleichbaren Zeitraum:

  • Gleiche Wochentage und Uhrzeiten: vier volle Wochen, zu genau den Zeiten, in denen der Agent später Anrufe annimmt.
  • Gleiche Saison oder Kampagne: Vergleichen Sie keine Aktionswoche mit einer ruhigen Woche und keine Ferienwoche mit einer normalen.
  • Gleicher Anrufmix: dieselbe Anrufart, dieselben Sprachen und Kundengruppen. Übernimmt der Pilot nur Anrufe am Abend, ist die Baseline das, was bisher mit Anrufen am Abend geschah, auch wenn das die Mailbox war.

Übernehmen Sie keine alten Abschlusscodes: Ein Klick auf „gelöst“ kann etwas anderes bedeuten als ein neuer Termin im Buchungssystem. Kennzeichnen Sie eine Zufallsstichprobe der Baseline-Anrufe nach den Regeln des Piloten neu, und messen Sie daran auch die falschen Aktionen Ihres Teams. Unser Artikel zu Containment und Lösungsquote erklärt, warum ein Anruf ohne Übergabe noch kein gelöster Anruf ist.

Wurde eine Kennzahl nie gemessen, schreiben Sie „nicht gemessen“ auf den Bogen. Leiten Sie ihr Ziel aus dem ab, was der Business Case braucht, und weisen Sie für diese Kennzahl später keine Verbesserung aus.

Schritt 2: den Pilotbogen aufsetzen

Der Pilotbogen enthält fünf Kennzahlen. Jede beantwortet eine andere Frage, damit ein guter Wert bei der einen keinen schlechten Wert bei einer anderen verdeckt. Notieren Sie für jede Kennzahl Zähler, Nenner und Ausschlüsse. Legen Sie dann zwei Werte fest. Das Ziel ist der Wert, bei dem sich der Business Case rechnet. Die Stoppgrenze ist der Wert, bei dem Sie stoppen, egal was die anderen Kennzahlen zeigen. Liegt eine Kennzahl zwischen beiden Werten, verfehlt sie ihr Ziel.

Alle Werte im Bogen sind für diesen Artikel erfundene Beispielwerte, keine Daten eines echten Unternehmens.

KennzahlGenaue DefinitionBaselineZielStoppgrenze
LösungsquoteAnrufe, die mit einem vom Kunden angenommenen Termin enden, sichtbar im Buchungssystem, ohne Übergabe oder Rückruf, geteilt durch alle relevanten Anrufe. Ausgeschlossen: Testanrufe und andere Anrufarten.74 %70 % oder mehrUnter 60 %
Quote wiederholter KontakteKunden, die sich innerhalb von 7 Tagen erneut wegen desselben Termins melden, über einen beliebigen Kanal, geteilt durch Kunden mit einem relevanten Anruf. Gezählt wird, sobald die 7 Tage vorbei sind.12 %12 % oder wenigerÜber 18 %
Quote falscher AktionenGeprüfte Anrufe mit falschem Datensatz, falscher Buchung oder falscher Auskunft, geteilt durch geprüfte Anrufe. In Woche 1 wird jeder Anruf geprüft, danach 100 zufällige Anrufe pro Woche.1,5 % (3 von 200 geprüften Anrufen)1 % oder wenigerÜber 3 %
ÜbergabequalitätÜbergaben, bei denen die übernehmende Person nicht noch einmal nach Name, Buchung oder Anrufgrund fragen musste, geteilt durch alle Übergaben.Nicht gemessen90 % oder mehrUnter 75 %
Manueller AufwandMinuten Ihres Teams je 100 relevante Anrufe für Übergaben, Rückrufe, Prüfungen und Korrekturen, bewertet in Woche 3 und 4. Baseline: Minuten für die Bearbeitung der Anrufe.640 Minuten250 Minuten oder wenigerÜber 400 Minuten

Das Ziel für die Lösungsquote liegt bewusst unter der Baseline. Halten Sie den Grund auf dem Bogen fest: Der Business Case rechnet sich bei 70 %, wenn der manuelle Aufwand von 640 auf höchstens 250 Minuten je 100 Anrufe sinkt. Beim manuellen Aufwand zählen nur Woche 3 und 4, denn in Woche 1 liest die Qualitätsprüfung jeden Anruf, und in Woche 2 folgt die erste Korrektur.

Stoppgrenzen, für die ein Anruf genügt

Manche Fehler sind zu teuer, um auf eine Quote zu warten:

  • Eine falsche Aktion mit finanziellen oder rechtlichen Folgen, etwa eine Belastung, eine Erstattung oder ein stornierter kostenpflichtiger Termin.
  • Personenbezogene Daten, die an einen Anrufer gehen, der die Identitätsprüfung nicht bestanden hat.
  • Ein Anrufer, der eine Gefahr meldet, etwa Gasgeruch, und nicht sofort an einen Menschen übergeben wird.

Schon einer dieser Fälle beendet den Piloten vorzeitig, und die Anrufe gehen noch am selben Tag zurück auf den bisherigen Weg. Ein Neustart nach einer Korrektur ist ein neuer Pilot ab Tag 1. Die Stoppgrenze einer Kennzahl wirkt langsamer: Der Pilot endet vorzeitig, wenn der gemessene Wert einer Kennzahl in zwei Wochenauswertungen nacheinander ihre Stoppgrenze verletzt. Dabei zählen nur die Wochenauswertungen, in denen diese Kennzahl bewertet wird: der manuelle Aufwand ab Woche 3, wiederholte Kontakte erst nach Ablauf ihrer 7 Tage.

Die Zufallsstichprobe von 100 Anrufen pro Woche erfasst die meisten der oben genannten Fehler nicht. Suchen Sie deshalb gezielt danach. Lesen Sie jede Woche jeden Anruf, der mit einer Belastung, einer Erstattung oder einer Stornierung endet, jeden Anruf, in dem der Agent personenbezogene Daten herausgegeben hat, und jeden Anruf, den ein Kunde oder jemand aus Ihrem Team als Problem meldet. Diese Prüfungen kommen zur Zufallsstichprobe hinzu.

Schritt 3: die Wochenauswertung durchführen

In der Wochenauswertung gehen Sie jede Woche am selben Tag denselben Bogen durch, prüfen die Zählung und wählen höchstens eine Änderung am Agenten.

WocheWas Sie prüfenZu klärende FrageWer entscheidet oder korrigiert
Woche 1Jeder Anruf ohne das erwartete Ergebnis, jede Übergabe und jede Terminänderung, abgeglichen mit dem Buchungssystem.Stimmen die Labels mit dem überein, was die Qualitätsprüfung hört?Die Qualitätsprüfung liest. Die Betriebsleitung entscheidet über Änderungen.
Woche 2Der Bogen neben der Baseline, mit Anzahlen und Fehlermargen. Ungelöste Anrufe, nach Ursache gruppiert.Welche Ursache erklärt die meisten ungelösten Anrufe: der Agent, die Systeme oder das Unternehmen?Die Betriebsleitung wählt eine Korrektur. Die Agentenentwicklung oder die IT setzt sie um.
Woche 3Die Kennzahl, die die Korrektur bewegen soll, und die anderen vier. Wiederholte Kontakte aus Woche 1 und 2, deren 7 Tage vorbei sind.Hat die Korrektur ihre Kennzahl bewegt, ohne einer anderen zu schaden?Die Betriebsleitung, gemeinsam mit der Qualitätsprüfung.
Woche 4Der vollständige Bogen über alle Anrufe seit Tag 1, die Stoppgrenzen und die Fehlermarge jeder Quote.Welche Entscheidung für Tag 30 stützt der Bogen: Ausweiten, Verlängern oder Stoppen?Die Betriebsleitung bereitet sie vor. Der Sponsor unterschreibt.

Drei Regeln halten die Wochen vergleichbar:

  • Eine Änderung pro Woche, mit Datum protokolliert. Bei zwei Änderungen wissen Sie nicht, welche die Zahl bewegt hat.
  • Feste Definitionen. Erweist sich eine Definition als falsch, ändern Sie sie einmal, halten den Grund fest und rechnen alle früheren Wochen neu.
  • Anzahlen neben Quoten. Schreiben Sie „64 % (256 von 400 Anrufen)“, nicht „64 %“.

Welche Anrufe die Qualitätsprüfung lesen sollte, zeigt unser Leitfaden zu Qualitätsstichproben im Callcenter.

Was die Zahlen aussagen und was nicht

Jede Quote aus einem Piloten ist eine Schätzung. Für eine Quote p, gemessen an n Anrufen, beträgt die Fehlermarge bei einem Konfidenzniveau von 95 % näherungsweise 1,96 × √(p(1 - p) / n). Bei einer Quote von 70 % ergibt das:

  • 100 Anrufe: rund ±9,0 Prozentpunkte
  • 400 Anrufe: rund ±4,5 Prozentpunkte
  • 1.000 Anrufe: rund ±2,8 Prozentpunkte

Ein Wochenwert aus 400 Anrufen weicht also meist um nicht mehr als rund 4,5 Prozentpunkte von der wahren Quote ab, und eine Veränderung um wenige Prozentpunkte von einer Woche zur nächsten kann reiner Zufall sein. Die Formel setzt unabhängige Anrufe voraus und eine Quote, die nicht nahe 0 % oder 100 % liegt. Ein Vergleich mit der Baseline hat eine größere Fehlermarge: Bei zwei Quoten von rund 70 % aus je 1.600 Anrufen liegt sie für die Differenz bei rund ±3,2 Prozentpunkten.

In Woche 1 des Beispiels liegt die Lösungsquote bei 64 % aus 400 Anrufen, mit einer Fehlermarge von rund ±4,7 Prozentpunkten. Die wahre Quote kann also irgendwo zwischen rund 59,3 % und 68,7 % liegen: Die Spanne reicht bis unter die Stoppgrenze und bleibt unter dem Ziel. Bis Tag 30 kommt das Beispiel auf 1.600 Anrufe mit 68 %, bei rund ±2,3 Prozentpunkten. Die Spanne von rund 65,7 % bis 70,3 % liegt klar über der Stoppgrenze und schließt das Ziel knapp ein.

Beispiel, keine echten Daten: die Lösungsquote im Vergleich zu Stoppgrenze, Ziel und Baseline. Die Spanne aus Woche 1 (400 Anrufe) reicht bis unter die Stoppgrenze. Die Spanne an Tag 30 (1.600 Anrufe) ist enger und schließt das Ziel knapp ein.

Dazu kommen drei weitere Einschränkungen:

  • Seltene Ereignisse. Keine falsche Aktion in 300 geprüften Anrufen ist immer noch mit einer wahren Quote von bis zu rund 1 % vereinbar. Das ist die „Dreierregel“: Gibt es in n Anrufen kein Ereignis, liegt die Obergrenze des 95-%-Konfidenzintervalls bei rund 3 / n. Lesen und klassifizieren Sie jede falsche Aktion.
  • Kleine Segmente. Eine Sprache oder ein Wochentag mit 60 Anrufen hat bei 70 % eine Fehlermarge von rund ±11,6 Prozentpunkten. Hören Sie sich diese Anrufe an, statt ihre Quote zu vergleichen.
  • Wiederholte Kontakte kommen später. An Tag 30 deckt die Quote wiederholter Kontakte nur Anrufe bis Tag 23 ab. Spätere Anrufe hatten ihre 7 Tage noch nicht.

Die Entscheidung an Tag 30: Ausweiten, Verlängern oder Stoppen

Berechnen Sie an Tag 30 den Pilotbogen über alle Anrufe seit Tag 1. Wenden Sie dann die Regel in dieser Reihenfolge an:

  • Stoppen, wenn eine Stoppgrenze verletzt ist, mehr als zwei Kennzahlen ihr Ziel verfehlen oder keine einzelne bekannte Ursache die Abweichung erklärt. Die Anrufe gehen zurück auf den bisherigen Weg, und der Grund wird für den nächsten Piloten festgehalten.
  • Ausweiten, wenn jedes Ziel erreicht und keine Stoppgrenze verletzt ist. Geben Sie dem Agenten schrittweise mehr Anrufe derselben Anrufart, mit demselben Bogen. Eine neue Anrufart bekommt ihren eigenen Pilotbogen.
  • Verlängern, wenn eine oder zwei Kennzahlen wegen einer einzigen bekannten Ursache ihr Ziel verfehlen. Verlängern Sie einmalig um zwei Wochen, mit einer Korrektur für diese Ursache und demselben Bogen, und bewerten Sie die Verlängerung anhand ihrer eigenen Anrufe. Ist dann jedes Ziel erreicht, heißt es: Ausweiten. Wenn nicht, lautet die Entscheidung: Stoppen.
Die Entscheidung an Tag 30: drei Wege, jeder mit einer Bedingung, die vor Tag 1 vereinbart wurde.

So lesen Sie gemischte Ergebnisse

Ein häufiges Ergebnis an Tag 30 ist gemischt: Vier Kennzahlen erreichen ihr Ziel, eine nicht.

  • Keinen Durchschnitt bilden. Eine hohe Lösungsquote gleicht keine falsche Buchung aus.
  • Zuerst den Kunden schützen. Die Quote falscher Aktionen und die Stoppgrenzen, für die ein Anruf genügt, werden nie gegen Lösungsquote oder manuellen Aufwand aufgerechnet. Verfehlt die Quote falscher Aktionen ihr Ziel, kommt Verlängern nur infrage, wenn jede falsche Aktion dieselbe bekannte Ursache hat und die Korrektur sie beseitigt.
  • Die Abweichung an der Fehlermarge messen. 68 % erreichen ein Ziel von 70 % nicht. Eine Abweichung, die kleiner ist als die Fehlermarge und eine bekannte Ursache hat, ist aber ein typischer Fall für Verlängern.
  • Klären, wo die Ursache liegt. Scheitern Anrufe, weil es keinen freien Termin gibt, hilft auch ein besserer Agent nicht. Verfehlt der manuelle Aufwand sein Ziel, prüfen Sie, ob er von Woche 3 zu Woche 4 noch sinkt.

Beispiel: ein Pilotbogen an Tag 30

Beispielwerte, keine echten Daten.

KennzahlZielErgebnis an Tag 30Einordnung
Lösungsquote70 % oder mehr68 % (1.088 von 1.600 Anrufen, ±2,3 Prozentpunkte)Ziel verfehlt, um weniger als die Fehlermarge
Quote wiederholter Kontakte12 % oder weniger11 % (Anrufe bis Tag 23)Erreicht
Quote falscher Aktionen1 % oder weniger0,6 % (4 von 700 geprüften Anrufen)Erreicht, jeder Fall gelesen und klassifiziert
Übergabequalität90 % oder mehr92 % (230 von 250 Übergaben)Erreicht
Manueller Aufwand250 Minuten oder weniger230 Minuten (Woche 3 und 4)Erreicht
Stoppgrenzen, für die ein Anruf genügt0 Fälle0 FälleKeine Stoppgrenze verletzt

Eine Kennzahl verfehlt ihr Ziel, und keine Stoppgrenze ist verletzt. In der größten Gruppe ungelöster Anrufe fragt der Kunde nach einem Termin am Abend, den das Buchungssystem nur Mitarbeitern anzeigt. Die Ursache ist bekannt, und eine einzige Korrektur setzt genau dort an. Die Entscheidung lautet daher Verlängern: zwei Wochen, derselbe Bogen, und der Agent bekommt Zugriff auf die Abendtermine. Bei rund 400 Anrufen pro Woche bringt die Verlängerung rund 800 neue Anrufe zur Bewertung, mit einer Fehlermarge von rund ±3,2 Prozentpunkten bei 70 %.

Wo DRING hilft

Mit DRING ist ein Agent in einer Woche live. Nutzen Sie diese Woche, um die Stichprobe für die Baseline aus vergangenen Anrufen neu zu kennzeichnen, und unterschreiben Sie den Pilotbogen vor dem ersten Live-Anruf. Jeder Agent von DRING durchläuft vor dem ersten echten Anruf 1.000 bis 10.000 simulierte Gespräche, eigens für Ihr Unternehmen erstellt. Das ist ein Test vor dem Start, nicht der Pilot. Die Simulation kann Lücken früh aufdecken, liefert aber weder eine Baseline noch eine Lösungsquote bei echten Kunden. Was sie abdeckt, erklärt unser Artikel zu simulierten Gesprächen.

Während des Piloten kann die Gesprächsauswertung zusätzliche Felder zurückgeben, die Sie selbst definieren, etwa das Ergebnis jedes Anrufs. Sie stehen über API, CRM, Dashboard und Berichte bereit. Die Qualitätsprüfung liest die Anrufe weiterhin, und die Felder geben jeder Wochenauswertung dieselben Labels. Dashboard und Berichte zeigt unsere Seite zur Anrufanalyse.

Zuerst die Kriterien vereinbaren

Hinterlassen Sie Ihre Nummer, und DRING ruft Sie in zwei Minuten an. Sagen Sie DRING, welche Anrufart Sie im Piloten testen möchten. Unser Team meldet sich danach und stimmt den Pilotbogen vor dem ersten Live-Anruf mit Ihnen ab.