Sie schreiben nie einen Prompt
Ihr Team erklärt die Arbeit und prüft, was der Agent sagt. Den Prompt selbst schreiben und pflegen wir.
Hinterlassen Sie einen Workflow und Ihre Nummer. Die KI stellt sich vor, stellt gezielte Fragen und erstellt ein strukturiertes Briefing.
Sie schreiben nie einen Prompt. Wir sammeln das Material, bauen daraus die Tests und geben nur frei, was besteht.
Prompts zu schreiben ist nicht Ihre Aufgabe. Sich die schwierigen Anrufe auszumalen, die Ihr Agent bekommen wird, auch nicht.
Ihr Team erklärt die Arbeit und prüft, was der Agent sagt. Den Prompt selbst schreiben und pflegen wir.
Dokumente, Aufzeichnungen, Richtlinien und Ihre Kommentare aus der Prüfung werden zum Testset für diesen Agenten.
Ein Agent geht erst in den Produktivbetrieb, wenn er dieses Set besteht. Bis dahin bleibt er auf einer privaten Leitung.
1.000 bis 10.000 simulierte Gespräche, eigens für Ihr Unternehmen erstellt, vor dem ersten echten Anruf. Die Zahl der simulierten Gespräche hängt vom Agenten ab. Jedes einzelne wird aus Ihrem eigenen Workflow, Ihren Dokumenten und Gesprächsaufzeichnungen erzeugt, nicht aus einem allgemeinen Benchmark-Set.
Dieselbe Disziplin gilt für Änderungen. Jede Regel, die Sie uns geben, kommt in das eine Testset dieses Agenten, und eine neue Regel geht erst live, wenn alle bestehenden Regeln daneben weiterhin bestehen. So wird der Agent gebaut
Für jeden Agenten läuft dieselbe Pipeline, egal wie einfach der Anwendungsfall von außen wirkt.
Verärgerte Anrufer, falsche Bestellungen, Richtlinienfallen, Stille und Unterbrechungen, abgeleitet aus Ihrem eigenen Workflow.
Jede Persona führt ein vollständiges Gespräch mit dem Agenten, nicht nur eine einzelne vorgegebene Frage.
Automatisierte Prüfinstanzen bewerten jedes Gespräch. Wo sie sich nicht einig sind, prüft ein Mensch den Anruf.
Die Ergebnisse werden vor jedem Release mit der vorherigen Version verglichen. So kann eine Korrektur nicht unbemerkt etwas anderes beschädigen.
Die Eskalation an einen Menschen wird ausdrücklich geprüft, nicht einfach vorausgesetzt.
Der Live-Verkehr steigt in kontrollierten Stufen. Die Werte werden bei jedem Schritt beobachtet, und das vorherige Release steht bereit.
Automatisierte Evaluierung kann abdriften oder eine Nuance übersehen. Unabhängige Prüfungen und die menschliche Kontrolle jeder Abweichung machen das Signal aussagekräftiger als ein einzelner Wert.
Die Tests enden nicht mit dem Start. Live-Agenten durchlaufen eine regelmäßige Qualitätskontrolle, solange sie im Einsatz sind.
Sobald ein Anruf endet, werden Lösung, Richtlinientreue und Antwortzeit bewertet, und die Stimmung wird als Label erfasst.
Jeder Live-Agent wird planmäßig erneut gegen das vorherige Release getestet. So fällt eine stille Verschlechterung auf, bevor ein Kunde sie bemerkt.
Verlässt ein Wert seinen erwarteten Bereich, wird automatisch eine Warnung ausgelöst, ohne auf den nächsten Prüflauf zu warten.
Fehler der Spracherkennung werden nach Name, Ort und Produktbegriff erfasst und dann im Wörterbuch des Agenten korrigiert.
| Kennzahl | Definition | Warum sie zählt |
|---|---|---|
| Lösungsquote | Ob das Anliegen des Kunden tatsächlich bearbeitet wurde. | Die zentrale Kennzahl dafür, ob der Agent seine Aufgabe erfüllt hat. |
| Stimmung | Wie sich der Ton des Kunden vom Anfang bis zum Ende des Anrufs verändert hat. | Erkennt Anrufe, die auf dem Papier gelöst waren, den Kunden aber frustriert haben. |
| Richtlinientreue | Ob die Aktionen des Agenten innerhalb der für ihn konfigurierten Regeln blieben. | Hält den Agenten in den Grenzen, die das Unternehmen gesetzt hat. |
| Antwortzeit | Die Pause zwischen dem Ende der Kundenäußerung und der Antwort des Agenten. | Eine langsame Antwort wirkt wie eine schlechte Verbindung, selbst wenn sie inhaltlich stimmt. |
| Treffsicherheit der Übergabe | Ob der Agent an einen Menschen eskaliert hat, wenn er es sollte. | Eine verpasste Eskalation ist schlimmer als eine unnötige. |
| Regressionsdelta | Die Veränderung des Werts gegenüber dem vorherigen Release auf demselben Testset. | Erkennt ein Release, das den Agenten unbemerkt verschlechtert. |
Welcher Einstiegssatz, welcher Ton oder welche Stimme funktioniert, entscheidet sich in echten Outbound-Anrufen, nicht in einer Besprechung.
Der Einstiegssatz, der Ton, die Stimme, das Tempo, die Reihenfolge der Fragen, der Umgang mit einem Einwand. Eine Variable pro Variante, damit sich das Ergebnis eindeutig zuordnen lässt.
Anhand des Kampagnenergebnisses selbst, mit einer vereinbarten Mindeststichprobe je Variante. Stimmung und Übergabequote dienen als Leitplanken: Eine Variante, die beim Ergebnis gewinnt, aber schlechter ankommt, geht nicht live.
Der Gewinner wird in kontrollierten Stufen ausgerollt, die anderen Varianten werden beendet, und die Änderung wird dokumentiert. So startet der nächste Vergleich von einer bekannten Basis.
Auch eine ausgerollte Variante muss das Regressionsset bestehen, bevor sie die ganze Kampagne erreicht.
Nein. Sie erklären die Arbeit, teilen Dokumente und Aufzeichnungen und prüfen, was der Agent sagt. Den Prompt zu schreiben und zu pflegen ist unsere Aufgabe. Die Tests entstehen aus dem Material, das Sie uns gegeben haben, nicht aus einer allgemeinen Vorlage.
Ja. Regressionsläufe gegen das vorherige Release finden regelmäßig statt, und jede Änderung durchläuft denselben stufenweisen Rollout wie der erste Start.
Das Gespräch geht an eine menschliche Prüfung und wird auditiert, bevor das Ergebnis feststeht. Wiederholte Widersprüche sind ein Signal, das Evaluierungsset selbst zu verfeinern.
Ja. Personas und Szenarien entstehen auf Basis Ihrer eigenen Richtlinien und Grenzfälle, und Sie können sie während des Onboardings einsehen.
Eine Drift-Warnung wird automatisch ausgelöst, die betroffenen Anrufe werden geprüft, und die Korrektur durchläuft erneut das Testset, bevor der Agent diesen Anruftyp wieder übernimmt.
Gehen Sie mit uns durch, wie ein gemessener Start aussehen würde, vom ersten Workflow-Briefing bis zur Prüfschleife nach dem Livegang.