U schrijft nooit een prompt
Uw team legt het werk uit en beoordeelt wat de agent zegt. De prompt zelf schrijven en onderhouden wij.
Laat één workflow en uw nummer achter. De AI maakt zich bekend, stelt een paar gerichte vragen en maakt een gestructureerde briefing.
U schrijft nooit een prompt. Wij verzamelen het materiaal, bouwen er de tests uit en brengen alleen uit wat slaagt.
Prompts schrijven is niet uw werk. Net zo min als bedenken welke lastige gesprekken uw agent zal krijgen.
Uw team legt het werk uit en beoordeelt wat de agent zegt. De prompt zelf schrijven en onderhouden wij.
Documenten, opnames, beleid en de opmerkingen die u tijdens de review geeft, worden de testset voor die agent.
Een agent gaat pas naar productie als die set is doorstaan. Tot die tijd blijft de agent op een privélijn.
1.000 tot 10.000 gesimuleerde gesprekken, gebouwd voor uw bedrijf, vóór het eerste echte gesprek. Het aantal gesimuleerde gesprekken hangt af van de agent, en elk ervan wordt gegenereerd uit uw eigen workflow, documenten en gespreksopnames, niet uit een generieke benchmarkset.
Dezelfde discipline geldt voor een wijziging. Elke regel die u ons geeft, komt in de ene testset van die agent, en een nieuwe regel gaat pas live als alle bestaande regels ernaast nog steeds slagen. Bekijk hoe de agent wordt gebouwd
Dezelfde pipeline draait voor elke agent, hoe eenvoudig de toepassing van buitenaf ook lijkt.
Boze bellers, verkeerde bestellingen, beleidsvallen, stiltes en onderbrekingen, gehaald uit uw eigen workflow.
Elke persona voert een volledig gesprek met de agent, niet één gescripte vraag.
Geautomatiseerde beoordelaars scoren elk gesprek. Waar ze het oneens zijn, controleert een mens het gesprek.
Resultaten worden vergeleken met de vorige release voordat er iets live gaat, zodat een fix niet ongemerkt iets anders kapotmaakt.
Escalatie naar een medewerker wordt uitdrukkelijk gecontroleerd, niet verondersteld.
Live verkeer neemt in gecontroleerde stappen toe, met de scores in de gaten bij elke stap en de vorige release klaar om terug te zetten.
Geautomatiseerde evaluatie kan afdrijven of een nuance missen. Onafhankelijke checks, plus menselijke review van elk verschil in oordeel, maken het signaal bruikbaarder dan één score zou zijn.
Het testen stopt niet bij de lancering. Live agents krijgen regelmatig kwaliteitscontrole, zolang ze draaien.
Oplossing, beleidsnaleving en reactietijd krijgen een score zodra een gesprek eindigt, en het sentiment krijgt een label.
Elke live agent wordt volgens planning opnieuw getest tegen de vorige release, zodat een stille achteruitgang boven water komt voordat een klant die merkt.
Een score die buiten het verwachte bereik komt, geeft vanzelf een melding, zonder op de volgende controleronde te wachten.
Fouten in de spraakherkenning worden bijgehouden per naam, plaats en productterm en daarna gecorrigeerd in het woordenboek van de agent.
| Maatstaf | Definitie | Waarom het telt |
|---|---|---|
| Oplossing | Of de reden van het telefoontje echt is afgehandeld. | De kernmaatstaf voor de vraag of de agent zijn werk heeft gedaan. |
| Sentiment | Hoe de toon van de klant veranderde van het begin tot het einde van het gesprek. | Vangt gesprekken die op papier opgelost zijn, maar de klant toch frustreerden. |
| Beleidsnaleving | Of de acties van de agent binnen de ingestelde regels bleven. | Houdt de agent binnen de grenzen die het bedrijf heeft gesteld. |
| Reactietijd | De tijd tussen het moment dat de klant uitgesproken is en het antwoord van de agent. | Een traag antwoord voelt als een slechte verbinding, ook als het antwoord klopt. |
| Juistheid van overdracht | Of de agent heeft doorverbonden met een medewerker wanneer dat nodig was. | Een gemiste escalatie is erger dan een onnodige. |
| Regressieverschil | De scoreverandering ten opzichte van de vorige release, op dezelfde testset. | Vangt een release die de agent ongemerkt slechter maakt. |
Welke openingszin, toon of stem werkt, wordt beslist in live uitgaande gesprekken, niet in een vergadering.
De openingszin, de toon, de stem, het tempo, de volgorde van de vragen, de manier waarop een bezwaar wordt opgevangen. Eén variabele per variant, zodat het resultaat toe te wijzen is.
Op de eigen uitkomst van de campagne, met een afgesproken minimale steekproef per variant. Sentiment en overdrachtspercentage werken als vangrails: een variant die wint op uitkomsten maar slechter valt bij de klant, gaat niet live.
De winnaar wordt in gecontroleerde stappen uitgerold, de andere varianten verdwijnen, en de wijziging wordt vastgelegd, zodat de volgende vergelijking vanaf een bekende basis begint.
Een gepromoveerde variant moet nog steeds door de regressieset voordat die de hele campagne bereikt.
Nee. U legt het werk uit, deelt de documenten en opnames en beoordeelt wat de agent zegt. De prompt schrijven en onderhouden is ons werk, en de tests worden gebouwd uit het materiaal dat u ons gaf, niet uit een generiek template.
Ja. Regressierondes tegen de vorige release draaien volgens een vaste planning, en elke wijziging doorloopt dezelfde gefaseerde uitrol als de eerste lancering.
Het gesprek gaat naar een menselijke beoordelaar en wordt gecontroleerd voordat het resultaat definitief is. Herhaalde verschillen zijn een signaal om de evaluatieset zelf aan te scherpen.
Ja. De persona's en scenario's worden gebouwd rond uw eigen beleid en randgevallen, en u kunt ze tijdens de onboarding inzien.
Er gaat automatisch een afwijkingsmelding uit, de gesprekken erachter worden beoordeeld, en de fix gaat opnieuw door de testset voordat dat type gesprek terug naar de agent gaat.
Loop met ons door hoe een gemeten lancering eruit zou zien, van de eerste workflowbriefing tot de reviewcyclus na de livegang.