Naar inhoud
Deel één workflow. DRING belt binnen twee minuten en brengt de behoefte in kaart. Word binnen twee minuten gebeld
Word binnen 2 minuten gebeld Bekijk Agent Factory
Voice-AI in productie · Diagnose van live gesprekken

Demo goed, live mis: welke laag breekt?

Uw voice-agent doorstond elke demo, maar loopt vast in echte gesprekken. De mislukte gesprekken zelf laten zien welke laag breekt en wat u als eerste oplost.

Het korte antwoord

Een voice-agent die in de demo slaagt maar live faalt, is niet ineens slechter geworden. Live gesprekken gaan door dezelfde zeven lagen als de demo, van audio en spraakherkenning tot tools, overdracht en meting. Alleen heeft de demo nooit de laag getest die nu onder echte omstandigheden breekt.

Begin dus niet met het herschrijven van de prompt. Neem de echte mislukte gesprekken, loop elk gesprek laag voor laag door en wijs het toe aan de eerste laag die brak. De laag met de meeste gesprekken is de laag die faalt, en daar zit uw eerste verbetering. Voer die ene verbetering door, laat dezelfde gesprekken opnieuw lopen en vergelijk.

Dit artikel gaat over een lijn die al live staat. Bent u nog niet live, begin dan met onze gids over het testen van een voice-AI-agent vóór de livegang.

Waarom de demo wel slaagde

Een demo is een vriendelijke test. De beller kent het script, praat duidelijk in een stille ruimte en wacht tot de agent is uitgesproken. De testgegevens kloppen: de bestelling bestaat en het tijdslot is vrij.

Echte bellers vallen de agent in de rede. Ze bellen vanuit de auto of het magazijn, gebruiken streekwoorden en afkortingen, en vragen naar aanverwante onderwerpen waarvoor de flow niet is gebouwd. Soms zijn ze niet de persoon die de flow verwachtte: de boekhouder neemt op in plaats van de eigenaar, een familielid neemt de telefoon aan of het gesprek komt bij een andere afdeling terecht.

Elk van die omstandigheden test een andere laag. Een goede demo laat zien dat de lagen het houden bij schone input, niet welke laag als eerste breekt bij echt belverkeer.

De zeven lagen waar elk gesprek doorheen gaat

Elk gesprek gaat in dezelfde volgorde door dezelfde lagen. Breekt een vroege laag, dan ziet u de symptomen in de lagen daarna. Symptomen alleen wijzen dus vaak naar de verkeerde plek.

  • Audio en telefonie: het gesprek komt tot stand, het geluid gaat zonder vertraging of echo heen en weer, en het gesprek eindigt netjes.
  • Spraakherkenning: wat de beller zegt, wordt tekst.
  • Kennis: de feiten die de agent kan gebruiken, zoals beleid, productinformatie en antwoorden op veelgestelde vragen.
  • Beslislogica: het verloop van het gesprek, dus wat de agent hierna zegt of vraagt, wanneer de agent iets laat bevestigen, wanneer er een overdracht volgt en hoe het gesprek eindigt.
  • Tools en systeemacties: opzoeken en vastleggen in het CRM, het boekingssysteem of het ticketsysteem.
  • Overdracht aan medewerkers: het doorverbinden of terugbellen, en de context die uw collega meekrijgt.
  • Meting: de vastgelegde uitkomst klopt met wat er echt gebeurde.

Daarnaast is er een controlepunt dat geen AI-laag is. Sommige gesprekken stranden aan de bedrijfskant: geen voorraad, geen vrij tijdslot of verouderde gegevens in uw eigen systeem. De agent deed zijn werk, maar het bedrijf kon niet leveren. Tel deze gesprekken apart en leg ze bij de eigenaar van dat proces.

Elk gesprek gaat in dezelfde volgorde door dezelfde zeven lagen. Een mislukt gesprek wordt één keer geteld, bij het eerste breekpunt: de eerste laag die brak. Gesprekken die aan de bedrijfskant stranden, tellen apart.

Begin bij echte bellers, niet bij de testlijst

Neem alle echte gesprekken uit een recente periode, niet de scenario's van uw testlijst. Haal er daarna de interne testgesprekken uit: hetzelfde nummer en dezelfde ingestudeerde zinnen, een paar minuten na elkaar herhaald. Een tester praat niet zoals een echte beller.

Controleer vervolgens de uitkomstlabels in een steekproef. Tellen voicemails als gesprek of voltooide boekingen als mislukt, dan klopt de set mislukte gesprekken zelf al niet. Meting is de laatste laag, maar de eerste die u controleert.

Luister tot slot naar de opnames. Het transcript laat zien wat de spraakherkenning hoorde. Alleen de opname laat horen wat de beller echt zei.

Diagnosetabel: van symptoom naar laag

Gebruik de tabel voor één mislukt gesprek tegelijk, en zoek het bewijs voordat u de laag toewijst.

SymptoomWaarschijnlijke laagWat u controleertBewijs dat het bevestigt
Uitgaande gesprekken eindigen in de eerste secondenAudio en telefonieDe tijd tussen opnemen en het eerste woord van de agentMensen hangen op na een stilte, nog voordat de agent iets zegt. Ophangen tijdens de openingszin wijst op beslislogica.
Lange stilte nadat de beller is uitgepraatAudio en telefonie, of toolsDe stilte vóór elk antwoord van de agentStiltes bij elke beurt wijzen op de lijn. Stiltes alleen bij beurten met een opzoekactie wijzen op tools.
De agent stopt midden in een zin terwijl niemand iets zeiAudio en telefonieElke onderbreking, naast de opname gelegdDe agent stopt bij verkeerslawaai, machines of de eigen echo.
Bellers moeten zich herhalenSpraakherkenningHet transcript van de eerste poging, naast de opname gelegdOp de opname is de beller goed te verstaan, maar het transcript is fout of leeg.
De agent beantwoordt een vraag die niemand steldeSpraakherkenningDe gehoorde tekst, naast de vraag die de agent net had gesteldIn het transcript staat een zin die de beller nooit zei, en de agent gaf daar antwoord op. Een correct transcript wijst op beslislogica.
Namen, productcodes of adressen worden verkeerd vastgelegdSpraakherkenningDezelfde termen in veel gesprekkenDezelfde verkeerde schrijfwijzen komen terug bij verschillende bellers.
Een stellig antwoord dat fout of verouderd isKennisDe bron achter het antwoord, en de datum daarvanHet materiaal van de agent zelf is fout of verouderd. Verouderde gegevens in uw eigen systeem horen bij de bedrijfskant.
“Die informatie heb ik niet” bij een veelgestelde vraagKennisOf het onderwerp in het materiaal van de agent staatDe vraag komt vaak voor in echte gesprekken en ontbreekt in het materiaal.
De agent vraagt opnieuw naar gegevens die de beller al gafBeslislogicaDe beurt waarin de beller antwoord gafHet transcript klopt, maar de volgende beurt van de agent negeert het.
De verkeerde persoon is aan de lijn en het script loopt gewoon doorBeslislogicaHoe de flow omgaat met een boekhouder, een familielid of een andere afdelingDe agent blijft vragen stellen die deze persoon niet kan beantwoorden, in plaats van te vragen wie de juiste persoon is.
De agent zegt dat de afspraak staat, maar in het CRM verschijnt nietsTools en systeemactiesHet log van de tool voor die beurt: verzoek, antwoord, record-IDEr kwam een foutmelding of geen record-ID terug, en de agent bevestigde toch. Ging er helemaal geen verzoek uit, dan wijst dat op beslislogica.
Na het doorverbinden vraagt uw collega de beller om opnieuw te beginnenOverdracht aan medewerkersWat de collega zag op het moment van doorverbindenDe samenvatting ontbrak, of kwam pas binnen nadat de collega had opgenomen.
Bellers worden aan het eind van het gesprek afgekaptBeslislogicaWie het gesprek beëindigde, en de laatste zin van de bellerDe agent hing op voordat de beller gedag zei. Een gesprek dat geen van beide kanten beëindigde, wijst op de lijn.
Het dashboard zegt opgelost, maar de klachten zeggen iets andersMetingEen steekproef van gesprekken die als opgelost zijn gemarkeerd, naast de definitie van de uitkomst gelegdDie gesprekken haalden de afgesproken uitkomst niet, of het waren voicemails.

Tel elk mislukt gesprek één keer, bij het eerste breekpunt

Zo analyseren we bij DRING mislukte gesprekken. Elk mislukt gesprek gaat de lagen in volgorde langs en krijgt één label: de eerste laag die brak. Een verkeerd verstane zin die tot een fout antwoord en daarna tot een mislukte boeking leidt, is één breekpunt in de spraakherkenning, geen drie problemen.

Met één waarde per gesprek komen de aantallen samen uit op het totale aantal mislukte gesprekken, en het grootste aantal laat zien waar één verbetering de meeste gesprekken kan terugwinnen.

Het gangbare alternatief is om elk symptoom te taggen, waar het ook opduikt. Op die manier geteld kregen de 200 mislukte gesprekken in het voorbeeld hieronder 355 tags. Beslislogica kreeg de meeste tags, 104, omdat een verkeerd verstane zin meestal ook het volgende antwoord fout maakt. Toch was beslislogica maar in 40 gesprekken het eerste breekpunt. Symptoomtags overlappen, hun totaal klopt niet met het aantal mislukte gesprekken en ze laten elke laag urgent lijken. Toon ze apart als dat helpt, maar bepaal de volgorde van verbeteringen op basis van eerste breekpunten.

De cijfers in dit deel zijn een voorbeeld voor dit artikel, geen data uit een echte implementatie.

Eerste laag die brakMislukte gesprekkenAandeel
Spraakherkenning6231%
Beslislogica4020%
Tools en systeemacties2412%
Bedrijfskant, geen AI-fout2211%
Audio en telefonie189%
Kennis147%
Overdracht aan medewerkers126%
Meting84%
Totaal200100%
Voorbeeld, geen data uit een echte implementatie: dezelfde 200 mislukte gesprekken op twee manieren geteld. Symptoomtags komen samen op 355 en zetten beslislogica bovenaan. Geteld per eerste breekpunt komt het totaal op 200 en staat spraakherkenning voorop, met 62 gesprekken.

In dit voorbeeld pakt u eerst de spraakherkenning aan: die is het eerste breekpunt in 62 van de 200 gesprekken. De 22 gesprekken aan de bedrijfskant zijn geen AI-fout. Geen enkele aanpassing aan de agent maakt een tijdslot vrij of werkt een verouderde prijslijst in uw eigen systeem bij.

Spraakherkenning: de meeste oplossingen zitten in de beslislogica

Het eerste breekpunt laat zien waar een gesprek ontspoorde, niet altijd waar de oplossing zit. Op een telefoonlijn zijn veel herkenningsfouten niet in de spraakherkenning zelf op te lossen: het geluid is gecomprimeerd, en een heftruck kan harder klinken dan de stem. Het gesprek moet kloppen, ook als de tekst fout is, en dat werk gebeurt in de beslislogica:

  • Beantwoord geen zin die niet past. Past de gehoorde tekst niet bij de vraag die de agent net stelde, dan doet de agent er niets mee en begint ook geen nieuw onderwerp. De agent zegt het niet goed te hebben verstaan en vraagt het opnieuw.
  • Houd bij wat vaak verkeerd wordt verstaan. Woorden die de spraakherkenning in echte gesprekken verkeerd verstaat, komen op een lijst, en de agent laat ze met een vraag bevestigen in plaats van te gokken.
  • Gebruik systeemgegevens. Is de bestelling of het record al bekend, dan leest de agent de gegevens voor en vraagt: “Gaat het hierom?”
  • Voeg als laatste een trefwoordenlijst toe. Een lijst met namen en producttermen is een goedkope instelling van de spraakherkenning, maar komt pas na de drie stappen hierboven.

Een voorbeeld geschreven voor dit artikel, geen echt gesprek: één verkeerd verstane beurt, op twee manieren afgehandeld.

BeurtWat er gezegd wordt
Agent“Uw bestelling wordt donderdag tussen negen en twaalf uur bezorgd. Komt dat u uit?”
Beller, in de auto“Ja, donderdag is prima. Kunt u hem afleveren bij de buren?”
Wat de spraakherkenning hoorde“Ja, donderdag is prima. Kunt u hem annuleren?”
Agent, slechte aanpak“Natuurlijk, ik heb uw bestelling geannuleerd. Kan ik u verder nog ergens mee helpen?”
Agent, goede aanpak“Dank u, donderdag dus. Sorry, het laatste stukje verstond ik niet goed. Wilt u dat nog een keer zeggen?”
Beller“Kunt u hem bij de buren afleveren als ik er niet ben?”
Agent“Geen probleem. Donderdag tussen negen en twaalf uur, en bent u er niet, dan leveren we hem af bij de buren.”

Het eerste antwoord maakt van een herkenningsfout een geannuleerde bestelling. Het tweede houdt vast wat past en vraagt de rest opnieuw. Meer over deze laag leest u in ons artikel over hoe voice-AI herstelt wat verkeerd is verstaan.

Tools en overdracht: vertrouw het log, niet de zin

Een agent die zegt “Uw afspraak staat ingepland”, heeft een zin uitgesproken, geen afspraak gemaakt. Controleer bij elke actie het log van de tool: ging het verzoek eruit, wat kwam er terug en was er een record-ID? De agent hoort een actie pas te bevestigen na een geslaagd antwoord. Onze gids over terugschrijven naar het CRM beschrijft wat een gesprek moet achterlaten.

Overdracht gaat net zo ongemerkt mis. Het doorverbinden lukt, maar de samenvatting komt te laat of helemaal niet. Luister naar de eerste seconden na elke doorverbinding. Vraagt uw collega waarom de beller belt, dan is de overdracht mislukt. Wat die context moet bevatten, leest u in onze gids over het ontwerp van de overdracht aan medewerkers.

Afsluiten: tel het afscheid

Veel flows beëindigen het gesprek na een vaste tijd of zodra de taak klaar is. In live gesprekken kapt dat mensen af, midden in een vraag of een bedankje. De agent hoort pas op te hangen als de beller gedag heeft gezegd.

Lees bij elk gesprek dat de agent beëindigde, de laatste zin van de beller vóór het ophangen. Zat daar een afscheid in? Het aandeel gesprekken zonder afscheid is uw afkappercentage, en dat hoort bij de beslislogica.

Verbeter één laag tegelijk

De tabel met eerste breekpunten bepaalt de volgorde van het werk:

  1. Kies de AI-laag met het hoogste aantal. De bedrijfskant gaat naar de eigenaar van dat proces.
  2. Breng één wijziging aan, gericht op die gesprekken. Bij breekpunten in de spraakherkenning zit die wijziging meestal in de beslislogica, zoals hierboven beschreven. Met twee wijzigingen tegelijk weet u niet welke heeft geholpen.
  3. Laat dezelfde mislukte gesprekken opnieuw lopen. Ze zijn nu uw regressieset: dezelfde zinnen van de beller en, waar mogelijk, dezelfde geluidsomstandigheden.
  4. Vergelijk het aantal eerste breekpunten voor en na bij hetzelfde soort verkeer: dezelfde campagne, hetzelfde type lijst of dezelfde uren voor inkomende gesprekken. Met een makkelijkere lijst lijkt elke wijziging goed.

Reken erop dat sommige gesprekken verschuiven in plaats van verdwijnen. Een gesprek dat nu door de spraakherkenning komt, kan verderop breken, bij de tools. Dat is vooruitgang: de volgende verbetering is nu zichtbaar. Agent Factory, de manier waarop DRING agents bouwt, test en verbetert, volgt dezelfde regel: één wijziging tegelijk, getest voordat die live gaat.

Waar DRING helpt

Valt een live flow tegen, breng die dan mee naar een terugbelgesprek. Zorg voor een steekproef van mislukte gesprekken, met opnames als uw beleid dat toelaat, en de uitkomst die elk gesprek had moeten halen. Ons team kan ze met u doorlopen zoals dit artikel beschrijft en kijken waar elk gesprek als eerste brak.

Wijzigingen die uw eigen systemen raken, worden apart afgebakend. Welke acties een agent in een CRM kan uitvoeren, hangt af van de editie van het CRM, de rechten en de API-toegang. Op DRING zijn extra analysevelden te definiëren, die terugkomen via de API, het CRM, het dashboard en de rapportages. Het eerste breekpunt kan een van die velden zijn.

Elke agent die DRING bouwt, doorloopt 1.000 tot 10.000 gesimuleerde gesprekken, gebouwd voor uw bedrijf, vóór het eerste echte gesprek. Toch laten live gesprekken zien wat de simulatie miste. Daarom begint verbeteren na de livegang bij echte bellers.

Vind de laag die faalt

Laat uw nummer achter en DRING belt u binnen twee minuten. Vertel welke flow tegenvalt, dan laat ons team u daarna weten waar u als eerste moet kijken.