Dobre demo, słabe rozmowy. Która warstwa zawiodła?
Państwa agent głosowy przeszedł każde demo, a w prawdziwych rozmowach sobie nie radzi. Same nieudane rozmowy pokazują, która warstwa zawodzi i co naprawić najpierw.
Krótka odpowiedź
Agent głosowy, który przeszedł demo, a zawodzi w rozmowach na żywo, nie stał się nagle gorszy. Rozmowy na żywo przechodzą przez te same siedem warstw co demo: od dźwięku na linii i rozpoznawania mowy po narzędzia, przekazanie do człowieka i pomiar. Demo po prostu nie sprawdziło warstwy, która teraz zawodzi w prawdziwych warunkach.
Dlatego nie warto zaczynać od przepisywania promptu. Lepiej wziąć prawdziwe nieudane rozmowy, przeprowadzić każdą z nich kolejno przez warstwy i przypisać ją do pierwszej warstwy, która zawiodła. Warstwa z największą liczbą rozmów to ta, która zawodzi, i to od niej trzeba zacząć naprawę. Po tej jednej poprawce należy ponownie przepuścić przez agenta te same rozmowy i porównać wyniki.
Ten artykuł dotyczy linii, która już działa produkcyjnie. Jeśli agent nie został jeszcze uruchomiony, warto zacząć od naszego poradnika o tym, jak testować voice AI przed uruchomieniem.
Dlaczego demo wypadło dobrze
Demo to test w cieplarnianych warunkach. Rozmówca zna skrypt, mówi wyraźnie w cichym pokoju i czeka, aż agent skończy. Dane testowe są czyste: zamówienie istnieje, a termin jest wolny.
Prawdziwi rozmówcy wchodzą w słowo. Dzwonią z samochodu albo z magazynu, używają lokalnych określeń i skrótów, pytają też o pokrewne sprawy, na które scenariusz rozmowy nie był przygotowany. Czasem to w ogóle nie jest osoba, której spodziewał się scenariusz: zamiast właściciela odbiera księgowa, telefon podnosi ktoś z rodziny albo połączenie trafia do innego działu.
Każdy z tych warunków sprawdza inną warstwę. Dobre demo pokazuje, że warstwy działają na czystych danych, ale nie pokazuje, która z nich zawiedzie pierwsza przy prawdziwym ruchu.
Siedem warstw, przez które przechodzi rozmowa
Każda rozmowa przechodzi przez te same warstwy w tej samej kolejności. Usterka we wcześniejszej warstwie wywołuje objawy w kolejnych, dlatego same objawy często wskazują złe miejsce.
- Dźwięk na linii i telefonia: połączenie zostaje nawiązane, dźwięk płynie w obie strony bez opóźnień i echa, a rozmowa kończy się prawidłowo.
- Rozpoznawanie mowy: to, co powiedział rozmówca, zamienia się w tekst.
- Wiedza: fakty, z których agent może korzystać, na przykład zasady, informacje o produktach i odpowiedzi na częste pytania.
- Decyzje: logika rozmowy, czyli co powiedzieć lub o co zapytać w następnej kolejności, kiedy potwierdzić, kiedy przekazać rozmowę i jak ją zakończyć.
- Narzędzia i działania w systemach: odczyty i zapisy w CRM, systemie rezerwacji albo systemie zgłoszeń.
- Przekazanie do człowieka: przełączenie albo oddzwonienie oraz kontekst, który dostaje osoba z Państwa zespołu.
- Pomiar: zapisany wynik zgadza się z tym, co naprawdę się wydarzyło.
Jest jeszcze jedno miejsce, w którym rozmowa może się nie udać, choć nie jest to warstwa AI. Część rozmów kończy się niepowodzeniem po stronie firmy: brakuje towaru, nie ma wolnego terminu albo dane w Państwa własnym systemie są nieaktualne. Agent zrobił swoje, ale firma nie mogła dać klientowi tego, czego chciał. Takie rozmowy warto liczyć osobno i przekazywać osobie odpowiedzialnej za dany proces.
Prawdziwi rozmówcy zamiast arkusza testów
Punktem wyjścia są wszystkie prawdziwe rozmowy z ostatniego okresu, a nie scenariusze z arkusza testów. Potem trzeba usunąć wewnętrzne rozmowy testowe: ten sam numer i te same wyuczone kwestie, powtarzane w odstępie kilku minut. Tester nie mówi jak prawdziwy rozmówca.
Następnie warto sprawdzić etykiety wyników na próbce. Jeśli połączenia, które trafiły na pocztę głosową, liczą się jako rozmowy albo udane rezerwacje jako niepowodzenia, błędny jest już sam zbiór nieudanych rozmów. Pomiar to ostatnia warstwa, ale sprawdza się go jako pierwszy.
Na koniec trzeba odsłuchać nagrania. Transkrypcja pokazuje, co rozpoznał system, a dopiero nagranie pokazuje, co rozmówca naprawdę powiedział.
Od objawu do warstwy w jednej tabeli
Tabelę stosuje się do jednej nieudanej rozmowy naraz, a warstwę przypisuje się dopiero po znalezieniu dowodu.
| Objaw | Prawdopodobna warstwa | Co sprawdzić | Dowód, który to potwierdza |
|---|---|---|---|
| Połączenia wychodzące kończą się w pierwszych sekundach | Dźwięk na linii i telefonia | Czas od odebrania do pierwszego słowa agenta | Ludzie rozłączają się po chwili ciszy, zanim agent się odezwie. Rozłączenia w trakcie powitania wskazują na warstwę decyzji. |
| Długa cisza po tym, jak rozmówca skończy mówić | Dźwięk na linii i telefonia albo narzędzia | Przerwa przed każdą odpowiedzią agenta | Przerwy przy każdej wypowiedzi wskazują na linię. Przerwy tylko przy wypowiedziach ze sprawdzeniem w systemie wskazują na narzędzia. |
| Agent urywa w pół zdania, choć nikt się nie odezwał | Dźwięk na linii i telefonia | Każde urwanie zestawione z nagraniem | Agent milknie, gdy słyszy hałas z ulicy, pracę maszyn albo własne echo. |
| Rozmówcy powtarzają to samo | Rozpoznawanie mowy | Transkrypcja pierwszej próby zestawiona z nagraniem | Na nagraniu mowa jest wyraźna, a transkrypcja błędna albo pusta. |
| Agent odpowiada na pytanie, którego nikt nie zadał | Rozpoznawanie mowy | Rozpoznany tekst zestawiony z pytaniem, które agent przed chwilą zadał | W transkrypcji jest zdanie, którego rozmówca nie powiedział, a agent na nie odpowiedział. Jeśli transkrypcja jest poprawna, problem leży w warstwie decyzji. |
| Nazwiska, kody produktów albo adresy są zapisywane błędnie | Rozpoznawanie mowy | Te same określenia w wielu rozmowach | Te same błędne formy powtarzają się u różnych rozmówców. |
| Pewna siebie odpowiedź, która jest błędna lub nieaktualna | Wiedza | Źródło odpowiedzi i jego data | Błędny lub nieaktualny jest sam materiał agenta. Nieaktualne dane w Państwa systemie to sprawa po stronie firmy. |
| „Nie mam tej informacji” przy częstym pytaniu | Wiedza | Czy ten temat w ogóle jest w materiałach agenta | Pytanie często pada w prawdziwych rozmowach, a w materiałach go brakuje. |
| Agent znowu pyta o dane, które rozmówca już podał | Decyzje | Wypowiedź, w której rozmówca odpowiedział | Transkrypcja jest poprawna, a kolejna wypowiedź agenta ją pomija. |
| Na linii jest niewłaściwa osoba, a agent dalej trzyma się skryptu | Decyzje | Jak scenariusz rozmowy radzi sobie z księgową, kimś z rodziny albo innym działem | Agent dalej zadaje pytania, na które ta osoba nie zna odpowiedzi, zamiast zapytać, z kim może porozmawiać. |
| Agent mówi, że zarezerwował termin, ale w CRM nic się nie pojawia | Narzędzia i działania w systemach | Log narzędzia dla tej wypowiedzi: zapytanie, odpowiedź, ID rekordu | Wrócił błąd albo nie wróciło ID rekordu, a agent i tak potwierdził. Jeśli zapytanie w ogóle nie zostało wysłane, problem leży w warstwie decyzji. |
| Po przełączeniu konsultant prosi rozmówcę, żeby zaczął od początku | Przekazanie do człowieka | Co konsultant widział w chwili przełączenia | Podsumowania nie było albo dotarło dopiero wtedy, gdy konsultant już odebrał. |
| Rozmówcy są rozłączani pod koniec rozmowy | Decyzje | Kto zakończył rozmowę i jakie było ostatnie zdanie rozmówcy | Agent się rozłączył, zanim rozmówca się pożegnał. Rozmowa, której nie zakończyła żadna ze stron, wskazuje na linię. |
| W panelu sprawa jest rozwiązana, a skargi mówią co innego | Pomiar | Próbka rozmów oznaczonych jako rozwiązane, zestawiona z definicją wyniku | Te rozmowy nie osiągnęły uzgodnionego wyniku albo trafiły na pocztę głosową. |
Każdą nieudaną rozmowę liczy się raz, przy pierwszej usterce
Tak w DRING analizujemy nieudane rozmowy. Każda z nich przechodzi kolejno przez warstwy i dostaje jedną etykietę: pierwszą warstwę, która zawiodła. Źle usłyszane zdanie, które prowadzi do błędnej odpowiedzi, a potem do nieudanej rezerwacji, to jedna usterka rozpoznawania mowy, a nie trzy problemy.
Gdy każda rozmowa ma tylko jedną etykietę, liczby sumują się do łącznej liczby nieudanych rozmów, a największa z nich pokazuje, gdzie jedna poprawka może odzyskać najwięcej rozmów.
Popularna alternatywa to tagowanie każdego objawu wszędzie, gdzie się pojawi. Przy takim liczeniu 200 nieudanych rozmów z przykładu poniżej dostało 355 tagów. Najwięcej, 104, zebrała warstwa decyzji, bo źle usłyszane zdanie zwykle psuje też kolejną odpowiedź. A przecież była miejscem pierwszej usterki tylko w 40 rozmowach. Tagi objawów nakładają się na siebie, ich suma nie zgadza się z liczbą nieudanych rozmów, a każda warstwa wygląda przez nie na pilną. Można je pokazywać osobno, jeśli się przydają, ale kolejność poprawek warto ustalać według pierwszych usterek.
Liczby w tej części to przykład przygotowany na potrzeby artykułu, a nie dane z prawdziwego wdrożenia.
| Pierwsza warstwa, która zawiodła | Nieudane rozmowy | Udział |
|---|---|---|
| Rozpoznawanie mowy | 62 | 31% |
| Decyzje | 40 | 20% |
| Narzędzia i działania w systemach | 24 | 12% |
| Po stronie firmy, nie usterka AI | 22 | 11% |
| Dźwięk na linii i telefonia | 18 | 9% |
| Wiedza | 14 | 7% |
| Przekazanie do człowieka | 12 | 6% |
| Pomiar | 8 | 4% |
| Razem | 200 | 100% |
W tym przykładzie pracę trzeba zacząć od rozpoznawania mowy: to tam pojawia się pierwsza usterka w 62 z 200 rozmów. Z kolei 22 rozmowy po stronie firmy nie świadczą o usterce AI. Żadna zmiana w agencie nie stworzy wolnego terminu ani nie poprawi nieaktualnego cennika w Państwa systemie.
Błędy rozpoznawania mowy naprawia się głównie w warstwie decyzji
Pierwsza usterka pokazuje, gdzie rozmowa zboczyła z kursu, ale nie zawsze, gdzie trzeba wprowadzić poprawkę. Na linii telefonicznej wielu błędów rozpoznawania nie da się naprawić w samej warstwie rozpoznawania mowy: dźwięk jest skompresowany, a wózek widłowy bywa głośniejszy niż głos rozmówcy. Rozmowa musi przebiegać poprawnie także wtedy, gdy tekst jest błędny, a to zadanie warstwy decyzji:
- Nie odpowiadać na zdanie, które nie pasuje. Gdy rozpoznany tekst nie pasuje do pytania, które agent przed chwilą zadał, agent nie podejmuje na jego podstawie działania ani nie otwiera nowego tematu. Mówi, że nie dosłyszał, i pyta jeszcze raz.
- Prowadzić listę typowych przekłamań. Słowa, które rozpoznawanie mowy w prawdziwych rozmowach zapisuje błędnie, trafiają na listę, a agent, zamiast zgadywać, potwierdza je pytaniem.
- Korzystać z danych w systemie. Gdy system zna już zamówienie albo rekord, agent odczytuje te dane na głos i pyta: „Czy o to chodzi?”
- Listę słów kluczowych dodać na końcu. Lista nazw i określeń produktowych to tania zmiana w ustawieniach rozpoznawania mowy, ale jej kolej przychodzi dopiero po trzech powyższych krokach.
Przykład napisany na potrzeby tego artykułu, a nie zapis prawdziwej rozmowy: jedna źle usłyszana wypowiedź i dwie możliwe reakcje agenta.
| Kto mówi | Wypowiedź |
|---|---|
| Agent | „Zamówienie dotrze w czwartek między 9:00 a 12:00. Czy ten termin Panu pasuje?” |
| Rozmówca, za kierownicą | „Tak, czwartek pasuje. A sąsiad może odebrać zamówienie?” |
| Tekst z rozpoznawania mowy | „Tak, czwartek pasuje. A czy mogę odwołać zamówienie?” |
| Agent, wersja błędna | „Oczywiście, zamówienie jest już odwołane. Czy mogę jeszcze w czymś pomóc?” |
| Agent, wersja poprawna | „Dziękuję, czyli czwartek. Przepraszam, końcówka mi umknęła. Może Pan powtórzyć?” |
| Rozmówca | „Czy sąsiad może je odebrać, jak mnie nie będzie w domu?” |
| Agent | „Nie ma problemu. Czwartek między 9:00 a 12:00, a jeśli nie będzie Pana w domu, zostawimy paczkę u sąsiada.” |
Pierwsza odpowiedź zamienia błąd rozpoznawania mowy w odwołane zamówienie. Druga zachowuje to, co pasuje, i dopytuje o resztę. Więcej o tej warstwie w artykule o tym, jak voice AI poprawia to, co źle usłyszy.
W narzędziach i przekazaniu liczy się log, a nie zdanie
Gdy agent mówi „Wizyta jest umówiona”, powstaje zdanie, a nie rezerwacja. Przy każdym działaniu trzeba sprawdzić log narzędzia: czy zapytanie zostało wysłane, co wróciło i czy jest ID rekordu? Agent powinien potwierdzać działanie dopiero po udanej odpowiedzi systemu. Nasz poradnik o zapisie wyniku w CRM opisuje, co rozmowa powinna po sobie zostawić.
Przekazanie zawodzi równie po cichu. Przełączenie następuje, ale podsumowanie dociera za późno albo wcale. Warto odsłuchać pierwsze sekundy po każdym przełączeniu. Jeśli konsultant pyta rozmówcę, w jakiej sprawie dzwoni, przekazanie się nie udało. Co powinien zawierać kontekst, opisujemy w tekście o projektowaniu przekazania do człowieka.
Na końcu rozmowy liczy się pożegnanie
Wiele scenariuszy kończy rozmowę po upływie ustalonego czasu albo zaraz po wykonaniu zadania. W rozmowach na żywo ucina to ludziom pytanie albo podziękowanie w pół słowa. Agent nie powinien się rozłączać, zanim usłyszy pożegnanie rozmówcy.
W każdej rozmowie zakończonej przez agenta warto przeczytać ostatnie zdanie rozmówcy przed rozłączeniem. Czy było w nim pożegnanie? Odsetek rozmów bez pożegnania to Państwa wskaźnik uciętych rozmów, a odpowiada za niego warstwa decyzji.
Naprawa warstwa po warstwie
Tabela pierwszych usterek wyznacza kolejność prac:
- Wybrać warstwę AI z największą liczbą rozmów. Rozmowy po stronie firmy trafiają do osoby odpowiedzialnej za dany proces.
- Wprowadzić jedną zmianę, która ma naprawić te rozmowy. Przy usterkach rozpoznawania mowy wprowadza się ją zwykle w warstwie decyzji, jak opisano wyżej. Przy dwóch zmianach naraz nie wiadomo, która z nich pomogła.
- Ponownie przepuścić przez agenta te same nieudane rozmowy. Od teraz tworzą one Państwa zestaw testów regresji: te same wypowiedzi rozmówców i, tam gdzie to możliwe, te same warunki dźwiękowe.
- Porównać liczby pierwszych usterek przed zmianą i po niej przy takim samym ruchu: tej samej kampanii, tym samym typie listy albo tych samych godzinach połączeń przychodzących. Przy łatwiejszej liście każda zmiana wygląda dobrze.
Trzeba się liczyć z tym, że część rozmów nie zniknie, tylko przesunie się dalej. Rozmowa, która teraz przechodzi przez rozpoznawanie mowy, może zawieść później, w warstwie narzędzi. To postęp: widać już następną poprawkę. Agent Factory, czyli sposób, w jaki DRING buduje, testuje i ulepsza agentów, działa według tej samej zasady: jedna zmiana naraz, przetestowana przed wydaniem.
Gdzie pomaga DRING
Jeśli działający proces daje słabsze wyniki, niż powinien, warto poprosić o telefon i omówić go z nami. Dobrze mieć wtedy pod ręką próbkę nieudanych rozmów, z nagraniami, jeśli pozwalają na to Państwa zasady, oraz wynik, jaki każda z nich powinna osiągnąć. Nasz zespół może przejść przez nie razem z Państwem w sposób opisany w tym artykule i sprawdzić, gdzie w każdej z nich pojawiła się pierwsza usterka.
Zakres zmian, które dotyczą Państwa własnych systemów, ustalamy osobno. To, jakie działania agent może wykonać w CRM, zależy od wersji CRM, uprawnień i dostępu do API. W DRING można zdefiniować dodatkowe pola analizy i otrzymywać je przez API, w CRM, w panelu i w raportach. Jednym z nich może być pierwsza warstwa, która zawiodła.
Każdy agent zbudowany przez DRING przechodzi przed pierwszą prawdziwą rozmową od 1 000 do 10 000 symulowanych rozmów przygotowanych dla Państwa firmy. Rozmowy na żywo i tak pokazują to, co umknęło symulacji, dlatego ulepszanie po uruchomieniu zaczyna się od prawdziwych rozmówców.
Znajdźmy warstwę, która zawodzi
Wystarczy zostawić numer, a DRING oddzwoni w dwie minuty. W rozmowie warto powiedzieć, który proces działa słabiej, a nasz zespół wróci z informacją, od czego zacząć szukanie.