Przejdź do treści
Wystarczy opisać jeden proces. DRING oddzwoni w dwie minuty i rozpozna potrzebę. Zadzwonimy w dwie minuty
Zadzwonimy w 2 minuty Poznaj Agent Factory
Operacje voice AI · Diagnoza rozmów na żywo

Dobre demo, słabe rozmowy. Która warstwa zawiodła?

Państwa agent głosowy przeszedł każde demo, a w prawdziwych rozmowach sobie nie radzi. Same nieudane rozmowy pokazują, która warstwa zawodzi i co naprawić najpierw.

Krótka odpowiedź

Agent głosowy, który przeszedł demo, a zawodzi w rozmowach na żywo, nie stał się nagle gorszy. Rozmowy na żywo przechodzą przez te same siedem warstw co demo: od dźwięku na linii i rozpoznawania mowy po narzędzia, przekazanie do człowieka i pomiar. Demo po prostu nie sprawdziło warstwy, która teraz zawodzi w prawdziwych warunkach.

Dlatego nie warto zaczynać od przepisywania promptu. Lepiej wziąć prawdziwe nieudane rozmowy, przeprowadzić każdą z nich kolejno przez warstwy i przypisać ją do pierwszej warstwy, która zawiodła. Warstwa z największą liczbą rozmów to ta, która zawodzi, i to od niej trzeba zacząć naprawę. Po tej jednej poprawce należy ponownie przepuścić przez agenta te same rozmowy i porównać wyniki.

Ten artykuł dotyczy linii, która już działa produkcyjnie. Jeśli agent nie został jeszcze uruchomiony, warto zacząć od naszego poradnika o tym, jak testować voice AI przed uruchomieniem.

Dlaczego demo wypadło dobrze

Demo to test w cieplarnianych warunkach. Rozmówca zna skrypt, mówi wyraźnie w cichym pokoju i czeka, aż agent skończy. Dane testowe są czyste: zamówienie istnieje, a termin jest wolny.

Prawdziwi rozmówcy wchodzą w słowo. Dzwonią z samochodu albo z magazynu, używają lokalnych określeń i skrótów, pytają też o pokrewne sprawy, na które scenariusz rozmowy nie był przygotowany. Czasem to w ogóle nie jest osoba, której spodziewał się scenariusz: zamiast właściciela odbiera księgowa, telefon podnosi ktoś z rodziny albo połączenie trafia do innego działu.

Każdy z tych warunków sprawdza inną warstwę. Dobre demo pokazuje, że warstwy działają na czystych danych, ale nie pokazuje, która z nich zawiedzie pierwsza przy prawdziwym ruchu.

Siedem warstw, przez które przechodzi rozmowa

Każda rozmowa przechodzi przez te same warstwy w tej samej kolejności. Usterka we wcześniejszej warstwie wywołuje objawy w kolejnych, dlatego same objawy często wskazują złe miejsce.

  • Dźwięk na linii i telefonia: połączenie zostaje nawiązane, dźwięk płynie w obie strony bez opóźnień i echa, a rozmowa kończy się prawidłowo.
  • Rozpoznawanie mowy: to, co powiedział rozmówca, zamienia się w tekst.
  • Wiedza: fakty, z których agent może korzystać, na przykład zasady, informacje o produktach i odpowiedzi na częste pytania.
  • Decyzje: logika rozmowy, czyli co powiedzieć lub o co zapytać w następnej kolejności, kiedy potwierdzić, kiedy przekazać rozmowę i jak ją zakończyć.
  • Narzędzia i działania w systemach: odczyty i zapisy w CRM, systemie rezerwacji albo systemie zgłoszeń.
  • Przekazanie do człowieka: przełączenie albo oddzwonienie oraz kontekst, który dostaje osoba z Państwa zespołu.
  • Pomiar: zapisany wynik zgadza się z tym, co naprawdę się wydarzyło.

Jest jeszcze jedno miejsce, w którym rozmowa może się nie udać, choć nie jest to warstwa AI. Część rozmów kończy się niepowodzeniem po stronie firmy: brakuje towaru, nie ma wolnego terminu albo dane w Państwa własnym systemie są nieaktualne. Agent zrobił swoje, ale firma nie mogła dać klientowi tego, czego chciał. Takie rozmowy warto liczyć osobno i przekazywać osobie odpowiedzialnej za dany proces.

Każda rozmowa przechodzi kolejno przez te same siedem warstw. Nieudaną rozmowę liczy się raz, przy pierwszej usterce. Straty po stronie firmy liczy się osobno.

Prawdziwi rozmówcy zamiast arkusza testów

Punktem wyjścia są wszystkie prawdziwe rozmowy z ostatniego okresu, a nie scenariusze z arkusza testów. Potem trzeba usunąć wewnętrzne rozmowy testowe: ten sam numer i te same wyuczone kwestie, powtarzane w odstępie kilku minut. Tester nie mówi jak prawdziwy rozmówca.

Następnie warto sprawdzić etykiety wyników na próbce. Jeśli połączenia, które trafiły na pocztę głosową, liczą się jako rozmowy albo udane rezerwacje jako niepowodzenia, błędny jest już sam zbiór nieudanych rozmów. Pomiar to ostatnia warstwa, ale sprawdza się go jako pierwszy.

Na koniec trzeba odsłuchać nagrania. Transkrypcja pokazuje, co rozpoznał system, a dopiero nagranie pokazuje, co rozmówca naprawdę powiedział.

Od objawu do warstwy w jednej tabeli

Tabelę stosuje się do jednej nieudanej rozmowy naraz, a warstwę przypisuje się dopiero po znalezieniu dowodu.

ObjawPrawdopodobna warstwaCo sprawdzićDowód, który to potwierdza
Połączenia wychodzące kończą się w pierwszych sekundachDźwięk na linii i telefoniaCzas od odebrania do pierwszego słowa agentaLudzie rozłączają się po chwili ciszy, zanim agent się odezwie. Rozłączenia w trakcie powitania wskazują na warstwę decyzji.
Długa cisza po tym, jak rozmówca skończy mówićDźwięk na linii i telefonia albo narzędziaPrzerwa przed każdą odpowiedzią agentaPrzerwy przy każdej wypowiedzi wskazują na linię. Przerwy tylko przy wypowiedziach ze sprawdzeniem w systemie wskazują na narzędzia.
Agent urywa w pół zdania, choć nikt się nie odezwałDźwięk na linii i telefoniaKażde urwanie zestawione z nagraniemAgent milknie, gdy słyszy hałas z ulicy, pracę maszyn albo własne echo.
Rozmówcy powtarzają to samoRozpoznawanie mowyTranskrypcja pierwszej próby zestawiona z nagraniemNa nagraniu mowa jest wyraźna, a transkrypcja błędna albo pusta.
Agent odpowiada na pytanie, którego nikt nie zadałRozpoznawanie mowyRozpoznany tekst zestawiony z pytaniem, które agent przed chwilą zadałW transkrypcji jest zdanie, którego rozmówca nie powiedział, a agent na nie odpowiedział. Jeśli transkrypcja jest poprawna, problem leży w warstwie decyzji.
Nazwiska, kody produktów albo adresy są zapisywane błędnieRozpoznawanie mowyTe same określenia w wielu rozmowachTe same błędne formy powtarzają się u różnych rozmówców.
Pewna siebie odpowiedź, która jest błędna lub nieaktualnaWiedzaŹródło odpowiedzi i jego dataBłędny lub nieaktualny jest sam materiał agenta. Nieaktualne dane w Państwa systemie to sprawa po stronie firmy.
„Nie mam tej informacji” przy częstym pytaniuWiedzaCzy ten temat w ogóle jest w materiałach agentaPytanie często pada w prawdziwych rozmowach, a w materiałach go brakuje.
Agent znowu pyta o dane, które rozmówca już podałDecyzjeWypowiedź, w której rozmówca odpowiedziałTranskrypcja jest poprawna, a kolejna wypowiedź agenta ją pomija.
Na linii jest niewłaściwa osoba, a agent dalej trzyma się skryptuDecyzjeJak scenariusz rozmowy radzi sobie z księgową, kimś z rodziny albo innym działemAgent dalej zadaje pytania, na które ta osoba nie zna odpowiedzi, zamiast zapytać, z kim może porozmawiać.
Agent mówi, że zarezerwował termin, ale w CRM nic się nie pojawiaNarzędzia i działania w systemachLog narzędzia dla tej wypowiedzi: zapytanie, odpowiedź, ID rekorduWrócił błąd albo nie wróciło ID rekordu, a agent i tak potwierdził. Jeśli zapytanie w ogóle nie zostało wysłane, problem leży w warstwie decyzji.
Po przełączeniu konsultant prosi rozmówcę, żeby zaczął od początkuPrzekazanie do człowiekaCo konsultant widział w chwili przełączeniaPodsumowania nie było albo dotarło dopiero wtedy, gdy konsultant już odebrał.
Rozmówcy są rozłączani pod koniec rozmowyDecyzjeKto zakończył rozmowę i jakie było ostatnie zdanie rozmówcyAgent się rozłączył, zanim rozmówca się pożegnał. Rozmowa, której nie zakończyła żadna ze stron, wskazuje na linię.
W panelu sprawa jest rozwiązana, a skargi mówią co innegoPomiarPróbka rozmów oznaczonych jako rozwiązane, zestawiona z definicją wynikuTe rozmowy nie osiągnęły uzgodnionego wyniku albo trafiły na pocztę głosową.

Każdą nieudaną rozmowę liczy się raz, przy pierwszej usterce

Tak w DRING analizujemy nieudane rozmowy. Każda z nich przechodzi kolejno przez warstwy i dostaje jedną etykietę: pierwszą warstwę, która zawiodła. Źle usłyszane zdanie, które prowadzi do błędnej odpowiedzi, a potem do nieudanej rezerwacji, to jedna usterka rozpoznawania mowy, a nie trzy problemy.

Gdy każda rozmowa ma tylko jedną etykietę, liczby sumują się do łącznej liczby nieudanych rozmów, a największa z nich pokazuje, gdzie jedna poprawka może odzyskać najwięcej rozmów.

Popularna alternatywa to tagowanie każdego objawu wszędzie, gdzie się pojawi. Przy takim liczeniu 200 nieudanych rozmów z przykładu poniżej dostało 355 tagów. Najwięcej, 104, zebrała warstwa decyzji, bo źle usłyszane zdanie zwykle psuje też kolejną odpowiedź. A przecież była miejscem pierwszej usterki tylko w 40 rozmowach. Tagi objawów nakładają się na siebie, ich suma nie zgadza się z liczbą nieudanych rozmów, a każda warstwa wygląda przez nie na pilną. Można je pokazywać osobno, jeśli się przydają, ale kolejność poprawek warto ustalać według pierwszych usterek.

Liczby w tej części to przykład przygotowany na potrzeby artykułu, a nie dane z prawdziwego wdrożenia.

Pierwsza warstwa, która zawiodłaNieudane rozmowyUdział
Rozpoznawanie mowy6231%
Decyzje4020%
Narzędzia i działania w systemach2412%
Po stronie firmy, nie usterka AI2211%
Dźwięk na linii i telefonia189%
Wiedza147%
Przekazanie do człowieka126%
Pomiar84%
Razem200100%
Przykład, nie dane z prawdziwego wdrożenia: te same 200 nieudanych rozmów policzone na dwa sposoby. Tagi objawów sumują się do 355, a na czele jest warstwa decyzji. Pierwsze usterki sumują się do 200, a na pierwszym miejscu jest rozpoznawanie mowy z 62 rozmowami.

W tym przykładzie pracę trzeba zacząć od rozpoznawania mowy: to tam pojawia się pierwsza usterka w 62 z 200 rozmów. Z kolei 22 rozmowy po stronie firmy nie świadczą o usterce AI. Żadna zmiana w agencie nie stworzy wolnego terminu ani nie poprawi nieaktualnego cennika w Państwa systemie.

Błędy rozpoznawania mowy naprawia się głównie w warstwie decyzji

Pierwsza usterka pokazuje, gdzie rozmowa zboczyła z kursu, ale nie zawsze, gdzie trzeba wprowadzić poprawkę. Na linii telefonicznej wielu błędów rozpoznawania nie da się naprawić w samej warstwie rozpoznawania mowy: dźwięk jest skompresowany, a wózek widłowy bywa głośniejszy niż głos rozmówcy. Rozmowa musi przebiegać poprawnie także wtedy, gdy tekst jest błędny, a to zadanie warstwy decyzji:

  • Nie odpowiadać na zdanie, które nie pasuje. Gdy rozpoznany tekst nie pasuje do pytania, które agent przed chwilą zadał, agent nie podejmuje na jego podstawie działania ani nie otwiera nowego tematu. Mówi, że nie dosłyszał, i pyta jeszcze raz.
  • Prowadzić listę typowych przekłamań. Słowa, które rozpoznawanie mowy w prawdziwych rozmowach zapisuje błędnie, trafiają na listę, a agent, zamiast zgadywać, potwierdza je pytaniem.
  • Korzystać z danych w systemie. Gdy system zna już zamówienie albo rekord, agent odczytuje te dane na głos i pyta: „Czy o to chodzi?”
  • Listę słów kluczowych dodać na końcu. Lista nazw i określeń produktowych to tania zmiana w ustawieniach rozpoznawania mowy, ale jej kolej przychodzi dopiero po trzech powyższych krokach.

Przykład napisany na potrzeby tego artykułu, a nie zapis prawdziwej rozmowy: jedna źle usłyszana wypowiedź i dwie możliwe reakcje agenta.

Kto mówiWypowiedź
Agent„Zamówienie dotrze w czwartek między 9:00 a 12:00. Czy ten termin Panu pasuje?”
Rozmówca, za kierownicą„Tak, czwartek pasuje. A sąsiad może odebrać zamówienie?”
Tekst z rozpoznawania mowy„Tak, czwartek pasuje. A czy mogę odwołać zamówienie?”
Agent, wersja błędna„Oczywiście, zamówienie jest już odwołane. Czy mogę jeszcze w czymś pomóc?”
Agent, wersja poprawna„Dziękuję, czyli czwartek. Przepraszam, końcówka mi umknęła. Może Pan powtórzyć?”
Rozmówca„Czy sąsiad może je odebrać, jak mnie nie będzie w domu?”
Agent„Nie ma problemu. Czwartek między 9:00 a 12:00, a jeśli nie będzie Pana w domu, zostawimy paczkę u sąsiada.”

Pierwsza odpowiedź zamienia błąd rozpoznawania mowy w odwołane zamówienie. Druga zachowuje to, co pasuje, i dopytuje o resztę. Więcej o tej warstwie w artykule o tym, jak voice AI poprawia to, co źle usłyszy.

W narzędziach i przekazaniu liczy się log, a nie zdanie

Gdy agent mówi „Wizyta jest umówiona”, powstaje zdanie, a nie rezerwacja. Przy każdym działaniu trzeba sprawdzić log narzędzia: czy zapytanie zostało wysłane, co wróciło i czy jest ID rekordu? Agent powinien potwierdzać działanie dopiero po udanej odpowiedzi systemu. Nasz poradnik o zapisie wyniku w CRM opisuje, co rozmowa powinna po sobie zostawić.

Przekazanie zawodzi równie po cichu. Przełączenie następuje, ale podsumowanie dociera za późno albo wcale. Warto odsłuchać pierwsze sekundy po każdym przełączeniu. Jeśli konsultant pyta rozmówcę, w jakiej sprawie dzwoni, przekazanie się nie udało. Co powinien zawierać kontekst, opisujemy w tekście o projektowaniu przekazania do człowieka.

Na końcu rozmowy liczy się pożegnanie

Wiele scenariuszy kończy rozmowę po upływie ustalonego czasu albo zaraz po wykonaniu zadania. W rozmowach na żywo ucina to ludziom pytanie albo podziękowanie w pół słowa. Agent nie powinien się rozłączać, zanim usłyszy pożegnanie rozmówcy.

W każdej rozmowie zakończonej przez agenta warto przeczytać ostatnie zdanie rozmówcy przed rozłączeniem. Czy było w nim pożegnanie? Odsetek rozmów bez pożegnania to Państwa wskaźnik uciętych rozmów, a odpowiada za niego warstwa decyzji.

Naprawa warstwa po warstwie

Tabela pierwszych usterek wyznacza kolejność prac:

  1. Wybrać warstwę AI z największą liczbą rozmów. Rozmowy po stronie firmy trafiają do osoby odpowiedzialnej za dany proces.
  2. Wprowadzić jedną zmianę, która ma naprawić te rozmowy. Przy usterkach rozpoznawania mowy wprowadza się ją zwykle w warstwie decyzji, jak opisano wyżej. Przy dwóch zmianach naraz nie wiadomo, która z nich pomogła.
  3. Ponownie przepuścić przez agenta te same nieudane rozmowy. Od teraz tworzą one Państwa zestaw testów regresji: te same wypowiedzi rozmówców i, tam gdzie to możliwe, te same warunki dźwiękowe.
  4. Porównać liczby pierwszych usterek przed zmianą i po niej przy takim samym ruchu: tej samej kampanii, tym samym typie listy albo tych samych godzinach połączeń przychodzących. Przy łatwiejszej liście każda zmiana wygląda dobrze.

Trzeba się liczyć z tym, że część rozmów nie zniknie, tylko przesunie się dalej. Rozmowa, która teraz przechodzi przez rozpoznawanie mowy, może zawieść później, w warstwie narzędzi. To postęp: widać już następną poprawkę. Agent Factory, czyli sposób, w jaki DRING buduje, testuje i ulepsza agentów, działa według tej samej zasady: jedna zmiana naraz, przetestowana przed wydaniem.

Gdzie pomaga DRING

Jeśli działający proces daje słabsze wyniki, niż powinien, warto poprosić o telefon i omówić go z nami. Dobrze mieć wtedy pod ręką próbkę nieudanych rozmów, z nagraniami, jeśli pozwalają na to Państwa zasady, oraz wynik, jaki każda z nich powinna osiągnąć. Nasz zespół może przejść przez nie razem z Państwem w sposób opisany w tym artykule i sprawdzić, gdzie w każdej z nich pojawiła się pierwsza usterka.

Zakres zmian, które dotyczą Państwa własnych systemów, ustalamy osobno. To, jakie działania agent może wykonać w CRM, zależy od wersji CRM, uprawnień i dostępu do API. W DRING można zdefiniować dodatkowe pola analizy i otrzymywać je przez API, w CRM, w panelu i w raportach. Jednym z nich może być pierwsza warstwa, która zawiodła.

Każdy agent zbudowany przez DRING przechodzi przed pierwszą prawdziwą rozmową od 1 000 do 10 000 symulowanych rozmów przygotowanych dla Państwa firmy. Rozmowy na żywo i tak pokazują to, co umknęło symulacji, dlatego ulepszanie po uruchomieniu zaczyna się od prawdziwych rozmówców.

Znajdźmy warstwę, która zawodzi

Wystarczy zostawić numer, a DRING oddzwoni w dwie minuty. W rozmowie warto powiedzieć, który proces działa słabiej, a nasz zespół wróci z informacją, od czego zacząć szukanie.