Dlaczego agent AI odpowiada z opóźnieniem
Cisza po tym, jak rozmówca skończy mówić, to suma sześciu składników. Warto mierzyć każdą wypowiedź, przyglądać się najwolniejszym i poprawiać ten składnik, który zajmuje najwięcej czasu.
Krótka odpowiedź
Gdy rozmówca kończy mówić i słyszy ciszę, rzadko stoi za nią jeden powolny element. Ta pauza to suma sześciu składników: Wykrycie końca, Transkrypcja, Odpowiedź modelu, Sprawdzanie, Start głosu i Linia. Sprawdzanie pojawia się tylko w wypowiedziach ze sprawdzeniem, czyli wtedy, gdy agent zagląda do systemu, na przykład po status zamówienia. Wszystkie pozostałe to zwykłe wypowiedzi.
W tym poradniku tę pauzę nazywamy czasem reakcji: od chwili, gdy rozmówca milknie, do pierwszego dźwięku agenta, tak jak słyszy go rozmówca. Średni czas reakcji ukrywa właśnie te wypowiedzi, które rozmówcy zapamiętują. Dlatego trzeba mierzyć każdą wypowiedź, oddzielać zwykłe wypowiedzi od wypowiedzi ze sprawdzeniem i analizować medianę oraz 90. percentyl.
Potem w każdej z najwolniejszych wypowiedzi trzeba znaleźć największy składnik. Ten, który najczęściej okazuje się największy, wskazuje pierwszą poprawkę. Trzeba zmieniać jeden składnik naraz i pilnować skutków ubocznych: agent, który krócej czeka z odpowiedzią, może zacząć wchodzić rozmówcom w słowo. Tam, gdzie pauzy nie da się uniknąć, krótki komunikat pozwala rozmówcy szybciej usłyszeć pierwszy dźwięk. Nie przyspiesza jednak samej odpowiedzi.
Docelowej wartości nie warto kopiować z żadnego źródła. Lepiej ustalić, od jakiego czasu reakcji Państwa rozmówcy zaczynają mówić w ciszy „Halo?”. To jest Państwa próg.
Artykuł o tym, gdzie rozmówcy rozłączają się z agentem AI, pomaga znaleźć etap, na którym rozmówcy odpadają. Ten poradnik schodzi poziom niżej: dlaczego cisza trwa długo i który składnik trzeba poprawić. Wszystkie liczby poniżej to przykład, a nie dane DRING ani dane branżowe.
Sześć składników czasu reakcji
Czas między ostatnim słowem rozmówcy a pierwszym dźwiękiem agenta dzieli się na sześć składników. W tym poradniku zawsze wymieniamy je w tej kolejności:
| Składnik | Co się dzieje | Co zwykle go wydłuża | Jak go mierzyć |
|---|---|---|---|
| Wykrycie końca | System uznaje, że rozmówca skończył mówić. | Przed decyzją czeka na długą ciszę. | Od końca mowy rozmówcy na nagraniu z Państwa systemu do decyzji systemu |
| Transkrypcja | Rozpoznawanie mowy podaje ostateczny tekst. | Ostateczny tekst pojawia się dopiero po przetworzeniu całego zdania. | Od decyzji do ostatecznego tekstu |
| Odpowiedź modelu | Model decyduje, co zrobić, i pisze odpowiedź. | Długie pierwsze zdanie, duży prompt, długi łańcuch rozumowania przed pierwszym słowem. | Od ostatecznego tekstu do odpowiedzi. W wypowiedzi ze sprawdzeniem dwa odcinki: do zapytania, od którego zaczyna się Sprawdzanie, i od wyniku Sprawdzania do odpowiedzi |
| Sprawdzanie | Sprawdzenie w systemie, na przykład statusu zamówienia. Tylko w wypowiedziach ze sprawdzeniem. | Wolny system, sprawdzenia wykonywane jedno po drugim, brak limitu czasu. | Od zapytania do odpowiedzi systemu |
| Start głosu | Synteza mowy generuje pierwszy dźwięk odpowiedzi. | Synteza mowy czeka na cały tekst odpowiedzi, zanim ruszy. | Od chwili, gdy tekst odpowiedzi trafia do syntezy mowy, do chwili, gdy pierwszy dźwięk opuszcza Państwa system |
| Linia | Telefonia i sieć przenoszą dźwięk w obie strony. | Długie trasy połączeń, odległe regiony, słaby zasięg sieci komórkowej. | Połączenia testowe ze zwykłych telefonów, nagrywane po stronie rozmówcy |
Dwa składniki mają po dwa odcinki. W wypowiedzi ze sprawdzeniem model pracuje przed Sprawdzaniem, żeby zdecydować, co sprawdzić, i po nim, żeby sformułować odpowiedź. Oba odcinki liczą się jako Odpowiedź modelu. Linia ma dwa odcinki w każdej wypowiedzi: głos rozmówcy, który dociera do Państwa systemu, i głos agenta, który dociera do rozmówcy. Oba odcinki liczą się jako Linia.
Jak mierzyć każdą wypowiedź
Mierzy się wypowiedzi, a nie rozmowy: w średniej z całej rozmowy jedna wolna wypowiedź ze sprawdzeniem może się ukryć wśród siedmiu szybkich. Każda wypowiedź dostaje jeden wiersz z tymi samymi polami. Przykładowe wartości pochodzą z wolnej wypowiedzi, którą pokazujemy dalej w tym poradniku. Przykład, nie prawdziwe dane.
| Pole | Co zawiera | Przykładowa wartość |
|---|---|---|
| ID rozmowy | Jedno ID wspólne dla nagrania rozmowy i logów systemu | C1047 |
| Numer wypowiedzi | Która z kolei jest to odpowiedź agenta w rozmowie | 4 |
| Typ wypowiedzi | Zwykła wypowiedź albo wypowiedź ze sprawdzeniem | Wypowiedź ze sprawdzeniem |
| Czas reakcji | Od ostatniego słowa rozmówcy do pierwszego dźwięku agenta, razem z Linią | 3,9 s |
| Wykrycie końca | Nagranie z Państwa systemu i znaczniki czasu | 0,7 s |
| Transkrypcja | Znaczniki czasu z systemu | 0,2 s |
| Odpowiedź modelu | Znaczniki czasu z systemu, w wypowiedzi ze sprawdzeniem oba odcinki | 0,6 s (0,3 s przed Sprawdzaniem i 0,3 s po nim) |
| Sprawdzanie | Znaczniki czasu z systemu, w zwykłej wypowiedzi puste | 1,9 s |
| Start głosu | Znaczniki czasu z systemu | 0,3 s |
| Linia | Połączenia testowe w sieciach, z których korzystają Państwa rozmówcy | 0,2 s |
| Czas nieprzypisany | Czas reakcji na nagraniu z Państwa systemu minus składniki zapisane w logach | 0,0 s |
| Rozmówca odezwał się w ciszy | Tak, jeśli w tej ciszy rozmówca powiedział „Halo?” albo powtórzył swoje słowa | Tak |
| Wejście w słowo | Tak, jeśli agent zaczął odpowiadać, gdy rozmówca jeszcze mówił albo tylko zrobił pauzę | Nie |
| Sprawa załatwiona | Dla całej rozmowy: tak, jeśli rozmówca dostał to, po co dzwonił | Tak |
Czas reakcji najpierw mierzy się na nagraniu rozmowy z Państwa systemu. Wspólne ID rozmowy pozwala dopasować każdą wypowiedź z nagrania do jej znaczników czasu w systemie. Z nich odczytuje się Wykrycie końca, Transkrypcję, Odpowiedź modelu, Sprawdzanie i Start głosu. Linię dodaje się w kolejnym kroku.
Linii nie widać na nagraniu z Państwa systemu: zegar rusza tam, gdy dźwięk od rozmówcy dociera do systemu, i staje, gdy dźwięk agenta go opuszcza. Dlatego warto wykonać połączenia testowe ze zwykłych telefonów w sieciach, z których korzystają Państwa rozmówcy, i nagrać je po stronie rozmówcy. Czas reakcji na tym nagraniu minus czas reakcji tej samej wypowiedzi na nagraniu z Państwa systemu to Linia. Tę wartość dodaje się do czasów reakcji z prawdziwych rozmów.
Potem trzeba sprawdzić sumę. Czas nieprzypisany to czas reakcji na nagraniu z Państwa systemu minus składniki zapisane w logach. Jeśli jest duży, brakuje jakiegoś znacznika czasu. W przykładowej wypowiedzi nagranie z Państwa systemu pokazuje 3,7 sekundy, a składniki z logów sumują się do 3,7 sekundy, więc czas nieprzypisany wynosi zero. Po dodaniu Linii, czyli 0,2 sekundy, rozmówca słyszy 3,9 sekundy ciszy.
Dlaczego średnia ukrywa problem
Przykład, nie prawdziwe dane: 400 wypowiedzi agenta z 50 nagranych rozmów na jednej linii, w tym 300 zwykłych wypowiedzi i 100 wypowiedzi ze sprawdzeniem. Każdy czas reakcji obejmuje Linię: 0,2 sekundy według połączeń testowych.
| Typ wypowiedzi | Wypowiedzi | Mediana | Średnia | 90. percentyl |
|---|---|---|---|---|
| Zwykłe wypowiedzi | 300 | 1,1 s | 1,2 s | 1,8 s |
| Wypowiedzi ze sprawdzeniem | 100 | 2,9 s | 3,2 s | 4,6 s |
| Wszystkie wypowiedzi | 400 | 1,3 s | 1,7 s | 3,4 s |
Średnia dla wszystkich wypowiedzi, 1,7 sekundy, jest wyższa od mediany, która wynosi 1,3 sekundy, bo wolne wypowiedzi ciągną ją w górę. Żadna z tych liczb nie pokazuje wypowiedzi, które rozmówcy zapamiętują. Pokazuje je dopiero 90. percentyl (p90): czas reakcji, który osiąga lub przekracza co dziesiąta wypowiedź, tutaj 3,4 sekundy. Wypowiedzi z takim lub dłuższym czasem reakcji to najwolniejsze wypowiedzi.
Wyniki warto też dzielić według typu wypowiedzi. Mediana zwykłych wypowiedzi wynosi 1,1 sekundy, a wypowiedzi ze sprawdzeniem 2,9 sekundy. Tydzień z większą liczbą wypowiedzi ze sprawdzeniem podnosi wyniki dla wszystkich wypowiedzi, nawet jeśli żaden składnik nie zwolnił.
Teraz te same 400 wypowiedzi trzeba podzielić na cztery przedziały czasu reakcji: 130 wypowiedzi poniżej 1,0 sekundy, 180 od 1,0 do 2,0 sekundy, 50 od 2,0 do 3,4 sekundy i 40 od 3,4 sekundy wzwyż. Następnie zaznacza się wypowiedzi, w których rozmówca odezwał się w ciszy: powiedział „Halo?” albo powtórzył swoje słowa. Zdarzyło się to w 31 z 40 najwolniejszych wypowiedzi i w 7 z pozostałych 360: 3 razy w 310 wypowiedziach poniżej 2,0 sekundy i 4 razy w 50 wypowiedziach od 2,0 do 3,4 sekundy.
Na tej linii odzywanie się w ciszy jest więc rzadkie poniżej 2,0 sekundy, nadal niezbyt częste od 2,0 do 3,4 sekundy i częste od 3,4 sekundy wzwyż. Próg tej linii to około 3,4 sekundy, a nie ogólny cel. Własny próg znajdą Państwo tak samo: wystarczy podzielić swoje wypowiedzi na przedziały i sprawdzić, w którym miejscu odzywanie się w ciszy przestaje być rzadkie i staje się częste. Węższe przedziały wokół tego miejsca pozwolą określić próg dokładniej.
Największy składnik w najwolniejszych wypowiedziach
Wartość 90. percentyla pokazuje, jak wolne są najwolniejsze wypowiedzi, ale nie mówi, dlaczego. Żeby to ustalić, trzeba przejrzeć każdą wolną wypowiedź i znaleźć jej największy składnik: ten, który w danej wypowiedzi zajął najwięcej czasu.
Przykład, nie prawdziwe dane: jedna z 40 najwolniejszych wypowiedzi. Rozmówca pyta o status zamówienia, więc jest to wypowiedź ze sprawdzeniem. Zegar rusza w chwili, gdy rozmówca milknie, tak jak słychać to po jego stronie.
Po kolei: Wykrycie końca 0,7 sekundy, Transkrypcja 0,2 sekundy, Odpowiedź modelu 0,6 sekundy, Sprawdzanie 1,9 sekundy, Start głosu 0,3 sekundy i Linia 0,2 sekundy. Odpowiedź modelu to dwa odcinki po 0,3 sekundy: jeden na decyzję o sprawdzeniu zamówienia, drugi na sformułowanie odpowiedzi. Linia to 0,1 sekundy w każdą stronę. Razem składniki dają czas reakcji 3,9 sekundy. Największym składnikiem jest Sprawdzanie: to prawie połowa całego czasu reakcji.
Czasy składników sumują się w ten sposób tylko w obrębie jednej wypowiedzi. Mediany i 90. percentyle się nie sumują: suma median sześciu składników nie jest medianą czasu reakcji. Dlatego największy składnik trzeba ustalać wypowiedź po wypowiedzi, a dopiero potem liczyć.
Przykład, nie prawdziwe dane: największy składnik w każdej z 40 najwolniejszych wypowiedzi.
| Największy składnik | Najwolniejsze wypowiedzi |
|---|---|
| Wykrycie końca | 8 |
| Transkrypcja | 0 |
| Odpowiedź modelu | 5 |
| Sprawdzanie | 27 |
| Start głosu | 0 |
| Linia | 0 |
| Razem | 40 |
Najczęściej największym składnikiem jest Sprawdzanie: w 27 z 40 wypowiedzi. To zgadza się z typami wypowiedzi: wśród najwolniejszych jest 36 wypowiedzi ze sprawdzeniem i 4 zwykłe. Wykrycie końca jest największym składnikiem w 8 wypowiedziach. W większości z nich rozmówca zrobił pauzę, dyktując numer, a system dłużej czekał, zanim uznał, że rozmówca skończył. Odpowiedź modelu jest największym składnikiem w 5 wypowiedziach.
Linia ani razu nie jest tu największym składnikiem, bo na tej linii stale wynosi 0,2 sekundy. Na innej linii może być inaczej. Artykuł o dobrym demo i słabych rozmowach na żywo podaje szybki test. Długi czas reakcji przy każdej wypowiedzi wskazuje na linię. Długi czas reakcji tylko przy wypowiedziach ze sprawdzeniem wskazuje na narzędzia.
Jeden składnik naraz i kontrola skutków ubocznych
Pracę zaczyna się od składnika, który w najwolniejszych wypowiedziach najczęściej jest największy, tutaj od Sprawdzania. Trzeba zmienić jedną rzecz i ponownie zmierzyć te same typy wypowiedzi. Przy dwóch zmianach naraz nie da się powiedzieć, która z nich przesunęła 90. percentyl.
Każda poprawka ma swoją cenę, dlatego w każdym wierszu podajemy też sygnał, który trzeba obserwować:
| Składnik | Co wypróbować | Co obserwować |
|---|---|---|
| Wykrycie końca | Czekanie przed decyzją zależne od tego, co mówi rozmówca: krótsze po krótkich odpowiedziach, takich jak „tak”, „nie” albo imię, a dłuższe, gdy rozmówca dyktuje numer albo literuje słowo. | Wejścia w słowo |
| Transkrypcja | Strumieniowe rozpoznawanie mowy, dzięki któremu większość tekstu jest gotowa, kiedy rozmówca kończy mówić. | Źle usłyszane słowa i liczby |
| Odpowiedź modelu | Krótkie pierwsze zdanie. Prosty plan odpowiedzi na częste pytania. | Jakość i kompletność odpowiedzi |
| Sprawdzanie | Niezależne sprawdzenia uruchamiać równolegle. Ustawić limit czasu z planem awaryjnym: przekazanie rozmowy człowiekowi albo propozycja oddzwonienia. Przed sprawdzeniem dodać krótki komunikat. | Nieaktualne albo niepełne odpowiedzi. Komunikaty powtarzane przy każdej wypowiedzi. |
| Start głosu | Uruchamiać syntezę mowy już na pierwszym zdaniu, gdy reszta odpowiedzi dopiero powstaje. | Nienaturalne pauzy w środku odpowiedzi |
| Linia | Połączenia testowe z sieci, z których korzystają Państwa rozmówcy. Przegląd trasy połączeń z Państwa dostawcą telefonii. | Jakość dźwięku, nie tylko opóźnienie |
W każdym wierszu są opcje do wyboru. Najpierw jedna, potem pomiar, a dopiero potem decyzja o następnej.
Cena krótszego Wykrycia końca: wejścia w słowo
Wejście w słowo to błąd odwrotny do długiego czasu reakcji: agent zaczyna odpowiadać, gdy rozmówca jeszcze mówi albo tylko zrobił pauzę. Przykład, nie prawdziwe dane: w tych samych 400 wypowiedziach było 6 wejść w słowo, z czego 5 wtedy, gdy rozmówca dyktował numer zamówienia albo numer telefonu. Za oboma błędami stoją dyktowane numery: Wykrycie końca było największym składnikiem w 8 spośród najwolniejszych wypowiedzi i w większości z nich rozmówca również dyktował numer. Skrócenie czekania w każdej wypowiedzi oznacza więcej wejść w słowo. Dlatego w wierszu Wykrycia końca są dwa różne czasy czekania. Dłuższe czekanie przy numerach nie przyspieszy jednak tych 8 wolnych wypowiedzi. Pomaga w nich sygnał, że numer jest już kompletny: jeśli system wie, że numer zamówienia ma pięć cyfr, może już po piątej cyfrze uznać, że rozmówca skończył, zamiast czekać na ciszę.
Gdy pauzy nie da się uniknąć: krótki komunikat
Niektóre sprawdzenia w systemie pozostaną wolne, a system, który za nimi stoi, nie zawsze zależy od Państwa. Wtedy rozmówca powinien usłyszeć pierwszy dźwięk jeszcze przed Sprawdzaniem: krótki komunikat, czyli jedno zdanie przed wolnym krokiem. W opisanej wyżej wolnej wypowiedzi padłby zaraz po pierwszym odcinku Odpowiedzi modelu:
- Rozmówca: „Zamówienie numer 4 8 1 7 2.”
- Agent, przed Sprawdzaniem: „Dziękuję, już sprawdzam to zamówienie.”
- Agent, po Sprawdzaniu: „Zamówienie jest już w drodze i dotrze w czwartek.”
Czas reakcji się skraca, bo pierwszy dźwięk pojawia się teraz przed Sprawdzaniem. Czas do odpowiedzi liczy się od chwili, gdy rozmówca milknie, do początku właściwej odpowiedzi. Ten czas pozostaje mniej więcej taki sam, bo odpowiedź nadal musi poczekać na Sprawdzanie. W takich wypowiedziach trzeba więc zapisywać w logach także czas do odpowiedzi, żeby komunikat nie ukrył Sprawdzania, które trwa coraz dłużej.
Komunikaty powinny być krótkie i pojawiać się tylko przed wolnym krokiem, nigdy w przeprosinach, przy liczbach ani na zakończenie rozmowy. Komunikat w każdej wypowiedzi też ma swoją cenę: rozmówcy w kółko słyszą to samo zdanie.
Co śledzić co tydzień
Co tydzień warto odczytywać trzy sygnały, osobno dla zwykłych wypowiedzi i dla wypowiedzi ze sprawdzeniem:
- Czas reakcji: mediana i 90. percentyl, a w wypowiedziach z krótkim komunikatem także czas do odpowiedzi.
- Rozmówca odezwał się w ciszy: odsetek wypowiedzi, w których do tego doszło.
- Wejścia w słowo: ich liczba i to, co rozmówca mówił w tym momencie.
Czwarty sygnał odczytuje się dla każdej rozmowy: czy sprawa została załatwiona. Krótszy czas reakcji niewiele daje, jeśli mniej rozmów kończy się załatwieniem sprawy. Jeśli prowadzą Państwo pilotaż, sprawę uznaje się za załatwioną tak, jak karta pilotażu definiuje rozwiązaną sprawę.
Przed każdą zmianą i po niej porównuje się te same typy wypowiedzi. Odsetek zmierzony na kilkuset wypowiedziach może się zmienić przypadkowo. Jak policzyć margines błędu odsetka, pokazujemy w artykule o kryteriach sukcesu pilotażu voice AI.
Gdzie pomaga DRING
Wybrane modele zamiany mowy na tekst, syntezy mowy i rozumowania, telefonia oraz testy i monitoring należą do wspólnych fundamentów każdego pakietu DRING. W DRING trzy z sześciu składników i krótki komunikat działają tak:
- Wykrycie końca: osobny model obsługuje barge-in i wykrywanie końca wypowiedzi. Dzięki temu agent nie mówi w trakcie pauzy i nie milczy, gdy rozmówca już skończył.
- Transkrypcja: rozmowa jest transkrybowana w czasie rzeczywistym, dzięki strumieniowej zamianie mowy na tekst.
- Linia: jakość dźwięku i opóźnienia są śledzone dla każdego numeru, żeby wcześnie wychwycić linię, która działa coraz gorzej.
- Krótki komunikat: gdy narzędzie lub model potrzebuje więcej czasu, krótka, naturalna fraza podtrzymująca z zatwierdzonego zestawu DRING utrzymuje rytm rozmowy. Taka fraza to w DRING forma krótkiego komunikatu i nigdy nie pojawia się w przeprosinach, przy liczbach ani na zakończenie rozmowy.
Strona speech core pokazuje, jak zamiana mowy na tekst, zarządzanie turami i synteza mowy działają jako jeden potok, a strona o telefonii opisuje stan linii.
Każdy agent DRING przechodzi przed pierwszą prawdziwą rozmową od 1 000 do 10 000 symulowanych rozmów przygotowanych dla Państwa firmy. Symulacje sprawdzają przed uruchomieniem zarządzanie turami i krótkie komunikaty. Nie mierzą jednak Linii w rozmowach na żywo. Linię mierzy się połączeniami testowymi w sieciach, z których korzystają Państwa rozmówcy.
Jeśli rozmówcy na Państwa linii mówią w ciszy „Halo?”, warto poprosić o telefon. Dobrze mieć wtedy pod ręką kilka takich rozmów, z nagraniami, jeśli pozwalają na to Państwa zasady. Nasz zespół może przejść z Państwem przez najwolniejsze wypowiedzi, składnik po składniku.
Znajdźmy składnik, który wydłuża czas reakcji
Wystarczy zostawić numer, a DRING oddzwoni w dwie minuty. W rozmowie warto powiedzieć, na której linii pojawiają się długie chwile ciszy. Potem odezwie się nasz zespół, żeby razem z Państwem przeanalizować najwolniejsze wypowiedzi.