Przejdź do treści
Wystarczy opisać jeden proces. DRING oddzwoni w dwie minuty i rozpozna potrzebę. Zadzwonimy w dwie minuty
Zadzwonimy w 2 minuty Poznaj Agent Factory
Speech core

Słucha, decyduje, odpowiada.

Strumieniowa zamiana mowy na tekst, mózg agenta, zarządzanie turami i synteza mowy działają za każdym połączeniem jako jeden potok. Każdy element jest testowany i można go wymienić bez spowalniania rozmowy.

Jedna wypowiedź od początku do końca

Ten sam potok przy każdym połączeniu

Kanały wchodzą po lewej, speech core odpowiada pośrodku, z pamięcią i narzędziami pod ręką, a wynik wychodzi po prawej. Całą ścieżkę testujemy i monitorujemy przy każdym kolejnym wydaniu.

KANAŁY PołączeniaPSTN · SIP WhatsAppCzat biznesowy E-mailPotwierdzenia RDZEŃ SPEECH-TO-SPEECH Pamięć Narzędzia STTWejście głosu LLMMózg agenta TTSWyjście głosu Ścieżka audio na żywo ZabezpieczeniaZasady sprawdzane na żywo Agent Factory Lepszy z każdym wydaniem WYNIKI Zapis wynikuKażda rozmowa oceniona ProcesyWebhook · CRM Państwa systemyRaportowanie ROZMÓWCA PRACOWNIK AI DRING Każdy kanał Jeden mózg agenta Każda rozmowa oceniona TEST WYDANIE MONITORING

Zobacz, jak testujemy wydanie, zanim trafi na tę ścieżkę

W środku

Co speech core faktycznie robi

Każda wypowiedź rozmówcy przechodzi przez pięć kroków, od linii do odpowiedzi. Na wszystkich pięciu obowiązują dwie gwarancje.

  1. Połączenie trafia do systemu

    SIP, wirtualna centrala i podłączone trasy telefoniczne doprowadzają połączenie do rdzenia, a przed wybraniem numeru obowiązują zasady połączeń wychodzących.

    Zobacz szczegóły telefonii
  2. Mowa zamienia się w tekst

    Rozmowa jest transkrybowana w czasie rzeczywistym, a potem poprawiana i normalizowana, zanim agent zacznie analizę. Dzięki temu akcent, wtrącenie czy pauza w pół zdania nie zniekształcają tego, co padło.

  3. Agent analizuje

    Odczytuje intencję, pamiętając wcześniejsze wypowiedzi i inne kanały. Zanim coś powie lub zrobi, sprawdza zabezpieczenia i zasady, a w trakcie rozmowy korzysta z potrzebnych narzędzi.

  4. Naturalna wymiana zdań

    Osobny model obsługuje barge-in, czyli możliwość wejścia agentowi w słowo, oraz wykrywanie końca wypowiedzi. Dzięki temu agent nie mówi w trakcie pauzy i nie milczy, gdy rozmówca już skończył.

  5. Tekst zamienia się w głos

    Każda marka wybiera z biblioteki starannie dobrany głos z personą, która określa tempo, stopień formalności i ton. Do tego korekta akcentu i słownik wymowy nazwisk, miejsc i nazw produktów.

Przy każdej wypowiedzi

Szybkie odpowiedzi, bez ciszy

Gdy narzędzie lub model potrzebuje więcej czasu, krótka, naturalna fraza podtrzymująca z zatwierdzonego zestawu DRING utrzymuje rytm rozmowy.

  • Odpowiedzi zachowują naturalne tempo, niezależnie od tego, który dostawca za nimi stoi
  • Frazy podtrzymujące nigdy nie pojawiają się w przeprosinach, przy liczbach ani na zakończenie rozmowy

Routing i failover modeli

Modele mowy, języka i głosu dobiera się osobno dla każdego agenta i języka, a proces można przełączyć na inny model bez zmiany platformy.

  • Gdy u dostawcy wystąpi problem, połączenie może przejść do dostawcy, który działa
  • Mocniejsza usługa trafia na produkcję dopiero po przejściu testów regresji, które obejmują cały stos
Zobacz benchmark operacyjny
Wspólne z czatem

Ten sam mózg, w mowie i w piśmie

Głos nie jest systemem odrębnym od czatu. Pamięć, zabezpieczenia i zapis wyniku pod spodem są te same.

Jedna pamięć

Osoba rozpoznana w rozmowie telefonicznej zostaje rozpoznana także w wiadomości, a rozmowę zaczętą przez telefon można dokończyć na WhatsAppie, bez powtarzania wszystkiego od nowa.

Te same zabezpieczenia

Ochrona przed prompt injection, weryfikacja faktów i maskowanie danych działają w odpowiedzi mówionej dokładnie tak samo jak w pisanej, a nie w lżejszej wersji.

Ten sam zapis wyniku

Rozmowa telefoniczna kończy się takim samym ustrukturyzowanym zapisem jak czat: wynikiem, oceną i polami zdefiniowanymi przez Państwa zespół, zapisanymi w CRM.

Zobacz silnik czatu, który korzysta z tego samego mózgu

FAQ

Pytania o speech core.

Czy speech core współdzieli pamięć i zabezpieczenia z czatem?+

Tak. Rozmowa i wiadomość dotyczące tego samego klienta należą do jednej sprawy i korzystają z jednej pamięci, a ochrona przed prompt injection, weryfikacja faktów i maskowanie danych działają w obu tak samo.

Co się dzieje, gdy generowanie odpowiedzi trwa dłużej?+

Krótka, naturalna fraza podtrzymująca z zatwierdzonego zestawu DRING utrzymuje rytm rozmowy, a odpowiedź kończy się w tle. Taka fraza nigdy nie pojawia się w przeprosinach, przy liczbach ani na zakończenie.

Czy można zmienić modele zamiany mowy na tekst i syntezy mowy?+

Tak. Dostawców zamiany mowy na tekst, modeli językowych i syntezy mowy można wymieniać niezależnie dla każdego agenta i języka, a proces można przełączyć na inny model bez zmiany platformy.

Skąd agent wie, że rozmówca skończył mówić?+

Odpowiada za to osobny model zarządzania turami. Barge-in pozwala rozmówcy wejść w słowo w pół zdania, a wykrywanie końca wypowiedzi mówi agentowi, kiedy rozmówca naprawdę skończył. Dzięki temu agent nie mówi w trakcie pauzy i nie czeka bez potrzeby po zakończonej odpowiedzi.

Skąd pochodzą głosy?+

Ze starannie dobranej biblioteki, osobno dla każdej marki i każdego języka. Do tego persona określająca tempo, formalność i ton, korekta akcentu głosu oraz słownik wymowy nazwisk, miejsc i nazw produktów.

Zobacz wszystkie pytania

Speech core na Państwa własnej linii

Wystarczy przesłać opis sytuacji wraz ze zgodą na kontakt. DRING zadzwoni, przedstawi się i ustali, jak speech core obsłużyłby Państwa najbardziej obciążoną linię.