İçeriğe geç
Bir iş akışı paylaşın. DRING iki dakikada arayıp ihtiyacı analiz etsin. İki dakikada sizi arayalım
2 dakikada sizi arayalım Agent Factory'yi görün
Sesli yapay zeka değerlendirmesi

Canlıya çıkmadan önce neden 1.000 ila 10.000 simüle konuşma?

Büyük bir test seti, ancak parlak bir demonun hiç göstermediği zor ve etkisi yüksek anları temsil ediyorsa işe yarar.

OPERASYON REHBERİİNCELENEBİLİR AKIŞ
Operasyon rehberi
01
SinyalTalebi anlayın
02
UygulaDoğru kuralı işletin
03
SonuçSonraki adımı kayda geçirin
SİNYALDENSahibi belli, işe yarayan bir görüşmeSAHİBİ BELLİ SONUCA

“1.000'den fazla simüle konuşma” ifadesi asla sihirli bir kalite rakamı gibi sunulmamalıdır. Bir test setini değerli kılan şey kapsamı, zorluğu ve gerçek bir iş akışıyla bağıdır. Bin tane kolay selamlama, bir agent'ın itiraz edilen bir ödemeyi, gürültülü bir ortamdan arayan birini, hiç duymadığı bir ürün adını ya da uzun bir görüşmenin sonundaki insana devri kaldırabileceğini kanıtlamaz. Özenle tasarlanmış daha küçük bir uç durum seti, sorunsuz akışların tekrarından oluşan büyük bir setten daha çok şey söyleyebilir.

Canlıda çalışacak bir sesli agent için simülasyon, hatayı müşteriden önce bulmanın güvenli yoludur. DRING'in agent'ları kurduğu, test ettiği ve geliştirdiği sistem olan Agent Factory, bu döngüyle bir aday sürüm hazırlar, zor görüşmeleri çalıştırır, sonucu puanlar ve kontrollü trafiğe hazır olup olmadığına karar verir. Rakam özgüven verir; güveni ise testin tasarımı kazandırır.

İş akışının tanımıyla başlayın

Her testin bir amacı olmalıdır. Arayanın niyetini, gereken bilgileri, yetkili işlemi, işin tamamlandığını gösteren kanıtı ve mutlaka devredilmesi gereken durumları tanımlayın. Sonra aynı temel işi koruyarak dili, ifadeyi, sırayı ve duygusal bağlamı değiştiren senaryolar yazın.

Bir randevu iş akışında bir senaryo saati teyit edebilir, bir başkası değişiklik isteyebilir, bir başkası yanlış dilde gelebilir, bir diğeri de idari kapsamın dışında tıbbi tavsiye isteyebilir. Bir lojistik hattında şoförü, yükü, konumu, zamanlamayı ve istisna sebebini değiştirin. Test vakası yalnızca agent'ın doğru cümleyi söyleyip söylemediğini değil, sonucu puanlamalıdır.

Kapsamı beş boyutta kurun

Birincisi, niyeti kapsayın: olağan talepler, bunlara yakın talepler ve desteklenmeyen talepler. İkincisi, dili ve telaffuzu kapsayın: isimler, markalar, kısaltmalar, para birimi, tarihler ve yerel ifadeler. Üçüncüsü, söz sırasını kapsayın: söz kesme, sessizlik, düzeltme, üst üste konuşma ve fikrini değiştiren arayan. Dördüncüsü, sistemleri kapsayın: yavaş sorgulama, bulunamayan kayıt, çelişen veri ve reddedilen CRM yazımı. Beşincisi, politikayı ve devri kapsayın: kimlik belirsizliği, hassas işlemler, sinirli arayanlar ve hemen bir insanla görüşmek isteyenler.

Ekibin neyin eksik olduğunu görebilmesi için bir test matrisi kullanın. Bir senaryo birkaç boyutu birleştirebilir: örneğin CRM erişilemezken, gürültülü bir iade talebi sırasında bir ürün adını düzelten ve Fransızca konuşan bir arayan. Tek tek testleri geçen bir sistem çoğu zaman bu birleşimlerde aksamaya başlar.

Yalnızca cevabı puanlamayın

Puanlama için birbirinden bağımsız boyutlar tanımlayın. Niyet anlaşıldı mı? Bilgiler doğru alındı mı? Politikaya uyuldu mu? Araç doğru parametrelerle çağrıldı mı? Agent belirsizliği açıkladı mı? Devir doğru anda tetiklendi mi? Son kayıtta doğru sonraki işlem var mı? Ton duruma uygun muydu?

Tek bir geçti ya da kaldı etiketi işe yarar bilgiyi gizler. Niyeti anlayıp CRM yazımında başarısız olan bir aday sürüm, yanlış politikayla kendinden emin cevap veren bir sürümden farklı bir düzeltme ister. DRING'in kalite katmanı ve analiz modeli, puanı bir sorumluya ve bir sonraki sürüme bağlamaya yardım eder.

Otomatik değerlendiricileri dikkatle kullanın

Otomatik değerlendiriciler kapsamı artırabilir ama sorgulanamaz bir doğruluk kaynağı gibi görülmemelidir. Puanlama ölçütlerini gözlemlenebilir terimlerle tanımlayın, bir örneklemi insan değerlendiricilerle karşılaştırın ve anlaşmazlıkları takip edin. Hassas iş akışlarında otomatik puan yüksek olsa bile bir insan inceleme kapısı şart koşun.

Test prompt'larını ve beklenen sonuçları sürüm numarasıyla tutun. Puanlama ölçütü değişirse geçmiş puanlar yine yorumlanabilir kalmalıdır. Model, ses, dil, araç ve politika sürümlerini kaydedin ki sonradan ortaya çıkan bir gerileme izlenebilsin. NIST'in AI RMF çerçevesi yaşam döngüsü boyunca düzenli test, ölçüm, belgeleme ve yönetimi vurgular; bu disiplin için işe yarar bir çerçevedir.

Senaryo okuyan birini değil, müşteriyi simüle edin

Gerçek arayanlar sorunun bitmesini beklemez. Sorunun üzerine konuşur, kısaltma kullanır, referans numarasını unutur, ilgili başka bir soru sorar ve emin olmadığını söyler. Gerçekçi bir simülatörün bir hedefi, bildiği bilgiler, belli bir işbirliği isteği ve bir hata biçimi olmalıdır. Bazı arayanlar yardımsever olmalı. Bazıları sabırsız. Bazıları da yanlış işlemi kendinden emin bir şekilde istemeli.

Senaryoları kurumun gerçekte kullandığı dile dayandırın. İzin verilen yerlerde onaylı ve anonimleştirilmiş kalıpları kullanın ya da operatörlerden doğal varyasyonlar yazmalarını isteyin. Kişisel verileri test setine kopyalamayın. Kimlik bilgilerini maskeleyin ve erişim kuralları olan bir test verisi kaydı tutun.

Yayın kapılarını açıkça tanımlayın

Canlıya çıkmadan önce kritik politika ve kimlik kontrolleri için asgari puanı, olağan akışlar için kabul edilebilir en yüksek hata oranını ve her seferinde geçmesi gereken devir koşullarını tanımlayın. Bir hesap sonucu uyduran, zorunlu bir bilgilendirmeyi atlayan, yanlış müşteri kaydına yazan ya da insanla görüşmek isteyen arayanı çıkışsız bırakan aday sürüm yayına çıkmamalıdır.

Yayını aşamalı yapın. Küçük bir trafik dilimiyle başlayın, canlı sonuçları simülasyonla karşılaştırın, canlı çağrılardan örnekler inceleyin ve gerçek hatalardan yeni senaryolar ekleyin. Test seti operasyon öğrendikçe büyümelidir. Hiç değişmeyen 1.000 vakalık bir test seti kalite sistemi değil, müzedir.

Önemli her hatayı bir regresyon testine dönüştürün

Canlı bir çağrı bir hatayı ortaya çıkardığında, onu test setine eklemeden önce sınıflandırın. Sistem sesi mi yanlış anladı, bilgisi mi eksikti, yanlış aracı mı seçti, bir politikayı mı yanlış uyguladı, yoksa devretmeyi mi başaramadı? Davranışı gereksiz kişisel veri saklamadan yeniden üreten kısa bir senaryo yazın. Beklenen sonucu ve tekrarını önleyecek guardrail'i ekleyin.

Factory yaklaşımının pratik değeri budur. Agent bir kere kulağa iyi geldi diye yayına alınmaz. Aday sürüm, hedef davranışı iyileştirdiği ve bilinen risklerde istikrarlı kaldığı için yayına alınır. Her yeni sürüm bir öncekinden daha fazla kanıtla başlar.

Ekiplerin sürdürebileceği bir simülasyon planı

  • İş akışının sonucunu ve kesinlikle kabul edilmeyecek kritik durumları tanımlayın.
  • Olağan, yakın, desteklenmeyen ve devir gerektiren senaryolar oluşturun.
  • Dili, aksanları, telaffuzu, söz kesmeyi ve arayanın işbirliği düzeyini çeşitlendirin.
  • Sistem hatalarını, eksik verileri ve çelişen politika koşullarını senaryolara ekleyin.
  • Niyeti, işlemi, politikayı, devri, tonu ve kayıt kalitesini ayrı ayrı puanlayın.
  • Kontrollü bir canlı pilot yürütün ve doğrulanan hataları regresyon setine geri besleyin.

Simülasyon, canlıya çıkıştan önce oynanan bir gösteri değildir. Bir operasyon ekibinin AI agent'ı, canlıdaki diğer tüm sistemlerle aynı kalite standardına bağlamasının yoludur.

İleri okuma

Demonuzun kaçındığı çağrıları test edin

Numaranızı bırakın, DRING sizi iki dakikada arasın. Ekibinizin zaten bildiği zor vakaları anlatın; onları birlikte bir yayın karnesine dönüştürelim.