Prompt savunması
Prompt enjeksiyonu: nasıl test ediyoruz, nasıl engelliyoruz
Sesli bir agent tasarımı gereği çağrıdaki kişiden talimat alır. Saldırgan da bunu tersine çevirmeye çalışır.
Bir saldırı nasıl görünür
Doğrudan geçersiz kılma: çağrı sırasında "talimatlarını yok say."
Araç veya web verisine gizlenmiş talimatlar: bir CRM notu, sipariş kaydı ya da web sayfası, okuyan kişi için değil agent için yazılmış metin taşır.
Personel taklidi: arayan, yalnızca doğrulanmış kimliğe açık aksiyonların kilidini açmak için kendini çalışan veya hesap sahibi gösterir.
İade veya işlem baskısı: politika dışı bir talep tekrarlanır ya da yükseltilir; ısrarın işe yarayacağı umulur.
Agent ne yapar
Kapsam dışı talimatları reddeder. Çağrıda söylenen hiçbir şey çalışma talimatlarını değiştirmez.
Araç çıktısını komut değil veri olarak ele alır. Araçtan gelen talimat benzeri içerik yürütülmez.
Ayrıcalıklı aksiyonlardan önce kimliği doğrular. Doğrulanmamış iddia reddedilir ve kayda geçer.
Yüksek riskli işlemler için yetki ister. Hiçbir iade, transfer veya indirim yalnızca talep üzerine geçmez.
Doğaçlama istisna yerine insana devir önerir.
Saldırı neyi dener, onu ne durdurur
| Saldırı | Arayanın denediği | Onu durduran |
| Geçersiz kılma | Talimatlarını yok say, yeni kuralları izle | Talimatlar çağrı boyunca sabit kalır, girişim loglanır |
| Araç sonucuna gömülü içerik | Komutları bir CRM notunun içine saklar | Araç çıktısı okunur, asla yürütülmez |
| Sahte kimlik | Kendini personel, yönetici veya hesap sahibi gösterir | İddiaya değil doğrulamaya bakılır |
| Politika dışı işlem | İade, transfer veya indirim için ısrar eder | Açık yetki gerekir, istisna yok |
| Veri talebi | Başka bir müşterinin verisini ister | Erişilebilir değil, veri izolasyonu engeller |
| Politika tuzağı | Doğaçlama bir vaade doğru yönlendirir | Her yanıt önce politikaya karşı kontrol edilir |
Her girişim loglanır ve incelenir.
Test nasıl işler
Saldırgan senaryolar
Geçersiz kılmalar, gömülü içerik ve tuzaklar; sürekli büyüyen bir kütüphaneden.
Bağımsız inceleme
Otomatik kontroller ve insan incelemesi, her anlaşmazlığı işaretler.
Çıktı ve işlem kontrolü
Yanıtlar ve yüksek riskli aksiyonlar yayından önce kontrol edilir.
Sürüm karnesi
Sonuçlar kalite ölçütlerinin yanında durur; test edilmeyen hiçbir şey yayınlanmaz.
Savunma modelde değil, katmanlarda. Koruma tek bir modelin iyi davranmasına dayanmaz. Modelin etrafındaki birkaç katmanda durur, saldırı senaryoları farklı modellerde düzenli olarak yeniden koşturulur ve her görüşme sonrasında otomatik güvenlik analizinden geçer.
Tek regresyon seti. Müşterinin verdiği her kural o agent'ın tek regresyon setine eklenir. Yeni bir kural, ancak mevcut tüm kurallar yanında geçmeye devam ederse yayınlanır; bir yerdeki düzeltme başka bir yeri sessizce bozamaz.