Yapay Zeka Değerlendirme ve Güvence · Politika davranışı testi
Güvenlik ve Politika Değerlendirmesi
Bir güvenlik politikası, her önemli maddesi hem zararlı davranışla hem de ona benzeyen meşru bir taleple aynı set içinde birlikte test edildiğinde değerlendirilebiliyor.
Bir politika maddesi ancak sistem davranışında gözlenebildiğinde test edilebilir hâle geliyor. Kötüye kullanım denemelerini onlara benzeyen meşru taleplerle eşliyor, reddetme kalitesini ve önem derecesini inceliyoruz. İyileştirmeden sonra neyin değiştiğini ve hangi riskin kaldığını ayrıca kaydediyoruz.
Karar dosyasında kural kapsamını, eşli senaryo bulgularını, ihlal önemini, yanlış retleri, yeniden test sonuçlarını ve risk sorumlusunun ele alacağı kalan riski görüyorsunuz.


Birlikte çalıştığımız 500'den fazla markadan birkaçı
Tüm referansları görAdımlar, kapılar ve kararı verenler
Çalışma şeklimiz
Önce yazılı kuralı davranışa bağlıyoruz. Ardından her kural için zararlı bir deneme ile meşru sınır vakasını birlikte çalıştırıyor, bulguyu önem incelemesinden yeniden teste kadar izliyoruz.
Her politika maddesini davranışa bağla
Her önemli kural için beklenen davranışı, ele aldığı zararı, olası kötüye kullanımı ve aynı kontrolün yanlışlıkla durdurabileceği meşru talebi kaydediyoruz.
- Yapay zeka desteği
- Analistlerimiz yazılı politika metninden yola çıkarak aday test vakalarını taslak hâline getiriyor.
- İnsan onayı
- Her önemli kural en az bir gözlenebilir teste kadar izlenebiliyor mu? Her kuralın testinin gerçekten niyetiyle örtüştüğünü politika sorumlunuz onaylıyor.


Politika sınırının iki tarafını test et
Her kötüye kullanım denemesini ona benzeyen meşru taleple yan yana çalıştırıyoruz. Açık sonuçlarda deterministik kontrolleri, bağlama bağlı retlerde ise kalibre edilmiş uzman incelemesini kullanıyoruz.
- Yapay zeka desteği
- Agent'larımız düşmanca ve iyi niyetli senaryo çiftlerini çalıştırıp sonuçları kayda geçiriyor.
- İnsan onayı
- Değerlendiriciler aynı rubrikle gerçek ihlali iyi niyetli uç vakadan ayırabiliyor mu? İşaretlenen bir vakanın gerçek ihlal mi yoksa gerçek iyi niyetli uç vaka mı olduğunu inceleyen uzman onaylıyor.


Önem derecesini ve ret kalitesini değerlendir
İnceleyen uzmanlar ne olduğunu, ne kadar ciddi olduğunu, hangi politika alanına dokunduğunu ve kimi etkilediğini ayrı ayrı kaydediyor. İhlaller ile yanlış retler analiz boyunca birbirine karıştırılmıyor.
- Yapay zeka desteği
- Agent'larımız hataları önem derecesine ve politika alanına göre sınıflandırıp incelemeye hazır hâle getiriyor.
- İnsan onayı
- Sistem, belirlediğimiz önem sınırlarını geçiyor mu, koşullu mu geçiyor, yoksa başarısız mı oluyor? Sistemin belirlediğimiz önem sınırlarını geçip geçmediğine, koşullu geçip geçmediğine veya başarısız olup olmadığına risk sorumlunuz karar veriyor.


Düzeltmeyi yeniden test et, kalanı açıkça yaz
Düzeltmeden sonra aynı vaka çiftlerini yeniden çalıştırıp önceki sonuçla karşılaştırıyoruz. Kayıt, hangi davranışın değiştiğini, hangi bulgunun açık kaldığını ve kalan riskten kimin sorumlu olduğunu gösteriyor.
- Yapay zeka desteği
- Agent'larımız yeniden test sonuçlarından kalan risk kaydının taslağını çıkarıyor.
- İnsan onayı
- Risk sorumlunuz kalan riski kabul mü ediyor, eskale mi ediyor, yoksa ek çalışma için geri mi gönderiyor? Kalan riski kabul eden, eskale eden veya ek çalışma için geri gönderen risk sorumlunuzdur.


Adı konmuş, sizde kalan çıktılar
Elinize geçenler
Her çıktıda politika metninden gözlenen davranışa giden iz korunuyor.


Matris
Kural-davranış test kapsamı haritası
Her politika kuralını beklenen davranışına, zarar kategorisine, kötüye kullanım pattern'ine ve iyi niyetli karşı örneğine eşler.


Test kanıtı
Eşli kötüye kullanım ve meşru senaryo dosyası
Kalibre edilmiş düşmanca ve iyi niyetli senaryoları, beklenen sonuçları ve değerlendirici notlarını içerir.


Rapor
İhlal, yanlış ret, önem ve kesit bulguları
Gerçek politika ihlallerini aşırı retlerden ayırıyoruz. Sonuçları önem derecesine ve etkilenen gruba göre bölüyoruz.


Karar kaydı
İyileştirme ve eşli yeniden test risk dosyası
Denenen düzeltmeleri, yeniden test sonuçlarını ve risk sorumlunuzun kabul ettiği veya eskale ettiği kalan riski belgeler.
Kapsam ve dürüst sınırlar
Bu çalışmanın size uyduğu durumlar
Asıl zor vakalar politika sınırında ortaya çıkıyor. Sistem zararlı bir talebe izin verirken benzer kelimeler taşıyan meşru bir isteği reddedebilir. İki sonucu aynı vaka çifti içinde test ediyoruz.
Şu durumlarda iyi bir seçim
- Yazılı politikalarınız var, ama sistemin baskı altında bu kurallara uyup uymadığını gösteren eşli test kanıtı henüz bulunmuyor.
- Meşru bir istek reddedilirken benzer zararlı talep geçiyor, bu yüzden tek geçiş oranı hem iş maliyetini hem güvenlik açığını gizliyor.
- Risk sorumlunuz tek bir geçiş yüzdesi görüyor, ama bu sayı hangi önem derecesinin, istisnanın veya kalan risk kararının dikkat istediğini göstermiyor.
- Politika maddeleri zararı ve beklenen davranışı anlatıyor, ama henüz eşli kötüye kullanım ve iyi niyetli uç vaka testlerine bağlanmıyor.
- Senaryo sonuçları ifadeye ve bağlama göre değişiyor, bu yüzden deterministik kontroller kalibre edilmiş insan rubriği olmadan karar vermeye yetmiyor.
- İhlaller ile yanlış retler birlikte sayılıyor, bu yüzden önem derecesi, etkilenen kesit, iyileştirme durumu ve yeniden testten sonra kalan risk görünmüyor.
- Bir düzeltme yeniden test ediliyor, ama neyin değiştiğini, neyin açık kaldığını ve kararı kimin vereceğini gösteren tek kalan risk dosyası bulunmuyor.
Şu durumlarda başka bir çalışma daha doğru
- Eşli senaryo testlerinin hukuki veya düzenleyici karar, denetim görüşü ya da sertifikasyon onayı vermesini istiyorsunuz. Bu yetki politika değerlendirmesinin dışında, uzmanlarınızda kalıyor.
- Sistemin tamamen güvenli, mevzuata uyumlu veya yeni kötüye kullanıma karşı bağışık ilan edilmesini istiyorsunuz. Eşli testler yalnızca incelenen senaryo setindeki davranışı gösteriyor.
- Kurallar test edilmeden önce politika metninin yeniden yazılmasını istiyorsunuz. Politika tasarımı ayrıca kapsama alınmadıkça ayrı bir çalışma oluyor.
Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: Ana hizmeti inceleyin
Test ettiğimiz sistemleri kendimiz de işletiyoruz
Bir sistemi hiç ayakta tutmak zorunda kalmadıysanız onu iyi test etmek de zor. Biz production'da AI işletiyoruz, bu yüzden değerlendirme, güvenlik testi ve LLMOps çalışmalarımız gerçekte nelerin kırıldığını bilerek başlıyor. Ekibimiz kıdemli mühendislerden oluşuyor ve Zeo 2011'den beri müşteri projelerinde çalışıyor.
Kullandığımız araçlar
Bu işin arkasındaki araçlar
PromptfooHer politika kuralından kötüye kullanım ve benzer meşru testler üretiyor
MindgardHer politika kuralını ekiplerin düşünmediği adversarial varyasyonlarla ayrıca sınıyor
Lakera GuardDüzeltme sonrasında gerçek trafikte refusal kalitesini ve ağırlığını sınıflandırıyor
GiskardHer politika kuralında kalan riski yapılandırılmış bir kayıtla izliyor
Sonraki adım
Politika sınırlarının gerçek davranışta nerede tuttuğunu görün


Karar vermeden önce




























