Bir güvenlik politikası, her önemli maddesi hem zararlı davranışla hem de ona benzeyen meşru bir taleple aynı set içinde birlikte test edildiğinde değerlendirilebiliyor.

Bir politika maddesi ancak sistem davranışında gözlenebildiğinde test edilebilir hâle geliyor. Kötüye kullanım denemelerini onlara benzeyen meşru taleplerle eşliyor, reddetme kalitesini ve önem derecesini inceliyoruz. İyileştirmeden sonra neyin değiştiğini ve hangi riskin kaldığını ayrıca kaydediyoruz.

Karar dosyasında kural kapsamını, eşli senaryo bulgularını, ihlal önemini, yanlış retleri, yeniden test sonuçlarını ve risk sorumlusunun ele alacağı kalan riski görüyorsunuz.

Güvenlik ve Politika Değerlendirmesi illüstrasyonu: bir yapay zeka sistemini temsili kanıtlara göre test eden ekip

Birlikte çalıştığımız 500'den fazla markadan birkaçı

Tüm referansları gör
  • MediaMarkt
  • PWC Türkiye
  • Sabancı Üniversitesi
  • Edenred
  • TRT
  • Cheetos
  • DYO

Önce yazılı kuralı davranışa bağlıyoruz. Ardından her kural için zararlı bir deneme ile meşru sınır vakasını birlikte çalıştırıyor, bulguyu önem incelemesinden yeniden teste kadar izliyoruz.

  1. Her politika maddesini davranışa bağla

    Her önemli kural için beklenen davranışı, ele aldığı zararı, olası kötüye kullanımı ve aynı kontrolün yanlışlıkla durdurabileceği meşru talebi kaydediyoruz.

    Yapay zeka desteği
    Analistlerimiz yazılı politika metninden yola çıkarak aday test vakalarını taslak hâline getiriyor.
    İnsan onayı
    Her önemli kural en az bir gözlenebilir teste kadar izlenebiliyor mu? Her kuralın testinin gerçekten niyetiyle örtüştüğünü politika sorumlunuz onaylıyor.
  2. Politika sınırının iki tarafını test et

    Her kötüye kullanım denemesini ona benzeyen meşru taleple yan yana çalıştırıyoruz. Açık sonuçlarda deterministik kontrolleri, bağlama bağlı retlerde ise kalibre edilmiş uzman incelemesini kullanıyoruz.

    Yapay zeka desteği
    Agent'larımız düşmanca ve iyi niyetli senaryo çiftlerini çalıştırıp sonuçları kayda geçiriyor.
    İnsan onayı
    Değerlendiriciler aynı rubrikle gerçek ihlali iyi niyetli uç vakadan ayırabiliyor mu? İşaretlenen bir vakanın gerçek ihlal mi yoksa gerçek iyi niyetli uç vaka mı olduğunu inceleyen uzman onaylıyor.
  3. Önem derecesini ve ret kalitesini değerlendir

    İnceleyen uzmanlar ne olduğunu, ne kadar ciddi olduğunu, hangi politika alanına dokunduğunu ve kimi etkilediğini ayrı ayrı kaydediyor. İhlaller ile yanlış retler analiz boyunca birbirine karıştırılmıyor.

    Yapay zeka desteği
    Agent'larımız hataları önem derecesine ve politika alanına göre sınıflandırıp incelemeye hazır hâle getiriyor.
    İnsan onayı
    Sistem, belirlediğimiz önem sınırlarını geçiyor mu, koşullu mu geçiyor, yoksa başarısız mı oluyor? Sistemin belirlediğimiz önem sınırlarını geçip geçmediğine, koşullu geçip geçmediğine veya başarısız olup olmadığına risk sorumlunuz karar veriyor.
  4. Düzeltmeyi yeniden test et, kalanı açıkça yaz

    Düzeltmeden sonra aynı vaka çiftlerini yeniden çalıştırıp önceki sonuçla karşılaştırıyoruz. Kayıt, hangi davranışın değiştiğini, hangi bulgunun açık kaldığını ve kalan riskten kimin sorumlu olduğunu gösteriyor.

    Yapay zeka desteği
    Agent'larımız yeniden test sonuçlarından kalan risk kaydının taslağını çıkarıyor.
    İnsan onayı
    Risk sorumlunuz kalan riski kabul mü ediyor, eskale mi ediyor, yoksa ek çalışma için geri mi gönderiyor? Kalan riski kabul eden, eskale eden veya ek çalışma için geri gönderen risk sorumlunuzdur.

Her çıktıda politika metninden gözlenen davranışa giden iz korunuyor.

  • Matris

    Kural-davranış test kapsamı haritası

    Her politika kuralını beklenen davranışına, zarar kategorisine, kötüye kullanım pattern'ine ve iyi niyetli karşı örneğine eşler.

  • Test kanıtı

    Eşli kötüye kullanım ve meşru senaryo dosyası

    Kalibre edilmiş düşmanca ve iyi niyetli senaryoları, beklenen sonuçları ve değerlendirici notlarını içerir.

  • Rapor

    İhlal, yanlış ret, önem ve kesit bulguları

    Gerçek politika ihlallerini aşırı retlerden ayırıyoruz. Sonuçları önem derecesine ve etkilenen gruba göre bölüyoruz.

  • Karar kaydı

    İyileştirme ve eşli yeniden test risk dosyası

    Denenen düzeltmeleri, yeniden test sonuçlarını ve risk sorumlunuzun kabul ettiği veya eskale ettiği kalan riski belgeler.

Asıl zor vakalar politika sınırında ortaya çıkıyor. Sistem zararlı bir talebe izin verirken benzer kelimeler taşıyan meşru bir isteği reddedebilir. İki sonucu aynı vaka çifti içinde test ediyoruz.

Şu durumlarda iyi bir seçim

  • Yazılı politikalarınız var, ama sistemin baskı altında bu kurallara uyup uymadığını gösteren eşli test kanıtı henüz bulunmuyor.
  • Meşru bir istek reddedilirken benzer zararlı talep geçiyor, bu yüzden tek geçiş oranı hem iş maliyetini hem güvenlik açığını gizliyor.
  • Risk sorumlunuz tek bir geçiş yüzdesi görüyor, ama bu sayı hangi önem derecesinin, istisnanın veya kalan risk kararının dikkat istediğini göstermiyor.
  • Politika maddeleri zararı ve beklenen davranışı anlatıyor, ama henüz eşli kötüye kullanım ve iyi niyetli uç vaka testlerine bağlanmıyor.
  • Senaryo sonuçları ifadeye ve bağlama göre değişiyor, bu yüzden deterministik kontroller kalibre edilmiş insan rubriği olmadan karar vermeye yetmiyor.
  • İhlaller ile yanlış retler birlikte sayılıyor, bu yüzden önem derecesi, etkilenen kesit, iyileştirme durumu ve yeniden testten sonra kalan risk görünmüyor.
  • Bir düzeltme yeniden test ediliyor, ama neyin değiştiğini, neyin açık kaldığını ve kararı kimin vereceğini gösteren tek kalan risk dosyası bulunmuyor.

Şu durumlarda başka bir çalışma daha doğru

  • Eşli senaryo testlerinin hukuki veya düzenleyici karar, denetim görüşü ya da sertifikasyon onayı vermesini istiyorsunuz. Bu yetki politika değerlendirmesinin dışında, uzmanlarınızda kalıyor.
  • Sistemin tamamen güvenli, mevzuata uyumlu veya yeni kötüye kullanıma karşı bağışık ilan edilmesini istiyorsunuz. Eşli testler yalnızca incelenen senaryo setindeki davranışı gösteriyor.
  • Kurallar test edilmeden önce politika metninin yeniden yazılmasını istiyorsunuz. Politika tasarımı ayrıca kapsama alınmadıkça ayrı bir çalışma oluyor.

Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: Ana hizmeti inceleyin

Bir sistemi hiç ayakta tutmak zorunda kalmadıysanız onu iyi test etmek de zor. Biz production'da AI işletiyoruz, bu yüzden değerlendirme, güvenlik testi ve LLMOps çalışmalarımız gerçekte nelerin kırıldığını bilerek başlıyor. Ekibimiz kıdemli mühendislerden oluşuyor ve Zeo 2011'den beri müşteri projelerinde çalışıyor.

  • Promptfoo

    Her politika kuralından kötüye kullanım ve benzer meşru testler üretiyor

  • Mindgard

    Her politika kuralını ekiplerin düşünmediği adversarial varyasyonlarla ayrıca sınıyor

  • Lakera Guard

    Düzeltme sonrasında gerçek trafikte refusal kalitesini ve ağırlığını sınıflandırıyor

  • Giskard

    Her politika kuralında kalan riski yapılandırılmış bir kayıtla izliyor

Yazılı kuralları, bu kuralların yönettiği sistemi ve yeniden testten sonra ne olacağına karar verecek risk sorumlusunu getirin.
Zeo ile konuşun

Hangi girdi ve erişimlere ihtiyaç duyuyorsunuz?

Amaçlanan kullanımı, geçerli kurum içi politikaları, sistem ve araç tasarımını, kötüye kullanım ve zarar endişelerini, gerçek kullanıcıları, mevcut kontrolleri ve risk kararlarını verecek sorumluyu getirmeniz gerekir.

İyi niyetli uç vakaları neden kötüye kullanım denemeleriyle birlikte test ediyorsunuz?

Zararlı ve meşru talepler bazen aynı kelimeleri ya da bağlamı paylaşır. Bu talepleri çift hâlinde çalıştırdığımızda kontrolün kötüye kullanımı durdururken izin verilen isteğe nasıl davrandığını da görebiliyoruz.

Politika değerlendirmesi ne zaman karara hazırdır?

Karar dosyasında kural-test kapsaması, ihlal ve yanlış ret sonuçları, önem derecesi, etkilenen kesitler, iyileştirme kanıtı ve kalan risk birlikte yer alıyor. Tek bir politika alanındaki kritik hata, genel sonuç iyi görünse de kritik kalıyor. Kabul kararını risk sorumlunuz veriyor.

Bu değerlendirme neyi garanti edemez?

Bu çalışma tam güvenliği, mevzuata uyumu veya incelenen senaryo setinin dışındaki yöntemlere karşı dayanıklılığı garanti edemez. Kanıt yalnızca o tarihte test edilen politika maddeleri, koşullar, kötüye kullanım pattern'leri ve iyi niyetli uç vakalar için geçerlidir. Yeni saldırılar ve politika değişiklikleri yeni test gerektirir. Risk sorumlunuz önem derecesi, etkilenen kesit, yeniden test sonucu ve kalan belirsizlik üzerinden karar verir.