Düşmanca test · Talimat saldırıları
Prompt Enjeksiyonu ve Jailbreak Testi
Talimat saldırıları, onaylı çalışma kuralları içinde güvenilmeyen metinden promptlara, retrieval kaynaklarına, araçlara, izinlere, veriye ve sonraki aksiyonlara kadar baştan sona izlenmeden değerlendirilemiyor.
Bir talimat kullanıcı mesajından gelebilir ya da sistemin retrieval ile aldığı bir belgenin içinde durabilir. Her iki yolu uygulama, promptlar, politikalar, araçlar, izinler, korunan veri ve sonraki aksiyonlar boyunca izliyoruz. Doğrulanan her atlatmayı kontrollü bir kayıtla gösteriyor, yeniden testte gündelik geçerli istekleri de çalıştırıyoruz.
Elinizde yetkilendirilmiş saldırı vaka seti, kontrollü atlatma izleri, etki bulguları ve her savunmayı geçerli isteklerle eşleyen yeniden test notları kalıyor.


Birlikte çalıştığımız 500'den fazla markadan birkaçı
Tüm referansları görAdımlar, kapılar ve kararı verenler
Çalışma şeklimiz
Saldırı vakası tasarımıyla savunma kabulünü ayrı tutuyoruz. İyileştirmeden sonra etkilenen saldırıları ve karşılık gelen geçerli istekleri yeniden çalıştırıyor, düzeltmeyle regresyonu birlikte değerlendiriyoruz.
Vaka setini ve çalışma kurallarını yetkilendiriyoruz
Sistem sınırını, korunan varlıkları, bilinen saldırıları, test ortamını, promptları, politikaları, retrieval kaynaklarını, araçları, izinleri, logları, durma koşullarını ve kanıt işleme kurallarını birlikte belirliyoruz. Bildirge izin vermeden hiçbir vaka çalışmıyor.
- Yapay zeka desteği
- Bilinen enjeksiyon örüntülerinden aday vaka seti maddeleri hazırlanıyor. Onaylı sete neyin gireceğini güvenlik sorumlunuz seçiyor.
- İnsan onayı
- Onaylı vaka seti ve işleme kuralları, yetkilendirilen her yol, güvenlik sınırı ve durma koşulu için tamam mı? Saldırı kapsamını, güvenlik sınırlarını ve durma koşullarını güvenlik sorumlunuz yetkilendiriyor.


Her talimatı sonucuna kadar izliyoruz
İncelenen iyi niyetli ve kötü niyetli vakaları doğrudan girdi, dolaylı içerik ve araç etkisi olan yollar üzerinde çalıştırıyoruz. Her vakada modele ulaşan talimatı, kontrolün nasıl tepki verdiğini ve sonrasında ne olduğunu kaydediyoruz.
- Yapay zeka desteği
- Yetkilendirilmiş ortamda bir agent onaylı vakaları çalıştırabilir ve talimat yolunu kaydedebilir.
- İnsan onayı
- Yetkili ikinci bir test uzmanı aynı kayıttan atlatmayı ya da engellenen sonucu tekrar üretebiliyor mu? Bir atlatma bulgu olarak kaydedilmeden önce Zeo güvenlik uzmanı tarafından doğrulanıyor.


Atlatmayı bağlamı içinde değerlendiriyoruz
Her atlatmayı etkilenen varlık, etki, tespit, önem, yetkisiz araç ya da veri açığa çıkması ve yanlış pozitif maliyeti üzerinden inceliyoruz. Kritik yolları genel puandan ayrı gösteriyoruz.
- Yapay zeka desteği
- Atlatma kanıtı etkilenen varlık, etki ve tespit başlıklarında düzenleniyor. Son değerlendirmeyi uzman yapıyor.
- İnsan onayı
- Doğrulanan hangi bulgular, güvenlik lideriniz test edilen sistem durumunu kabul etmeden önce kapanmalı? Kabulden önce hangi doğrulanmış bulguların düzeltilmesi gerektiğine güvenlik sorumlunuz karar veriyor.


Savunmayı yeniden deniyoruz
İyileştirmeden sonra ilgili saldırıları ve bunlara karşılık gelen iyi niyetli vakaları tekrar ediyoruz. Birlikte okunan sonuçlar, atlatmanın kapanıp kapanmadığını ve geçerli isteklerin çalışmaya devam edip etmediğini gösteriyor.
- Yapay zeka desteği
- Bir agent onaylı saldırıları ve geçerli vakaları yeniden çalıştırıp sonuçları ilk kayda bağlayabilir.
- İnsan onayı
- Üzerinde anlaştığımız vaka seti, kritik yollar ve geçerli istekler savunma regresyon eşiğini karşılıyor mu? Savunma regresyon eşiğinin karşılanıp karşılanmadığına siz karar veriyorsunuz.


Adı konmuş, sizde kalan çıktılar
Elinize geçenler
Mühendisleriniz, doğrulanmış bir atlatmayı yeniden üretebilecek, ilgili kontrolü inceleyebilecek ve iyileştirme sonucunu karşılaştırabilecek kontrollü kanıtı alıyor. Bu kayıt yalnızca onaylı erişim içinde kalıyor.


Dataset
Onaylı test bildirgesi ve saldırı vaka seti
Yetkilendirilmiş sınır ile doğrudan, dolaylı ve araç etkili yollar için seçilen iyi niyetli ve kötü niyetli vakalar.


Test kanıtı
Kontrollü atlatma tekrar izleri dosyası
Test edilen girdiyi, talimat yolunu, model yanıtını, ilgili araç ya da veri etkisini, kontrol davranışını ve gözlenen sonucu erişimi sınırlandırarak kaydeder.


Risk kaydı
İncelenen etki ve kontrol bulguları
Doğrulanan bulgular etkilenen varlık, atlatmanın etkisi, tespit davranışı, önem, yanlış pozitifler ve devreye girmesi beklenen kontrole göre düzenlenir.


Rapor
İyileştirme notları ve yeniden test kaydı
Her bulguya bağlı savunma önerileri ile ilgili saldırıların ve geçerli isteklerin yeniden test sonuçlarını bir arada tutar.
Kapsam ve dürüst sınırlar
Bu çalışmanın size uyduğu durumlar
Güvenilmeyen bir talimatın araca, korunan veriye, retrieval kaynağına ya da sonucu olan bir işleme ulaşabildiği uygulamalar için bu çalışma anlamlıdır.
Şu durumlarda iyi bir seçim
- Güvenilmeyen metin kullanıcı mesajından veya retrieval ile alınan belgeden giriyor, ama hangi talimatın modele ve araçlara ulaştığını kimse izlemiyor.
- Başarılı bir atlatma aracı çağırabiliyor ya da korunan veriyi açığa çıkarabiliyor, bu yüzden tek vaka sonucu olan bir aksiyonu başlatabiliyor.
- Savunma saldırı vakasını engelliyor, ama olağan davranışın sürdüğünü gösterecek eşlenmiş geçerli istek kanıtı ekipte bulunmuyor.
- Talimatlar prompt, politika, retrieval kaynağı, araç ve izinlerden geçiyor, ama korunan varlığa uzanan tam yol henüz izlenemiyor.
- Doğrudan ve dolaylı saldırılar biliniyor, ama iyi ve kötü niyetli vakalar tek bir incelenmiş sette buluşmuyor.
- Atlatma yeniden üretilebiliyor, ama etkisi, tespiti, önemi, yanlış pozitifleri, iyileştirmesi ve yeniden test sonucu birlikte incelenmiyor.
- Onaylı girdinin kontrollü kaydı var, ama talimat yolu, kontrol tepkisi ve gözlenen araç ya da veri etkisi aynı izde buluşmuyor.
Şu durumlarda başka bir çalışma daha doğru
- Doğrulanan bir atlatmanın hukuki ya da düzenleyici soruyu çözmesini istiyorsunuz. Denetim görüşü ve sertifikasyon kararı yetkili uzmanlarınıza ait kalıyor.
- Gelecekteki her prompt, model sürümü, araç veya dolaylı enjeksiyon yolu için güvence arıyorsunuz, ama vaka seti yalnızca incelenen örnekleri kapsıyor.
- İyileştirmenin production'a alınmasını bekliyorsunuz, çünkü bu çalışma savunma notları ve bağlantılı yeniden test kanıtıyla tamamlanıyor.
Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: AI güvenlik hizmetini inceleyin
Test ettiğimiz sistemleri kendimiz de işletiyoruz
Bir sistemi hiç ayakta tutmak zorunda kalmadıysanız onu iyi test etmek de zor. Biz production'da AI işletiyoruz, bu yüzden değerlendirme, güvenlik testi ve LLMOps çalışmalarımız gerçekte nelerin kırıldığını bilerek başlıyor. Ekibimiz kıdemli mühendislerden oluşuyor ve Zeo 2011'den beri müşteri projelerinde çalışıyor.
Kullandığımız araçlar
Bu işin arkasındaki araçlar
PromptfooDoğrudan jailbreak'leri ve doküman kaynaklı dolaylı injection'ları kapsayan eklenti seti
garakKamuya açık jailbreak ailelerini kapsayan güncel probe kütüphanesi
Lakera GuardSavunma regresyonu testinin üzerinde çalıştığı gerçek çalışma zamanı katmanı
GiskardYanlış pozitifleri ve gerçek bulguları tek geçişte puanlayan tarama
Sonraki adım
Güvenilmeyen talimatı sonuca kadar izleyelim


Karar vermeden önce





















