Talimat saldırıları, onaylı çalışma kuralları içinde güvenilmeyen metinden promptlara, retrieval kaynaklarına, araçlara, izinlere, veriye ve sonraki aksiyonlara kadar baştan sona izlenmeden değerlendirilemiyor.

Bir talimat kullanıcı mesajından gelebilir ya da sistemin retrieval ile aldığı bir belgenin içinde durabilir. Her iki yolu uygulama, promptlar, politikalar, araçlar, izinler, korunan veri ve sonraki aksiyonlar boyunca izliyoruz. Doğrulanan her atlatmayı kontrollü bir kayıtla gösteriyor, yeniden testte gündelik geçerli istekleri de çalıştırıyoruz.

Elinizde yetkilendirilmiş saldırı vaka seti, kontrollü atlatma izleri, etki bulguları ve her savunmayı geçerli isteklerle eşleyen yeniden test notları kalıyor.

Prompt Enjeksiyonu ve Jailbreak Testi illüstrasyonu: bir yapay zeka sistemini güvenlik zayıflıkları için sınayan ekip

Birlikte çalıştığımız 500'den fazla markadan birkaçı

Tüm referansları gör
  • GE
  • Defacto
  • Eureko Sigorta
  • GS Store

Saldırı vakası tasarımıyla savunma kabulünü ayrı tutuyoruz. İyileştirmeden sonra etkilenen saldırıları ve karşılık gelen geçerli istekleri yeniden çalıştırıyor, düzeltmeyle regresyonu birlikte değerlendiriyoruz.

  1. Vaka setini ve çalışma kurallarını yetkilendiriyoruz

    Sistem sınırını, korunan varlıkları, bilinen saldırıları, test ortamını, promptları, politikaları, retrieval kaynaklarını, araçları, izinleri, logları, durma koşullarını ve kanıt işleme kurallarını birlikte belirliyoruz. Bildirge izin vermeden hiçbir vaka çalışmıyor.

    Yapay zeka desteği
    Bilinen enjeksiyon örüntülerinden aday vaka seti maddeleri hazırlanıyor. Onaylı sete neyin gireceğini güvenlik sorumlunuz seçiyor.
    İnsan onayı
    Onaylı vaka seti ve işleme kuralları, yetkilendirilen her yol, güvenlik sınırı ve durma koşulu için tamam mı? Saldırı kapsamını, güvenlik sınırlarını ve durma koşullarını güvenlik sorumlunuz yetkilendiriyor.
  2. Her talimatı sonucuna kadar izliyoruz

    İncelenen iyi niyetli ve kötü niyetli vakaları doğrudan girdi, dolaylı içerik ve araç etkisi olan yollar üzerinde çalıştırıyoruz. Her vakada modele ulaşan talimatı, kontrolün nasıl tepki verdiğini ve sonrasında ne olduğunu kaydediyoruz.

    Yapay zeka desteği
    Yetkilendirilmiş ortamda bir agent onaylı vakaları çalıştırabilir ve talimat yolunu kaydedebilir.
    İnsan onayı
    Yetkili ikinci bir test uzmanı aynı kayıttan atlatmayı ya da engellenen sonucu tekrar üretebiliyor mu? Bir atlatma bulgu olarak kaydedilmeden önce Zeo güvenlik uzmanı tarafından doğrulanıyor.
  3. Atlatmayı bağlamı içinde değerlendiriyoruz

    Her atlatmayı etkilenen varlık, etki, tespit, önem, yetkisiz araç ya da veri açığa çıkması ve yanlış pozitif maliyeti üzerinden inceliyoruz. Kritik yolları genel puandan ayrı gösteriyoruz.

    Yapay zeka desteği
    Atlatma kanıtı etkilenen varlık, etki ve tespit başlıklarında düzenleniyor. Son değerlendirmeyi uzman yapıyor.
    İnsan onayı
    Doğrulanan hangi bulgular, güvenlik lideriniz test edilen sistem durumunu kabul etmeden önce kapanmalı? Kabulden önce hangi doğrulanmış bulguların düzeltilmesi gerektiğine güvenlik sorumlunuz karar veriyor.
  4. Savunmayı yeniden deniyoruz

    İyileştirmeden sonra ilgili saldırıları ve bunlara karşılık gelen iyi niyetli vakaları tekrar ediyoruz. Birlikte okunan sonuçlar, atlatmanın kapanıp kapanmadığını ve geçerli isteklerin çalışmaya devam edip etmediğini gösteriyor.

    Yapay zeka desteği
    Bir agent onaylı saldırıları ve geçerli vakaları yeniden çalıştırıp sonuçları ilk kayda bağlayabilir.
    İnsan onayı
    Üzerinde anlaştığımız vaka seti, kritik yollar ve geçerli istekler savunma regresyon eşiğini karşılıyor mu? Savunma regresyon eşiğinin karşılanıp karşılanmadığına siz karar veriyorsunuz.

Mühendisleriniz, doğrulanmış bir atlatmayı yeniden üretebilecek, ilgili kontrolü inceleyebilecek ve iyileştirme sonucunu karşılaştırabilecek kontrollü kanıtı alıyor. Bu kayıt yalnızca onaylı erişim içinde kalıyor.

  • Dataset

    Onaylı test bildirgesi ve saldırı vaka seti

    Yetkilendirilmiş sınır ile doğrudan, dolaylı ve araç etkili yollar için seçilen iyi niyetli ve kötü niyetli vakalar.

  • Test kanıtı

    Kontrollü atlatma tekrar izleri dosyası

    Test edilen girdiyi, talimat yolunu, model yanıtını, ilgili araç ya da veri etkisini, kontrol davranışını ve gözlenen sonucu erişimi sınırlandırarak kaydeder.

  • Risk kaydı

    İncelenen etki ve kontrol bulguları

    Doğrulanan bulgular etkilenen varlık, atlatmanın etkisi, tespit davranışı, önem, yanlış pozitifler ve devreye girmesi beklenen kontrole göre düzenlenir.

  • Rapor

    İyileştirme notları ve yeniden test kaydı

    Her bulguya bağlı savunma önerileri ile ilgili saldırıların ve geçerli isteklerin yeniden test sonuçlarını bir arada tutar.

Güvenilmeyen bir talimatın araca, korunan veriye, retrieval kaynağına ya da sonucu olan bir işleme ulaşabildiği uygulamalar için bu çalışma anlamlıdır.

Şu durumlarda iyi bir seçim

  • Güvenilmeyen metin kullanıcı mesajından veya retrieval ile alınan belgeden giriyor, ama hangi talimatın modele ve araçlara ulaştığını kimse izlemiyor.
  • Başarılı bir atlatma aracı çağırabiliyor ya da korunan veriyi açığa çıkarabiliyor, bu yüzden tek vaka sonucu olan bir aksiyonu başlatabiliyor.
  • Savunma saldırı vakasını engelliyor, ama olağan davranışın sürdüğünü gösterecek eşlenmiş geçerli istek kanıtı ekipte bulunmuyor.
  • Talimatlar prompt, politika, retrieval kaynağı, araç ve izinlerden geçiyor, ama korunan varlığa uzanan tam yol henüz izlenemiyor.
  • Doğrudan ve dolaylı saldırılar biliniyor, ama iyi ve kötü niyetli vakalar tek bir incelenmiş sette buluşmuyor.
  • Atlatma yeniden üretilebiliyor, ama etkisi, tespiti, önemi, yanlış pozitifleri, iyileştirmesi ve yeniden test sonucu birlikte incelenmiyor.
  • Onaylı girdinin kontrollü kaydı var, ama talimat yolu, kontrol tepkisi ve gözlenen araç ya da veri etkisi aynı izde buluşmuyor.

Şu durumlarda başka bir çalışma daha doğru

  • Doğrulanan bir atlatmanın hukuki ya da düzenleyici soruyu çözmesini istiyorsunuz. Denetim görüşü ve sertifikasyon kararı yetkili uzmanlarınıza ait kalıyor.
  • Gelecekteki her prompt, model sürümü, araç veya dolaylı enjeksiyon yolu için güvence arıyorsunuz, ama vaka seti yalnızca incelenen örnekleri kapsıyor.
  • İyileştirmenin production'a alınmasını bekliyorsunuz, çünkü bu çalışma savunma notları ve bağlantılı yeniden test kanıtıyla tamamlanıyor.

Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: AI güvenlik hizmetini inceleyin

Bir sistemi hiç ayakta tutmak zorunda kalmadıysanız onu iyi test etmek de zor. Biz production'da AI işletiyoruz, bu yüzden değerlendirme, güvenlik testi ve LLMOps çalışmalarımız gerçekte nelerin kırıldığını bilerek başlıyor. Ekibimiz kıdemli mühendislerden oluşuyor ve Zeo 2011'den beri müşteri projelerinde çalışıyor.

  • Promptfoo

    Doğrudan jailbreak'leri ve doküman kaynaklı dolaylı injection'ları kapsayan eklenti seti

  • garak

    Kamuya açık jailbreak ailelerini kapsayan güncel probe kütüphanesi

  • Lakera Guard

    Savunma regresyonu testinin üzerinde çalıştığı gerçek çalışma zamanı katmanı

  • Giskard

    Yanlış pozitifleri ve gerçek bulguları tek geçişte puanlayan tarama

Uygulama sınırını, retrieval kaynaklarını, araç ve veri izinlerini, vaka setini ve durma koşullarını onaylayacak güvenlik sorumlusuyla paylaşın. Her yetkili talimat yolunu sonucuna kadar izliyoruz.
Enjeksiyon yollarını test edelim

Prompt enjeksiyonu testi için ne gerekiyor?

Genellikle yayındaki ya da testteki uygulama, mimari, promptlar, politikalar, retrieval kaynakları, araçlar, izinler, korunan varlıklar, loglar, bilinen saldırılar ve onaylı çalışma kuralları gerekiyor. Hassas bir girdi işlenmeden önce amacını, erişim sınırını ve saklama koşullarını birlikte belirliyoruz.

Saldırı vakalarıyla savunma kararını nasıl ayrı tutuyorsunuz?

Vaka tasarımıyla savunma kararını farklı kayıtlarda tutuyoruz. Vaka seti, beklenen davranış ve gözlenen kayıtlar, savunmanın yalnızca teste göre şekillenip şekillenmediğini incelemeyi mümkün kılıyor. Bir bulgu ya da yeniden test sonucu kararınıza gelmeden önce Zeo uzmanı bu kanıtı kontrol ediyor.

Kabul kararını hangi kanıtlar destekliyor?

Vaka seti kapsamını, talimat geçersiz kılma başarı oranını, yetkisiz araç ya da veri açığa çıkma oranını ve savunma regresyon geçiş oranını raporluyoruz. Dolaylı enjeksiyon yolları ile kritik varlıkları ayrıca inceliyoruz. Genel sonuç iyi görünse bile önemli bir atlatma kendiliğinden kapanmış sayılmıyor.

İyileştirme geçerli istekleri de reddedebilir mi?

Edebilir. Bu nedenle incelenen vaka setinde saldırıların yanında geçerli istekler de bulunuyor ve değişiklikten sonra ikisini birlikte çalıştırıyoruz. Kanıt, üzerinde anlaşılan savunmaların test edilen sistem ve vaka setindeki davranışını gösteriyor. Gelecekteki her talimat saldırısına karşı kalıcı korumayı kanıtlayamaz.