Adalet testi, yetkili sorumlularınız etkilenen grupları ve kabul edilebilir ödünleşimleri belirledikten sonra uzmanlar sonuçları, hata yükünü, açıklamaları ve kanıt sınırlarını karşılaştırdığında anlamlı oluyor.

Adalet sorusu önce kurumunuzun vereceği kararlara dayanıyor. Kimler etkilenebilir, hangi sonuç önemlidir, hangi ödünleşim kabul edilebilir? Bu seçimlerin oluşturduğu karşılaştırmaları ve açıklamaları test ediyor, kanıtın sonuç çıkarmaya yetmediği yerleri açıkça gösteriyoruz.

Hangi farkın ele alınacağı artık görüş olmaktan çıkıyor. Tanımlı grup bulguları, desteklenen ve durdurulan karşılaştırmalar, iyileştirme öncelikleri ve yeniden test ölçütleri yetkili sorumlunuzun önünde duruyor.

Önyargı, Adalet ve Açıklanabilirlik Testleri illüstrasyonu: bir yapay zeka sistemini temsili kanıtlara göre test eden ekip

Birlikte çalıştığımız 500'den fazla markadan birkaçı

Tüm referansları gör
  • İyzico
  • Aydem Perakende
  • Canbebe
  • Otsimo
  • Jack Martin Menswear
  • Elele
  • Karel

İlk iş karşılaştırma sorusunu kurmak. Yetkili kişileriniz kimin sonucunun önemli olduğunu ve kanıtın hangi kararı desteklemesi gerektiğini belirliyor. Biz de verinin bu karşılaştırmayı taşıyıp taşıyamadığına bakıyoruz.

  1. Adalet sorusunun sınırını çiz

    Yetkili kişileriniz etkilenen grupları, önemli sonuçları, ilgili kesitleri, açıklamayı kullanacak kişileri ve kabul edilebilir ödünleşimleri tanımlıyor. Kanıtın hangi karara girdi sağlayacağını da baştan belirtiyor.

    Yapay zeka desteği
    Analistlerimiz sizin belirttiğiniz etkilenen gruplardan yola çıkarak aday kesitleri taslak hâline getiriyor.
    İnsan onayı
    Gruplar ve sonuçlar, politika sorusunu bizim uydurmamıza gerek kalmadan test edilecek kadar açık mı? Hangi grup ve ödünleşimin kapsamda olduğunu yetkili sorumlunuz tanımlıyor.
  2. Her karşılaştırmanın kanıtını kontrol et

    Önerilen her karşılaştırma için temsili örneklere, etiketlere, örneklem kapsamına, bağımlılıklara ve bilinen boşluklara bakıyoruz. Bazı kesitler ölçülebilir bir sonucu desteklerken bazıları yalnızca açık bir sınırlama yazmamıza izin verebilir.

    Yapay zeka desteği
    Analistlerimiz etiket kapsamını kontrol ediyor, kanıtı zayıf kalan kesitleri işaretliyor.
    İnsan onayı
    Kanıt karşılaştırma için yeterli mi, belirsizlik nerede çok yüksek? Hangi karşılaştırmanın çalıştırılamayacak kadar az kanıta sahip olduğuna değerlendirme liderimiz karar veriyor.
  3. Farkı kendi bağlamında yorumla

    Kararlaştırdığımız kesitlerde sonuçları ve hata yükünü karşılaştırıyor, aynı bağlamlarda açıklamaların nasıl davrandığını inceliyoruz. Alan uzmanları, anlamlı bir farkı gürültüden, bağımlılık etkisinden veya kanıtın taşıyamadığı bir karşılaştırmadan ayırmaya yardımcı oluyor.

    Yapay zeka desteği
    Analistlerimiz üzerinde anlaştığımız eşiği aşan aday farkları işaretliyor.
    İnsan onayı
    Hangi farklar iyileştirme, istisna incelemesi veya daha fazla kanıt gerektiriyor? İşaretlenen bir farkın gürültü değil önemli olduğunu alan uzmanı onaylıyor.
  4. Yanıtı ve sınırlarını kayda geçir

    Son kayıtta kabul edilen bulgular ile çözülemeyenler ayrılıyor. Önerilen değişiklikleri, sorumluları ve yeniden test ölçütlerini yazıyor, kalan belirsizliği sonraki karara taşıyoruz.

    Yapay zeka desteği
    Analistlerimiz kabul edilen bulgulardan iyileştirme kapısı kaydının taslağını çıkarıyor.
    İnsan onayı
    Yetkili sorumlunuz kanıtı, koşulları ve kalan belirsizliği kabul ediyor mu? Bulguları ve kalan belirsizliği yetkili sorumlunuz kabul ediyor.

Teslimatlar üç unsuru ayrı ama bağlantılı tutuyor. Kurumunuzun seçtiği karşılaştırma, bu karşılaştırma için mevcut kanıt ve yetkili kişilerinizin onayladığı yanıt.

  • Rapor

    Tanımlı gruplarda önyargı ve açıklama bulguları

    Tanımlanan grupları, sonuçları, kesitleri, ölçüleri, açıklama testlerini, belirsizliği, bulguları ve değerlendirmenin sınırlarını belirtir.

  • Dataset

    Etkilenen grup ve sonuç kesiti kanıt kaydı

    Her kesit için sahadan örnekleri, örneklem kapsamını, etiketleri, bağımlılıkları, bilinen boşlukları ve kanıt kalitesini kaydeder.

  • Matris

    Fark, açıklama ve istisna raporu

    Sonuç ve hata farklılıklarını, açıklama bulgularını, belirsizliği, kabul edilen istisnaları ve ek kanıt gerektiren maddeleri ayrı gösterir.

  • Karar kaydı

    İyileştirme öncelikleri ve yeniden test listesi

    Bulguları önceliklere, sorumlulara, önerilen değişikliklere, yeniden test ölçütlerine, kabul edilen koşullara ve sonraki incelemeye bağlar.

Genel sonuç kabul edilebilir görünürken tanımlı bir grup daha fazla hata, daha kötü sonuç veya daha az yararlı açıklama ile karşılaşabilir. Bu inceleme farkları görünür kılıyor, ama verinin tek başına değerler hakkında karar verebileceğini varsaymıyor.

Şu durumlarda iyi bir seçim

  • Sistem önemli sonuçları etkiliyor, ama tanımlı grupların farklı hata yükü taşıyıp taşımadığı henüz kontrol edilmiyor.
  • Genel doğruluk yeterli görünüyor, ancak sonuç kesitleri toplam puanın göstermediği önemli bir farkı saklayabiliyor.
  • Kullanıcılara veya inceleyenlere açıklama sunuluyor ama bu açıklamaların yararı ve sınırları henüz test edilmedi.
  • Etkilenen gruplar ve kabul edilebilir ödünleşimler tanımlanıyor, ama sonuç kesitleri ile iyileştirme kapıları tek karara bağlanmıyor.
  • Sahadan örnekler bulunuyor, ancak örnekleme sınırları, etiketler ve bağımlılıklar bazı grup karşılaştırmalarını desteksiz bırakıyor.
  • Kesit bazında bulgular çıkıyor, ama istisna kararları, iyileştirme öncelikleri, sorumlular ve yeniden test ölçütleri açık kalıyor.
  • Mevcut kanıt bazı karşılaştırmaları destekliyor, bazılarını ise durduruyor, ancak değerlendirme bu sınırı henüz açıkça kaydetmiyor.

Şu durumlarda başka bir çalışma daha doğru

  • Kesit bulgularının hukuki veya düzenleyici adalet onayı sayılmasını istiyorsunuz. Biz karşılaştırma kanıtını tutuyoruz, onay yetkili uzmanlarınızda kalıyor.
  • Etkilenen grupları veya kabul edilebilir ödünleşimleri değerlendiricinin seçmesini istiyorsunuz. Bu ürün ve politika kararları yetkili sorumlunuza ait kalıyor.
  • Testin evrensel adaleti kanıtlamasını veya tüm önyargıyı ortadan kaldırmasını bekliyorsunuz. İncelenen kesitler bu iddiayı taşıyamıyor.

Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: Ana hizmeti inceleyin

Bir sistemi hiç ayakta tutmak zorunda kalmadıysanız onu iyi test etmek de zor. Biz production'da AI işletiyoruz, bu yüzden değerlendirme, güvenlik testi ve LLMOps çalışmalarımız gerçekte nelerin kırıldığını bilerek başlıyor. Ekibimiz kıdemli mühendislerden oluşuyor ve Zeo 2011'den beri müşteri projelerinde çalışıyor.

  • Confident AI / DeepEval

    Modelin açıkladığı gerekçenin verdiği kararla uyuşup uyuşmadığını test ediyoruz

  • Arize Phoenix

    Gruplar arasındaki hata farklarını zaman içinde Arize Phoenix ile izliyoruz

  • Giskard

    Alt grupları tarıyor, verinin yetersiz kaldığı karşılaştırmaları Giskard ile işaretliyoruz

  • Label Studio

    Eşitsizlik bulgularını kurumun kararlarıyla değerlendirilmek üzere insan incelemesine yönlendiriyoruz

  • Scale AI

    Alt grup karşılaştırmaları için gereken etiketli veriyi Scale AI ile genişletiyoruz

Etkilenen grupları, önemli sonuçları, mevcut kanıtı ve ödünleşim ile yanıtı onaylayacak yetkili kişiyi getirin.
Zeo ile konuşun

Sizin tanımladığınız etkilenen gruplar ve sonuçlar, ilgili kesit ve fark ölçüleri, sahadan örnekler, etiket ve veri bağlamı, açıklama davranışı, bilinen endişeler, mevcut kısıtlar, iyileştirme sorumluları ve sonucu kabul edecek yetkili kişi gerekiyor.