RAG yayın kararı ancak tam yanıt değerlendirilmeden önce retrieval, groundedness, alıntı, erişim ve yanıt vermeme davranışının her biri ayrı puanlandığında güvenilir oluyor.

Retrieval, grounded iddialar, alıntılar, erişim kontrolleri ve yanıt vermeme davranışını ayrı ayrı test ediyoruz. Böylece hatanın veri kaynağında, retrieval'da, üretimde, alıntıda ya da erişim tasarımında başladığı görülebiliyor.

Elinizde altın sorgular, alt sistem puanlaması, sorgu kesiti bulguları ve her açık hatanın hangi RAG katmanına ait olduğunu gösteren yayın listesi kalıyor.

RAG Değerlendirme ve Temellendirme Testi illüstrasyonu: bir doküman hattını bir getirim sistemine bağlayan ekip

Birlikte çalıştığımız 500'den fazla markadan birkaçı

Tüm referansları gör
  • Amazon
  • English Home
  • Yandex
  • Odeabank
  • İstanbul Gedik Üniversitesi
  • Desa
  • GS Store

Tam yanıtın davranışına bakmadan önce RAG yolundaki her parçayı kendi içinde inceliyoruz.

  1. Test sınırını belirle

    Sorgu kümesini, kaynak dokümanları, erişim rollerini, beklenen kanıtı, bilinen hataları ve kabul edilebilir yayın sınırlarını birlikte netleştiriyoruz.

    Yapay zeka desteği
    Analistlerimiz bilinen kullanım pattern'lerinden ve hatalardan yola çıkarak aday sorgu kümesini taslak hâline getiriyor.
    İnsan onayı
    Değerlendirme seti önemli soruları ve kullanıcıları temsil ediyor mu? Değerlendirme setinin önemli soruları temsil ettiğini ürün sorumlunuz onaylıyor.
  2. Korunan vakaları oluştur

    Altın sorguları ve ilgi etiketlerini hazırlıyor, değerlendirme setini uygulama ayarlarından ayrı tutuyoruz.

    Yapay zeka desteği
    Analistlerimiz alan incelemesi için aday ilgi etiketleri taslağı hazırlıyor.
    İnsan onayı
    Her etiket onaylı bir kaynağa ve inceleme kuralına bağlanabiliyor mu? Her etiketi korunan sete girmeden önce bir alan uzmanı onaylıyor.
  3. Alt sistemleri ayrı test et

    Tam yanıt yolunu incelemeden önce retrieval'i, grounded iddiaları, alıntıları, erişimi ve yanıt vermemeyi ayrı ayrı ölçüyoruz.

    Yapay zeka desteği
    Araçlarımız retrieval'i, alıntıları ve groundedness'i her vaka için ayrı ayrı puanlıyor.
    İnsan onayı
    Her hata onu gerçekten düzeltebilecek alt sisteme yönlendirildi mi? Belirli bir hatanın hangi alt sisteme ait olduğuna değerlendirme liderimiz karar veriyor.
  4. Release gate'i yeniden test et

    Değişikliklerden sonra hatalı kesitleri tekrarlıyoruz. Açık istisnaları, regresyon durumunu ve sonraki kararın kime ait olduğunu kaydediyoruz.

    Yapay zeka desteği
    Araçlarımız hatalı kesitleri yeniden çalıştırıp regresyon durumu taslağını incelemeye hazırlıyor.
    İnsan onayı
    Ürün sorumlusu yayına alıyor mu, koşullu alıyor mu, yoksa geliştirmeyi bekletiyor mu? Geliştirmeyi yayınlama, koşullama veya bekletme kararını ürün sorumlunuz veriyor.

Kanıtı, hatanın görüldüğü sorgu, kaynak, rol ve sistem katmanıyla birlikte tutuyoruz.

  • Dataset

    Altın sorgu ve ilgi etiketi envanteri

    Gerçek sorguları, beklenen kaynakları, ilgi etiketlerini, erişim bağlamını ve inceleme kurallarını içerir.

  • Test kanıtı

    Retrieval'dan yanıt vermemeye puanlama matrisi

    Retrieval'i, groundedness'i, alıntıyı, erişimi ve yanıt vermemeyi hem ayrı hem de tam yanıt yolu üzerinde test eder.

  • Rapor

    Sorgu kesiti hataları ve iyileştirme bulguları

    Hataları sorgu türüne, kaynağa, role, alt sisteme ve denenen iyileştirmeye göre gruplar.

  • Karar kaydı

    Groundedness sınırları, istisnalar ve yayın listesi

    Kabul edilebilir sınırları, kritik istisnaları, onaylanan koşulları, sorumluları ve sonraki regresyon tetikleyicisini kaydeder.

RAG yanıtı akıcı olabilir ama yanlış doküman gelmiş, iddia desteksiz kalmış, alıntı yanıltmış ya da erişim kuralı aşılmış olabilir. Bu değerlendirme o hataları birbirinden ayırıyor.

Şu durumlarda iyi bir seçim

  • RAG yanıtları akıcı göründüğü hâlde incelemeden kalıyor, ama ekip hatanın retrieval, desteksiz üretim ya da alıntıdan mı başladığını ayıramıyor.
  • Genel yanıt kalitesi kabul edilebilir görünüyor, ama erişim sızıntıları ve yanıt vermeme hataları toplam sonucun içinde kayboluyor.
  • Temsili sorgular ve kaynak dokümanlar var, ama bilinen hatalar erişim rolleri, izler ve beklenen kanıtla eşleşmiyor.
  • Altın sorgular hazırlanıyor, ama ilgi etiketleri, kritik kullanıcı kesitleri ve korunan vakalar aynı inceleme kuralına bağlanmıyor.
  • Tam yanıta tek puan veriliyor, bu yüzden retrieval, groundedness, alıntı, erişim ve yanıt vermeme hataları birbirinden ayrılamıyor.
  • Bir iyileştirme ortalamayı yükseltiyor, ama hatalı sorgu kesitleri yeniden çalıştırılmıyor ve regresyon kapısına bağlanmıyor.
  • Bileşen kanıtı bulunuyor, ama kritik istisnalar ve regresyon durumu ürün sorumlusunun yayın kararını hâlâ belirsiz bırakıyor.

Şu durumlarda başka bir çalışma daha doğru

  • Groundedness ve yanıt vermeme sonuçlarının sertifikasyon ya da denetim görüşü yerine geçmesini bekliyorsunuz. Hukuki ve düzenleyici belirleme ürün yetkilinizde kalıyor.
  • Her yanıtın doğru, grounded, eksiksiz veya risksiz olmasını bekliyorsunuz, ama kanıt yalnızca test edilen korpus, roller ve sorguları kapsıyor.
  • Korpus edinimi, production işletimi veya iyileştirmenin uygulanmasını istiyorsunuz, çünkü bu çalışma kararlaştırılan RAG test sınırında bitiyor.

Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: Ana hizmeti inceleyin

Bir sistemi hiç ayakta tutmak zorunda kalmadıysanız onu iyi test etmek de zor. Biz production'da AI işletiyoruz, bu yüzden değerlendirme, güvenlik testi ve LLMOps çalışmalarımız gerçekte nelerin kırıldığını bilerek başlıyor. Ekibimiz kıdemli mühendislerden oluşuyor ve Zeo 2011'den beri müşteri projelerinde çalışıyor.

  • LlamaIndex

    retrieval ara adımlarını ayrı bir test alanı olarak açıyor

  • Chroma

    retrieval testlerini production'ın sorguladığı aynı corpus üzerinde çalıştırıyor

  • Ragas

    retrieval ve kaynağa dayanma düzeyini ayrı ayrı ölçüyor

  • Confident AI / DeepEval

    retrieval'ın yalnızca ilgiyi değil kullanıcı rolünü de gözettiğini kontrol ediyor

Mevcut hattı ve temsili soruları, yayın yetkisini taşıyan kişiyle birlikte inceleyelim.
Zeo ile konuşun

Kapsamdaki RAG uygulamasını, temsili sorgu ve kaynak dokümanları, erişim rollerini, beklenen kanıtı, bilinen hataları, izleri ve önerilen yayın sınırlarını paylaşın. Hassas dokümanlar ile değerlendirme vakalarının nasıl kullanılacağını ve saklanacağını da baştan belirliyoruz.