RAG ve Kurumsal Bilgi Sistemleri
RAG Değerlendirme ve Temellendirme Testi
RAG yayın kararı ancak tam yanıt değerlendirilmeden önce retrieval, groundedness, alıntı, erişim ve yanıt vermeme davranışının her biri ayrı puanlandığında güvenilir oluyor.
Retrieval, grounded iddialar, alıntılar, erişim kontrolleri ve yanıt vermeme davranışını ayrı ayrı test ediyoruz. Böylece hatanın veri kaynağında, retrieval'da, üretimde, alıntıda ya da erişim tasarımında başladığı görülebiliyor.
Elinizde altın sorgular, alt sistem puanlaması, sorgu kesiti bulguları ve her açık hatanın hangi RAG katmanına ait olduğunu gösteren yayın listesi kalıyor.


Birlikte çalıştığımız 500'den fazla markadan birkaçı
Tüm referansları görAdımlar, kapılar ve kararı verenler
Çalışma şeklimiz
Tam yanıtın davranışına bakmadan önce RAG yolundaki her parçayı kendi içinde inceliyoruz.
Test sınırını belirle
Sorgu kümesini, kaynak dokümanları, erişim rollerini, beklenen kanıtı, bilinen hataları ve kabul edilebilir yayın sınırlarını birlikte netleştiriyoruz.
- Yapay zeka desteği
- Analistlerimiz bilinen kullanım pattern'lerinden ve hatalardan yola çıkarak aday sorgu kümesini taslak hâline getiriyor.
- İnsan onayı
- Değerlendirme seti önemli soruları ve kullanıcıları temsil ediyor mu? Değerlendirme setinin önemli soruları temsil ettiğini ürün sorumlunuz onaylıyor.


Korunan vakaları oluştur
Altın sorguları ve ilgi etiketlerini hazırlıyor, değerlendirme setini uygulama ayarlarından ayrı tutuyoruz.
- Yapay zeka desteği
- Analistlerimiz alan incelemesi için aday ilgi etiketleri taslağı hazırlıyor.
- İnsan onayı
- Her etiket onaylı bir kaynağa ve inceleme kuralına bağlanabiliyor mu? Her etiketi korunan sete girmeden önce bir alan uzmanı onaylıyor.


Alt sistemleri ayrı test et
Tam yanıt yolunu incelemeden önce retrieval'i, grounded iddiaları, alıntıları, erişimi ve yanıt vermemeyi ayrı ayrı ölçüyoruz.
- Yapay zeka desteği
- Araçlarımız retrieval'i, alıntıları ve groundedness'i her vaka için ayrı ayrı puanlıyor.
- İnsan onayı
- Her hata onu gerçekten düzeltebilecek alt sisteme yönlendirildi mi? Belirli bir hatanın hangi alt sisteme ait olduğuna değerlendirme liderimiz karar veriyor.


Release gate'i yeniden test et
Değişikliklerden sonra hatalı kesitleri tekrarlıyoruz. Açık istisnaları, regresyon durumunu ve sonraki kararın kime ait olduğunu kaydediyoruz.
- Yapay zeka desteği
- Araçlarımız hatalı kesitleri yeniden çalıştırıp regresyon durumu taslağını incelemeye hazırlıyor.
- İnsan onayı
- Ürün sorumlusu yayına alıyor mu, koşullu alıyor mu, yoksa geliştirmeyi bekletiyor mu? Geliştirmeyi yayınlama, koşullama veya bekletme kararını ürün sorumlunuz veriyor.


Adı konmuş, sizde kalan çıktılar
Elinize geçenler
Kanıtı, hatanın görüldüğü sorgu, kaynak, rol ve sistem katmanıyla birlikte tutuyoruz.


Dataset
Altın sorgu ve ilgi etiketi envanteri
Gerçek sorguları, beklenen kaynakları, ilgi etiketlerini, erişim bağlamını ve inceleme kurallarını içerir.


Test kanıtı
Retrieval'dan yanıt vermemeye puanlama matrisi
Retrieval'i, groundedness'i, alıntıyı, erişimi ve yanıt vermemeyi hem ayrı hem de tam yanıt yolu üzerinde test eder.


Rapor
Sorgu kesiti hataları ve iyileştirme bulguları
Hataları sorgu türüne, kaynağa, role, alt sisteme ve denenen iyileştirmeye göre gruplar.


Karar kaydı
Groundedness sınırları, istisnalar ve yayın listesi
Kabul edilebilir sınırları, kritik istisnaları, onaylanan koşulları, sorumluları ve sonraki regresyon tetikleyicisini kaydeder.
Kapsam ve dürüst sınırlar
Bu çalışmanın size uyduğu durumlar
RAG yanıtı akıcı olabilir ama yanlış doküman gelmiş, iddia desteksiz kalmış, alıntı yanıltmış ya da erişim kuralı aşılmış olabilir. Bu değerlendirme o hataları birbirinden ayırıyor.
Şu durumlarda iyi bir seçim
- RAG yanıtları akıcı göründüğü hâlde incelemeden kalıyor, ama ekip hatanın retrieval, desteksiz üretim ya da alıntıdan mı başladığını ayıramıyor.
- Genel yanıt kalitesi kabul edilebilir görünüyor, ama erişim sızıntıları ve yanıt vermeme hataları toplam sonucun içinde kayboluyor.
- Temsili sorgular ve kaynak dokümanlar var, ama bilinen hatalar erişim rolleri, izler ve beklenen kanıtla eşleşmiyor.
- Altın sorgular hazırlanıyor, ama ilgi etiketleri, kritik kullanıcı kesitleri ve korunan vakalar aynı inceleme kuralına bağlanmıyor.
- Tam yanıta tek puan veriliyor, bu yüzden retrieval, groundedness, alıntı, erişim ve yanıt vermeme hataları birbirinden ayrılamıyor.
- Bir iyileştirme ortalamayı yükseltiyor, ama hatalı sorgu kesitleri yeniden çalıştırılmıyor ve regresyon kapısına bağlanmıyor.
- Bileşen kanıtı bulunuyor, ama kritik istisnalar ve regresyon durumu ürün sorumlusunun yayın kararını hâlâ belirsiz bırakıyor.
Şu durumlarda başka bir çalışma daha doğru
- Groundedness ve yanıt vermeme sonuçlarının sertifikasyon ya da denetim görüşü yerine geçmesini bekliyorsunuz. Hukuki ve düzenleyici belirleme ürün yetkilinizde kalıyor.
- Her yanıtın doğru, grounded, eksiksiz veya risksiz olmasını bekliyorsunuz, ama kanıt yalnızca test edilen korpus, roller ve sorguları kapsıyor.
- Korpus edinimi, production işletimi veya iyileştirmenin uygulanmasını istiyorsunuz, çünkü bu çalışma kararlaştırılan RAG test sınırında bitiyor.
Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: Ana hizmeti inceleyin
Test ettiğimiz sistemleri kendimiz de işletiyoruz
Bir sistemi hiç ayakta tutmak zorunda kalmadıysanız onu iyi test etmek de zor. Biz production'da AI işletiyoruz, bu yüzden değerlendirme, güvenlik testi ve LLMOps çalışmalarımız gerçekte nelerin kırıldığını bilerek başlıyor. Ekibimiz kıdemli mühendislerden oluşuyor ve Zeo 2011'den beri müşteri projelerinde çalışıyor.
Kullandığımız araçlar
Bu işin arkasındaki araçlar
LlamaIndexretrieval ara adımlarını ayrı bir test alanı olarak açıyor
Chromaretrieval testlerini production'ın sorguladığı aynı corpus üzerinde çalıştırıyor
Ragasretrieval ve kaynağa dayanma düzeyini ayrı ayrı ölçüyor
Confident AI / DeepEvalretrieval'ın yalnızca ilgiyi değil kullanıcı rolünü de gözettiğini kontrol ediyor
Sonraki adım
RAG hatasını sorumlu katmana kadar izleyin


Karar vermeden önce



























