Güvenilirlik, yayına girecek geliştirmede tekrarlı görev yörüngeleri, açık araç ve politika kontrolleri, kalibre değerlendiriciler ve görünür kalan kritik kesitlerle gösterildiğinde karar taşımaya başlıyor.

Agent yörüngelerini ölçümlüyor ve regresyon paketini incelenen geliştirmeye bağlıyoruz. Görev başarısı, araç davranışı, toparlanma, eskalasyon, politika kontrolleri ve koşudan koşuya değişkenlik yayın öncesinde ayrı ayrı görülebiliyor.

Yayın sorumlunuz agent'ı kabul, koşullama veya durdurma kararını geliştirmeye bağlı regresyon kanıtına, incelenmiş değerlendirici uyuşmazlıklarına ve kritik kesit brief'ine dayandırıyor.

AI Agent Değerlendirme ve Güvenilirlik illüstrasyonu: bir yapay zeka ajanının araçlarını ve karar sınırlarını test eden ekip

Birlikte çalıştığımız 500'den fazla markadan birkaçı

Tüm referansları gör
  • Bayer
  • PayTR
  • Mustela
  • Akakçe
  • Logo Yazılım
  • Exquise
  • Neova Sigorta

İnceleme, agent'ı amaçlanan görevden araç çağrılarına, toparlanmadan eskalasyona ve geliştirme kararına kadar izliyor.

  1. Değerlendirme sözleşmesini kur

    Gerçek görevleri, bilinen hataları, araç sözleşmelerini, politikaları ve yayın ölçütlerini tek bir değerlendirme tanımında topluyoruz.

    Yapay zeka desteği
    Agent'larımız, incelenen agent'ın kendi kayıtlarından yola çıkarak aday görevleri ve hata kategorilerini taslak hâline getirir.
    İnsan onayı
    Görevler ve belirlediğimiz sınırlar agent'ın gerçek çalışma koşullarını yansıtıyor mu? Sözleşmedeki görevleri ve sınırları yayın sorumlunuz onaylar.
  2. Ölçümle ve çalıştır

    Agent'ın izlediği yolları ve yan etkileri kaydediyoruz. Temsili, olumsuz, toparlanma ve eskalasyon vakalarını aynı geliştirme üzerinde tekrarlıyoruz.

    Yapay zeka desteği
    Agent'larımız tekrarlı vakaları çalıştırıp kalibre incelemesi için yörüngeleri kayda geçirir.
    İnsan onayı
    Önemli her sonuç kendi izi üzerinden yeniden üretilebiliyor mu? Bir iz hata sayılmadan önce değerlendirme liderimiz onaylar.
  3. Kanıtı kalibre et

    Deterministik kontrolleri, rubrik değerlendiricilerini ve uzmanların incelediği izleri karşılaştırıyoruz. Uyuşmazlığı ortalamaya gömmüyor, ayrıca kalibre ediyoruz.

    Yapay zeka desteği
    Agent'larımız deterministik kontrollerle rubrik değerlendiricileri arasındaki uyuşmazlığı işaretler.
    İnsan onayı
    Değerlendirici kararları yayın sorusunu yanıtlayacak kadar tutarlı mı? Hangi değerlendirici kararının güvenilir olduğuna adı belli uzman karar verir.
  4. Release gate'i yeniden test et

    Değişikliklerden sonra başarısız yolları yeniden çalıştırıyoruz. Geçilen sınırları, açık istisnaları, kalan riski ve sonraki inceleme tetikleyicisini kaydediyoruz.

    Yapay zeka desteği
    Agent'larımız yeniden test sonuçlarından kesit raporunun taslağını incelemeye hazır hâle getirir.
    İnsan onayı
    Yayın sorumlunuz geliştirmeyi kabul ediyor, koşullu kabul ediyor veya durduruyor mu? Geliştirmeyi kabul eden, koşullayan veya reddeden kişi yayın sorumlunuzdur.

Her çıktı, üretildiği agent geliştirmesine, girdilere, araç koşullarına ve yayın sorusuna geri bağlanıyor.

  • Playbook

    Agent görevleri ve hata sınıfları dosyası

    Günlük görevleri, hata sınıflarını, araç sözleşmelerini, politikaları, belirlediğimiz sınırları ve inceleme sorumlularını tanımlar.

  • Test kanıtı

    Geliştirmeye bağlı yörünge regresyon dosyası

    Test vakalarını ve yörünge kaydını incelenen agent sürümüne bağlar.

  • Dataset

    Değerlendirici uyuşmazlığı ve iz örneği dosyası

    Deterministik kontrollerin, rubrik değerlendiricilerinin ve uzman incelemesinin nerede uyuştuğunu veya ayrıştığını gösterir.

  • Karar kaydı

    Toparlanma ve eskalasyon kesit bulguları brief'i

    Görev, politika, araç, toparlanma ve eskalasyon sonuçlarını açık istisnalar ve yeniden test durumuyla ayrı gösterir.

İyi bir demo sonucun tekrarlanıp tekrarlanmayacağını, agent'ın araç sözleşmesine uyacağını, hatadan toparlanacağını ya da doğru yerde eskalasyon yapacağını gösteremez. Bu çalışma yayın kanıtını kuruyor.

Şu durumlarda iyi bir seçim

  • Tek bir agent koşusu ikna edici görünüyor, ama temsili görevler tekrarlandığında başarı, araç davranışı, toparlanma veya eskalasyon değişiyor.
  • Araç çağrıları demoda tamamlanıyor, ama yan etkiler aynı geliştirmedeki açık sözleşme ve politika kurallarıyla henüz karşılaştırılmıyor.
  • Yayın tarihi yaklaşıyor, ama sorumlunuzun belirlediğimiz sınırları ve kritik görev, araç, toparlanma ile eskalasyon istisnalarını ayrı göreceği kanıtı yok.
  • Önemli agent yolları biliniyor, ama tekrarlı koşunun nerede ayrıldığını gösteren hata taksonomisi ve yörünge ölçümlemesi henüz bulunmuyor.
  • Deterministik kontroller ve rubrik değerlendiricileri geliştirmeyi puanlıyor, ama uyuşmazlıkları uzmanların incelediği izlerle henüz kalibre edilmiyor.
  • Genel sonuç güçlü görünüyor, ama stres, toparlanma, politika, araç ve görev kesitleri yayını durdurabilecek yolu hâlâ gizliyor.
  • Bir release gate var, ama sorumlunuz hangi istisnanın açık kaldığını, neyin değiştiğini veya hangi yörüngenin yeniden koşacağını göremiyor.

Şu durumlarda başka bir çalışma daha doğru

  • Geliştirmenin denetim veya sertifikasyon çıktısı sayılmasını ya da hukuki ve düzenleyici onay taşımasını istiyorsunuz. Biz davranış kanıtı sunuyoruz, onayı yetkili uzmanınız veriyor.
  • Agent'ın kusursuz, tam otonom, güvenli veya kalan risksiz olduğunun kanıtlanmasını istiyorsunuz. Tekrarlı koşular yalnızca test edilen görevleri ve geliştirmeyi gösteriyor.
  • Production'daki agent'ın işletilmesini veya hatalı yollarının düzeltilmesini istiyorsunuz. Bu çalışma geliştirmeyi değerlendirip yeniden test ediyor, uygulama ayrı kalıyor.

Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: Ana hizmeti inceleyin

Bir sistemi hiç ayakta tutmak zorunda kalmadıysanız onu iyi test etmek de zor. Biz production'da AI işletiyoruz, bu yüzden değerlendirme, güvenlik testi ve LLMOps çalışmalarımız gerçekte nelerin kırıldığını bilerek başlıyor. Ekibimiz kıdemli mühendislerden oluşuyor ve Zeo 2011'den beri müşteri projelerinde çalışıyor.

  • Langfuse

    Agent'ın tool çağrılarını ve recovery adımlarını her tekrarlı çalışmada izliyoruz

  • Braintrust

    Regresyon test setini doğrudan canlıya alınacak agent sürümüne bağlıyoruz

  • Confident AI / DeepEval

    Agent rotalarını kalibre edilmiş grader'larla puanlayıp insan değerlendirmesiyle karşılaştırıyoruz

  • Arize Phoenix

    Agent güvenilirliğinin kırıldığı kritik görev segmentlerini tek tek izole ediyoruz

Mevcut geliştirmeyi, temsili görevleri ve yayın konusunda son yetkiyi taşıyan kişiyi hazır tutun.
Zeo ile konuşun

Agent kapsamını ve mimarisini, temsili görevleri, araç sözleşmelerini, yörüngeleri, politikaları, bilinen hataları, ortam erişimini ve önerilen yayın ölçütlerini paylaşın. Hassas malzeme için kullanım amacını, erişim sınırını ve saklama koşulunu testten önce belirliyoruz.