Golden dataset, vakalar izinli kaynaklara kadar izlendiğinde, değerlendiriciler ortak karar kuralını kullandığında, kritik kesitler görünür kaldığında ve her sürümün yenileme sorumlusu belli olduğunda güvenilir kalıyor.

Temsili vakalardan sürümlü bir set kurarken her vakanın kaynağını, beklenen davranışı, belirsizlik kuralını ve görüş ayrılığının nasıl karara bağlandığını kaydediyoruz. Setin bakım sorumlusu da belli oluyor.

Sürümlü değerlendirme vaka seti, kalibre etiketleri ve kaydedilmiş belirsizlik kararlarını yanında taşıyor. Korunan bölmeler, bilinen kapsam boşlukları ve sonraki yenileme politikası aynı sürümde kayıtlı kalıyor.

Altın Veri Seti Geliştirme illüstrasyonu: bir yapay zeka sistemini temsili kanıtlara göre test eden ekip

Birlikte çalıştığımız 500'den fazla markadan birkaçı

Tüm referansları gör
  • Capital Dergisi
  • Halk Yatırım
  • Joker
  • Altınbaş
  • Jumbo
  • Groupama

Seti sürümleri, inceleme kuralları ve bakım sorumlusu olan bir değerlendirme ürünü gibi kuruyoruz. Bir örnek klasörü bunun yerini tutmuyor.

  1. Kapsamı ve hakları tanımla

    Amaçlanan kullanımı, hata türlerini, kritik kesitleri, aday kaynakları, kullanım kısıtlarını ve kapsamı onaylayacak sorumluyu birlikte belirliyoruz.

    Yapay zeka desteği
    Analistlerimiz bilinen hata türlerinden ve kesitlerden yola çıkarak aday kapsam hedeflerini taslak hâline getirir.
    İnsan onayı
    Vakalar izinli mi, konuyla ilgili mi ve gerçek bir değerlendirme ihtiyacına dayanıyor mu? Hangi kaynağın ve kapsamın gerçekten kullanıma izinli olduğuna alan sorumlunuz karar verir.
  2. Vakaları topla ve yapılandır

    Kaynağı izlenebilir örnekleri topluyoruz, değerlendirme malzemesini ürün verisinden ayrı tutuyoruz. Sürümü ve veri bölmelerini üzerinde anlaştığımız karara göre tasarlıyoruz.

    Yapay zeka desteği
    Analistlerimiz aday vakaları toplar, kaynak ve köken bilgisini inceleme için etiketler.
    İnsan onayı
    Her vaka kaynağına, amacına ve izinli kullanımına kadar geriye izlenebiliyor mu? Her vakanın izlenebilir olduğunu ve doğru kaynaktan geldiğini alan sorumlunuz onaylar.
  3. Etiketleri ve belirsizliği kalibre et

    Alan uzmanları beklenen davranışı ve rubrikleri vakalara uyguluyor. Değerlendirici etiketlerini karşılaştırıyoruz, tek bir kuralla çözülemeyen vakalarda alan uzmanları bir araya gelip ortak bir karara varıyor.

    Yapay zeka desteği
    Analistlerimiz değerlendirici etiketlerini karşılaştırır, uyuşmazlık gösteren vaka kümelerini işaretler.
    İnsan onayı
    Değerlendiriciler arasındaki uyum yeterli mi, belirsiz vakalar açıkça işaretlendi mi? Tek bir kuralla çözülemeyen vakalarda alan uzmanları bir araya gelip ortak karara varır.
  4. Sürümle ve teslim et

    Kapsamı, bilinen boşlukları, bulaşma kontrollerini, yenileme tetikleyicilerini ve gelecekteki değişiklik akışını tek belgede topluyoruz.

    Yapay zeka desteği
    Analistlerimiz etiketlenmiş setten kapsam raporunun ve veri kartının ilk taslağını çıkarır.
    İnsan onayı
    Mevcut sürümü kim onaylıyor, sonraki yenilemeden kim sorumlu olacak? Mevcut sürümü kabul eden ve sonraki yenilemeyi üstlenen kişi, alan sorumlunuzdur.

Dataset'le birlikte mevcut sürümü anlaşılır ve sürdürülebilir kılan kayıtları da teslim ediyoruz.

  • Playbook

    Golden dataset kullanım ve kaynak kuralları planı

    Amaçlanan değerlendirme kullanımını, hedef görevleri, hata türlerini, kesitleri, kaynak kurallarını ve kapsam önceliklerini tanımlar.

  • Dataset

    Sürümlü değerlendirme vaka dosyası ve etiketleme rehberi

    Kaynağı izlenebilir vakaları, beklenen davranışı, etiketleri, rubrikleri, inceleme rehberini ve korunan veri bölmelerini bir arada sunar.

  • Atölye kaydı

    Değerlendirici kalibrasyonu ve belirsizlik karar dosyası

    Değerlendirici uyumunu, tartışmalı etiketleri, belirsizlik kararlarını ve ortak karara bağlanan vakaların gerekçesini kayda geçirir.

  • Model kartı

    Kapsam, köken ve yenileme politikası raporu

    Kapsamı, kökeni, kullanım kısıtlarını, bilinen boşlukları, bulaşma kontrollerini, sürüm geçmişini ve bakım tetikleyicilerini özetler.

Değerlendirme vakalarının kaynağı bulunamıyorsa, etiketler kişiden kişiye değişiyorsa, önemli kesitler zayıf kalıyorsa ya da tuning malzemesi test setine karıştıysa bu çalışma anlamlı oluyor.

Şu durumlarda iyi bir seçim

  • Ekipler model, prompt, agent ve yayınları farklı vaka setleriyle karşılaştırıyor, bu yüzden puan değişimi ile örnek değişimi birbirinden ayrılamıyor.
  • Değerlendiriciler aynı belirsiz vakayı farklı etiketliyor, ama hangi cevabın geçerli kalacağını açıklayan davranış kuralı veya karar günlüğü bulunmuyor.
  • Kritik görev ve kullanıcı kesitleri zayıf kalıyor, ama değerlendirme setinin yeni hatalarla yenilenmesini kimse üstlenmiyor.
  • Vakalar birkaç kaynaktan geliyor, ama kapsam haritası onları amaçlanan görevlere, hata türlerine ve puanın temsil edeceği kritik kesitlere bağlamıyor.
  • Beklenen çıktı ve rubrikler inceleyenlerin notlarında duruyor, ancak görüş ayrılığı ile gerçek belirsizlik tutarlı biçimde kalibre edilmiyor.
  • Değerlendirme vakaları sürümleniyor, ama zayıf köken ve bulaşma kontrolleri tuning malzemesinin korunan bölmelere geçmesini engellemiyor.
  • Yeni vakalar gelişigüzel ekleniyor veya kaldırılıyor, bu yüzden golden dataset yeni sürüme geçtiğinde karşılaştırılabilirliği koruyan kapı bulunmuyor.

Şu durumlarda başka bir çalışma daha doğru

  • Kaynak hakkı, gizlilik veya izinli veri kullanımı için hukuki onay istiyorsunuz. Dataset kökeni kaydediyor, hüküm ise yetkili uzmanınızda kalıyor.
  • Golden dataset'in gelecekteki her kullanıcıyı, görevi veya hatayı temsil etmesini istiyorsunuz. Kapsam yalnızca onaylanan kesit ve hata türlerinde geçerli kalıyor.
  • Büyük bir etiketleme operasyonu veya sürekli bakım istiyorsunuz. Bu çalışma yenileme politikasını kuruyor, devam eden işletim ayrı kapsam gerektiriyor.

Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: Ana hizmeti inceleyin

Bir sistemi hiç ayakta tutmak zorunda kalmadıysanız onu iyi test etmek de zor. Biz production'da AI işletiyoruz, bu yüzden değerlendirme, güvenlik testi ve LLMOps çalışmalarımız gerçekte nelerin kırıldığını bilerek başlıyor. Ekibimiz kıdemli mühendislerden oluşuyor ve Zeo 2011'den beri müşteri projelerinde çalışıyor.

  • Confident AI / DeepEval

    Golden dataset yapısını gerçek bir değerlendirme çalıştırmasıyla doğrulayan platform

  • DVC

    Golden dataset'i teslim edilebilir bir artifact olarak versiyonladığımız sistem

  • Label Studio

    Her vakada reviewer uyumunu ve anlaşmazlık kararını kaydettiğimiz platform

  • Tonic

    Nadir veya hassas kapsam boşluklarını sentetik vakalarla tamamladığımız araç

  • Jupyter

    Her vakanın kaynağını ve kullanım hakkını kodla kontrol eden notebook ortamı

  • Scale AI

    İç kayıtların yetmediği kapsam için vakaları ölçekli biçimde etiketlediğimiz platform

Use case'i, aday örnekleri ve beklenen davranış konusunda karar verecek alan sorumlusunu bize iletin.
Zeo ile konuşun

Amaçlanan kullanımı, hata türlerini, aday vakaları, kaynak ve kullanım hakkı bilgisini, gizlilik kısıtlarını, alan uzmanlarını, beklenen davranış kurallarını, kritik kesitleri ve dataset'in bakımını üstlenecek kişiyi hazırlayın.