Fine-tuning veri seti, kabul edilen her kaydın izinli kaynağı izlendiğinde, etiketler kritik kesitlerde tutarlı kaldığında ve eğitim verisi doğrulama ile test vakalarından yalıtıldığında hazır oluyor.

İyi örnekleri bir klasörde toplamak, eğitim dataset'i kurmaya yetmiyor. Her kaydın nereden geldiğini ve hangi hakla kullanılabildiğini belgeliyor, etiketleme kurallarını birlikte kalibre ediyor, tekrarları ayıklıyor ve değerlendirme örneklerini eğitim verisinden ayrı tutuyoruz. Teslimde elinizde izinli, temsili ve sürümlü bir dataset kalıyor. Bu çalışma model eğitimi içermiyor.

Bir kaydın neden eğitime girdiği aylar sonra da sabit kaynak izlerinden okunabiliyor. Sürümlü eğitim verisi, kalibre etiketler, korunan bölmeler, sızıntı bulguları ve veri sorumlunuzun kabul ettiği sınırlar bir arada duruyor.

İnce Ayar Veri Seti Kürasyonu illüstrasyonu: bir modeli hedef davranışa ve başlangıç seviyesine göre ayarlayan ekip

Birlikte çalıştığımız 500'den fazla markadan birkaçı

Tüm referansları gör
  • LC Waikiki
  • PayTR
  • Yves Rocher
  • A101
  • Shiftdelete
  • Country Floors
  • Groupama

Kabul, ret ve belirsizlik kararlarını örnek seti hâlâ alan uzmanlarının tek tek inceleyebileceği büyüklükteyken veriyoruz.

  1. Toplamadan önce kuralları netleştiriyoruz

    Hedef davranışı ve baseline'ı tanımlıyor, izinli kaynakları kararlaştırıyor, biçimlerle etiketleri belirliyor, kritik kesitleri adlandırıyor, ret gerekçelerini kaydediyor ve ayrılmış test sınırını çiziyoruz.

    Yapay zeka desteği
    Hedef davranış ve kalibrasyon örneklerinden ilk etiketleme ölçütünü model taslaklıyor. Veri sorumlusu taslağı inceleyip düzeltiyor.
    İnsan onayı
    Veri sorumlunuz hem etiketleme ölçütünü hem de izinli kaynakları onayladı mı? Veri sorumlunuz toplama başlamadan önce taslağı inceliyor, ölçütü ve kaynak listesini onaylıyor.
  2. Her örneği kaynağıyla birlikte alıyoruz

    Aday kayıtları köken ve kullanım hakkı bilgisiyle birlikte alıyoruz. Biçimleri normalleştirirken kaynağın kimliğini inceleme için koruyoruz.

    Yapay zeka desteği
    Köken kaydı veya kullanım hakkı belgesi bulunmayan adayları model işaretliyor. Veri sorumlusu her adayı inceliyor.
    İnsan onayı
    Kabul edilen her kayıt izinli bir kaynağa kadar izlenebiliyor mu? Eksik ya da belirsiz hak kaydı olan her örnek hakkında veri sorumlunuz karar veriyor.
  3. Temsili çalışma setini oluşturuyoruz

    Örnekleri filtreliyor, etiketliyor ve kritik kesitler arasındaki dağılımı inceliyoruz. Belirsiz ve reddedilen kayıtlar, alan uzmanı karar verene kadar görünür kalıyor.

    Yapay zeka desteği
    Etiketleri model ölçütle karşılaştırıp tutarsız kararları öne çıkarıyor. Alan uzmanı her belirsizliği çözüyor.
    İnsan onayı
    İnceleyen kişiler ölçütü kalibrasyon örneklerinin dışında da tutarlı uygulayabiliyor mu? Belirsiz kalan her etiket için son kararı alan uzmanı veriyor.
  4. Bölmeleri ayırıp sürümü sabitliyoruz

    Tekrarları ayıklıyor, sızıntıyı tarıyor, eğitim-doğrulama-test üyeliğini belirliyor, sürümü sabitliyor ve dataset kartını yazıyoruz.

    Yapay zeka desteği
    Eğitim, doğrulama ve test bölmelerini model tekrar ve olası sızıntı için tarıyor. Bir uzman bulguları herhangi bir kayıt taşınmadan önce inceliyor.
    İnsan onayı
    Ayrılmış örnekler yalıtıldı mı, kalan kusurlar veri sorumlusu tarafından kabul edildi mi? Veri sorumlunuz dataset sürümünü bilinen sınırlarıyla birlikte kabul ediyor.

Teslim seti dataset'e hangi kayıtların girdiğini, bunların nereden geldiğini, nasıl kontrol edildiğini ve hangi kullanımların onaylandığını gösteriyor.

  • Playbook

    Hedef davranış ve izinli kaynak kürasyon planı

    Hedef davranış, kaynak kuralları, etiketleme ölçütü, biçimler, kritik kesitler, ret koşulları ve ayrılmış test sınırı için çalışma belgesi.

  • Dataset

    Kaynak iziyle sürümlenmiş fine-tuning veri dosyası

    Kabul edilen kayıtlar sabit kimlik, etiket, kaynak referansı, normalleştirme geçmişi ve dataset sürümüyle teslim edilir.

  • Risk kaydı

    Kullanım hakkı, kesit kapsamı ve sızıntı raporu

    Kaynak ve hak kayıtları, kritik kesit kapsamı, tekrarlar, olası sızıntılar, etiket sorunları ve açık istisnalar tek raporda yer alır.

  • Model kartı

    Eğitim-doğrulama-test bölme manifestosu ve sınır dosyası

    Manifesto eğitim, doğrulama ve test üyeliğini kaydeder. Dataset kartı amaçlanan kullanımı, sınırları, bilinen kusurları, inceleme durumunu ve sorumluyu açıklar.

Modelin öğrenmesini istediğiniz davranış belli, ama elinizdeki örneklerin eğitim verisine girebilmesi için izin, temsil ve tutarlılık açısından incelenmesi gerekiyor.

Şu durumlarda iyi bir seçim

  • Örnekler birkaç sistemden geliyor, ama biçim, etiket ve izin kayıtlarındaki farklar hangi kaydın eğitime girebileceği konusunda inceleyenleri kararsız bırakıyor.
  • Dataset büyük görünüyor, ancak kritik kullanıcı, görev ve hata kesitleri eğitim örneğinin öğreteceği davranışı bozacak kadar zayıf kalıyor.
  • Baseline ve ayrılmış vakalar eğitim havuzuna yakın duruyor, bu yüzden tekrar veya sızıntı sonraki deneyi gerçekte olduğundan iyi gösterebiliyor.
  • Hedef davranış biliniyor, ama onaylı veri reçetesi, etiketleme ölçütü, biçim kuralı ve kritik kesit listesi toplamayı yönlendirmiyor.
  • Kaynaklar, normalleştirme kararları, denge kontrolleri, köken ve kullanım hakları ayrı kayıtlarda duruyor, bu yüzden kabul edilen örnek izlenemiyor.
  • Kayıtlarda tekrar ve sızıntı adayları kalıyor, ancak eğitim, doğrulama ve test üyeliği henüz birbirinden yalıtılmıyor.
  • Dataset sürümü teslime yaklaşıyor, ama kalite incelemesi, bölme manifestosu, bilinen kusurlar ve sorumlu kişi henüz belgelenmiyor.

Şu durumlarda başka bir çalışma daha doğru

  • Kullanım hakkı, gizlilik yükümlülüğü veya düzenlemeye tabi veri için hukuki onay istiyorsunuz. Kürasyon kanıtı kaydediyor, hüküm yetkilinizde kalıyor.
  • Kapsam boşluğunu doğrulanmamış veya izinsiz örneklerle kapatmak istiyorsunuz, ama kabul edilen her kayıt yine izinli bir kaynağa dayanıyor.
  • Modelin eğitilmesini, dağıtılmasını veya işletilmesini istiyorsunuz. Bu çalışma kabul edilmiş veri dosyasında bitiyor, sonraki aşamalar ayrı kapsam gerektiriyor.

Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: Model özelleştirme hizmetlerini incele

Zeo'nun kod yazıp teslim eden tarafı burası. Kıdemli mühendislerimiz agent, chatbot ve RAG sistemleri geliştiriyor, çevrelerindeki otomasyon ve veri işlerini üstleniyor, sistemler canlıya çıktıktan sonra da işletmeyi sürdürüyor. 2011'den beri 500'den fazla markayla çalıştık.

  • Hugging Face

    Kürasyonu tamamlanan veri setini eğitime hazır formatta teslim ettiğimiz platform

  • DVC

    Her kürasyon turunda veri setini kayıt bazında versiyonlayan sistem

  • Tonic

    Hassas gerçek veriyi açmadan kapsamı sentetik örneklerle genişletmemize yardımcı olur

  • Jupyter

    Tekrar ayıklama ve rubric kontrollerini yeniden çalıştırılabilir kodla yürüttüğümüz ortam

  • Labelbox

    Etiketleme sürecinde reviewer uyumunu tanımlı rubric üzerinden takip ettiğimiz platform

Hedef davranışı, aday örnekleri ve hak kayıtlarını getirin. Etiketleme kurallarından sorumlu kişinin de görüşmeye katılması gerekir.
Dataset'i konuşalım

Başlangıçta hangi materyaller hazır olmalı?

Hedef davranışı ve baseline'ı, aday örnekleri, kaynak ve kullanım hakkı kayıtlarını, biçim gereksinimlerini, kritik kesitleri, bilinen hata pattern'lerini ve ayrılmış değerlendirme ihtiyacını paylaşmanız gerekir. Alan uzmanlarınızın belirsiz vakalara karar vermek için zaman ayırması da gerekir.

Dataset kürasyonunda AI agent'ları ne yapabilir?

Agent'lar onaylı çalışma alanında kayıtları profilleyebilir, olası tekrarları bulabilir, etiketleri karşılaştırabilir ve zayıf kapsama işaret edebilir. Bir kaynağı veya kullanım hakkını onaylayamaz, etiketleme ölçütünün sorumluluğunu alamazlar. Kanıtı uzman inceliyor. Kabul kararlarını veri sorumlunuz veriyor.

Dataset hangi noktada teslime hazır olur?

Kritik kesit kapsamını, hak kayıtlarının tamlığını, tekrar ve sızıntı bulgularını ve kabul edilen setteki kusurları inceliyoruz. Ayrılmış değerlendirme verisi yalıtılmış kalıyor. Çözülmemiş izin boşluğu, kritik kapsam eksiği veya bulaşma varsa bunları teslim kaydına açık kusur olarak yazıyor, veri sorumlusunun sürümü bu bilgiyle değerlendirmesini istiyoruz.

Bu çalışma fine-tuning'in gerekli olduğunu gösterir mi?

Hayır. Kontrollü bir eğitim deneyine uygun dataset hazırlar ve deneye izlenebilir bir veri sınırı verir. Modelin eğitilmesi, baseline ve ayrılmış vakalara karşı test edilmesi ayrı bir çalışmadır.