Fine-tuning ancak prompt ve RAG baseline'ları tekrarlanan bir davranış farkı bıraktığında ve her eğitim koşusu sürümlü, ayrılmış, izlenebilir ve karşılaştırılabilir kaldığında anlam kazanıyor.

Fine-tuning kararı için önce kararlı bir davranış farkı görmemiz gerekir. Aynı ayrılmış görevleri prompt ve RAG baseline'larıyla test ediyoruz. Fark hâlâ anlamlıysa her eğitim koşusunu sürümlüyor, görev kazanımını kritik hatalar, genel yetenek gerilemesi, tutarlılık, maliyet ve latency ile birlikte inceliyoruz.

Çalışmanın sonunda hedef kazanımı kritik regresyon, tutarlılık, inference maliyeti ve latency ile birlikte değerlendiren tekrarlanabilir bir deney izi ve belgelenmiş yayın kararı alıyorsunuz.

LLM Fine-Tuning ve Model Özelleştirme illüstrasyonu: bir modeli hedef davranışa ve başlangıç seviyesine göre ayarlayan ekip

Birlikte çalıştığımız 500'den fazla markadan birkaçı

Tüm referansları gör
  • Acıbadem Sağlık Grubu
  • Atasun Optik
  • Tazedirekt
  • Sporjinal
  • QNB Finansfaktoring
  • Vispera

Eğitim gerekçesini, uygulanan müdahaleyi ve sonucu ilk baseline karşılaştırmasından yayın önerisine kadar aynı iz üzerinde tutuyoruz.

  1. Eğitim ihtiyacını kanıtlıyoruz

    Hedef davranışı prompt ve RAG baseline'ıyla test ediyor, kalan farkı kaydediyor, ayrılmış görevleri, kritik davranışları, regresyon sınırlarını, bütçeyi ve karar sorumlusunu birlikte tanımlıyoruz.

    Yapay zeka desteği
    Hedef davranış ile prompt ve RAG baseline'ı arasındaki farkın ilk karşılaştırmasını model hazırlıyor. Ürün sorumlusu bulguları inceleyip eğitim gerekçesini sorguluyor.
    İnsan onayı
    Kaydedilen farkı kapatmak için eğitim en uygun müdahale mi? Kalan farkın fine-tuning deneyine değip değmediğine ürün sorumlunuz karar veriyor.
  2. Her koşuyu ayrı sürümlüyoruz

    Her deney için veri ve yapılandırma referanslarını sabitliyoruz. Önceki sonuçtan sonra değişen varsayım ve ayarlarla birlikte bütün koşuları ve model sürümlerini kaydediyoruz.

    Yapay zeka desteği
    Kararlaştırılan veri sürümü ve yapılandırma etiketlerini model her koşu kaydına ekliyor. Uzman, meta veriyi sonuçlar karşılaştırılmadan önce doğruluyor.
    İnsan onayı
    Sonuç tek bir veri sürümüne, yapılandırmaya ve model sürümüne bağlanabiliyor mu? Bir uzman, sonuç karşılaştırmaya girmeden önce koşu meta verisini kontrol ediyor.
  3. Kazanımı kayıpla birlikte ölçüyoruz

    Hedef görev kazanımını kritik davranış hataları, genel yetenek gerilemesi, tutarlılık, inference maliyeti ve latency ile birlikte, önemli kesitlere ayrılmış biçimde karşılaştırıyoruz.

    Yapay zeka desteği
    Hedef görev kazanımı, regresyon ve maliyeti kesitlere ayıran tabloyu model taslaklıyor. Değerlendirme uzmanları değerleri doğruluyor.
    İnsan onayı
    Regresyon, maliyet ve latency kesit bazında görünürken kazanım hâlâ anlamlı mı? Kanıtın fine-tuned modeli kullanmayı destekleyip desteklemediğine ürün sorumlunuz karar veriyor.
  4. Yayın kararını kayda geçiriyoruz

    Seçilen model referansını, deney geçmişini, ayrılmış karşılaştırmayı, sınırlamaları, yayın koşullarını ve yeni incelemeyi başlatacak olayı teslim ediyoruz.

    Yapay zeka desteği
    Kabul edilen koşu ve belgelenen sınırlardan yayın özetini model taslaklıyor. Ürün sorumlusu özeti inceleyip düzeltiyor.
    İnsan onayı
    Ürün sorumlunuz hem kanıtı hem de bu koşuya bağlı sınırları kabul ediyor mu? Seçilen model çıktısını ve yayın koşullarını ürün sorumlunuz kabul ediyor.

Sonucu, başka bir uzmanın koşuyu yeniden üretebileceği, alternatiflerle karşılaştırabileceği ve release önerisini sorgulayabileceği biçimde teslim ediyoruz.

  • Karar kaydı

    Prompt, RAG ve fine-tuning baseline değerlendirmesi

    Davranış hedefini, prompt ve RAG baseline'ını, kalan farkı, eğitim gerekçesini, kabul kontrollerini, kapsam dışını ve sorumluyu kaydeder.

  • Dataset

    Sürümlü eğitim ve değerlendirme manifesto listesi

    Her deney için model, dataset, yapılandırma, ortam, koşu, değerlendirme seti ve fine-tuning uygulanmış model sürümü referanslarını içerir.

  • Pano

    Tekrarlanabilir koşu günlüğü ve seçilen model kaydı

    Koşular, değişiklikler, hatalar, gözlemler, seçilen model sürümü ve ayrılmış sonuçların bağlantıları aynı günlükte tutulur.

  • Model kartı

    Ayrılmış karşılaştırma raporu ve sınırlar özeti

    Baseline ve fine-tuning uygulanmış sonuçlar görev ve kritik kesit bazında, regresyon, tutarlılık, maliyet, latency, amaçlanan kullanım ve bilinen sınırlarla birlikte gösterilir.

Bu çalışma, aynı baseline üzerinde prompt ve retrieval değişiklikleri denendikten sonra da süren, kararlı ve tekrarlanabilir bir davranış farkı için uygundur.

Şu durumlarda iyi bir seçim

  • Prompt ve RAG baseline'ları hedef görevlerde çalışıyor, ama aynı çıktı davranışı ayrılmış vakalarda hâlâ gerekli seviyeye ulaşmıyor.
  • Kürasyonu tamamlanmış eğitim verisi hazır, ama ayrı değerlendirme setinin gerileyen kritik davranışları hâlâ görünür kılması gerekiyor.
  • Deney bütçesi ve latency ihtiyacı biliniyor, ama beklenen kazanım inference maliyeti ve yenileme gereksinimiyle birlikte karşılaştırılmıyor.
  • Prompt, RAG ve fine-tuning seçeneklerinin ayrı sonuçları var, ama eğitimin neden doğru müdahale olduğunu gösteren ortak baseline kaydı bulunmuyor.
  • Eğitim koşuları model çıktıları üretiyor, ama veri sürümleri ve ayar değişiklikleri başka bir uzmanın deneyi tekrarlamasına yetecek kadar bağlanmıyor.
  • Ayrılmış görevler hedef kazanımı gösteriyor, ama kritik kesitler, genel regresyon, tutarlılık, maliyet ve latency aynı tabloda okunmuyor.
  • Fine-tuning uygulanmış model seçilebiliyor, ama sınırlar, yayın koşulları, sorumlu ve sonraki inceleme tetikleyicisi birlikte kaydedilmiyor.

Şu durumlarda başka bir çalışma daha doğru

  • Aynı vakalarda prompt veya retrieval değişikliği denenmeden fine-tuning'e başlamak istiyorsunuz. Kalan farkı önce daha basit baseline'ın göstermesi gerekiyor.
  • Değerlendirme örnekleri eğitime veya model seçimine giriyor, ama sonuç yine de kazanım sayılıyor. Bu sızıntı temiz bir karşılaştırma gerektiriyor.
  • Production dağıtımı veya sürekli yeniden eğitim istiyorsunuz. Bu görevler ayrıca kapsamlanan bir çalışma gerektiriyor.

Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: Model özelleştirme hizmetlerini incele

Zeo'nun kod yazıp teslim eden tarafı burası. Kıdemli mühendislerimiz agent, chatbot ve RAG sistemleri geliştiriyor, çevrelerindeki otomasyon ve veri işlerini üstleniyor, sistemler canlıya çıktıktan sonra da işletmeyi sürdürüyor. 2011'den beri 500'den fazla markayla çalıştık.

  • Modal

    Her training run'ı için kalıcı cluster kurmadan isteğe bağlı GPU sağlıyor

  • Weights & Biases

    Her versioned training run'ını aşması gereken prompt ve RAG baseline'larıyla karşılaştırıyor

  • Braintrust

    Her trained sürümde ortalama lift'in yanında kritik hataları da puanlıyor

  • Hugging Face

    Fine-tuning run'ının kullandığı base model ve training pipeline'ını barındırıyor

  • Unsloth

    Versioned training deneylerini alışılmış compute maliyetinin küçük bir bölümüyle çalıştırıyor

  • Predibase

    Birden fazla fine-tuned sürümü doğrudan karşılaştırmak için yan yana sunuyor

Baseline'ı, kürasyonu tamamlanmış dataset'i, ayrılmış vakaları ve deney bütçesini getirin. Yayın kararından sorumlu kişinin de görüşmede olması gerekir.
Fine-tuning'i konuşalım

Eğitim koşusundan önce nelerin sabit olması gerekir?

Kararlaştırılmış hedef davranış, prompt ve RAG baseline'ı, kürasyonu tamamlanmış izinli veri, ayrı değerlendirme seti, kritik davranışlar, aday model kısıtları, deney bütçesi, inference gereksinimleri ve regresyon sınırları gerekir. Sonuçları karşılaştırmadan önce veri ve değerlendirme sürümlerini sabitliyoruz.

AI agent'ları fine-tuning deneyinde nerede kullanıyoruz?

Agent'lar onaylı çalışma alanında koşu meta verisini düzenleyebilir, çıktıları karşılaştırabilir, olası kapsama boşluklarını işaretleyebilir ve değerlendirme vakaları taslaklayabilir. Veri referanslarını, etiketleri ve sonuçları uzmanlar doğruluyor. Müdahale, bütçe ve yayın koşulları hakkındaki karar ürün sorumlunuzda kalıyor.

Bir fine-tuning koşusunu hangi kanıtla kabul ediyoruz?

Ayrılmış görevlerde baseline'a göre gelişime bakıyor, ardından genel yetenek gerilemesini, kritik davranış hatalarını, tutarlılığı, eğitim ve inference maliyetini ve latency'yi inceliyoruz. Önemli kesitleri ayrı okuyoruz. Değerlendirme sızıntısı veya çözülmemiş regresyon kabul kararını durdurabilir.

Kabul edilen koşu production'a hazır sayılır mı?

Yalnızca bu deneyin sonucuyla production'a hazır sayılmaz. Çalışma, tek bir model çıktısının test edilen koşullardaki davranışını gösterir. Production hazırlığı için entegrasyon, güvenlik, izleme, işletim sorumluluğu ve model sınırlarının açıkça kabul edilmesi de gerekir.