Bir prompt değişikliği tek denemede daha iyi görünebiliyor. Yayın kararını sabit vakalar, kayıtlı ayarlar, ortak rubrik ve kalibre edilmiş insan incelemesi veriyor, her sürüm bu dördünden de geçiyor.

Prompt değişikliklerini sabit bir baseline, temsili vakalar, açık rubrikler, kalibre değerlendiriciler, hata kesitleri, sürümlü deneyler ve regresyon kapısıyla inceliyoruz.

Çalışma sonunda elinizde hangi promptun yayınlanabileceğini gösteren vaka envanteri, değerlendirici kalibrasyon notları, sürümlü hata sonuçları ve regresyon değişiklik listesi kalıyor.

Prompt Değerlendirme ve Kalite Güvencesi illüstrasyonu: gerçek örneklere göre promptları test edip iyileştiren ekip

Birlikte çalıştığımız 500'den fazla markadan birkaçı

Tüm referansları gör
  • EY
  • Shell
  • Sanofi
  • Ülker
  • Domino’s
  • Tazedirekt
  • Sportive

Bir sürüm seçilmeden önce her aday aynı vakalar, ayarlar, rubrik ve baseline üzerinden geçiyor.

  1. Görevi ve baseline'ı tanımla

    Temsili girdileri, beklenen davranışı, bilinen hataları, kritik kesitleri, mevcut prompt sürümlerini ve yayın ölçütlerini netleştiriyoruz.

    Yapay zeka desteği
    Analistlerimiz bilinen hatalardan ve mevcut prompt sürümlerinden yola çıkarak aday test setini taslak hâline getiriyor.
    İnsan onayı
    Test seti promptun gerçekten yapması gereken işi temsil ediyor mu? Test setinin gerçek görevi temsil ettiğini, promptun sorumlusu onaylıyor.
  2. Sürümlü deneyleri çalıştır

    Prompt adaylarını aynı vakalarda deterministik kontroller, rubrik değerlendiricileri ve kaydedilmiş model ile parametre ayarlarıyla karşılaştırıyoruz.

    Yapay zeka desteği
    Araçlarımız prompt adaylarını sabit vakalara karşı çalıştırıyor ve sürüm manifestosunu kaydediyor.
    İnsan onayı
    Her sonuç sürüm manifestosundan yeniden üretilebiliyor mu? Bir sonuç sürümler arasında karşılaştırılmadan önce değerlendirme liderimiz onaylıyor.
  3. Değerlendiricileri ve kesitleri kalibre et

    İnsan değerlendiriciler ortak örnekleri puanlıyor, önemli rubrik farklarını çözüyor ve kritik hata kesitlerini ortalamadan ayrı inceliyor.

    Yapay zeka desteği
    Araçlarımız değerlendiricilerin aynı örneğe farklı puan verdiği vakaları işaretliyor.
    İnsan onayı
    Değerlendirici uyumu prompt sürümleri arasında seçim yapacak kadar güçlü mü? Bir insan değerlendirici, rubrik farkını puana yansımadan önce çözüyor.
  4. Regresyon kapısını onayla

    Onaylı sürümü seçiyor, istisnaları kaydediyor ve gelecekteki prompt değişiklikleri için test paketini değişiklik politikasına bağlıyoruz.

    Yapay zeka desteği
    Araçlarımız kabul edilen sürümün sonuçlarından regresyon kapısı kaydı taslağı hazırlıyor.
    İnsan onayı
    Promptun sorumlusu bu sürümü ve açık istisnalarını onaylıyor mu? Sürümü ve açık istisnalarını promptun sorumlusu onaylıyor.

Bu çıktılar değişikliği karşılaştırmayı, sonucu yeniden üretmeyi ve gerektiğinde onaylı sürüme dönmeyi mümkün kılıyor.

  • Test kanıtı

    Prompt vakaları ve model ayarları envanteri

    Gerçek vakaları, prompt metnini, model ayarlarını, beklenen davranışı ve bilinen hataları her deney sürümüne bağlar.

  • Playbook

    Görev rubrikleri ve değerlendirici kalibrasyon notları

    Her görev veya kesit için başarıyı, hatayı ve değerlendirici görüş ayrılığını tanımlar.

  • Pano

    Deney günlüğü ve hata kesiti raporu

    Adayları vaka, kesit, hata türü, değerlendirici notu ve sürümlü sonuca göre karşılaştırır.

  • Karar kaydı

    Onaylı prompt ve regresyon değişiklik listesi

    Yayınlanan promptu, kabul edilen istisnaları, kimin sorumlu olduğunu ve sonraki değişiklikten önce çalışacak kontrolleri kaydeder.

Birkaç akılda kalan sohbet ya da günün en iyi görünen çıktısı, tekrarlanabilir bir prompt karşılaştırmasının yerini almaya başladıysa QA sürecini kurmak gerekiyor.

Şu durumlarda iyi bir seçim

  • Bir prompt birkaç akılda kalan sohbette iyi görünüyor, ama ekibiniz hedef görevin mi iyileştiğini yoksa yalnızca üslubun mu değiştiğini ayırt edemiyor.
  • Bilinen bir hata düzenlemeden sonra geri geliyor, çünkü prompt sürümleriyle regresyon vakaları farklı yerlerde tutuluyor.
  • İnsan değerlendiriciler aynı çıktıya farklı puan veriyor, ama ortak rubrik ve kalibrasyon çalışması yayın kararındaki farkı çözemiyor.
  • Hedef görev belli, ama hatalar, kritik kesitler, baseline davranışı ve temsili vakalar tek bir test setinde tanımlanmıyor.
  • Deterministik kontrollerle rubrik değerlendiricileri uyuşmuyor, bu yüzden insan kalibrasyonu tekrarlanabilir bir deney sonucu üretemiyor.
  • Aday prompt ortalamada daha güçlü görünüyor, ama hata analizi ve regresyon kapısı onaylanacak sürümü hâlâ belirleyemiyor.
  • Prompt adayları farklı girdiler veya inceleme kuralları görüyor, bu yüzden ekip sürümler arasında adil ve tekrarlanabilir bir kıyas kuramıyor.

Şu durumlarda başka bir çalışma daha doğru

  • Regresyon kapısının bir denetim görüşü ya da sertifika yerine geçmesini bekliyorsunuz. Hukuki ve düzenleyici belirleme yetkili uzmanlarınızda kalıyor.
  • Tek bir promptun her modelde, görevde, kullanıcıda ve gelecek sürümde aynı davranmasını bekliyorsunuz, ama kanıt yalnızca test edilen ayarları kapsıyor.
  • Onaylı sürüm teslim edildikten sonra prompt yaşam döngüsünün sürekli işletilmesini istiyorsunuz, çünkü bu çalışma kayıtlı değişiklik politikasında bitiyor.

Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: Ana hizmeti inceleyin

Bir sistemi hiç ayakta tutmak zorunda kalmadıysanız onu iyi test etmek de zor. Biz production'da AI işletiyoruz, bu yüzden değerlendirme, güvenlik testi ve LLMOps çalışmalarımız gerçekte nelerin kırıldığını bilerek başlıyor. Ekibimiz kıdemli mühendislerden oluşuyor ve Zeo 2011'den beri müşteri projelerinde çalışıyor.

  • Agenta

    Versiyonlu prompt deneylerini sabit baseline ile yan yana çalıştırıyor

  • PromptLayer

    Her prompt sürümünü geçmesi gereken baseline ile birlikte kaydediyor

  • Confident AI / DeepEval

    Çıktıları kriterlere göre puanlayıp tek sayı yerine sorun alanlarını raporluyor

  • Giskard

    Prompt değişikliklerinin neden olabileceği sessiz regresyonları otomatik olarak tarıyor

  • Label Studio

    Değerlendirmeler arası uyumu ölçerek kabul kriterinin ihtiyaç duyduğu kalibrasyonu sağlıyor

Mevcut promptları, temsili işi ve hangi sürümün yayınlanacağına karar verecek kişiyi hazır edin.
Zeo ile konuşun

Hangi girdi ve erişimlere ihtiyaç duyuyorsunuz?

Görevi, mevcut prompt sürümlerini, temsili girdileri, beklenen davranışı, bilinen hataları, politika ve veri kısıtlarını, baseline kanıtını, insan değerlendiricileri, model ayarlarını ve yayın ölçütlerini paylaşmanız gerekiyor.

Model çıktıları koşular arasında değişiyorsa promptları karşılaştırabilir misiniz?

Evet, ama değerlendirme bu değişkenliği hesaba katmalı. Vakaları ve ayarları sabit tutuyoruz, gerektiğinde tekrarlı koşular kullanıyoruz, tek bir örnek yerine kesitleri inceliyoruz ve şanslı bir çıktıyı sonuç gibi sunmak yerine belirsizliği kaydediyoruz.

Bir prompt sürümünün hazır olduğuna nasıl karar veriyorsunuz?

Temsili kapsamı, rubrik ile insan incelemesi arasındaki uyumu, kesit bazında kritik hata oranlarını ve regresyon kapısının sonucunu inceliyoruz. Prompt sorumlusu, sürümü ancak baseline'a göre iyileşme ve gerilemeleri birlikte gördükten sonra onaylıyor.

Prompt kalite güvencesi neyi garanti etmez?

Prompt QA her model, kullanıcı, girdi veya gelecek sürümde aynı davranışın çıkacağını vaat edemez. Test edilen görev, vakalar, ayarlar ve sürüm için tekrarlanabilir kanıt sunuyor.