Prompt ve Yapay Zeka İş Akışı Yetkinliği
Prompt Değerlendirme ve Kalite Güvencesi
Bir prompt değişikliği tek denemede daha iyi görünebiliyor. Yayın kararını sabit vakalar, kayıtlı ayarlar, ortak rubrik ve kalibre edilmiş insan incelemesi veriyor, her sürüm bu dördünden de geçiyor.
Prompt değişikliklerini sabit bir baseline, temsili vakalar, açık rubrikler, kalibre değerlendiriciler, hata kesitleri, sürümlü deneyler ve regresyon kapısıyla inceliyoruz.
Çalışma sonunda elinizde hangi promptun yayınlanabileceğini gösteren vaka envanteri, değerlendirici kalibrasyon notları, sürümlü hata sonuçları ve regresyon değişiklik listesi kalıyor.


Birlikte çalıştığımız 500'den fazla markadan birkaçı
Tüm referansları görAdımlar, kapılar ve kararı verenler
Çalışma şeklimiz
Bir sürüm seçilmeden önce her aday aynı vakalar, ayarlar, rubrik ve baseline üzerinden geçiyor.
Görevi ve baseline'ı tanımla
Temsili girdileri, beklenen davranışı, bilinen hataları, kritik kesitleri, mevcut prompt sürümlerini ve yayın ölçütlerini netleştiriyoruz.
- Yapay zeka desteği
- Analistlerimiz bilinen hatalardan ve mevcut prompt sürümlerinden yola çıkarak aday test setini taslak hâline getiriyor.
- İnsan onayı
- Test seti promptun gerçekten yapması gereken işi temsil ediyor mu? Test setinin gerçek görevi temsil ettiğini, promptun sorumlusu onaylıyor.


Sürümlü deneyleri çalıştır
Prompt adaylarını aynı vakalarda deterministik kontroller, rubrik değerlendiricileri ve kaydedilmiş model ile parametre ayarlarıyla karşılaştırıyoruz.
- Yapay zeka desteği
- Araçlarımız prompt adaylarını sabit vakalara karşı çalıştırıyor ve sürüm manifestosunu kaydediyor.
- İnsan onayı
- Her sonuç sürüm manifestosundan yeniden üretilebiliyor mu? Bir sonuç sürümler arasında karşılaştırılmadan önce değerlendirme liderimiz onaylıyor.


Değerlendiricileri ve kesitleri kalibre et
İnsan değerlendiriciler ortak örnekleri puanlıyor, önemli rubrik farklarını çözüyor ve kritik hata kesitlerini ortalamadan ayrı inceliyor.
- Yapay zeka desteği
- Araçlarımız değerlendiricilerin aynı örneğe farklı puan verdiği vakaları işaretliyor.
- İnsan onayı
- Değerlendirici uyumu prompt sürümleri arasında seçim yapacak kadar güçlü mü? Bir insan değerlendirici, rubrik farkını puana yansımadan önce çözüyor.


Regresyon kapısını onayla
Onaylı sürümü seçiyor, istisnaları kaydediyor ve gelecekteki prompt değişiklikleri için test paketini değişiklik politikasına bağlıyoruz.
- Yapay zeka desteği
- Araçlarımız kabul edilen sürümün sonuçlarından regresyon kapısı kaydı taslağı hazırlıyor.
- İnsan onayı
- Promptun sorumlusu bu sürümü ve açık istisnalarını onaylıyor mu? Sürümü ve açık istisnalarını promptun sorumlusu onaylıyor.


Adı konmuş, sizde kalan çıktılar
Elinize geçenler
Bu çıktılar değişikliği karşılaştırmayı, sonucu yeniden üretmeyi ve gerektiğinde onaylı sürüme dönmeyi mümkün kılıyor.


Test kanıtı
Prompt vakaları ve model ayarları envanteri
Gerçek vakaları, prompt metnini, model ayarlarını, beklenen davranışı ve bilinen hataları her deney sürümüne bağlar.


Playbook
Görev rubrikleri ve değerlendirici kalibrasyon notları
Her görev veya kesit için başarıyı, hatayı ve değerlendirici görüş ayrılığını tanımlar.


Pano
Deney günlüğü ve hata kesiti raporu
Adayları vaka, kesit, hata türü, değerlendirici notu ve sürümlü sonuca göre karşılaştırır.


Karar kaydı
Onaylı prompt ve regresyon değişiklik listesi
Yayınlanan promptu, kabul edilen istisnaları, kimin sorumlu olduğunu ve sonraki değişiklikten önce çalışacak kontrolleri kaydeder.
Kapsam ve dürüst sınırlar
Bu çalışmanın size uyduğu durumlar
Birkaç akılda kalan sohbet ya da günün en iyi görünen çıktısı, tekrarlanabilir bir prompt karşılaştırmasının yerini almaya başladıysa QA sürecini kurmak gerekiyor.
Şu durumlarda iyi bir seçim
- Bir prompt birkaç akılda kalan sohbette iyi görünüyor, ama ekibiniz hedef görevin mi iyileştiğini yoksa yalnızca üslubun mu değiştiğini ayırt edemiyor.
- Bilinen bir hata düzenlemeden sonra geri geliyor, çünkü prompt sürümleriyle regresyon vakaları farklı yerlerde tutuluyor.
- İnsan değerlendiriciler aynı çıktıya farklı puan veriyor, ama ortak rubrik ve kalibrasyon çalışması yayın kararındaki farkı çözemiyor.
- Hedef görev belli, ama hatalar, kritik kesitler, baseline davranışı ve temsili vakalar tek bir test setinde tanımlanmıyor.
- Deterministik kontrollerle rubrik değerlendiricileri uyuşmuyor, bu yüzden insan kalibrasyonu tekrarlanabilir bir deney sonucu üretemiyor.
- Aday prompt ortalamada daha güçlü görünüyor, ama hata analizi ve regresyon kapısı onaylanacak sürümü hâlâ belirleyemiyor.
- Prompt adayları farklı girdiler veya inceleme kuralları görüyor, bu yüzden ekip sürümler arasında adil ve tekrarlanabilir bir kıyas kuramıyor.
Şu durumlarda başka bir çalışma daha doğru
- Regresyon kapısının bir denetim görüşü ya da sertifika yerine geçmesini bekliyorsunuz. Hukuki ve düzenleyici belirleme yetkili uzmanlarınızda kalıyor.
- Tek bir promptun her modelde, görevde, kullanıcıda ve gelecek sürümde aynı davranmasını bekliyorsunuz, ama kanıt yalnızca test edilen ayarları kapsıyor.
- Onaylı sürüm teslim edildikten sonra prompt yaşam döngüsünün sürekli işletilmesini istiyorsunuz, çünkü bu çalışma kayıtlı değişiklik politikasında bitiyor.
Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: Ana hizmeti inceleyin
Test ettiğimiz sistemleri kendimiz de işletiyoruz
Bir sistemi hiç ayakta tutmak zorunda kalmadıysanız onu iyi test etmek de zor. Biz production'da AI işletiyoruz, bu yüzden değerlendirme, güvenlik testi ve LLMOps çalışmalarımız gerçekte nelerin kırıldığını bilerek başlıyor. Ekibimiz kıdemli mühendislerden oluşuyor ve Zeo 2011'den beri müşteri projelerinde çalışıyor.

Can Mutioğlu
Senior SEO Executive

Ezgi Gülsen Yaylı
SEO Manager

Yiğit Konur
Founder & Chief Strategy Officer

Ozan Ketenci
VP of Consulting & Strategy

Samet Özsüleyman
SEO Manager

Ataberk Yüzat
SEO Executive

Mehmet Aktuğ
Co-Founder & COO
Bu konuda ürettiğimiz içerikler
Kullandığımız araçlar
Bu işin arkasındaki araçlar
AgentaVersiyonlu prompt deneylerini sabit baseline ile yan yana çalıştırıyor
PromptLayerHer prompt sürümünü geçmesi gereken baseline ile birlikte kaydediyor
Confident AI / DeepEvalÇıktıları kriterlere göre puanlayıp tek sayı yerine sorun alanlarını raporluyor
GiskardPrompt değişikliklerinin neden olabileceği sessiz regresyonları otomatik olarak tarıyor
Label StudioDeğerlendirmeler arası uyumu ölçerek kabul kriterinin ihtiyaç duyduğu kalibrasyonu sağlıyor
Sonraki adım
Prompt sürümlerini zor vakalarla birlikte karşılaştırın


Karar vermeden önce





















