Hangi davranışın önemli olduğunu birlikte belirliyor, temsili ve kritik vakaları çalıştırıyoruz. Kararı verecek kişiye inceleyip yeniden üretebileceği bir kanıt seti bırakıyoruz.

Birlikte çalıştığımız 500'den fazla markadan birkaçı. Kendi işimizi production'daki 100'den fazla AI workflow'u üzerinden yürütüyoruz.

Tüm referansları gör
  • MediaMarkt
  • LC Waikiki
  • Memorial
  • TRT
  • Bernardo
  • Vispera
10 hizmet, prompt ve RAG'dan agent'lara, güvenlik testlerine, model seçimine ve yayına hazırlığa kadar sistem davranışının farklı yönlerini test ediyor.

Güvence Altına Alın ve İşletin

AI Agent Değerlendirmeve Güvenilirlik

Agent yörüngelerini ölçümlüyor ve regresyon paketini incelenen geliştirmeye bağlıyoruz. Görev başarısı, araç davranışı, toparlanma, eskalasyon, politika kontrolleri ve koşudan koşuya değişkenlik yayın öncesinde ayrı ayrı görülebiliyor.

Yayın kararınız agent’ın görev başarısı kadar araç davranışı, toparlanma, eskalasyon ve koşular arası değişkenliği de gerektiriyorsa güvenilirlik değerlendirmesini seçin.

RAG Değerlendirme veTemellendirme Testi

Retrieval, grounded iddialar, alıntılar, erişim kontrolleri ve yanıt vermeme davranışını ayrı ayrı test ediyoruz. Böylece hatanın veri kaynağında, retrieval'da, üretimde, alıntıda ya da erişim tasarımında başladığı görülebiliyor.

RAG hatasının kaynak, retrieval, üretim, alıntı veya erişim katmanından hangisinde başladığını ayırmanız gerekiyorsa temellendirme testine yönelin.

Yapay ZekaDeğerlendirme Stratejisi

Tek bir AI kullanımında kabul edilebilir davranışı, önemli hataları, gerçek işi temsil eden vakaları ve kanıtın nasıl inceleneceğini tanımlıyoruz. Yayın onayının kimde olduğu da baştan belli oluyor.

Hangi AI davranışının kabul edilebilir olduğu ve hangi metriğin yayın kararını değiştireceği belirsizse önce değerlendirme stratejisini kurun.

Altın VeriSeti Geliştirme

Temsili vakalardan sürümlü bir set kurarken her vakanın kaynağını, beklenen davranışı, belirsizlik kuralını ve görüş ayrılığının nasıl karara bağlandığını kaydediyoruz. Setin bakım sorumlusu da belli oluyor.

Değerlendirme vakalarının kaynağı, etiketi, kritik kesit kapsamı veya tuning’den ayrımı güvenilir değilse sürümlü altın veri seti geliştirin.

Bağımsız AIAgent Değerlendirmesi

Belgelenmiş bağımsızlık sözleşmesi, mevcut agent'ı görev, yörünge, araç, politika ve toparlanma davranışıyla nasıl inceleyeceğimizi belirliyor. Değerlendirilen uygulamanın geliştirmesini biz üstlenmiyoruz.

Agent yayını için geliştirme ekibinden bağımsız kapsam, yeniden üretim ve öneri kanıtı gerekiyorsa bağımsız değerlendirmeyi seçin.

Güvenlik vePolitika Değerlendirmesi

Bir politika maddesi ancak sistem davranışında gözlenebildiğinde test edilebilir hâle geliyor. Kötüye kullanım denemelerini onlara benzeyen meşru taleplerle eşliyor, reddetme kalitesini ve önem derecesini inceliyoruz. İyileştirmeden sonra neyin değiştiğini ve hangi riskin kaldığını ayrıca kaydediyoruz.

Politika testiniz zararlı talepleri benzer meşru isteklerle birlikte sınamalıysa ihlal, yanlış ret ve kalan riski ayıran güvenlik değerlendirmesine yönelin.

Yapay Zeka YayınaHazırlık İncelemesi

Yayın dosyası genelde değerlendirme raporlarına, güvenlik ve gizlilik girdilerine, çalışma rehberlerine, destek planlarına ve açık bulgulara dağılmış durumda oluyor. Güncel kanıtı bir araya getiriyor, dosyanın karar vermeye yetecek kadar tamamlanıp tamamlanmadığını inceliyoruz. Yayına alma, koşullu yayına alma veya yayına almama kararı sizin belirlediğiniz yayın yetkilisine ait.

Kalite, güvenlik, gizlilik, destek ve açık bulgular ayrı dosyalardaysa yayın yetkilisi için güncel kanıtı tek hazırlık incelemesinde birleştirin.

Prompt Değerlendirme veKalite Güvencesi

Prompt değişikliklerini sabit bir baseline, temsili vakalar, açık rubrikler, kalibre değerlendiriciler, hata kesitleri, sürümlü deneyler ve regresyon kapısıyla inceliyoruz.

Prompt sürümleri birkaç iyi örnekle seçiliyorsa sabit vakalar, rubrikler, kalibre değerlendiriciler ve regresyon kapısı kuran kalite güvencesini seçin.

LLM Değerlendirmeve Karşılaştırma

Aday LLM'leri aynı temsili görev, kesit, rubrik, güvenlik kısıtı, latency sınırı ve maliyet koşulunda çalıştırıyoruz. Ardından her seçeneğin ne kazandırdığını ve karşılığında ne verdiğini gösteriyoruz.

Model seçimi genel sıralamalara dayanıyorsa aday LLM’leri aynı iş yükü, güvenlik, latency ve maliyet koşullarında karşılaştıran kıyasa yönelin.

Önyargı, Adalet veAçıklanabilirlik Testleri

Adalet sorusu önce kurumunuzun vereceği kararlara dayanıyor. Kimler etkilenebilir, hangi sonuç önemlidir, hangi ödünleşim kabul edilebilir? Bu seçimlerin oluşturduğu karşılaştırmaları ve açıklamaları test ediyor, kanıtın sonuç çıkarmaya yetmediği yerleri açıkça gösteriyoruz.

Değerlendirme ortalaması belirli gruplardaki hata veya açıklama farklarını gizleyebiliyorsa yetkili ödünleşim kararlarıyla önyargı ve adalet testini seçin.

İşe yarayan bir değerlendirme, kritik vakaları ve kullanıcı kesitlerini görünür tutuyor. Belirsizliği ve inceleyenler arasındaki görüş ayrılığını da kaydediyoruz ki başka biri sonucu anlayabilsin ve kontrolü yeniden çalıştırabilsin.

Kanıtı kimin kullanacağını, hangi hataları kabul edemeyeceğini ve karar için ne kadar kapsama ihtiyaç duyduğunu baştan belirliyoruz. Metrik, rubrik ve değerlendirici seçimi bundan sonra geliyor.

Kanıtı kullanacak kişiden ve onun kabul edemeyeceği hatalardan başlıyoruz.

Hedeflenen kullanımı, önemli kullanıcıları, kabul edilemez hataları, kısıtları ve kanıtla hareket edecek kişiyi adıyla yazıyor; ardından mevcut sistemi, veriyi, iş akışını, bilinen hataları ve eldeki kontrolleri inceliyor, bilinmeyenleri geçmiş sayılan kontroller yerine görünür tutuyoruz. Temsili vakalar ve uygun kontroller ancak bundan sonra seçiliyor; ortalamanın yanında karar için önemli olan kritik kesitler ve olumsuz davranış da test ediliyor. Belirsizliği ve inceleyenler arasındaki görüş ayrılığını, başka birinin sonucu yeniden üretebileceği kadar bağlamla kaydediyoruz; kayıt açık istisnalar, kalan risk, sorumlular ve konuyu yeniden açacak koşulla kapanıyor.

Değerlendirme sorusundan sorumluluğu belli karara uzanan, incelenebilir bir yol
  1. Kararı tanımlayın

    Amaçlanan kullanımı, önemli kullanıcıları, kabul edilemez hataları, kısıtları ve kanıtla harekete geçecek sorumluyu belirleyin.
  2. Başlangıç noktasını inceleyin

    Mevcut sistemi, veriyi, iş akışını, bilinen hataları ve kontrolleri değerlendirin. Bilinmeyenleri başarılı sonuç gibi saymayın.
  3. Değerlendirmeyi kurup çalıştırın

    Temsili vakaları ve uygun kontrolleri seçin. Karar açısından önemli kritik kesitleri ve olumsuz davranışları test edin.
  4. Sonucu ve sorumluları kaydedin

    Kanıtı, açık istisnaları, kalan riski, sorumluları ve yeni bir incelemeyi başlatacak koşulu belgeleyin.

Zeo'da operasyonda çalışan her danışmanın güvenli LLM erişimi ve eğitimi var, AI günlük işin içinde duruyor. Beşi AI Bootcamp'imizden geçti ve neyin değişmesini beklediğini yazdı.

Ozan Ketenci
zeo-logo-yuvarlak.png

Generative AI, günlük hayatımızı ve temas ettiği her sektörü değiştirebilecek çok büyük bir potansiyele sahip. Teknoloji geliştikçe yaratıcılık, problem çözme ve inovasyon tarafındaki kullanım alanları da genişliyor. Gerçekçi görsel, video ve müzik üretiminden ilaç araştırmalarına ve tasarıma kadar birbirinden oldukça farklı alanlar bunun içinde yer alıyor. Bu kapsamın büyümeye devam edeceğini ve birçok sektörde derin bir etki yaratacağını düşünüyorum. E-ticaret, sağlık, finans ve başka sektörler, generative AI'ı ilgi çekici ve kişiselleştirilmiş deneyimler oluşturmak, iş süreçlerini optimize etmek için kullanabilecek.

Benzersiz içerik ve çözümler üretebilmesi yeni olasılıkların önünü açacak, verimliliği artıracak.

Ozan Ketenci

Samet Özsüleyman
zeo-logo-yuvarlak.png

Generative AI, SEO ve dijital pazarlamayla birlikte başka sektörleri de dönüştürme potansiyeline sahip ve yakın gelecekte hayatımızda önemli bir rol oynayacak. Kişiselleştirilmiş deneyimler, daha etkili pazarlama, veriyi daha hızlı yorumlama ve daha hızlı aksiyon alma gibi kullanım biçimleri göreceğiz. Ürün ve hizmetler gelişecek, müşteri iletişimi gibi iş süreçleri daha verimli hale gelecek. Bu gelişmelere ayak uyduramayan kurumlar, AI'ı işine dahil eden şirketlerin gerisinde kalacak.

Kendi sektörünüzde kullanabileceğiniz AI uygulamalarını vakit kaybetmeden planlamaya başlamalısınız.

Samet Özsüleyman

Hande Parmaksız
zeo-logo-yuvarlak.png

Generative AI'la birlikte bilgisayar devrimi kadar etkili olabilecek bir dönüşüme tanıklık ediyoruz. Bu, iş hayatı ve endüstriler için tarihi bir an. Bugün çoğumuz için teknoloji hâlâ ChatGPT gibi büyük generative AI arayüzlerini işte veya günlük hayatta kullanmakla sınırlı görünüyor. Oysa bu, teknolojinin potansiyelinin yalnızca yüzeyi. Modelleri içerik üretiminin ötesinde kendi workflow'larına ve müşteri süreçlerine dahil eden işletmeler, önümüzdeki yıllarda çok büyük rekabet avantajları elde edecek.

Generative AI'ın en kısa sürede tüm yönetim kurullarının gündemine girmesi gerektiğine inanıyorum.

Hande Parmaksız

Can Mutioğlu
zeo-logo-yuvarlak.png

AI'ı bugün ve geleceğin en heyecan verici teknolojisi olarak görüyorum. Potansiyelinin sınırsız olduğuna inanıyorum. Henüz buzdağının görünen kısmındayız. AI hızla gelişiyor ve farklı sektörlerde neler yapabileceğinin önemli bir bölümü hâlâ keşfedilmiş değil. Dijital işlerde şimdiden büyük bir etki yarattı, ilerleyen yıllarda başka endüstrileri yeniden şekillendiren atılımlar göreceğiz.

AI'ın potansiyeli büyümeye devam edecek. Hiçbir sektör verimlilik ve ilerleme açısından sunduğu bu fırsatı göz ardı edemez. Her yeni adımda başka boyutlar keşfedecek ve AI'ın doyum noktası olmadığını göreceğiz.

Can Mutioğlu

Ezgi Gülsen Yaylı
zeo-logo-yuvarlak.png

Büyük teknoloji şirketlerinin generative AI alanındaki çalışmalarının önümüzdeki yıllarda çok daha geniş bir etki yaratması muhtemel. Sanat ve tasarım gibi yaratıcı sektörlerde, ayrıca sağlık ve finans gibi hassas alanlarda yeni çalışma biçimlerinin ortaya çıkmasını bekliyorum. Teknoloji günlük hayata girdikçe etik ve risk sorularını da beraberinde getiriyor. Yeni gelişmeleri yakından takip edip deneyimleyebilmek, generative AI'ı benim için son yılların en heyecan verici potansiyeli haline getiriyor.

Gelecekte generative AI'ın toplumun yararına daha fazla kullanıldığını görmeyi sabırsızlıkla bekliyorum.

Ezgi Gülsen Yaylı

Zeo'da agent, chatbot ve RAG sistemlerini kıdemli mühendisler kuruyor ve canlıya çıktıktan sonra işletmeyi de onlar sürdürüyor. Aşağıdaki danışmanlar bu sayfanın kapsadığı işe göre eşleşen o ekip.

Modeller, retrieval, değerlendirme ve gözlemlenebilirlik çalışan bir sistemin ayrı katmanları. Bu sistemleri kurup işlettiğimiz araçlar bunlar.

Modeller ve bulut platformları

  • Google GeminiLLM Evaluation & Benchmarking'in karşılaştırmaları, Gemini'ı aday bir model ailesi olarak içeriyor. Bu, benchmark paketine bu ailenin başka yerlerde varsayılan olarak test ettiği iki sağlayıcıyla sınırlı kalmak yerine gerçek bir çoklu tedarikçi yayılımı kazandırıyor.

Agent ve otomasyon framework'leri

  • LlamaIndexRAG Evaluation & Groundedness Testing, bir sistemin üretmeden önce gerçekte neyi çektiğini denetlemeyi gerektiriyor. LlamaIndex, bu belirli alt görevin değerlendirme çalıştırmalarında test edilen çekme katmanı.
  • PromptfooSafety & Policy Evaluation'ın eşleştirilmiş test yöntemi, bir kötüye kullanım denemesini ve onun meşru benzerini her iki tarafta da reddetme kalitesi açısından değerlendiriyor. Promptfoo'nun kırmızı takım test üretimi tam olarak bunu inşa ediyor.

Uygulama ve prompt araçları

  • PromptLayerPrompt Evaluation & QA, her prompt revizyonunun puanlanmış sonucunu PromptLayer'da izliyor. Bu, ekibin öznel bir okumaya güvenmek yerine yeni bir prompt sürümünü aynı değerlendirme setinde bir öncekiyle karşılaştırmasını sağlıyor.
  • AgentaPrompt Evaluation & QA, aynı vakalara karşı birkaç prompt varyantını test eden tekrarlı bir QA döngüsü tanımlıyor. Agenta'nın karşılaştırma çalışma alanı, insan incelemesini ve otomatik puanlamayı bu döngü için tek bir yerde tutuyor.

Retrieval, embedding ve hafıza

  • ChromaRAG Evaluation & Groundedness Testing'in değerlendirme çalıştırmaları, test edilen bir pasajın gerçekte neyi çektiğini denetlemek için Chroma'yı doğrudan sorguluyor. Chroma, değerlendirme oturumunun kendi içinde çalışacak kadar hafif tutuluyor.

Gateway ve hosted inference

  • OpenRouterLLM Evaluation & Benchmarking, aynı değerlendirme setini her sağlayıcı için ayrı bir entegrasyon kurmadan birçok aday modele karşı çalıştırmayı gerektiriyor. OpenRouter'ın birleşik yönlendirmesi, bu karşılaştırmayı sayfanın benchmark çalışmasının ölçeğinde pratik hâle getiriyor.
  • GroqLLM Evaluation & Benchmarking, gecikmeyi bir karşılaştırma boyutu olarak içerdiğinde bunu bir tahminle geçiştirmiyor. Groq'un çıkarım hızı, bu benchmark'a gerçek ve üst düzey bir referans noktası veriyor.

Değerlendirme ve gözlemlenebilirlik

  • Weights & BiasesBu sayfanın hero bölümü, bir iddianın ileri sürülmeden önce kanıtlanması gerektiğini söylüyor. Weights & Biases, bu kanıtın arkasındaki değerlendirme geçmişini LLM Evaluation & Benchmarking ile AI Evaluation Strategy genelinde tek bir anlık görüntü yerine çalıştırmadan çalıştırmaya tutuyor.
  • DatadogAI Launch Readiness Review'un onayı, bir tasarım belgesinin ne iddia ettiğine değil sistemin gerçek koşullar altında ne yaptığına bağlı. Datadog'un üretim izlemesi, yayın kararından önce bu operasyonel kanıtın çekildiği yer.
  • LangfuseHero bölümü, hem temsili hem kritik vakaların test edildiğini söylüyor. Langfuse'un çalıştırma başına izi, AI Agent Evaluation & Reliability ile Independent AI Agent Evaluation'ın belirli bir hatayı sonradan yeniden anlatmak yerine yeniden üretmek için kullandığı şey.
  • Arize PhoenixHero bölümünün ortalamaların önemli olan hatayı gizleyebileceği uyarısı, tam olarak Arize Phoenix'in dilim analizinin karşı durmak için tasarlandığı şey. Zeo bu analizi AI Agent Evaluation & Reliability ile Bias, Fairness & Explainability Testing çalışmalarında bir sistemin davranışının ortalamasından saptığı belirli koşulu bulmak için kullanıyor.
  • BraintrustIndependent AI Agent Evaluation ile LLM Evaluation & Benchmarking, puanlanmış karşılaştırmalarını Braintrust üzerinde çalıştırıyor. Sayfanın iddia kanıt gerektirir standardı, paketin genel bir yetenek izlenimi yerine adı belirtilmiş tek bir yapıya sabitlenmesini gerektiriyor.
  • HeliconeLLM Evaluation & Benchmarking, yalnızca çıktı kalitesini değil işletme maliyetini de hesaba katan bir model karşılaştırması gerektiriyor. Helicone'un çağrı başına maliyet izlemesi, karşılaştırmanın bu ikinci yarısını tamamlıyor.
  • TraceloopAI Launch Readiness Review, bir sistemin üretimde tasarımının iddia ettiği gibi davrandığını doğrulamak zorunda. Traceloop'un yürütme izleri bu kanıtı onay incelemesine taşıyor.
  • Confident AI / DeepEvalBu sayfadaki neredeyse her alt görev bir noktada Confident AI'ın DeepEval'inden geçiyor. Bir değerlendiricinin çıktısı, test edilen sistem hakkındaki bir iddia için kanıt sayılmadan önce kendi güvenilirliğinin insan yargısına karşı kurulması ve denetlenmesi gerekiyor.
  • RagasRAG Evaluation & Groundedness Testing bu sayfanın altında yer alıyor ve Ragas, tam olarak bu soru için tasarlanmış ölçüt paketi. Üretilen bir yanıtın yalnızca alakalı görünmesi değil gerçekten çekilen kaynakla desteklenip desteklenmediğini gösteriyor.
  • GalileoRAG Evaluation & Groundedness Testing ile Bias, Fairness & Explainability Testing için Galileo'nun aralık düzeyinde halüsinasyon tespitini kullanıyoruz. Bu, belirsiz bir kalite şikayetini yanıtın hangi bölümünün desteklenmediğine dair kesin ve konumlandırılmış bir iddiaya dönüştürüyor.
  • Patronus AILLM Evaluation & Benchmarking bazen yalnızca müşterinin kendi senaryolarına değil sektör standardı bir pakete karşı da bir karşılaştırma gerektiriyor. Patronus AI'ın benchmark değerlendirmeleri, bu dış referans noktası için kullanılıyor.

Eğitim, serving ve MLOps

  • DVCGolden Dataset Development, ayrılmış setinin sürümlenmesini ve herhangi bir eğitim bölümünden ayrılmasını gerektiriyor. DVC'nin veri seti sürümlemesi, bu ayrılık iddiasının varsayılmak yerine sonradan denetlenebilir olmasını sağlıyor.

Güvenlik ve güvenlik testi

  • GiskardBias, Fairness & Explainability Testing, temel taramasını Giskard üzerinden çalıştırıyor. Bu tarama, 'bu bazı gruplar için haksız olabilir' endişesini ekibin üzerinde hareket edebileceği somut ve tekrarlanabilir bir bulguya dönüştürüyor.
  • Guardrails AIAI Launch Readiness Review ile Safety & Policy Evaluation, bir azaltımın yalnızca var olduğunu değil gerçekten işe yaradığını kanıtlamayı gerektiriyor. Guardrails AI, önerilen bir kontrolün onaya sayılmadan önce durdurmayı iddia ettiği zarara karşı test edildiği yer.
  • Lakera GuardSafety & Policy Evaluation'ın yeniden test adımı, bir düzeltmenin gerçek koşullar altında tuttuğunu doğrularken Lakera Guard'ın canlı reddetme davranışı sınıflandırmasına karşı çalışıyor. Bu, boşluğu ilk bulan orijinal test vakasından ayrı bir kontrol.
  • MindgardAI Launch Readiness Review ile Independent AI Agent Evaluation, ikinci ve bağımsız bir bakış altında geçerliliğini koruyan bir güvenlik bulgusuna ihtiyaç duyuyor. Mindgard'ın sürekli kırmızı takımı, tek seferlik bir rapor yerine tekrarlanabilir bir saldırı yolu sağlıyor.

Veri, etiketleme ve geliştirme

  • Label StudioGolden Dataset Development, Bias, Fairness & Explainability Testing ve Prompt Evaluation & QA, tartışmalı veya örneklenen otomatik puanlamaları insan kontrolü için Label Studio'ya yönlendiriyor. Bu, otomatik bir değerlendiriciyi dürüst tutan kalibrasyon adımı.
  • Scale AIGolden Dataset Development bazen müşterinin kendi ekibinden daha fazla insan inceleme kapasitesine ihtiyaç duyuyor. Scale AI'ın yönetilen iş gücü, ayrılmış değerlendirme setinin kalite çıtasını hacimde tutarlı tutmak için kullanılıyor.
  • TonicGolden Dataset Development, ekibin gerçek kayıtları doğrudan kullanamadığı hassas bir senaryoyu kapsaması gerekebiliyor. Tonic'in sentetik üretimi, bu belirli kapsam boşluğunu dolduruyor.
  • JupyterGolden Dataset Development'ın kapsam kontrolleri ve LLM Evaluation & Benchmarking'in puan toplaması, notebook analizi olarak çalışıyor. Böylece ortaya çıkan sayılar, opak bir hesaplama yerine denetlenebilir adımlara kadar izlenebiliyor.
Otomatikleştirmek istediğiniz iş akışını, operasyonel darboğazı veya kullanım senaryosunu paylaşın. Net bir yapay zekâ uygulama planı kuralım.
Projenizi anlatın