Her önbellek, toplu işleme, bağlam, yönlendirme, retrieval veya araç değişikliği aynı iş yükü, kalite sınırı, yük profili ve yedek akış koşullarında karşılaştırılmadıkça optimizasyon güvenilir bir sonuca dönüşmüyor.

Maliyet ve yanıt süresinin nerede biriktiğini buluyor, önbellek, toplu işleme, bağlam, yönlendirme, retrieval veya araç kullanımında her seferinde tek bir değişkeni değiştiriyoruz. Aynı iş yükü kalite, güvenilirlik, kapasite ve yedek akış sınırlarını geçerse sonucu tutuyoruz.

Operasyon sorumlunuz iş yükü baseline'ını, sürümlü deney listesini, seçilen sonuçları ve kabul edilen dengeyi izleyip gerektiğinde yapılandırmayı geri almak için kullanacağı kapasite sınırlarını devralıyor.

Yapay Zeka Maliyet ve Gecikme Optimizasyonu illüstrasyonu: üretimdeki bir yapay zeka sistemini izleyen ve işleten ekip

Birlikte çalıştığımız 500'den fazla markadan birkaçı

Tüm referansları gör
  • CHIP Online
  • Albaraka Türk
  • Exquise
  • Grandvision
  • DYO
  • DLive

Başlangıç profilini sabit tutuyor, her deneyde tek değişkeni oynatıyoruz. Böylece sonucun deneyden gelip gelmediğini ve aynı anda kalite, güvenilirlik, kapasite ile yedek akışta ne olduğunu sorumlunuz görebiliyor.

  1. Başlangıç profilini çıkarıyoruz

    Gerçeği yansıtan görev ve yükleri model rotaları, token ve bağlam kullanımı, retrieval, araç çağrıları, mevcut maliyet, latency hedefleri, kalite ve kapasite sınırlarıyla birlikte profilliyoruz. Önemli kesitleri genel ortalamadan ayrı tutuyoruz.

    Yapay zeka desteği
    Araçlar, izleri gerçek iş yükü kesitlerine ayırıp incelememize yardımcı oluyor.
    İnsan onayı
    İş yükü, sağlıklı bir karşılaştırma yapacak kadar temsili mi? Kesitlerin gerçek production trafiğini yansıttığını güvenilirlik ekibi liderimiz onaylıyor.
  2. Her deneyde tek değişkene odaklanıyoruz

    Önbellek, toplu işleme, bağlam, yönlendirme, retrieval veya araç kullanımında her deneyde tek bir sınırlı değişkeni değiştiriyoruz. Yapılandırma, varsayım, istisna ve gördüğümüz sonuç aynı deney kaydında kalıyor.

    Yapay zeka desteği
    Araçlar, yapılandırmaları karşılaştırıp deney günlüğü için taslak kayıtlar hazırlıyor.
    İnsan onayı
    Gördüğümüz fark gerçekten deneyden mi kaynaklanıyor, yoksa başlangıç profili mi değişti? Deneyde hangi değişkenin değiştiğini güvenilirlik ekibi liderimiz onaylıyor.
  3. Yükü ve yedek akışı test ediyoruz

    Seçtiğimiz değişiklikleri normal ve tepe yükte, kalite gerilemesi vakalarında, hatalarda ve yedek akış yollarında test ediyoruz. Daha hızlı bir ortalama ciddi bir kesiti veya çalışmayan yedek akışı gizleyemiyor.

    Yapay zeka desteği
    Araçlar, test ettiğimiz kesitlerdeki olası kalite gerilemelerini işaretliyor.
    İnsan onayı
    Maliyet, p50 ve p95 latency, işlem hacmi ve kalite, birlikte belirlediğimiz sınırlar içinde mi? Hangi gerilemede deneyi durduracağımıza ürün ya da operasyon sorumlunuz karar veriyor.
  4. İşletim sınırlarını netleştiriyoruz

    Birlikte belirlediğimiz sınırları geçen değişiklikleri işletim kaydına alıyoruz. Kapasite bütçesini, gerileme uyarılarını, yedek akış tetikleyicilerini, geri alma koşullarını ve sonraki incelemenin sorumlusunu belirliyoruz.

    Yapay zeka desteği
    Araçlar, test sonuçlarından kapasite bütçesi ve uyarı sınırları için taslak hazırlıyor.
    İnsan onayı
    Bu dengeyi kim onaylıyor, bir sonraki incelemeyi kim takip ediyor? Maliyet, latency ve kalite arasındaki dengeyi sorumlunuz onaylıyor, sonraki incelemeyi de yine bu kişi takip ediyor.

Teslimatlar karşılaştırmayı yeniden inceleyebilmenizi sağlıyor. Test edilen iş yükünü, değişen değişkeni, kalite ve güvenilirlik sonucunu, kabul edilen dengeyi ve production'da izlenecek sınırları aynı kayıtta görüyorsunuz.

  • Pano

    İş yükü bazlı maliyet ve kapasite tablosu

    Model rotalarını, token ve bağlam kullanımını, retrieval'ı, araçları, maliyeti, latency'yi ve kapasite kısıtlarını iş yüküne ve önemli kesitlere göre gösteren bir başlangıç profili hazırlıyoruz.

  • Karar kaydı

    Sürümlü optimizasyon deney listesi

    Test ettiğimiz her değişkeni ve yapılandırmayı, varsayımları, istisnaları, sonuçları ve aldığımız kararları bu günlükte kayda alıyoruz.

  • Test kanıtı

    Normal ve yedek akış karşılaştırma raporu

    Normal yük, tepe yük, hata ve yedek akış koşullarındaki karşılaştırma sonuçlarını, kabul ettiğimiz değişikliklerle birlikte sunuyoruz.

  • Politika

    Kapasite bütçesi ve gerileme uyarı listesi

    İşletim bütçesini, işlem hacmi sınırlarını, kalite gerilemesi uyarılarını, yedek akış tetikleyicilerini ve inceleme koşullarını tanımlıyoruz.

Maliyet veya latency bir ürün hedefini engelliyor ama ekibiniz iş yükünün hangi kısmının buna neden olduğunu ve değişiklikle hangi kaliteden vazgeçileceğini göremiyorsa bu çalışma karşılaştırma zemini kuruyor.

Şu durumlarda iyi bir seçim

  • Başarılı görev başına maliyetiniz yükseliyor, ama token harcaması hangi iş yükü ya da model rotasının artışı yarattığını tek başına açıklamıyor.
  • p95 yanıt süresi temsili iş yükünde hedefinizi kaçırıyor, fakat bağlamın, retrieval'ın veya araç çağrılarının gecikmedeki payı bilinmiyor.
  • Ekipler prompt, bağlam, model, retrieval ya da araçları, deneyleri karşılaştırabilecekleri bir kayıt tutmadan değiştiriyor.
  • İş yükü, görev kalitesi, maliyet ve kapasite ölçümleri farklı yerlerde tutuluyor, bu yüzden aynı değişiklik için ortak bir başlangıç profili kurulamıyor.
  • Önbellek, toplu işleme, bağlam, model yönlendirme, retrieval ve araç çağrıları değiştiriliyor, ama deney kaydı hangi değişkenin sonucu oynattığını göstermiyor.
  • Bir değişiklik normal yükte geçiyor, ancak temsili vakalarda kalite gerilemesi, kapasite, hata ve yedek akış davranışı henüz sınanmıyor.
  • Kapasite bütçeleri ve izleme sınırları konuşuluyor, yine de kabul edilen değişiklik için geri alma koşulu ve sonraki inceleme sorumlusu bulunmuyor.

Şu durumlarda başka bir çalışma daha doğru

  • Daha düşük token maliyetini görev kalitesi veya güvenilirlik düştüğü halde başarı saymak istiyorsunuz. Bu bir optimizasyon sonucu değil, yalnızca maliyet kesintisi oluyor.
  • İş yükü ve kısıtlar ölçülmeden sabit bir maliyet ya da latency düşüşü vaat edilmesini istiyorsunuz. Bu çalışma hedefi test ediyor, sonucu garanti etmiyor.
  • Üzerinde anlaştığımız deney sınırı dışındaki production sistemlerinin işletilmesini veya değiştirilmesini istiyorsunuz. Bu iş ayrı bir operasyon kapsamı gerektiriyor.

Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: LLMOps hizmetini inceleyin

Bir sistemi hiç ayakta tutmak zorunda kalmadıysanız onu iyi test etmek de zor. Biz production'da AI işletiyoruz, bu yüzden değerlendirme, güvenlik testi ve LLMOps çalışmalarımız gerçekte nelerin kırıldığını bilerek başlıyor. Ekibimiz kıdemli mühendislerden oluşuyor ve Zeo 2011'den beri müşteri projelerinde çalışıyor.

  • LiteLLM

    Routing, caching, fallback ve sağlayıcı değişimlerini tutarlı biçimde test ediyoruz

  • Groq

    Gerçek open-weight iş yükleriyle düşük latency'li hosting seçeneğini test ediyoruz

  • Cloudflare AI Gateway

    Edge caching, hız sınırları ve failover davranışını yük altında test ediyoruz

  • Helicone

    İstek başına maliyet, latency, token, cache hit ve retry ölçüyoruz

  • Braintrust

    Maliyet ve latency değişirken kalite baseline'ını koruma altında tutuyoruz

  • Datadog

    Model isteğinin ötesindeki uçtan uca hizmet etkisini kontrol ediyoruz

Gerçeği yansıtan iş yükünü, mevcut maliyet ve latency ölçülerini, değişmemesi gereken kalite sınırını paylaşın. İlk kontrollü karşılaştırmayı bu profil üzerinden tanımlayalım.
Zeo ile konuşun

Çalışmaya başlamak için hangi verilere ve erişimlere ihtiyaç duyuyorsunuz?

Genellikle production izlerine ya da sahadaki yük verisine, görev kalitesi referansına, mimariye ve model rotalarına ihtiyaç duyuyoruz. Token ve bağlam profilleri, retrieval ve araç davranışı, maliyet verisi, latency hedefleri, kapasite kısıtları ve gerileme sınırları da çalışmanın diğer girdilerini oluşturuyor. Ortaya çıkan dengeyi onaylayacak ya da reddedecek bir sorumlunun da çalışmaya katılması gerekiyor.

AI araçlarından deneylerin hangi aşamalarında yararlanıyorsunuz?

AI araçları, onaylı çalışma alanında izleri karşılaştırabiliyor, yapılandırmaları gruplayabiliyor, test vakaları hazırlayabiliyor ve deney sonuçlarını özetleyebiliyor. Yönlendirme, bağlam, önbellek ya da yedek akışta bir değişiklik önermeden önce kaynak veriyi, iş yükü kesitlerini ve hesapları biz doğruluyoruz.

Bir değişikliği kabul ederken hangi ölçülere bakıyorsunuz?

Başarıyla tamamlanan görev başına maliyete, p50 ve p95 yanıt süresine, birlikte belirlediğimiz kalite sınırındaki işlem hacmine ve kalite gerileme oranına bakıyoruz. Tepe yükünü, hataları, yedek akışları ve önemli kesitleri de ayrıca inceliyoruz. Ortaya çıkan dengeyi kabul edip etmeyeceğinize sorumlunuz karar veriyor.

Belirli bir tasarruf ya da hızlanma vaat ediyor musunuz?

Hayır. Elde edilebilecek değişim iş yüküne, model rotalarına, bağlama, retrieval'a, araçlara, kalite sınırına ve mevcut kapasite kısıtlarına bağlı. Önce karşılaştırılabilir bir profil kuruyor, sonra bu iş yükünü etkileme ihtimali olan seçenekleri test ediyoruz. Bir fikir tek bir sayıyı düşürüp kalite, güvenilirlik veya yedek akış sınırında kalırsa ilerlemiyor. Test edilen profil, deney kaydı, seçilen değişiklikler ve işletim sınırları yine teslim ediliyor.