Özel bir agent ancak kontrol edilebilir tek iş, araç izinleri, durma koşulları, toparlanma yolları, görev izleri ve insan müdahalesi tek sınırlı döngüde birleştiğinde yayına hazırlanabiliyor.

Ekibinizin tarif edebildiği ve sonucunu kontrol edebildiği bir işle başlıyoruz. Agent'ın bu işi hangi adımlarla yürüttüğünü, nerede takıldığını, hatadan nasıl çıktığını ve ne zaman bir insana döndüğünü iz üzerinden inceliyoruz.

Teslimde yayın sorumlunuz çalışan agent sürümünü, incelenmiş görev izlerini, açık araç yetkisini ve müdahale, geri alma ile toparlanma için ilk kullanım planını devralıyor.

Özel AI Agent Geliştirme illüstrasyonu: bir yapay zeka ajanının araçlarını ve karar sınırlarını test eden ekip

Birlikte çalıştığımız 500'den fazla markadan birkaçı

Tüm referansları gör
  • Defacto
  • Tosla
  • Neova Sigorta
  • Ajansspor
  • DLive

Önce tek bir yolu baştan sona çalıştırıyoruz. Agent'a yeni bir araç, toparlanma seçeneği veya yayın koşulu eklemek için izlerde gerekçe arıyoruz.

  1. İşin yazılı sözleşmesi

    Girdiyi, kabul edilebilir sonucu, yasak aksiyonları, araçları, veriyi, maliyet ve latency bütçelerini, bilinen hataları ve istisnayı onaylayacak kişiyi birlikte belirliyoruz.

    Yapay zeka desteği
    Verdiğiniz örneklerden olası hata sınıflarını ve bütçe varsayımlarını çıkarıp incelemeye hazırlıyor.
    İnsan onayı
    Sonucu kontrol edebiliyor muyuz, sınırlar açık mı ve karardan kim sorumlu? Workflow sorumlunuz işin sınırını, kullanılabilecek araçları ve istisna yetkisini kesinleştiriyor.
  2. En kısa tamamlanmış yol

    Bir görevi girdiden sonuca taşıyacak hedef, durum, bellek, çıktının kaynakla desteklenmesi, araç sözleşmeleri, izinler ve durma koşullarını kuruyoruz.

    Yapay zeka desteği
    Onaylanan iş tasarımından durum makinesi ve araç sözleşmesi iskeletleri hazırlıyor.
    İnsan onayı
    Bir inceleyen kişi her aksiyonu ve durum değişikliğini yeniden takip edebiliyor mu? Test başlamadan önce araç ve izin sınırlarını mühendislik lideriniz onaylıyor.
  3. Görev yolundan çıktığında

    Temsili, uç ve olumsuz görevlerde tamamlanmayı, geçersiz aksiyonu, yinelenen yan etkiyi, takılan döngüyü, toparlanmayı, eskalasyonu, maliyeti ve latency'yi inceliyoruz.

    Yapay zeka desteği
    İncelenecek test setini genişletmek için uç ve olumsuz görev varyantları öneriyor.
    İnsan onayı
    Kritik hata tasarlandığı gibi duruyor ya da sorumlu kişiye ulaşıyor mu? Hangi hata sınıflarıyla sınırlı yayına çıkılabileceğine güvenlik lideriniz karar veriyor.
  4. Kontrolleri işletecek ekip

    Yayın sınırlarını, izlemeyi, müdahaleyi, geri almayı ve işletim görevlerini incelenmiş izlerle birlikte teslim ediyoruz.

    Yapay zeka desteği
    Test edilen hata yollarından izleme ve geri alma rehberinin ilk taslağını oluşturuyor.
    İnsan onayı
    Agent'ı kim durdurabilir, toparlayabilir, genişletebilir veya kullanımdan kaldırabilir? Sınırlı yayın koşullarını ve durdurma yetkisini yayın sorumlunuz belirliyor.

Çalışan sürümün yanında, kapsamın aynı kalmasına, değişmesine veya genişlemesine karar verebilmeniz için gereken inceleme kanıtını da alırsınız.

  • Mimari dokümanı

    Agent döngüsü, durumları ve durma koşulları haritası

    Agent'ın hedefini, durumunu, döngüsünü, belleğini, çıktının kaynakla nasıl desteklendiğini, durma koşullarını, araç sınırlarını ve sorumluluk düzenini açıklar.

  • Matris

    Araç sözleşmeleri ve eskalasyon yetki kaydı

    Onaylı araçları ve şemaları, izinleri, insan onaylarını, yasak aksiyonları, kaynak bütçelerini ve eskalasyon yollarını gösterir.

  • Test kanıtı

    İncelenmiş görev izleri ve hata bulguları

    Tamamlama, geçersiz aksiyon, toparlanma, eskalasyon ve kaynak kullanımı için temsili, uç ve olumsuz görevleri incelenmiş izleriyle toplar.

  • Playbook

    İlk kullanım müdahale ve toparlanma planı

    İlk kullanım koşullarını, izlemeyi, müdahaleyi, geri almayı, toparlanmayı ve inceleme görevlerini kayda geçirir.

Başlangıç için en uygun iş, girdisi ve kabul edilebilir sonucu ekip tarafından bilinen, tekrar eden ve nasıl bozulabileceğine dair örnekleri bulunan iştir.

Şu durumlarda iyi bir seçim

  • İş birkaç adım ya da sistem arasında ilerliyor, bu yüzden tek bir prompt veya sabit kural artık yeterli olmuyor.
  • Temsili görevler ve hata örnekleri var, ama güvenli test ortamı ile gerekli araç ve veri erişimi henüz aynı sınırda buluşmuyor.
  • Yetki, maliyet, latency ve toparlanma kuralları farklı kişilerde kalıyor, bu yüzden agent'ın tek bir işletme sınırı bulunmuyor.
  • Tekrarlanan işin kabul edilebilir sonucu biliniyor, ama agent'ın durum, bellek, kaynak desteği, durma ve tamamlama döngüsü birlikte tanımlanmıyor.
  • Onaylı araçlar bulunuyor, ancak sözleşmeleri, izinleri, bütçe sınırları ve insana dönüş yolları tek bir yetki sınırında birleşmiyor.
  • Çalışan agent sürümü tanıdık görevleri tamamlıyor, ama izleri bilinen hataları ve kararlaştırılan toparlanma yollarını henüz kapsamıyor.
  • Uçtan uca görevler test edilebiliyor, ancak ilk kullanım sınırları, müdahale kontrolleri ve işletim görevleri yayın sorumlusuna bağlanmıyor.

Şu durumlarda başka bir çalışma daha doğru

  • Görevi, yetki tavanı ve bitiş koşulu tanımlanmadan genel amaçlı otonom çalışan istiyorsunuz. Bu seçimleri önce agent stratejisi netleştirmeli.
  • Agent'a kontrolleri incelenmeden yüksek etkili erişim veya geri alınamayan aksiyon vermek istiyorsunuz. Önce güvenlik tasarımı ve yetkilendirme gerekiyor.
  • Zeo'nun production'ı işletmesini, yeni veri edinmesini veya bu sürümün dışındaki entegrasyonları kurmasını istiyorsunuz. Bu işler ayrı kapsam gerektiriyor.

Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: AI agent hizmetini inceleyin

  • OpenAI

    En kısa çalışan agent döngüsünü OpenAI modelleri ve Agents SDK ile kuruyoruz

  • LangChain

    Agent döngüsündeki state'leri ve insan kontrol noktalarını LangGraph ile görünür kılıyoruz

  • Pydantic AI

    Hatalı agent çıktılarını Pydantic AI ile doğrudan sınırda durduruyoruz

  • Langfuse

    Agent'ın her adımını Langfuse trace'i üzerinden ayrıntılı biçimde inceliyoruz

  • Braintrust

    Hatalı ilerleyen agent yollarını Braintrust ile tekrar tekrar puanlıyoruz

  • Helicone

    Rollout kararında agent maliyetini ve latency'yi Helicone verileriyle değerlendiriyoruz

  • Guardrails AI

    Agent çıktı sözleşmesini rollout sonrasında Guardrails AI ile uyguluyoruz

Görevi, bilinen hata örneklerini ve sonuçtan sorumlu kişiyi getirin. En küçük tamamlanmış agent döngüsünü birlikte geliştirip test edelim.
İlk işi konuşalım

Bilinen girdisi, birinin kontrol edebileceği sonucu, temsili örnekleri, tanıdık hata biçimleri, gerekli en az araç ve verisi, politika sınırları, maliyet ve latency bütçeleri, ayrıca istisnayı onaylayacak kişisi olan tek bir iş yeterlidir.