Otonom agent'ları test edip güvenle yayınlayın

Agent kendi başına çalışmadan önce insan onayı ve yeniden çalıştırma koruması ekleyin. Sonuçları denetlenebilir rubriklerle değerlendirin, yayın, host davranışı ve kimliği ayrı ayrı doğrulayın.


Bu derste neler öğreneceksiniz?

  • İnsan onaylı otonom flow'da kanıtı doğru yansıtan uç durumlar kullanın
  • İşlemden önce yeniden çalıştırma korumasıyla tekrarlı kayıtları engelleyin
  • Agent yanıtlarını denetlenebilir test kümeleri ve rubriklerle değerlendirin
  • Yayın, host davranışı ve kimlik denetimini ayrı sonuçlar olarak kaydedin
  • Ölçümlü kullanıcı kitlesinin Copilot Credit tüketimini hesaplayın
Bu sayfada

Şimdiye kadarki her çalışma siz Test düğmesine bastığınızda başladı. Otonom agent bir olayla çalışmaya başlar, kimse izlemiyorken işlem yapar ve sonucunu bu bilgiye güvenecek kişilere bildirir.

Bu yüzden söylediği her iddianın ayrı kanıtı olmalıdır. Sonuç doğuran eylemlerden önce onay ve yeniden çalıştırma koruması koyacak, uç durumları açıkça tanımlayacak, sonuçları denetlenebilir ölçütlerle değerlendireceksiniz. Yayının tamamlanmasıyla agent'ın gerçek host'taki davranışını da ayrı kaydedeceksiniz.

Olay yalnızca işin başladığını kanıtlar

Konuşma odaklı agent kullanıcı mesajını bekler. Olay odaklı agent başka sistem değişiklik bildirdiğinde başlar. Örneğin kayıt "Submitted" durumuna geçince kimse izlemiyorken flow çalışabilir. Risk artar, çünkü sonraki kişi sürecin gerçeğini çoğu zaman yalnızca agent raporundan görür.

Olay yalnızca işin başladığını kanıtlar. Girdinin geçerliliğini, onayın verildiğini veya kaydın oluştuğunu göstermez. Her olgu kendi adımında kanıtlanır. İyi otonom flow şu uç durumlardan birini tam anlamıyla döndürür:

  • CompletedAutomatically, tutar onay gerektirmedi ve görev gerçekten oluşturuldu.
  • Approved, insan onay verdi ve görev gerçekten oluşturuldu.
  • Rejected, insan reddetti ve görev oluşmadı.
  • InvalidInput, doğrulama herhangi bir işlemden önce çalışmayı durdurdu.
  • Failed, işlem denendi ancak görev oluşturulamadı.

"Approved" otomatik işlem için kullanılmaz. Hedef kayıt gerçekten oluşmadan iki başarı durumundan biri döndürülemez. Bu durumları zihinsel modelde ve flow'da ayırmak otonom güvenliğin temelidir.

İnsan onayını sonuç doğuran işlemden önce koyun

İnsan kararını sonuç doğuran eylemden önce alın. Yaygın tasarımda belirli tutarın üzerinde insan onayı istenir, eşikte veya altında otomatik işlem yapılır. Onay isteğinde talep, talep sahibi, tutar, amaç, onayın yetki verdiği işlem ve reddin sonucu birlikte gösterilmelidir.

Onay denemeye yetki verir, sonucu garanti etmez. İnsan onayladıktan sonra oluşturma başarısız olursa durum Failed olmalıdır. "Approved", "kuyruğa alındı" veya "yükseltildi" denemez. Agent yalnızca doğrulanmış eylemin ürettiği sonucu bildirebilir. Döndürülen durum desteklemiyorsa onay, oluşturma, bildirim veya yükseltme iddiası kullanmayın.

Sistem aynı olayı yeniden gönderebilir. Aynı talep kimliği ikinci görev oluşturmamalıdır. Yeniden çalıştırma korumasını onay ve oluşturma adımından önce koyun. Kimlikle eşleşen kayıt varsa onay istemeyin, oluşturmayı denemeyin, tekrara özgü başarısız olmayan durum döndürün ve eşleşme sayısını tam bir olarak koruyun. Bu kontrolü atlamak tekrarlı sipariş gibi pahalı sonuç doğurabilir.

İnsan onayı işlemin tamamlandığını göstermez

Onayla seçimi yalnızca işlem denemesine izin verir. Sonraki oluşturma adımı başarısızsa Failed döndürün. Yalnızca onaya bakarak "görev oluşturuldu" demek otonom sisteme güveni zedeler.

Uç durumu değiştirmeden raporlayın· copilot-studio
Zayıf örnek

Kullanıcıya talebin işlendiğini söyle ve güven verici bir durum güncellemesi paylaş.

İyi örnek

Flow'un döndürdüğü Status değerini aynen raporla: - Approved, bir insanın onayladığı ve görevin oluşturulduğu anlamına gelir. - Rejected, hiçbir görevin oluşturulmadığı anlamına gelir. - CompletedAutomatically, görevin onaysız oluşturulduğu anlamına gelir. - InvalidInput, doğrulamanın ya da yeniden çalıştırma korumasının işlemeyi durdurduğu anlamına gelir. - Failed, denenen görev oluşturmanın tamamlanmadığı anlamına gelir. Döndürülen durum ve mesaj doğrulamadıkça onay, görev oluşturma, bildirim, kuyruğa alma veya yükseltme iddiası kullanma.

Bu prompt neden daha iyi? Doğrulanmış uç durumu değiştirmeden aktaran agent. Onay sonrası başarısız oluşturma tamamlanmış görev değil hata olarak bildirilir.

Onay isteğinde karar için gereken bağlamı verin· copilot-studio
Zayıf örnek

Yöneticiye PR-1042 talebini onaylat ve devam et.

İyi örnek

PR-1042 satın alma talebini inceleyin. Talep sahibi: Maya Chen Tutar: $8,600 Amaç: Yıllık güvenlik değerlendirmesi yenilemesi Yenileme görevini oluşturma denemesine izin vermek için Onayla. Görev oluşturmadan bitirmek için Reddet.

Bu prompt neden daha iyi? Onaylayanın ek bağlam aramadan karar verebildiği, onay ve reddin sonucunu açıkça gösteren istek.

Agent'ı adlandırılmış senaryolarla değerlendirin

Birkaç prompt çalıştırmak kapsamlı değerlendirme değildir. Her girdiyi beklenen ve gözlemlenebilir davranışla eşleştiren adlandırılmış senaryolardan test kümesi hazırlayın. Microsoft'un Copilot Agent Kit'i farklı sınırlar için test türleri sunar. Kararlı metinde Response Match, yönlendirmede Topic Match, ifadesi değişebilen bilgi yanıtlarında Generative Answers kullanılır. Böylece bütün metni birebir eşleştirmek yerine senaryonun önemli özelliğini korursunuz.

Kabul ölçütü ile yapılandırılmış oracle kuralını ayırın. Kabul ölçütü iş gereksinimidir, örneğin "16 hafta, tam zamanlı statü ve 12 aylık hizmet belirtir." Oracle bu gereksinimi testte uygulayan kuraldır. Yanıt gevşek oracle'ı geçip gerçek gereksinimi ihlal edebilir. Bu durumda hem agent davranışı hem oracle zayıftır.

Bilgi yanıtlarında Kit rubriğe göre 1 ile 5 arasında not veren yapay zeka hakemi kullanır. Belgelenmiş geçme eşiği 5'tir ve not insan değerlendirmesiyle karşılaştırılabilir. "İyi yanıta 5 ver" belirsizdir. "Üç zorunlu olgu da varsa 5 ver" denetlenebilir kabul testidir. Başarısız senaryoyu agent davranışı, oracle yapılandırması veya eksik bağımlılık gibi doğru sınıfa koyun ve ilgili sorunu düzeltin. Testi yeşile çevirmek için doğru ölçütü gevşetmeyin. "Answered" etiketi veya en yüksek hakem notu olgu doğruluğunu kanıtlamaz.

Yapay zeka hakemine denetlenebilir rubrik verin· copilot-studio
Zayıf örnek

Yanıt iyiyse 5, eksikleri varsa daha düşük puan ver.

İyi örnek

Yalnızca üç zorunlu olgunun tamamı varsa 5 ver: 16 hafta izin, düzenli tam zamanlı statü ve 12 kesintisiz aylık hizmet. Zorunlu olgulardan biri eksikse en fazla 4 ver. Yanıt fikstürle çelişiyor veya istisna üretiyorsa en fazla 2 ver.

Bu prompt neden daha iyi? İş gereksinimini izleyen puanlama. Tek olgulu yanıt 5 alamaz, yapay zeka hakemiyle insan inceleyici aynı ölçüte yaklaşır.

Yayın zincirindeki her kontrol noktasını ayrı doğrulayın

Yayın sürecinde birkaç kontrol noktası vardır ve her biri dar bir sonucu gösterir: geliştirme testi, yayın sonucu, kanal kullanılabilirliği, host davranışı ve kimlik. Geliştirme testinin geçmesi yayının tamamlandığını göstermez. Yayın sonucu kanalın açıldığını, host'un açılması yanıtların doğru olduğunu, doğru yanıtlar da oturum açma ve erişim kontrollerini kanıtlamaz.

Her hedefi doğrudan kontrol edin. Yayından sonra Teams, Microsoft 365 Copilot veya onaylı web sayfasındaki gerçek host'u açıp yeni konuşma başlatın. Kaynağın yanıtladığı ve yanıtlamadığı soruları yeniden deneyin. Yayınlanmamış düzenlemeler siz tekrar yayınlayana kadar bağlı kanallara ulaşmaz. Copilot Studio deneme sürümü de yayın yapamaz. Kullanılabilirlik, davranış ve kimliği ayrı kaydedin. Agent doğru yanıt verirken SSO kontrolü, yapılandırma kanıtınız olmadığı için engellenmiş kalabilir. Bu durumda doğru sonuç "Engellendi"dir.

Gerçek zamanlı ses için ek koşullar vardır. Voice kanallı Dynamics 365 Contact Center, Omnichannel yönetici rolü ve Copilot Studio maker rolü gerekir. AB Veri Sınırı müşterileri izin verilmeyen coğrafyalar arası işlem nedeniyle bu özelliği kullanamaz.

Kullanılabilirlik, davranış ve kimliği ayırın

Her hedefte kullanılabilirlik, davranış ve kimliği ayrı kaydedin. Agent yanıt testlerini geçerken SSO testi eksik yapılandırma kanıtıyla engellenebilir. Tek hüküm bu önemli boşluğu gizler.

Copilot Credit maliyetini işleme göre tahmin edin

Lisanslama iki ayrı soruyu yanıtlar: agent'ı kim kullanabilir ve tüketim nasıl ödenir? Microsoft 365 Copilot lisanslı kullanıcı için eklentinin yıllık ödemede kullanıcı başına aylık liste fiyatı $30'dur ve kapsanan agent etkileşiminde ek ücret yoktur. Diğer kullanımlar Copilot Credit ile ölçülebilir.

Copilot Credit mesaj veya kullanıcı değildir. Özellikler farklı kredi tüketir. Temmuz 2026 oran tablosunda üretken yanıt başına 2 kredi, agent eylemi başına 5 kredi, 100 agent-flow eylemi başına 13 kredi yer alır. Tahmini koltuk değil işlem üzerinden yapın. Agent işlemlerini listeleyip oranlarla çarpın ve toplayın. Ölçümlü, lisanssız kitlede kredi başına yaklaşık $0.01 ile kaba kullandıkça öde tahmini yapılabilir. 1,630 kredi yaklaşık $16.30 eder.

Lisanslı işlemleri ölçümlü kullanımdan ayırın, lisans kapsamındaki etkinliği yeniden ücretlendirmeyin. Bütün tutarları tahmin diye etiketleyin. İstikrarlı kullanımda ön ödemeli kapasite seçilebilir. Paket fiyatları ve otonom tetikleyici ek ücretleri tenant'a göre değiştiği için güncel teklifi yöneticiden doğrulayın.

Şimdi siz deneyin

Otonomi güvenlik matrisini simüle edin

Dört talep için uç durumları çıkarın. Ardından yeniden çalıştırmanın tekrarlı görev üretmediğini on dakikalık simülasyonla kanıtlayın. Tenant gerekmez.

  1. 01

    Kuralları yazın. 5,000'i aşan tutar insan onayı ister. Talep "Submitted" durumunda olmalıdır. Görev yalnızca doğrulama ve gerekiyorsa onaydan sonra oluşturulur. Her talep kimliği için tam bir görev bulunabilir.

  2. 02

    ER-2001, Submitted, 3,200 tutarlı talep için durumu ve onay gerekip gerekmediğini belirleyin.

    İpucu: Talep geçerli ve eşiğin altındadır. Onay olmadan otomatik görev oluşur.

  3. 03

    ER-2002, Submitted, 8,600 tutarlı talepte onay veriliyor ve oluşturma başarılı oluyor. Durumu ve hedef satırı yazın.

  4. 04

    ER-2004, Submitted, 2,400 tutarlı talepte talep sahibi boş. Durumu, onay davranışını ve satır oluşup oluşmadığını belirleyin.

  5. 05

    ER-2001'i yeni çalıştırma kimliğiyle yeniden gönderin. Onay istenmediğini, satır eklenmediğini, eşleşme sayısının 1 kaldığını ve tekrara özgü başarısız olmayan durum döndüğünü doğrulayın.

Her uç durumu kanıtla açıklayan beş satırlık kayıt ve yeniden çalıştırma sonrasında tam bir görev kaldığını gösteren sonuç.

Modülün ortak kuralı şudur: kaydedilmiş taslak, test çalıştırması, olay, onay ve yayın kendi dar kanıtını üretir. Agent sonraki iddiayı önceki adımdan ödünç almamalı, yeni kanıtla hak etmelidir. Bu refleks güvenilir agent yayınlamanın temelidir. Yönetim ve yönetişim serisinde aynı alışkanlığı tenant geneline taşıyacaksınız.

Aklınızda kalsın

  • Olay otonom işi başlatır, ancak girdi, onay veya tamamlanma kanıtı değildir.
  • İnsan onayı denemeye izin verir, hedef kayıt oluşmazsa dürüst durum "Failed"dır.
  • Yeniden çalıştırma koruması işlem öncesinde mevcut kaydı bulup tekrarlı işi engeller.
  • Test kümesi ve denetlenebilir rubrik kullanın, "Answered" etiketi veya en yüksek not kanıt değildir.
  • Yazma testi, yayın, kanal, host davranışı ve kimlik ayrı kontrol noktalarıdır. Copilot Studio deneme sürümü yayın yapamaz.

Kendinizi test edin

  1. 1. Eşik üstü talep insan tarafından onaylanıyor, ancak yenileme görevini oluşturma işlemi kalıyor ve hedef satır oluşmuyor. Hangi durum dönmelidir?

  2. 2. Daha önce tamamlanan talep aynı kimlikle yeniden geliyor. Yeniden çalıştırma koruması nerede olmalı ve hangi sonuç doğru çalıştığını gösterir?

  3. 3. Senaryo üç politika olgusu istiyor, yanıt yalnızca birini veriyor. Sonuç "Answered", belirsiz hakem rubriği de en yüksek notu veriyor. Doğru düzeltme nedir?

  4. 4. Agent yazma testini geçiyor ve yayın tamamlanıyor. Web chat'te desteksiz ödenek uyduruyor, SSO yapılandırma kanıtı da yok. Davranış ve kimlik sonucu nedir?

  5. 5. Ölçümlü kitle 500 üretken yanıt, her biri 2 kredi, 100 agent eylemi, her biri 5 kredi, ve 1,000 agent-flow eylemi, 100 başına 13 kredi çalıştırıyor. Toplam ve kredi başına $0.01 tahmini maliyet nedir?

  6. 6. Copilot Studio deneme sürümünde aşağıdakilerden hangisi yapılamaz?

Sık sorulan sorular

Bu dersteki terimler

otonom agent
Kullanıcı mesajı yerine sistem olayıyla başlayıp doğrudan gözetim olmadan flow çalıştıran agent.
human-in-the-loop
Otomasyonun sonuç doğuran işlem öncesinde insan kararı için durduğu ve bu kararı izlediği tasarım.
yeniden çalıştırma koruması
İşlem öncesinde mevcut kaydı kontrol ederek tekrarlanan olayın tekrarlı iş oluşturmasını engelleyen koruma.
Copilot Credit
Agent özelliklerinin farklı miktarlarda tükettiği ölçüm birimi.
kanal
Yayınlanmış agent'ın Teams, Microsoft 365 Copilot, web chat veya ses gibi kullanıcıya ulaştığı hedef.

Daha fazla kaynak