Testi karara bağlayacak kurallar, ilk ziyaretçi atanmadan önce yazılır.

Bir experiment'ı her gün kontrol edip iyi göründüğü anda durdurmak, sonucu olduğundan iyi gösterebilir. Test tasarımını ve analiz kuralını yayından önce netleştiriyor, sonuçları bu kurala göre okuyoruz.

Birincil metriğin yanında olumsuz etkileri de görünür kılan koruma metrikleriyle, kapsamı ve karar kuralları yazılı bir A/B test tasarımı ve sonuç raporu.

İki Zeo test uzmanı, A/B kapılarından geçen yaya trafiğini ölçüyor

Birlikte çalıştığımız 500'den fazla markadan birkaçı

Tüm referansları gör
  • Domino’s
  • Silverline
  • Odeabank
  • Duru
  • Gusto
  • Elele

Hypothesis'ten analiz zamanına kadar sonucu etkileyebilecek kararları, sonuçlar görünmeden önce yazılı hale getiriyoruz. Experiment'ı tasarlıyor, teknik kurulumunu doğruluyor, karar vermeden izliyor ve sonucu önceden kayda alınmış yöntemle raporluyoruz.

Çalışma ilkelerimiz

  • Başarı ölçütünü sonuç ekranı açılmadan tanımlarız — Hypothesis'i ve başarıyı gösterecek birincil metriği experiment sonuçları görülmeden önce netleştiriyoruz.
  • Örneklem büyüklüğünü gerçek etkiyi ayıracak şekilde hesaplarız — Anlamlı bir etkiyi gürültüden ayırmak için gerekli trafik ya da süreyi tahmin ediyoruz. Böylece test rastlantısal bir hareket yüzünden erken durmuyor.
  • Koruma metriklerini test başlamadan seçeriz — Birincil metrikte kazanım görünürken başka bir alanın kötüleşmesini kaçırmamak için koruma metriklerini baştan belirliyoruz.
  • Analiz zamanını ve durma kuralını önceden kararlaştırırız — Sonucun ne zaman ve hangi yöntemle değerlendirileceğini kayda alıyoruz. Ara sonuçların iyi görünmesi tek başına testi durdurma gerekçesi olmuyor.
  1. Experiment tasarımını hazırlıyoruz

    Hypothesis'i, atama birimini, örneklem büyüklüğünü, koruma metriklerini ve durma kuralını test yayına alınmadan önce tanımlıyoruz.

    Experiment tasarım dokümanı

    Yapay zeka desteği
    Trafik verinizden örneklem büyüklüğü için bir hesaplama taslağı çıkarır.
    İnsan onayı
    Üründen sorumlu kişi birincil metriği onaylıyor.
    Sorumlular
    Experiment Analisti, Ürün Sorumlusu
    Çizim masasında plan çizen karakter
  2. Teknik kurulumu doğruluyoruz

    Atamanın planlandığı gibi çalıştığını ve test tam yayına geçmeden önce test ile kontrol grupları arasında bulaşma olmadığını kontrol ediyoruz.

    Kurulum doğrulama kaydı

    Yapay zeka desteği
    Gerçekleşen atama oranını hedeflenen oranla karşılaştırır.
    İnsan onayı
    Analist testin bulaşmadığını doğruluyor.
    Sorumlular
    Experiment Analisti, Mühendislik Lideri
    Devasa bir ölçüm kadranını okuyan çizim karakter
  3. Karar vermeden teknik olarak izliyoruz

    Test sürerken teknik sorunları takip ediyor, ara sonuçlara bakarak plansız durdurma ya da devam kararı vermiyoruz.

    Experiment izleme kaydı

    Yapay zeka desteği
    Teknik anormallikleri otomatik olarak işaretler.
    İnsan onayı
    Kuralın belirlediği tarihe kadar kimse testi karara bağlamıyor.
    Sorumlular
    Experiment Analisti, Ürün Sorumlusu
    Takip satırlarıyla dolu bir ekranı izleyen çizim karakter
  4. Sonucu analiz ediyor ve raporluyoruz

    Sonucu testten önce kayda alınan yönteme göre analiz ediyor, belirgin bir etki çıkmadıysa bunu da açıkça raporluyoruz.

    Experiment sonuç raporu

    Yapay zeka desteği
    Kayıtlı analiz yöntemine dayanarak sonuç taslağı oluşturur.
    İnsan onayı
    Analist yayına almayı önermeden önce her koruma metriğini onaylıyor.
    Sorumlular
    Experiment Analisti, Ürün Sorumlusu
    Şövale üzerindeki çubuk grafiği anlatan çizim karakter

Testin temel kararlarını sonuç ortaya çıkmadan kayda alırız

Otomasyon trafiğinizden örneklem büyüklüğünü tahmin eder, atama dağılımını hedeflenen oranla karşılaştırır, koşu sırasındaki teknik anomalileri işaretler ve sonuç raporunu önceden kabul edilen kurala göre taslaklar. Disiplin insana aittir: kimse testi kural tarihinden önce kapatmaz ve bir analist, yayına alma önerilmeden önce her koruma metriğini kontrol eder.

Sonuç olumlu da olsa olumsuz da olsa belirgin bir etki göstermese de, aynı yöntemle hazırlanmış ve sınırları açık bir değerlendirme sunuyoruz.

  • Çalışma dokümanı

    Experiment tasarım dokümanı

    Sonuçlar oluşmadan önce kayda alınmış hypothesis, örneklem büyüklüğü hesabı, koruma metrikleri ve durma kuralı.

    Kabul koşulu

    Zaman damgası ilk atamadan öncedir; böylece kuralların sonradan seçilmiş olması mümkün değildir.

    Ritim: Atama başlamadan önce yazılır

  • Karar notu

    Experiment sonuç raporu

    Testten önce kabul edilen yöntemle analiz edilmiş ana sonuç, p-value ve koruma metriklerinin durumu.

    Kabul koşulu

    Sonuç hangi yönde çıkarsa çıksın, birincil metrik ve tüm koruma metrikleri birlikte raporlanır.

    Ritim: Örneklem büyüklüğüne ulaşıldığında

  • Referans dokümanı

    Karar kaydı

    Test sonucuna dayanarak alınan kararın ve gerekçesinin daha sonra da izlenebilmesi için tutulan kayıt.

    Kabul koşulu

    Kayıt, hangi kararın alındığını ve sonuç raporunun hangi bölümünün bu kararı verdirdiğini belirtir.

    Ritim: Deney başına bir tane

Şu olduğunda tamam sayarız: sonuç raporu önceden kayda geçen kurala uyduğunda, her koruma metriği birincil metrikle birlikte raporlandığında ve hiçbir şeyi yayına almama kararı da bir kazanç kadar özenle yazıldığında.

Bu çalışma, ürün içindeki kontrollü bir deneye tasarım, teknik izleme ve analiz desteği verir. Tedavinin geliştirilmesi bu kapsamın dışındadır.

Şu durumlarda iyi bir seçim

  • Belirli bir ürün değişikliğini sınamak için, gelişigüzel trafik bölmek yerine kuralları belli bir A/B test tasarımına ihtiyacınız var.
  • Önceki testler erken durduruldu ya da sonuç görüldükten sonra yeniden analiz edildi. Bu nedenle bulguların güvenilirliği tartışmalı kaldı.
  • Birincil metrikteki iyileşmenin başka bir metriğe zarar verip vermediğini gösterecek koruma metrikleri arıyorsunuz.

Şu durumlarda başka bir çalışma daha doğru

  • Ürün içindeki bir değişiklik yerine pazarlama harcamasını ya da kanal etkinliğini test etmek istiyorsanız, bu ihtiyaç Incrementality ve Lift Ölçümleme kapsamındadır.
  • Test edilen özelliği bizim geliştirip yayına almamızı bekliyorsanız bu kapsam uygun değildir. Biz testi tasarlayıp analiz ederiz, uygulamayı ürün veya mühendislik ekibiniz yapar.

Bunlardan biri sizin durumunuza daha yakınsa, buradan başlayın: Ürün ve Müşteri Analitiği çalışmalarının tümü

Şu olduğunda tamam sayarız: hypothesis, birincil metrik, örneklem büyüklüğü, koruma metrikleri ve durma kuralı kayda geçtiğinde ve ürün sorumlusu birincil metriği onayladığında.

  • Evan Miller's A/B Tools

    sabit örneklem büyüklüğü ve durma kuralının arkasındaki tarafsız hesap makinesi, referans yazı

  • Amplitude

    kimse birincil sonuca erken bakmasın diye koruma metriklerini test boyunca izliyor

  • Optimizely

    testi, yayından önce belirlenen örneklem büyüklüğü ve durma kuralına göre çalıştırıyor

Test etmek istediğiniz değişikliği ve hypothesis'i paylaşın. Örneklem büyüklüğünü, koruma metriklerini ve durma kuralını sonuçlar oluşmadan belirleyip her bulguyu aynı yöntemle değerlendirelim.
Bir experiment planla

Sonuç açık bir kazanım gösteriyorsa testi erken durdurabilir miyiz?

Yalnızca sequential testing yöntemi test başlamadan doğru biçimde planlandıysa. Böyle bir plan yokken iyi görünen ara sonuçta testi durdurmak, yanlış pozitif olasılığını artırır.

Experiment belirgin bir etki göstermiyorsa ne yaparsınız?

Sonucu olduğu gibi raporluyoruz. Sonuç görüldükten sonra yalnızca olumlu görünen bir alt grup aramıyoruz. Bu, test edilen tasarım ve kapsam içinde güvenilir bir etki gösterilemediği anlamına gelir. Tek başına daha fazla trafik gerektiğini ya da etkinin kesinlikle bulunmadığını kanıtlamaz.

Test edilen özelliği siz mi geliştiriyorsunuz?

Hayır. Experiment'ı tasarlıyor ve sonucu analiz ediyoruz. Değişikliği geliştirmek ve yayına almak ürün ya da mühendislik ekibinizin sorumluluğundadır.

Mevcut test kurulumumuzdan neler gerekir?

Experiment platformunuza ya da feature flag sisteminize erişim, test edilecek hypothesis ve anlamlı bir örneklem büyüklüğüne ulaşabilecek trafik gerekir.