İçeriğe geç

A/B Test Anlamlılık Hesaplayıcısı

A/B test sonucunuzun istatistiksel olarak anlamlı olup olmadığını kontrol edin. Ziyaretçileri ve dönüşümleri girin, p-değeri, z-skoru, güven aralığı ve göreceli kaldırmayı alın.

A/B Test Anlamlılık Hesaplayıcısı

Her varyant için ziyaretçileri ve dönüşümleri girin, farkın gerçek mi yoksa sadece gürültü mü olduğunu kontrol edin.

Kontrol (A)
Varyasyon (B)

Sonuçlar

İstatistiksel Olarak Anlamlı

Farkın seçilen güven seviyesinde şansa bağlı olması olası değildir.

P-değeri
0.0007

Chance this gap is just luck — lower is stronger.

Z-skoru
3.381

How far apart the two rates are, in standard errors.

Göreceli kaldırma
+50.0%
Kontrol oranı
10.00%
Varyasyon oranı
15.00%
Mutlak fark
+5.00 pp
Güven aralığı (fark) · 95%
2.11% to 7.89%

The likely range for the true difference.

Varyant başına dönüşüm oranı
Varyant başına dönüşüm oranı. Grouped bar chart with 1 series: Dönüşüm oranı.0%5%10%15%Dönüşüm oranıKontrol (A)Varyasyon (B)10%15%
Yükleme hesaplayıcısı...
📚

Belgeler

A/B testi bir dakikada

Bir düğmeyi, bir başlığı veya bir ödeme akışını değiştirdiniz. Sürüm A eski, sürüm B yenidir. B daha iyi görünüyor — ziyaretçilerin %15'i dönüştürülürken A için %10. Ancak bu boşluk sadece şans olabilir mi, tıpkı bir parayı on kez atarken yedi yazı gelme ihtimali gibi?

Bu hesaplayıcı tam olarak bunu yanıtlar. Her sürümü kaç kişinin gördüğünü ve kaçının dönüştüğünü girersiniz ve ölçtüğünüz farkın gerçek mi yoksa rastgele gürültü mü olma olasılığını söyler. Bu olasılık yeterince yüksekse, bir kazanan var. Değilse, testi çalıştırmaya devam edersiniz.

İzlenecek bir sayı p-değeridir: iki sürüm aslında aynı olsaydı bu kadar büyük bir boşluk görme şansı. Küçük bir p-değeri (örneğin 0,05'in altında) "bu nadiren şans eseri olur, bu nedenle fark muhtemelen gerçektir" anlamına gelir.

Nasıl kullanılır

  1. Ziyaretçiler — her sürümü kaç benzersiz kişi görüş.
  2. Dönüşümler — bunlardan kaçı önem verdiğiniz şeyi yaptı (satın aldı, kaydoldu, tıkladı).
  3. Güven seviyesi — bir kazanan çağırmadan önce ne kadar emin olmak istiyorsunuz. %95 endüstri standardıdır.
  4. Hipoteziki yönlü "B, A'dan farklı mı?" sorusunu sorar (daha güvenli, varsayılan); tek yönlü sadece "B, A'dan daha iyi mi?" sorusunu sorar (daha hassas, ancak testi çalıştırmadan önce yönü belirlemelisiniz).

Sonuç canlı güncellenir ve girişler sayfa URL'sinde depolanır, bu nedenle bir sonucu yer işareti koyabilir veya paylaşabilirsiniz. Sıfırla formu temizler; Örnek verileri yükle çalışılmış bir örneği doldurur.

Çalışılmış bir örnek

ZiyaretçilerDönüşümlerOran
A (kontrol)1.000100%10,0
B (varyasyon)1.000150%15,0

Bu %5 puan mutlak artış ve %50 göreceli artıştır. Hesaplayıcı yaklaşık 0,0007 p-değeri döndürür — 0,05'in altında — bu nedenle %95 güvenle sonuç istatistiksel olarak anlamlıdır. Kabaca, iki sürüm tamamen aynı olsaydı, bin testten birinde bu kadar büyük bir boşluk göreceksiniz.

Matematik (iki-oran z-testi)

Arka planda bu standart iki-oran z-testi, tanıtıcı istatistiklerde öğretilen ve ana A/B araçları tarafından kullanılan aynı testtir.

  1. Her grubun dönüşüm oranı:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    burada xx dönüşümler ve nn ziyaretçilerdir.

  2. Birleştirilmiş oran, her iki grubun bir gerçek orandan paylaştığı varsayıldığında (sıfır hipotezi için):

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Farkın standart hatası:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Z-skoru — iki oran kaç standart hata kadar uzak:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. P-değeri standart normal dağılımdan Φ\Phi gelir. İki yönlü: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Tek yönlü: p=1Φ(z)p = 1 - \Phi(z).

  6. Anlamlı şu durumlarda p<αp < \alpha, burada α=1gu¨ven\alpha = 1 - \text{güven} (%95'te 0,05).

Hesaplayıcı ayrıca, birleştirilmemiş standart hata p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}} ile hesaplanan fark için bir güven aralığı da rapor eder: gerçek boşluk için makul aralık. Bu aralık 0'ı hariç tutarsa, sonuç anlamlıdır.

0 -1.96 +1.96 no difference

%95 güven seviyesinde, ±1.96'nın ötesindeki bir z (gölgeli kuyruklar, alanın %5'i) anlamlı sayılır.

Sonucu dürüstçe okuyun

  • İstatistiksel anlamlılık, iş anlamı değildir. %0,1 kaldırma istatistiksel olarak gerçek olabilir ancak sevk etmeye değer olmayabilir.
  • Erken gözetlemeyin ve durmayın. P-değerini her gün kontrol etmek ve 0,05'in altına düştüğü anda durma, yanlış-pozitif oranınızı şişirir. Örnek boyutunu önceden belirleyin ve testin bitmesine izin verin.
  • Örnek boyutu hakkındaki kuralı izleyin. Normal yaklaşım, her grup en az ~10 dönüşüme ve ~10 dönüşüm olmayan sahip olduğunda güvenilirdir. Küçük sayılarla, sonucu yalnızca yönlü olarak ele alın.
  • Güven ≠ B'nin daha iyi olma olasılığı. %95 güven seviyesi prosedürün uzun vadede zamanın en fazla %5'inde yanlış olduğu anlamına gelir — bu sıklıkçı bir ifadedir, "B kazanma ihtimali %95" değildir.
  • Bir test, bir metrik. Aynı anda birçok metrik veya varyant test etme, tesadüfi ihtimalini çoğaltır; düzeltmek (örn. Bonferroni) veya testi belirleyen tek metriği ön kayıt edin.

Kendiniz hesaplayın

Her snippet yukarıdaki çalışılmış örnek için iki yönlü p-değerini hesaplar.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = kontrol ziyaretçileri, dönüşümler ; A2,B2 = varyasyon ziyaretçileri, dönüşümler
6

SSS

Ne kadar örnek boyuta ihtiyacım var? Anlamlı bir kaldırmanın tespit edilebileceği kadar. Bir taban olarak, varyant başına en az birkaç yüz dönüşümü hedefleyin; temel oranınız ve tespit edilmeye değer en küçük kaldırma ile özel bir örnek boyutu hesaplayıcı kullanın.

İki yönlü mi yoksa tek yönlü mi? Sadece iyileştirmeyle ilgilenmek için sağlam, önceden kararlı bir nedeniniz yoksa iki yönlü kullanın. Tek yönlü, hassasiyetinizi iki katına çıkarır ancak B'nin daha kötü olmasına tepki vermeyi yasaklar.

Hesaplayıcı neden bir güven aralığı gösteriyor? Sadece evet/hayır kararı değil, gerçek farkın makul aralığını gösterir. 0'ı aşan geniş bir aralık "henüz yeterli veri yok" anlamına gelir.

Bu Bayesci mi? Hayır — en yaygın olarak öğretilen ve kullanılan yöntem olan sıklıkçı z-testi. Bayesci A/B araçları p-değeri yerine "B, A'yı geçme olasılığı" rapor eder; her ikisi de geçerlidir, biraz farklı soruları yanıtlarlar.

Kaynaklar