Langkau ke kandungan

Kalkulator Kepentingan Ujian A/B

Periksa sama ada hasil ujian A/B anda signifikan secara statistik. Masukkan pelawat dan penukaran untuk mendapatkan nilai-p, skor-z, selang keyakinan, dan lif relatif.

Kalkulator Kepentingan Ujian A/B

Masukkan pelawat dan penukaran untuk setiap varian untuk memeriksa sama ada perbezaan adalah nyata atau hanya hingar.

Kawalan (A)
Variasi (B)

Hasil

Signifikan Secara Statistik

Perbezaan itu tidak mungkin disebabkan oleh kebetulan pada tahap keyakinan pilihan anda.

Nilai-p
0.0007

Chance this gap is just luck โ€” lower is stronger.

Skor-z
3.381

How far apart the two rates are, in standard errors.

Lif relatif
+50.0%
Kadar kawalan
10.00%
Kadar variasi
15.00%
Perbezaan mutlak
+5.00 pp
Selang keyakinan (perbezaan) ยท 95%
2.11% to 7.89%

The likely range for the true difference.

Kadar penukaran mengikut varian
Kadar penukaran mengikut varian. Grouped bar chart with 1 series: Kadar penukaran.0%5%10%15%Kadar penukaranKawalan (A)Variasi (B)10%15%
Kalkulator Pemuatan...
๐Ÿ“š

Dokumentasi

Ujian A/B dalam satu minit

Anda mengubah butang, tajuk, atau aliran pembayaran. Versi A adalah yang lama, versi B adalah yang baru. B kelihatan lebih baik โ€” ia menukar 15% pelawat berbanding 10% untuk A. Tetapi bolehkah jurang itu hanya keberuntungan, cara yang sama dengan membalik syiling sepuluh kali boleh memberikan tujuh kepala?

Kalkulator ini menjawab tepat itu. Anda memasukkan berapa ramai orang yang melihat setiap versi dan berapa yang ditukar, dan ia memberitahu anda kebarangkalian bahawa perbezaan yang anda ukur adalah nyata daripada hingar rawak. Jika kebarangkalian itu cukup tinggi, anda mempunyai pemenang. Jika tidak, anda terus menjalankan ujian.

Nombor yang perlu diperhatikan adalah nilai-p: peluang melihat jurang sekurang-kurangnya sebesar ini jika kedua-dua versi sebenarnya sama. Nilai-p yang kecil (misalnya, di bawah 0.05) bermaksud "ini jarang berlaku kebetulan, jadi perbezaan mungkin nyata."

Cara menggunakannya

  1. Pelawat โ€” berapa ramai orang unik yang ditunjukkan setiap versi.
  2. Penukaran โ€” berapa ramai daripada mereka melakukan perkara yang anda ambil berat (membeli, mendaftar, mengklik).
  3. Tahap keyakinan โ€” seberapa yakin anda ingin menjadi sebelum memanggil pemenang. 95% adalah standard industri.
  4. Hipotesis โ€” dua hala bertanya "adakah B berbeza daripada A?" (lebih selamat, lalai); satu hala hanya bertanya "adakah B lebih baik daripada A?" (lebih sensitif, tetapi anda mesti memutuskan arah sebelum menjalankan ujian).

Hasil dikemas kini secara langsung dan input disimpan dalam URL halaman, jadi anda boleh menanda isyarat atau berkongsi hasil. Tetapkan semula mengosongkan borang; Muat data sampel mengisi contoh yang dilakukan.

Contoh yang dilakukan

PelawatPenukaranKadar
A (kawalan)1,00010010.0%
B (variasi)1,00015015.0%

Itu adalah lif mutlak 5 mata peratusan dan lif relatif +50%. Kalkulator mengembalikan nilai-p kira-kira 0.0007 โ€” di bawah 0.05 โ€” jadi pada keyakinan 95% hasilnya signifikan secara statistik. Secara kasar, jika kedua-dua versi benar-benar sama, anda akan melihat jurang sebesar ini kurang daripada sekali dalam seribu ujian.

Matematik (ujian z dua perkadaran)

Di bawah penutup ini adalah ujian z dua perkadaran standard, ujian yang sama diajarkan dalam statistik pengenalan dan digunakan oleh alat A/B arus perdana.

  1. Kadar penukaran setiap kumpulan:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    di mana xx adalah penukaran dan nn adalah pelawat.

  2. Kadar terkumpul, dengan menganggap (untuk hipotesis nol) kedua-dua kumpulan berkongsi satu kadar sebenar:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Ralat standard perbezaan:

    SE=p^โ€‰(1โˆ’p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Skor-z โ€” berapa banyak ralat standard selain dua kadar:

    z=p2โˆ’p1SEz = \dfrac{p_2 - p_1}{SE}

  5. Nilai-p datang daripada taburan normal standard ฮฆ\Phi. Dua hala: p=2(1โˆ’ฮฆ(โˆฃzโˆฃ))p = 2\left(1 - \Phi(|z|)\right). Satu hala: p=1โˆ’ฮฆ(z)p = 1 - \Phi(z).

  6. Signifikan apabila p<ฮฑp < \alpha, di mana ฮฑ=1โˆ’keyakinan\alpha = 1 - \text{keyakinan} (jadi 0.05 pada 95%).

Kalkulator juga melaporkan selang keyakinan untuk perbezaan, dikira dengan ralat standard yang tidak terkumpul p1(1โˆ’p1)n1+p2(1โˆ’p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: julat yang masuk akal untuk jurang sebenar. Jika selang itu mengecualikan 0, hasilnya signifikan.

0 -1.96 +1.96 tiada perbezaan

Pada keyakinan 95%, z di luar ยฑ1.96 (ekor berlorek, 5% daripada kawasan) dikira sebagai signifikan.

Membaca hasilnya dengan jujur

  • Kepentingan statistik bukan kepentingan perniagaan. Lif 0.1% boleh menjadi nyata secara statistik namun tidak bernilai dihantar.
  • Jangan mengintip dan berhenti awal. Memeriksa nilai-p setiap hari dan menghentikan saat ia turun di bawah 0.05 meningkatkan kadar positif palsu anda. Tentukan saiz sampel di hadapan dan biarkan ujian selesai.
  • Perhatikan peraturan jempol saiz sampel. Anggaran normal adalah dipercayai apabila setiap kumpulan mempunyai sekurang-kurangnya ~10 penukaran dan ~10 bukan penukaran. Dengan nombor-nombor kecil, anggap hasilnya hanya berarah.
  • Keyakinan โ‰  kebarangkalian B lebih baik. Tahap keyakinan 95% bermaksud prosedur salah paling 5% daripada masa dalam jangka panjang โ€” ia adalah pernyataan frequentist, bukan "peluang 95% B menang."
  • Satu ujian, satu metrik. Menguji banyak metrik atau varian serentak mengalikan peluang kebetulan; betulkan untuk itu (cth Bonferroni) atau daftar awal metrik tunggal yang menentukan ujian.

Kira sendiri

Setiap cebisan mengira nilai-p dua hala untuk contoh yang dilakukan di atas.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

Soalan Lazim

Apakah saiz sampel yang saya perlukan? Cukup sehinggakan lif bermakna boleh dikesan. Sebagai lantai, sasarkan sekurang-kurangnya beberapa ratus penukaran per varian; gunakan kalkulator saiz sampel berdedikasi dengan kadar asas anda dan lif terkecil bernilai mengesan.

Dua hala atau satu hala? Gunakan dua hala melainkan anda mempunyai sebab yang kukuh dan pra-komitmen untuk hanya peduli tentang peningkatan. Satu hala menggandakan sensitiviti anda tetapi melarang bertindak balas kepada B menjadi lebih teruk.

Mengapa kalkulator menunjukkan selang keyakinan? Ia menunjukkan julat yang boleh diterima bagi perbezaan sebenar, bukan hanya keputusan ya/tidak. Selang lebar yang meletak 0 bermaksud "belum cukup data lagi."

Adakah ini Bayesian? Tidak โ€” ia adalah ujian z frequentist, kaedah yang paling banyak diajarkan dan digunakan. Alat A/B Bayesian melaporkan "kebarangkalian B mengalahkan A" bukan nilai-p; kedua-duanya sah, mereka menjawab soalan yang sedikit berbeza.

Sumber