Lewati ke konten

Kalkulator Signifikansi Uji A/B

Periksa apakah hasil uji A/B Anda signifikan secara statistik. Masukkan pengunjung dan konversi untuk mendapatkan p-value, skor-z, interval kepercayaan, dan kenaikan relatif.

Kalkulator Signifikansi Uji A/B

Masukkan pengunjung dan konversi untuk setiap varian untuk memeriksa apakah perbedaannya nyata atau hanya kebisingan.

Kontrol (A)
Variasi (B)

Hasil

Signifikan Secara Statistik

Perbedaannya tidak mungkin karena kebetulan pada tingkat kepercayaan pilihan Anda.

P-value
0.0007

Chance this gap is just luck โ€” lower is stronger.

Skor Z
3.381

How far apart the two rates are, in standard errors.

Kenaikan relatif
+50.0%
Tingkat kontrol
10.00%
Tingkat variasi
15.00%
Perbedaan absolut
+5.00 pp
Interval kepercayaan (perbedaan) ยท 95%
2.11% to 7.89%

The likely range for the true difference.

Tingkat konversi berdasarkan varian
Tingkat konversi berdasarkan varian. Grouped bar chart with 1 series: Tingkat konversi.0%5%10%15%Tingkat konversiKontrol (A)Variasi (B)10%15%
Kalkulator pemuatan...
๐Ÿ“š

Dokumentasi

Pengujian A/B dalam satu menit

Anda mengubah tombol, judul, atau alur checkout. Versi A adalah yang lama, versi B adalah yang baru. B terlihat lebih baik โ€” dikonversi 15% pengunjung versus 10% untuk A. Tetapi apakah selisih itu hanya keberuntungan, seperti melempar koin sepuluh kali bisa menghasilkan tujuh kepala?

Kalkulator ini menjawab tepatnya itu. Anda memasukkan berapa banyak orang melihat setiap versi dan berapa banyak yang dikonversi, dan ini memberi tahu Anda probabilitas bahwa perbedaan yang Anda ukur adalah nyata bukan kebisingan acak. Jika probabilitas itu cukup tinggi, Anda memiliki pemenang. Jika tidak, Anda tetap menjalankan tes.

Satu-satunya angka yang perlu diperhatikan adalah p-value: kemungkinan melihat selisih setidaknya sebesar ini jika kedua versi benar-benar identik. P-value kecil (katakanlah, di bawah 0,05) berarti "ini jarang terjadi karena keberuntungan, jadi perbedaannya mungkin nyata."

Cara menggunakannya

  1. Pengunjung โ€” berapa banyak orang unik yang ditampilkan ke setiap versi.
  2. Konversi โ€” berapa banyak dari mereka yang melakukan hal yang Anda pedulikan (membeli, mendaftar, mengklik).
  3. Tingkat kepercayaan โ€” seberapa yakin Anda ingin sebelum memanggil pemenang. 95% adalah standar industri.
  4. Hipotesis โ€” dua sisi menanyakan "apakah B berbeda dari A?" (lebih aman, standar); satu sisi hanya menanyakan "apakah B lebih baik dari A?" (lebih sensitif, tetapi Anda harus memutuskan arahnya sebelum menjalankan tes).

Hasilnya diperbarui secara langsung dan input disimpan di URL halaman, sehingga Anda dapat menandai atau membagikan hasil. Reset menghapus formulir; Muat data sampel mengisinya dengan contoh yang sudah dikerjakan.

Contoh yang sudah dikerjakan

PengunjungKonversiTarif
A (kontrol)1.00010010,0%
B (variasi)1.00015015,0%

Itu adalah kenaikan absolut 5 poin persentase dan kenaikan relatif +50%. Kalkulator mengembalikan p-value sekitar 0,0007 โ€” di bawah 0,05 โ€” jadi dengan kepercayaan 95% hasilnya signifikan secara statistik. Kira-kira, jika kedua versi benar-benar identik, Anda akan melihat selisih sekecil ini kurang dari sekali dalam seribu tes.

Matematika (uji z dua proporsi)

Di bawah kap ini adalah uji z dua proporsi standar, tes yang sama yang diajarkan dalam statistik pengantar dan digunakan oleh alat A/B arus utama.

  1. Tingkat konversi setiap kelompok:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    di mana xx adalah konversi dan nn adalah pengunjung.

  2. Tingkat gabungan, dengan asumsi (untuk hipotesis nol) kedua kelompok berbagi satu tingkat yang benar:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Kesalahan standar perbedaannya:

    SE=p^โ€‰(1โˆ’p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Skor z โ€” berapa banyak kesalahan standar terpisah dua tarif:

    z=p2โˆ’p1SEz = \dfrac{p_2 - p_1}{SE}

  5. p-value berasal dari distribusi normal standar ฮฆ\Phi. Dua sisi: p=2(1โˆ’ฮฆ(โˆฃzโˆฃ))p = 2\left(1 - \Phi(|z|)\right). Satu sisi: p=1โˆ’ฮฆ(z)p = 1 - \Phi(z).

  6. Signifikan ketika p<ฮฑp < \alpha, di mana ฮฑ=1โˆ’kepercayaan\alpha = 1 - \text{kepercayaan} (jadi 0,05 pada 95%).

Kalkulator juga melaporkan interval kepercayaan untuk perbedaannya, dihitung dengan kesalahan standar tidak gabungan p1(1โˆ’p1)n1+p2(1โˆ’p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: jangkauan yang masuk akal untuk kesenjangan sejati. Jika interval itu mengecualikan 0, hasilnya signifikan.

0 -1.96 +1.96 no difference

Pada 95% kepercayaan, z di luar ยฑ1,96 (ekor yang diarsir, 5% dari area) dihitung sebagai signifikan.

Membaca hasilnya dengan jujur

  • Signifikansi statistik bukanlah signifikansi bisnis. Kenaikan 0,1% bisa benar secara statistik namun tidak layak dikirim.
  • Jangan mengintip dan berhenti lebih awal. Memeriksa p-value setiap hari dan menghentikan tes saat jatuh di bawah 0,05 meningkatkan tingkat positif palsu Anda. Tetapkan ukuran sampel di depan dan biarkan tes selesai.
  • Tonton aturan praktis ukuran sampel. Perkiraan normal dapat diandalkan ketika setiap kelompok memiliki setidaknya ~10 konversi dan ~10 non-konversi. Dengan angka kecil, anggap hasilnya hanya direktif.
  • Kepercayaan โ‰  probabilitas B lebih baik. Tingkat kepercayaan 95% berarti prosedur salah paling banyak 5% dari waktu dalam jangka panjang โ€” itu adalah pernyataan frequentist, bukan "95% kesempatan B menang."
  • Satu tes, satu metrik. Menguji banyak metrik atau varian sekaligus menggandakan kesempatan kebetulan; perbaiki (misalnya Bonferroni) atau daftarkan sebelumnya metrik tunggal yang memutuskan tes.

Hitungnya sendiri

Setiap cuplikan menghitung p-value dua sisi untuk contoh yang sudah dikerjakan di atas.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

Pertanyaan yang Sering Diajukan

Ukuran sampel apa yang saya butuhkan? Cukup sehingga kenaikan bermakna dapat dideteksi. Sebagai dasar, targetkan setidaknya beberapa ratus konversi per varian; gunakan kalkulator ukuran sampel khusus dengan tingkat dasar Anda dan kenaikan terkecil yang layak dideteksi.

Dua sisi atau satu sisi? Gunakan dua sisi kecuali Anda memiliki alasan yang kuat dan berkomitmen sebelumnya untuk hanya peduli dengan perbaikan. Satu sisi menggandakan sensitivitas Anda tetapi melarang bereaksi terhadap B yang lebih buruk.

Mengapa kalkulator menunjukkan interval kepercayaan? Ini menunjukkan jangkauan yang masuk akal dari perbedaan sejati, bukan hanya verdikat ya/tidak. Interval lebar yang melintasi 0 berarti "belum cukup data."

Apakah ini Bayesian? Tidak โ€” itu adalah uji z frequentist, metode yang paling banyak diajarkan dan digunakan. Alat A/B Bayesian melaporkan "probabilitas B mengalahkan A" bukan p-value; keduanya valid, mereka menjawab pertanyaan yang sedikit berbeda.

Sumber