Preskoči na sadržaj

Kalkulator statističke značajnosti A/B testa

Provjerite je li rezultat vašeg A/B testa statistički značajan. Unesite posjetitelje i konverzije kako biste dobili p-vrijednost, z-rezultat, interval pouzdanosti i relativni porast.

Kalkulator statističke značajnosti A/B testa

Unesite posjetitelje i konverzije za svaku varijantu kako biste provjerili je li razlika stvarna ili samo buka.

Kontrolna grupa (A)
Varijacija (B)

Rezultati

Statistički značajno

Razlika je malo vjerovatno da je zbog slučaja na vašoj odabranoj razini pouzdanosti.

P-vrijednost
0.0007

Chance this gap is just luck — lower is stronger.

Z-rezultat
3.381

How far apart the two rates are, in standard errors.

Relativni porast
+50.0%
Stopa kontrole
10.00%
Stopa varijacije
15.00%
Apsolutna razlika
+5.00 pp
Interval pouzdanosti (razlika) · 95%
2.11% to 7.89%

The likely range for the true difference.

Stopa konverzije prema varijanti
Stopa konverzije prema varijanti. Grouped bar chart with 1 series: Stopa konverzije.0%5%10%15%Stopa konverzijeKontrolna grupa (A)Varijacija (B)10%15%
Kalkulator učitavanja...
📚

Dokumentacija

A/B testiranje u jednoj minuti

Promijenili ste gumb, naslov ili tok plaćanja. Verzija A je stara, verzija B je nova. B izgleda bolje — konvertirala je 15% posjetitelja nasuprot 10% za A. Ali bi taj razmak mogao biti samo sreća, kao što bacanje novčića deset puta može dati sedam glava?

Ovaj kalkulator odgovara upravo na to pitanje. Unosite koliko je ljudi vidjelo svaku verziju i koliko je konvertiralo, te vam pokazuje vjerojatnost da je razlika koju ste izmjerili stvarna umjesto slučajnog šuma. Ako je ta vjerojatnost dovoljno visoka, imate pobjednika. Ako nije, nastavite test.

Broj na koji trebate paziti je p-vrijednost: vjerojatnost da vidite razmak najmanje ovakav ako su dvije verzije zapravo identične. Mala p-vrijednost (recimo, ispod 0,05) znači "ovo bi se rijetko dogodilo slučajno, tako da je razlika vjerojatno stvarna."

Kako ga koristiti

  1. Posjetitelji — koliko jedinstvenih ljudi je vidjelo svaku verziju.
  2. Konverzije — koliko ih je učinilo ono što vas zanima (kupilo, prijavilo se, kliknulo).
  3. Razina pouzdanosti — koliko ste sigurni prije nego što proglasите pobjednika. 95% je industrijski standard.
  4. Hipotezadvostrana pita "je li B drugačit od A?" (sigurnije, zadana vrijednost); jednostrana pita samo "je li B bolje od A?" (osjetljivije, ali morate odlučiti smjer prije pokretanja testa).

Rezultat se ažurira u stvarnom vremenu i unosi se spremaju u URL stranice, tako da možete oblikovati ili podijeliti rezultat. Resetiraj briše obrazac; Učitaj primjer podataka popunjava radni primjer.

Radni primjer

PosjetiteljiKonverzijeStopa
A (kontrola)1.00010010,0%
B (varijacija)1.00015015,0%

To je porast od 5 postotnih poena apsolutan i +50% relativni porast. Kalkulator vraća p-vrijednost od oko 0,0007 — ispod 0,05 — tako da je rezultat na 95% pouzdanosti statistički značajan. Grubo, ako su dvije verzije bile zaista identične, vidjeli biste razmak ovakav manje od jednom u tisuću testova.

Matematika (test dva proporciona z)

Ispod haube ovo je standardni test dva proporciona z, isti test koji se podučava u uvodnoj statistici i koristi ga glavne A/B alate.

  1. Stopa konverzije svake grupe:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    gdje je xx konverzije i nn posjetitelji.

  2. Stavljena stopa, pretpostavljajući (za nultu hipotezu) obje grupe dijele jednu stvarnu stopu:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Standardna greška razlike:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Z-rezultat — koliko standardnih grešaka razjedinjenih dvije stope:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. P-vrijednost dolazi iz standardne normalne distribucije Φ\Phi. Dvostrana: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Jednostrana: p=1Φ(z)p = 1 - \Phi(z).

  6. Značajna kada je p<αp < \alpha, gdje je α=1pouzdanost\alpha = 1 - \text{pouzdanost} (dakle 0,05 na 95%).

Kalkulator također prikazuje interval pouzdanosti za razliku, izračunat s nestavljenom standardnom greškom p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: vjerojatni raspon za stvarnu jaz. Ako taj interval isključuje 0, rezultat je značajan.

0 -1.96 +1.96 no difference

Na 95% pouzdanosti, z izvan ±1,96 (osjenčane repove, 5% područja) računa se kao značajno.

Čitanje rezultata iskreno

  • Statistička značajnost nije poslovna značajnost. Porast od 0,1% može biti statistički stvaran, ali ne vrijedi otpremanja.
  • Ne pogledajte i ne staneteearly. Provjera p-vrijednosti svaki dan i zaustavljanje čim padne ispod 0,05 povećava vašu stopu lažno-pozitivnih. Odlučite veličinu uzorka unaprijed i pustite test da završi.
  • Pazite na pravilo veličine uzorka. Normalna aproksimacija je pouzdana kada svaka grupa ima najmanje ~10 konverzija i ~10 ne-konverzija. S malim brojevima, rezultat tretirati samo kao smjerni.
  • Pouzdanost ≠ vjerojatnost da je B bolje. Razina pouzdanosti od 95% znači da je postupak kriv maksimalno 5% vremena u dugom roku — to je izjava čestotnjaka, ne "95% šansi da B pobijedi."
  • Jedan test, jedna metrika. Testiranje mnogih metrika ili varijanti odjednom množi šansu za fluke; ispraviti za to (npr. Bonferroni) ili preunaprijed registrirati jednu metriku koja odlučuje test.

Izračunajte ga sami

Svaki isječak izračunava p-vrijednost na dvije strane za radni primjer gore.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

FAQ

Koju veličinu uzorka trebam? Dovoljno da bi se detektirala smislena porast. Kao minimum, teži najmanje nekoliko stotina konverzija po varijanti; koristiti poseban kalkulator veličine uzorka sa vašom baznom stopom i najmanjom detektabilnom porastom.

Dvostrana ili jednostrana? Koristite dvostrana osim ako imate čvrst, unaprijed predan razlog da brinete samo o poboljšanju. Jednostrana dvostruko povećava vašu osjetljivost, ali zabranjuje reagiranje na to što B bude gore.

Zašto kalkulator prikazuje interval pouzdanosti? Pokazuje vjerojatni raspon stvarne razlike, ne samo da/ne verdikt. Široki interval koji prelazi 0 znači "nedovoljno podataka još."

Je li ovo Bayesovo? Ne — to je čestotnjakov z-test, najčešće podučavana i korištena metoda. Bayesovi A/B alati izvještavaju "vjerojatnost da B porazi A" umjesto p-vrijednosti; oboje su valjani, odgovaraju malo drugačitim pitanjima.

Izvori