Preskoči na vsebino

Kalkulator A/B test statistične značilnosti

Preverite, ali je rezultat vašega A/B testa statistično značilen. Vnesite obiskovalce in konverzije, da dobite p-vrednost, z-rezultat, interval zaupanja in relativno dvigo.

Kalkulator A/B test statistične značilnosti

Vnesite obiskovalce in konverzije za vsako različico, da preverite, ali je razlika resnična ali le šum.

Nadzor (A)
Različica (B)

Rezultati

Statistično značilno

Razlika je pri vašem izbiranem nivoju zaupanja malo verjetna, da je naključna.

P-vrednost
0.0007

Chance this gap is just luck — lower is stronger.

Z-rezultat
3.381

How far apart the two rates are, in standard errors.

Relativna dviga
+50.0%
Stopnja nadzora
10.00%
Stopnja različice
15.00%
Absolutna razlika
+5.00 pp
Interval zaupanja (razlika) · 95%
2.11% to 7.89%

The likely range for the true difference.

Stopnja konverzije po različici
Stopnja konverzije po različici. Grouped bar chart with 1 series: Stopnja konverzije.0%5%10%15%Stopnja konverzijeNadzor (A)Različica (B)10%15%
Kalkulator nalaganja...
📚

Dokumentacija

A/B testiranje v eni minuti

Spremenili ste gumb, naslov ali tok za plačilo. Različica A je stara, različica B je nova. B izgleda bolje — konvertirala je 15 % obiskovalcev proti 10 % za A. Vendar bi ta razlika lahko bila le sreča, enako kot lahko metanje kovanca desetkrat da sedem repov?

Ta kalkulator odgovori točno na to. Vnesete, koliko ljudi je videlo vsako različico in koliko jih je konvertiralo, in vam pove verjetnost, da je razlika, ki ste jo izmerili, resnična namesto naključnega šuma. Če je ta verjetnost dovolj visoka, imate zmagovalca. Če ne, nadaljujete s testom.

Edino število, ki ga morate spremljati, je p-vrednost: verjetnost, da vidite razliko vsaj tako veliko če bi bili pravzaprav obe različici enaki. Majhna p-vrednost (npr. pod 0,05) pomeni »to bi se redko zgodilo po sreči, zato je razlika verjetno resnična«.

Kako ga uporabljati

  1. Obiskovalci — koliko edinstvenega ljudi je videlo vsako različico.
  2. Konverzije — koliko jih je naredilo stvar, ki te zanima (kupilo, se prijavilo, kliknilo).
  3. Nivo zaupanja — kako prepričan se želiš biti, preden deklariraš zmagovalca. 95 % je industrijski standard.
  4. Hipotezadvostransko sprašuje »je B drugačna od A?« (varnejše, privzeto); enostransko sprašuje samo »je B boljša od A?« (bolj občutljivo, vendar se moraš odločiti za smer pred izvedbo testa).

Rezultat se posodablja v živo in vhodi se shranjujejo v URL strani, zato lahko rezultat označite z zaznamkom ali ga delite. Ponastavka počisti obrazec; Naloži vzorčne podatke izpolni primer.

Delujoči primer

ObiskovalciKonverzijeStopnja
A (nadzor)1.00010010,0 %
B (različica)1.00015015,0 %

To je dvotočkovna absolutna dviga in +50 % relativna dviga. Kalkulator vrne p-vrednost približno 0,0007 — pod 0,05 — zato je rezultat pri 95-odstotni zaupanju statistično značilen. Grobo rečeno, če bi bili obe različici resnično enaki, bi videli tako veliko razliko manj kot enkrat v tisoč testih.

Matematika (dvoproporcijski z-test)

Prikrito je to standardni dvoproporcijski z-test, isti test, ki se poučuje v uvodnih statistikah in ga uporabljajo mainstream A/B orodja.

  1. Konverzijsko stopnjo vsake skupine:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    kjer je xx konverzije in nn obiskovalci.

  2. Kombinirana stopnja, ob predpostavki (za ničelno hipotezo), da obe skupini delita eno resnično stopnjo:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Standardna napaka razlike:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Z-rezultat — koliko standardnih napak narazen sta obe stopnji:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. P-vrednost prihaja iz standardne normalne porazdelitve Φ\Phi. Dvostransko: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Enostransko: p=1Φ(z)p = 1 - \Phi(z).

  6. Značilna ko je p<αp < \alpha, kjer je α=1zaupanje\alpha = 1 - \text{zaupanje} (torej 0,05 pri 95 %).

Kalkulator tudi poroča interval zaupanja za razliko, izračunan s nezdruženo standardno napako p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: smiselni razpon za pravo vrzel. Če ta interval izključuje 0, je rezultat značilen.

0 -1.96 +1.96 no difference

Pri 95-odstotni zaupanju se z preko ±1,96 (senčeni repi, 5 % površine) šteje za značilen.

Iskreno preberite rezultat

  • Statistična značilnost ni poslovna značilnost. Dviga 0,1 % je lahko statistično realna, vendar ne vredno pošiljanja.
  • Ne vohunite in se ne ustavljajte zgodaj. Preverjanje p-vrednosti vsak dan in ustavljanje v trenutku, ko pade pod 0,05, nadufla vašo stopnjo lažno pozitivnih. Vnaprej odločite velikost vzorca in pustite, da se test zaključi.
  • Upoštevajte pravilo palca za velikost vzorca. Normalna aproximacija je zanesljiva, ko ima vsaka skupina najmanj ~10 konverzij in ~10 ne-konverzij. S tiny številkami obravnavajte rezultat samo kot smer.
  • Zaupanje ≠ verjetnost, da je B boljša. Nivo zaupanja 95 % pomeni, da je postopek v dolgoročnem teku napačen največ 5 % časa — to je frekventistična izjava, ne »95 % verjetnost, da B zmaguje«.
  • En test, ena metrika. Testiranje številnih metrik ali različic hkrati pomnoži možnost naključja; popravite to (npr. Bonferroni) ali vnaprej registrirajte posamezno metriko, ki odloči test.

Izračunaj sam

Vsak fragment izračuna dvostransko p-vrednost za delujoči primer zgoraj.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

Pogosta vprašanja

Kolikšna velikost vzorca potrebujem? Dovolj, da bi bila smiselna dviga zaznana. Kot nižja meja ciljajte vsaj nekaj sto konverzij na varianto; uporabite dedicirani kalkulator za velikost vzorca z vašo bazično stopnjo in najmanjšo dvigo vredne zaznave.

Dvostransko ali enostransko? Uporabite dvostransko, razen če imate trdno, vnaprej zavezano razlogo, da vas zanima samo izboljšanje. Enostransko podvoji vašo občutljivost, vendar prepoveduje reagiranje na B, ki je slabši.

Zakaj kalkulator prikazuje interval zaupanja? Prikazuje smiselni razpon prave razlike, ne samo da/ne verdikt. Širok interval, ki prečka 0, pomeni »še ni dovolj podatkov«.

Je to Bayesovska? Ne — to je frekventistični z-test, najbolj poučena in uporabljena metoda. Bayesovska A/B orodja sporočajo »verjetnost B prekaša A« namesto p-vrednosti; obe sta veljavni, odgovarjata malo drugačna vprašanja.

Viri