Preskočiť na obsah

Kalkulačka štatistickej významnosti A/B testov

Skontrolujte, či je váš výsledok A/B testu štatisticky významný. Zadajte návštevníkov a konverzie, aby ste dostali p-hodnotu, z-skóre, interval spoľahlivosti a relatívne zvýšenie.

Kalkulačka štatistickej významnosti A/B testov

Zadajte návštevníkov a konverzie pre každý variant a skontrolujte, či je rozdiel skutočný alebo len šum.

Kontrola (A)
Variácia (B)

Výsledky

Štatisticky významné

Rozdiel je nepravdepodobný kvôli náhode pri zvolenej úrovni spoľahlivosti.

P-hodnota
0.0007

Chance this gap is just luck — lower is stronger.

Z-skóre
3.381

How far apart the two rates are, in standard errors.

Relatívne zvýšenie
+50.0%
Frekvencia kontroly
10.00%
Frekvencia variácie
15.00%
Absolútny rozdiel
+5.00 pp
Interval spoľahlivosti (rozdiel) · 95%
2.11% to 7.89%

The likely range for the true difference.

Frekvencia konverzie podľa variantu
Frekvencia konverzie podľa variantu. Grouped bar chart with 1 series: Frekvencia konverzie.0%5%10%15%Frekvencia konverzieKontrola (A)Variácia (B)10%15%
Kalkulačka načítavania...
📚

Dokumentácia

A/B testovanie za jednu minútu

Zmenili ste tlačidlo, nadpis alebo tok platby. Verzia A je tá stará, verzia B je tá nová. B vyzerá lepšie – konvertovala 15% návštevníkov oproti 10% pre A. Ale mohla by tá prehra byť len šťastím, rovnako ako keď je možné pri desiatich hodoch mincou získať sedem lícov?

Táto kalkulačka odpovie presne na to. Zadáte, koľko ľudí videlo každú verziu a koľko z nich konvertovalo, a ona vám povie pravdepodobnosť, že rozdiel, ktorý ste nameráli, je skutočný a nie len náhodný šum. Ak je táto pravdepodobnosť dostatočne vysoká, máte víťaza. Ak nie, pokračujete v teste.

Číslo, na ktoré treba dávať pozor, je p-hodnota: šanca vidieť rozdiel aspoň takto veľký ak by boli obe verzie vlastne identické. Malá p-hodnota (napríklad pod 0,05) znamená "toto by sa vzácne stalo šťastím, takže rozdiel je pravdepodobne skutočný."

Ako to používať

  1. Návštevníci – koľko jedinečných ľudí bolo priradených ku každej verzii.
  2. Konverzie – koľko z nich urobilo vec, na ktorej vám záleží (kúpilo, podpísalo sa, kliklo).
  3. Úroveň spoľahlivosti – ako si chcete byť istí predtým, ako deklarujete víťaza. 95% je priemyselný štandard.
  4. Hypotézadvojstranný pýta „je B iný ako A?" (bezpečnejší, predvolený); jednostranný pýta iba „je B lepší ako A?" (citlivejší, ale musíte sa rozhodnúť smerom predtým, ako spustíte test).

Výsledok sa aktualizuje živý a vstupy sú uložené v URL stránky, takže môžete výsledok zabudovať alebo zdieľať. Obnoviť vymaže formulár; Načítať vzorové údaje vyplní spracovaný príklad.

Spracovaný príklad

NávštevníciKonverzieFrekvencia
A (kontrola)1 00010010,0%
B (variácia)1 00015015,0%

To je zvýšenie o 5 percentných bodov absolútne a +50% relatívne zvýšenie. Kalkulačka vráti p-hodnotu približne 0,0007 – pod 0,05 – takže pri 95% spoľahlivosti je výsledok štatisticky významný. Zhruba povedané, ak by boli obe verzie naozaj identické, videli by ste rozdiel takej veľkosti menej ako raz za tisíc testov.

Matematika (test dvoch proporcií z)

Pod kapotou je to štandardný test dvoch proporcií z, rovnaký test vyučovaný v úvodných kurzoch štatistiky a používaný bežnými nástrojmi A/B.

  1. Frekvencia konverzie každej skupiny:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    kde xx je konverzie a nn je návštevníci.

  2. Zjednotená frekvencia, za predpokladu (pre nulovú hypotézu), že obe skupiny zdieľajú jednu skutočnú frekvenciu:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Štandardná chyba rozdielu:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Z-skóre – koľko štandardných chýb od seba sú dve frekvencie:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. P-hodnota pochádza zo štandardného normálneho rozdelenia Φ\Phi. Dvojstranný: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Jednostranný: p=1Φ(z)p = 1 - \Phi(z).

  6. Významný keď p<αp < \alpha, kde α=1confidence\alpha = 1 - \text{confidence} (takže 0,05 pri 95%).

Kalkulačka tiež hlási interval spoľahlivosti pre rozdiel, vypočítaný s nezjednotenú štandardnú chybou p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: rozumný rozsah pre skutočnú medzeru. Ak ten interval vylučuje 0, výsledok je významný.

0 -1.96 +1.96 no difference

Pri 95% spoľahlivosti, z bez ±1,96 (tieňované chvosty, 5% plochy) sa počíta ako významný.

Čítanie výsledku čestne

  • Štatistická významnosť nie je obchodná významnosť. Zvýšenie o 0,1% môže byť štatisticky skutočné, ale nemusí stáť za to ho zaviesť.
  • Nepozerajte a nezastavujte sa skoro. Kontrola p-hodnoty každý deň a zastavenie v momente, keď klesne pod 0,05, zvyšuje vašu mieru falošne pozitívnych. Rozhodnite sa na veľkosť vzorky vopred a nechajte test skončiť.
  • Sledujte pravidlo palca pre veľkosť vzorky. Normálna aproximácia je spoľahlivá, keď má každá skupiny aspoň ~10 konverzií a ~10 nekonverzií. S malými číslami konečný výsledok považujte za orientačný iba.
  • Spoľahlivosť ≠ pravdepodobnosť B je lepší. Úroveň spoľahlivosti 95% znamená postup je chybný maximálne 5% času v dlhodobom horizonte – je to frekventistické tvrdenie, nie "95% šanca na výhru B."
  • Jeden test, jedna metrika. Testovanie mnohých metrík alebo variantov naraz zvyšuje šancu na náhodu; korigovať to (napr. Bonferroni) alebo predregistrujte jednu metriku, ktorá rozhoduje test.

Vypočítajte si to sami

Každý útržok počíta dvoustranný p-hodnotu pre spracovaný príklad vyššie.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

Časté otázky

Akú veľkosť vzorky potrebujem? Dosť, aby zmysluplné zvýšenie bolo detekovateľné. Ako minimálny cieľ, snažte sa aspoň pár stoviek konverzií na variant; použite špecializovanú kalkulačku veľkosti vzorky s vaším základnom a najmenším zvýšením, ktoré stojí za to zistiť.

Dvojstranný alebo jednostranný? Použite dvojstranný, pokiaľ nemáte pevný, vopred záväzný dôvod starostlivosti iba o zlepšenie. Jednostranný zdvojnásobuje vašu citlivosť, ale zakazuje reagovať na to, že B je horšie.

Prečo kalkulačka ukazuje interval spoľahlivosti? Ukazuje rozumný rozsah skutočného rozdielu, nie len áno/nie verdikt. Širší interval, ktorý prekročí 0, znamená "ešte nie je dosť údajov."

Je toto bayesovské? Nie – je to frekventistický z-test, najčastejšie vyučovaná a používaná metóda. Bayesovské nástroje A/B hlášajú "pravdepodobnosť B bije A" namiesto p-hodnoty; obidve sú platné, len odpovedajú trochu iným otázkam.

Zdroje