Preskočiť na obsah

Kalkulačka štatistickej významnosti A/B testov

Skontrolujte, či je váš výsledok A/B testu štatisticky významný. Zadajte návštevníkov a konverzie, aby ste dostali p-hodnotu, z-skóre, interval spoľahlivosti a relatívne zvýšenie.

Kalkulačka štatistickej významnosti A/B testov

Zadajte návštevníkov a konverzie pre každý variant a skontrolujte, či je rozdiel skutočný alebo len šum.

Kontrola (A)
Variácia (B)

Výsledky

Štatisticky významné

Rozdiel je nepravdepodobný kvôli náhode pri zvolenej úrovni spoľahlivosti.

P-hodnota
0.0007

Chance this gap is just luck — lower is stronger.

Z-skóre
3.381

How far apart the two rates are, in standard errors.

Relatívne zvýšenie
+50.0%
Frekvencia kontroly
10.00%
Frekvencia variácie
15.00%
Absolútny rozdiel
+5.00 pp
Interval spoľahlivosti (rozdiel) · 95%
2.11% to 7.89%

The likely range for the true difference.

Frekvencia konverzie podľa variantu
Frekvencia konverzie podľa variantu. Grouped bar chart with 1 series: Frekvencia konverzie.0%5%10%15%Frekvencia konverzieKontrola (A)Variácia (B)10%15%
Kalkulačka načítavania...
📚

Dokumentácia

Čo robí kalkulačka štatistickej významnosti A/B testu

Kalkulačka štatistickej významnosti A/B testu overuje, či je rozdiel medzi dvoma verziami niečoho — webovej stránky, e-mailu alebo tlačidla na dokončenie objednávky — skutočným efektom, alebo iba náhodou. Pre každú verziu použije počet návštevníkov a počet konverzií a vráti p-hodnotu, z-skóre a interval spoľahlivosti. Konverzia je akákoľvek akcia považovaná za úspech: nákup, registrácia alebo kliknutie.

Ako používať kalkulačku

Kalkulačka potrebuje štyri čísla.

  • Návštevníci (kontrolná skupina): koľko ľudí videlo verziu A, pôvodnú verziu.
  • Konverzie (kontrolná skupina): koľko z nich vykonalo konverziu.
  • Návštevníci (variant): koľko ľudí videlo verziu B, novú verziu.
  • Konverzie (variant): koľko z nich vykonalo konverziu.

Výsledok ovplyvňujú ešte dve nastavenia.

  • Úroveň spoľahlivosti určuje prísnosť testu. Bežná predvolená hodnota je 95 %. Vyššia úroveň, napríklad 99 %, vyžaduje silnejšie dôkazy, kým sa výsledok označí za významný.
  • Hypotéza určuje smer otázky. Obojstranný test sa pýta: „Líši sa B od A, a to ktorýmkoľvek smerom?“ Jednostranný test sa pýta iba: „Je B lepšia než A?“ Jednostranný test by sa mal zvoliť ešte pred získaním údajov a iba vtedy, keď by horší výsledok verzie B nezmenil žiadne rozhodnutie.

Výsledok sa aktualizuje pri zadávaní čísel. Vstupy sa ukladajú do webovej adresy stránky, takže výsledok možno uložiť medzi záložky alebo zdieľať ako odkaz.

Vzorec A/B testu (z-test dvoch podielov)

Kalkulačka používa z-test dvoch podielov, štandardnú metódu z úvodnej štatistiky na porovnávanie dvoch podielov.

Krok 1. Miera konverzie v každej skupine.

p1=x1n1,p2=x2n2p_1 = \frac{x_1}{n_1}, \qquad p_2 = \frac{x_2}{n_2}

Tu je xx počet konverzií a nn počet návštevníkov pre kontrolnú skupinu (1) a variant (2).

Krok 2. Spoločná miera konverzie. Tento krok predpokladá, že obe skupiny majú v rámci testu jednu spoločnú skutočnú mieru.

p^=x1+x2n1+n2\hat{p} = \frac{x_1 + x_2}{n_1 + n_2}

Krok 3. Štandardná chyba rozdielu, vypočítaná zo spoločnej miery.

SE=p^(1−p^)(1n1+1n2)SE = \sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}

Krok 4. Z-skóre, teda rozdiel medzi dvoma mierami vyjadrený v počte štandardných chýb.

z=p2−p1SEz = \frac{p_2 - p_1}{SE}

Krok 5. P-hodnota, získaná zo štandardného normálneho rozdelenia Φ\Phi. Pri obojstrannom teste: p=2(1−Φ(∣z∣))p = 2\left(1 - \Phi(|z|)\right). Pri jednostrannom teste: p=1−Φ(z)p = 1 - \Phi(z).

Krok 6. Záver. Výsledok sa považuje za štatisticky významný, keď je p-hodnota menšia než α\alpha, kde α=1−uˊrovenˇ spolˇahlivosti\alpha = 1 - \text{úroveň spoľahlivosti}. Pri 95 % spoľahlivosti platí α=0.05\alpha = 0.05.

Kalkulačka uvádza aj interval spoľahlivosti pre veľkosť rozdielu, p2−p1p_2 - p_1. Tento interval používa samostatnú štandardnú chybu, ktorá nepredpokladá, že obe skupiny majú rovnakú mieru:

SEunpooled=p1(1−p1)n1+p2(1−p2)n2SE_{unpooled} = \sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}}

Interval je (p2−p1)±zc×SEunpooled(p_2 - p_1) \pm z_c \times SE_{unpooled}, kde zcz_c je 1,6449 pri 90 % spoľahlivosti, 1,96 pri 95 % a 2,5758 pri 99 %. Ak interval neobsahuje nulu, rozdiel je pri danej úrovni spoľahlivosti významný.

Príklad výpočtu

NávštevníciKonverzieMiera
Kontrolná skupina (A)1 00010010,00 %
Variant (B)1 00015015,00 %

Spoločná miera je (100+150)/(1000+1000)=0.125(100+150)/(1000+1000) = 0.125 alebo 12,5 %. Spoločná štandardná chyba je približne 0,0148. Z-skóre je (0.15−0.10)/0.0148≈3.38(0.15 - 0.10) / 0.0148 \approx 3.38.

Pri obojstrannom teste je p-hodnota približne 0,00072. To je menej než bežná hranica 0,05, takže pri 95 % spoľahlivosti je rozdiel štatisticky významný. Ak by obe verzie mali v skutočnosti rovnakú úspešnosť, takýto veľký alebo väčší rozdiel by sa čisto náhodou objavil približne v 7 z každých 10 000 testov.

Absolútny rozdiel je 5,00 percentuálneho bodu. Relatívny nárast je 50 %, keďže miera verzie B je 1,5-násobkom miery verzie A. Interval spoľahlivosti 95 % pre skutočný rozdiel je približne od 2,11 % do 7,89 %.

Ako správne interpretovať výsledok

Štatisticky významný výsledok automaticky neznamená, že sa podľa neho oplatí konať. Malé, skutočné zlepšenie nemusí stáť za náklady na jeho zavedenie. Po vykonaní výpočtu je stále potrebné zohľadniť obchodné hľadisko.

Každodenná kontrola p-hodnoty a zastavenie testu hneď po prekročení hodnoty 0,05 zvyšujú riziko, že výsledok bude pozitívny, hoci v skutočnosti je falošný. Lepšie je vopred zvoliť veľkosť vzorky alebo dĺžku testu a pred vyhodnotením výsledku nechať test dokončiť.

Normálna aproximácia, o ktorú sa tento test opiera, funguje najlepšie, keď má každá skupina aspoň približne 10 konverzií a 10 nekonverzií. Pri menších počtoch treba výsledok považovať skôr za orientačný signál než za spoľahlivú odpoveď.

Úroveň spoľahlivosti 95 % neznamená, že pravdepodobnosť, že B je skutočne lepšia, je 95 %. Znamená to, že ak by sa rovnaký test opakoval mnohokrát, táto metóda by najviac v 5 % prípadov poskytla nesprávny významný výsledok. Ide o tvrdenie o metóde, nie o tomto konkrétnom výsledku.

Testovanie veľkého počtu metrík alebo variantov naraz zvyšuje pravdepodobnosť, že aspoň jedno porovnanie bude vyzerať významne iba vďaka náhode. Tomuto problému sa dá vyhnúť výberom jednej metriky ešte pred začiatkom testu.

Často kladené otázky

Akú veľkú vzorku potrebuje A/B test? Potrebný je taký počet návštevníkov, aby sa zmysluplné zlepšenie skutočne prejavilo ako štatisticky významné. Orientačným minimom je niekoľko stoviek konverzií na každú verziu. Špecializovaná kalkulačka veľkosti vzorky, ktorá používa základnú mieru a najmenšie zlepšenie, ktoré má zmysel odhaliť, poskytne pred začiatkom testu presnejší počet.

Má byť test jednostranný alebo obojstranný? Obojstranný test je bezpečnejšia predvolená možnosť, pretože môže označiť B za lepšiu aj horšiu než A. Jednostranný test je citlivejší na zlepšenie, ale nedokáže odhaliť horší výsledok, preto by sa mal použiť iba vtedy, keď by horší výsledok B nezmenil žiadne rozhodnutie.

Prečo kalkulačka uvádza interval spoľahlivosti? Interval spoľahlivosti ukazuje pravdepodobný rozsah skutočného rozdielu, nielen označenie významný alebo nevýznamný. Široký interval, ktorý zahŕňa nulu, zvyčajne znamená, že test potrebuje viac údajov.

Je táto kalkulačka bayesovská? Nie. Používa frekventistický z-test, metódu najčastejšie vyučovanú a používanú pri A/B testovaní. Bayesovský nástroj namiesto toho uvádza pravdepodobnosť, že B prekoná A. Obe metódy sú platné, odpovedajú však na trochu odlišné otázky.

Čo ak kalkulačka zobrazí chybu? Chyba sa zobrazí, ak je počet konverzií záporný, ak presahuje počet návštevníkov alebo ak je spoločná miera konverzie v oboch skupinách 0 % alebo 100 %, pretože vzorec z-testu v takom prípade nemôže deliť nulovou štandardnou chybou.

Zdroje