Přeskočit na obsah

Kalkulačka statistické významnosti A/B testu

Zkontrolujte, zda je výsledek vašeho A/B testu statisticky významný. Zadejte návštěvníky a konverze, abyste získali p-value, z-skóre, interval spolehlivosti a relativní nárůst.

Kalkulačka statistické významnosti A/B testu

Zadejte návštěvníky a konverze pro každou variantu, abyste zkontrolovali, zda je rozdíl skutečný nebo jen šum.

Kontrola (A)
Varianta (B)

Výsledky

Statisticky významné

Rozdíl je nepravděpodobný, že by byl způsoben náhodou ve vaší zvolené úrovni důvěry.

P-value
0.0007

Chance this gap is just luck — lower is stronger.

Z-skóre
3.381

How far apart the two rates are, in standard errors.

Relativní nárůst
+50.0%
Míra kontroly
10.00%
Míra variace
15.00%
Absolutní rozdíl
+5.00 pp
Interval spolehlivosti (rozdíl) · 95%
2.11% to 7.89%

The likely range for the true difference.

Konverzní sazba podle varianty
Konverzní sazba podle varianty. Grouped bar chart with 1 series: Konverzní sazba.0%5%10%15%Konverzní sazbaKontrola (A)Varianta (B)10%15%
Kalkulačka načítání...
📚

Dokumentace

A/B testování v jedné minutě

Změnili jste tlačítko, nadpis nebo checkout flow. Verze A je stará, verze B je nová. B vypadá lépe — konvertovala 15% návštěvníků oproti 10% pro A. Ale mohl by být ten rozdíl jen náhoda, stejně jako když si házíte mincí desetkrát a padne vám sedmkrát panna?

Tato kalkulačka odpovídá přesně na to. Zadáte, kolik lidí vidělo každou verzi a kolik jich konvertovalo, a ona vám řekne, jaká je pravděpodobnost, že rozdíl, který jste naměřili, je skutečný a ne náhodný šum. Pokud je tato pravděpodobnost dostatečně vysoká, máte vítěze. Pokud ne, necháte test běžet dál.

Jediné číslo, na které se musíte soustředit, je p-value: šance na rozdíl alespoň takto velký, pokud by byly obě verze vlastně identické. Malá p-value (řekněme níže 0,05) znamená "to by se náhodou zřídka stalo, takže rozdíl je pravděpodobně skutečný."

Jak to používat

  1. Návštěvníci — kolik jedinečných lidí vidělo každou verzi.
  2. Konverze — kolik z nich udělalo věc, na které vám záleží (koupili, registrovali se, klikli).
  3. Úroveň důvěry — jak si chcete být jisti, než deklarujete vítěze. 95 % je průmyslový standard.
  4. Hypotézaoboustranná se ptá "je B jiná než A?" (bezpečnější, výchozí); jednostranná se ptá jen "je B lepší než A?" (citlivější, ale musíte si směr určit před spuštěním testu).

Výsledek se aktualizuje v reálném čase a vstupy se ukládají v URL stránky, takže si můžete výsledek uložit do záložek nebo sdílet. Obnovit vymaže formulář; Načíst ukázková data vyplní odpracovaný příklad.

Odpracovaný příklad

NávštěvníciKonverzeSazba
A (kontrola)1 00010010,0%
B (varianta)1 00015015,0%

To je nárůst o 5 procentních bodů v absolutní hodnotě a +50 % relativní nárůst. Kalkulačka vrátí p-value přibližně 0,0007 — pod 0,05 — takže s 95% důvěrou je výsledek statisticky významný. Zhruba řečeno, pokud by byly obě verze skutečně identické, viděli byste takto velký rozdíl méně než jednou z tisíce testů.

Matematika (z-test dvou proporcí)

Pod kapotou je to standardní z-test dvou proporcí, stejný test vyučovaný v úvodní statistice a používaný mainstreamovými A/B nástroji.

  1. Míra konverze každé skupiny:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    kde xx jsou konverze a nn jsou návštěvníci.

  2. Sdružená sazba, za předpokladu (pro nulovou hypotézu), že obě skupiny sdílejí jednu skutečnou sazbu:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Standardní chyba rozdílu:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Z-skóre — kolik standardních chyb jsou obě sazby od sebe:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. p-value pochází ze standardního normálního rozdělení Φ\Phi. Oboustranné: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Jednostranné: p=1Φ(z)p = 1 - \Phi(z).

  6. Významné když p<αp < \alpha, kde α=1confidence\alpha = 1 - \text{confidence} (takže 0,05 na 95 %).

Kalkulačka také hlásí interval spolehlivosti pro rozdíl, počítaný s nesdruženou standardní chybou p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: plausibilní rozsah pro skutečný rozdíl. Pokud tento interval vylučuje 0, výsledek je významný.

0 -1.96 +1.96 no difference

S 95% důvěrou se z mimo ±1,96 (stínované ocasy, 5 % plochy) počítá jako významné.

Čestné čtení výsledku

  • Statistická významnost není obchodní významnost. Nárůst o 0,1 % může být statisticky skutečný, ale není stojí za to to nasadit.
  • Nekoukejte a zastavte se brzy. Kontrola p-value každý den a zastavení se v okamžiku, kdy padne pod 0,05, zvyšuje váš falešně pozitivní poměr. Rozhodněte se o velikosti vzorku předem a nechte test skončit.
  • Sledujte pravidlo aproximace velikosti vzorku. Normální aproximace je spolehlivá, když každá skupina má alespoň ~10 konverzí a ~10 nekonverzí. S malými čísly zacházejte s výsledkem jen orientačně.
  • Důvěra ≠ pravděpodobnost, že B je lepší. Úroveň důvěry 95 % znamená, že procedura je chybná nejvýše 5 % času v dlouhodobém horizontu — je to frequentistické tvrzení, ne "95% šance, že B vyhraje."
  • Jeden test, jedna metrika. Testování více metrik nebo variant najednou násobí šanci na náhodu; opravte ji (např. Bonferroni) nebo předem zaregistrujte jedinou metriku, která rozhodne o testu.

Vypočítejte si sami

Každý úryvek vypočítá oboustrannou p-value pro odpracovaný příklad výše.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

FAQ

Jakou velikost vzorku potřebuji? Dostatečné, aby byl zjistitelný smysluplný nárůst. Jako minimální cíl se snažte alespoň pár set konverzí na variantu; použijte vyhrazenou kalkulačku velikosti vzorku s vaší základní sazbou a nejmenším nárůstem za to stojícím.

Oboustranné nebo jednostranné? Používejte oboustranné, pokud nemáte pevný, předem dohodnutý důvod starat se jen o zlepšení. Jednostranné zdvojnásobuje vaši citlivost, ale zakazuje vám reagovat na B, které je horší.

Proč kalkulačka ukazuje interval spolehlivosti? Ukazuje plausibilní rozsah skutečného rozdílu, ne jen ano/ne rozhodnutí. Široký interval, který se pohybuje kolem 0, znamená "ještě není dost dat."

Je to Bayesovské? Ne — je to frequentistský z-test, nejvíce vyučovaná a používaná metoda. Bayesovské A/B nástroje hlásí "pravděpodobnost, že B překoná A" místo p-value; obě jsou platné, odpovídají jen mírně odlišné otázky.

Zdroje