Przejdź do treści

Kalkulator Istotności Testu A/B

Sprawdź czy wynik twojego testu A/B jest istotny statystycznie. Wprowadź odwiedzających i konwersje aby uzyskać p-wartość, wynik z, przedział ufności i wzrost względny.

Kalkulator Istotności Testu A/B

Wprowadź odwiedzających i konwersje dla każdego wariantu aby sprawdzić czy różnica jest rzeczywista czy tylko szum.

Kontrola (A)
Wariacja (B)

Wyniki

Istotne statystycznie

Różnica jest mało prawdopodobna aby być spowodowana przypadkiem na twoim wybranym poziomie pewności.

P-wartość
0.0007

Chance this gap is just luck — lower is stronger.

Wynik Z
3.381

How far apart the two rates are, in standard errors.

Wzrost względny
+50.0%
Stopa kontrolna
10.00%
Stopa wariacji
15.00%
Różnica absolutna
+5.00 pp
Przedział ufności (różnica) · 95%
2.11% to 7.89%

The likely range for the true difference.

Stopa konwersji według wariantu
Stopa konwersji według wariantu. Grouped bar chart with 1 series: Stopa konwersji.0%5%10%15%Stopa konwersjiKontrola (A)Wariacja (B)10%15%
Kalkulator załadunku...
📚

Dokumentacja

Testowanie A/B w ciągu minuty

Zmieniłeś przycisk, nagłówek lub przepływ checkout. Wersja A to stara, wersja B to nowa. B wygląda lepiej — przeliczył 15% odwiedzających w stosunku do 10% dla A. Ale czy ta różnica mogła być tylko szczęściem, tak jak rzucanie monetą dziesięć razy może dać siedem reszek?

Ten kalkulator odpowiada dokładnie na to pytanie. Wprowadzisz ile osób widziało każdą wersję i ile się przeliczył, a on ci powie prawdopodobieństwo, że zmierzona przez ciebie różnica jest rzeczywista, a nie szum losowy. Jeśli to prawdopodobieństwo jest wystarczająco wysokie, masz zwycięzcę. Jeśli nie, kontynuujesz test.

Jedna liczba, którą warto obserwować, to p-wartość: szansa na zobaczenie przerwy co najmniej tak dużej jeśli obie wersje były faktycznie identyczne. Mała p-wartość (powiedzmy, poniżej 0,05) oznacza „to byłoby rzadko zdarzać się przypadkowo, więc różnica jest prawdopodobnie rzeczywista".

Jak z niego korzystać

  1. Odwiedzający — ile unikalnych osób zobaczył każdą wersję.
  2. Konwersje — ile z nich zrobiło to, na czym ci zależy (kupiło, zarejestrowało się, kliknęło).
  3. Poziom pewności — jak bardzo chcesz być pewny przed ogłoszeniem zwycięzcy. 95% to standard branżowy.
  4. Hipotezadwustronnie pyta „czy B różni się od A?" (bezpieczniejsze, domyślne); jednostronnie pyta tylko „czy B jest lepsze od A?" (bardziej czułe, ale musisz zdecydować kierunek przed uruchomieniem testu).

Wynik aktualizuje się na żywo a dane wejściowe są przechowywane w adresie URL strony, możesz więc oznaczyć zakładką lub udostępnić wynik. Resetuj czyści formularz; Załaduj przykładowe dane wypełnia pracowany przykład.

Pracowany przykład

OdwiedzającyKonwersjeStopa
A (kontrola)1 00010010,0%
B (wariacja)1 00015015,0%

To wzrost absolutny o 5 punktów procentowych i wzrost względny +50%. Kalkulator zwraca p-wartość około 0,0007 — poniżej 0,05 — więc przy 95% pewności wynik jest istotny statystycznie. Najprościej mówiąc, gdyby obie wersje były naprawdę identyczne, taką dużą różnicę zobaczyłbyś rzadziej niż raz na tysiąc testów.

Matematyka (test z dla dwóch proporcji)

Pod spodem jest to standardowy test z dla dwóch proporcji, ten sam test nauczany w kursach statystyki wprowadzającej i używany przez główne narzędzia A/B.

  1. Stopa konwersji każdej grupy:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    gdzie xx to konwersje a nn to odwiedzający.

  2. Stopa pooled, zakładając (dla hipotezy zerowej) obie grupy dzielą jedną prawdziwą stopę:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Błąd standardowy różnicy:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Wynik z — jak wiele błędów standardowych jest osobno dwie stopy:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. p-wartość pochodzi ze standardowego rozkładu normalnego Φ\Phi. Dwustronna: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Jednostronna: p=1Φ(z)p = 1 - \Phi(z).

  6. Istotna gdy p<αp < \alpha, gdzie α=1confidence\alpha = 1 - \text{confidence} (więc 0,05 przy 95%).

Kalkulator również raportuje przedział ufności dla różnicy, wyliczony z niepooled błędem standardowym p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: wiarygodny zakres dla prawdziwej luki. Jeśli ten przedział wyklucza 0, wynik jest istotny.

0 -1.96 +1.96 no difference

Przy 95% pewności, z poza ±1,96 (zaciemnione ogony, 5% obszaru) liczy się jako istotny.

Czytanie wyniku szczerze

  • Istotność statystyczna to nie istotność biznesowa. Wzrost 0,1% może być statystycznie rzeczywisty a jednak nie wart wysłania.
  • Nie podglądaj i nie zatrzymuj się wcześnie. Codzienne sprawdzanie p-wartości i zatrzymanie się w momencie, gdy spadnie poniżej 0,05, zwiększa poziom fałszywych alarmów. Zdecyduj wielkość próby z góry i pozwól testowi się skończyć.
  • Obserwuj regułę kciuka wielkości próby. Przybliżenie normalne jest wiarygodne gdy każda grupa ma co najmniej ~10 konwersji i ~10 niekonwersji. Z maleńkimi liczbami traktuj wynik jako kierunkowy tylko.
  • Pewność ≠ prawdopodobieństwo że B jest lepsze. Poziom pewności 95% oznacza, że procedura jest błędna co najwyżej 5% czasu w długim okresie — to stwierdzenie częstościowe, nie „95% szansy że B wygra".
  • Jeden test, jedna metrika. Testowanie wielu metryk lub wariantów na raz zwielokrotnia szansę przypadkowego zbiegu; skoryguj to (np. Bonferroni) lub wstępnie zarejestruj pojedynczą metrikę, która decyduje test.

Oblicz to sam

Każdy fragment oblicza dwustronną p-wartość dla pracowanego przykładu powyżej.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

FAQ

Jaka wielkość próby mi potrzebna? Wystarczająco dużo, aby znaczący wzrost byłby do wykrycia. Jako minimum postaraj się mieć co najmniej kilkaset konwersji na wariant; użyj dedykowanego kalkulatora wielkości próby z twoją bazową stopą i najmniejszym wzrostem wartym wykrycia.

Dwustronnie czy jednostronnie? Użyj dwustronnie chyba że masz zdecydowany, wcześniej zaangażowany powód by dbać tylko o ulepszenie. Jednostronnie podwaja twoją czułość ale zabrania reagowania na B będące gorsze.

Dlaczego kalkulator pokazuje przedział ufności? Pokazuje wiarygodny zakres prawdziwej różnicy, nie tylko tak/nie werdykt. Szeroki przedział, który przechodzi przez 0 oznacza „nie wystarczy jeszcze danych".

Czy to Bayesian? Nie — to test z częstościowy, najszerzej nauczana i używana metoda. Narzędzia A/B Bayesian raportują „prawdopodobieństwo że B bije A" zamiast p-wartości; oba są ważne, odpowiadają trochę na inne pytania.

Źródła