Przejdź do treści

Kalkulator Istotności Testu A/B

Sprawdź czy wynik twojego testu A/B jest istotny statystycznie. Wprowadź odwiedzających i konwersje aby uzyskać p-wartość, wynik z, przedział ufności i wzrost względny.

Kalkulator Istotności Testu A/B

Wprowadź odwiedzających i konwersje dla każdego wariantu aby sprawdzić czy różnica jest rzeczywista czy tylko szum.

Kontrola (A)
Wariacja (B)

Wyniki

Istotne statystycznie

Różnica jest mało prawdopodobna aby być spowodowana przypadkiem na twoim wybranym poziomie pewności.

P-wartość
0.0007

Chance this gap is just luck — lower is stronger.

Wynik Z
3.381

How far apart the two rates are, in standard errors.

Wzrost względny
+50.0%
Stopa kontrolna
10.00%
Stopa wariacji
15.00%
Różnica absolutna
+5.00 pp
Przedział ufności (różnica) · 95%
2.11% to 7.89%

The likely range for the true difference.

Stopa konwersji według wariantu
Stopa konwersji według wariantu. Grouped bar chart with 1 series: Stopa konwersji.0%5%10%15%Stopa konwersjiKontrola (A)Wariacja (B)10%15%
Kalkulator załadunku...
📚

Dokumentacja

Co robi kalkulator istotności testu A/B

Kalkulator istotności testu A/B sprawdza, czy różnica między dwiema wersjami czegoś — strony internetowej, wiadomości e-mail lub przycisku finalizacji zakupu — jest rzeczywistym efektem, czy tylko dziełem przypadku. Dla każdej wersji wykorzystuje liczbę odwiedzających i liczbę konwersji, a następnie zwraca wartość p, wynik z oraz przedział ufności. Konwersja to dowolne działanie uznane za sukces: zakup, rejestracja lub kliknięcie.

Jak korzystać z kalkulatora

Kalkulator potrzebuje czterech liczb.

  • Odwiedzający (grupa kontrolna): ile osób zobaczyło wersję A, czyli wersję oryginalną.
  • Konwersje (grupa kontrolna): ile z tych osób dokonało konwersji.
  • Odwiedzający (wariant): ile osób zobaczyło wersję B, czyli nową wersję.
  • Konwersje (wariant): ile z tych osób dokonało konwersji.

Dwa dodatkowe ustawienia zmieniają sposób oceny wyniku.

  • Poziom ufności określa, jak rygorystyczny jest test. 95% to typowa wartość domyślna. Wyższy poziom, taki jak 99%, wymaga silniejszych dowodów, zanim wynik zostanie uznany za istotny.
  • Hipoteza określa kierunek pytania. Test dwustronny pyta: „czy B różni się od A w którymkolwiek kierunku?”. Test jednostronny pyta tylko: „czy B jest lepsze od A?”. Test jednostronny należy wybrać wyłącznie przed uzyskaniem danych i tylko wtedy, gdy gorszy wynik B nie zmieniłby żadnej decyzji.

Wynik aktualizuje się w miarę wprowadzania liczb. Dane wejściowe są zapisywane w adresie strony internetowej, więc wynik można dodać do zakładek lub udostępnić jako link.

Wzór testu A/B (test z dla dwóch proporcji)

Kalkulator używa testu z dla dwóch proporcji — standardowej metody nauczanej na wstępnych kursach statystyki do porównywania dwóch współczynników.

Krok 1. Współczynnik konwersji w każdej grupie.

p1=x1n1,p2=x2n2p_1 = \frac{x_1}{n_1}, \qquad p_2 = \frac{x_2}{n_2}

Tutaj xx oznacza liczbę konwersji, a nn liczbę odwiedzających, odpowiednio dla grupy kontrolnej (1) i wariantu (2).

Krok 2. Połączony współczynnik konwersji. W tym kroku, na potrzeby testu, zakłada się, że obie grupy mają jeden prawdziwy, wspólny współczynnik.

p^=x1+x2n1+n2\hat{p} = \frac{x_1 + x_2}{n_1 + n_2}

Krok 3. Błąd standardowy różnicy, obliczany na podstawie połączonego współczynnika.

SE=p^(1−p^)(1n1+1n2)SE = \sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}

Krok 4. Wartość z, czyli różnica między dwoma współczynnikami mierzona w błędach standardowych.

z=p2−p1SEz = \frac{p_2 - p_1}{SE}

Krok 5. Wartość p, wyznaczana ze standardowego rozkładu normalnego Φ\Phi. Dla testu dwustronnego: p=2(1−Φ(∣z∣))p = 2\left(1 - \Phi(|z|)\right). Dla testu jednostronnego: p=1−Φ(z)p = 1 - \Phi(z).

Krok 6. Werdykt. Wynik uznaje się za istotny statystycznie, gdy wartość p jest mniejsza niż α\alpha, gdzie α=1−poziom ufnosˊci\alpha = 1 - \text{poziom ufności}. Przy poziomie ufności 95%, α=0.05\alpha = 0.05.

Kalkulator podaje również przedział ufności dla wielkości różnicy, p2−p1p_2 - p_1. W tym przedziale stosuje się odrębny błąd standardowy, który nie zakłada, że obie grupy mają ten sam współczynnik:

SEunpooled=p1(1−p1)n1+p2(1−p2)n2SE_{unpooled} = \sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}}

Przedział ma postać (p2−p1)±zc×SEunpooled(p_2 - p_1) \pm z_c \times SE_{unpooled}, gdzie zcz_c wynosi 1,6449 przy poziomie ufności 90%, 1,96 przy 95% oraz 2,5758 przy 99%. Jeśli przedział nie zawiera zera, różnica jest istotna przy danym poziomie ufności.

Przykład obliczeń

OdwiedzającyKonwersjeWspółczynnik
Grupa kontrolna (A)1 00010010,00%
Wariant (B)1 00015015,00%

Połączony współczynnik wynosi (100+150)/(1000+1000)=0.125(100+150)/(1000+1000) = 0.125, czyli 12,5%. Połączony błąd standardowy wynosi w przybliżeniu 0,0148. Wynik z to (0.15−0.10)/0.0148≈3.38(0.15 - 0.10) / 0.0148 \approx 3.38.

W przypadku testu dwustronnego daje to wartość p wynoszącą około 0,00072. Jest ona niższa od typowego progu 0,05, więc przy poziomie ufności 95% różnica jest istotna statystycznie. Gdyby obie wersje rzeczywiście działały tak samo, różnica tej wielkości lub większa pojawiłaby się wyłącznie wskutek przypadku w około 7 na każde 10 000 testów.

Różnica bezwzględna wynosi 5,00 punktów procentowych. Wzrost względny wynosi 50%, ponieważ współczynnik dla B jest 1,5 raza większy niż współczynnik dla A. Przedział ufności 95% dla rzeczywistej różnicy wynosi w przybliżeniu od 2,11% do 7,89%.

Prawidłowa interpretacja wyniku

Wynik istotny statystycznie nie jest automatycznie wynikiem, na podstawie którego warto podejmować działania. Niewielki, rzeczywisty wzrost może nie uzasadniać kosztu wdrożenia. Po wykonaniu obliczeń nadal liczy się ocena biznesowa.

Codzienne sprawdzanie wartości p i przerywanie testu w chwili, gdy spadnie ona poniżej 0,05, zwiększa prawdopodobieństwo wyniku fałszywie dodatniego. Lepiej z góry ustalić liczebność próby lub czas trwania testu i odczytać wynik dopiero po jego zakończeniu.

Przybliżenie rozkładem normalnym, na którym opiera się ten test, działa najlepiej, gdy każda grupa ma co najmniej około 10 konwersji i 10 braku konwersji. Przy mniejszych liczbach wynik należy traktować jako przybliżony sygnał, a nie rozstrzygającą odpowiedź.

Poziom ufności 95% nie oznacza, że istnieje 95% szans, iż B jest rzeczywiście lepsze. Oznacza, że gdyby ten sam test powtarzano wiele razy, metoda ta dawałaby błędny wynik istotny statystycznie najwyżej w 5% przypadków. Jest to stwierdzenie dotyczące metody, a nie tego pojedynczego wyniku.

Jednoczesne testowanie wielu metryk lub wielu wariantów zwiększa prawdopodobieństwo, że co najmniej jedno porównanie okaże się istotne wyłącznie przez przypadek. Wybór jednej metryki przed rozpoczęciem testu pozwala uniknąć tego problemu.

Najczęściej zadawane pytania

Jakiej liczebności próby potrzebuje test A/B? Tylu odwiedzających, aby istotny wzrost rzeczywiście mógł okazać się istotny statystycznie. Przybliżonym minimum jest kilkaset konwersji na wersję. Dedykowany kalkulator liczebności próby, wykorzystujący wartość bazową współczynnika i najmniejszy wykrywany wzrost, podaje dokładniejszą liczbę przed rozpoczęciem testu.

Czy test powinien być jednostronny czy dwustronny? Test dwustronny jest bezpieczniejszym ustawieniem domyślnym, ponieważ może wskazać, że B jest zarówno lepsze, jak i gorsze od A. Test jednostronny jest bardziej czuły na poprawę, ale nie może wskazać gorszego wyniku, dlatego należy go stosować tylko wtedy, gdy gorszy wynik B nie zmieniłby żadnej decyzji.

Dlaczego kalkulator podaje przedział ufności? Przedział ufności pokazuje prawdopodobny zakres rzeczywistej różnicy, a nie tylko etykietę „istotna” lub „nieistotna”. Szeroki przedział obejmujący zero zazwyczaj oznacza, że test wymaga większej ilości danych.

Czy jest to kalkulator bayesowski? Nie. Wykorzystuje test z w ujęciu częstościowym, czyli metodę najczęściej nauczaną i stosowaną w testach A/B. Narzędzie bayesowskie podaje natomiast prawdopodobieństwo, że B przewyższa A. Obie metody są prawidłowe, ale odpowiadają na nieco inne pytania.

Co zrobić, jeśli kalkulator wyświetla błąd? Błąd pojawia się, gdy liczba konwersji jest ujemna, przekracza liczbę odwiedzających albo łączny współczynnik konwersji w obu grupach wynosi 0% lub 100%, ponieważ w takim przypadku wzór testu z nie może dzielić przez błąd standardowy równy zero.

Źródła