Ugrás a tartalomra

A/B teszt szignifikancia kalkulátor

Ellenőrizze, hogy az A/B teszt eredménye statisztikailag szignifikáns-e. Adja meg a látogatókat és konverziókat, hogy megkapja a p-értéket, z-pontszámot, konfidencia intervallumot és relatív növekedést.

A/B teszt szignifikancia kalkulátor

Adja meg a látogatókat és konverziókat minden variánshoz, hogy ellenőrizze, a különbség valódi vagy csak zaj.

Kontroll (A)
Variáns (B)

Eredmények

Statisztikailag szignifikáns

A különbség nem valószínű, hogy a véletlen miatt lenne a kiválasztott megbízhatósági szinten.

P-érték
0.0007

Chance this gap is just luck — lower is stronger.

Z-pontszám
3.381

How far apart the two rates are, in standard errors.

Relatív növekedés
+50.0%
Kontroll arány
10.00%
Variáns arány
15.00%
Abszolút különbség
+5.00 pp
Konfidencia intervallum (különbség) · 95%
2.11% to 7.89%

The likely range for the true difference.

Konverziós arány variánsonként
Konverziós arány variánsonként. Grouped bar chart with 1 series: Konverziós arány.0%5%10%15%Konverziós arányKontroll (A)Variáns (B)10%15%
Betöltési kalkulátor...
📚

Dokumentáció

A/B tesztelés egy perc alatt

Megváltoztattál egy gombot, egy főcímet vagy egy fizetési folyamatot. Az A verzió a régi, a B verzió az új. A B jobbnak tűnik — a látogatók 15%-a konvertálódott, az A-nak pedig 10%. De lehet, hogy ez a különbség csak szerencse, ahogy egy érme tízszeri feldobásakor kaphatunk hét fejjel?

Ez a kalkulátor pontosan ezt a kérdést válaszolja meg. Beírod, hogy hányan látták az egyes verziókat és hányan konvertálódtak, majd megmondja, hogy az általad mért különbség milyen valószínűséggel valódi és nem véletlen ingadozás. Ha ez a valószínűség elég nagy, akkor van nyertesed. Ha nem, folytatod a tesztet.

Az egyetlen szám, amit figyelemmel kell követned, a p-érték: annak az esélye, hogy ekkora vagy még nagyobb különbséget látsz, ha a két verzió valójában azonos lenne. Az alacsony p-érték (mondjuk 0,05 alatt) azt jelenti: „ez szerencsével nagyon ritkán fordulna elő, tehát a különbség valószínűleg valódi."

Hogyan kell használni

  1. Látogatók — hány egyedi személy látta az egyes verziókat.
  2. Konverziók — közülük hányan csinálták meg azt a dolgot, ami fontos (vásárlás, regisztráció, kattintás).
  3. Megbízhatósági szint — mennyire szeretnél biztos lenni a győztes megállapítása előtt. A 95% az iparági standard.
  4. Hipotéziskétoldali azt kérdezi, hogy „a B különbözik-e az A-tól?" (biztonságosabb, alapértelmezett); egyoldali csak azt kérdezi, hogy „a B jobb-e, mint az A?" (érzékenyebb, de előre el kell döntened az irányt).

Az eredmény élőben frissül, és a bemenetek az oldal URL-jében tárolódnak, így könyvjelzőzés vagy megosztás után is visszakaphatod az eredményt. Az Alaphelyzetbe állítás töröl az alakzatot; a Mintaadatok betöltése egy kidolgozott példát tölt be.

Kidolgozott példa

LátogatókKonverziókArány
A (kontroll)1 00010010,0%
B (variáns)1 00015015,0%

Ez egy 5 százalékpontos abszolút növekedés és egy +50% relatív növekedés. A kalkulátor kb. 0,0007 p-értéket ad vissza — 0,05 alatt — tehát 95%-os megbízhatóságnál az eredmény statisztikailag szignifikáns. Nagyjából: ha a két verzió valóban azonos lenne, egy ilyen nagyságú különbséget kevesebb mint ezredik tesztenként látnál.

A matematika (kétarányos z-teszt)

A háttérben ez a standard kétarányos z-teszt, ugyanaz a teszt, amely az alapstatisztikában tanítják, és a szokásos A/B tesztelő eszközök használják.

  1. Az egyes csoportok konverziós aránya:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    ahol xx a konverziók, és nn a látogatók száma.

  2. Összesített arány, feltételezve (a nullhipotézishez), hogy mindkét csoport egy igaz arányt oszt meg:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. A különbség szabványos hibája:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. A z-pontszám — hány standard hiba távolságra vannak egymástól a két arány:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. A p-érték a standard normális eloszlásból Φ\Phi származik. Kétoldali: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Egyoldali: p=1Φ(z)p = 1 - \Phi(z).

  6. Szignifikáns, amikor p<αp < \alpha, ahol α=1confidence\alpha = 1 - \text{confidence} (szóval 0,05, 95%-os esetén).

A kalkulátor egy konfidencia intervallumot is megjelenít a különbséghez, az nem összesített szabványos hiba felhasználásával p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: a valódi rés hihető tartománya. Ha az intervallum kizárja a 0-t, az eredmény szignifikáns.

0 -1.96 +1.96 no difference

95%-os megbízhatóságnál a ±1.96-on túli z (az árnyékolt végek, a terület 5%-a) szignifikánsnak számít.

Az eredmény becsületes értelmezése

  • A statisztikai szignifikancia nem üzleti szignifikancia. A 0,1%-os növekedés statisztikailag valódi lehet, de nem érdemes telepíteni.
  • Ne jelezz korán és ne állj meg előbb. A p-érték napi ellenőrzése és azonnali leállítása, amint 0,05 alá csökken, megnöveli a hamis pozitív arányt. Döntsd el a minta méretét előre és hagyd befejezni a tesztet.
  • Figyelj a minta méretének ökölszabályára. A normális közelítés megbízható, amikor mindkét csoportban legalább ~10 konverzió és ~10 nem-konverzió van. Kis számok esetén az eredményt csak iránymutatónak tekintsd.
  • A megbízhatóság ≠ B jobb valószínűsége. A 95%-os megbízhatósági szint azt jelenti, hogy az eljárás a hosszú távon legfeljebb 5%-ban téved — ez egy gyakoriaszt kijelentés, nem „95% esélye, hogy B nyer."
  • Egy teszt, egy metrika. Ha egyszerre több metrikát vagy variánst tesztelsz, megsokszorozod a szerencsés eset esélyét; korrigáld (pl. Bonferroni) vagy előre regisztráld az egyetlen metrikát, amely eldönti a tesztet.

Számold ki magad

Minden kódrészlet a fenti kidolgozott példa kétoldali p-értékét számítja ki.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

GYIK

Mekkora minta méret szükséges? Elég nagy, hogy egy értelmes növekedés kimutatható lenne. Alapvonalként legalább pár száz konverziót célozz meg variánsként; egy dedikált minta méret kalkulátort használj az alapértékeddel és a legkisebb értelmes növekedéssel.

Kétoldali vagy egyoldali? Kétoldali, hacsak nem van erős, előre elkötelezett okod arra, hogy csak a javulást figyelembe vedd. Az egyoldali megkétszerezi az érzékenységet, de nem reagálhatsz arra, hogy B rosszabb.

Miért mutat a kalkulátor egy konfidencia intervallumot? A valódi különbség hihető tartományát mutatja, nem csak egy igen/nem ítéletet. A széles intervallum, amely a 0-t átlépi, azt jelenti: „még nem elég adat."

Ez Bayesian? Nem — ez egy frequentista z-teszt, a legszélesebben tanított és használt módszer. A Bayes-i A/B eszközök az „a B valószínűsége legyőzi az A-t" helyett egy p-értéket jeleznek; mindkettő érvényes, csak kicsit más kérdésekre válaszolnak.

Források