Siirry sisältöön

A/B-testin merkitsevyyslaskin

Tarkista, onko A/B-testin tulos tilastollisesti merkitsevä. Syötä vierailijat ja muunnokset saadaksesi p-arvon, z-pistemäärän, luottamusvälin ja suhteellisen nosteen.

A/B-testin merkitsevyyslaskin

Syötä vierailijat ja muunnokset jokaiselle variantille tarkistaaksesi, onko ero todellinen vai vain kohinaa.

Hallinta (A)
Variaatio (B)

Tulokset

Tilastollisesti merkitsevä

Ero ei todennäköisesti johdu sattumasta valitulla luottamustasolla.

P-arvo
0.0007

Chance this gap is just luck — lower is stronger.

Z-pistemäärä
3.381

How far apart the two rates are, in standard errors.

Suhteellinen nosto
+50.0%
Hallinnan korko
10.00%
Variaation korko
15.00%
Absoluuttinen ero
+5.00 pp
Luottamusväli (ero) · 95%
2.11% to 7.89%

The likely range for the true difference.

Muunnoksen määrä variantin mukaan
Muunnoksen määrä variantin mukaan. Grouped bar chart with 1 series: Muunnoksen määrä.0%5%10%15%Muunnoksen määräHallinta (A)Variaatio (B)10%15%
Latauslaskuri...
📚

Dokumentaatio

A/B-testaus yhdessä minuutissa

Vaihdoit painikkeen, otsikon tai kassavirtausta. Versio A on vanha, versio B on uusi. B näyttää paremmalta — se muunsi 15 % vierailijoista verrattuna 10 %:iin A:lle. Voiko tämä ero johtua pelkästään sattumasta, samalla tavalla kuin kolikkoa heittäessä kymmenen kertaa voidaan saada seitsemän kruunaa?

Tämä laskin vastaa juuri siihen. Syötät kuinka monta ihmistä näki jokaisen version ja kuinka moni muuntui, ja se kertoo sinulle todennäköisyyden, että mittaamasi ero on todellinen eikä satunnaista kohinaa. Jos todennäköisyys on riittävän suuri, sinulla on voittaja. Jos ei, jatkat testin suorittamista.

Yksi numero, jota kannattaa seurata, on p-arvo: mahdollisuus nähdä yhtä suuri ero jos kaksi versiota olisivat todella identtisiä. Pieni p-arvo (esimerkiksi alle 0,05) tarkoittaa "tämä tapahtuisi harvoin sattumalla, joten ero on todennäköisesti todellinen."

Kuinka käyttää sitä

  1. Vierailijat — kuinka monta ainutlaatuista ihmistä näki jokaisen version.
  2. Muunnokset — kuinka moni heistä teki asian, josta välität (osti, rekisteröityi, klikkasi).
  3. Luottamustaso — kuinka varma haluat olla ennen voittajan julistamista. 95 % on alan vakio.
  4. Hypoteesikaksipuolinen kysyy "onko B erilainen kuin A?" (turvallisempi, oletusarvo); yksipuolinen kysyy vain "onko B parempi kuin A?" (herkempi, mutta sinun on päätettävä suunta ennen testin suorittamista).

Tulos päivittyy reaaliajassa ja syötteet tallennetaan sivun URL-osoitteeseen, joten voit merkitä tai jakaa tuloksen. Nollaa tyhjentää lomakkeen; Lataa näytetiedot täyttää työskennellyn esimerkin.

Työskennelty esimerkki

VierailijatMuunnoksetKorko
A (hallinta)1 00010010,0 %
B (variaatio)1 00015015,0 %

Se on 5 prosenttiyksikön absoluuttinen nosto ja +50 % suhteellinen nosto. Laskin palauttaa p-arvon noin 0,0007 — alle 0,05 — joten 95 %:n luottamustasolla tulos on tilastollisesti merkitsevä. Karkeasti sanottuna, jos kaksi versiota olisivat todella identtisiä, näkisit tämän kokoisen aukon alle kerran tuhannen testin joukossa.

Matematiikka (kahden osuuden z-testi)

Pinnan alla tämä on standardi kahden osuuden z-testi, sama testi, jota opetetaan johdantotilastotieteessä ja jota käyttävät valtavirran A/B-työkalut.

  1. Kunkin ryhmän muuntumisaste:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    jossa xx on muunnokset ja nn on vierailijat.

  2. Yhdistetty korko, olettaen (nollahypoteesin osalta), että molemmat ryhmät jakavat yhden todellisen koron:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Erojen keskivirhe:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Z-pistemäärä — kuinka monta keskivirhettä kaksi korkoa on toisistaan:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. p-arvo tulee standardinormaalijakaumasta Φ\Phi. Kaksipuolinen: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Yksipuolinen: p=1Φ(z)p = 1 - \Phi(z).

  6. Merkitsevä, kun p<αp < \alpha, missä α=1luottamus\alpha = 1 - \text{luottamus} (joten 0,05 95 %:lla).

Laskin raportoi myös luottamusvälin erolle, joka lasketaan yhdistämättömällä keskivirheellä p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: uskottava vaihteluväli todelliselle erolle. Jos kyseinen väli sulkee pois 0:n, tulos on merkitsevä.

0 -1.96 +1.96 no difference

95 %:n luottamustasolla z:n arvo, joka ylittää ±1,96:n (varjostetut hännät, 5 % alueesta), on merkitsevä.

Tuloksen rehellinen lukeminen

  • Tilastollinen merkitsevyys ei ole liiketaloudellinen merkitsevyys. 0,1 % nosto voi olla tilastollisesti todellinen, mutta silti ei kannata toimittaa.
  • Älä kurkista ja lopeta aikaisin. P-arvon tarkistaminen päivittäin ja pysäyttäminen heti, kun se laskee alle 0,05:n, lisää väärien positiivisten tulosten määrää. Päätä otoskoko etukäteen ja anna testin valmistua.
  • Noudata näytteen koon nyrkkisääntöä. Normaali likiarvo on luotettava, kun jokaisella ryhmällä on vähintään ~10 muunnosta ja ~10 ei-muunnosta. Pienillä numeroilla pidä tulosta vain suuntaa-antavana.
  • Luottamus ≠ todennäköisyys, että B on parempi. 95 % luottamustaso tarkoittaa, että menetelmä on enintään 5 % ajasta väärä pitkällä aikavälillä — se on frekventisti lausunto, ei "95 % mahdollisuus, että B voittaa."
  • Yksi testi, yksi mittari. Monien mittareiden tai varianttien testaaminen kerralla moninkertaistaa sattumien mahdollisuuden; korjaa se (esim. Bonferroni) tai esirekisteröi yksittäinen mittari, joka päättää testin.

Laske se itse

Jokainen katkelmä laskee kaksipuolisen p-arvon yllä olevalle työskennellylle esimerkille.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

Usein kysytyt kysymykset

Mikä otoskoko minulle sopii? Tarpeeksi, jotta merkittävä nosto olisi havaittavissa. Pohjana tavoittele vähintään muutamaa sataa muunnosta per variantti; käytä erityistä otoskoko-laskinta perusarvolla ja pienimmällä nostolla, joka kannattaa havaita.

Kaksipuolinen vai yksipuolinen? Käytä kaksipuolista, elleivät sinulla ole vahvaa, ennalta määritettyä syytä välittää vain parantumisesta. Yksipuolinen kaksinkertaistaa herkkyytesi, mutta kieltää reagoimisen siihen, että B on huonompi.

Miksi laskin näyttää luottamusvälin? Se näyttää todellisen eron uskottavan vaihteluväliin, ei vain kyllä/ei -tuomio. Leveä väli, joka ratsastaa 0:n yli, tarkoittaa "ei vielä tarpeeksi tietoja".

Onko tämä bayesilainen? Ei — se on frekventisti z-testi, eniten opetettu ja käytetty menetelmä. Bayesilainen A/B-työkalut raportoivat "todennäköisyys, että B voittaa A:n" p-arvon sijaan; molemmat ovat kelvollisia, ne vastaavat hieman eri kysymyksiin.

Lähteet