Hoppa till innehåll

A/B-testets signifikansräknare

Kontrollera om ditt A/B-testresultat är statistiskt signifikant. Ange besökare och konverteringar för att få p-värdet, z-poängen, konfidensintervallet och den relativa ökningen.

A/B-testets signifikansräknare

Ange besökare och konverteringar för varje variant för att kontrollera om skillnaden är verklig eller bara buller.

Kontroll (A)
Variation (B)

Resultat

Statistiskt signifikant

Skillnaden är osannolik att bero på slumpen på din valda konfidensnivå.

P-värde
0.0007

Chance this gap is just luck — lower is stronger.

Z-poäng
3.381

How far apart the two rates are, in standard errors.

Relativ ökning
+50.0%
Kontrollfrekvens
10.00%
Variationsfrekvens
15.00%
Absolut skillnad
+5.00 pp
Konfidensintervall (skillnad) · 95%
2.11% to 7.89%

The likely range for the true difference.

Konverteringsfrekvens efter variant
Konverteringsfrekvens efter variant. Grouped bar chart with 1 series: Konverteringsfrekvens.0%5%10%15%KonverteringsfrekvensKontroll (A)Variation (B)10%15%
Laddningsberäknare...
📚

Dokumentation

A/B-testning på en minut

Du ändrade en knapp, en rubrik eller ett kassaflöde. Version A är den gamla, version B är den nya. B ser bättre ut — den konverterade 15% av besökarna mot 10% för A. Men kunde det gapet bara vara tur, på samma sätt som att kasta ett mynt tio gånger kan ge sju kronor?

Denna miniräknare besvarar exakt det. Du anger hur många människor som såg varje version och hur många som konverterade, och den talar om för dig sannolikheten att skillnaden du mätt är verklig snarare än slumpmässig brus. Om denna sannolikhet är tillräckligt hög har du en vinnare. Om inte, fortsätter du att köra testet.

Det ena numret att hålla ögonen på är p-värdet: chansen att se ett gap minst lika stort om de två versionerna faktiskt var identiska. Ett litet p-värde (säg, under 0,05) betyder "detta skulle sällan hända av tur, så skillnaden är förmodligen verklig."

Hur man använder det

  1. Besökare — hur många unika människor fick se varje version.
  2. Konverteringar — hur många av dem gjorde det du bryr dig om (köpte, anmälde sig, klickade).
  3. Konfidensnivå — hur säker du vill vara innan du kallar på en vinnare. 95% är branschstandarden.
  4. Hypotestvåsidigt frågar "är B olika från A?" (säkrare, standard); ensidigt frågar bara "är B bättre än A?" (mer känsligt, men du måste bestämma riktningen innan du kör testet).

Resultatet uppdateras live och inmatningarna lagras i sidans URL, så du kan bokmärka eller dela ett resultat. Återställ rensar formuläret; Ladda exempeldata fyller i ett genomarbetat exempel.

Ett genomarbetat exempel

BesökareKonverteringarHastighet
A (kontroll)1 00010010,0%
B (variation)1 00015015,0%

Det är en absolut ökning på 5 procentenheter och en +50% relativ ökning. Miniräknaren returnerar ett p-värde på cirka 0,0007 — under 0,05 — så på 95% konfidensnivå är resultatet statistiskt signifikant. Ungefär, om de två versionerna var verkligen identiska, skulle du se ett gap denna stor mindre än en gång på tusen tester.

Matematiken (två-proportioner z-test)

Under huven är detta standard två-proportioner z-test, samma test som lärdes i introduktionsstatistik och som används av vanliga A/B-verktyg.

  1. Konverteringsfrekvens för varje grupp:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    där xx är konverteringar och nn är besökare.

  2. Poolad frekvens, förutsatt (för nollhypotesen) att båda grupperna delar en sann frekvens:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Standardfel för skillnaden:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Z-poängen — hur många standardfel skiljer de två frekvenserna åt:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. P-värdet kommer från normalfördelningen Φ\Phi. Tvåsidigt: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Ensidigt: p=1Φ(z)p = 1 - \Phi(z).

  6. Signifikant när p<αp < \alpha, där α=1konfidensniva˚\alpha = 1 - \text{konfidensnivå} (så 0,05 på 95%).

Miniräknaren rapporterar också ett konfidensintervall för skillnaden, beräknat med det opoolerade standardfelet p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: det troliga intervallet för det verkliga gapet. Om det intervallet utesluter 0 är resultatet signifikant.

0 -1.96 +1.96 ingen skillnad

Vid 95% konfidensnivå räknas en z bortom ±1,96 (de skuggade svansarna, 5% av området) som signifikant.

Läsa resultatet ärligt

  • Statistisk signifikans är inte affärsmässig signifikans. En 0,1% ökning kan vara statistiskt verklig men ändå inte värd att skeppa.
  • Kika inte och stanna tidigt. Att kontrollera p-värdet varje dag och stanna när det sjunker under 0,05 blåser upp din falskt-positiv-frekvens. Bestäm provstorleken på förhand och låt testet slutföras.
  • Se till exempel-storleksregeln. Normalapproximationen är tillförlitlig när varje grupp har minst ~10 konverteringar och ~10 icke-konverteringar. Med små siffror, behandla resultatet som endast riktningsgivet.
  • Konfidensnivå ≠ sannolikhet för att B är bättre. En konfidensnivå på 95% betyder att proceduren är felaktig högst 5% av tiden i det långa loppet — det är ett frekventistuttalande, inte "95% chans att B vinner."
  • Ett test, ett mätvärde. Att testa många mätvärden eller varianter samtidigt multiplicerar chansen för ett lyckoslut; korrigera för det (t.ex. Bonferroni) eller pre-registrera det enda mätvärde som bestämmer testet.

Beräkna det själv

Varje avsnitt beräknar två-sidiga p-värde för exemplet ovan.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = kontroll besökare, konverteringar ; A2,B2 = variation besökare, konverteringar
6

FAQ

Vilken provstorlekt behöver jag? Tillräckligt att en meningsfull ökning skulle kunna upptäckas. Som en golvnivå, sikta på minst ett par hundra konverteringar per variant; använd en dedikerad provstorleksräknare med din baslinjehastighet och den minsta ökning värd att detektera.

Tvåsidigt eller ensidigt? Använd tvåsidigt om du inte har ett fast, förbundet skäl att bara bry dig om förbättring. Ensidigt fördubblar din känslighet men förbjuder reaktion på B som är värre.

Varför visar miniräknaren ett konfidensintervall? Det visar det troliga intervallet för den verkliga skillnaden, inte bara ett ja/nej-svar. Ett brett intervall som straddlar 0 betyder "inte tillräckligt med data ännu."

Är detta Bayesianskt? Nej — det är ett frekventist z-test, den mest allmänt undervisade och använd metoden. Bayesianske A/B-verktyg rapporterar "sannolikheten att B slår A" istället för ett p-värde; båda är giltiga, de besvarar lite olika frågor.

Källor