A/B-testets signifikansräknare
Kontrollera om ditt A/B-testresultat är statistiskt signifikant. Ange besökare och konverteringar för att få p-värdet, z-poängen, konfidensintervallet och den relativa ökningen.
A/B-testets signifikansräknare
Ange besökare och konverteringar för varje variant för att kontrollera om skillnaden är verklig eller bara buller.
Resultat
Statistiskt signifikant
Skillnaden är osannolik att bero på slumpen på din valda konfidensnivå.
Chance this gap is just luck — lower is stronger.
How far apart the two rates are, in standard errors.
The likely range for the true difference.
Dokumentation
Vad en signifikanskalkylator för A/B-test gör
En signifikanskalkylator för A/B-test kontrollerar om en skillnad mellan två versioner av något – en webbsida, ett e-postmeddelande eller en kassaknapp – är en verklig effekt eller bara slumpen. Den tar antalet besökare och antalet konverteringar för varje version och returnerar ett p-värde, ett z-värde och ett konfidensintervall. En konvertering är den åtgärd som räknas som ett lyckat resultat: ett köp, en registrering eller ett klick.
Så använder du kalkylatorn
Kalkylatorn behöver fyra tal.
- Besökare (kontroll): hur många personer som såg version A, originalet.
- Konverteringar (kontroll): hur många av dem som konverterade.
- Besökare (variation): hur många personer som såg version B, den nya versionen.
- Konverteringar (variation): hur många av dem som konverterade.
Ytterligare två inställningar påverkar hur resultatet bedöms.
- Konfidensnivå anger hur strikt testet är. 95 % är det vanliga standardvärdet. En högre nivå, till exempel 99 %, kräver starkare belägg innan ett resultat kallas signifikant.
- Hypotes anger frågans riktning. Ett tvåsidigt test frågar ”skiljer sig B från A, i endera riktningen?” Ett ensidigt test frågar bara ”är B bättre än A?” Ett ensidigt test bör endast väljas innan data samlas in och endast när ett sämre resultat för B inte skulle påverka något beslut.
Resultatet uppdateras när talen matas in. Inmatningarna sparas i sidans webbadress, så resultatet kan bokmärkas eller delas som en länk.
Formel för A/B-test (z-test för två andelar)
Kalkylatorn använder ett z-test för två andelar, en standardmetod som lärs ut i grundläggande statistik för att jämföra två andelar.
Steg 1. Konverteringsgrad för varje grupp.
Här är antalet konverteringar och antalet besökare, för kontroll (1) och variation (2).
Steg 2. Poolad konverteringsgrad. Detta steg antar, för testets skull, att båda grupperna har samma verkliga underliggande andel.
Steg 3. Standardfelet för skillnaden, beräknat från den poolade andelen.
Steg 4. Z-värde, skillnaden mellan de två andelarna uttryckt i standardfel.
Steg 5. P-värde, hämtat från standardnormalfördelningen . För ett tvåsidigt test: . För ett ensidigt test: .
Steg 6. Bedömning. Resultatet räknas som statistiskt signifikant när p-värdet är mindre än , där . Vid 95 % konfidens är .
Kalkylatorn rapporterar också ett konfidensintervall för storleken på skillnaden, . Detta intervall använder ett separat standardfel som inte antar att de två grupperna har samma andel:
Intervallet är , där är 1,6449 vid 90 % konfidens, 1,96 vid 95 % och 2,5758 vid 99 %. Om intervallet inte innehåller noll är skillnaden signifikant på den konfidensnivån.
Räkneexempel
| Besökare | Konverteringar | Andel | |
|---|---|---|---|
| Kontroll (A) | 1 000 | 100 | 10,00 % |
| Variation (B) | 1 000 | 150 | 15,00 % |
Den poolade andelen är , eller 12,5 %. Det poolade standardfelet är ungefär 0,0148. Z-värdet är .
För ett tvåsidigt test ger detta ett p-värde på ungefär 0,00072. Det ligger under den vanliga tröskeln 0,05, så skillnaden är statistiskt signifikant vid 95 % konfidens. Om de två versionerna i själva verket gav samma resultat skulle en så här stor eller större skillnad uppstå av enbart slumpen i ungefär 7 av varje 10 000 test.
Den absoluta skillnaden är 5,00 procentenheter. Den relativa ökningen är 50 %, eftersom B:s andel är 1,5 gånger A:s andel. Konfidensintervallet vid 95 % för den verkliga skillnaden sträcker sig från ungefär 2,11 % till 7,89 %.
Så tolkar du resultatet korrekt
Ett statistiskt signifikant resultat är inte automatiskt värt att agera på. En liten men verklig ökning kanske inte är värd kostnaden för att införa den. Affärsbedömningen är fortfarande viktig när matematiken är klar.
Att kontrollera p-värdet varje dag och stoppa testet så snart det passerar 0,05 ökar risken för ett falskt positivt resultat. Det är bättre att bestämma en stickprovsstorlek eller testlängd i förväg och låta testet slutföras innan resultatet tolkas.
Den normalapproximation som testet bygger på fungerar bäst när varje grupp har minst ungefär 10 konverteringar och 10 icke-konverteringar. Med mindre antal bör resultatet betraktas som en grov signal snarare än ett säkert svar.
En 95 % konfidensnivå betyder inte att det är 95 % sannolikt att B verkligen är bättre. Det betyder att om samma test upprepades många gånger skulle denna metod ge ett felaktigt signifikant resultat högst 5 % av gångerna. Det är ett påstående om metoden, inte om just detta resultat.
Att testa många mätvärden eller många varianter samtidigt ökar risken för att minst en jämförelse ser signifikant ut enbart av slumpen. Om ett mätvärde väljs innan testet börjar undviks detta problem.
Vanliga frågor
Hur stor stickprovsstorlek behöver ett A/B-test? Tillräckligt många besökare för att en meningsfull ökning faktiskt ska bli signifikant. En grov miniminivå är några hundra konverteringar per version. En särskild kalkylator för stickprovsstorlek, som använder baslinjeandelen och den minsta ökning som är värd att upptäcka, ger ett säkrare antal innan testet börjar.
Bör testet vara ensidigt eller tvåsidigt? Tvåsidigt är det säkrare standardvalet, eftersom det kan visa att B är antingen bättre eller sämre än A. Ensidigt är känsligare för en förbättring men kan inte visa ett sämre resultat, så det bör endast användas när ett sämre resultat för B inte skulle påverka något beslut.
Varför rapporterar kalkylatorn ett konfidensintervall? Ett konfidensintervall visar det sannolika spannet för den verkliga skillnaden, inte bara en etikett för signifikant eller inte signifikant. Ett brett intervall som omfattar noll betyder vanligtvis att testet behöver mer data.
Är detta en bayesiansk kalkylator? Nej. Den använder ett frekventistiskt z-test, den metod som oftast lärs ut och används för A/B-testning. Ett bayesianskt verktyg rapporterar i stället sannolikheten att B slår A. Båda metoderna är giltiga, men de besvarar något olika frågor.
Vad händer om kalkylatorn visar ett fel? Ett fel visas om antalet konverteringar är negativt, om det överstiger antalet besökare eller om den sammanlagda konverteringsgraden för båda grupperna är 0 % eller 100 %, eftersom z-testets formel då inte kan dividera med ett standardfel på noll.