Spring til indhold

A/B-test signifikansberegner

Kontroller, om dit A/B-testresultat er statistisk signifikant. Indtast besøgende og konverteringer for at få p-værdien, z-score, konfidensinterval og relativt løft.

A/B-test signifikansberegner

Indtast besøgende og konverteringer for hver variant for at kontrollere, om forskellen er reel eller bare støj.

Kontrol (A)
Variation (B)

Resultater

Statistisk signifikant

Forskellen er usandsynlig at skyldes tilfælde ved dit valgte konfidensniveau.

P-værdi
0.0007

Chance this gap is just luck — lower is stronger.

Z-score
3.381

How far apart the two rates are, in standard errors.

Relativt løft
+50.0%
Kontrol rate
10.00%
Variations rate
15.00%
Absolut forskel
+5.00 pp
Konfidensinterval (forskel) · 95%
2.11% to 7.89%

The likely range for the true difference.

Konverteringsrate efter variant
Konverteringsrate efter variant. Grouped bar chart with 1 series: Konverteringsrate.0%5%10%15%KonverteringsrateKontrol (A)Variation (B)10%15%
Indlæsningsberegner...
📚

Dokumentation

A/B-test på et minut

Du ændrede en knap, en overskrift eller en checkout-flow. Version A er den gamle, version B er den nye. B ser bedre ud — den konverterede 15% af besøgende mod 10% for A. Men kunne det gap bare være held, på samme måde som at slå mønt ti gange kan give syv plat?

Denne beregner besvarer præcis det. Du angiver, hvor mange mennesker der så hver version, og hvor mange der konverterede, og den fortæller dig sandsynligheden for, at den forskel, du målte, er reel snarere end tilfældig støj. Hvis denne sandsynlighed er høj nok, har du en vinder. Hvis ikke, fortsætter du testen.

Det ene tal at holde øje med er p-værdien: chancen for at se et gap mindst så stort hvis de to versioner faktisk var identiske. En lille p-værdi (f.eks. under 0,05) betyder "dette ville sjældent ske ved held, så forskellen er sandsynligvis reel."

Sådan bruges den

  1. Besøgende — hvor mange unikke mennesker der blev vist hver version.
  2. Konverteringer — hvor mange af dem gjorde det, du ønsker (købte, tilmeldte sig, klikked).
  3. Konfidensniveau — hvor sikker du vil være, før du erklærer en vinder. 95% er industristandarden.
  4. Hypoteseto-sidet spørger "er B forskellig fra A?" (sikrer, standard); en-sidet spørger kun "er B bedre end A?" (mere følsom, men du skal beslutte retningen før testen).

Resultatet opdateres live, og inputs lagres i side-URL'en, så du kan bogmærke eller dele et resultat. Nulstil rydder formularen; Indlæs eksempeldata udfylder et gennemarbejdet eksempel.

Et gennemarbejdet eksempel

BesøgendeKonverteringerRate
A (kontrol)1.00010010,0%
B (variation)1.00015015,0%

Det er et løft på 5 procentpoint absolut og et +50% relativt løft. Beregneren returnerer en p-værdi på omkring 0,0007 — under 0,05 — så med 95% tillid er resultatet statistisk signifikant. Cirka, hvis de to versioner var virkelig identiske, ville du se et gap af denne størrelse mindre end én gang i tusinde tests.

Matematikken (to-proportions z-test)

Under hætten er dette standard to-proportions z-test, samme test undervist i introduktionsstatistik og brugt af mainstream A/B-værktøjer.

  1. Konverteringsrate for hver gruppe:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    hvor xx er konverteringer og nn er besøgende.

  2. Pooled rate, der antager (for nulhypotesen), at begge grupper deler én sand rate:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Standardfejl af forskellen:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Z-score'en — hvor mange standardfejl fra hinanden de to rater er:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. P-værdien kommer fra standardnormalfordelingen Φ\Phi. To-sidet: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). En-sidet: p=1Φ(z)p = 1 - \Phi(z).

  6. Signifikant når p<αp < \alpha, hvor α=1confidence\alpha = 1 - \text{confidence} (så 0,05 ved 95%).

Beregneren rapporterer også et konfidensinterval for forskellen, beregnet med usamlet standardfejl p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: det plausible område for det sande gap. Hvis det interval udelukker 0, er resultatet signifikant.

0 -1.96 +1.96 no difference

Ved 95% tillit tæller en z ud over ±1,96 (de skraverede haler, 5% af området) som signifikant.

Læs resultatet ærligt

  • Statistisk signifikans er ikke forretningssignifikans. Et 0,1% løft kan være statistisk reelt, men ikke værd at udrulles.
  • Kig ikke og stop tidligt. At kontrollere p-værdien hver dag og stoppe i det øjeblik, den dykker under 0,05, oppusterkassen din falsk-positive rate. Beslut stikprøvestørrelse på forhånd og lad testen afsluttes.
  • Se stikprøvestørrelse tommelfingerregel. Normalapproksimationen er pålidelig, når hver gruppe har mindst ~10 konverteringer og ~10 ikke-konverteringer. Med små tal, behandl resultatet som retningsgivende kun.
  • Tillid ≠ sandsynlighed B er bedre. Et 95% konfidensniveau betyder proceduren er forkert højst 5% af tiden i det lange løb — det er en frequentist-erklæring, ikke "95% chance B vinder."
  • En test, en metrik. Test af mange metrikker eller varianter på én gang multiplicerer chancen for en tilfældighed; korriger for det (f.eks. Bonferroni) eller forhåndsregistrer den eneste metrik, der afgør testen.

Beregn det selv

Hvert snippet beregner to-sidet p-værdi for det gennemarbejdet eksempel ovenfor.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

FAQ

Hvilken stikprøvestørrelse har jeg brug for? Nok til at et meningsfuldt løft ville være påviseligt. Som minimum, sigte på mindst et par hundrede konverteringer pr. variant; brug en dedikeret stikprøvestørrelse-beregner med din baseline-rate og det mindste løft værd at opdage.

To-sidet eller en-sidet? Brug to-sidet medmindre du har en fast, forudgående grund til kun at bekymre dig om forbedring. En-sidet fordobler din følsomhed, men forbyder at reagere på B værende værre.

Hvorfor viser beregneren et konfidensinterval? Det viser det plausible område for den sande forskel, ikke bare et ja/nej-dom. Et bredt interval, der strider mod 0, betyder "ikke nok data endnu."

Er dette Bayesiansk? Nej — det er en frequentist z-test, den mest bredt undervist og brugt metode. Bayesianske A/B-værktøjer rapporterer "sandsynlighed B slår A" i stedet for en p-værdi; begge er gyldige, de besvarer lidt forskellige spørgsmål.

Kilder