Naar inhoud springen

A/B Test Significantie Calculator

Controleer of je A/B-testresultaat statistisch significant is. Voer bezoekers en conversies in om de p-waarde, z-score, betrouwbaarheidsinterval en relatieve lift te krijgen.

A/B Test Significantie Calculator

Voer bezoekers en conversies in voor elke variant om te controleren of het verschil echt is of alleen ruis.

Controle (A)
Variatie (B)

Resultaten

Statistisch Significant

Het verschil is onwaarschijnlijk door toeval op je gekozen betrouwbaarheidsniveau.

P-waarde
0.0007

Chance this gap is just luck — lower is stronger.

Z-score
3.381

How far apart the two rates are, in standard errors.

Relatieve lift
+50.0%
Controlepercentage
10.00%
Variatiepercentage
15.00%
Absoluut verschil
+5.00 pp
Betrouwbaarheidsinterval (verschil) · 95%
2.11% to 7.89%

The likely range for the true difference.

Conversiesnelheid per variant
Conversiesnelheid per variant. Grouped bar chart with 1 series: Conversiesnelheid.0%5%10%15%ConversiesnelheidControle (A)Variatie (B)10%15%
Laadcalculator...
📚

Documentatie

A/B-testing in één minuut

Je hebt een knop, kop of checkout-flow gewijzigd. Versie A is de oude, versie B is de nieuwe. B ziet er beter uit — het converteerde 15% van de bezoekers tegenover 10% voor A. Maar zou dat verschil gewoon geluk kunnen zijn, op dezelfde manier als dat tien keer gooien met een munt zeven koppen kan geven?

Deze calculator beantwoordt precies dat. Je voert in hoeveel mensen elke versie hebben gezien en hoeveel hebben geconverteerd, en het vertelt je de waarschijnlijkheid dat het verschil dat je hebt gemeten echt is in plaats van willekeurige ruis. Als die waarschijnlijkheid groot genoeg is, heb je een winnaar. Zo niet, dan laat je de test verder lopen.

Het enige getal om te volgen is de p-waarde: de kans om een verschil van minstens deze grootte te zien als de twee versies in werkelijkheid identiek waren. Een kleine p-waarde (bijvoorbeeld onder 0,05) betekent "dit zou zelden door geluk gebeuren, dus het verschil is waarschijnlijk echt."

Hoe te gebruiken

  1. Bezoekers — hoeveel unieke mensen elke versie hebben gezien.
  2. Conversies — hoeveel van hen hebben gedaan wat je belangrijk vindt (kopen, aanmelden, klikken).
  3. Betrouwbaarheidsniveau — hoe zeker je wilt zijn voordat je een winnaar aanroept. 95% is de industriestandaard.
  4. Hypothesetweezijdig vraagt "is B anders dan A?" (veiliger, de standaard); eenzijdig vraagt alleen "is B beter dan A?" (gevoeliger, maar je moet de richting vooraf bepalen voordat je de test uitvoert).

Het resultaat wordt in real-time bijgewerkt en de invoer wordt opgeslagen in de pagina-URL, dus je kunt een resultaat bladwijzeren of delen. Reset wist het formulier; Voorbeeldgegevens laden vult een uitgewerkt voorbeeld in.

Een uitgewerkt voorbeeld

BezoekersConversiesPercentage
A (controle)1.00010010,0%
B (variatie)1.00015015,0%

Dat is een lift van 5 procentpunten absolute waarde en een +50% relatieve lift. De calculator geeft een p-waarde van ongeveer 0,0007 — onder 0,05 — dus met 95% betrouwbaarheid is het resultaat statistisch significant. Ruwweg gezegd zou je, als de twee versies echt identiek waren, een verschil van deze grootte minder dan eens in de duizend tests zien.

De wiskunde (twee-proporties z-toets)

Achter de schermen is dit de standaard twee-proporties z-toets, dezelfde test die in inleidende statistiek wordt onderwezen en die door de meeste A/B-tools wordt gebruikt.

  1. Conversiesnelheid van elke groep:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    waarbij xx conversies zijn en nn bezoekers.

  2. Gepoelde snelheid, aangenomen (voor de nulhypothese) dat beide groepen één werkelijke snelheid delen:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Standaardfout van het verschil:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. De z-score — hoeveel standaardfouten de twee snelheden uit elkaar liggen:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. De p-waarde komt uit de standaard normale verdeling Φ\Phi. Tweezijdig: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Eenzijdig: p=1Φ(z)p = 1 - \Phi(z).

  6. Significant wanneer p<αp < \alpha, waarbij α=1betrouwbaarheid\alpha = 1 - \text{betrouwbaarheid} (dus 0,05 bij 95%).

De calculator rapporteert ook een betrouwbaarheidsinterval voor het verschil, berekend met de niet-gepoelde standaardfout p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: het plausibele bereik voor het werkelijke verschil. Als dat interval 0 uitsluit, is het resultaat significant.

0 -1.96 +1.96 no difference

Bij 95% betrouwbaarheid telt een z voorbij ±1,96 (de gearceerde staarten, 5% van het gebied) als significant.

Het resultaat eerlijk lezen

  • Statistische significantie is niet hetzelfde als zakelijke significantie. Een lift van 0,1% kan statistisch echt zijn, maar niet de moeite waard om uit te voeren.
  • Kijk niet vroeg in en stop niet voortijdig. De p-waarde dagelijks controleren en stoppen zodra deze onder 0,05 daalt, vergroot je vals-positieve percentage. Bepaal de steekproefomvang vooraf en laat de test afmaken.
  • Let op de vuistregel voor steekproefomvang. De normale benadering is betrouwbaar wanneer elke groep minstens ~10 conversies en ~10 niet-conversies heeft. Met kleine aantallen, behandel het resultaat als alleen richtinggevend.
  • Betrouwbaarheid ≠ waarschijnlijkheid dat B beter is. Een betrouwbaarheidsniveau van 95% betekent dat de procedure hooguit 5% van de tijd verkeerd is op lange termijn — het is een frequentistische verklaring, niet "95% kans dat B wint."
  • Één test, één metric. Het testen van veel metrics of varianten tegelijk vermenigvuldigt de kans op toeval; corrigeer ervoor (bijv. Bonferroni) of registreer vooraf de enkele metric die de test beslist.

Bereken het zelf

Elk fragment berekent de tweezijdige p-waarde voor het uitgewerkte voorbeeld hierboven.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

Veelgestelde vragen

Welke steekproefomvang heb ik nodig? Genoeg zodat een betekenisvolle lift detecteerbaar zou zijn. Staar minimaal naar een paar honderd conversies per variant; gebruik een speciale calculator voor steekproefomvang met je basispercentage en de kleinste lift die detecteerbaar is.

Tweezijdig of eenzijdig? Gebruik tweezijdig tenzij je een sterke, vooraf vastgestelde reden hebt om alleen verbetering te willen. Eenzijdig verdubbelt je gevoeligheid maar verbiedt reageren op B erger is.

Waarom toont de calculator een betrouwbaarheidsinterval? Het toont het plausibele bereik van het werkelijke verschil, niet alleen een ja/nee-antwoord. Een breed interval dat 0 overspant betekent "nog niet genoeg gegevens."

Is dit Bayesiaans? Nee — het is een frequentistische z-toets, de meest onderwezen en gebruikte methode. Bayesiaanse A/B-tools rapporteren "waarschijnlijkheid dat B A verslaat" in plaats van een p-waarde; beide zijn geldig, ze beantwoorden iets andere vragen.

Bronnen