A/B Test Significantie Calculator
Controleer of je A/B-testresultaat statistisch significant is. Voer bezoekers en conversies in om de p-waarde, z-score, betrouwbaarheidsinterval en relatieve lift te krijgen.
A/B Test Significantie Calculator
Voer bezoekers en conversies in voor elke variant om te controleren of het verschil echt is of alleen ruis.
Resultaten
Statistisch Significant
Het verschil is onwaarschijnlijk door toeval op je gekozen betrouwbaarheidsniveau.
Chance this gap is just luck — lower is stronger.
How far apart the two rates are, in standard errors.
The likely range for the true difference.
Documentatie
Wat een significantiecalculator voor A/B-tests doet
Een significantiecalculator voor A/B-tests controleert of een verschil tussen twee versies van iets — een webpagina, een e-mail, een afrekenknop — een echt effect is of slechts toeval. De calculator neemt het aantal bezoekers en het aantal conversies voor elke versie als invoer en geeft een p-waarde, een z-score en een betrouwbaarheidsinterval. Een conversie is elke actie die als succes geldt: een aankoop, een registratie of een klik.
De calculator gebruiken
De calculator heeft vier getallen nodig.
- Bezoekers (controle): hoeveel mensen versie A, de oorspronkelijke versie, hebben gezien.
- Conversies (controle): hoeveel van hen een conversie hebben uitgevoerd.
- Bezoekers (variant): hoeveel mensen versie B, de nieuwe versie, hebben gezien.
- Conversies (variant): hoeveel van hen een conversie hebben uitgevoerd.
Nog twee instellingen bepalen hoe het resultaat wordt beoordeeld.
- Betrouwbaarheidsniveau bepaalt hoe streng de test is. 95% is de gebruikelijke standaardinstelling. Een hoger niveau, zoals 99%, vereist sterker bewijs voordat een resultaat significant wordt genoemd.
- Hypothese bepaalt de richting van de vraag. Bij een tweezijdige toets is de vraag: "verschilt B van A, in welke richting dan ook?" Bij een eenzijdige toets is alleen de vraag: "is B beter dan A?" Een eenzijdige toets mag alleen vóór het binnenkomen van de gegevens worden gekozen, en alleen wanneer een slechter resultaat voor B geen enkele beslissing zou veranderen.
Het resultaat wordt bijgewerkt zodra de getallen worden ingevoerd. De invoer wordt opgeslagen in het webadres van de pagina, zodat een resultaat als bladwijzer kan worden opgeslagen of als link kan worden gedeeld.
A/B-testformule (z-toets voor twee proporties)
De calculator gebruikt een z-toets voor twee proporties, een standaardmethode die in inleidende statistiekcursussen wordt onderwezen voor het vergelijken van twee percentages.
Stap 1. Conversiepercentage van elke groep.
Hier is het aantal conversies en het aantal bezoekers, voor de controlegroep (1) en de variantgroep (2).
Stap 2. Gepoold conversiepercentage. Bij deze stap wordt voor deze toets aangenomen dat beide groepen dezelfde werkelijke onderliggende conversieratio hebben.
Stap 3. Standaardfout van het verschil, berekend op basis van het gepoolde percentage.
Stap 4. Z-score, het verschil tussen de twee percentages uitgedrukt in standaardfouten.
Stap 5. P-waarde, afgeleid uit de standaardnormale verdeling . Voor een tweezijdige toets: . Voor een eenzijdige toets: .
Stap 6. Beoordeling. Het resultaat geldt als statistisch significant wanneer de p-waarde kleiner is dan , waarbij . Bij een betrouwbaarheidsniveau van 95% is .
De calculator rapporteert ook een betrouwbaarheidsinterval voor de omvang van het verschil, . Dit interval gebruikt een afzonderlijke standaardfout, waarbij niet wordt aangenomen dat de twee groepen hetzelfde percentage hebben:
Het interval is , waarbij gelijk is aan 1,6449 bij een betrouwbaarheidsniveau van 90%, 1,96 bij 95% en 2,5758 bij 99%. Als het interval nul niet bevat, is het verschil significant op dat betrouwbaarheidsniveau.
Uitgewerkt voorbeeld
| Bezoekers | Conversies | Percentage | |
|---|---|---|---|
| Controle (A) | 1.000 | 100 | 10,00% |
| Variant (B) | 1.000 | 150 | 15,00% |
Het gepoolde percentage is , oftewel 12,5%. De gepoolde standaardfout is ongeveer 0,0148. De z-score is .
Bij een tweezijdige toets geeft dit een p-waarde van ongeveer 0,00072. Dat ligt onder de gebruikelijke drempel van 0,05, dus is het verschil bij een betrouwbaarheidsniveau van 95% statistisch significant. Als de twee versies werkelijk hetzelfde presteerden, zou een verschil van deze omvang of groter door toeval alleen voorkomen in ongeveer 7 van elke 10.000 tests.
Het absolute verschil is 5,00 procentpunt. De relatieve stijging is 50%, omdat het percentage van B 1,5 keer zo hoog is als dat van A. Het 95%-betrouwbaarheidsinterval voor het werkelijke verschil loopt ongeveer van 2,11% tot 7,89%.
Het resultaat correct interpreteren
Een statistisch significant resultaat is niet automatisch een resultaat waarnaar moet worden gehandeld. Een kleine, echte stijging is de kosten van implementatie mogelijk niet waard. Ook nadat de berekening is uitgevoerd, blijft zakelijk inzicht van belang.
Elke dag de p-waarde controleren en de test stoppen zodra deze 0,05 overschrijdt, vergroot de kans op een vals-positief resultaat. Het is beter om vooraf een steekproefomvang of testduur te kiezen en de test af te laten lopen voordat het resultaat wordt geïnterpreteerd.
De normale benadering waarop deze test berust werkt het best wanneer elke groep ten minste ongeveer 10 conversies en 10 niet-conversies heeft. Bij kleinere aantallen moet het resultaat worden gezien als een ruwe aanwijzing en niet als een definitief antwoord.
Een betrouwbaarheidsniveau van 95% betekent niet dat er een kans van 95% is dat B werkelijk beter is. Het betekent dat deze methode, als dezelfde test vele malen zou worden herhaald, hoogstens in 5% van de gevallen ten onrechte een significant resultaat zou geven. Dat is een uitspraak over de methode, niet over dit ene resultaat.
Het gelijktijdig testen van veel statistieken of varianten vergroot de kans dat ten minste één vergelijking puur door toeval significant lijkt. Door vóór de start van de test één statistiek te kiezen, wordt dit probleem vermeden.
Veelgestelde vragen
Welke steekproefomvang heeft een A/B-test nodig? Er zijn voldoende bezoekers nodig zodat een betekenisvolle stijging daadwerkelijk als significant naar voren zou komen. Een ruwe ondergrens is enkele honderden conversies per versie. Een speciale calculator voor de steekproefomvang, die het basispercentage en de kleinst detecteerbare stijging gebruikt, geeft vóór de start van een test een nauwkeuriger aantal.
Moet de test eenzijdig of tweezijdig zijn? Tweezijdig is de veiligere standaardkeuze, omdat daarmee kan worden vastgesteld dat B zowel beter als slechter is dan A. Eenzijdig is gevoeliger voor een verbetering, maar kan een slechter resultaat niet signaleren. Gebruik deze optie daarom alleen wanneer een slechter resultaat voor B geen enkele beslissing zou veranderen.
Waarom rapporteert de calculator een betrouwbaarheidsinterval? Een betrouwbaarheidsinterval toont het waarschijnlijke bereik van het werkelijke verschil, en niet alleen het label significant of niet-significant. Een breed interval dat nul omvat, betekent meestal dat de test meer gegevens nodig heeft.
Is dit een Bayesiaanse calculator? Nee. De calculator gebruikt een frequentistische z-toets, de methode die het vaakst wordt onderwezen en gebruikt voor A/B-tests. Een Bayesiaans hulpmiddel rapporteert daarentegen de kans dat B beter is dan A. Beide methoden zijn geldig; ze beantwoorden enigszins verschillende vragen.
Wat als de calculator een foutmelding toont? Er verschijnt een foutmelding als een conversieaantal negatief is, als het groter is dan het aantal bezoekers, of als het gecombineerde conversiepercentage van beide groepen 0% of 100% is, omdat de formule van de z-toets in dat geval niet kan delen door een standaardfout die nul is.