A/B-Test-Signifikanzrechner
Überprüfen Sie, ob Ihr A/B-Test-Ergebnis statistisch signifikant ist. Geben Sie Besucher und Konversionen ein, um den p-Wert, z-Wert, Konfidenzintervall und relativen Anstieg zu erhalten.
A/B-Test-Signifikanzrechner
Geben Sie Besucher und Konversionen für jede Variante ein, um zu überprüfen, ob der Unterschied real ist oder nur Rauschen.
Ergebnisse
Statistisch Signifikant
Der Unterschied ist bei Ihrem gewählten Konfidenzniveau unwahrscheinlich zufällig.
Chance this gap is just luck — lower is stronger.
How far apart the two rates are, in standard errors.
The likely range for the true difference.
Dokumentation
Was ein Signifikanzrechner für A/B-Tests leistet
Ein Signifikanzrechner für A/B-Tests prüft, ob ein Unterschied zwischen zwei Versionen von etwas – einer Webseite, einer E-Mail oder einer Checkout-Schaltfläche – ein echter Effekt oder nur Zufall ist. Er verwendet die Besucherzahl und die Zahl der Conversions für jede Version und gibt einen p-Wert, einen z-Wert und ein Konfidenzintervall aus. Eine Conversion ist jede Handlung, die als Erfolg gilt: ein Kauf, eine Registrierung oder ein Klick.
So wird der Rechner verwendet
Der Rechner benötigt vier Zahlen.
- Besucher (Kontrollgruppe): Wie viele Personen Version A, das Original, gesehen haben.
- Conversions (Kontrollgruppe): Wie viele davon konvertiert haben.
- Besucher (Variante): Wie viele Personen Version B, die neue Version, gesehen haben.
- Conversions (Variante): Wie viele davon konvertiert haben.
Zwei weitere Einstellungen beeinflussen die Bewertung des Ergebnisses.
- Konfidenzniveau legt fest, wie streng der Test ist. 95 % ist der übliche Standardwert. Ein höheres Niveau wie 99 % verlangt stärkere Belege, bevor ein Ergebnis als signifikant bezeichnet wird.
- Hypothese legt die Richtung der Fragestellung fest. Ein zweiseitiger Test fragt: „Unterscheidet sich B von A, und zwar in beide Richtungen?“ Ein einseitiger Test fragt nur: „Ist B besser als A?“ Ein einseitiger Test sollte nur vor der Datenerhebung gewählt werden und nur dann, wenn ein schlechteres Ergebnis für B keine Entscheidung ändern würde.
Das Ergebnis wird aktualisiert, sobald die Zahlen eingegeben werden. Die Eingaben werden in der Webadresse der Seite gespeichert, sodass ein Ergebnis als Lesezeichen gespeichert oder als Link geteilt werden kann.
Formel für den A/B-Test (z-Test für zwei Anteile)
Der Rechner verwendet einen z-Test für zwei Anteile, eine Standardmethode aus der einführenden Statistik zum Vergleich zweier Raten.
Schritt 1. Conversion-Rate jeder Gruppe.
Dabei ist die Zahl der Conversions und die Zahl der Besucher, für die Kontrollgruppe (1) und die Variante (2).
Schritt 2. Gepoolte Conversion-Rate. Dieser Schritt nimmt für den Test an, dass beide Gruppen dieselbe zugrunde liegende tatsächliche Rate haben.
Schritt 3. Standardfehler des Unterschieds, berechnet aus der gepoolten Rate.
Schritt 4. z-Wert, der Abstand zwischen den beiden Raten, gemessen in Standardfehlern.
Schritt 5. p-Wert, entnommen aus der Standardnormalverteilung . Für einen zweiseitigen Test gilt: . Für einen einseitigen Test gilt: .
Schritt 6. Beurteilung. Das Ergebnis gilt als statistisch signifikant, wenn der p-Wert kleiner als ist, wobei gilt. Bei einem Konfidenzniveau von 95 % gilt .
Der Rechner gibt außerdem ein Konfidenzintervall für die Größe des Unterschieds aus. Dieses Intervall verwendet einen separaten Standardfehler, der nicht annimmt, dass beide Gruppen dieselbe Rate haben:
Das Intervall ist , wobei bei einem Konfidenzniveau von 90 % 1,6449, bei 95 % 1,96 und bei 99 % 2,5758 beträgt. Enthält das Intervall null nicht, ist der Unterschied bei diesem Konfidenzniveau signifikant.
Rechenbeispiel
| Besucher | Conversions | Zinssatz | |
|---|---|---|---|
| Kontrollgruppe (A) | 1.000 | 100 | 10,00 % |
| Variante (B) | 1.000 | 150 | 15,00 % |
Die gepoolte Rate beträgt oder 12,5 %. Der gepoolte Standardfehler beträgt ungefähr 0,0148. Der z-Wert beträgt .
Für einen zweiseitigen Test ergibt sich daraus ein p-Wert von ungefähr 0,00072. Dieser liegt unter dem üblichen Schwellenwert von 0,05. Bei einem Konfidenzniveau von 95 % ist der Unterschied daher statistisch signifikant. Wenn beide Versionen tatsächlich gleich gut abgeschnitten hätten, würde ein ebenso großer oder größerer Unterschied allein durch Zufall in etwa 7 von jeweils 10.000 Tests auftreten.
Der absolute Unterschied beträgt 5,00 Prozentpunkte. Die relative Steigerung beträgt 50 %, da die Rate von B 1,5-mal so hoch ist wie die Rate von A. Das 95 %-Konfidenzintervall für den tatsächlichen Unterschied reicht ungefähr von 2,11 % bis 7,89 %.
Ergebnisse richtig interpretieren
Ein statistisch signifikantes Ergebnis ist nicht automatisch ein Ergebnis, aus dem sich eine sinnvolle Maßnahme ableiten lässt. Eine kleine, echte Steigerung ist möglicherweise die Kosten für ihre Umsetzung nicht wert. Nach der mathematischen Auswertung bleibt die geschäftliche Beurteilung wichtig.
Wenn der p-Wert täglich geprüft und der Test in dem Moment beendet wird, in dem er 0,05 unterschreitet, steigt die Wahrscheinlichkeit eines falsch positiven Ergebnisses. Besser ist es, die Stichprobengröße oder die Laufzeit im Voraus festzulegen und den Test vor der Auswertung des Ergebnisses abzuschließen.
Die Normalapproximation, auf der dieser Test beruht, funktioniert am besten, wenn jede Gruppe mindestens ungefähr 10 Conversions und 10 Nicht-Conversions aufweist. Bei kleineren Zahlen sollte das Ergebnis eher als grobes Signal denn als verlässliche Antwort betrachtet werden.
Ein Konfidenzniveau von 95 % bedeutet nicht, dass die Wahrscheinlichkeit, dass B tatsächlich besser ist, 95 % beträgt. Es bedeutet, dass diese Methode bei einer vielfachen Wiederholung desselben Tests höchstens in 5 % der Fälle ein falsches signifikantes Ergebnis liefern würde. Das ist eine Aussage über die Methode, nicht über dieses einzelne Ergebnis.
Das gleichzeitige Testen vieler Kennzahlen oder Varianten erhöht die Wahrscheinlichkeit, dass mindestens ein Vergleich rein zufällig signifikant aussieht. Die Auswahl einer Kennzahl vor Beginn des Tests vermeidet dieses Problem.
Häufig gestellte Fragen
Welche Stichprobengröße benötigt ein A/B-Test? Es werden genügend Besucher benötigt, damit eine bedeutsame Steigerung tatsächlich als signifikant sichtbar wird. Eine grobe Untergrenze sind einige hundert Conversions pro Version. Ein spezieller Stichprobengrößenrechner liefert anhand der Ausgangsrate und der kleinsten erkennbaren Steigerung vor Testbeginn eine verlässlichere Zahl.
Sollte der Test einseitig oder zweiseitig sein? Der zweiseitige Test ist der sicherere Standard, da er erkennen kann, ob B besser oder schlechter als A ist. Der einseitige Test reagiert empfindlicher auf eine Verbesserung, kann aber ein schlechteres Ergebnis nicht erkennen. Er sollte daher nur verwendet werden, wenn ein schlechteres Ergebnis von B keine Entscheidung ändern würde.
Warum gibt der Rechner ein Konfidenzintervall aus? Ein Konfidenzintervall zeigt den wahrscheinlichen Bereich des tatsächlichen Unterschieds und nicht nur die Kennzeichnung „signifikant“ oder „nicht signifikant“. Ein breites Intervall, das null umfasst, bedeutet normalerweise, dass der Test mehr Daten benötigt.
Ist dies ein Bayes-Rechner? Nein. Er verwendet einen frequentistischen z-Test, die am häufigsten gelehrte und eingesetzte Methode für A/B-Tests. Ein Bayes-Verfahren gibt stattdessen die Wahrscheinlichkeit an, dass B besser als A ist. Beide Methoden sind gültig, beantworten aber etwas unterschiedliche Fragen.
Was ist, wenn der Rechner einen Fehler anzeigt? Ein Fehler wird angezeigt, wenn eine Conversion-Zahl negativ ist, die Besucherzahl überschreitet oder die kombinierte Conversion-Rate beider Gruppen 0 % oder 100 % beträgt, da die z-Test-Formel in diesem Fall nicht durch einen Standardfehler von null teilen kann.