Passer au contenu

Calculateur de significativité des tests A/B

Vérifiez si votre résultat de test A/B est statistiquement significatif. Entrez les visiteurs et les conversions pour obtenir la p-value, le score z, l'intervalle de confiance et l'augmentation relative.

Calculateur de significativité des tests A/B

Entrez les visiteurs et les conversions pour chaque variante pour vérifier si la différence est réelle ou juste du bruit.

Contrôle (A)
Variation (B)

Résultats

Statistiquement significatif

La différence est peu probable d'être due au hasard à votre niveau de confiance choisi.

P-value
0.0007

Chance this gap is just luck — lower is stronger.

Score z
3.381

How far apart the two rates are, in standard errors.

Augmentation relative
+50.0%
Taux de contrôle
10.00%
Taux de variation
15.00%
Différence absolue
+5.00 pp
Intervalle de confiance (différence) · 95%
2.11% to 7.89%

The likely range for the true difference.

Taux de conversion par variante
Taux de conversion par variante. Grouped bar chart with 1 series: Taux de conversion.0%5%10%15%Taux de conversionContrôle (A)Variation (B)10%15%
Calculateur de chargement...
📚

Documentation

Tests A/B en une minute

Vous avez changé un bouton, un titre ou un processus de paiement. La version A est l'ancienne, la version B est la nouvelle. B semble meilleure — elle a converti 15 % des visiteurs contre 10 % pour A. Mais cet écart pourrait-il simplement être une coïncidence, comme obtenir sept têtes sur dix lancers de pièce ?

Ce calculateur répond exactement à cette question. Vous entrez le nombre de personnes qui ont vu chaque version et le nombre qui ont converti, et il vous indique la probabilité que la différence mesurée soit réelle plutôt que du bruit aléatoire. Si cette probabilité est suffisamment élevée, vous avez un gagnant. Sinon, vous continuez le test.

Le seul nombre à surveiller est la p-value : la probabilité de voir un écart au moins aussi grand si les deux versions étaient réellement identiques. Une petite p-value (par exemple, inférieure à 0,05) signifie « cela se produirait rarement par chance, donc la différence est probablement réelle ».

Comment l'utiliser

  1. Visiteurs — le nombre unique de personnes à qui chaque version a été présentée.
  2. Conversions — combien d'entre eux ont fait ce qui vous importe (acheté, inscrit, cliqué).
  3. Niveau de confiance — le degré de certitude avant de déclarer un gagnant. 95 % est la norme de l'industrie.
  4. Hypothèsebilatéral demande « B est-il différent de A ? » (plus sûr, par défaut) ; unilatéral demande seulement « B est-il meilleur que A ? » (plus sensible, mais vous devez décider la direction avant d'exécuter le test).

Le résultat se met à jour en temps réel et les entrées sont stockées dans l'URL de la page, vous pouvez donc marquer ou partager un résultat. Réinitialiser efface le formulaire ; Charger des données d'exemple remplit un exemple travaillé.

Un exemple travaillé

VisiteursConversionsTaux
A (contrôle)1 00010010,0 %
B (variation)1 00015015,0 %

C'est une augmentation absolue de 5 points de pourcentage et une augmentation relative de +50 %. Le calculateur retourne une p-value d'environ 0,0007 — inférieure à 0,05 — donc avec une confiance de 95 % le résultat est statistiquement significatif. Grosso modo, si les deux versions étaient vraiment identiques, vous verriez un écart de cette taille moins d'une fois sur mille tests.

Les mathématiques (test z pour deux proportions)

Sous le capot, c'est le test z standard pour deux proportions, le même test enseigné dans les statistiques introductives et utilisé par les principaux outils A/B.

  1. Taux de conversion de chaque groupe :

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    xx est conversions et nn est visiteurs.

  2. Taux groupé, en supposant (pour l'hypothèse nulle) que les deux groupes partagent un seul taux vrai :

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Erreur standard de la différence :

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Le score z — combien d'erreurs standard séparent les deux taux :

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. La p-value provient de la distribution normale standard Φ\Phi. Bilatéral : p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Unilatéral : p=1Φ(z)p = 1 - \Phi(z).

  6. Significatif quand p<αp < \alpha, où α=1confiance\alpha = 1 - \text{confiance} (donc 0,05 à 95 %).

Le calculateur rapporte également un intervalle de confiance pour la différence, calculé avec l'erreur standard non groupée p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}} : la plage plausible pour l'écart vrai. Si cet intervalle exclut 0, le résultat est significatif.

0 -1.96 +1.96 no difference

Avec une confiance de 95 %, un z au-delà de ±1,96 (les queues ombragées, 5 % de l'aire) compte comme significatif.

Lire le résultat honnêtement

  • La significativité statistique n'est pas la significativité métier. Une augmentation de 0,1 % peut être statistiquement réelle mais ne vaut pas la peine de déployer.
  • Ne regardez pas et n'arrêtez pas tôt. Vérifier la p-value chaque jour et arrêter le moment où elle tombe sous 0,05 gonfle votre taux de faux positifs. Décidez la taille d'échantillon à l'avance et laissez le test se terminer.
  • Observez la règle du pouce sur la taille d'échantillon. L'approximation normale est fiable quand chaque groupe a au moins ~10 conversions et ~10 non-conversions. Avec de petits nombres, traitez le résultat comme directionnel uniquement.
  • Confiance ≠ probabilité que B soit meilleur. Un niveau de confiance de 95 % signifie que la procédure est erronée au maximum 5 % du temps sur le long terme — c'est une affirmation fréquentiste, pas « 95 % de chance que B gagne ».
  • Un test, une métrique. Tester plusieurs métriques ou variantes à la fois multiplie la chance d'une coïncidence ; corrigez-la (par exemple, Bonferroni) ou pré-enregistrez la seule métrique qui décide du test.

Calculez-le vous-même

Chaque snippet calcule la p-value bilatérale pour l'exemple travaillé ci-dessus.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

FAQ

De quelle taille d'échantillon ai-je besoin ? Assez pour qu'une augmentation significative soit détectable. En tant que plancher, visez au moins quelques centaines de conversions par variante ; utilisez un calculateur de taille d'échantillon dédié avec votre taux de base et l'augmentation minimale qui en vaut la peine.

Bilatéral ou unilatéral ? Utilisez bilatéral sauf si vous avez une raison ferme et pré-engagée de ne vous soucier que de l'amélioration. Unilatéral double votre sensibilité mais vous interdit de réagir si B est pire.

Pourquoi le calculateur affiche-t-il un intervalle de confiance ? Il affiche la plage plausible de la vraie différence, pas juste un verdict oui/non. Un intervalle large qui enjambe 0 signifie « pas assez de données pour le moment ».

Est-ce bayésien ? Non — c'est un test z fréquentiste, la méthode la plus largement enseignée et utilisée. Les outils A/B bayésiens rapportent « probabilité que B batte A » au lieu d'une p-value ; les deux sont valides, ils répondent à des questions légèrement différentes.

Sources