Calculateur de significativité des tests A/B
Vérifiez si votre résultat de test A/B est statistiquement significatif. Entrez les visiteurs et les conversions pour obtenir la p-value, le score z, l'intervalle de confiance et l'augmentation relative.
Calculateur de significativité des tests A/B
Entrez les visiteurs et les conversions pour chaque variante pour vérifier si la différence est réelle ou juste du bruit.
Résultats
Statistiquement significatif
La différence est peu probable d'être due au hasard à votre niveau de confiance choisi.
Chance this gap is just luck — lower is stronger.
How far apart the two rates are, in standard errors.
The likely range for the true difference.
Documentation
Ce que fait un calculateur de significativité d’un test A/B
Un calculateur de significativité d’un test A/B vérifie si une différence entre deux versions d’un élément — une page web, un e-mail, un bouton de paiement — est un effet réel ou le fruit du hasard. Il prend le nombre de visiteurs et le nombre de conversions de chaque version, puis renvoie une p-valeur, un score z et un intervalle de confiance. Une conversion correspond à l’action considérée comme une réussite : un achat, une inscription ou un clic.
Comment utiliser le calculateur
Le calculateur a besoin de quatre nombres.
- Visiteurs (contrôle) : le nombre de personnes qui ont vu la version A, l’originale.
- Conversions (contrôle) : le nombre de personnes qui ont effectué une conversion.
- Visiteurs (variante) : le nombre de personnes qui ont vu la version B, la nouvelle version.
- Conversions (variante) : le nombre de personnes qui ont effectué une conversion.
Deux autres paramètres modifient la manière dont le résultat est évalué.
- Niveau de confiance définit le degré d’exigence du test. 95 % est la valeur par défaut la plus courante. Un niveau supérieur, comme 99 %, exige des preuves plus solides avant de déclarer un résultat significatif.
- Hypothèse définit le sens de la question. Un test bilatéral demande : « B est-elle différente de A, dans un sens ou dans l’autre ? » Un test unilatéral demande seulement : « B est-elle meilleure que A ? » Un test unilatéral ne devrait être choisi qu’avant l’arrivée des données, et uniquement si un résultat moins bon pour B ne modifierait aucune décision.
Le résultat est mis à jour au fur et à mesure de la saisie des nombres. Les valeurs saisies sont enregistrées dans l’adresse web de la page, de sorte qu’un résultat peut être ajouté aux favoris ou partagé sous forme de lien.
Formule du test A/B (test z pour deux proportions)
Le calculateur utilise un test z pour deux proportions, une méthode standard enseignée en statistique élémentaire pour comparer deux taux.
Étape 1. Taux de conversion de chaque groupe.
Ici, représente le nombre de conversions et le nombre de visiteurs, pour le groupe de contrôle (1) et la variante (2).
Étape 2. Taux de conversion groupé. Cette étape suppose, pour les besoins du test, que les deux groupes partagent un même taux réel sous-jacent.
Étape 3. Erreur standard de la différence, calculée à partir du taux groupé.
Étape 4. Score z, c’est-à-dire l’écart entre les deux taux, mesuré en erreurs standards.
Étape 5. P-valeur, obtenue à partir de la loi normale standard . Pour un test bilatéral : . Pour un test unilatéral : .
Étape 6. Conclusion. Le résultat est statistiquement significatif lorsque la p-valeur est inférieure à , où . Avec un niveau de confiance de 95 %, .
Le calculateur indique également un intervalle de confiance pour l’ampleur de la différence, . Cet intervalle utilise une erreur standard distincte, qui ne suppose pas que les deux groupes partagent un même taux :
L’intervalle est , où vaut 1,6449 avec un niveau de confiance de 90 %, 1,96 avec 95 % et 2,5758 avec 99 %. Si l’intervalle ne contient pas zéro, la différence est significative à ce niveau de confiance.
Exemple détaillé
| Visiteurs | Conversions | Taux | |
|---|---|---|---|
| Contrôle (A) | 1 000 | 100 | 10,00 % |
| Variante (B) | 1 000 | 150 | 15,00 % |
Le taux groupé est , soit 12,5 %. L’erreur standard groupée est d’environ 0,0148. Le score z est .
Pour un test bilatéral, cela donne une p-valeur d’environ 0,00072. Elle est inférieure au seuil habituel de 0,05 ; avec un niveau de confiance de 95 %, la différence est donc statistiquement significative. Si les deux versions produisaient réellement les mêmes résultats, un écart aussi important ou supérieur apparaîtrait par hasard dans environ 7 tests sur 10 000.
La différence absolue est de 5,00 points de pourcentage. L’augmentation relative est de 50 %, puisque le taux de B est 1,5 fois celui de A. L’intervalle de confiance à 95 % pour la différence réelle va environ de 2,11 % à 7,89 %.
Interpréter correctement le résultat
Un résultat statistiquement significatif ne mérite pas automatiquement d’être exploité. Une faible hausse, même réelle, peut ne pas justifier le coût de sa mise en production. Le jugement commercial reste nécessaire une fois les calculs terminés.
Vérifier la p-valeur chaque jour et arrêter le test dès qu’elle passe sous 0,05 augmente le risque de faux positif. Il vaut mieux choisir à l’avance une taille d’échantillon ou une durée d’exécution, puis laisser le test se terminer avant d’en lire le résultat.
L’approximation normale sur laquelle repose ce test fonctionne au mieux lorsque chaque groupe compte au moins environ 10 conversions et 10 non-conversions. Avec des nombres plus faibles, le résultat doit être considéré comme une indication approximative plutôt que comme une réponse définitive.
Un niveau de confiance de 95 % ne signifie pas qu’il y a une probabilité de 95 % que B soit réellement meilleure. Cela signifie que, si le même test était répété de nombreuses fois, cette méthode produirait un résultat significatif erroné au plus 5 % du temps. Il s’agit d’une propriété de la méthode, et non de ce résultat particulier.
Tester de nombreuses mesures ou variantes simultanément augmente la probabilité qu’au moins une comparaison paraisse significative par simple hasard. Choisir une seule mesure avant le début du test évite ce problème.
Foire aux questions
De quelle taille d’échantillon un test A/B a-t-il besoin ? Il faut suffisamment de visiteurs pour qu’une hausse importante apparaisse effectivement comme significative. Un seuil approximatif est de quelques centaines de conversions par version. Un calculateur dédié de taille d’échantillon, utilisant le taux de référence et la plus petite hausse à détecter, fournit un nombre plus fiable avant le début du test.
Le test doit-il être unilatéral ou bilatéral ? Le test bilatéral est le choix par défaut le plus prudent, car il peut signaler que B est meilleure ou moins bonne que A. Le test unilatéral est plus sensible à une amélioration, mais ne peut pas signaler une dégradation ; il ne doit donc être utilisé que si un résultat moins bon pour B ne modifierait aucune décision.
Pourquoi le calculateur indique-t-il un intervalle de confiance ? Un intervalle de confiance montre la plage probable de la différence réelle, et pas seulement une étiquette « significatif » ou « non significatif ». Un intervalle large qui englobe zéro signifie généralement que le test nécessite davantage de données.
Ce calculateur est-il bayésien ? Non. Il utilise un test z fréquentiste, la méthode la plus couramment enseignée et utilisée pour les tests A/B. Un outil bayésien indique plutôt la probabilité que B soit meilleure que A. Les deux méthodes sont valides, mais elles répondent à des questions légèrement différentes.
Que se passe-t-il si le calculateur affiche une erreur ? Une erreur apparaît si le nombre de conversions est négatif, s’il dépasse le nombre de visiteurs, ou si le taux de conversion combiné des deux groupes est de 0 % ou de 100 %, car la formule du test z ne peut alors pas diviser par une erreur standard nulle.