A/B परीक्षण महत्व कैलकुलेटर
जांचें कि आपका A/B परीक्षण परिणाम सांख्यिकीय रूप से महत्वपूर्ण है। p-value, z-score, आत्मविश्वास अंतराल और सापेक्ष उत्थान प्राप्त करने के लिए दर्शक और रूपांतरण दर्ज करें।
A/B परीक्षण महत्व कैलकुलेटर
यह जांचने के लिए प्रत्येक वेरिएंट के लिए दर्शक और रूपांतरण दर्ज करें कि क्या अंतर वास्तविक है या केवल शोर है।
परिणाम
सांख्यिकीय रूप से महत्वपूर्ण
अंतर आपके चुने हुए आत्मविश्वास स्तर पर मौका के कारण असंभव है।
Chance this gap is just luck — lower is stronger.
How far apart the two rates are, in standard errors.
The likely range for the true difference.
दस्तावेज़ीकरण
एक मिनट में A/B परीक्षण
आपने एक बटन, एक हेडलाइन, या एक चेकआउट प्रवाह बदला। संस्करण A पुराना है, संस्करण B नया है। B बेहतर लगता है — इसने 15% दर्शकों को परिवर्तित किया जबकि A के लिए 10%। लेकिन क्या यह अंतर केवल भाग्य हो सकता है, उसी तरह जैसे दस बार सिक्का फ्लिप करने से सात बार चित आ सकता है?
यह कैलकुलेटर इसी सवाल का जवाब देता है। आप प्रत्येक संस्करण को कितने लोगों ने देखा और कितने परिवर्तित हुए, यह दर्ज करते हैं, और यह आपको बताता है कि आपके द्वारा मापा गया अंतर वास्तविक होने की संभावना यादृच्छिक शोर के बजाय क्या है। यदि यह संभावना काफी अधिक है, तो आपके पास एक विजेता है। यदि नहीं, तो आप परीक्षण चलाते रहें।
देखने के लिए एक नंबर है p-value: यदि दोनों संस्करण वास्तव में समान थे तो इस बड़े अंतर को देखने की संभावना। एक छोटा p-value (उदाहरण के लिए, 0.05 से नीचे) का अर्थ है "यह शुभकामनाओं से शायद ही कभी होता है, इसलिए अंतर संभवतः वास्तविक है।"
इसे कैसे उपयोग करें
- दर्शक — प्रत्येक संस्करण को कितने अद्वितीय लोगों ने देखा।
- रूपांतरण — इनमें से कितने ने वह काम किया जिसकी आप परवाह करते हैं (खरीदा, साइन अप किया, क्लिक किया)।
- आत्मविश्वास स्तर — एक विजेता को कॉल करने से पहले आप कितना सुनिश्चित होना चाहते हैं। 95% उद्योग मानक है।
- परिकल्पना — दोनों तरफा पूछता है "क्या B, A से अलग है?" (सुरक्षित, डिफ़ॉल्ट); एक तरफा केवल पूछता है "क्या B, A से बेहतर है?" (अधिक संवेदनशील, लेकिन आपको परीक्षण चलाने से पहले दिशा तय करनी होगी)।
परिणाम लाइव अपडेट होता है और इनपुट पेज URL में संग्रहीत होते हैं, इसलिए आप किसी परिणाम को बुकमार्क या साझा कर सकते हैं। रीसेट फॉर्म को साफ़ करता है; नमूना डेटा लोड करें एक काम किए गए उदाहरण को भरता है।
एक काम किए गए उदाहरण
| दर्शक | रूपांतरण | दर | |
|---|---|---|---|
| A (नियंत्रण) | 1,000 | 100 | 10.0% |
| B (भिन्नता) | 1,000 | 150 | 15.0% |
यह 5 प्रतिशत अंक पूर्ण वृद्धि और +50% सापेक्ष वृद्धि है। कैलकुलेटर लगभग 0.0007 का p-value लौटाता है — 0.05 के नीचे — इसलिए 95% आत्मविश्वास पर परिणाम सांख्यिकीय रूप से महत्वपूर्ण है। मोटे तौर पर, यदि दोनों संस्करण वास्तव में समान थे, तो आप एक हजार परीक्षणों में से कम से कम एक बार इस बड़े अंतर को देखेंगे।
गणित (दो-अनुपात z-परीक्षण)
इसके तहत यह मानक दो-अनुपात z-परीक्षण है, जो परिचयात्मक आंकड़ों में सिखाया जाता है और मुख्यधारा के A/B उपकरणों द्वारा उपयोग किया जाता है।
-
प्रत्येक समूह का रूपांतरण दर:
जहां रूपांतरण है और दर्शक हैं।
-
पूल किया गया दर, यह मानते हुए कि (शून्य परिकल्पना के लिए) दोनों समूह एक सत्य दर साझा करते हैं:
-
अंतर की मानक त्रुटि:
-
z-score — दोनों दरें कितने मानक त्रुटियों से अलग हैं:
-
p-value मानक सामान्य वितरण से आता है। दोनों तरफा: । एक तरफा: ।
-
महत्वपूर्ण जब , जहां (इसलिए 95% पर 0.05)।
कैलकुलेटर अंतर के लिए एक आत्मविश्वास अंतराल भी रिपोर्ट करता है, जिसकी गणना अनपूल्ड मानक त्रुटि के साथ की जाती है : सत्य अंतर के लिए प्रशंसनीय सीमा। यदि वह अंतराल 0 को बाहर करता है, तो परिणाम महत्वपूर्ण है।
95% आत्मविश्वास पर, ±1.96 से परे एक z (छायांकित पूंछ, क्षेत्र का 5%) महत्वपूर्ण के रूप में गिना जाता है।
परिणाम को ईमानदारी से पढ़ना
- सांख्यिकीय महत्व व्यावसायिक महत्व नहीं है। 0.1% लिफ्ट सांख्यिकीय रूप से वास्तविक हो सकता है फिर भी शिप करने के लायक नहीं।
- जल्दी झलक न लें और रुकें। P-value को हर दिन चेक करना और जैसे ही यह 0.05 से नीचे आए तो रुकना आपकी झूठी-सकारात्मक दर को बढ़ाता है। नमूना आकार आगे से तय करें और परीक्षण को समाप्त होने दें।
- नमूना आकार का नियम ध्यान में रखें। सामान्य सन्निकटन विश्वसनीय है जब प्रत्येक समूह के पास कम से कम ~10 रूपांतरण और ~10 गैर-रूपांतरण हैं। छोटी संख्याओं के साथ, परिणाम को केवल दिशात्मक के रूप में मानें।
- आत्मविश्वास ≠ संभावना B बेहतर है। 95% आत्मविश्वास स्तर का मतलब है कि प्रक्रिया लंबे समय में अधिकतम 5% समय गलत है — यह एक बारंबारता कथन है, "95% मौका B जीते" नहीं।
- एक परीक्षण, एक मीट्रिक। कई मेट्रिक्स या वेरिएंट का एक साथ परीक्षण करना एक भाग्य की संभावना को गुणा करता है; इसे सही करें (जैसे बोनफेरोनी) या एकल मीट्रिक को पूर्व-पंजीकृत करें जो परीक्षण तय करता है।
इसे स्वयं परिकलित करें
प्रत्येक स्निपेट ऊपर दिए गए काम किए गए उदाहरण के लिए दोनों तरफा p-value की गणना करता है।
1=2*(1-NORM.S.DIST(
2 (B2/A2 - B1/A1) /
3 SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4 TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
61from math import sqrt, erf
2
3def ab_pvalue(n1, x1, n2, x2, two_sided=True):
4 p1, p2 = x1 / n1, x2 / n2
5 p = (x1 + x2) / (n1 + n2)
6 se = sqrt(p * (1 - p) * (1 / n1 + 1 / n2))
7 z = (p2 - p1) / se
8 phi = lambda v: 0.5 * (1 + erf(v / sqrt(2))) # standard normal CDF
9 return 2 * (1 - phi(abs(z))) if two_sided else 1 - phi(z)
10
11print(ab_pvalue(1000, 100, 1000, 150)) # ~0.00072
121// erf via Abramowitz & Stegun 7.1.26
2function erf(x) {
3 const s = x < 0 ? -1 : 1;
4 x = Math.abs(x);
5 const t = 1 / (1 + 0.3275911 * x);
6 const y = 1 - ((((1.061405429 * t - 1.453152027) * t + 1.421413741) * t
7 - 0.284496736) * t + 0.254829592) * t * Math.exp(-x * x);
8 return s * y;
9}
10const phi = z => 0.5 * (1 + erf(z / Math.SQRT2));
11
12function abPValue(n1, x1, n2, x2, twoSided = true) {
13 const p1 = x1 / n1, p2 = x2 / n2, p = (x1 + x2) / (n1 + n2);
14 const se = Math.sqrt(p * (1 - p) * (1 / n1 + 1 / n2));
15 const z = (p2 - p1) / se;
16 return twoSided ? 2 * (1 - phi(Math.abs(z))) : 1 - phi(z);
17}
18console.log(abPValue(1000, 100, 1000, 150)); // ~0.00072
191public static double abPValue(int n1, int x1, int n2, int x2) {
2 double p1 = (double) x1 / n1, p2 = (double) x2 / n2;
3 double p = (double) (x1 + x2) / (n1 + n2);
4 double se = Math.sqrt(p * (1 - p) * (1.0 / n1 + 1.0 / n2));
5 double z = (p2 - p1) / se;
6 // Phi via the error function; erf approximated (A&S 7.1.26) separately.
7 double phi = 0.5 * (1 + erf(Math.abs(z) / Math.sqrt(2)));
8 return 2 * (1 - phi);
9}
101static double AbPValue(int n1, int x1, int n2, int x2) {
2 double p1 = (double)x1 / n1, p2 = (double)x2 / n2;
3 double p = (double)(x1 + x2) / (n1 + n2);
4 double se = Math.Sqrt(p * (1 - p) * (1.0 / n1 + 1.0 / n2));
5 double z = (p2 - p1) / se;
6 double phi = 0.5 * (1 + Erf(Math.Abs(z) / Math.Sqrt(2)));
7 return 2 * (1 - phi);
8}
91#include <cmath>
2
3double ab_pvalue(int n1, int x1, int n2, int x2) {
4 double p1 = (double)x1 / n1, p2 = (double)x2 / n2;
5 double p = (double)(x1 + x2) / (n1 + n2);
6 double se = std::sqrt(p * (1 - p) * (1.0 / n1 + 1.0 / n2));
7 double z = (p2 - p1) / se;
8 double phi = 0.5 * (1 + std::erf(std::fabs(z) / std::sqrt(2.0)));
9 return 2 * (1 - phi);
10}
111import "math"
2
3func abPValue(n1, x1, n2, x2 float64) float64 {
4 p1, p2 := x1/n1, x2/n2
5 p := (x1 + x2) / (n1 + n2)
6 se := math.Sqrt(p * (1 - p) * (1/n1 + 1/n2))
7 z := (p2 - p1) / se
8 phi := 0.5 * (1 + math.Erf(math.Abs(z)/math.Sqrt2))
9 return 2 * (1 - phi)
10}
111// erf from the `libm` crate; std has no erf.
2fn ab_pvalue(n1: f64, x1: f64, n2: f64, x2: f64) -> f64 {
3 let (p1, p2) = (x1 / n1, x2 / n2);
4 let p = (x1 + x2) / (n1 + n2);
5 let se = (p * (1.0 - p) * (1.0 / n1 + 1.0 / n2)).sqrt();
6 let z = (p2 - p1) / se;
7 let phi = 0.5 * (1.0 + libm::erf(z.abs() / 2f64.sqrt()));
8 2.0 * (1.0 - phi)
9}
101function ab_pvalue($n1, $x1, $n2, $x2) {
2 $p1 = $x1 / $n1; $p2 = $x2 / $n2;
3 $p = ($x1 + $x2) / ($n1 + $n2);
4 $se = sqrt($p * (1 - $p) * (1 / $n1 + 1 / $n2));
5 $z = ($p2 - $p1) / $se;
6 $phi = 0.5 * (1 + erf(abs($z) / sqrt(2)));
7 return 2 * (1 - $phi);
8}
91def ab_pvalue(n1, x1, n2, x2)
2 p1, p2 = x1.to_f / n1, x2.to_f / n2
3 p = (x1 + x2).to_f / (n1 + n2)
4 se = Math.sqrt(p * (1 - p) * (1.0 / n1 + 1.0 / n2))
5 z = (p2 - p1) / se
6 phi = 0.5 * (1 + Math.erf(z.abs / Math.sqrt(2)))
7 2 * (1 - phi)
8end
91# R has this built in: prop.test does the whole thing.
2prop.test(c(100, 150), c(1000, 1000), correct = FALSE)$p.value # ~0.00072
3FAQ
मुझे कितना नमूना आकार चाहिए? पर्याप्त कि एक अर्थपूर्ण लिफ्ट पता लगाया जा सके। एक मंजिल के रूप में, प्रत्येक वेरिएंट के लिए कम से कम कुछ सौ रूपांतरणों का लक्ष्य रखें; अपनी आधारभूत दर और सबसे छोटी लिफ्ट के साथ एक समर्पित नमूना-आकार कैलकुलेटर का उपयोग करें।
दोनों तरफा या एक तरफा? दो-तरफा का उपयोग करें जब तक कि आपके पास केवल सुधार की परवाह करने का एक दृढ़, पूर्व-प्रतिबद्ध कारण न हो। एक-तरफा आपकी संवेदनशीलता को दोगुना करता है लेकिन B के बदतर होने पर प्रतिक्रिया करने से मना करता है।
कैलकुलेटर एक आत्मविश्वास अंतराल क्यों दिखाता है? यह केवल हां/नहीं निर्णय के बजाय सत्य अंतर की प्रशंसनीय सीमा दिखाता है। एक विस्तृत अंतराल जो 0 को पार करता है "अभी तक पर्याप्त डेटा नहीं" का अर्थ है।
क्या यह Bayesian है? नहीं — यह एक बारंबारता z-परीक्षण है, सबसे व्यापक रूप से सिखाया और उपयोग किया जाने वाला तरीका। Bayesian A/B उपकरण p-value के बजाय "संभावना B को हरा देता है" रिपोर्ट करते हैं; दोनों मान्य हैं, वे थोड़े अलग सवालों का जवाब देते हैं।