सामग्री पर जाएं

A/B परीक्षण महत्व कैलकुलेटर

जांचें कि आपका A/B परीक्षण परिणाम सांख्यिकीय रूप से महत्वपूर्ण है। p-value, z-score, आत्मविश्वास अंतराल और सापेक्ष उत्थान प्राप्त करने के लिए दर्शक और रूपांतरण दर्ज करें।

A/B परीक्षण महत्व कैलकुलेटर

यह जांचने के लिए प्रत्येक वेरिएंट के लिए दर्शक और रूपांतरण दर्ज करें कि क्या अंतर वास्तविक है या केवल शोर है।

नियंत्रण (A)
भिन्नता (B)

परिणाम

सांख्यिकीय रूप से महत्वपूर्ण

अंतर आपके चुने हुए आत्मविश्वास स्तर पर मौका के कारण असंभव है।

P-value
0.0007

Chance this gap is just luck — lower is stronger.

Z-score
3.381

How far apart the two rates are, in standard errors.

सापेक्ष उत्थान
+50.0%
नियंत्रण दर
10.00%
भिन्नता दर
15.00%
पूर्ण अंतर
+5.00 pp
आत्मविश्वास अंतराल (अंतर) · 95%
2.11% to 7.89%

The likely range for the true difference.

भिन्नता द्वारा रूपांतरण दर
भिन्नता द्वारा रूपांतरण दर. Grouped bar chart with 1 series: रूपांतरण दर.0%5%10%15%रूपांतरण दरनियंत्रण (A)भिन्नता (B)10%15%
लोडिंग कैलकुलेटर...
📚

दस्तावेज़ीकरण

एक मिनट में A/B परीक्षण

आपने एक बटन, एक हेडलाइन, या एक चेकआउट प्रवाह बदला। संस्करण A पुराना है, संस्करण B नया है। B बेहतर लगता है — इसने 15% दर्शकों को परिवर्तित किया जबकि A के लिए 10%। लेकिन क्या यह अंतर केवल भाग्य हो सकता है, उसी तरह जैसे दस बार सिक्का फ्लिप करने से सात बार चित आ सकता है?

यह कैलकुलेटर इसी सवाल का जवाब देता है। आप प्रत्येक संस्करण को कितने लोगों ने देखा और कितने परिवर्तित हुए, यह दर्ज करते हैं, और यह आपको बताता है कि आपके द्वारा मापा गया अंतर वास्तविक होने की संभावना यादृच्छिक शोर के बजाय क्या है। यदि यह संभावना काफी अधिक है, तो आपके पास एक विजेता है। यदि नहीं, तो आप परीक्षण चलाते रहें।

देखने के लिए एक नंबर है p-value: यदि दोनों संस्करण वास्तव में समान थे तो इस बड़े अंतर को देखने की संभावना। एक छोटा p-value (उदाहरण के लिए, 0.05 से नीचे) का अर्थ है "यह शुभकामनाओं से शायद ही कभी होता है, इसलिए अंतर संभवतः वास्तविक है।"

इसे कैसे उपयोग करें

  1. दर्शक — प्रत्येक संस्करण को कितने अद्वितीय लोगों ने देखा।
  2. रूपांतरण — इनमें से कितने ने वह काम किया जिसकी आप परवाह करते हैं (खरीदा, साइन अप किया, क्लिक किया)।
  3. आत्मविश्वास स्तर — एक विजेता को कॉल करने से पहले आप कितना सुनिश्चित होना चाहते हैं। 95% उद्योग मानक है।
  4. परिकल्पनादोनों तरफा पूछता है "क्या B, A से अलग है?" (सुरक्षित, डिफ़ॉल्ट); एक तरफा केवल पूछता है "क्या B, A से बेहतर है?" (अधिक संवेदनशील, लेकिन आपको परीक्षण चलाने से पहले दिशा तय करनी होगी)।

परिणाम लाइव अपडेट होता है और इनपुट पेज URL में संग्रहीत होते हैं, इसलिए आप किसी परिणाम को बुकमार्क या साझा कर सकते हैं। रीसेट फॉर्म को साफ़ करता है; नमूना डेटा लोड करें एक काम किए गए उदाहरण को भरता है।

एक काम किए गए उदाहरण

दर्शकरूपांतरणदर
A (नियंत्रण)1,00010010.0%
B (भिन्नता)1,00015015.0%

यह 5 प्रतिशत अंक पूर्ण वृद्धि और +50% सापेक्ष वृद्धि है। कैलकुलेटर लगभग 0.0007 का p-value लौटाता है — 0.05 के नीचे — इसलिए 95% आत्मविश्वास पर परिणाम सांख्यिकीय रूप से महत्वपूर्ण है। मोटे तौर पर, यदि दोनों संस्करण वास्तव में समान थे, तो आप एक हजार परीक्षणों में से कम से कम एक बार इस बड़े अंतर को देखेंगे।

गणित (दो-अनुपात z-परीक्षण)

इसके तहत यह मानक दो-अनुपात z-परीक्षण है, जो परिचयात्मक आंकड़ों में सिखाया जाता है और मुख्यधारा के A/B उपकरणों द्वारा उपयोग किया जाता है।

  1. प्रत्येक समूह का रूपांतरण दर:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    जहां xx रूपांतरण है और nn दर्शक हैं।

  2. पूल किया गया दर, यह मानते हुए कि (शून्य परिकल्पना के लिए) दोनों समूह एक सत्य दर साझा करते हैं:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. अंतर की मानक त्रुटि:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. z-score — दोनों दरें कितने मानक त्रुटियों से अलग हैं:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. p-value मानक सामान्य वितरण Φ\Phi से आता है। दोनों तरफा: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right)। एक तरफा: p=1Φ(z)p = 1 - \Phi(z)

  6. महत्वपूर्ण जब p<αp < \alpha, जहां α=1आत्मविश्वास\alpha = 1 - \text{आत्मविश्वास} (इसलिए 95% पर 0.05)।

कैलकुलेटर अंतर के लिए एक आत्मविश्वास अंतराल भी रिपोर्ट करता है, जिसकी गणना अनपूल्ड मानक त्रुटि के साथ की जाती है p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: सत्य अंतर के लिए प्रशंसनीय सीमा। यदि वह अंतराल 0 को बाहर करता है, तो परिणाम महत्वपूर्ण है।

0 -1.96 +1.96 no difference

95% आत्मविश्वास पर, ±1.96 से परे एक z (छायांकित पूंछ, क्षेत्र का 5%) महत्वपूर्ण के रूप में गिना जाता है।

परिणाम को ईमानदारी से पढ़ना

  • सांख्यिकीय महत्व व्यावसायिक महत्व नहीं है। 0.1% लिफ्ट सांख्यिकीय रूप से वास्तविक हो सकता है फिर भी शिप करने के लायक नहीं।
  • जल्दी झलक न लें और रुकें। P-value को हर दिन चेक करना और जैसे ही यह 0.05 से नीचे आए तो रुकना आपकी झूठी-सकारात्मक दर को बढ़ाता है। नमूना आकार आगे से तय करें और परीक्षण को समाप्त होने दें।
  • नमूना आकार का नियम ध्यान में रखें। सामान्य सन्निकटन विश्वसनीय है जब प्रत्येक समूह के पास कम से कम ~10 रूपांतरण और ~10 गैर-रूपांतरण हैं। छोटी संख्याओं के साथ, परिणाम को केवल दिशात्मक के रूप में मानें।
  • आत्मविश्वास ≠ संभावना B बेहतर है। 95% आत्मविश्वास स्तर का मतलब है कि प्रक्रिया लंबे समय में अधिकतम 5% समय गलत है — यह एक बारंबारता कथन है, "95% मौका B जीते" नहीं।
  • एक परीक्षण, एक मीट्रिक। कई मेट्रिक्स या वेरिएंट का एक साथ परीक्षण करना एक भाग्य की संभावना को गुणा करता है; इसे सही करें (जैसे बोनफेरोनी) या एकल मीट्रिक को पूर्व-पंजीकृत करें जो परीक्षण तय करता है।

इसे स्वयं परिकलित करें

प्रत्येक स्निपेट ऊपर दिए गए काम किए गए उदाहरण के लिए दोनों तरफा p-value की गणना करता है।

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

FAQ

मुझे कितना नमूना आकार चाहिए? पर्याप्त कि एक अर्थपूर्ण लिफ्ट पता लगाया जा सके। एक मंजिल के रूप में, प्रत्येक वेरिएंट के लिए कम से कम कुछ सौ रूपांतरणों का लक्ष्य रखें; अपनी आधारभूत दर और सबसे छोटी लिफ्ट के साथ एक समर्पित नमूना-आकार कैलकुलेटर का उपयोग करें।

दोनों तरफा या एक तरफा? दो-तरफा का उपयोग करें जब तक कि आपके पास केवल सुधार की परवाह करने का एक दृढ़, पूर्व-प्रतिबद्ध कारण न हो। एक-तरफा आपकी संवेदनशीलता को दोगुना करता है लेकिन B के बदतर होने पर प्रतिक्रिया करने से मना करता है।

कैलकुलेटर एक आत्मविश्वास अंतराल क्यों दिखाता है? यह केवल हां/नहीं निर्णय के बजाय सत्य अंतर की प्रशंसनीय सीमा दिखाता है। एक विस्तृत अंतराल जो 0 को पार करता है "अभी तक पर्याप्त डेटा नहीं" का अर्थ है।

क्या यह Bayesian है? नहीं — यह एक बारंबारता z-परीक्षण है, सबसे व्यापक रूप से सिखाया और उपयोग किया जाने वाला तरीका। Bayesian A/B उपकरण p-value के बजाय "संभावना B को हरा देता है" रिपोर्ट करते हैं; दोनों मान्य हैं, वे थोड़े अलग सवालों का जवाब देते हैं।

स्रोत