A/B পরীক্ষা গুরুত্ব ক্যালকুলেটর
আপনার A/B পরীক্ষার ফলাফল পরিসংখ্যানগতভাবে উল্লেখযোগ্য কিনা তা যাচাই করুন। দর্শক এবং রূপান্তর প্রবেশ করান p-মান, z-স্কোর, আত্মবিশ্বাস ব্যবধান এবং আপেক্ষিক উত্তোলন পেতে।
A/B পরীক্ষা গুরুত্ব ক্যালকুলেটর
প্রতিটি ভেরিয়েন্টের জন্য দর্শক এবং রূপান্তর প্রবেশ করান পার্থক্য বাস্তব বা শুধু শব্দ যদি তা যাচাই করুন।
ফলাফল
পরিসংখ্যানগতভাবে উল্লেখযোগ্য
পার্থক্য আপনার নির্বাচিত আত্মবিশ্বাসের স্তরে সুযোগ ছাড়াই সম্ভব।
Chance this gap is just luck — lower is stronger.
How far apart the two rates are, in standard errors.
The likely range for the true difference.
ডকুমেন্টেশন
এক মিনিটে A/B পরীক্ষা
আপনি একটি বোতাম, একটি শিরোনাম বা একটি চেকআউট প্রবাহ পরিবর্তন করেছেন। সংস্করণ A পুরনো, সংস্করণ B নতুন। B দেখতে ভাল লাগছে — এটি ১৫% দর্শককে রূপান্তরিত করেছে যেখানে A এর জন্য ১০%। কিন্তু এই ব্যবধান কি শুধু ভাগ্য, যেমন একটি কয়েন দশবার ফ্লিপ করলে সাতবার মাথা আসতে পারে?
এই ক্যালকুলেটর ঠিক এটি উত্তর দেয়। আপনি প্রতিটি সংস্করণ কতজন মানুষ দেখেছে এবং কতজন রূপান্তরিত হয়েছে তা প্রবেশ করান, এবং এটি আপনাকে বলে যে আপনি যে পার্থক্যটি পরিমাপ করেছেন তা বাস্তব হওয়ার সম্ভাবনা অনুমান করে, র্যান্ডম শব্দ নয়। যদি সেই সম্ভাবনা যথেষ্ট বেশি হয় তবে আপনার একটি বিজয়ী আছে। যদি না হয় তবে আপনি পরীক্ষা চলমান রাখুন।
যে এক নম্বরটি দেখতে হবে তা হল p-মান: যদি দুটি সংস্করণ প্রকৃতপক্ষে অভিন্ন হত তবে এই বড় ব্যবধান দেখার সম্ভাবনা। একটি ছোট p-মান (বলুন, ০.০৫ এর নিচে) মানে "এটি ভাগ্যবশত খুব কমই ঘটবে, তাই পার্থক্য সম্ভবত বাস্তব।"
এটি কীভাবে ব্যবহার করবেন
১. দর্শক — প্রতিটি সংস্করণ কতজন অনন্য মানুষ দেখেছে। २. রূপান্তর — তাদের মধ্যে কতজন আপনি যা যত্ন করেন তা করেছে (কেনা, সাইন আপ, ক্লিক করা)। ३. আত্মবিশ্বাস স্তর — বিজয়ী হিসাবে কল করার আগে আপনি কতটা নিশ্চিত হতে চান। ৯৫% শিল্প মান। ४. অনুমান — দ্বি-পার্শ্বিক প্রশ্ন করে "B A থেকে আলাদা?" (নিরাপদ, ডিফল্ট); এক-পার্শ্বিক শুধুমাত্র প্রশ্ন করে "B A থেকে ভাল?" (আরও সংবেদনশীল, কিন্তু আপনি পরীক্ষা চালানোর আগে দিকটি সিদ্ধান্ত নিতে হবে)।
ফলাফল লাইভ আপডেট হয় এবং ইনপুটগুলি পৃষ্ঠার URL-তে সংরক্ষিত হয়, তাই আপনি একটি ফলাফল বুকমার্ক বা শেয়ার করতে পারেন। রিসেট ফর্মটি সাফ করে; নমুনা ডেটা লোড করুন একটি কাজ করা উদাহরণ পূরণ করে।
একটি কাজ করা উদাহরণ
| দর্শক | রূপান্তর | হার | |
|---|---|---|---|
| A (নিয়ন্ত্রণ) | ১,০০০ | ১০০ | ১০.०% |
| B (ভিন্নতা) | १,००० | १५० | १५.०% |
এটি ৫ শতাংশ পয়েন্ট পরম উত্তোলন এবং একটি +५०% আপেক্ষিক উত্তোলন। ক্যালকুলেটর প্রায় ०.००७ এর একটি p-মান প্রদান করে — ०.०५ এর নিচে — তাই ९५% আত্মবিশ্বাসে ফলাফলটি পরিসংখ্যানগতভাবে উল্লেখযোগ্য। মোটামুটি, যদি দুটি সংস্করণ সত্যিকারের অভিন্ন হয়, তবে আপনি এই বড় ব্যবধান হাজার পরীক্ষায় একবারেরও কম দেখতে পাবেন।
গণিত (দ্বি-অনুপাত z-পরীক্ষা)
হুডের অধীনে এটি স্ট্যান্ডার্ড দ্বি-অনুপাত z-পরীক্ষা, একই পরীক্ষা প্রারম্ভিক পরিসংখ্যানে শেখানো হয় এবং মূলধারার A/B সরঞ্জাম দ্বারা ব্যবহৃত।
१. প্রতিটি গ্রুপের রূপান্তর হার:
যেখানে রূপান্তর এবং দর্শক।
२. পুল করা হার, অনুমান করে (শূন্য অনুমানের জন্য) উভয় গ্রুপ একটি সত্য হার শেয়ার করে:
३. পার্থক্যের মান ত্রুটি:
४. z-স্কোর — দুটি হার কতটা মান ত্রুটি আলাদা:
५. p-মান স্ট্যান্ডার্ড স্বাভাবিক বিতরণ থেকে আসে। দ্বি-পার্শ্বিক: . এক-পার্শ্বিক: .
६. উল্লেখযোগ্য যখন , যেখানে (তাই ०.०५ at ९५%)।
ক্যালকুলেটর এছাড়াও একটি আত্মবিশ্বাস ব্যবধান পার্থক্যের জন্য রিপোর্ট করে, unpooled মান ত্রুটি দিয়ে গণনা করা হয়েছে : সত্য ব্যবধানের জন্য প্ল্যাবসিবল রেঞ্জ। যদি সেই ব্যবধান ० বাদ দেয়, ফলাফল উল্লেখযোগ্য।
९५% আত্মবিশ্বাসে, একটি z ±१.९६ এর বাইরে (ছায়ায় লেজ, এলাকার ५%) উল্লেখযোগ্য হিসাবে গণনা করা হয়।
সৎভাবে ফলাফল পড়া
- পরিসংখ্যানগত তাৎপর্য ব্যবসায়িক তাৎপর্য নয়। একটি ०.१% উত্তোলন পরিসংখ্যানগতভাবে বাস্তব হতে পারে কিন্তু শিপিংয়ের যোগ্য নয়।
- তাড়াতাড়ি ঝাঁকুনি এবং থামবেন না। প্রতিদিন p-মান পরীক্ষা করা এবং মুহূর্তটি যখন এটি ०.०५ এর নিচে ডুব দেয় তাৎক্ষণিক আপনার মিথ্যা ইতিবাচক হার বাড়ায়। নমুনা আকার আগাম সিদ্ধান্ত নিন এবং পরীক্ষা শেষ করতে দিন।
- নমুনা-আকার নিয়ম পর্যবেক্ষণ করুন। স্বাভাবিক অনুমান নির্ভরযোগ্য যখন প্রতিটি গ্রুপের কমপক্ষে ~००conversion এবং ~१० অ-রূপান্তর আছে। ছোট সংখ্যার সাথে, ফলাফলটি নির্দেশমূলক হিসাবে বিবেচনা করুন।
- আত্মবিশ্বাস ≠ সম্ভাবনা B ভাল। একটি ९५% আত্মবিশ্বাসের স্তর অর্থ পদ্ধতি দীর্ঘ মেয়াদী সময়ের १% এ বেশিরভাগ ত্রুটিযুক্ত — এটি একটি পরিসংখ্যান বিবৃতি, "९५% সুযোগ B জয়" নয়।
- এক পরীক্ষা, এক মেট্রিক। একসাথে অনেক মেট্রিক বা ভেরিয়েন্ট পরীক্ষা করা একটি fluke সুযোগ বৃদ্ধি করে; এটির জন্য সংশোধন করুন (যেমন Bonferroni) বা পূর্ব-রেজিস্টার সিদ্ধান্তটি সিদ্ধান্ত নেয় তা।
এটি নিজে হিসাব করুন
প্রতিটি স্নিপেট উপরে কাজ করা উদাহরণের জন্য দ্বি-পার্শ্বিক p-মান গণনা করে।
1=2*(1-NORM.S.DIST(
2 (B2/A2 - B1/A1) /
3 SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4 TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
61from math import sqrt, erf
2
3def ab_pvalue(n1, x1, n2, x2, two_sided=True):
4 p1, p2 = x1 / n1, x2 / n2
5 p = (x1 + x2) / (n1 + n2)
6 se = sqrt(p * (1 - p) * (1 / n1 + 1 / n2))
7 z = (p2 - p1) / se
8 phi = lambda v: 0.5 * (1 + erf(v / sqrt(2))) # standard normal CDF
9 return 2 * (1 - phi(abs(z))) if two_sided else 1 - phi(z)
10
11print(ab_pvalue(1000, 100, 1000, 150)) # ~0.00072
121// erf via Abramowitz & Stegun 7.1.26
2function erf(x) {
3 const s = x < 0 ? -1 : 1;
4 x = Math.abs(x);
5 const t = 1 / (1 + 0.3275911 * x);
6 const y = 1 - ((((1.061405429 * t - 1.453152027) * t + 1.421413741) * t
7 - 0.284496736) * t + 0.254829592) * t * Math.exp(-x * x);
8 return s * y;
9}
10const phi = z => 0.5 * (1 + erf(z / Math.SQRT2));
11
12function abPValue(n1, x1, n2, x2, twoSided = true) {
13 const p1 = x1 / n1, p2 = x2 / n2, p = (x1 + x2) / (n1 + n2);
14 const se = Math.sqrt(p * (1 - p) * (1 / n1 + 1 / n2));
15 const z = (p2 - p1) / se;
16 return twoSided ? 2 * (1 - phi(Math.abs(z))) : 1 - phi(z);
17}
18console.log(abPValue(1000, 100, 1000, 150)); // ~0.00072
191public static double abPValue(int n1, int x1, int n2, int x2) {
2 double p1 = (double) x1 / n1, p2 = (double) x2 / n2;
3 double p = (double) (x1 + x2) / (n1 + n2);
4 double se = Math.sqrt(p * (1 - p) * (1.0 / n1 + 1.0 / n2));
5 double z = (p2 - p1) / se;
6 // Phi via the error function; erf approximated (A&S 7.1.26) separately.
7 double phi = 0.5 * (1 + erf(Math.abs(z) / Math.sqrt(2)));
8 return 2 * (1 - phi);
9}
101static double AbPValue(int n1, int x1, int n2, int x2) {
2 double p1 = (double)x1 / n1, p2 = (double)x2 / n2;
3 double p = (double)(x1 + x2) / (n1 + n2);
4 double se = Math.Sqrt(p * (1 - p) * (1.0 / n1 + 1.0 / n2));
5 double z = (p2 - p1) / se;
6 double phi = 0.5 * (1 + Erf(Math.Abs(z) / Math.Sqrt(2)));
7 return 2 * (1 - phi);
8}
91#include <cmath>
2
3double ab_pvalue(int n1, int x1, int n2, int x2) {
4 double p1 = (double)x1 / n1, p2 = (double)x2 / n2;
5 double p = (double)(x1 + x2) / (n1 + n2);
6 double se = std::sqrt(p * (1 - p) * (1.0 / n1 + 1.0 / n2));
7 double z = (p2 - p1) / se;
8 double phi = 0.5 * (1 + std::erf(std::fabs(z) / std::sqrt(2.0)));
9 return 2 * (1 - phi);
10}
111import "math"
2
3func abPValue(n1, x1, n2, x2 float64) float64 {
4 p1, p2 := x1/n1, x2/n2
5 p := (x1 + x2) / (n1 + n2)
6 se := math.Sqrt(p * (1 - p) * (1/n1 + 1/n2))
7 z := (p2 - p1) / se
8 phi := 0.5 * (1 + math.Erf(math.Abs(z)/math.Sqrt2))
9 return 2 * (1 - phi)
10}
111// erf from the `libm` crate; std has no erf.
2fn ab_pvalue(n1: f64, x1: f64, n2: f64, x2: f64) -> f64 {
3 let (p1, p2) = (x1 / n1, x2 / n2);
4 let p = (x1 + x2) / (n1 + n2);
5 let se = (p * (1.0 - p) * (1.0 / n1 + 1.0 / n2)).sqrt();
6 let z = (p2 - p1) / se;
7 let phi = 0.5 * (1.0 + libm::erf(z.abs() / 2f64.sqrt()));
8 2.0 * (1.0 - phi)
9}
101function ab_pvalue($n1, $x1, $n2, $x2) {
2 $p1 = $x1 / $n1; $p2 = $x2 / $n2;
3 $p = ($x1 + $x2) / ($n1 + $n2);
4 $se = sqrt($p * (1 - $p) * (1 / $n1 + 1 / $n2));
5 $z = ($p2 - $p1) / $se;
6 $phi = 0.5 * (1 + erf(abs($z) / sqrt(2)));
7 return 2 * (1 - $phi);
8}
91def ab_pvalue(n1, x1, n2, x2)
2 p1, p2 = x1.to_f / n1, x2.to_f / n2
3 p = (x1 + x2).to_f / (n1 + n2)
4 se = Math.sqrt(p * (1 - p) * (1.0 / n1 + 1.0 / n2))
5 z = (p2 - p1) / se
6 phi = 0.5 * (1 + Math.erf(z.abs / Math.sqrt(2)))
7 2 * (1 - phi)
8end
91# R has this built in: prop.test does the whole thing.
2prop.test(c(100, 150), c(1000, 1000), correct = FALSE)$p.value # ~0.00072
3FAQ
আমার কি নমুনার আকার প্রয়োজন? যথেষ্ট যাতে একটি অর্থপূর্ণ উত্তোলন সনাক্তকরণযোগ্য হবে। একটি মেঝে হিসাবে, প্রতিটি ভেরিয়েন্টের জন্য কয়েক শত রূপান্তরণের জন্য লক্ষ্য করুন; আপনার বেসলাইন হার এবং সবচেয়ে ছোট উত্তোলনের জন্য একটি নিবেদিত নমুনা আকার ক্যালকুলেটর ব্যবহার করুন যা আপনি সনাক্ত করতে চান।
দ্বি-পার্শ্বিক বা এক-পার্শ্বিক? দ্বি-পার্শ্বিক ব্যবহার করুন যদি আপনার একটি দৃঢ়, পূর্ব-প্রতিশ্রুতিবদ্ধ কারণ থাকে শুধুমাত্র উন্নতির বিষয়ে যত্নশীল হতে। এক-পার্শ্বিক আপনার সংবেদনশীলতা দ্বিগুণ করে কিন্তু B গোরে প্রতিক্রিয়া নিষেধ করে।
ক্যালকুলেটর কেন একটি আত্মবিশ্বাস ব্যবধান দেখায়? এটি সত্য পার্থক্যের বাস্তবসম্মত পরিসীমা দেখায়, শুধু একটি হ্যাঁ/না সিদ্ধান্ত নয়। একটি বিস্তৃত ব্যবধান যা ০ জুড়ে মানে "এখনও যথেষ্ট ডেটা নেই।"
এটি Bayesian? না — এটি একটি frequentist z-পরীক্ষা, সবচেয়ে ব্যাপক শেখানো এবং ব্যবহৃত পদ্ধতি। Bayesian A/B সরঞ্জাম একটি p-মানের পরিবর্তে "সম্ভাবনা B A ছেড়ে যায়" রিপোর্ট করে; উভয় বৈধ, তারা সামান্য ভিন্ন প্রশ্নের উত্তর দেয়।