پرش به محتوا

ماشین حساب معناداری آزمون A/B

بررسی کنید که نتیجه آزمون A/B شما از نظر آماری معنادار است. تعداد بازدیدکنندگان و تبدیل‌ها را وارد کنید تا مقدار P، امتیاز Z، فاصله اطمینان و افزایش نسبی را دریافت کنید.

ماشین حساب معناداری آزمون A/B

تعداد بازدیدکنندگان و تبدیل‌ها برای هر نسخه را وارد کنید تا بررسی کنید آیا تفاوت واقعی است یا فقط نویز.

کنترل (A)
تغییر (B)

نتایج

از نظر آماری معنادار

تفاوت بعید است که ناشی از شانس باشد در سطح اطمینان انتخابی شما.

مقدار P
0.0007

Chance this gap is just luck — lower is stronger.

امتیاز Z
3.381

How far apart the two rates are, in standard errors.

افزایش نسبی
+50.0%
نرخ کنترل
10.00%
نرخ تغییر
15.00%
تفاوت مطلق
+5.00 pp
فاصله اطمینان (تفاوت) · 95%
2.11% to 7.89%

The likely range for the true difference.

نرخ تبدیل بر اساس نسخه
نرخ تبدیل بر اساس نسخه. Grouped bar chart with 1 series: نرخ تبدیل.0%5%10%15%نرخ تبدیلکنترل (A)تغییر (B)10%15%
ماشین حساب بارگذاری...
📚

مستندات

محاسبه‌گر معناداری آزمون A/B چه کاری انجام می‌دهد

محاسبه‌گر معناداری آزمون A/B بررسی می‌کند که آیا تفاوت میان دو نسخه از یک چیز — یک صفحهٔ وب، یک ایمیل یا یک دکمهٔ پرداخت — اثری واقعی است یا فقط حاصل تصادف. این ابزار تعداد بازدیدکنندگان و تعداد تبدیل‌ها را برای هر نسخه می‌گیرد و مقدار p، امتیاز z و فاصلهٔ اطمینان را برمی‌گرداند. تبدیل هر اقدامی است که موفقیت محسوب می‌شود: خرید، ثبت‌نام یا کلیک.

روش استفاده از محاسبه‌گر

محاسبه‌گر به چهار عدد نیاز دارد.

  • بازدیدکنندگان (کنترل): تعداد افرادی که نسخهٔ A، یعنی نسخهٔ اصلی، را دیده‌اند.
  • تبدیل‌ها (کنترل): تعداد افرادی از آن‌ها که تبدیل شده‌اند.
  • بازدیدکنندگان (تغییر‌یافته): تعداد افرادی که نسخهٔ B، یعنی نسخهٔ جدید، را دیده‌اند.
  • تبدیل‌ها (تغییر‌یافته): تعداد افرادی از آن‌ها که تبدیل شده‌اند.

دو تنظیم دیگر نحوهٔ ارزیابی نتیجه را تغییر می‌دهند.

  • سطح اطمینان میزان سخت‌گیری آزمون را تعیین می‌کند. ۹۵٪ پیش‌فرض رایج است. سطح بالاتری مانند ۹۹٪ پیش از معنادار دانستن نتیجه، به شواهد قوی‌تری نیاز دارد.
  • فرضیه جهت پرسش را تعیین می‌کند. آزمون دوطرفه می‌پرسد: «آیا B در هر جهتی با A تفاوت دارد؟» آزمون یک‌طرفه فقط می‌پرسد: «آیا B از A بهتر است؟» آزمون یک‌طرفه باید فقط پیش از ورود داده‌ها انتخاب شود و تنها زمانی که بدتر بودن نتیجهٔ B هیچ تصمیمی را تغییر ندهد.

نتیجه هم‌زمان با وارد کردن اعداد به‌روزرسانی می‌شود. ورودی‌ها در نشانی وب صفحه ذخیره می‌شوند؛ بنابراین می‌توان نتیجه را به‌صورت پیوند نشانک‌گذاری یا به اشتراک گذاشت.

فرمول آزمون A/B (آزمون z برای دو نسبت)

این محاسبه‌گر از آزمون z برای دو نسبت استفاده می‌کند؛ روشی استاندارد که در آمار مقدماتی برای مقایسهٔ دو نرخ آموزش داده می‌شود.

گام ۱. نرخ تبدیل هر گروه.

p1=x1n1,p2=x2n2p_1 = \frac{x_1}{n_1}, \qquad p_2 = \frac{x_2}{n_2}

در اینجا xx تعداد تبدیل‌ها و nn تعداد بازدیدکنندگان برای گروه کنترل (۱) و گروه تغییر‌یافته (۲) است.

گام ۲. نرخ تبدیل تجمیعی. در این گام، برای انجام آزمون فرض می‌شود که هر دو گروه یک نرخ واقعی زیربنایی مشترک دارند.

p^=x1+x2n1+n2\hat{p} = \frac{x_1 + x_2}{n_1 + n_2}

گام ۳. خطای استاندارد تفاوت که بر اساس نرخ تجمیعی محاسبه می‌شود.

SE=p^(1−p^)(1n1+1n2)SE = \sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}

گام ۴. امتیاز z، یعنی فاصلهٔ میان دو نرخ که بر حسب خطاهای استاندارد سنجیده شده است.

z=p2−p1SEz = \frac{p_2 - p_1}{SE}

گام ۵. مقدار p که از توزیع نرمال استاندارد Φ\Phi به دست می‌آید. برای آزمون دوطرفه: p=2(1−Φ(∣z∣))p = 2\left(1 - \Phi(|z|)\right). برای آزمون یک‌طرفه: p=1−Φ(z)p = 1 - \Phi(z).

گام ۶. نتیجه‌گیری. وقتی مقدار p از α\alpha کوچک‌تر باشد، نتیجه از نظر آماری معنادار محسوب می‌شود؛ در اینجا α=1−سطح اطمینان\alpha = 1 - \text{سطح اطمینان} است. در سطح اطمینان ۹۵٪، α=0.05\alpha = 0.05 است.

محاسبه‌گر همچنین فاصلهٔ اطمینانی برای اندازهٔ تفاوت، یعنی p2−p1p_2 - p_1، گزارش می‌کند. این فاصله از یک خطای استاندارد جداگانه استفاده می‌کند که فرض نمی‌کند دو گروه نرخ مشترکی دارند:

SEunpooled=p1(1−p1)n1+p2(1−p2)n2SE_{unpooled} = \sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}}

این فاصله برابر است با (p2−p1)±zc×SEunpooled(p_2 - p_1) \pm z_c \times SE_{unpooled}؛ در اینجا zcz_c در سطح اطمینان ۹۰٪ برابر ۱٫۶۴۴۹، در سطح ۹۵٪ برابر ۱٫۹۶ و در سطح ۹۹٪ برابر ۲٫۵۷۵۸ است. اگر فاصله شامل صفر نباشد، تفاوت در آن سطح اطمینان معنادار است.

مثال حل‌شده

بازدیدکنندگانتبدیل‌هانرخ
کنترل (A)۱٬۰۰۰۱۰۰۱۰٫۰۰٪
تغییر‌یافته (B)۱٬۰۰۰۱۵۰۱۵٫۰۰٪

نرخ تجمیعی برابر است با (100+150)/(1000+1000)=0.125(100+150)/(1000+1000) = 0.125، یعنی ۱۲٫۵٪. خطای استاندارد تجمیعی تقریباً ۰٫۰۱۴۸ است. امتیاز z برابر است با (0.15−0.10)/0.0148≈3.38(0.15 - 0.10) / 0.0148 \approx 3.38.

در آزمون دوطرفه، مقدار p تقریباً ۰٫۰۰۰۷۲ به دست می‌آید. این مقدار از آستانهٔ معمول ۰٫۰۵ کمتر است؛ بنابراین در سطح اطمینان ۹۵٪، تفاوت از نظر آماری معنادار است. اگر عملکرد واقعی دو نسخه یکسان بود، تفاوتی به این بزرگی یا بزرگ‌تر، صرفاً بر اثر شانس، در حدود ۷ مورد از هر ۱۰٬۰۰۰ آزمون دیده می‌شد.

تفاوت مطلق ۵٫۰۰ واحد درصد است. بهبود نسبی ۵۰٪ است، زیرا نرخ B برابر ۱٫۵ برابر نرخ A است. فاصلهٔ اطمینان ۹۵٪ برای تفاوت واقعی تقریباً از ۲٫۱۱٪ تا ۷٫۸۹٪ است.

تفسیر درست نتیجه

نتیجهٔ معنادار از نظر آماری لزوماً نتیجه‌ای نیست که ارزش اقدام داشته باشد. ممکن است یک بهبود واقعی اما بسیار کوچک، ارزش هزینهٔ انتشار آن را نداشته باشد. پس از انجام محاسبات نیز قضاوت کسب‌وکار اهمیت دارد.

بررسی روزانهٔ مقدار p و متوقف کردن آزمون درست در لحظه‌ای که از ۰٫۰۵ عبور می‌کند، احتمال مثبت کاذب را افزایش می‌دهد. بهتر است اندازهٔ نمونه یا مدت اجرای آزمون از پیش تعیین شود و پیش از خواندن نتیجه، آزمون به پایان برسد.

تقریب نرمالی که این آزمون بر آن تکیه دارد، زمانی بهترین عملکرد را دارد که هر گروه دست‌کم حدود ۱۰ تبدیل و ۱۰ عدم‌تبدیل داشته باشد. با اعداد کوچک‌تر، نتیجه باید به‌عنوان نشانه‌ای تقریبی، نه پاسخی قطعی، در نظر گرفته شود.

سطح اطمینان ۹۵٪ به این معنا نیست که احتمال بهتر بودن واقعی B برابر ۹۵٪ است. معنایش این است که اگر همین آزمون بارها تکرار شود، این روش حداکثر در ۵٪ موارد نتیجه‌ای معنادار اما نادرست ارائه می‌کند. این گزاره دربارهٔ روش است، نه دربارهٔ این نتیجهٔ خاص.

آزمودن معیارها یا نسخه‌های متعدد به‌طور هم‌زمان، احتمال آن را افزایش می‌دهد که دست‌کم یک مقایسه صرفاً بر اثر شانس معنادار به نظر برسد. انتخاب یک معیار پیش از آغاز آزمون از این مشکل جلوگیری می‌کند.

پرسش‌های متداول

آزمون A/B به چه اندازه نمونه‌ای نیاز دارد؟ تعداد بازدیدکنندگان باید آن‌قدر باشد که یک بهبود معنادار واقعاً به‌صورت آماری معنادار ظاهر شود. یک حداقل تقریبی، چند صد تبدیل برای هر نسخه است. محاسبه‌گر اختصاصی اندازهٔ نمونه، با استفاده از نرخ پایه و کوچک‌ترین بهبودی که ارزش شناسایی دارد، پیش از آغاز آزمون عدد دقیق‌تری ارائه می‌کند.

آزمون باید یک‌طرفه باشد یا دوطرفه؟ آزمون دوطرفه گزینهٔ پیش‌فرض مطمئن‌تری است، زیرا می‌تواند بهتر یا بدتر بودن B نسبت به A را نشان دهد. آزمون یک‌طرفه نسبت به بهبود حساس‌تر است، اما نمی‌تواند بدتر شدن نتیجه را نشان دهد؛ بنابراین فقط زمانی باید استفاده شود که بدتر بودن B هیچ تصمیمی را تغییر ندهد.

چرا محاسبه‌گر فاصلهٔ اطمینان را گزارش می‌کند؟ فاصلهٔ اطمینان دامنهٔ محتمل تفاوت واقعی را نشان می‌دهد، نه فقط برچسب معنادار یا غیرمعنادار را. فاصلهٔ گسترده‌ای که صفر را دربرگیرد، معمولاً یعنی آزمون به دادهٔ بیشتری نیاز دارد.

آیا این محاسبه‌گر بیزی است؟ خیر. این ابزار از آزمون z فراوانی‌گرا استفاده می‌کند؛ روشی که بیش از همه برای آزمون A/B آموزش داده می‌شود و به کار می‌رود. ابزار بیزی در عوض احتمال بهتر بودن B از A را گزارش می‌کند. هر دو روش معتبرند، اما به پرسش‌هایی اندکی متفاوت پاسخ می‌دهند.

اگر محاسبه‌گر خطا نشان دهد چه باید کرد؟ اگر تعداد تبدیل منفی باشد، از تعداد بازدیدکنندگان بیشتر باشد، یا نرخ تبدیل ترکیبی دو گروه برابر ۰٪ یا ۱۰۰٪ باشد، خطا ظاهر می‌شود؛ زیرا در این حالت فرمول آزمون z نمی‌تواند بر خطای استاندارد صفر تقسیم شود.

منابع