پرش به محتوا

ماشین حساب معناداری آزمون A/B

بررسی کنید که نتیجه آزمون A/B شما از نظر آماری معنادار است. تعداد بازدیدکنندگان و تبدیل‌ها را وارد کنید تا مقدار P، امتیاز Z، فاصله اطمینان و افزایش نسبی را دریافت کنید.

ماشین حساب معناداری آزمون A/B

تعداد بازدیدکنندگان و تبدیل‌ها برای هر نسخه را وارد کنید تا بررسی کنید آیا تفاوت واقعی است یا فقط نویز.

کنترل (A)
تغییر (B)

نتایج

از نظر آماری معنادار

تفاوت بعید است که ناشی از شانس باشد در سطح اطمینان انتخابی شما.

مقدار P
0.0007

Chance this gap is just luck — lower is stronger.

امتیاز Z
3.381

How far apart the two rates are, in standard errors.

افزایش نسبی
+50.0%
نرخ کنترل
10.00%
نرخ تغییر
15.00%
تفاوت مطلق
+5.00 pp
فاصله اطمینان (تفاوت) · 95%
2.11% to 7.89%

The likely range for the true difference.

نرخ تبدیل بر اساس نسخه
نرخ تبدیل بر اساس نسخه. Grouped bar chart with 1 series: نرخ تبدیل.0%5%10%15%نرخ تبدیلکنترل (A)تغییر (B)10%15%
ماشین حساب بارگذاری...
📚

مستندات

آزمایش A/B در یک دقیقه

شما یک دکمه، یک عنوان یا یک جریان پرداخت را تغییر دادید. نسخه A نسخه قدیمی است، نسخه B نسخه جدید است. B بهتر به نظر می‌رسد — 15% از بازدیدکنندگان تبدیل شدند در مقابل 10% برای A. اما آیا این شکاف فقط شانس نیست، مانند وقتی که یک سکه را ده بار پرتاب کنید و هفت بار رو بیاید؟

این ماشین‌حساب دقیقاً به این سؤال پاسخ می‌دهد. شما تعداد افرادی که هر نسخه را دیده‌اند و چند نفر تبدیل شده‌اند را وارد می‌کنید و آن احتمال این را به شما می‌گوید که تفاوتی که اندازه‌گیری کردید واقعی است تا نویز تصادفی. اگر این احتمال به اندازه کافی زیاد باشد، برنده را پیدا کردید. اگر نه، تست را ادامه می‌دهید.

عددی که باید نگاه کنید p-value است: احتمال دیدن تفاوتی حداقل این بزرگ اگر دو نسخه واقعاً یکسان بودند. p-value کوچک (مثلاً زیر 0.05) به معنی "این به ندرت به صورت تصادفی اتفاق می‌افتد، بنابراین تفاوت احتمالاً واقعی است."

نحوه استفاده

  1. بازدیدکنندگان — چند نفر منحصر به فرد هر نسخه را دیده‌اند.
  2. تبدیل‌ها — چند نفر از آنها کاری که برایتان مهم است انجام دادند (خریداری کردند، ثبت‌نام کردند، کلیک کردند).
  3. سطح اطمینان — چقدر مطمئن می‌خواهید پیش از تعیین برنده باشید. 95% استاندارد صنعت است.
  4. فرضیهدو طرفه می‌پرسد "آیا B با A متفاوت است؟" (محفوظ‌تر، پیش‌فرض)؛ یک طرفه فقط می‌پرسد "آیا B بهتر از A است؟" (حساس‌تر، اما باید قبل از اجرای تست جهت را تصمیم بگیرید).

نتیجه به‌صورت زنده به‌روز می‌شود و ورودی‌ها در URL صفحه ذخیره می‌شوند، بنابراین می‌توانید نتیجه را نشانی‌گذاری کنید یا به اشتراک بگذارید. بازنشانی فرم را پاک‌کند؛ بارگذاری داده‌های نمونه یک مثال تکمیل‌شده را پر می‌کند.

یک مثال تکمیل‌شده

بازدیدکنندگانتبدیل‌هانرخ
A (کنترل)1,00010010.0%
B (تغییر)1,00015015.0%

این افزایش مطلق 5 درصدی و افزایش نسبی +50% است. ماشین‌حساب p-value حدود 0.0007 را برمی‌گرداند — زیر 0.05 — بنابراین با اطمینان 95% نتیجه آماری‌معنی‌دار است. به‌طور تقریبی، اگر دو نسخه کاملاً یکسان بودند، یک تفاوت این اندازه را کمتر از یک بار در هزار تست می‌دیدید.

ریاضیات (آزمون z دو نسبت)

درون‌سازی این آزمون z دو نسبت استاندارد است، همان آزمونی که در آمار مقدماتی تدریس می‌شود و توسط ابزارهای A/B اصلی استفاده می‌شود.

  1. نرخ تبدیل هر گروه:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    که در آن xx تبدیل‌ها و nn بازدیدکنندگان است.

  2. نرخ ترکیب‌شده، با فرض (برای فرضیه صفر) هر دو گروه یک نرخ واقعی را به اشتراک می‌گذارند:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. خطای استاندارد تفاوت:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. امتیاز z — چند خطای استاندارد دو نرخ از هم جدا هستند:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. p-value از توزیع نرمال استاندارد Φ\Phi می‌آید. دو طرفه: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). یک طرفه: p=1Φ(z)p = 1 - \Phi(z).

  6. معنی‌دار هنگامی که p<αp < \alpha، که در آن α=1confidence\alpha = 1 - \text{confidence} (بنابراین 0.05 در 95%).

ماشین‌حساب همچنین یک فاصله اطمینان برای تفاوت را به‌کمک خطای استاندارد غیرترکیب‌شده گزارش می‌کند p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: محدوده معقول برای شکاف واقعی. اگر این فاصله 0 را شامل نشود، نتیجه معنی‌دار است.

0 -1.96 +1.96 no difference

در اطمینان 95%، z فراتر از ±1.96 (دم‌های سایه‌دار، 5% از ناحیه) به‌عنوان معنی‌دار شمار می‌رود.

خواندن نتیجه درست

  • اهمیت آماری اهمیت تجاری نیست. بهبود 0.1% می‌تواند آماری واقعی باشد اما ارسال آن ارزش ندارد.
  • نگاه نکنید و زود متوقف نشوید. بررسی p-value هر روز و متوقف کردن لحظه‌ای که زیر 0.05 سقوط کند، میزان مثبت کاذب شما را افزایش می‌دهد. اندازه نمونه را از قبل تصمیم بگیرید و تست را تکمیل کنید.
  • قانون شماره انگشتی حجم نمونه را بررسی کنید. تقریب نرمال هنگامی قابل اعتماد است که هر گروه حداقل ~10 تبدیل و ~10 عدم تبدیل داشته باشد. با اعداد کوچک، نتیجه را فقط جهت‌دار در نظر بگیرید.
  • اطمینان ≠ احتمال B بهتر است. سطح اطمینان 95% به معنی روش حداکثر 5% مواقع در دراز‌مدت اشتباه است — این یک گفتار فراوانی‌گرا است، نه "احتمال 95% که B برنده شود."
  • یک تست، یک متریک. آزمایش متریک‌های متعدد یا انواع همزمان، احتمال تصادف را افزایش می‌دهد؛ برای آن اصلاح کنید (مثلاً Bonferroni) یا متریک منفرد را که تست را تصمیم می‌دهد قبل از ثبت کنید.

خود را محاسبه کنید

هر متن برای مثال تکمیل‌شده بالا p-value دو طرفه را محاسبه می‌کند.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

سؤالات متداول

چه حجم نمونه‌ای نیاز دارم؟ حجمی که بهبود معنی‌داری قابل تشخیص باشد. حداقل، هدفگذاری برای حداقل چند صد تبدیل در هر انواع؛ از ماشین‌حساب اختصاصی حجم نمونه استفاده کنید.

دو طرفه یا یک طرفه؟ دو طرفه استفاده کنید مگر اینکه دلیل محکم و متعهدانه قبلی برای فقط مراقبت بهبود داشته باشید. یک طرفه حساسیت شما را دو برابر می‌کند اما مانع از واکنش به B بدتر است.

چرا ماشین‌حساب فاصله اطمینان نشان می‌دهد؟ محدوده معقول تفاوت واقعی را نشان می‌دهد، نه فقط تصمیم بله/خیر. فاصله گسترده‌ای که 0 را شامل می‌شود به معنی "هنوز اطلاعات کافی نیست."

آیا این بیزی است؟ خیر — این یک آزمون z فراوانی‌گرا است، روش پرآموختگی‌تر و پرکاربردی‌تر است. ابزارهای A/B بیزی "احتمال بقایای B بهتر از A" را به جای p-value گزارش می‌کنند؛ هر دو معتبر هستند، آنها سؤالات کمی متفاوتی را پاسخ می‌دهند.

منابع