تخطي إلى المحتوى

حاسبة أهمية اختبار A/B

تحقق من أن نتيجة اختبار A/B الخاص بك ذات دلالة إحصائية. أدخل الزوار والتحويلات للحصول على قيمة p، درجة z، فترة الثقة، والرفع النسبي.

حاسبة أهمية اختبار A/B

أدخل الزوار والتحويلات لكل متغير للتحقق من وجود فرق حقيقي أم مجرد ضوضاء.

التحكم (أ)
المتغير (ب)

النتائج

ذات دلالة إحصائية

من غير المرجح أن يكون الفرق بسبب الصدفة بمستوى الثقة المختار.

قيمة P
0.0007

Chance this gap is just luck — lower is stronger.

درجة Z
3.381

How far apart the two rates are, in standard errors.

الرفع النسبي
+50.0%
معدل التحكم
10.00%
معدل المتغير
15.00%
الفرق المطلق
+5.00 pp
فترة الثقة (الفرق) · 95%
2.11% to 7.89%

The likely range for the true difference.

معدل التحويل حسب المتغير
معدل التحويل حسب المتغير. Grouped bar chart with 1 series: معدل التحويل.0%5%10%15%معدل التحويلالتحكم (أ)المتغير (ب)10%15%
حاسبة التحميل...
📚

التوثيق

اختبار أ/ب في دقيقة واحدة

غيّرت زرًا أو عنوانًا أو سير الدفع. الإصدار أ هو القديم، والإصدار ب هو الجديد. يبدو أن ب أفضل — حوّل 15% من الزوار مقابل 10% للإصدار أ. لكن هل يمكن أن يكون هذا الفرق مجرد صدفة، مثل رمي عملة عشر مرات والحصول على سبع وجوه؟

توفر هذه الحاسبة الإجابة بالضبط. تدخل عدد الأشخاص الذين رأوا كل إصدار وعدد من قاموا بالتحويل، وتخبرك بالاحتمالية بأن الفرق الذي قسته حقيقي بدلاً من ضوضاء عشوائية. إذا كان هذا الاحتمال مرتفعًا بما يكفي، فلديك فائز. إذا لم يكن كذلك، فتابع الاختبار.

الرقم الوحيد الذي يجب الانتباه له هو قيمة p: فرصة رؤية فجوة على الأقل بهذا الحجم إذا كان الإصدارتان متطابقتين فعلاً. تعني قيمة p الصغيرة (على سبيل المثال، أقل من 0.05) "هذا نادراً ما يحدث بالصدفة، لذا الفرق محتمل أن يكون حقيقياً."

كيفية الاستخدام

  1. الزوار — عدد الأشخاص الفريدين الذين تم عرض كل إصدار عليهم.
  2. التحويلات — كم عدد الأشخاص الذين فعلوا الشيء الذي تهتم به (اشتروا أو اشتركوا أو نقروا).
  3. مستوى الثقة — ما مدى تأكدك قبل إعلان الفائز. 95% هو المعيار الصناعي.
  4. الفرضيةثنائية الطرف تسأل "هل ب مختلف عن أ؟" (أكثر أماناً، الافتراضي)؛ أحادية الطرف تسأل فقط "هل ب أفضل من أ؟" (أكثر حساسية، لكن يجب أن تقرر الاتجاه قبل تشغيل الاختبار).

تتحدث النتيجة مباشرة ويتم تخزين المدخلات في عنوان URL للصفحة، لذا يمكنك حفظ النتيجة أو مشاركتها. إعادة تعيين مسح النموذج؛ تحميل نموذج البيانات يملأ مثال عملي.

مثال عملي

الزوارالتحويلاتالمعدل
أ (التحكم)1,00010010.0%
ب (المتغير)1,00015015.0%

هذا رفع مطلق بنسبة 5 نقاط مئوية وأ 50% رفع نسبي. تحسب الحاسبة قيمة p حوالي 0.0007 — أقل من 0.05 — لذا بثقة 95% النتيجة ذات دلالة إحصائية. تقريباً، إذا كان الإصدارتان متطابقتان فعلاً، كنت ستشهد فجوة بهذا الحجم أقل من مرة واحدة من كل ألف اختبار.

الرياضيات (اختبار z ثنائي النسبة)

تحت الغطاء، هذا هو اختبار z ثنائي النسبة القياسي، الاختبار نفسه الذي يتم تدريسه في الإحصائيات التمهيدية وتستخدمه أدوات A/B السائدة.

  1. معدل التحويل لكل مجموعة:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    حيث xx هو التحويلات و nn هو الزوار.

  2. المعدل المجمع، بافتراض (بالنسبة للفرضية الصفرية) أن كلا المجموعتين تتشاركان معدل حقيقي واحد:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. الخطأ المعياري للفرق:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. درجة z — عدد الأخطاء المعيارية التي تفصل بين المعدلين:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. تأتي قيمة p من التوزيع الطبيعي المعياري Φ\Phi. ثنائية الطرف: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). أحادية الطرف: p=1Φ(z)p = 1 - \Phi(z).

  6. ذات دلالة عندما p<αp < \alpha، حيث α=1confidence\alpha = 1 - \text{confidence} (إذن 0.05 بنسبة 95%).

تحسب الحاسبة أيضًا فترة الثقة للفرق، المحسوبة بالخطأ المعياري غير المجمع p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: النطاق المعقول للفجوة الحقيقية. إذا استبعدت هذه الفترة 0، فالنتيجة ذات دلالة.

0 -1.96 +1.96 no difference

بثقة 95%، تعتبر درجة z التي تتجاوز ±1.96 (الذيول المظللة، 5% من المساحة) ذات دلالة إحصائية.

قراءة النتيجة بصراحة

  • الدلالة الإحصائية ليست دلالة تجارية. يمكن أن يكون رفع 0.1% حقيقياً إحصائياً لكن لا يستحق النشر.
  • لا تراقب وتتوقف مبكراً. التحقق من قيمة p يومياً والتوقف اللحظة التي تنخفض أقل من 0.05 يضخم معدل إيجابياتك الكاذبة. حدد حجم العينة مقدماً واترك الاختبار ينتهي.
  • راقب قاعدة حجم العينة. التقريب الطبيعي يكون موثوقاً عندما تمتلك كل مجموعة ما لا يقل عن ~10 تحويلات و ~10 عدم تحويلات. مع الأرقام الصغيرة، تعامل مع النتيجة كاتجاهية فقط.
  • الثقة ≠ احتمال أن ب أفضل. مستوى ثقة 95% يعني أن الإجراء مخطئ في الحد الأقصى 5% من الوقت على المدى الطويل — إنها بيان تكراري، وليس "95% فرصة أن ب يفوز."
  • اختبار واحد، مقياس واحد. اختبار عدة مقاييس أو متغيرات في نفس الوقت يضاعف فرصة خطأ؛ صحح له (على سبيل المثال Bonferroni) أو سجل المقياس الوحيد الذي يقرر الاختبار.

احسبها بنفسك

يحسب كل مقطع قيمة p ثنائية الطرف للمثال العملي أعلاه.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

الأسئلة الشائعة

ما حجم العينة الذي أحتاجه؟ ما يكفي بحيث يكون الرفع المعني قابلاً للكشف. كأساس، اهدف إلى ما لا يقل عن بضع مئات التحويلات لكل متغير؛ استخدم حاسبة حجم عينة مخصصة مع معدل الأساس والرفع الأصغر الذي يستحق الكشف.

ثنائي الطرف أم أحادي الطرف؟ استخدم ثنائي الطرف ما لم يكن لديك سبب قوي مقدم للعناية فقط بالتحسين. يضاعف الطرف الواحد حساسيتك لكنه يحظر الرد على أن ب أسوأ.

لماذا تعرض الحاسبة فترة ثقة؟ تعرض النطاق المعقول للفرق الحقيقي، ليس فقط حكم نعم/لا. فترة واسعة تمس 0 تعني "لا توجد بيانات كافية بعد."

هل هذا بايزي؟ لا — إنه اختبار z تكراري، الطريقة الأكثر تدريسًا واستخداماً. تقارير أدوات A/B بايزية "احتمالية أن ب يتغلب على أ" بدلاً من قيمة p؛ كلاهما صحيح، يجيب على أسئلة مختلفة قليلاً.

المصادر