تخطي إلى المحتوى

حاسبة أهمية اختبار A/B

تحقق من أن نتيجة اختبار A/B الخاص بك ذات دلالة إحصائية. أدخل الزوار والتحويلات للحصول على قيمة p، درجة z، فترة الثقة، والرفع النسبي.

حاسبة أهمية اختبار A/B

أدخل الزوار والتحويلات لكل متغير للتحقق من وجود فرق حقيقي أم مجرد ضوضاء.

التحكم (أ)
المتغير (ب)

النتائج

ذات دلالة إحصائية

من غير المرجح أن يكون الفرق بسبب الصدفة بمستوى الثقة المختار.

قيمة P
0.0007

Chance this gap is just luck — lower is stronger.

درجة Z
3.381

How far apart the two rates are, in standard errors.

الرفع النسبي
+50.0%
معدل التحكم
10.00%
معدل المتغير
15.00%
الفرق المطلق
+5.00 pp
فترة الثقة (الفرق) · 95%
2.11% to 7.89%

The likely range for the true difference.

معدل التحويل حسب المتغير
معدل التحويل حسب المتغير. Grouped bar chart with 1 series: معدل التحويل.0%5%10%15%معدل التحويلالتحكم (أ)المتغير (ب)10%15%
حاسبة التحميل...
📚

التوثيق

ما الذي تفعله حاسبة دلالة اختبار A/B

تتحقق حاسبة دلالة اختبار A/B مما إذا كان الفرق بين نسختين من شيء ما — صفحة ويب أو رسالة بريد إلكتروني أو زر إتمام الشراء — تأثيرًا حقيقيًا أم مجرد صدفة عشوائية. وتأخذ عدد الزوار وعدد التحويلات لكل نسخة، ثم تعرض قيمة p ودرجة z وفترة ثقة. والتحويل هو أي إجراء يُعد نجاحًا، مثل الشراء أو التسجيل أو النقر.

كيفية استخدام الحاسبة

تحتاج الحاسبة إلى أربعة أرقام.

  • الزوار (المجموعة الضابطة): عدد الأشخاص الذين شاهدوا النسخة A، أي النسخة الأصلية.
  • التحويلات (المجموعة الضابطة): عدد الذين أتمّوا التحويل من بينهم.
  • الزوار (المجموعة التجريبية): عدد الأشخاص الذين شاهدوا النسخة B، أي النسخة الجديدة.
  • التحويلات (المجموعة التجريبية): عدد الذين أتمّوا التحويل من بينهم.

يغيّر إعدادان إضافيان طريقة تقييم النتيجة.

  • مستوى الثقة يحدد مدى صرامة الاختبار. وتُعد 95% القيمة الافتراضية الشائعة. أما المستوى الأعلى، مثل 99%، فيتطلب دليلًا أقوى قبل اعتبار النتيجة دالة إحصائيًا.
  • الفرضية تحدد اتجاه السؤال. يسأل الاختبار ثنائي الطرف: «هل تختلف B عن A، في أي من الاتجاهين؟» أما الاختبار أحادي الطرف فلا يسأل إلا: «هل B أفضل من A؟» ولا ينبغي اختيار الاختبار أحادي الطرف إلا قبل ظهور البيانات، وفقط عندما لا تؤدي نتيجة أسوأ لـ B إلى تغيير أي قرار.

تتحدث النتيجة مع إدخال الأرقام. وتُخزَّن المدخلات في عنوان صفحة الويب، لذلك يمكن حفظ النتيجة في الإشارات المرجعية أو مشاركتها كرابط.

صيغة اختبار A/B (اختبار z لنسبتين)

تستخدم الحاسبة اختبار z لنسبتين، وهو أسلوب قياسي يُدرَّس في الإحصاء التمهيدي لمقارنة معدلين.

الخطوة 1. معدل التحويل لكل مجموعة.

p1=x1n1,p2=x2n2p_1 = \frac{x_1}{n_1}, \qquad p_2 = \frac{x_2}{n_2}

هنا xx هو عدد التحويلات وnn هو عدد الزوار، للمجموعة الضابطة (1) والمجموعة المتغيرة (2).

الخطوة 2. معدل التحويل المجمّع. تفترض هذه الخطوة، لأغراض الاختبار، أن للمجموعتين معدلًا حقيقيًا أساسيًا واحدًا.

p^=x1+x2n1+n2\hat{p} = \frac{x_1 + x_2}{n_1 + n_2}

الخطوة 3. الخطأ المعياري للفرق، المحسوب من المعدل المجمّع.

SE=p^(1−p^)(1n1+1n2)SE = \sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}

الخطوة 4. درجة z، وهي الفجوة بين المعدلين مقيسةً بالأخطاء المعيارية.

z=p2−p1SEz = \frac{p_2 - p_1}{SE}

الخطوة 5. قيمة p، المأخوذة من التوزيع الطبيعي المعياري Φ\Phi. في الاختبار ثنائي الطرف: p=2(1−Φ(∣z∣))p = 2\left(1 - \Phi(|z|)\right). وفي الاختبار أحادي الطرف: p=1−Φ(z)p = 1 - \Phi(z).

الخطوة 6. الحكم. تُعد النتيجة دالة إحصائيًا عندما تكون قيمة p أصغر من α\alpha، حيث α=1−مستوى الثقة\alpha = 1 - \text{مستوى الثقة}. وعند مستوى ثقة 95%، تكون α=0.05\alpha = 0.05.

تعرض الحاسبة أيضًا فترة ثقة لحجم الفرق، p2−p1p_2 - p_1. وتستخدم هذه الفترة خطأً معياريًا منفصلًا لا يفترض أن للمجموعتين معدلًا مشتركًا:

SEunpooled=p1(1−p1)n1+p2(1−p2)n2SE_{unpooled} = \sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}}

الفترة هي (p2−p1)±zc×SEunpooled(p_2 - p_1) \pm z_c \times SE_{unpooled}، حيث إن zcz_c تساوي 1.6449 عند مستوى ثقة 90%، و1.96 عند مستوى ثقة 95%، و2.5758 عند مستوى ثقة 99%. وإذا لم تتضمن الفترة الصفر، فالفرق دال إحصائيًا عند مستوى الثقة ذلك.

مثال تطبيقي

الزوارالتحويلاتالمعدل
الضابطة (A)1,00010010.00%
المتغيرة (B)1,00015015.00%

المعدل المجمّع هو (100+150)/(1000+1000)=0.125(100+150)/(1000+1000) = 0.125، أو 12.5%. ويبلغ الخطأ المعياري المجمّع نحو 0.0148. ودرجة z هي (0.15−0.10)/0.0148≈3.38(0.15 - 0.10) / 0.0148 \approx 3.38.

في الاختبار ثنائي الطرف، ينتج عن ذلك قيمة p تبلغ نحو 0.00072. وهذه أقل من العتبة المعتادة 0.05، ولذلك يكون الفرق دالًا إحصائيًا عند مستوى ثقة 95%. ولو كان أداء النسختين متماثلًا فعلًا، لظهر فرق بهذا الحجم أو أكبر في نحو 7 من كل 10,000 اختبار بسبب الصدفة وحدها.

يبلغ الفرق المطلق 5.00 نقاط مئوية. وتبلغ الزيادة النسبية 50%، لأن معدل B يساوي 1.5 ضعف معدل A. وتتراوح فترة الثقة البالغة 95% للفرق الحقيقي تقريبًا من 2.11% إلى 7.89%.

قراءة النتيجة بصورة صحيحة

لا تعني النتيجة الدالة إحصائيًا تلقائيًا أنها تستحق اتخاذ إجراء بناءً عليها. فقد لا تستحق زيادة صغيرة وحقيقية تكلفة طرحها. ويظل الحكم التجاري مهمًا بعد إتمام الحسابات.

إن فحص قيمة p يوميًا وإيقاف الاختبار لحظة تجاوزها 0.05 يزيد احتمال الإيجابية الكاذبة. والأفضل تحديد حجم العينة أو مدة الاختبار مسبقًا، وترك الاختبار يكتمل قبل قراءة النتيجة.

يعمل التقريب الطبيعي الذي يعتمد عليه هذا الاختبار بأفضل صورة عندما تضم كل مجموعة نحو 10 تحويلات و10 حالات عدم تحويل على الأقل. ومع الأعداد الأصغر، ينبغي التعامل مع النتيجة باعتبارها مؤشرًا تقريبيًا لا إجابة حاسمة.

لا يعني مستوى ثقة 95% أن هناك احتمالًا قدره 95% لأن تكون B أفضل فعلًا. بل يعني أنه إذا تكرر الاختبار نفسه مرات عديدة، فستعطي هذه الطريقة نتيجة دالة خاطئة في حد أقصى 5% من الحالات. وهذا بيان عن الطريقة، لا عن هذه النتيجة بعينها.

يؤدي اختبار مقاييس كثيرة أو متغيرات كثيرة في الوقت نفسه إلى زيادة احتمال أن تبدو مقارنة واحدة على الأقل دالة لمجرد الحظ. ويؤدي اختيار مقياس واحد قبل بدء الاختبار إلى تجنب هذه المشكلة.

الأسئلة الشائعة

ما حجم العينة الذي يحتاج إليه اختبار A/B؟ عدد من الزوار يكفي لكي تظهر الزيادة المهمة فعلًا على أنها دالة إحصائيًا. والحد التقريبي هو بضع مئات من التحويلات لكل نسخة. وتوفر حاسبة مخصصة لحجم العينة، تستخدم المعدل الأساسي وأصغر زيادة تستحق الكشف عنها، رقمًا أدق قبل بدء الاختبار.

هل ينبغي أن يكون الاختبار أحادي الطرف أم ثنائي الطرف؟ الاختبار ثنائي الطرف هو الخيار الافتراضي الأكثر أمانًا، إذ يمكنه إظهار أن B أفضل من A أو أسوأ منها. أما الاختبار أحادي الطرف فهو أكثر حساسية للتحسن، لكنه لا يستطيع إظهار النتيجة الأسوأ؛ لذلك لا ينبغي استخدامه إلا عندما لا تؤدي نتيجة أسوأ لـ B إلى تغيير أي قرار.

لماذا تعرض الحاسبة فترة ثقة؟ تُظهر فترة الثقة النطاق المرجح للفرق الحقيقي، لا مجرد تصنيف النتيجة إلى دالة أو غير دالة. وعادةً ما تعني الفترة الواسعة التي تشمل الصفر أن الاختبار يحتاج إلى مزيد من البيانات.

هل هذه حاسبة بايزية؟ لا. فهي تستخدم اختبار z القائم على المنهج التكراري، وهو الأسلوب الأكثر شيوعًا في تدريس اختبارات A/B واستخدامها. أما الأداة البايزية فتُبلغ عن احتمال تفوق B على A. وكلا الأسلوبين صحيح، لكنهما يجيبان عن سؤالين مختلفين قليلًا.

ماذا لو عرضت الحاسبة خطأً؟ يظهر خطأ إذا كان عدد التحويلات سالبًا، أو تجاوز عدد الزوار، أو كان معدل التحويل المجمّع عبر المجموعتين يساوي 0% أو 100%، لأن صيغة اختبار z لا تستطيع القسمة على خطأ معياري يساوي صفرًا في هذه الحالة.

المصادر