דלג לתוכן

מחשבון משמעות בדיקות A/B

מחשבון בדיקת A/B המחשב מובהקות סטטיסטית משתי גרסאות לפי מספרי מבקרים והמרות. מחזיר ערך p, ציון z, רווח סמך ואחוז שיפור, לבחירת הגרסה המנצחת בשיווק.

מחשבון משמעות בדיקות A/B

הזן מבקרים והמרות לכל גרסה כדי לבדוק אם ההבדל אמיתי או רק רעש.

בקרה (A)
וריאציה (B)

תוצאות

משמעותי סטטיסטית

ההבדל כמעט בטוח שלא בגלל הזדמנות ברמת הביטחון הנבחרת שלך.

ערך P
0.0007

Chance this gap is just luck — lower is stronger.

ציון Z
3.381

How far apart the two rates are, in standard errors.

גדילה יחסית
+50.0%
שיעור בקרה
10.00%
שיעור וריאציה
15.00%
הבדל מוחלט
+5.00 pp
רווח ביטחון (הבדל) · 95%
2.11% to 7.89%

The likely range for the true difference.

שיעור המרה לפי גרסה
שיעור המרה לפי גרסה. Grouped bar chart with 1 series: שיעור המרה.0%5%10%15%שיעור המרהבקרה (A)וריאציה (B)10%15%
מחשבון טעינה...
📚

תיעוד

בדיקות A/B בדקה אחת

שינית כפתור, כותרת או זרימת קנייה. גרסה A היא הישנה, גרסה B היא החדשה. B נראית טוב יותר — היא המירה 15% מהמבקרים לעומת 10% ל-A. אבל האם הפער הזה יכול להיות רק מזל, באותו אופן שהטלת מטבע עשר פעמים יכולה לתן שבע ראשים?

המחשבון הזה עונה בדיוק על זה. אתה מזין כמה אנשים ראו כל גרסה וכמה הומרו, והוא אומר לך את ההסתברות שההבדל שמדדת הוא אמיתי ולא רעש אקראי. אם ההסתברות הזו גבוהה מספיק, יש לך זוכה. אם לא, אתה מחזיק את הבדיקה לפעול.

המספר היחיד שצריך להתעקב אחריו הוא ערך ה-p: הסיכוי לראות פער של לפחות גודל זה אם שתי הגרסות היו למעשה זהות. ערך p קטן (נגיד, מתחת ל-0.05) אומר "זה בדרך כלל לא היה קורה במקרה, כך שההבדל כנראה אמיתי."

איך להשתמש בו

  1. מבקרים — כמה אנשים ייחודיים הוצגו לכל גרסה.
  2. המרות — כמה מהם עשו את הדבר שחשוב לך (קנו, נרשמו, לחצו).
  3. רמת ביטחון — כמה בטוח אתה רוצה להיות לפני שאתה קורא לזוכה. 95% הוא ברירת המחדל של התעשייה.
  4. השערהדו-צדדית שואלת "האם B שונה מ-A?" (בטוח יותר, ברירת המחדל); חד-צדדית שואלת רק "האם B טוב יותר מ-A?" (רגיש יותר, אבל עליך להחליט על הכיוון לפני הפעלת הבדיקה).

התוצאה מתעדכנת בזמן אמת והתשומות מאוחסנות בכתובת ה-URL של העמוד, כך שתוכל לסמן בחוקים או לשתף תוצאה. אפס מוחק את הטופס; טען נתוני דוגמה משמש דוגמה מעובדת.

דוגמה מעובדת

מבקריםהמרותשיעור
A (בקרה)1,00010010.0%
B (וריאציה)1,00015015.0%

זה גדילה מוחלטת של 5 נקודות אחוז וגדילה יחסית של +50%. המחשבון מחזיר ערך p של בערך 0.0007 — מתחת ל-0.05 — כך שבביטחון 95% התוצאה היא משמעותית סטטיסטית. בערך, אם שתי הגרסות היו באמת זהות, היית רואה פער כזה גדול פחות מפעם אחת בצבר בדיקות.

המתמטיקה (בדיקת z דו-פרופורציה)

מתחת להיקף הזה זה בדיקת z דו-פרופורציה רגילה, אותה בדיקה המלומדה בסטטיסטיקה מבוא וחרות על ידי כלים A/B בעיקר.

  1. שיעור ההמרה של כל קבוצה:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    כאשר xx הוא המרות ו-nn הוא מבקרים.

  2. שיעור מאוגד, בהנחה (עבור השערת האפס) שלשתי הקבוצות יש שיעור אמיתי אחד:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. שגיאה רגילה של ההבדל:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. ציון ה-z — כמה שגיאות רגילות זה מלבד שני השיעורים:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. ערך ה-p מגיע מהתפלגות הנורמלית הרגילה Φ\Phi. דו-צדדית: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). חד-צדדית: p=1Φ(z)p = 1 - \Phi(z).

  6. משמעותי כאשר p<αp < \alpha, כאשר α=1confidence\alpha = 1 - \text{confidence} (אז 0.05 ב-95%).

המחשבון גם מדווח על רווח ביטחון להבדל, המחושב עם שגיאה רגילה לא מאוגדת p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: הטווח הגיוני להפרש האמיתי. אם הרווח הזה מוציא 0, התוצאה היא משמעותית.

0 -1.96 +1.96 no difference

ב-95% ביטחון, z מעבר ±1.96 (הזנבות המוצללים, 5% מהשטח) נחשב משמעותי.

קריאת התוצאה בכנות

  • משמעות סטטיסטית היא לא משמעות עסקית. גדילה של 0.1% יכולה להיות אמיתית מבחינה סטטיסטית עדיין לא שווה שינוע.
  • אל תביט ועצור מוקדם. בדיקה של ערך ה-p כל יום ועצירה ברגע שהוא מטפטף מתחת ל-0.05 מוגברת שיעור החיובי השקר שלך. החלט על גודל המדגם מראש והנח לבדיקה להסתיים.
  • צפה בכלל אצבע גודל מדגם. הקירוב הנורמלי אמין כאשר לכל קבוצה יש לפחות ~10 המרות ו~10 אי-המרות. עם מספרים זעירים, התייחסות לתוצאה כלא לכן בלבד.
  • ביטחון ≠ הסתברות B טוב יותר. רמת ביטחון 95% פירושה ההליך טעוני לכל היותר 5% של הזמן בטווח ארוך — זה הצהרה לא בתכנון תדירות, לא "95% סיכוי B ינצח."
  • בדיקה אחת, מטרי אחד. בדיקה של מטרים רבים או גרסים בו זמנית מכפילה את הסיכוי לתאונה; תתקן לזה (למשל Bonferroni) או הירשם מראש למטרי יחיד המחליט את הבדיקה.

חשבו זה בעצמכם

כל קטע מחשב את ערך ה-p דו-צדדי לדוגמה המעובדת לעיל.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

שאלות נפוצות

איזה גודל מדגם אני צריך? מספיק שגדילה משמעותית תהיה ניתנת לגילוי. כרצפה, תשאף לפחות כמה מאות המרות לכל גרסה; השתמש במחשבון גודל מדגם ייעודי עם שיעור ייצור הבסיס שלך וגדילה הקטנה ביותר שכדאי לגלות.

דו-צדדית או חד-צדדית? השתמש דו-צדדית אלא אם יש לך סיבה חזקה וחוקית מראש לטפל בשיפור בלבד. חד-צדדית מכפילה את רגישותך אך אוסרת על תגובה ל-B להיות גרוע.

למה המחשבון מציג רווח ביטחון? הוא מציג את הטווח הגיוני של ההבדל האמיתי, לא רק פסק דין כן/לא. רווח רחב שחוצה 0 אומר "לא מספיק נתונים עדיין."

האם זה בייסיאני? לא — זה בדיקת z בתדירות, השיטה הנלמדת בעיקר והשימוש. כלים A/B בייסיאניים דווחו על "הסתברות B מנצחת A" במקום ערך p; שניהם תקפים, הם עונים על שאלות מעט שונות.

מקורות