מחשבון משמעות בדיקות A/B
מחשבון בדיקת A/B המחשב מובהקות סטטיסטית משתי גרסאות לפי מספרי מבקרים והמרות. מחזיר ערך p, ציון z, רווח סמך ואחוז שיפור, לבחירת הגרסה המנצחת בשיווק.
מחשבון משמעות בדיקות A/B
הזן מבקרים והמרות לכל גרסה כדי לבדוק אם ההבדל אמיתי או רק רעש.
תוצאות
משמעותי סטטיסטית
ההבדל כמעט בטוח שלא בגלל הזדמנות ברמת הביטחון הנבחרת שלך.
Chance this gap is just luck — lower is stronger.
How far apart the two rates are, in standard errors.
The likely range for the true difference.
תיעוד
מה עושה מחשבון מובהקות של מבחן A/B
מחשבון מובהקות של מבחן A/B בודק אם ההבדל בין שתי גרסאות של דבר כלשהו — דף אינטרנט, הודעת דוא״ל או כפתור תשלום — הוא אפקט אמיתי או תוצאה של מקריות בלבד. הוא מקבל את מספר המבקרים ואת מספר ההמרות בכל גרסה ומחזיר ערך-p, ציון-z ורווח סמך. המרה היא כל פעולה שנחשבת להצלחה: רכישה, הרשמה או לחיצה.
כיצד להשתמש במחשבון
המחשבון זקוק לארבעה מספרים.
- מבקרים (קבוצת ביקורת): כמה אנשים ראו את גרסה A, הגרסה המקורית.
- המרות (קבוצת ביקורת): כמה מהם ביצעו המרה.
- מבקרים (גרסה חלופית): כמה אנשים ראו את גרסה B, הגרסה החדשה.
- המרות (גרסה חלופית): כמה מהם ביצעו המרה.
שתי הגדרות נוספות משפיעות על אופן השיפוט של התוצאה.
- רמת סמך קובעת עד כמה המבחן מחמיר. 95% היא ברירת המחדל המקובלת. רמה גבוהה יותר, כגון 99%, דורשת ראיות חזקות יותר לפני שמכריזים על תוצאה כמובהקת.
- השערה קובעת את כיוון השאלה. מבחן דו־צדדי שואל: "האם B שונה מ־A, בכל כיוון שהוא?" מבחן חד־צדדי שואל רק: "האם B טובה יותר מ־A?" יש לבחור במבחן חד־צדדי רק לפני קבלת הנתונים, ורק כאשר תוצאה גרועה יותר עבור B לא תשנה שום החלטה.
התוצאה מתעדכנת כאשר מזינים את המספרים. נתוני הקלט נשמרים בכתובת האינטרנט של הדף, ולכן אפשר להוסיף את התוצאה לסימניות או לשתף אותה כקישור.
נוסחת מבחן A/B (מבחן z לשני שיעורים)
המחשבון משתמש במבחן z לשני שיעורים, שיטה מקובלת הנלמדת בסטטיסטיקה למתחילים להשוואת שני שיעורים.
שלב 1. שיעור ההמרה של כל קבוצה.
כאן הוא מספר ההמרות ו־ הוא מספר המבקרים, עבור קבוצת הביקורת (1) והגרסה החלופית (2).
שלב 2. שיעור המרה מאוחד. בשלב זה מניחים, לצורך המבחן, שלשתי הקבוצות יש שיעור אמיתי בסיסי משותף.
שלב 3. טעות התקן של ההפרש, המחושבת על בסיס השיעור המאוחד.
שלב 4. ציון z, הפער בין שני השיעורים כשהוא נמדד ביחידות של טעויות תקן.
שלב 5. ערך-p, הנלקח מההתפלגות הנורמלית התקנית . עבור מבחן דו־צדדי: . עבור מבחן חד־צדדי: .
שלב 6. הכרעה. התוצאה נחשבת מובהקת סטטיסטית כאשר ערך ה־p קטן מ־, כאשר . ברמת סמך של 95%, .
המחשבון מדווח גם על רווח סמך לגודל ההפרש, . רווח זה משתמש בטעות תקן נפרדת, שאינה מניחה שלשתי הקבוצות יש שיעור משותף:
הרווח הוא , כאשר הוא 1.6449 ברמת סמך של 90%, 1.96 ברמת סמך של 95%, ו־2.5758 ברמת סמך של 99%. אם הרווח אינו כולל את האפס, ההבדל מובהק ברמת סמך זו.
דוגמה פתורה
| מבקרים | המרות | שיעור | |
|---|---|---|---|
| קבוצת ביקורת (A) | 1,000 | 100 | 10.00% |
| גרסה חלופית (B) | 1,000 | 150 | 15.00% |
השיעור המאוחד הוא , או 12.5%. טעות התקן המאוחדת היא בערך 0.0148. ציון ה־z הוא .
עבור מבחן דו־צדדי מתקבל ערך-p של בערך 0.00072. ערך זה נמוך מסף 0.05 המקובל, ולכן ברמת סמך של 95% ההבדל מובהק סטטיסטית. אילו שתי הגרסאות היו מפיקות בפועל את אותה תוצאה, פער בגודל כזה או גדול ממנו היה מופיע במקרה בלבד בכ־7 מתוך כל 10,000 מבחנים.
ההבדל המוחלט הוא 5.00 נקודות אחוז. השיפור היחסי הוא 50%, משום ששיעור ההמרה של B הוא פי 1.5 משיעור ההמרה של A. רווח הסמך ברמת 95% עבור ההבדל האמיתי הוא בערך מ־2.11% עד 7.89%.
כיצד לקרוא את התוצאה נכון
תוצאה מובהקת סטטיסטית אינה בהכרח תוצאה שכדאי לפעול לפיה. ייתכן ששיפור קטן אך אמיתי לא יצדיק את עלות ההשקה שלו. שיקול הדעת העסקי עדיין חשוב לאחר סיום החישובים.
בדיקת ערך ה־p מדי יום והפסקת המבחן ברגע שהוא חוצה את 0.05 מגדילות את הסיכוי לחיובי כוזב. עדיף לקבוע מראש גודל מדגם או משך הרצה, ולאפשר למבחן להסתיים לפני שקוראים את התוצאה.
הקירוב הנורמלי שעליו מסתמך המבחן פועל בצורה הטובה ביותר כאשר בכל קבוצה יש לפחות כ־10 המרות ו־10 אי־המרות. במספרים קטנים יותר יש להתייחס לתוצאה כאות ראשוני ולא כתשובה ודאית.
רמת סמך של 95% אינה אומרת שהסיכוי לכך ש־B טובה יותר באמת הוא 95%. המשמעות היא שאילו אותו מבחן היה חוזר פעמים רבות, שיטה זו הייתה מניבה תוצאה מובהקת שגויה לכל היותר ב־5% מהמקרים. זו אמירה על השיטה, לא על התוצאה המסוימת הזו.
בדיקה של מדדים רבים או של גרסאות רבות בו־זמנית מגדילה את הסיכוי שלפחות השוואה אחת תיראה מובהקת רק בזכות המזל. בחירה במדד אחד לפני תחילת המבחן מונעת את הבעיה הזו.
שאלות נפוצות
איזה גודל מדגם דרוש למבחן A/B? מספר מבקרים מספיק כך ששיפור משמעותי אכן יופיע כמובהק. רף גס הוא כמה מאות המרות לכל גרסה. מחשבון ייעודי לגודל מדגם, המשתמש בשיעור הבסיסי ובשיפור הקטן ביותר שכדאי לזהות, מספק מספר מדויק יותר לפני תחילת המבחן.
האם המבחן צריך להיות חד־צדדי או דו־צדדי? דו־צדדי הוא ברירת המחדל הבטוחה יותר, משום שהוא יכול לזהות ש־B טובה יותר או גרועה יותר מ־A. מבחן חד־צדדי רגיש יותר לשיפור, אך אינו יכול לזהות תוצאה גרועה יותר, ולכן יש להשתמש בו רק כאשר תוצאה גרועה יותר של B לא תשנה שום החלטה.
מדוע המחשבון מדווח על רווח סמך? רווח סמך מציג את הטווח הסביר של ההבדל האמיתי, ולא רק תווית של מובהק או לא מובהק. רווח רחב הכולל את האפס משמעו בדרך כלל שהמבחן זקוק לנתונים נוספים.
האם זהו מחשבון בייסיאני? לא. הוא משתמש במבחן z בגישה פריקוונטיסטית, השיטה הנלמדת והמשמשת בדרך כלל לבדיקות A/B. כלי בייסיאני מדווח במקום זאת על ההסתברות ש־B עדיפה על A. שתי השיטות תקפות; הן עונות על שאלות מעט שונות.
מה אם המחשבון מציג שגיאה? שגיאה מופיעה אם מספר ההמרות שלילי, אם הוא גדול ממספר המבקרים, או אם שיעור ההמרה המשולב בשתי הקבוצות הוא 0% או 100%, משום שבמקרה כזה נוסחת מבחן ה־z אינה יכולה לחלק בטעות תקן שערכה אפס.