Калкулатор за значимост на A/B тест
Проверете дали вашият A/B тест резултат е статистически значим. Въведете посетители и преобразувания, за да получите p-стойност, z-резултат, интервал на доверие и относителна мощност.
Калкулатор за значимост на A/B тест
Въведете посетители и преобразувания за всеки вариант, за да проверите дали разликата е реална или просто шум.
Резултати
Статистически значимо
Разликата е малко вероятно да се дължи на случайност при вашето избрано ниво на доверие.
Chance this gap is just luck — lower is stronger.
How far apart the two rates are, in standard errors.
The likely range for the true difference.
Документация
Какво прави калкулаторът за статистическа значимост на A/B тест
Калкулаторът за статистическа значимост на A/B тест проверява дали разликата между две версии на нещо — уебстраница, имейл или бутон за плащане — е реален ефект, или е само случайност. Той приема броя посетители и броя реализации за всяка версия и връща p-стойност, z-оценка и доверителен интервал. Реализация е всяко действие, което се счита за успех: покупка, регистрация или кликване.
Как се използва калкулаторът
Калкулаторът изисква четири числа.
- Посетители (контролна група): колко души са видели версия A, оригиналната версия.
- Реализации (контролна група): колко от тях са извършили желаното действие.
- Посетители (вариант): колко души са видели версия B, новата версия.
- Реализации (вариант): колко от тях са извършили желаното действие.
Още две настройки променят начина, по който се оценява резултатът.
- Ниво на доверие определя строгостта на теста. 95% е обичайната стойност по подразбиране. По-високо ниво, например 99%, изисква по-силни доказателства, преди резултатът да бъде обявен за значим.
- Хипотеза определя посоката на въпроса. Двустранният тест пита: „Различава ли се B от A в която и да е посока?“ Едностранният тест пита само: „По-добър ли е B от A?“ Едностранен тест трябва да се избира само преди получаването на данните и само когато по-лош резултат за B не би променил нито едно решение.
Резултатът се актуализира при въвеждане на числата. Въведените стойности се съхраняват в уеб адреса на страницата, така че резултатът може да бъде добавен към отметките или споделен като връзка.
Формула за A/B теста (z-тест за две пропорции)
Калкулаторът използва z-тест за две пропорции — стандартен метод, преподаван във въвеждащите курсове по статистика за сравняване на два дяла.
Стъпка 1. Процент на реализациите във всяка група.
Тук е броят реализации, а е броят посетители за контролната група (1) и варианта (2).
Стъпка 2. Обединен процент на реализациите. За целите на теста тази стъпка приема, че двете групи имат един и същ истински процент.
Стъпка 3. Стандартна грешка на разликата, изчислена от обединения процент.
Стъпка 4. Z-оценка, тоест разликата между двата процента, измерена в стандартни грешки.
Стъпка 5. P-стойност, получена от стандартното нормално разпределение . При двустранен тест: . При едностранен тест: .
Стъпка 6. Заключение. Резултатът се счита за статистически значим, когато p-стойността е по-малка от , където . При 95% доверие .
Калкулаторът отчита и доверителен интервал за размера на разликата, . Този интервал използва отделна стандартна грешка, която не приема, че двете групи имат един и същ процент:
Интервалът е , където е 1,6449 при 90% доверие, 1,96 при 95% и 2,5758 при 99%. Ако интервалът не съдържа нула, разликата е значима на съответното ниво на доверие.
Решен пример
| Посетители | Реализации | Ставка | |
|---|---|---|---|
| Контролна група (A) | 1 000 | 100 | 10,00% |
| Вариант (B) | 1 000 | 150 | 15,00% |
Обединеният процент е , или 12,5%. Обединената стандартна грешка е приблизително 0,0148. Z-оценката е .
При двустранен тест това дава p-стойност приблизително 0,00072. Тя е под обичайния праг 0,05, така че при 95% доверие разликата е статистически значима. Ако двете версии действително се представяха еднакво, разлика с такъв или по-голям размер би се появила приблизително при 7 от всеки 10 000 теста само по случайност.
Абсолютната разлика е 5,00 процентни пункта. Относителното увеличение е 50%, тъй като процентът на B е 1,5 пъти процента на A. 95% доверителният интервал за истинската разлика е приблизително от 2,11% до 7,89%.
Правилно тълкуване на резултата
Статистически значимият резултат не е автоматично резултат, въз основа на който си струва да се предприемат действия. Малко, но реално увеличение може да не оправдава разходите за внедряването му. Бизнес преценката остава важна и след извършването на математическите изчисления.
Ежедневната проверка на p-стойността и спирането на теста в момента, в който тя премине под 0,05, увеличават вероятността от фалшиво положителен резултат. По-добре е предварително да се изберат размерът на извадката или продължителността на теста и тестът да приключи, преди резултатът да бъде прегледан.
Нормалното приближение, на което се основава този тест, работи най-добре, когато всяка група има поне приблизително 10 реализации и 10 нереализации. При по-малки числа резултатът трябва да се приема като ориентировъчен сигнал, а не като окончателен отговор.
Ниво на доверие 95% не означава, че вероятността B действително да е по-добър е 95%. То означава, че ако същият тест бъде повторен много пъти, този метод би дал погрешен значим резултат най-много в 5% от случаите. Това е твърдение за метода, а не за този конкретен резултат.
Тестването на много показатели или много варианти едновременно увеличава вероятността поне едно сравнение да изглежда значимо единствено по случайност. Избирането на един показател преди началото на теста предотвратява този проблем.
Често задавани въпроси
Какъв размер на извадката е необходим за A/B тест? Достатъчно посетители, така че значимо увеличение действително да се прояви като значимо. Приблизителен минимум са няколкостотин реализации за всяка версия. Специализиран калкулатор за размера на извадката, който използва базовия процент и най-малкото увеличение, което си струва да бъде открито, дава по-точно число преди началото на теста.
Едностранен или двустранен трябва да бъде тестът? Двустранният е по-безопасният избор по подразбиране, тъй като може да покаже, че B е както по-добър, така и по-лош от A. Едностранният е по-чувствителен към подобрение, но не може да покаже по-лош резултат, затова трябва да се използва само когато по-лош резултат за B не би променил нито едно решение.
Защо калкулаторът отчита доверителен интервал? Доверителният интервал показва вероятния диапазон на истинската разлика, а не само етикет „значимо/незначимо“. Широк интервал, който обхваща нулата, обикновено означава, че тестът се нуждае от повече данни.
Байесов ли е този калкулатор? Не. Той използва честотен z-тест — метода, който най-често се преподава и използва за A/B тестване. Байесовият инструмент вместо това отчита вероятността B да превъзхожда A. И двата метода са валидни, но отговарят на малко различни въпроси.
Какво става, ако калкулаторът покаже грешка? Грешка се появява, ако броят реализации е отрицателен, ако надвишава броя посетители или ако общият процент на реализациите в двете групи е 0% или 100%, тъй като в такъв случай формулата на z-теста не може да дели на нулева стандартна грешка.