Калькулятор значущості A/B тесту
Перевірте, чи результат вашого A/B тесту статистично значимий. Введіть відвідувачів і конверсії, щоб отримати p-значення, z-оцінку, довірчий інтервал і відносний підйом.
Калькулятор значущості A/B тесту
Введіть відвідувачів і конверсії для кожного варіанту, щоб перевірити, чи різниця реальна чи просто шум.
Результати
Статистично значимий
Різниця малоймовірна через випадок при вибраному рівні впевненості.
Chance this gap is just luck — lower is stronger.
How far apart the two rates are, in standard errors.
The likely range for the true difference.
Документація
Що робить калькулятор статистичної значущості A/B-тесту
Калькулятор статистичної значущості A/B-тесту перевіряє, чи є різниця між двома версіями чогось — вебсторінки, електронного листа, кнопки оформлення замовлення — реальним ефектом, чи лише випадковістю. Він отримує кількість відвідувачів і кількість конверсій для кожної версії та повертає p-значення, z-оцінку й довірчий інтервал. Конверсія — це будь-яка дія, яку вважають успішною: покупка, реєстрація або клік.
Як користуватися калькулятором
Калькулятору потрібні чотири числа.
- Відвідувачі (контрольна група): скільки людей побачили версію A, початкову версію.
- Конверсії (контрольна група): скільки з них здійснили конверсію.
- Відвідувачі (варіант): скільки людей побачили версію B, нову версію.
- Конверсії (варіант): скільки з них здійснили конверсію.
Ще два налаштування змінюють спосіб оцінювання результату.
- Рівень довіри визначає суворість тесту. 95% — поширене значення за замовчуванням. Вищий рівень, наприклад 99%, вимагає переконливіших доказів, перш ніж результат буде визнано значущим.
- Гіпотеза визначає напрямок запитання. Двобічний тест запитує: «чи відрізняється B від A в будь-який бік?» Однобічний тест запитує лише: «чи є B кращим за A?» Однобічний тест слід обирати тільки до отримання даних і лише тоді, коли гірший результат для B не змінив би жодного рішення.
Результат оновлюється в міру введення чисел. Введені дані зберігаються у вебадресі сторінки, тому результат можна додати в закладки або поширити як посилання.
Формула A/B-тесту (z-тест для двох пропорцій)
Калькулятор використовує z-тест для двох пропорцій — стандартний метод, якому навчають у вступній статистиці для порівняння двох часток.
Крок 1. Коефіцієнт конверсії кожної групи.
Тут — кількість конверсій, а — кількість відвідувачів для контрольної групи (1) і варіанта (2).
Крок 2. Об’єднаний коефіцієнт конверсії. На цьому кроці для цілей тесту припускається, що обидві групи мають одну спільну істинну базову частку.
Крок 3. Стандартна похибка різниці, обчислена на основі об’єднаної частки.
Крок 4. Z-оцінка — різниця між двома частками, виміряна у стандартних похибках.
Крок 5. P-значення, отримане зі стандартного нормального розподілу . Для двобічного тесту: . Для однобічного тесту: .
Крок 6. Висновок. Результат вважається статистично значущим, коли p-значення менше за , де . За рівня довіри 95%, .
Калькулятор також подає довірчий інтервал для величини різниці, . Для цього інтервалу використовується окрема стандартна похибка, яка не припускає, що обидві групи мають однакову частку:
Інтервал має вигляд , де дорівнює 1,6449 за рівня довіри 90%, 1,96 за 95% і 2,5758 за 99%. Якщо інтервал не містить нуля, різниця є значущою на цьому рівні довіри.
Приклад обчислення
| Відвідувачі | Конверсії | Коефіцієнт | |
|---|---|---|---|
| Контрольна група (A) | 1 000 | 100 | 10,00% |
| Варіант (B) | 1 000 | 150 | 15,00% |
Об’єднаний коефіцієнт дорівнює , або 12,5%. Об’єднана стандартна похибка становить приблизно 0,0148. Z-оцінка дорівнює .
Для двобічного тесту це дає p-значення приблизно 0,00072. Воно нижче за звичайний поріг 0,05, тому за рівня довіри 95% різниця є статистично значущою. Якби дві версії насправді працювали однаково, розрив такого самого або більшого розміру виникав би приблизно у 7 з кожних 10 000 тестів лише через випадковість.
Абсолютна різниця становить 5,00 відсоткових пунктів. Відносне зростання дорівнює 50%, оскільки коефіцієнт для B у 1,5 раза більший за коефіцієнт для A. Довірчий інтервал 95% для істинної різниці становить приблизно від 2,11% до 7,89%.
Як правильно читати результат
Статистично значущий результат не обов’язково вартий практичних дій. Невелике, але реальне зростання може не виправдати витрат на його впровадження. Після завершення математичних розрахунків усе одно потрібне ділове судження.
Щоденна перевірка p-значення та припинення тесту тієї миті, коли воно перетинає поріг 0,05, підвищує ймовірність хибнопозитивного результату. Краще заздалегідь визначити розмір вибірки або тривалість тесту й дочекатися його завершення, перш ніж читати результат.
Нормальна апроксимація, на якій ґрунтується цей тест, найкраще працює, коли кожна група має щонайменше приблизно 10 конверсій і 10 неконверсій. За меншої кількості даних результат слід розглядати як приблизний сигнал, а не як остаточну відповідь.
Рівень довіри 95% не означає, що ймовірність істинної переваги B над A становить 95%. Це означає, що якби той самий тест повторювали багато разів, цей метод давав би помилковий значущий результат не більш ніж у 5% випадків. Це твердження про метод, а не про цей конкретний результат.
Перевірка багатьох показників або багатьох варіантів одночасно підвищує ймовірність того, що принаймні одне порівняння виглядатиме значущим лише через випадковість. Вибір одного показника до початку тесту дає змогу уникнути цієї проблеми.
Поширені запитання
Який розмір вибірки потрібен для A/B-тесту? Потрібно достатньо відвідувачів, щоб значуще зростання справді виявилося статистично значущим. Орієнтовний мінімум — кілька сотень конверсій для кожної версії. Спеціальний калькулятор розміру вибірки, що використовує базовий коефіцієнт і найменше зростання, яке потрібно виявити, дає точніше число до початку тесту.
Тест має бути однобічним чи двобічним? Двобічний тест є безпечнішим значенням за замовчуванням, оскільки він може виявити, що B як кращий, так і гірший за A. Однобічний тест чутливіший до покращення, але не може виявити гірший результат, тому його слід використовувати лише тоді, коли гірший результат B не змінив би жодного рішення.
Навіщо калькулятор подає довірчий інтервал? Довірчий інтервал показує ймовірний діапазон істинної різниці, а не лише позначку «значуще/незначуще». Широкий інтервал, що охоплює нуль, зазвичай означає, що тесту потрібно більше даних.
Це байєсівський калькулятор? Ні. Він використовує частотний z-тест — метод, якому найчастіше навчають і який найчастіше застосовують для A/B-тестування. Байєсівський інструмент натомість подає ймовірність того, що B кращий за A. Обидва методи коректні; вони відповідають на дещо різні запитання.
Що робити, якщо калькулятор показує помилку? Помилка з’являється, якщо кількість конверсій від’ємна, перевищує кількість відвідувачів або об’єднаний коефіцієнт конверсії для обох груп дорівнює 0% чи 100%, оскільки в такому разі формула z-тесту не може виконати ділення на нульову стандартну похибку.