Перейти до вмісту

Калькулятор значущості A/B тесту

Перевірте, чи результат вашого A/B тесту статистично значимий. Введіть відвідувачів і конверсії, щоб отримати p-значення, z-оцінку, довірчий інтервал і відносний підйом.

Калькулятор значущості A/B тесту

Введіть відвідувачів і конверсії для кожного варіанту, щоб перевірити, чи різниця реальна чи просто шум.

Контроль (A)
Варіація (B)

Результати

Статистично значимий

Різниця малоймовірна через випадок при вибраному рівні впевненості.

P-значення
0.0007

Chance this gap is just luck — lower is stronger.

Z-оцінка
3.381

How far apart the two rates are, in standard errors.

Відносний підйом
+50.0%
Коефіцієнт контролю
10.00%
Коефіцієнт варіацій
15.00%
Абсолютна різниця
+5.00 pp
Довірчий інтервал (різниця) · 95%
2.11% to 7.89%

The likely range for the true difference.

Коефіцієнт конверсії за варіантом
Коефіцієнт конверсії за варіантом. Grouped bar chart with 1 series: Коефіцієнт конверсії.0%5%10%15%Коефіцієнт конверсіїКонтроль (A)Варіація (B)10%15%
Калькулятор завантаження...
📚

Документація

A/B тестування за одну хвилину

Ви змінили кнопку, заголовок або процес оформлення. Версія A — це стара, версія B — нова. B виглядає краще — її конвертували 15% відвідувачів проти 10% для A. Але це може бути просто везіння, як коли кидати монету десять разів можна отримати сім орлів?

Цей калькулятор відповідає на це питання. Ви вводите, скільки людей бачило кожну версію та скільки їх конвертувало, і він показує вам ймовірність того, що різниця, яку ви виміряли, реальна, а не випадковий шум. Якщо ця ймовірність достатньо висока, у вас є переможець. Якщо ні, ви продовжуєте тест.

Одна цифра, на яку потрібно звернути увагу — це p-значення: ймовірність побачити розрив принаймні такий великий, якщо б дві версії були насправді однаковими. Невелике p-значення (скажімо, нижче 0,05) означає "це рідко траплялось би випадково, тому різниця, ймовірно, реальна".

Як це використовувати

  1. Відвідувачі — скільки унікальних людей було показано кожну версію.
  2. Конверсії — скільки з них зробили те, що вас цікавить (купили, зареєструвалися, клацнули).
  3. Рівень впевненості — наскільки впевнені ви, перш ніж оголосити переможця. 95% — це стандарт галузі.
  4. Гіпотезадвостороння запитує "чи B відрізняється від A?" (безпечніше, за замовчуванням); односторонна запитує тільки "чи B краще за A?" (чутливіше, але ви повинні вирішити напрямок перед запуском тесту).

Результат оновлюється в реальному часі, а вхідні дані зберігаються в URL сторінки, тому ви можете додати результат до закладок або поділитися ним. Скидання очищує форму; Завантажити приклад даних заповнює виконаний приклад.

Виконаний приклад

ВідвідувачіКонверсіїКоефіцієнт
A (контроль)1 00010010,0%
B (варіація)1 00015015,0%

Це 5 пунктів абсолютного підйому та +50% відносного підйому. Калькулятор повертає p-значення близько 0,0007 — менше 0,05 — тому при 95% впевненості результат статистично значимий. Грубо кажучи, якби дві версії були справді однаковими, ви бачили б розрив такого розміру менше одного разу з тисячі тестів.

Математика (двопропорційний z-тест)

Під капотом це стандартний двопропорційний z-тест, той самий тест, який викладається у вступних статистиках та використовується основними інструментами A/B.

  1. Коефіцієнт конверсії кожної групи:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    де xx — конверсії та nn — відвідувачі.

  2. Об'єднаний коефіцієнт, припускаючи (для нульової гіпотези) обидві групи мають один справжній коефіцієнт:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Стандартна помилка різниці:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. z-оцінка — скільки стандартних помилок розокремлюють два коефіцієнти:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. p-значення походить від стандартного нормального розподілу Φ\Phi. Двостороння: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Односторонна: p=1Φ(z)p = 1 - \Phi(z).

  6. Значимо, коли p<αp < \alpha, де α=1впевненість\alpha = 1 - \text{впевненість} (тому 0,05 при 95%).

Калькулятор також повідомляє довірчий інтервал для різниці, обчислений з необ'єднаною стандартною помилкою p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: правдоподібний діапазон справжнього розриву. Якщо цей інтервал виключає 0, результат значимий.

0 -1.96 +1.96 no difference

При 95% впевненості z крім ±1,96 (затінені хвости, 5% площі) вважається значимим.

Чесно читати результат

  • Статистична значущість — це не ділова значущість. Підйом на 0,1% може бути статистично реальним, але не варто його запускати.
  • Не підглядайте й не зупиняйтеся рано. Перевірка p-значення кожного дня та зупинка в момент, коли воно впаде нижче 0,05, інфлює вашу хибно-позитивну частоту. Визначте розмір вибірки заздалегідь і дайте тесту закінчитися.
  • Дотримуйтеся правила розміру вибірки. Звичайне наближення надійне, коли кожна група має принаймні ~10 конверсій і ~10 не-конверсій. З невеликими цифрами розглядайте результат тільки як напрям.
  • Впевненість ≠ ймовірність того, що B краще. Рівень впевненості 95% означає, що процедура неправильна щонайбільше 5% часу в довгостроковій перспективі — це твердження частотників, а не "95% шанс того, що B виграє".
  • Один тест, одна метрика. Тестування багатьох метрик або варіантів одночасно множить ймовірність помилки; компенсуйте це (наприклад, Bonferroni) або попередньо зареєструйте єдину метрику, яка визначає тест.

Обчисліть самостійно

Кожен уривок обчислює двосторонній p-значення для наведеного вище виконаного прикладу.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

FAQ

Який розмір вибірки мені потрібен? Достатньо, щоб виміряний значимий підйом можна було виявити. Як мінімум, прагніть щонайменше кількох сотень конверсій на варіант; використовуйте спеціалізований калькулятор розміру вибірки з вашим базовим коефіцієнтом і найменшим підйомом, який варто виявити.

Двостороння чи односторонна? Використовуйте двосторонню, якщо у вас немає твердої, попередньої причини цікавитися тільки вдосконаленням. Односторонна подвоює вашу чутливість, але забороняє реагування на те, що B гірше.

Чому калькулятор показує довірчий інтервал? Він показує правдоподібний діапазон справжньої різниці, а не просто так/ні вердикт. Широкий інтервал, який охоплює 0, означає "недостатньо даних ще".

Це Баєсів? Ні — це частотськешний z-тест, найбільш широко викладаний та використовуваний метод. Баєсові A/B інструменти повідомляють "ймовірність того, що B переможе A" замість p-значення; обидва дійсні, вони відповідають на дещо різні питання.

Джерела