Перейти к содержимому

Калькулятор статистической значимости A/B тестов

Проверьте, является ли ваш результат A/B теста статистически значимым. Введите количество посетителей и конверсий, чтобы получить p-значение, z-оценку, доверительный интервал и относительный прирост.

Калькулятор статистической значимости A/B тестов

Введите количество посетителей и конверсий для каждого варианта, чтобы проверить, является ли разница реальной или просто шумом.

Контроль (A)
Вариация (B)

Результаты

Статистически значимо

Разница вряд ли произойдёт просто так при выбранном вами уровне уверенности.

P-значение
0.0007

Chance this gap is just luck — lower is stronger.

Z-оценка
3.381

How far apart the two rates are, in standard errors.

Относительный прирост
+50.0%
Процент конверсии контроля
10.00%
Процент конверсии вариации
15.00%
Абсолютная разница
+5.00 pp
Доверительный интервал (разница) · 95%
2.11% to 7.89%

The likely range for the true difference.

Процент конверсии по вариантам
Процент конверсии по вариантам. Grouped bar chart with 1 series: Процент конверсии.0%5%10%15%Процент конверсииКонтроль (A)Вариация (B)10%15%
Калькулятор загрузки...
📚

Документация

Что делает калькулятор статистической значимости A/B-теста

Калькулятор статистической значимости A/B-теста проверяет, является ли различие между двумя версиями чего-либо — веб-страницы, электронного письма, кнопки оформления заказа — реальным эффектом или случайностью. Он принимает число посетителей и число конверсий для каждой версии и возвращает p-значение, z-оценку и доверительный интервал. Конверсия — это любое действие, считающееся успехом: покупка, регистрация или клик.

Как пользоваться калькулятором

Калькулятору нужны четыре числа.

  • Посетители (контрольная группа): сколько людей увидели версию A, исходный вариант.
  • Конверсии (контрольная группа): сколько из них совершили конверсию.
  • Посетители (тестовая группа): сколько людей увидели версию B, новый вариант.
  • Конверсии (тестовая группа): сколько из них совершили конверсию.

Ещё две настройки влияют на оценку результата.

  • Уровень доверия определяет строгость теста. 95 % — распространённое значение по умолчанию. Более высокий уровень, например 99 %, требует более убедительных доказательств, прежде чем результат можно будет признать значимым.
  • Гипотеза задаёт направление вопроса. Двусторонний тест спрашивает: «Отличается ли B от A в любом направлении?» Односторонний тест спрашивает только: «Лучше ли B, чем A?» Односторонний тест следует выбирать только до получения данных и только тогда, когда худший результат для B не изменил бы никаких решений.

Результат обновляется по мере ввода чисел. Введённые данные сохраняются в веб-адресе страницы, поэтому результат можно добавить в закладки или отправить как ссылку.

Формула A/B-теста (z-тест для двух пропорций)

Калькулятор использует z-тест для двух пропорций — стандартный метод, который изучают во вводном курсе статистики для сравнения двух долей.

Шаг 1. Коэффициент конверсии каждой группы.

p1=x1n1,p2=x2n2p_1 = \frac{x_1}{n_1}, \qquad p_2 = \frac{x_2}{n_2}

Здесь xx — число конверсий, а nn — число посетителей для контрольной (1) и тестовой (2) групп.

Шаг 2. Объединённый коэффициент конверсии. На этом шаге предполагается, что для целей теста обе группы имеют одно и то же истинное значение коэффициента конверсии.

p^=x1+x2n1+n2\hat{p} = \frac{x_1 + x_2}{n_1 + n_2}

Шаг 3. Стандартная ошибка разности, рассчитанная на основе объединённой доли.

SE=p^(1−p^)(1n1+1n2)SE = \sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}

Шаг 4. Z-оценка, то есть разность между двумя долями, измеренная в стандартных ошибках.

z=p2−p1SEz = \frac{p_2 - p_1}{SE}

Шаг 5. P-значение, полученное из стандартного нормального распределения Φ\Phi. Для двустороннего теста: p=2(1−Φ(∣z∣))p = 2\left(1 - \Phi(|z|)\right). Для одностороннего теста: p=1−Φ(z)p = 1 - \Phi(z).

Шаг 6. Вывод. Результат считается статистически значимым, если p-значение меньше α\alpha, где α=1−уровень доверия\alpha = 1 - \text{уровень доверия}. При доверительном уровне 95 % α=0.05\alpha = 0.05.

Калькулятор также сообщает доверительный интервал для величины разности, p2−p1p_2 - p_1. В этом интервале используется отдельная стандартная ошибка, не предполагающая, что две группы имеют одинаковую долю:

SEunpooled=p1(1−p1)n1+p2(1−p2)n2SE_{unpooled} = \sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}}

Интервал равен (p2−p1)±zc×SEunpooled(p_2 - p_1) \pm z_c \times SE_{unpooled}, где zcz_c составляет 1,6449 при доверительном уровне 90 %, 1,96 при 95 % и 2,5758 при 99 %. Если интервал не содержит ноль, разность значима при соответствующем уровне доверия.

Пример расчёта

ПосетителиКонверсииКоэффициент конверсии
Контрольная группа (A)1 00010010,00 %
Тестовая группа (B)1 00015015,00 %

Объединённый коэффициент конверсии равен (100+150)/(1000+1000)=0.125(100+150)/(1000+1000) = 0.125, или 12,5 %. Объединённая стандартная ошибка составляет примерно 0,0148. Z-оценка равна (0.15−0.10)/0.0148≈3.38(0.15 - 0.10) / 0.0148 \approx 3.38.

Для двустороннего теста это даёт p-значение примерно 0,00072. Оно ниже обычного порога 0,05, поэтому при уровне доверия 95 % разность статистически значима. Если бы две версии действительно работали одинаково, разность такого или большего размера возникала бы примерно в 7 из каждых 10 000 тестов только из-за случайности.

Абсолютная разность составляет 5,00 процентного пункта. Относительный прирост равен 50 %, поскольку коэффициент конверсии B в 1,5 раза выше коэффициента A. Доверительный интервал 95 % для истинной разности составляет примерно от 2,11 % до 7,89 %.

Как правильно интерпретировать результат

Статистически значимый результат не обязательно означает, что на его основе стоит предпринимать действия. Небольшой, но реальный прирост может не оправдывать затрат на его внедрение. После выполнения расчётов всё равно требуется деловая оценка.

Ежедневная проверка p-значения и остановка теста сразу после того, как оно пересечёт порог 0,05, повышают вероятность ложноположительного результата. Лучше заранее выбрать размер выборки или продолжительность теста и дождаться его завершения, прежде чем оценивать результат.

Нормальная аппроксимация, на которой основан этот тест, лучше всего работает, когда в каждой группе есть как минимум примерно 10 конверсий и 10 неконверсий. При меньших значениях результат следует считать приблизительным сигналом, а не окончательным выводом.

Уровень доверия 95 % не означает, что вероятность истинного превосходства B над A составляет 95 %. Это означает, что при многократном повторении того же теста данный метод выдавал бы ошибочно значимый результат не более чем в 5 % случаев. Это утверждение о методе, а не об этом конкретном результате.

Одновременная проверка множества метрик или вариантов повышает вероятность того, что хотя бы одно сравнение окажется значимым исключительно по воле случая. Выбор одной метрики до начала теста позволяет избежать этой проблемы.

Часто задаваемые вопросы

Какой размер выборки нужен для A/B-теста? Нужно достаточно посетителей, чтобы значимый прирост действительно проявился как статистически значимый. Приблизительный минимум — несколько сотен конверсий на каждую версию. Специализированный калькулятор размера выборки, использующий базовый коэффициент конверсии и минимальный обнаруживаемый прирост, позволяет точнее определить число до начала теста.

Тест должен быть односторонним или двусторонним? Двусторонний тест — более безопасный вариант по умолчанию, поскольку он может показать, что B как лучше, так и хуже A. Односторонний тест чувствительнее к улучшению, но не способен выявить ухудшение, поэтому его следует использовать только тогда, когда худший результат B не изменил бы никаких решений.

Зачем калькулятор сообщает доверительный интервал? Доверительный интервал показывает вероятный диапазон истинной разности, а не только метку «значимо/незначимо». Широкий интервал, охватывающий ноль, обычно означает, что тесту нужно больше данных.

Является ли этот калькулятор байесовским? Нет. Он использует частотный z-тест — метод, который чаще всего преподают и применяют для A/B-тестирования. Байесовский инструмент вместо этого сообщает вероятность того, что B превосходит A. Оба подхода допустимы, но отвечают на несколько разные вопросы.

Что делать, если калькулятор показывает ошибку? Ошибка появляется, если число конверсий отрицательно, превышает число посетителей или объединённый коэффициент конверсии для обеих групп равен 0 % или 100 %, поскольку в таком случае формула z-теста не может выполнить деление на нулевую стандартную ошибку.

Источники