Прескочи на садржај

Калкулатор статистичке значајности А/Б теста

Проверите да ли је резултат вашег А/Б теста статистички значајан. Унесите посетиоце и конверзије да бисте добили п-вредност, з-скор, интервал поверења и релативно подизање.

Калкулатор статистичке значајности А/Б теста

Унесите посетиоце и конверзије за сваку варијанту да бисте проверили да ли је разлика реална или само буква.

Контрола (А)
Варијација (Б)

Резултати

Статистички значајно

Разлика је врло вероватна да није због случајности при вашем избраном нивоу поверења.

П-вредност
0.0007

Chance this gap is just luck — lower is stronger.

З-скор
3.381

How far apart the two rates are, in standard errors.

Релативно подизање
+50.0%
Стопа контроле
10.00%
Стопа варијације
15.00%
Апсолутна разлика
+5.00 pp
Интервал поверења (разлика) · 95%
2.11% to 7.89%

The likely range for the true difference.

Стопа конверзије по варијанти
Стопа конверзије по варијанти. Grouped bar chart with 1 series: Стопа конверзије.0%5%10%15%Стопа конверзијеКонтрола (А)Варијација (Б)10%15%
Kalkulator učitavanja...
📚

Dokumentacija

А/Б тестирање за једну минуту

Променили сте дугме, наслов или ток плаћања. Верзија А је стара, верзија Б је нова. Б изгледа боље — конвертовано је 15% посетилаца наспрам 10% за А. Али може ли та разлика бити само срећа, исто као што бацање новчића десет пута може дати седам глава?

Овај калкулатор одговара управо на то. Унесете колико је људи видело сваку верзију и колико их је конвертовало, и он вам говори вероватноћу да је разлика коју сте измерили реална уместо случајне буке. Ако је та вероватноћа довољно велика, имате победника. Ако не, наставите тест.

Једина бројка коју требате пратити је п-вредност: шанса да видите разлику барем овако велику ако су две верзије заправо биле идентичне. Мала п-вредност (рецимо, испод 0,05) значи "ово би се ретко десило срећом, тако да је разлика вероватно реална."

Како га користити

  1. Посетиоци — колико јединствених људи је приказано свакој верзији.
  2. Конверзије — колико их је урадило оно што вас занима (куповина, пријава, клик).
  3. Ниво поверења — колико сте сигурни пре него што позовете победника. 95% је индустријски стандард.
  4. Хипотезадвострана пита "да ли је Б различита од А?" (безбеднија, подразумевана); једнострана пита само "да ли је Б боља од А?" (осетљивија, али морате одлучити смер пре него што покренете тест).

Резултат се ажурира уживо и уноси се чувају у УРЛ-у странице, па можете означити или делити резултат. Ресетуј брише образац; Учитај примере попуњава радни пример.

Радни пример

ПосетиоциКонверзијеСтопа
А (контрола)1.00010010,0%
Б (варијација)1.00015015,0%

То је подизање од 5 процентних поена апсолутно и +50% релативно подизање. Калкулатор враћа п-вредност од отприлике 0,0007 — испод 0,05 — тако да је при 95% поверења резултат статистички значајан. Отприлике, да су две верзије биле заиста идентичне, видели бисте разлику овако велику мање од једном у хиљаду тестова.

Математика (двосразмерни з-тест)

Испод маске ово је стандардни двосразмерни з-тест, исти тест који се предаје у уводној статистици и користе га главни А/Б алати.

  1. Стопа конверзије сваке групе:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    где је xx конверзија и nn посетиоци.

  2. Обједињена стопа, под претпоставком (за нулту хипотезу) да обе групе деле једну праву стопу:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Стандардна грешка разлике:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. З-скор — колико стандардних грешака су раздвајају две стопе:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. п-вредност долази из стандардне нормалне дистрибуције Φ\Phi. Двострана: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Једнострана: p=1Φ(z)p = 1 - \Phi(z).

  6. Значајна када је p<αp < \alpha, где је α=1confidence\alpha = 1 - \text{confidence} (тако 0,05 при 95%).

Калкулатор такође извештава интервал поверења за разлику, израчунат са необједињеном стандардном грешком p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: вероватан опсег за праву разлику. Ако тај интервал искључи 0, резултат је значајан.

0 -1.96 +1.96 no difference

При 95% поверења, з изван ±1,96 (осенчени редови, 5% површине) броји се као значајан.

Честита читања резултата

  • Статистичка значајност није пословна значајност. Подизање од 0,1% може бити статистички реално, али не вредно достављања.
  • Не шпијунирајте и не стајте рано. Провера п-вредности сваког дана и заустављање чим падне испод 0,05 инфлационира вашу стопу лажних позитива. Одлучите величину узорка унапред и нека тест буде завршен.
  • Пазите на правило палца величине узорка. Нормална апроксимација је поузданa када свака група има најмање ~10 конверзија и ~10 неконверзија. Са малим бројевима, третирајте резултат као само смернички.
  • Поверење ≠ вероватноћа да је Б боља. 95% ниво поверења значи да је процедура погрешна највише 5% време у дугом року — то је фреквентистичка изјава, није "95% шанса да Б победи."
  • Један тест, једна метрика. Тестирање много метрика или варијанти одједном множи шансу за случајност; исправите то (нпр. Бонферони) или претходно региструј једину метрику која одлучује тест.

Израчунајте то сами

Сваки одломак израчунава двострану п-вредност за горе наведени радни пример.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

Честа питања

Коју величину узорка требам? Довољну да би опазљиво подизање било детектабилно. Као минимум, циљајте најмање неколико стотина конверзија по варијанти; користите посвећени калкулатор величине узорка са вашом базном стопом и најмањим подизањем вредним детектовања.

Двострана или једнострана? Користите двострану осим ако немате чврст, унапред обавезан разлог за гледање само побољшања. Једнострана удвостручава вашу осетљивост али забрањује реаговање на Б који је гори.

Зашто калкулатор приказује интервал поверења? Приказује вероватан опсег праве разлике, не само да/не вердикт. Широк интервал који прелази 0 значи "немате довољно информација још."

Да ли је ово Бајесовско? Не — то је фреквентистички з-тест, најчешће предавана и коришћена метода. Бајесовски А/Б алати извештавају "вероватноћу да Б побеђује А" уместо п-вредности; обе су валидне, одговарају на мало различита питања.

Извори