Прескочи към съдържанието

Калкулатор за значимост на A/B тест

Проверете дали вашият A/B тест резултат е статистически значим. Въведете посетители и преобразувания, за да получите p-стойност, z-резултат, интервал на доверие и относителна мощност.

Калкулатор за значимост на A/B тест

Въведете посетители и преобразувания за всеки вариант, за да проверите дали разликата е реална или просто шум.

Контролна (A)
Вариация (B)

Резултати

Статистически значимо

Разликата е малко вероятно да се дължи на случайност при вашето избрано ниво на доверие.

P-стойност
0.0007

Chance this gap is just luck — lower is stronger.

Z-резултат
3.381

How far apart the two rates are, in standard errors.

Относителна мощност
+50.0%
Норма на контрола
10.00%
Норма на вариацията
15.00%
Абсолютна разлика
+5.00 pp
Интервал на доверие (разлика) · 95%
2.11% to 7.89%

The likely range for the true difference.

Норма на преобразуване по вариант
Норма на преобразуване по вариант. Grouped bar chart with 1 series: Норма на преобразуване.0%5%10%15%Норма на преобразуванеКонтролна (A)Вариация (B)10%15%
Калкулатор за зареждане...
📚

Документация

A/B тестване за една минута

Вие променихте бутон, заглавие или процес на отплата. Версия A е старата, версия B е новата. B изглежда по-добре — преобразува 15% от посетителите спрямо 10% за A. Но могло ли е това различие просто да е късмет, както хвърлянето на монета десет пъти може да даде седем глави?

Този калкулатор отговаря точно на това. Вие въвеждате колко хора видяха всяка версия и колко се преобразуваха, а той ви казва вероятността разликата, която измерихте, да е реална, а не случайна грешка. Ако тази вероятност е достатъчно висока, имате победител. Ако не, продължавате теста.

Единственото число, което трябва да следите, е p-стойност: вероятността да видите разлика поне толкова голяма ако две версии бяха идентични. Малка p-стойност (например под 0,05) означава "това би се случило редко от късмет, така че разликата е вероятно реална."

Как да го използвате

  1. Посетители — колко уникални хора видяха всяка версия.
  2. Преобразувания — колко от тях направиха нещото, за което ви е грижа (купиха, се регистрираха, кликнаха).
  3. Ниво на доверие — колко сигурни искате да бъдете преди да обявите победител. 95% е индустриалният стандарт.
  4. Хипотезадвустранна пита "различна ли е B от A?" (по-безопасна, по подразумеване); еностранна пита само "B ли е по-добра от A?" (по-чувствителна, но трябва да решите посоката преди да изпълните теста).

Резултатът се актуализира в реално време и входовете се съхраняват в URL адреса на страницата, така че можете да добавите във връзки или да споделите резултат. Нулиране изчиства формата; Зареждане на примерни данни попълва работен пример.

Работен пример

ПосетителиПреобразуванияНорма
A (контролна)1 00010010,0%
B (вариация)1 00015015,0%

Това е 5 процентни пункта абсолютна мощност и +50% относителна мощност. Калкулаторът връща p-стойност от около 0,0007 — под 0,05 — така че при 95% доверие резултатът е статистически значим. Приблизително, ако две версии бяха наистина идентични, щяхте да видите разлика толкова голяма по-малко от веднъж в хиляда тестове.

Математиката (тест на две пропорции z)

Под капака това е стандартният тест на две пропорции z, същия тест, преподаван при уводната статистика и използван от основни A/B инструменти.

  1. Норма на преобразуване за всяка група:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    където xx е преобразувания и nn е посетители.

  2. Обединена норма, при предположение (за нулевата хипотеза), че и двете групи имат един истински процент:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Стандартна грешка на разликата:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Z-резултатът — колко стандартни грешки се намират две норми:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. P-стойност идва от стандартното нормално разпределение Φ\Phi. Двустранна: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Еностранна: p=1Φ(z)p = 1 - \Phi(z).

  6. Значимо когато p<αp < \alpha, където α=1confidence\alpha = 1 - \text{confidence} (така че 0,05 при 95%).

Калкулаторът също отчита интервал на доверие за разликата, изчислен със необединена стандартна грешка p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: вероятния диапазон за истинската разлика. Ако този интервал исключва 0, резултатът е значим.

0 -1.96 +1.96 no difference

При 95% доверие, z над ±1,96 (засенчените опашки, 5% на площта) броя като значим.

Честно прочитане на резултата

  • Статистическата значимост не е бизнес значимост. Мощност от 0,1% може да бъде статистически реална, но не струва си да бъде пуснята.
  • Не гледайте рано и не спирайте рано. Проверката на p-стойност всеки ден и спирането в момента, когато пада под 0,05, увеличава вашия процент на фалшиво положителни резултати. Решете размера на извадката отпред и позволете на теста да завърши.
  • Следете правилото на палеца за размер на извадката. Нормалното приближение е надеждно, когато всяка група има поне ~10 преобразувания и ~10 не-преобразувания. При малки числа третирайте резултата само като посочване на посока.
  • Доверие ≠ вероятност B е по-добра. Ниво на доверие от 95% означава процедурата е грешна най-много 5% от времето в дългосрочен план — това е твърдение на честотиста, не "95% шанс B спечелва."
  • Един тест, една метрика. Тестване на много показатели или варианти наведнъж множи шанса за случайност; коригирайте го (например Bonferroni) или предварително регистрирайте единствената метрика, която решава теста.

Изчислете го сами

Всеки фрагмент изчислява двустранната p-стойност за работния пример по-горе.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

ЧЗВ

Какъв размер на извадката е ми необходим? Достатъчно, че значителна мощност щеше да бъде открита. Като основа, целете поне няколко стотин преобразувания на вариант; използвайте отделен калкулатор за размер на извадката с вашата базова норма и най-малката мощност, струваща си да бъде открита.

Двустранна или еностранна? Използвайте двустранна, освен ако нямате твърдо, предварително ангажирана причина да се грижите само за подобрение. Еностранната удвоява вашата чувствителност, но забранява реакция на B бидейки по-лоша.

Защо калкулаторът показва интервал на доверие? Показва вероятния диапазон на истинската разлика, не само вердикт "да" или "не". Широк интервал, който преминава 0, означава "още няма достатъчно данни."

Това Байезианско ли е? Не — това е честотиски z-тест, най-широко преподаваният и използван метод. Байезийските A/B инструменти отчитат "вероятност B побеждава A" вместо p-стойност; и двете са валидни, отговарят на малко различни въпроси.

Източници