Pāriet uz saturu

A/B testa nozīmīguma kalkulators

Pārbaudiet, vai jūsu A/B testa rezultāts ir statistiski nozīmīgs. Ievadiet apmeklētājus un konversijas, lai iegūtu p-vērtību, z-rādītāju, ticamības intervālu un relatīvo pieaugumu.

A/B testa nozīmīguma kalkulators

Ievadiet apmeklētājus un konversijas katram variantam, lai pārbaudītu, vai atšķirība ir reāla vai tikai troksnis.

Kontrole (A)
Variācija (B)

Rezultāti

Statistiski nozīmīga

Atšķirība ir maz ticama, ka būtu nejaušības dēļ jūsu izvēlētajā ticamības līmenī.

P-vērtība
0.0007

Chance this gap is just luck — lower is stronger.

Z-rādītājs
3.381

How far apart the two rates are, in standard errors.

Relatīvs pieaugums
+50.0%
Kontroles likme
10.00%
Variācijas likme
15.00%
Absolūta atšķirība
+5.00 pp
Ticamības intervāls (atšķirība) · 95%
2.11% to 7.89%

The likely range for the true difference.

Konversijas likme pēc varianta
Konversijas likme pēc varianta. Grouped bar chart with 1 series: Konversijas likme.0%5%10%15%Konversijas likmeKontrole (A)Variācija (B)10%15%
Ielādes kalkulators...
📚

Dokumentācija

A/B testēšana vienas minūtes laikā

Jūs mainījāt pogu, virsrakstu vai norēķināšanās plūsmu. Versija A ir vecā, versija B ir jaunā. B izskatās labāka — tā konvertēja 15% apmeklētāju pret 10% A variantam. Bet vai šī atšķirība vienkārši tikai veiksme, tāpat kā monētas mešana desmit reizes var dot septiņus ģerbonīcas?

Šis kalkulators atbild tieši uz šo jautājumu. Jūs ievadāt, cik cilvēku redzēja katru versiju un cik no viņiem konvertēja, un tas norāda varbūtību, ka izmērītā atšķirība ir reāla nevis nejaušs troksnis. Ja šī varbūtība ir pietiekami liela, jūs esat atraduši uzvarētāju. Ja nē, turpiniet testa izpildi.

Viens skaitlis, uz kuru jākoncentrējas, ir p-vērtība: varbūtība redzēt atšķirību vismaz šāda lieluma ja abas versijas būtu faktiski identiskas. Maza p-vērtība (piemēram, zem 0,05) nozīmē "tas reti notiktu pēc nejaušības, tāpēc atšķirība ir droši vien reāla."

Kā to izmantot

  1. Apmeklētāji — cik daudz unikālu cilvēku tika parādīta katra versija.
  2. Konversijas — cik no viņiem izdarīja darbību, par kuru jums ir rūpe (nopirka, pierakstījās, noklikšķināja).
  3. Ticamības līmenis — cik drošs vēlaties būt pirms uzvarētāja paziņošanas. 95% ir nozares standarts.
  4. Hipotēzedivpusēja jautā "vai B atšķiras no A?" (drošāka, noklusējums); vienpusēja jautā tikai "vai B ir labāka par A?" (jutīgāka, bet jums jāizlemj virziens pirms testa sākuma).

Rezultāts atjauninās tiešraidē un ievadi tiek saglabāti lapas URL, tāpēc varat grāmatzīmēt vai dalīties ar rezultātu. Atiestatīt notīra formu; Ielādēt parauga datus aizpilda apstrādātu piemēru.

Apstrādāts piemērs

ApmeklētājiKonversijasLikme
A (kontrole)1 00010010,0%
B (variācija)1 00015015,0%

Tā ir 5 procentpunktu absolūts pieaugums un +50% relatīvs pieaugums. Kalkulators atgriež p-vērtību aptuveni 0,0007 — zem 0,05 — tātad ar 95% ticamības līmeni rezultāts ir statistiski nozīmīgs. Aptuveni, ja abas versijas būtu patiešām identiskas, jūs redzētu šādu atšķirību mazāk kā vienu reizi uz tūkstošiem testiem.

Matemātika (divu proporciju z-tests)

Zem pārsega šis ir standarta divu proporciju z-tests, tas pats tests, ko māca ievadniecības statistikā un ko lieto galvenie A/B rīki.

  1. Konversijas likme katrai grupai:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    kur xx ir konversijas un nn ir apmeklētāji.

  2. Kombinētā likme, pieņemot (nulles hipotēzei), ka abas grupas dala vienu patiesu likmi:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Standarta kļūda atšķirībai:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Z-rādītājs — cik standarta kļūdu ir atdalītas divas likmes:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. p-vērtība nāk no standarta normālā sadalījuma Φ\Phi. Divpusēja: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Vienpusēja: p=1Φ(z)p = 1 - \Phi(z).

  6. Nozīmīga kad p<αp < \alpha, kur α=1ticamıˉbas lıˉmenis\alpha = 1 - \text{ticamības līmenis} (tātad 0,05 pie 95%).

Kalkulators arī ziņo par ticamības intervālu atšķirībai, aprēķinātu ar nekombinēto standarta kļūdu p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: ticamais diapazons patiesajai atšķirībai. Ja šis intervāls izslēdz 0, rezultāts ir nozīmīgs.

0 -1.96 +1.96 no difference

Ar 95% ticamības līmeni, z pārsniedzot ±1,96 (ēnotie asteles, 5% no platības) uzskatās par nozīmīgu.

Rezultāta godīga nolasīšana

  • Statistiskā nozīmīguma nav biznesa nozīmīgums. 0,1% pieaugums var būt statistiski reāls, bet ne vērts izdot.
  • Nepieķeries un nestopies agri. P-vērtības pārbaude katru dienu un apstāšanās brīdī, kad tā nokrīt zem 0,05, palielina jūsu viltus-pozitīvu rādītāju. Nolemiet izlases lielumu iepriekš un ļaujiet testam pabeigties.
  • Pārraugiet izlases lieluma vudu noteikumu. Normālais tuvinājums ir uzticams, kad katrā grupā ir vismaz ~10 konversiju un ~10 nekonversiju. Ar mazu skaitļu skaitu, uzskatiet rezultātu tikai par virziena norādi.
  • Ticamības līmenis ≠ varbūtība, ka B ir labāka. 95% ticamības līmenis nozīmē, ka procedūra ir nepareiza vairāk kā 5% laika garumā — tā ir frekventista apgalvojums, nevis "95% iespēja, ka B uzvar."
  • Viens tests, viena metrika. Daudzu metrikas vai variantu vienlaicīga testēšana reizina nejaušības iespēju; koriģējiet to (piemēram, Bonferroni) vai iepriekš reģistrējiet vienu metriku, kas nolemj testu.

Aprēķiniet to pats

Katrs fragments aprēķina divpusējo p-vērtību iepriekš minētajam piemēram.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

BUJ

Kāds izlases lielums man nepieciešams? Pietiekami, lai nozīmīgu pieaugumu varētu atklāt. Kā stāvokli, censieties vismaz dažas simtus konversiju uz variantu; izmantojiet īpašu izlases lieluma kalkulatoru ar jūsu bāzes likmi un mazāko pieaugumu, kas vērts atklāt.

Divpusēja vai vienpusēja? Izmantojiet divpusēju, ja vien jums nav stingras, iepriekš saistītas iemesles, lai rūpētos tikai par uzlabojumiem. Vienpusēja divkāršo jūsu jutību, bet aizliedz reaģēt uz B būšanu sliktāku.

Kāpēc kalkulators parāda ticamības intervālu? Tas parāda patiesās atšķirības ticamo diapazonu, nevis tikai jā/nē spriedumu. Plats intervāls, kas krusto 0, nozīmē "vēl nav pietiekami daudz datu."

Vai tā ir Bajesiana? Nē — tā ir frekventista z-tests, visplašāk pasniegstais un izmantotais paņēmiens. Bajesiana A/B rīki ziņo "varbūtība, ka B uzvar A" vietā p-vērtības; abi ir derīgi, viņi atbild uz nedaudz atšķirīgiem jautājumiem.

Avoti