Sari la conținut

Calculator de Semnificație A/B

Verifică dacă rezultatul testului A/B este semnificativ din punct de vedere statistic. Introduceți vizitatori și conversii pentru a obține p-value, scor z, interval de încredere și ridicare relativă.

Calculator de Semnificație A/B

Introduceți vizitatori și conversii pentru fiecare variantă pentru a verifica dacă diferența este reală sau doar zgomot.

Control (A)
Variație (B)

Rezultate

Semnificativ din punct de vedere statistic

Diferența este puțin probabil să se datoreze hazardului la nivelul de încredere ales.

P-value
0.0007

Chance this gap is just luck — lower is stronger.

Scor z
3.381

How far apart the two rates are, in standard errors.

Ridicare relativă
+50.0%
Rata de control
10.00%
Rata de variație
15.00%
Diferență absolută
+5.00 pp
Interval de încredere (diferență) · 95%
2.11% to 7.89%

The likely range for the true difference.

Rata de conversie după variantă
Rata de conversie după variantă. Grouped bar chart with 1 series: Rata de conversie.0%5%10%15%Rata de conversieControl (A)Variație (B)10%15%
Calculator de încărcare...
📚

Documentație

Testare A/B într-un minut

Ai schimbat un buton, un titlu sau un flux de finalizare. Versiunea A este cea veche, versiunea B este cea nouă. B arată mai bine — a convertit 15% din vizitatori versus 10% pentru A. Dar această diferență ar putea fi doar norocul, la fel cum aruncarea unei monede de zece ori poate da șapte capete?

Calculator-ul răspunde exact asta. Introduci câți oameni au văzut fiecare versiune și câți au convertit, și ți-o spune probabilitatea ca diferența pe care ai măsurat-o să fie reală mai degrabă decât zgomot aleator. Dacă acea probabilitate este suficient de mare, ai un câștigător. Dacă nu, continui să rulezi testul.

Singurul număr de urmărit este p-value: șansa de a vedea o diferență cel puțin atât de mare dacă cele două versiuni ar fi de fapt identice. O p-value mică (să zicem, sub 0.05) înseamnă "asta s-ar întâmpla rar din noroc, deci diferența este probabil reală."

Cum să-l folosești

  1. Vizitatori — câți oameni unici au fost arătați fiecare versiune.
  2. Conversii — câți din ei au făcut lucrul pe care ți-l dorești (au cumpărat, s-au înscris, au făcut clic).
  3. Nivel de încredere — cât de sigur dorești să fii înainte de a proclama un câștigător. 95% este standardul industriei.
  4. Ipotezăbilateral întreabă "este B diferit de A?" (mai sigur, implicit); unilateral întreabă doar "este B mai bun decât A?" (mai sensibil, dar trebuie să decizi direcția înainte de a rula testul).

Rezultatul se actualizează în timp real și intrările sunt stocate în URL-ul paginii, deci poți adăuga în marcaje sau partaja un rezultat. Reset șterge formularul; Load sample data completează un exemplu lucrat.

Un exemplu lucrat

VizitatoriConversiiRată
A (control)1,00010010.0%
B (variație)1,00015015.0%

Aceasta este o ridicare absolută de 5 puncte procentuale și o ridicare +50% relativă. Calculator-ul returnează o p-value de aproximativ 0.0007 — sub 0.05 — deci cu 95% încredere rezultatul este semnificativ din punct de vedere statistic. Aproximativ, dacă cele două versiuni ar fi fost cu adevărat identice, ai vedea o diferență atât de mare mai puțin decât o dată la o mie de teste.

Matematica (testul z cu două proporții)

Sub capot, aceasta este testul standard z cu două proporții, același test predat în statistica introductivă și folosit de instrumentele A/B principale.

  1. Rata de conversie a fiecărui grup:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    unde xx sunt conversiile și nn sunt vizitatorii.

  2. Rata agregată, presupunând (pentru ipoteza nulă) că ambele grupuri împărtășesc o rată adevărată:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Eroare standard a diferenței:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Scorul z — câte erori standard sunt distanțate cele două rate:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. p-value vine din distribuția normală standard Φ\Phi. Bilateral: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Unilateral: p=1Φ(z)p = 1 - \Phi(z).

  6. Semnificativ când p<αp < \alpha, unde α=1ıˆncredere\alpha = 1 - \text{încredere} (deci 0.05 la 95%).

Calculator-ul raportează, de asemenea, un interval de încredere pentru diferență, calculat cu eroarea standard neagregată p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: gama plauzibilă pentru golul adevărat. Dacă acel interval exclude 0, rezultatul este semnificativ.

0 -1.96 +1.96 no difference

La 95% încredere, un z peste ±1.96 (cozile umbrite, 5% din suprafață) numără ca semnificativ.

Citind rezultatul cu sinceritate

  • Semnificația statistică nu este semnificație comercială. O ridicare de 0.1% poate fi reală din punct de vedere statistic, dar nu merită publicată.
  • Nu te uita și nu te opri devreme. Verificarea p-value în fiecare zi și oprirea în momentul în care scade sub 0.05 vânează rata fals-pozitivilor. Decide mărimea eșantionului înainte și lasă testul să se termine.
  • Urmărește regula de mărime a eșantionului. Aproximarea normală este de încredere când fiecare grup are cel puțin ~10 conversii și ~10 non-conversii. Cu numere minuscule, trata rezultatul ca doar direcțional.
  • Încredere ≠ probabilitate B este mai bun. Un nivel de încredere de 95% înseamnă că procedura este greșită cel mult 5% din timp pe termen lung — este o afirmație frecventistă, nu "95% șansă ca B să câștige."
  • Un test, o metrică. Testarea mai multor metrici sau variante simultan multiplică șansa unei gafe; corectează-o (de ex. Bonferroni) sau pre-înregistrează metrica unică care decide testul.

Calculează-l singur

Fiecare snippet calculează p-value-ul bilateral pentru exemplul lucrat de mai sus.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

FAQ

Ce dimensiune a eșantionului am nevoie? Suficient încât o ridicare semnificativă ar fi detectabilă. Ca podea, urmăresc cel puțin câteva sute de conversii per variantă; utilizează un calculator dedicat de mărime a eșantionului cu rata de bază și cea mai mică ridicare care merită detectată.

Bilateral sau unilateral? Utilizează bilateral decât dacă ai un motiv ferm, pre-stabilit să numai ții cont de îmbunătățire. Unilateral dublează sensibilitatea dar interzice reacția la B fiind mai rău.

De ce arată calculator-ul un interval de încredere? Arată gama plauzibilă a diferenței adevărate, nu doar un verdict da/nu. Un interval larg care umblă în jurul 0 înseamnă "nu suficiente date deocamdată."

Este asta Bayesian? Nu — este un test z frecventist, cea mai larg predate și utilizată metodă. Instrumentele A/B Bayesiene raportează "probabilitate B bate A" în loc de o p-value; ambele sunt valide, răspund la întrebări ușor diferite.

Surse