Salta al contingut

Calculadora de Significació de Test A/B per a Resultats Ràpids

Calculeu la significació estadística del test A/B a l'instant. Obteniu valors p i taxes de conversió precisos per prendre decisions basades en dades per a l'optimització de màrqueting i UX.

Calculadora de Test A/B

Introdueix visitants i conversions per a cada variant per comprovar si la diferència és real o només soroll.

Control (A)
Variació (B)

Resultats

Estadísticament Significatiu

La diferència és improbable que sigui deguda a l'atzar al nivell de confiança escollit.

Valor p
0.0007

Chance this gap is just luck — lower is stronger.

Puntuació z
3.381

How far apart the two rates are, in standard errors.

Millora relativa
+50.0%
Taxa de control
10.00%
Taxa de variació
15.00%
Diferència absoluta
+5.00 pp
Interval de confiança (diferència) · 95%
2.11% to 7.89%

The likely range for the true difference.

Taxa de conversió per variant
Taxa de conversió per variant. Grouped bar chart with 1 series: Taxa de conversió.0%5%10%15%Taxa de conversióControl (A)Variació (B)10%15%
Calculadora de càrrega...
📚

Documentació

Proves A/B en un minut

Has canviat un botó, un titular o un flux de pagament. La versió A és l'antiga, la versió B és la nova. B sembla millor—va convertir el 15% de visitants enfront del 10% de A. Però podria aquest buit ser només sort, igual que llançar una moneda deu vegades pot donar set cares?

Aquesta calculadora respon exactament això. Introdueixes quants visitants va veure cada versió i quants es van convertir, i et diu la probabilitat que la diferència que has mesurat sigui real en lloc de soroll aleatori. Si aquesta probabilitat és prou alta, tens un guanyador. Si no, continua amb la prova.

L'únic número que has de vigilar és el p-valor: la probabilitat de veure una bretxa almenys tan gran si les dues versions fossin realment idèntiques. Un p-valor petit (per exemple, per sota de 0,05) significa "això rarament succeiria per sort, així que la diferència probablement és real."

Com utilitzar-ho

  1. Visitants—quants visitants únics van veure cada versió.
  2. Conversions—quants d'ells van fer la cosa que t'importa (van comprar, es van registrar, van fer clic).
  3. Nivell de confiança—com de segur vols estar abans de trucar a un guanyador. El 95% és l'estàndard de la indústria.
  4. Hipòtesibilateral pregunta "és B diferent de A?" (més segur, per defecte); unilateral només pregunta "és B millor que A?" (més sensible, però has de decidir la direcció abans d'executar la prova).

El resultat s'actualitza en temps real i els inputs s'emmagatzemen a l'URL de la pàgina, de manera que pots marcar com a preferit o compartir un resultat. Restablir neteja el formulari; Carregar dades de mostra omple un exemple treballat.

Un exemple treballat

VisitantsConversionsTaxa
A (control)1.00010010,0%
B (variació)1.00015015,0%

Aquesta és una millora absoluta de 5 punts percentuals i una millora relative de +50%. La calculadora retorna un p-valor d'aproximadament 0,0007—inferior a 0,05—de manera que amb una confiança del 95% el resultat és estadísticament significatiu. En termes generals, si les dues versions eren veritablement idèntiques, hauríes de veure una bretxa tan gran menys d'una vegada en mil proves.

La matemàtica (prova z de dues proporcions)

Sota el capó, aquesta és la prova z de dues proporcions estàndard, la mateixa prova que s'ensenya en estadística introductòria i que utilitzen les eines A/B principals.

  1. Taxa de conversió de cada grup:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    on xx és conversions i nn és visitants.

  2. Taxa agrupada, assumint (per a la hipòtesi nul·la) que ambdós grups comparteixen una taxa veritable:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Error estàndard de la diferència:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. La puntuació z—quants errors estàndard estan les dues taxes apart:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. El p-valor prové de la distribució normal estàndard Φ\Phi. Bilateral: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Unilateral: p=1Φ(z)p = 1 - \Phi(z).

  6. Significatiu quan p<αp < \alpha, on α=1confianc¸a\alpha = 1 - \text{confiança} (així que 0,05 al 95%).

La calculadora també informa d'un interval de confiança per a la diferència, calculat amb l'error estàndard no agrupat p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: el rang plausible per a la brecxa veritable. Si aquest interval exclou 0, el resultat és significatiu.

0 -1.96 +1.96 no difference

Al 95% de confiança, una z més allà de ±1,96 (les cues ombrejades, el 5% de l'àrea) compta com a significativa.

Llegir el resultat amb honestedat

  • La significació estadística no és significació empresarial. Un ascens del 0,1% pot ser estadísticament real però no mereix la pena d'implementar.
  • No espiïs i no pares aviat. Comprovar el p-valor cada dia i parar quan cau per sota de 0,05 infla la taxa de fals positius. Decideix la mida de la mostra per avançat i deixa que la prova es completi.
  • Vigila la regla de thumb de la mida de la mostra. L'aproximació normal és fiable quan cada grup té almenys ~10 conversions i ~10 no-conversions. Amb nombres petits, tracta el resultat com només direccional.
  • Confiança ≠ probabilitat que B sigui millor. Un nivell de confiança del 95% significa que el procediment és incorrecte com a màxim el 5% de les vegades a llarg termini—és una afirmació freqüentista, no "95% de probabilitat que B guanyi."
  • Una prova, una mètrica. Provar moltes mètriques o variants alhora multiplica la probabilitat d'una coincidència; corregeix-ho (p. ex. Bonferroni) o pre-registra la mètrica única que decideix la prova.

Calcula-ho tu mateix

Cada fragment calcula el p-valor bilateral per a l'exemple treballat anterior.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

Preguntes Freqüents

Quina mida de mostra necessito? Prou perquè una millora significativa seria detectable. Com a mínim, apunta a almenys alguns centenars de conversions per variant; utilitza una calculadora dedicada de mida de mostra amb la teva taxa base i l'ascens més petit que val la pena detectar.

Bilateral o unilateral? Utilitza bilateral tret que tinguis una raó fermament pre-compromesa per només preocupar-te per millorar. Unilateral duplica la teva sensibilitat però prohibeix reaccionar si B és pitjor.

Per què la calculadora mostra un interval de confiança? Mostra el rang plausible de la veritable diferència, no només un veredicte sí/no. Un interval ampl que travessa 0 significa "encara no hi ha prou dades."

Això és Bayesià? No—és una prova z freqüentista, el mètode més àmpliament ensenyat i utilitzat. Les eines A/B Bayesianes informen de "probabilitat que B guanyi A" en lloc d'un p-valor; tots dos són vàlids, responen preguntes lleugerament diferents.

Fonts