Saltar al contenido

Calculadora de Significancia de Pruebas A/B

Verifica si el resultado de tu prueba A/B es estadísticamente significativo. Ingresa visitantes y conversiones para obtener el valor p, puntuación z, intervalo de confianza e incremento relativo.

Calculadora de Significancia de Pruebas A/B

Ingresa visitantes y conversiones para cada variante para verificar si la diferencia es real o solo ruido.

Control (A)
Variación (B)

Resultados

Estadísticamente Significativo

Es poco probable que la diferencia se deba al azar en tu nivel de confianza elegido.

Valor p
0.0007

Chance this gap is just luck — lower is stronger.

Puntuación z
3.381

How far apart the two rates are, in standard errors.

Incremento relativo
+50.0%
Tasa de control
10.00%
Tasa de variación
15.00%
Diferencia absoluta
+5.00 pp
Intervalo de confianza (diferencia) · 95%
2.11% to 7.89%

The likely range for the true difference.

Tasa de conversión por variante
Tasa de conversión por variante. Grouped bar chart with 1 series: Tasa de conversión.0%5%10%15%Tasa de conversiónControl (A)Variación (B)10%15%
Calculadora de carga...
📚

Documentación

Qué hace una calculadora de significancia para pruebas A/B

Una calculadora de significancia para pruebas A/B comprueba si la diferencia entre dos versiones de algo —una página web, un correo electrónico o un botón de pago— es un efecto real o solo fruto del azar. Toma el número de visitantes y el número de conversiones de cada versión, y devuelve un valor p, una puntuación z y un intervalo de confianza. Una conversión es cualquier acción que se considere un éxito: una compra, un registro o un clic.

Cómo utilizar la calculadora

La calculadora necesita cuatro números.

  • Visitantes (control): cuántas personas vieron la versión A, la original.
  • Conversiones (control): cuántas de ellas realizaron una conversión.
  • Visitantes (variación): cuántas personas vieron la versión B, la nueva versión.
  • Conversiones (variación): cuántas de ellas realizaron una conversión.

Hay dos ajustes más que cambian cómo se evalúa el resultado.

  • Nivel de confianza establece cuán estricto es el test. 95 % es el valor predeterminado habitual. Un nivel superior, como 99 %, exige pruebas más sólidas antes de considerar significativo un resultado.
  • Hipótesis establece la dirección de la pregunta. Una prueba bilateral pregunta «¿B es diferente de A, en cualquier dirección?». Una prueba unilateral pregunta únicamente «¿B es mejor que A?». Una prueba unilateral solo debe elegirse antes de disponer de los datos y únicamente cuando un resultado peor para B no cambiaría ninguna decisión.

El resultado se actualiza a medida que se introducen los números. Los datos introducidos se almacenan en la dirección web de la página, por lo que el resultado puede guardarse en marcadores o compartirse como enlace.

Fórmula de la prueba A/B (prueba z para dos proporciones)

La calculadora utiliza una prueba z para dos proporciones, un método estándar que se enseña en los cursos introductorios de estadística para comparar dos tasas.

Paso 1. Tasa de conversión de cada grupo.

p1=x1n1,p2=x2n2p_1 = \frac{x_1}{n_1}, \qquad p_2 = \frac{x_2}{n_2}

Aquí xx es el número de conversiones y nn es el número de visitantes, para el control (1) y la variación (2).

Paso 2. Tasa de conversión combinada. Este paso supone, para los fines de la prueba, que ambos grupos comparten una única tasa real subyacente.

p^=x1+x2n1+n2\hat{p} = \frac{x_1 + x_2}{n_1 + n_2}

Paso 3. Error estándar de la diferencia, calculado a partir de la tasa combinada.

SE=p^(1−p^)(1n1+1n2)SE = \sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}

Paso 4. Puntuación z, la diferencia entre las dos tasas medida en errores estándar.

z=p2−p1SEz = \frac{p_2 - p_1}{SE}

Paso 5. Valor p, obtenido de la distribución normal estándar Φ\Phi. Para una prueba bilateral: p=2(1−Φ(∣z∣))p = 2\left(1 - \Phi(|z|)\right). Para una prueba unilateral: p=1−Φ(z)p = 1 - \Phi(z).

Paso 6. Veredicto. El resultado se considera estadísticamente significativo cuando el valor p es menor que α\alpha, donde α=1−nivel de confianza\alpha = 1 - \text{nivel de confianza}. Con un nivel de confianza de 95 %, α=0.05\alpha = 0.05.

La calculadora también informa de un intervalo de confianza para el tamaño de la diferencia, p2−p1p_2 - p_1. Este intervalo utiliza un error estándar diferente, que no supone que los dos grupos compartan una misma tasa:

SEunpooled=p1(1−p1)n1+p2(1−p2)n2SE_{unpooled} = \sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}}

El intervalo es (p2−p1)±zc×SEunpooled(p_2 - p_1) \pm z_c \times SE_{unpooled}, donde zcz_c es 1,6449 con un nivel de confianza de 90 %, 1,96 con 95 % y 2,5758 con 99 %. Si el intervalo no contiene cero, la diferencia es significativa con ese nivel de confianza.

Ejemplo resuelto

VisitantesConversionesTasa
Control (A)1.00010010,00 %
Variación (B)1.00015015,00 %

La tasa combinada es (100+150)/(1000+1000)=0.125(100+150)/(1000+1000) = 0.125, o 12,5 %. El error estándar combinado es aproximadamente 0,0148. La puntuación z es (0.15−0.10)/0.0148≈3.38(0.15 - 0.10) / 0.0148 \approx 3.38.

Para una prueba bilateral, esto da un valor p aproximado de 0,00072. Está por debajo del umbral habitual de 0,05, por lo que, con un nivel de confianza de 95 %, la diferencia es estadísticamente significativa. Si las dos versiones realmente tuvieran el mismo rendimiento, una diferencia de este tamaño o mayor aparecería aproximadamente en 7 de cada 10.000 pruebas solo por azar.

La diferencia absoluta es de 5,00 puntos porcentuales. La mejora relativa es del 50 %, ya que la tasa de B es 1,5 veces la tasa de A. El intervalo de confianza de 95 % para la diferencia real va aproximadamente de 2,11 % a 7,89 %.

Cómo interpretar correctamente el resultado

Un resultado estadísticamente significativo no es automáticamente un resultado sobre el que convenga actuar. Una mejora real pero mínima quizá no compense el coste de implementarla. El criterio empresarial sigue siendo importante una vez hechos los cálculos.

Comprobar el valor p todos los días y detener la prueba en el momento en que cruza 0,05 aumenta la probabilidad de obtener un falso positivo. Es preferible elegir de antemano un tamaño de muestra o una duración de la prueba y dejar que esta termine antes de interpretar el resultado.

La aproximación normal en la que se basa esta prueba funciona mejor cuando cada grupo tiene al menos aproximadamente 10 conversiones y 10 no conversiones. Con cifras menores, el resultado debe considerarse una señal aproximada, no una respuesta definitiva.

Un nivel de confianza de 95 % no significa que haya una probabilidad del 95 % de que B sea realmente mejor. Significa que, si se repitiera la misma prueba muchas veces, este método daría un resultado significativo incorrecto como máximo 5 % de las veces. Es una afirmación sobre el método, no sobre este resultado concreto.

Probar muchas métricas o muchas variantes a la vez aumenta la probabilidad de que al menos una comparación parezca significativa únicamente por azar. Elegir una sola métrica antes de comenzar la prueba evita este problema.

Preguntas frecuentes

¿Qué tamaño de muestra necesita una prueba A/B? Un número suficiente de visitantes para que una mejora relevante aparezca realmente como significativa. Como orientación aproximada, se necesitan unos cientos de conversiones por versión. Una calculadora específica del tamaño de muestra, que utiliza la tasa de referencia y la menor mejora que se desea detectar, proporciona una cifra más precisa antes de comenzar la prueba.

¿La prueba debe ser unilateral o bilateral? La prueba bilateral es la opción predeterminada más segura, ya que puede indicar que B es mejor o peor que A. La prueba unilateral es más sensible a una mejora, pero no puede indicar un resultado peor, por lo que solo debe utilizarse cuando un resultado peor para B no cambiaría ninguna decisión.

¿Por qué la calculadora informa de un intervalo de confianza? Un intervalo de confianza muestra el rango probable de la diferencia real, no solo una etiqueta de significativo o no significativo. Un intervalo amplio que abarca el cero suele indicar que la prueba necesita más datos.

¿Es una calculadora bayesiana? No. Utiliza una prueba z frecuentista, el método que se enseña y se utiliza con mayor frecuencia para las pruebas A/B. Una herramienta bayesiana informa, en cambio, de la probabilidad de que B supere a A. Ambos métodos son válidos; responden preguntas ligeramente diferentes.

¿Qué ocurre si la calculadora muestra un error? Aparece un error si el número de conversiones es negativo, si supera el número de visitantes o si la tasa de conversión combinada de ambos grupos es 0 % o 100 %, ya que en ese caso la fórmula de la prueba z no puede dividir entre un error estándar igual a cero.

Fuentes