Saltar al contenido

Calculadora de Significancia de Pruebas A/B

Verifica si el resultado de tu prueba A/B es estadísticamente significativo. Ingresa visitantes y conversiones para obtener el valor p, puntuación z, intervalo de confianza e incremento relativo.

Calculadora de Significancia de Pruebas A/B

Ingresa visitantes y conversiones para cada variante para verificar si la diferencia es real o solo ruido.

Control (A)
Variación (B)

Resultados

Estadísticamente Significativo

Es poco probable que la diferencia se deba al azar en tu nivel de confianza elegido.

Valor p
0.0007

Chance this gap is just luck — lower is stronger.

Puntuación z
3.381

How far apart the two rates are, in standard errors.

Incremento relativo
+50.0%
Tasa de control
10.00%
Tasa de variación
15.00%
Diferencia absoluta
+5.00 pp
Intervalo de confianza (diferencia) · 95%
2.11% to 7.89%

The likely range for the true difference.

Tasa de conversión por variante
Tasa de conversión por variante. Grouped bar chart with 1 series: Tasa de conversión.0%5%10%15%Tasa de conversiónControl (A)Variación (B)10%15%
Calculadora de carga...
📚

Documentación

Pruebas A/B en un minuto

Cambiaste un botón, un titular o un flujo de pago. La versión A es la antigua, la versión B es la nueva. B se ve mejor — se convirtió el 15% de visitantes versus 10% para A. Pero, ¿esa brecha podría ser solo suerte, de la misma manera que lanzar una moneda diez veces puede dar siete caras?

Esta calculadora responde exactamente eso. Ingresas cuántas personas vieron cada versión y cuántas se convirtieron, y te dice la probabilidad de que la diferencia que mediste sea real en lugar de ruido aleatorio. Si esa probabilidad es lo suficientemente alta, tienes un ganador. Si no, mantienes la prueba en ejecución.

El único número a observar es el valor p: la oportunidad de ver una brecha al menos tan grande si las dos versiones fueran idénticas. Un valor p pequeño (digamos, por debajo de 0.05) significa "esto rara vez sucedería por suerte, así que la diferencia probablemente es real."

Cómo usarlo

  1. Visitantes — cuántas personas únicas vieron cada versión.
  2. Conversiones — cuántas de ellas hicieron lo que te importa (compraron, se registraron, hicieron clic).
  3. Nivel de confianza — qué tan seguro quieres estar antes de llamar ganador. 95% es el estándar de la industria.
  4. Hipótesisbilateral pregunta "¿es B diferente de A?" (más seguro, el predeterminado); unilateral pregunta solo "¿es B mejor que A?" (más sensible, pero debes decidir la dirección antes de ejecutar la prueba).

El resultado se actualiza en vivo y las entradas se almacenan en la URL de la página, por lo que puedes marcar como favorito o compartir un resultado. Restablecer borra el formulario; Cargar datos de ejemplo rellena un ejemplo trabajado.

Un ejemplo trabajado

VisitantesConversionesTasa
A (control)1,00010010.0%
B (variación)1,00015015.0%

Eso es un incremento absoluto de 5 puntos porcentuales y un incremento relativo de +50%. La calculadora devuelve un valor p de aproximadamente 0.0007 — por debajo de 0.05 — así que con confianza del 95% el resultado es estadísticamente significativo. Aproximadamente, si las dos versiones fueran verdaderamente idénticas, verías una brecha esta grande menos de una vez en mil pruebas.

Las matemáticas (prueba z de dos proporciones)

Bajo el capó esto es la estándar prueba z de dos proporciones, la misma prueba enseñada en estadística introductoria y usada por herramientas A/B convencionales.

  1. Tasa de conversión de cada grupo:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    donde xx son conversiones y nn son visitantes.

  2. Tasa agrupada, asumiendo (para la hipótesis nula) que ambos grupos comparten una tasa verdadera:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Error estándar de la diferencia:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. La puntuación z — cuántos errores estándar aparte están las dos tasas:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. El valor p viene de la distribución normal estándar Φ\Phi. Bilateral: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Unilateral: p=1Φ(z)p = 1 - \Phi(z).

  6. Significativo cuando p<αp < \alpha, donde α=1confianza\alpha = 1 - \text{confianza} (así 0.05 a 95%).

La calculadora también reporta un intervalo de confianza para la diferencia, calculado con el error estándar no agrupado p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: el rango plausible para la brecha verdadera. Si ese intervalo excluye 0, el resultado es significativo.

0 -1.96 +1.96 no difference

Con confianza del 95%, una z más allá de ±1.96 (las colas sombreadas, 5% del área) cuenta como significativo.

Leer el resultado honestamente

  • La significancia estadística no es significancia de negocio. Un incremento del 0.1% puede ser realmente estadístico pero no valer la pena implementar.
  • No hagas peeking y detengas temprano. Revisar el valor p cada día y detener el momento en que cae por debajo de 0.05 infla tu tasa de falsos positivos. Decide el tamaño de la muestra por adelantado y deja terminar la prueba.
  • Observa la regla general del tamaño de la muestra. La aproximación normal es confiable cuando cada grupo tiene al menos ~10 conversiones y ~10 no conversiones. Con números pequeños, trata el resultado como solo direccional.
  • Confianza ≠ probabilidad de que B sea mejor. Un nivel de confianza del 95% significa el procedimiento está equivocado como máximo 5% del tiempo a largo plazo — es una declaración frecuentista, no "95% de oportunidad de que B gane."
  • Una prueba, una métrica. Probar muchas métricas o variantes a la vez multiplica la oportunidad de un golpe de suerte; corrige por ello (ej. Bonferroni) o preregistra la métrica única que decide la prueba.

Calcula usted mismo

Cada fragmento calcula el valor p bilateral para el ejemplo trabajado anterior.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

Preguntas Frecuentes

¿Qué tamaño de muestra necesito? Lo suficiente para que un incremento significativo sea detectable. Como mínimo, apunta a al menos algunos cientos de conversiones por variante; usa una calculadora de tamaño de muestra dedicada con tu tasa de base y el incremento más pequeño que vale la pena detectar.

¿Bilateral o unilateral? Usa bilateral a menos que tengas una razón firme y precomprometida para solo preocuparte por la mejora. Unilateral duplica tu sensibilidad pero prohíbe reaccionar a B siendo peor.

¿Por qué la calculadora muestra un intervalo de confianza? Muestra el rango plausible de la diferencia verdadera, no solo un veredicto sí/no. Un intervalo amplio que se aproxima a 0 significa "datos insuficientes todavía."

¿Es esto Bayesiano? No — es una prueba z frecuentista, el método más ampliamente enseñado y utilizado. Las herramientas A/B Bayesianas reportan "probabilidad de que B supere A" en lugar de un valor p; ambas son válidas, responden preguntas ligeramente diferentes.

Fuentes