Pular para o conteúdo

Calculadora de Significância de Testes A/B

Verifique se o resultado do seu teste A/B é estatisticamente significativo. Insira visitantes e conversões para obter o p-valor, pontuação Z, intervalo de confiança e aumento relativo.

Calculadora de Significância de Testes A/B

Insira visitantes e conversões para cada variante para verificar se a diferença é real ou apenas ruído.

Controle (A)
Variação (B)

Resultados

Estatisticamente Significativo

A diferença é improvável ser devido ao acaso no seu nível de confiança escolhido.

P-valor
0.0007

Chance this gap is just luck — lower is stronger.

Pontuação Z
3.381

How far apart the two rates are, in standard errors.

Aumento relativo
+50.0%
Taxa de controle
10.00%
Taxa de variação
15.00%
Diferença absoluta
+5.00 pp
Intervalo de confiança (diferença) · 95%
2.11% to 7.89%

The likely range for the true difference.

Taxa de conversão por variante
Taxa de conversão por variante. Grouped bar chart with 1 series: Taxa de conversão.0%5%10%15%Taxa de conversãoControle (A)Variação (B)10%15%
Calculadora de carregamento...
📚

Documentação

Testes A/B em um minuto

Você mudou um botão, um título ou um fluxo de checkout. A versão A é a antiga, a versão B é a nova. B parece melhor — converteu 15% dos visitantes em comparação com 10% para A. Mas essa diferença poderia ser apenas sorte, da mesma forma que jogar uma moeda dez vezes pode dar sete caras?

Esta calculadora responde exatamente isso. Você informa quantas pessoas viram cada versão e quantas se converteram, e ela diz a probabilidade de que a diferença medida seja real em vez de ruído aleatório. Se essa probabilidade for alta o suficiente, você tem um vencedor. Caso contrário, você continua executando o teste.

O número a observar é o p-valor: a chance de ver uma diferença pelo menos tão grande se as duas versões fossem realmente idênticas. Um p-valor pequeno (digamos, abaixo de 0,05) significa "isso raramente aconteceria por sorte, então a diferença é provavelmente real."

Como usar

  1. Visitantes — quantas pessoas únicas viram cada versão.
  2. Conversões — quantas delas fizeram o que você se importa (compraram, se cadastraram, clicaram).
  3. Nível de confiança — o quanto você quer estar certo antes de declarar um vencedor. 95% é o padrão da indústria.
  4. Hipótesebilateral pergunta "B é diferente de A?" (mais seguro, o padrão); unilateral pergunta apenas "B é melhor que A?" (mais sensível, mas você deve decidir a direção antes de executar o teste).

O resultado é atualizado em tempo real e as entradas são armazenadas na URL da página, para que você possa marcador ou compartilhar um resultado. Redefinir limpa o formulário; Carregar dados de exemplo preenche com um exemplo resolvido.

Um exemplo resolvido

VisitantesConversõesTaxa
A (controle)1.00010010,0%
B (variação)1.00015015,0%

Isso representa um aumento absoluto de 5 pontos percentuais e um aumento relativo de +50%. A calculadora retorna um p-valor de cerca de 0,0007 — abaixo de 0,05 — então com 95% de confiança o resultado é estatisticamente significativo. Aproximadamente, se as duas versões fossem realmente idênticas, você veria uma diferença tão grande menos de uma vez em mil testes.

A matemática (teste z de duas proporções)

Por baixo dos panos, este é o teste z de duas proporções padrão, o mesmo teste ensinado em estatística introdutória e usado por ferramentas A/B convencionais.

  1. Taxa de conversão de cada grupo:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    onde xx é conversões e nn é visitantes.

  2. Taxa agrupada, assumindo (para a hipótese nula) que ambos os grupos compartilham uma taxa verdadeira:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Erro padrão da diferença:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. O z-score — quantos erros padrão as duas taxas estão separadas:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. O p-valor vem da distribuição normal padrão Φ\Phi. Bilateral: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Unilateral: p=1Φ(z)p = 1 - \Phi(z).

  6. Significativo quando p<αp < \alpha, onde α=1confidence\alpha = 1 - \text{confidence} (então 0,05 em 95%).

A calculadora também relata um intervalo de confiança para a diferença, calculado com o erro padrão não agrupado p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: o intervalo plausível para a diferença verdadeira. Se esse intervalo exclui 0, o resultado é significativo.

0 -1.96 +1.96 sem diferença

Com 95% de confiança, um z além de ±1,96 (as caudas sombreadas, 5% da área) conta como significativo.

Lendo o resultado honestamente

  • Significância estatística não é significância comercial. Um aumento de 0,1% pode ser estatisticamente real, mas não vale a pena entregar.
  • Não espreite e pare cedo. Verificar o p-valor todos os dias e parar no momento em que cai abaixo de 0,05 inflaciona sua taxa de falsos positivos. Decida o tamanho da amostra antecipadamente e deixe o teste terminar.
  • Observe a regra prática do tamanho da amostra. A aproximação normal é confiável quando cada grupo tem pelo menos ~10 conversões e ~10 não-conversões. Com números pequenos, trate o resultado apenas como direcional.
  • Confiança ≠ probabilidade de B ser melhor. Um nível de confiança de 95% significa que o procedimento está errado no máximo 5% do tempo no longo prazo — é uma declaração frequentista, não "95% de chance de B vencer."
  • Um teste, uma métrica. Testar muitas métricas ou variantes ao mesmo tempo multiplica a chance de uma falha; corrija isso (por exemplo, Bonferroni) ou pré-registre a única métrica que decide o teste.

Calcule você mesmo

Cada trecho calcula o p-valor bilateral para o exemplo acima.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = visitantes do controle, conversões ; A2,B2 = visitantes da variação, conversões
6

PERGUNTAS FREQUENTES

Qual tamanho de amostra preciso? O suficiente para que um aumento significativo seja detectável. Como mínimo, tenha como objetivo pelo menos algumas centenas de conversões por variante; use uma calculadora de tamanho de amostra dedicada com sua taxa de linha de base e o menor aumento que vale a pena detectar.

Bilateral ou unilateral? Use bilateral a menos que você tenha uma razão firme e pré-comprometida para se importar apenas com a melhoria. Unilateral dobra sua sensibilidade, mas proíbe reagir a B ser pior.

Por que a calculadora mostra um intervalo de confiança? Ela mostra o intervalo plausível da diferença verdadeira, não apenas um veredito sim/não. Um intervalo amplo que atravessa 0 significa "dados insuficientes ainda."

Isso é bayesiano? Não — é um teste z frequentista, o método mais amplamente ensinado e usado. As ferramentas bayesianas de A/B relatam "probabilidade de B vencer A" em vez de um p-valor; ambas são válidas, elas respondem perguntas ligeiramente diferentes.

Fontes