Pular para o conteúdo

Calculadora de Significância de Testes A/B

Verifique se o resultado do seu teste A/B é estatisticamente significativo. Insira visitantes e conversões para obter o p-valor, pontuação Z, intervalo de confiança e aumento relativo.

Calculadora de Significância de Testes A/B

Insira visitantes e conversões para cada variante para verificar se a diferença é real ou apenas ruído.

Controle (A)
Variação (B)

Resultados

Estatisticamente Significativo

A diferença é improvável ser devido ao acaso no seu nível de confiança escolhido.

P-valor
0.0007

Chance this gap is just luck — lower is stronger.

Pontuação Z
3.381

How far apart the two rates are, in standard errors.

Aumento relativo
+50.0%
Taxa de controle
10.00%
Taxa de variação
15.00%
Diferença absoluta
+5.00 pp
Intervalo de confiança (diferença) · 95%
2.11% to 7.89%

The likely range for the true difference.

Taxa de conversão por variante
Taxa de conversão por variante. Grouped bar chart with 1 series: Taxa de conversão.0%5%10%15%Taxa de conversãoControle (A)Variação (B)10%15%
Calculadora de carregamento...
📚

Documentação

O que faz uma calculadora de significância de teste A/B

Uma calculadora de significância de teste A/B verifica se uma diferença entre duas versões de algo — uma página web, um e-mail, um botão de finalização de compra — é um efeito real ou apenas acaso. Ela recebe o número de visitantes e o número de conversões de cada versão e retorna um valor-p, um escore-z e um intervalo de confiança. Conversão é qualquer ação considerada um sucesso: uma compra, uma inscrição ou um clique.

Como usar a calculadora

A calculadora precisa de quatro números.

  • Visitantes (controle): quantas pessoas viram a versão A, a original.
  • Conversões (controle): quantas delas converteram.
  • Visitantes (variação): quantas pessoas viram a versão B, a nova versão.
  • Conversões (variação): quantas delas converteram.

Duas outras configurações mudam a forma como o resultado é avaliado.

  • Nível de confiança define o rigor do teste. 95% é o padrão mais comum. Um nível mais alto, como 99%, exige evidências mais fortes antes de considerar um resultado significativo.
  • Hipótese define a direção da pergunta. Um teste bilateral pergunta: "B é diferente de A, em qualquer direção?" Um teste unilateral pergunta apenas: "B é melhor que A?" Um teste unilateral só deve ser escolhido antes da obtenção dos dados e somente quando um resultado pior para B não mudaria nenhuma decisão.

O resultado é atualizado à medida que os números são inseridos. As entradas são armazenadas no endereço da página na web, portanto o resultado pode ser salvo nos favoritos ou compartilhado como um link.

Fórmula do teste A/B (teste z para duas proporções)

A calculadora usa um teste z para duas proporções, um método padrão ensinado em estatística introdutória para comparar duas taxas.

Etapa 1. Taxa de conversão de cada grupo.

p1=x1n1,p2=x2n2p_1 = \frac{x_1}{n_1}, \qquad p_2 = \frac{x_2}{n_2}

Aqui, xx é o número de conversões e nn é o número de visitantes, para o controle (1) e a variação (2).

Etapa 2. Taxa de conversão combinada. Esta etapa pressupõe, para fins do teste, que os dois grupos compartilham uma única taxa real subjacente.

p^=x1+x2n1+n2\hat{p} = \frac{x_1 + x_2}{n_1 + n_2}

Etapa 3. Erro padrão da diferença, calculado a partir da taxa combinada.

SE=p^(1−p^)(1n1+1n2)SE = \sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}

Etapa 4. Escore-z, a diferença entre as duas taxas medida em erros padrão.

z=p2−p1SEz = \frac{p_2 - p_1}{SE}

Etapa 5. Valor-p, obtido da distribuição normal padrão Φ\Phi. Para um teste bilateral: p=2(1−Φ(∣z∣))p = 2\left(1 - \Phi(|z|)\right). Para um teste unilateral: p=1−Φ(z)p = 1 - \Phi(z).

Etapa 6. Veredito. O resultado é considerado estatisticamente significativo quando o valor-p é menor que α\alpha, em que α=1−nıˊvel de confianc¸a\alpha = 1 - \text{nível de confiança}. Com 95% de confiança, α=0.05\alpha = 0.05.

A calculadora também informa um intervalo de confiança para o tamanho da diferença, p2−p1p_2 - p_1. Esse intervalo usa um erro padrão separado, que não pressupõe que os dois grupos compartilhem uma taxa:

SEunpooled=p1(1−p1)n1+p2(1−p2)n2SE_{unpooled} = \sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}}

O intervalo é (p2−p1)±zc×SEunpooled(p_2 - p_1) \pm z_c \times SE_{unpooled}, em que zcz_c é 1,6449 com 90% de confiança, 1,96 com 95% e 2,5758 com 99%. Se o intervalo não contiver zero, a diferença será significativa nesse nível de confiança.

Exemplo prático

VisitantesConversõesAlíquota
Controle (A)1.00010010,00%
Variação (B)1.00015015,00%

A taxa combinada é (100+150)/(1000+1000)=0.125(100+150)/(1000+1000) = 0.125, ou 12,5%. O erro padrão combinado é aproximadamente 0,0148. O escore-z é (0.15−0.10)/0.0148≈3.38(0.15 - 0.10) / 0.0148 \approx 3.38.

Para um teste bilateral, isso resulta em um valor-p de aproximadamente 0,00072. Esse valor está abaixo do limiar usual de 0,05; portanto, com 95% de confiança, a diferença é estatisticamente significativa. Se as duas versões realmente tivessem o mesmo desempenho, uma diferença desse tamanho ou maior apareceria, apenas por acaso, em cerca de 7 de cada 10.000 testes.

A diferença absoluta é de 5,00 pontos percentuais. O aumento relativo é de 50%, pois a taxa de B é 1,5 vezes a taxa de A. O intervalo de confiança de 95% para a diferença real vai aproximadamente de 2,11% a 7,89%.

Interpretando corretamente o resultado

Um resultado estatisticamente significativo não é automaticamente um resultado que vale a pena implementar. Um pequeno aumento real pode não compensar o custo de colocá-lo em produção. O julgamento empresarial continua sendo importante depois que a matemática é concluída.

Verificar o valor-p todos os dias e interromper o teste no momento em que ele ultrapassar 0,05 aumenta a probabilidade de um falso positivo. É melhor escolher antecipadamente um tamanho de amostra ou uma duração para o teste e deixá-lo terminar antes de interpretar o resultado.

A aproximação normal em que este teste se baseia funciona melhor quando cada grupo tem pelo menos cerca de 10 conversões e 10 não conversões. Com números menores, o resultado deve ser tratado como um sinal aproximado, não como uma resposta definitiva.

Um nível de confiança de 95% não significa que exista uma probabilidade de 95% de B ser realmente melhor. Significa que, se o mesmo teste fosse repetido muitas vezes, este método produziria um resultado significativo incorreto no máximo em 5% das vezes. Isso é uma afirmação sobre o método, não sobre este resultado específico.

Testar muitas métricas ou muitas variantes ao mesmo tempo aumenta a probabilidade de que pelo menos uma comparação pareça significativa apenas por sorte. Escolher uma métrica antes do início do teste evita esse problema.

Dúvidas frequentes

De que tamanho de amostra um teste A/B precisa? Visitantes suficientes para que um aumento relevante realmente apareça como significativo. Um limite aproximado é de algumas centenas de conversões por versão. Uma calculadora específica de tamanho de amostra, usando a taxa de referência e o menor aumento que vale a pena detectar, fornece um número mais preciso antes do início do teste.

O teste deve ser unilateral ou bilateral? O teste bilateral é a opção padrão mais segura, pois pode identificar B como melhor ou pior que A. O teste unilateral é mais sensível a uma melhoria, mas não consegue identificar um resultado pior; por isso, só deve ser usado quando um B pior não mudaria nenhuma decisão.

Por que a calculadora informa um intervalo de confiança? Um intervalo de confiança mostra a faixa provável da diferença real, não apenas um rótulo de significativo ou não significativo. Um intervalo amplo que inclui zero geralmente indica que o teste precisa de mais dados.

Esta é uma calculadora bayesiana? Não. Ela usa um teste z frequentista, o método mais comumente ensinado e usado em testes A/B. Uma ferramenta bayesiana, por sua vez, informa a probabilidade de B superar A. Ambos são métodos válidos; eles respondem a perguntas ligeiramente diferentes.

E se a calculadora mostrar um erro? Um erro aparece se uma contagem de conversões for negativa, se exceder a contagem de visitantes ou se a taxa de conversão combinada dos dois grupos for 0% ou 100%, pois nesse caso a fórmula do teste z não pode dividir por um erro padrão igual a zero.

Fontes