ConvertiloConvertilo

Calculadora de Testes A/B

Calcule a significância estatística de um teste A/B (valor-p, escore z) ou o tamanho de amostra necessário. Teste z bicaudal para duas proporções. Sem cadastro.

Variante A (controle)

Variante B (teste)

Veredito

Não significativo — colete mais dados

Confiança: 84,71 % · Valor-p: 0,1529

Taxa de conversão A

10%

Taxa de conversão B

12%

Incremento

+20%

Escore z

1,429

Fórmula do teste z para duas proporções

z = (p₂ − p₁) / √(p̄ · (1 − p̄) · (1/n₁ + 1/n₂))

p̄ é a taxa de conversão combinada dos dois grupos. O valor-p bicaudal é calculado por meio da distribuição normal padrão.

Como usar a calculadora

Uma única ferramenta cobre as duas tarefas de um analista de produto: planejar um teste antes que ele comece e avaliar sua significância depois de terminado.

Escolha um modo

Use o seletor superior para alternar entre Significância (analisar dados coletados) e Tamanho da amostra (planejar um teste futuro).

Informe os dados

Para significância — visitantes e conversões de cada variante. Para tamanho da amostra — taxa de conversão base, MDE, nível de significância e poder estatístico.

Leia o resultado

Você obtém um veredito com o valor-p e o escore z, ou o número exato de usuários que precisa alocar a cada variante do teste.

Por que usar esta calculadora

Duas ferramentas em uma

Planeje o tamanho da amostra antes do teste. Verifique a significância estatística depois. Sem precisar alternar entre serviços.

Fórmulas transparentes

Usamos o clássico teste z de duas proporções e a fórmula padrão de tamanho de amostra para duas proporções. Sem caixas-pretas — a matemática é exibida na página.

Funciona para qualquer métrica binária

Taxa de conversão, CTR, retenção, cliques em botões — qualquer coisa medida como «aconteceu / não aconteceu» por usuário único.

Perguntas frequentes sobre testes A/B

Que valor-p é considerado significativo?

Tradicionalmente p < 0,05, que corresponde a 95% de confiança de que a diferença entre as variantes não é aleatória. Em áreas sensíveis (medicina, finanças), usa-se um limite mais rigoroso de 0,01.

O que é o MDE?

Efeito Mínimo Detectável — a menor melhoria que o teste conseguirá detectar com o poder escolhido. Se a referência é de 10% e o MDE é de 10%, o teste detectará qualquer mudança para 11% ou mais. Um MDE menor exige um tamanho de amostra desproporcionalmente maior.

O que é o poder estatístico?

A probabilidade de detectar corretamente um efeito, se ele realmente existir. O valor padrão do setor é 80%: um teste com esse poder deixará de detectar uma melhoria real em 20% das vezes. Para decisões críticas, use 90%.

Posso interromper o teste antes se ele já for significativo?

Não. Verificar resultados intermediários infla drasticamente a taxa de falsos positivos — seu valor-p real será muito mais alto do que o exibido. Execute o teste até o N planejado e só então observe o resultado. Se precisar interrompê-lo antes, use testes sequenciais ou métodos bayesianos.