Calculadora de Testes A/B
Calcule a significância estatística de um teste A/B (valor-p, escore z) ou o tamanho de amostra necessário. Teste z bicaudal para duas proporções. Sem cadastro.
Variante A (controle)
Variante B (teste)
Veredito
Não significativo — colete mais dados
Confiança: 84,71 % · Valor-p: 0,1529
Taxa de conversão A
10%
Taxa de conversão B
12%
Incremento
+20%
Escore z
1,429
Fórmula do teste z para duas proporções
z = (p₂ − p₁) / √(p̄ · (1 − p̄) · (1/n₁ + 1/n₂))
p̄ é a taxa de conversão combinada dos dois grupos. O valor-p bicaudal é calculado por meio da distribuição normal padrão.
Como usar a calculadora
Uma única ferramenta cobre as duas tarefas de um analista de produto: planejar um teste antes que ele comece e avaliar sua significância depois de terminado.
Escolha um modo
Use o seletor superior para alternar entre Significância (analisar dados coletados) e Tamanho da amostra (planejar um teste futuro).
Informe os dados
Para significância — visitantes e conversões de cada variante. Para tamanho da amostra — taxa de conversão base, MDE, nível de significância e poder estatístico.
Leia o resultado
Você obtém um veredito com o valor-p e o escore z, ou o número exato de usuários que precisa alocar a cada variante do teste.
Por que usar esta calculadora
Duas ferramentas em uma
Planeje o tamanho da amostra antes do teste. Verifique a significância estatística depois. Sem precisar alternar entre serviços.
Fórmulas transparentes
Usamos o clássico teste z de duas proporções e a fórmula padrão de tamanho de amostra para duas proporções. Sem caixas-pretas — a matemática é exibida na página.
Funciona para qualquer métrica binária
Taxa de conversão, CTR, retenção, cliques em botões — qualquer coisa medida como «aconteceu / não aconteceu» por usuário único.
Perguntas frequentes sobre testes A/B
Que valor-p é considerado significativo?
Tradicionalmente p < 0,05, que corresponde a 95% de confiança de que a diferença entre as variantes não é aleatória. Em áreas sensíveis (medicina, finanças), usa-se um limite mais rigoroso de 0,01.
O que é o MDE?
Efeito Mínimo Detectável — a menor melhoria que o teste conseguirá detectar com o poder escolhido. Se a referência é de 10% e o MDE é de 10%, o teste detectará qualquer mudança para 11% ou mais. Um MDE menor exige um tamanho de amostra desproporcionalmente maior.
O que é o poder estatístico?
A probabilidade de detectar corretamente um efeito, se ele realmente existir. O valor padrão do setor é 80%: um teste com esse poder deixará de detectar uma melhoria real em 20% das vezes. Para decisões críticas, use 90%.
Posso interromper o teste antes se ele já for significativo?
Não. Verificar resultados intermediários infla drasticamente a taxa de falsos positivos — seu valor-p real será muito mais alto do que o exibido. Execute o teste até o N planejado e só então observe o resultado. Se precisar interrompê-lo antes, use testes sequenciais ou métodos bayesianos.