Pular para o conteúdo

Calculadora de teste A/B

Significância estatística para um teste A/B, com suporte a mais de uma variante, intervalo de confiança no aumento e planejador de tamanho de amostra.

Controle
Variantes
Configurações do teste

Testa apenas se uma variante é melhor que o controle, não se difere em qualquer direção. O teste bilateral é o padrão mais seguro.

Resultado do teste

Melhor resultado

-

Digite os dados do seu teste

GrupoTaxaDif. abs.Elev. rel.IC de 95% da diferençazValor-pResultado

Como funciona

Uma calculadora de significância para teste A/B determina se a diferença nas taxas de conversão entre um controle e uma ou mais variantes é estatisticamente real e não apenas acaso, usando um teste z de duas proporções. O planejador de tamanho de amostra calcula quantos visitantes um teste precisa antes de você executá-lo.

  1. Insira seus dados

    Visitantes e conversões do controle e, em seguida, de cada variante testada.

  2. Escolha o nível de confiança

    95% é o padrão comum. Adicione uma segunda ou terceira variante se você testou mais de uma.

  3. Leia o valor-p

    Um valor abaixo do seu limite de significância indica que é improvável que a diferença seja fruto do acaso.

O teste z de duas proporções

z = (taxa(variante) − taxa(controle)) / √(agrupado × (1−agrupado) × (1/n(controle) + 1/n(variante)))

A taxa agrupada é o total de conversões dividido pelo total de visitantes em ambos os grupos. O valor-p vem da distribuição normal padrão: um teste bicaudal verifica diferenças em qualquer direção, enquanto um teste unicaudal verifica apenas melhorias. Um valor-p abaixo do seu limite de significância, 0,05 com 95% de confiança, significa que é improvável que o resultado seja fruto do acaso.

Tamanho da amostra antes de executar o teste

n = (z(confiança) + z(poder))² × (p1(1−p1) + p2(1−p2)) / (p2 − p1)²

p1 é a taxa de base e p2 é a taxa que você deseja detectar. Planejar com antecedência evita o viés causado por consultar os resultados e interromper o teste assim que eles parecem significativos, o que aumenta a taxa de falsos positivos. Um efeito mínimo detectável menor ou um nível de confiança mais alto exigem uma amostra maior.

Antes de declarar um vencedor

Execute um teste por pelo menos um ciclo completo de negócios, geralmente de uma a duas semanas, para capturar variações por dia da semana, mesmo que a significância apareça antes. Cada grupo geralmente precisa de pelo menos 100 conversões para um resultado confiável. Um resultado estatisticamente significativo não garante que o aumento se mantenha após o lançamento, apenas que é improvável que seja ruído aleatório nestes dados.

Perguntas frequentes

O que significa significância estatística em um teste A/B?

Significância estatística significa que é improvável que a diferença observada nas taxas de conversão entre o controle e uma variante tenha ocorrido por acaso. Com 95% de confiança, um valor-p abaixo de 0,05 significa que há apenas 5% de probabilidade de o resultado ser obra do acaso. Isso não garante que o aumento se manterá em produção, apenas que há evidências estatísticas suficientes para agir sobre o resultado com uma confiança razoável.

Quantas conversões são necessárias para obter significância em um teste A/B?

Não existe um número único: isso depende da taxa de conversão inicial e do tamanho do aumento que você deseja detectar. Como regra geral, cada grupo precisa de pelo menos 100 conversões e, idealmente, várias centenas, para um resultado confiável. Use o modo Planejar tamanho da amostra: insira a taxa inicial e o efeito mínimo detectável para obter a contagem exata de visitantes necessária por grupo antes de iniciar o teste.

O que é um valor-p em um teste A/B?

O valor-p é a probabilidade de que a diferença observada, ou uma maior, ocorresse se não houvesse realmente nenhuma diferença real entre os grupos. Um valor-p de 0,03 significa que há apenas 3% de chance de o resultado ser devido a variações aleatórias. A maioria das equipes usa um limite de p abaixo de 0,05, 95% de confiança, antes de declarar um vencedor, embora uma decisão de alto risco possa exigir p abaixo de 0,01, 99% de confiança.

Significância estatística é o mesmo que tamanho da amostra?

Não. A significância estatística é um resultado, expresso pelo valor-p, que depende dos dados coletados. O tamanho da amostra é um parâmetro de planejamento que determina a sensibilidade do teste para detectar um determinado aumento. Executar um teste até obter significância sem planejar antes o tamanho da amostra pode gerar viés: ao consultar repetidamente os resultados, você pode interromper o teste quando eles parecem significativos por acaso, aumentando a taxa de falsos positivos.

Posso comparar mais de uma variante contra o controle ao mesmo tempo?

Sim. Adicione até quatro variantes. Cada uma é testada em relação ao controle com seu próprio teste z, intervalo de confiança e valor-p, para que você possa comparar os resultados lado a lado. Testar várias variantes ao mesmo tempo aumenta a chance de que uma pareça significativa apenas por sorte. Por isso, avalie com cautela um resultado limítrofe entre muitas variantes e considere testá-la novamente isoladamente.