Calculadora de testes A/B
Verifique se o seu teste ganhou, planeie o tamanho da amostra e quantas semanas são precisas, e veja quanto vale a variante vencedora em receita. Significância, probabilidade bayesiana de ganhar, verificação da proporção amostral e testes de receita num só lugar. Grátis, sem registo.
A sua próxima ideia de teste
Teste como próxima variante um agente de IA que responde às perguntas dos visitantes na sua página de preços.
O CRMsoftware.pro responde a perguntas no seu website, WhatsApp, Telegram e email em segundos, de dia e de noite, e transforma cada conversa num contacto e num negócio que pode medir.
- Agente de IA treinado com o seu website, documentos e políticas
- Passa a conversa a um colega com todo o contexto
- Cada conversa passa a ser um contacto e um negócio no seu pipeline
Plano gratuito, sem cartão de crédito. Planos pagos a partir de 19 $/mês, com faturação anual.
O método
Como funciona a significância num teste A/B
A calculadora executa um teste z para duas proporções: a diferença entre A e B é maior do que aquela que o ruído aleatório normalmente produziria?
O erro padrão é calculado a partir da taxa de conversão agregada dos dois grupos. O valor z converte-se num valor-p: a probabilidade de observar uma diferença tão grande se A e B fossem, na realidade, iguais. Um valor-p inferior a 0,05 é significativo com 95 % de confiança. O intervalo de confiança da diferença usa o erro padrão não agregado.
5,0 % vs. 5,8 %
z = 2.50, p = 0.012
10 000 visitantes em cada versão, 500 vs. 580 conversões. B sobe 16 %, significativo a 95 %. O aumento situa-se provavelmente entre 3,5 % e 28,5 %.
Detetar um aumento de 10 %
31 234 visitantes por versão
Com uma taxa de conversão de 5 %, 95 % de confiança e 80 % de poder. Com 20 000 visitantes por semana, mantenha-o 4 semanas completas.
Lançar uma vencedora com +10 %
+100 conversões = 8 000 $ por mês
50 000 visitantes por mês a 2 % e 80 $ por conversão. Isso dá 96 000 $ por ano.
Antes de lançar
Tamanho da amostra e efeito mínimo detetável
Quanto menor o aumento que quer detetar, mais visitantes precisa. Reduzir o aumento para metade quadruplica, aproximadamente, a amostra.
O efeito mínimo detetável (EMD, em inglês MDE) é o menor aumento que o seu teste consegue encontrar com fiabilidade. Planear o teste mostra os visitantes de que precisa para o seu EMD e, na tabela, o menor aumento que consegue detetar se o teste durar de 1 a 8 semanas. Se o aumento que espera for menor do que aquilo que o seu tráfego consegue detetar, teste uma alteração mais ousada ou uma página com mais tráfego.
Testar mais de duas versões divide o tráfego e exige um limiar mais rigoroso. A calculadora aplica a correção de Bonferroni ao nível de confiança, para que cada comparação com o controlo continue rigorosa.
Duração
Quanto tempo deve durar um teste A/B?
Até atingir o tamanho de amostra planeado, e em semanas completas.
Abranja todos os dias da semana
Os compradores comportam-se de forma diferente à segunda-feira e ao sábado. Arredonde a duração para semanas completas, para que cada versão receba a mesma combinação.
Defina a amostra primeiro
Ver os resultados todos os dias e parar no primeiro momento significativo aumenta as falsas vitórias. Defina o tamanho da amostra antecipadamente e leia o resultado uma única vez.
Atenção à contaminação
Testes muito longos sofrem com perda de cookies, sazonalidade e outras campanhas. Se precisar de meses, teste antes uma alteração maior.
Outra perspetiva
Probabilidade bayesiana de ganhar
Ao lado do valor-p, o resultado mostra a probabilidade de B ser melhor do que A e quanto arrisca perder se lançar B e este for, afinal, pior.
A calculadora usa uma distribuição a priori Beta(1, 1) para cada versão e calcula a probabilidade exata de a taxa real de B ser superior à de A. No exemplo, B tem 99,4 % de probabilidade de ser melhor. Muitas equipas acham isto mais fácil de explicar do que um valor-p, mas responde a uma pergunta diferente, por isso use sempre o mesmo limiar.
Qualidade dos dados
Desequilíbrio da proporção amostral
Se divide o tráfego 50/50 mas uma versão recebeu visivelmente mais visitantes, algo na configuração está errado e o resultado não é fiável.
A calculadora executa um teste qui-quadrado sobre o número de visitantes face à divisão planeada. Um valor-p inferior a 0,01 assinala um desequilíbrio. As causas comuns são redirecionamentos que perdem visitantes, bots, rastreio que só dispara numa versão e cache. Corrija a causa e reinicie o teste em vez de confiar nos números.
Porque é importante
Quanto vale um teste vencedor
Um aumento na taxa de conversão só se transforma em dinheiro através do seu tráfego e do valor das encomendas.
O impacto na receita mostra também quanto custa cada semana de atraso depois de ter uma vencedora, e o efeito no limite inferior de um intervalo se introduzir um aumento prudente. Para receita por visitante ou valor médio da encomenda, use Valor médio: executa o teste t de Welch, que não pressupõe que as duas versões tenham a mesma dispersão.
Folhas de cálculo
Fórmulas de testes A/B para Excel e Google Sheets
A1 = visitantes A, B1 = conversões A, C1 = visitantes B, D1 = conversões B.
Aumento de B face a A
Valor z
Valor-p bilateral (E1 = valor z)
Visitantes por versão (F1 = taxa de referência, G1 = taxa que espera atingir)
Perguntas frequentes
Perguntas sobre testes A/B
Como sei se o meu teste A/B é estatisticamente significativo?
Introduza os visitantes e as conversões das duas versões. Se o valor-p for inferior a 1 menos o seu nível de confiança, por exemplo inferior a 0,05 a 95 %, a diferença é significativa. Com 500 em 10 000 contra 580 em 10 000, p = 0,012, por isso B ganha com 95 % de confiança.
De quantos visitantes preciso para um teste A/B?
Depende da sua taxa de conversão e do menor aumento que lhe interessa. Com uma taxa de conversão de 5 %, detetar um aumento relativo de 10 % com 95 % de confiança e 80 % de poder exige cerca de 31 234 visitantes por versão.
Quanto tempo devo manter um teste A/B?
Até cada versão atingir o tamanho de amostra planeado, arredondado para semanas completas. Divida o total de visitantes necessários pelo seu tráfego semanal e não pare mais cedo só porque o resultado parece bom.
Qual é um bom nível de confiança?
95 % é o valor predefinido habitual. Use 99 % para alterações dispendiosas de reverter e 90 % para testes rápidos e de baixo risco. Decida antes de começar.
O que é o poder estatístico?
O poder é a probabilidade de o seu teste detetar um aumento pelo menos igual ao seu EMD quando ele existe realmente. 80 % é o padrão; 90 % exige cerca de um terço mais de visitantes.
Bayesiano ou frequencista: qual devo usar?
Ambos usam os mesmos dados. O valor-p controla com que frequência declara uma falsa vencedora; a probabilidade bayesiana de ganhar indica-lhe quão provável é B ser melhor. Escolha uma regra de decisão e aplique-a de forma consistente.
O que é um desequilíbrio da proporção amostral?
Uma divisão de visitantes que se afasta do plano mais do que o acaso permite, por exemplo 52/48 com muito tráfego numa configuração 50/50. Normalmente indica um erro de rastreio ou de redirecionamento, e o teste deve ser corrigido e repetido.
Posso testar a receita em vez da taxa de conversão?
Sim. Use Valor médio com a média e o desvio padrão da receita por visitante de cada versão. Executa o teste t de Welch e dá a diferença com um intervalo de confiança.
Referências
Fontes
- Tamanho da amostra para testes de conversão: Evan Miller
- Diagnóstico do desequilíbrio da proporção amostral em experiências online, KDD 2019: Fabijan et al., ACM
- Teste t de Welch: Wikipedia
Mais ferramentas de vendas gratuitas
Transforme mais visitantes em conversas e conversas em negócios.
O CRMsoftware.pro responde aos seus visitantes com IA, capta cada lead e mostra que conversas fecham negócio. Plano gratuito, sem cartão.