CRMsoftware.pro

Calculadora de testes A/B

Verifique se o seu teste ganhou, planeie o tamanho da amostra e quantas semanas são precisas, e veja quanto vale a variante vencedora em receita. Significância, probabilidade bayesiana de ganhar, verificação da proporção amostral e testes de receita num só lugar. Grátis, sem registo.

Controlo (A)

Variante (B)

%
Usada para detetar um desequilíbrio da proporção amostral

A sua próxima ideia de teste

Teste como próxima variante um agente de IA que responde às perguntas dos visitantes na sua página de preços.

O CRMsoftware.pro responde a perguntas no seu website, WhatsApp, Telegram e email em segundos, de dia e de noite, e transforma cada conversa num contacto e num negócio que pode medir.

  • Agente de IA treinado com o seu website, documentos e políticas
  • Passa a conversa a um colega com todo o contexto
  • Cada conversa passa a ser um contacto e um negócio no seu pipeline

Plano gratuito, sem cartão de crédito. Planos pagos a partir de 19 $/mês, com faturação anual.

O método

Como funciona a significância num teste A/B

A calculadora executa um teste z para duas proporções: a diferença entre A e B é maior do que aquela que o ruído aleatório normalmente produziria?

z = (Taxa B − Taxa A) ÷ Erro padrão

O erro padrão é calculado a partir da taxa de conversão agregada dos dois grupos. O valor z converte-se num valor-p: a probabilidade de observar uma diferença tão grande se A e B fossem, na realidade, iguais. Um valor-p inferior a 0,05 é significativo com 95 % de confiança. O intervalo de confiança da diferença usa o erro padrão não agregado.

Ganhou?

5,0 % vs. 5,8 %

z = 2.50, p = 0.012

10 000 visitantes em cada versão, 500 vs. 580 conversões. B sobe 16 %, significativo a 95 %. O aumento situa-se provavelmente entre 3,5 % e 28,5 %.

Planear

Detetar um aumento de 10 %

31 234 visitantes por versão

Com uma taxa de conversão de 5 %, 95 % de confiança e 80 % de poder. Com 20 000 visitantes por semana, mantenha-o 4 semanas completas.

Receita

Lançar uma vencedora com +10 %

+100 conversões = 8 000 $ por mês

50 000 visitantes por mês a 2 % e 80 $ por conversão. Isso dá 96 000 $ por ano.

Antes de lançar

Tamanho da amostra e efeito mínimo detetável

Quanto menor o aumento que quer detetar, mais visitantes precisa. Reduzir o aumento para metade quadruplica, aproximadamente, a amostra.

O efeito mínimo detetável (EMD, em inglês MDE) é o menor aumento que o seu teste consegue encontrar com fiabilidade. Planear o teste mostra os visitantes de que precisa para o seu EMD e, na tabela, o menor aumento que consegue detetar se o teste durar de 1 a 8 semanas. Se o aumento que espera for menor do que aquilo que o seu tráfego consegue detetar, teste uma alteração mais ousada ou uma página com mais tráfego.

Testar mais de duas versões divide o tráfego e exige um limiar mais rigoroso. A calculadora aplica a correção de Bonferroni ao nível de confiança, para que cada comparação com o controlo continue rigorosa.

Duração

Quanto tempo deve durar um teste A/B?

Até atingir o tamanho de amostra planeado, e em semanas completas.

Semanas completas

Abranja todos os dias da semana

Os compradores comportam-se de forma diferente à segunda-feira e ao sábado. Arredonde a duração para semanas completas, para que cada versão receba a mesma combinação.

Não espreite

Defina a amostra primeiro

Ver os resultados todos os dias e parar no primeiro momento significativo aumenta as falsas vitórias. Defina o tamanho da amostra antecipadamente e leia o resultado uma única vez.

Não para sempre

Atenção à contaminação

Testes muito longos sofrem com perda de cookies, sazonalidade e outras campanhas. Se precisar de meses, teste antes uma alteração maior.

Outra perspetiva

Probabilidade bayesiana de ganhar

Ao lado do valor-p, o resultado mostra a probabilidade de B ser melhor do que A e quanto arrisca perder se lançar B e este for, afinal, pior.

A calculadora usa uma distribuição a priori Beta(1, 1) para cada versão e calcula a probabilidade exata de a taxa real de B ser superior à de A. No exemplo, B tem 99,4 % de probabilidade de ser melhor. Muitas equipas acham isto mais fácil de explicar do que um valor-p, mas responde a uma pergunta diferente, por isso use sempre o mesmo limiar.

Qualidade dos dados

Desequilíbrio da proporção amostral

Se divide o tráfego 50/50 mas uma versão recebeu visivelmente mais visitantes, algo na configuração está errado e o resultado não é fiável.

A calculadora executa um teste qui-quadrado sobre o número de visitantes face à divisão planeada. Um valor-p inferior a 0,01 assinala um desequilíbrio. As causas comuns são redirecionamentos que perdem visitantes, bots, rastreio que só dispara numa versão e cache. Corrija a causa e reinicie o teste em vez de confiar nos números.

Porque é importante

Quanto vale um teste vencedor

Um aumento na taxa de conversão só se transforma em dinheiro através do seu tráfego e do valor das encomendas.

Receita adicional por mês = Visitantes × Taxa de conversão × Aumento × Valor por conversão

O impacto na receita mostra também quanto custa cada semana de atraso depois de ter uma vencedora, e o efeito no limite inferior de um intervalo se introduzir um aumento prudente. Para receita por visitante ou valor médio da encomenda, use Valor médio: executa o teste t de Welch, que não pressupõe que as duas versões tenham a mesma dispersão.

Folhas de cálculo

Fórmulas de testes A/B para Excel e Google Sheets

A1 = visitantes A, B1 = conversões A, C1 = visitantes B, D1 = conversões B.

Aumento de B face a A

=(D1/C1)/(B1/A1)-1

Valor z

=(D1/C1-B1/A1)/SQRT((B1+D1)/(A1+C1)*(1-(B1+D1)/(A1+C1))*(1/A1+1/C1))

Valor-p bilateral (E1 = valor z)

=2*(1-NORM.S.DIST(ABS(E1);TRUE))

Visitantes por versão (F1 = taxa de referência, G1 = taxa que espera atingir)

=ROUNDUP((NORM.S.INV(0,975)*SQRT(2*(F1+G1)/2*(1-(F1+G1)/2))+NORM.S.INV(0,8)*SQRT(F1*(1-F1)+G1*(1-G1)))^2/(G1-F1)^2;0)

Perguntas frequentes

Perguntas sobre testes A/B

Como sei se o meu teste A/B é estatisticamente significativo?

Introduza os visitantes e as conversões das duas versões. Se o valor-p for inferior a 1 menos o seu nível de confiança, por exemplo inferior a 0,05 a 95 %, a diferença é significativa. Com 500 em 10 000 contra 580 em 10 000, p = 0,012, por isso B ganha com 95 % de confiança.

De quantos visitantes preciso para um teste A/B?

Depende da sua taxa de conversão e do menor aumento que lhe interessa. Com uma taxa de conversão de 5 %, detetar um aumento relativo de 10 % com 95 % de confiança e 80 % de poder exige cerca de 31 234 visitantes por versão.

Quanto tempo devo manter um teste A/B?

Até cada versão atingir o tamanho de amostra planeado, arredondado para semanas completas. Divida o total de visitantes necessários pelo seu tráfego semanal e não pare mais cedo só porque o resultado parece bom.

Qual é um bom nível de confiança?

95 % é o valor predefinido habitual. Use 99 % para alterações dispendiosas de reverter e 90 % para testes rápidos e de baixo risco. Decida antes de começar.

O que é o poder estatístico?

O poder é a probabilidade de o seu teste detetar um aumento pelo menos igual ao seu EMD quando ele existe realmente. 80 % é o padrão; 90 % exige cerca de um terço mais de visitantes.

Bayesiano ou frequencista: qual devo usar?

Ambos usam os mesmos dados. O valor-p controla com que frequência declara uma falsa vencedora; a probabilidade bayesiana de ganhar indica-lhe quão provável é B ser melhor. Escolha uma regra de decisão e aplique-a de forma consistente.

O que é um desequilíbrio da proporção amostral?

Uma divisão de visitantes que se afasta do plano mais do que o acaso permite, por exemplo 52/48 com muito tráfego numa configuração 50/50. Normalmente indica um erro de rastreio ou de redirecionamento, e o teste deve ser corrigido e repetido.

Posso testar a receita em vez da taxa de conversão?

Sim. Use Valor médio com a média e o desvio padrão da receita por visitante de cada versão. Executa o teste t de Welch e dá a diferença com um intervalo de confiança.

Referências

Fontes

  1. Tamanho da amostra para testes de conversão: Evan Miller
  2. Diagnóstico do desequilíbrio da proporção amostral em experiências online, KDD 2019: Fabijan et al., ACM
  3. Teste t de Welch: Wikipedia

Mais ferramentas de vendas gratuitas

Transforme mais visitantes em conversas e conversas em negócios.

O CRMsoftware.pro responde aos seus visitantes com IA, capta cada lead e mostra que conversas fecham negócio. Plano gratuito, sem cartão.

Começar grátis →