CRMsoftware.pro

Calcolatore A/B test

Verifica se il tuo test ha vinto, pianifica la dimensione del campione e quante settimane servono, e scopri quanto vale in ricavi la variante vincente. Significatività, probabilità bayesiana di vittoria, controllo del rapporto di campionamento e test sui ricavi in un unico posto. Gratis, senza registrazione.

Controllo (A)

Variante (B)

%
Serve a rilevare uno squilibrio nel rapporto di campionamento

La tua prossima idea di test

Come prossima variante, testa un agente IA che risponde alle domande dei visitatori sulla tua pagina dei prezzi.

CRMsoftware.pro risponde alle domande sul tuo sito, su WhatsApp, Telegram ed email in pochi secondi, giorno e notte, e trasforma ogni conversazione in un contatto e una trattativa misurabili.

  • Agente IA addestrato sul tuo sito, sui tuoi documenti e sulle tue policy
  • Passa la conversazione a un collega con tutto il contesto
  • Ogni chat diventa un contatto e una trattativa nella tua pipeline

Piano gratuito, senza carta di credito. Piani a pagamento da 19 $/mese, con fatturazione annuale.

Il metodo

Come funziona la significatività di un A/B test

Il calcolatore esegue un test z per due proporzioni: la differenza tra A e B è più grande di quella che di solito produrrebbe il rumore casuale?

z = (Tasso B − Tasso A) ÷ Errore standard

L'errore standard deriva dal tasso di conversione aggregato dei due gruppi. Il punteggio z si traduce in un p-value: la probabilità di osservare una differenza così grande se A e B fossero davvero uguali. Un p-value inferiore a 0,05 è significativo con una confidenza del 95%. L'intervallo di confidenza della differenza usa l'errore standard non aggregato.

Ha vinto?

5,0% contro 5,8%

z = 2.50, p = 0.012

10.000 visitatori ciascuna, 500 contro 580 conversioni. B è in crescita del 16%, significativo al 95%. L'incremento è probabilmente compreso tra il 3,5% e il 28,5%.

Pianificazione

Rilevare un incremento del 10%

31.234 visitatori per versione

Con un tasso di conversione del 5%, confidenza al 95% e potenza all'80%. Con 20.000 visitatori a settimana, fallo durare 4 settimane complete.

Ricavi

Pubblica una variante vincente al 10%

+100 conversioni = 8.000 $ al mese

50.000 visitatori al mese al 2% e 80 $ per conversione. Sono 96.000 $ all'anno.

Prima del lancio

Dimensione del campione ed effetto minimo rilevabile

Più piccolo è l'incremento che vuoi rilevare, più visitatori ti servono. Dimezzare l'incremento quadruplica all'incirca il campione.

L'effetto minimo rilevabile (MDE) è il più piccolo incremento che il tuo test può individuare in modo affidabile. Pianifica il test mostra i visitatori necessari per il tuo MDE e, nella tabella, l'incremento minimo rilevabile se il test dura da 1 a 8 settimane. Se l'incremento che speri di ottenere è più piccolo di quello che il tuo traffico può rilevare, testa una modifica più audace o una pagina con più traffico.

Testare più di due versioni divide il traffico e richiede una soglia più severa. Il calcolatore applica la correzione di Bonferroni al livello di confidenza, così ogni confronto con il controllo resta corretto.

Tempistiche

Quanto deve durare un A/B test?

Finché non raggiunge la dimensione del campione prevista, e per settimane intere.

Settimane intere

Copri tutti i giorni della settimana

Gli acquirenti si comportano diversamente il lunedì e il sabato. Arrotonda la durata per eccesso a settimane complete, così ogni versione riceve lo stesso mix.

Niente sbirciate

Decidi prima il campione

Controllare i risultati ogni giorno e fermarsi al primo momento significativo gonfia le false vittorie. Stabilisci in anticipo la dimensione del campione e leggi il risultato una sola volta.

Non all'infinito

Attenzione alla contaminazione

I test molto lunghi risentono della perdita dei cookie, della stagionalità e di altre campagne. Se ti servono mesi, testa piuttosto una modifica più grande.

Un altro punto di vista

Probabilità bayesiana di vittoria

Accanto al p-value, il risultato mostra la probabilità che B sia migliore di A e quanto rischi di perdere se pubblichi B e in realtà è peggiore.

Il calcolatore usa una distribuzione a priori Beta(1, 1) per ogni versione e calcola la probabilità esatta che il tasso reale di B sia superiore a quello di A. Nell'esempio, B ha il 99,4% di probabilità di essere migliore. Molti team lo trovano più facile da spiegare di un p-value, ma risponde a una domanda diversa, quindi usa sempre la stessa soglia.

Qualità dei dati

Squilibrio nel rapporto di campionamento

Se dividi il traffico 50/50 ma una versione ha ricevuto molti più visitatori, qualcosa nella configurazione non funziona e il risultato non è affidabile.

Il calcolatore esegue un test del chi quadrato sul numero di visitatori rispetto alla suddivisione prevista. Un p-value inferiore a 0,01 segnala uno squilibrio. Le cause più comuni sono reindirizzamenti che perdono visitatori, bot, tracciamenti che scattano solo su una versione e la cache. Risolvi la causa e riavvia il test invece di fidarti dei numeri.

Perché conta

Quanto vale un test vincente

Un incremento del tasso di conversione diventa denaro solo attraverso il tuo traffico e il valore degli ordini.

Ricavi extra al mese = Visitatori × Tasso di conversione × Incremento × Valore per conversione

Impatto sui ricavi mostra anche quanto costa ogni settimana di ritardo una volta trovata la variante vincente, e l'effetto all'estremo inferiore di un intervallo se inserisci un incremento prudente. Per il ricavo per visitatore o il valore medio dell'ordine, usa Valore medio: esegue il test t di Welch, che non presuppone che le due versioni abbiano la stessa dispersione.

Fogli di calcolo

Formule per A/B test in Excel e Google Sheets

A1 = visitatori A, B1 = conversioni A, C1 = visitatori B, D1 = conversioni B.

Incremento di B rispetto ad A

=(D1/C1)/(B1/A1)-1

Punteggio z

=(D1/C1-B1/A1)/SQRT((B1+D1)/(A1+C1)*(1-(B1+D1)/(A1+C1))*(1/A1+1/C1))

P-value bilaterale (E1 = punteggio z)

=2*(1-NORM.S.DIST(ABS(E1);TRUE))

Visitatori per versione (F1 = tasso di partenza, G1 = tasso che speri di ottenere)

=ROUNDUP((NORM.S.INV(0,975)*SQRT(2*(F1+G1)/2*(1-(F1+G1)/2))+NORM.S.INV(0,8)*SQRT(F1*(1-F1)+G1*(1-G1)))^2/(G1-F1)^2;0)

Domande frequenti

Domande sugli A/B test

Come faccio a sapere se il mio A/B test è statisticamente significativo?

Inserisci visitatori e conversioni per entrambe le versioni. Se il p-value è inferiore a 1 meno il tuo livello di confidenza, ad esempio inferiore a 0,05 al 95%, la differenza è significativa. Con 500 su 10.000 contro 580 su 10.000, p = 0,012, quindi B vince con una confidenza del 95%.

Quanti visitatori servono per un A/B test?

Dipende dal tuo tasso di conversione e dal più piccolo incremento che ti interessa. Con un tasso di conversione del 5%, per rilevare un incremento relativo del 10% con confidenza al 95% e potenza all'80% servono circa 31.234 visitatori per versione.

Quanto dovrei far durare un A/B test?

Finché ogni versione non raggiunge la dimensione del campione prevista, arrotondando per eccesso a settimane complete. Dividi il totale dei visitatori necessari per il tuo traffico settimanale e non fermarti prima solo perché il risultato sembra buono.

Qual è un buon livello di confidenza?

Il 95% è il valore predefinito più comune. Usa il 99% per modifiche costose da annullare e il 90% per test rapidi e a basso rischio. Decidi prima di iniziare.

Che cos'è la potenza statistica?

La potenza è la probabilità che il tuo test rilevi un incremento pari almeno al tuo MDE quando esiste davvero. L'80% è lo standard; il 90% richiede circa un terzo di visitatori in più.

Bayesiano o frequentista: quale usare?

Entrambi usano gli stessi dati. Il p-value controlla quanto spesso dichiari un falso vincitore; la probabilità bayesiana di vittoria ti dice quanto è probabile che B sia migliore. Scegli una regola per le decisioni e applicala con coerenza.

Che cos'è uno squilibrio nel rapporto di campionamento?

Una suddivisione dei visitatori che si discosta dal piano più di quanto consenta il caso, ad esempio 52/48 su un traffico elevato con una configurazione 50/50. Di solito indica un errore di tracciamento o di reindirizzamento, e il test va corretto e ripetuto.

Posso testare i ricavi invece del tasso di conversione?

Sì. Usa Valore medio con la media e la deviazione standard del ricavo per visitatore di ciascuna versione. Esegue il test t di Welch e fornisce la differenza con un intervallo di confidenza.

Riferimenti

Fonti

  1. Dimensione del campione per i test di conversione: Evan Miller
  2. Diagnosi dello squilibrio nel rapporto di campionamento negli esperimenti online, KDD 2019: Fabijan et al., ACM
  3. Test t di Welch: Wikipedia

Altri strumenti di vendita gratuiti

Trasforma più visitatori in conversazioni e più conversazioni in trattative.

CRMsoftware.pro risponde ai tuoi visitatori con l'IA, acquisisce ogni lead e mostra quali conversazioni si chiudono. Piano gratuito, senza carta.

Inizia gratis →