Calcolatore di significatività del test A/B
Verifica se il risultato del tuo test A/B è statisticamente significativo. Inserisci visitatori e conversioni per ottenere il p-value, lo z-score, l'intervallo di confidenza e l'incremento relativo.
Calcolatore di significatività del test A/B
Inserisci visitatori e conversioni per ogni variante per verificare se la differenza è reale o solo rumore.
Risultati
Statisticamente significativo
È improbabile che la differenza sia dovuta al caso al livello di confidenza scelto.
Chance this gap is just luck — lower is stronger.
How far apart the two rates are, in standard errors.
The likely range for the true difference.
Documentazione
Cosa fa un calcolatore della significatività di un test A/B
Un calcolatore della significatività di un test A/B verifica se la differenza tra due versioni di qualcosa — una pagina web, un'e-mail, un pulsante di pagamento — è un effetto reale o solo il frutto del caso. Usa il numero di visitatori e il numero di conversioni per ciascuna versione e restituisce un p-value, un punteggio z e un intervallo di confidenza. Una conversione è qualsiasi azione considerata un successo: un acquisto, una registrazione, un clic.
Come usare il calcolatore
Il calcolatore richiede quattro numeri.
- Visitatori (controllo): quante persone hanno visto la versione A, quella originale.
- Conversioni (controllo): quante di loro hanno effettuato una conversione.
- Visitatori (variante): quante persone hanno visto la versione B, quella nuova.
- Conversioni (variante): quante di loro hanno effettuato una conversione.
Altre due impostazioni modificano il modo in cui viene valutato il risultato.
- Livello di confidenza stabilisce quanto è rigoroso il test. 95% è il valore predefinito più comune. Un livello più alto, come 99%, richiede prove più solide prima di considerare significativo un risultato.
- Ipotesi stabilisce la direzione della domanda. Un test a due code chiede: «B è diverso da A, in una direzione qualsiasi?». Un test a una coda chiede soltanto: «B è migliore di A?». Un test a una coda dovrebbe essere scelto solo prima di raccogliere i dati e solo quando un risultato peggiore per B non cambierebbe alcuna decisione.
Il risultato si aggiorna man mano che vengono inseriti i numeri. I dati immessi vengono memorizzati nell'indirizzo web della pagina, quindi il risultato può essere aggiunto ai segnalibri o condiviso come link.
Formula del test A/B (test z per due proporzioni)
Il calcolatore usa un test z per due proporzioni, un metodo standard insegnato nei corsi introduttivi di statistica per confrontare due tassi.
Passaggio 1. Tasso di conversione di ciascun gruppo.
Qui è il numero di conversioni e è il numero di visitatori, rispettivamente per il gruppo di controllo (1) e per la variante (2).
Passaggio 2. Tasso di conversione aggregato. In questo passaggio si ipotizza, ai fini del test, che entrambi i gruppi condividano uno stesso tasso reale sottostante.
Passaggio 3. Errore standard della differenza, calcolato a partire dal tasso aggregato.
Passaggio 4. Punteggio z, ovvero la differenza tra i due tassi misurata in errori standard.
Passaggio 5. P-value, ricavato dalla distribuzione normale standard . Per un test a due code: . Per un test a una coda: .
Passaggio 6. Verdetto. Il risultato è considerato statisticamente significativo quando il p-value è inferiore a , dove . Con un livello di confidenza del 95%, .
Il calcolatore restituisce anche un intervallo di confidenza per l'entità della differenza, . Questo intervallo usa un errore standard distinto, che non presuppone che i due gruppi condividano lo stesso tasso:
L'intervallo è , dove è 1,6449 con un livello di confidenza del 90%, 1,96 con 95% e 2,5758 con 99%. Se l'intervallo non contiene zero, la differenza è significativa a quel livello di confidenza.
Esempio svolto
| Visitatori | Conversioni | Tasso | |
|---|---|---|---|
| Controllo (A) | 1.000 | 100 | 10,00% |
| Variante (B) | 1.000 | 150 | 15,00% |
Il tasso aggregato è , ovvero 12,5%. L'errore standard aggregato è circa 0,0148. Il punteggio z è .
Per un test a due code, si ottiene un p-value di circa 0,00072. È inferiore alla soglia usuale di 0,05, quindi, con un livello di confidenza del 95%, la differenza è statisticamente significativa. Se le due versioni avessero realmente ottenuto lo stesso risultato, una differenza di questa entità o maggiore si manifesterebbe per il solo effetto del caso in circa 7 test su ogni 10.000.
La differenza assoluta è di 5,00 punti percentuali. L'incremento relativo è del 50%, poiché il tasso di B è 1,5 volte quello di A. L'intervallo di confidenza del 95% per la differenza reale va da circa 2,11% a 7,89%.
Interpretare correttamente il risultato
Un risultato statisticamente significativo non è automaticamente un risultato su cui conviene intervenire. Un incremento reale ma minimo potrebbe non giustificare il costo della sua implementazione. Dopo i calcoli, il giudizio aziendale resta importante.
Controllare il p-value ogni giorno e interrompere il test non appena supera 0,05 aumenta la probabilità di un falso positivo. È preferibile stabilire in anticipo la dimensione del campione o la durata del test e lasciarlo terminare prima di interpretare il risultato.
L'approssimazione normale su cui si basa questo test funziona meglio quando ciascun gruppo ha almeno circa 10 conversioni e 10 non conversioni. Con numeri più bassi, il risultato dovrebbe essere considerato un'indicazione approssimativa, non una risposta definitiva.
Un livello di confidenza del 95% non significa che ci sia una probabilità del 95% che B sia realmente migliore di A. Significa che, se lo stesso test fosse ripetuto molte volte, questo metodo produrrebbe un risultato significativamente errato al massimo nel 5% dei casi. È un'affermazione sul metodo, non su questo singolo risultato.
Testare contemporaneamente molte metriche o molte varianti aumenta la probabilità che almeno un confronto risulti significativo per puro caso. Scegliere una sola metrica prima dell'inizio del test evita questo problema.
Domande frequenti
Di quale dimensione del campione ha bisogno un test A/B? Sono necessari abbastanza visitatori perché un incremento significativo risulti effettivamente significativo dal punto di vista statistico. Una soglia approssimativa è di alcune centinaia di conversioni per versione. Un calcolatore dedicato della dimensione del campione, che utilizza il tasso di base e il più piccolo incremento che vale la pena rilevare, fornisce un numero più affidabile prima dell'inizio del test.
Il test dovrebbe essere a una coda o a due code? Il test a due code è l'impostazione predefinita più prudente, poiché può indicare che B è migliore o peggiore di A. Il test a una coda è più sensibile a un miglioramento, ma non può rilevare un risultato peggiore; va quindi usato solo quando un risultato peggiore per B non cambierebbe alcuna decisione.
Perché il calcolatore restituisce un intervallo di confidenza? Un intervallo di confidenza mostra l'intervallo plausibile della differenza reale, non solo un'etichetta «significativo/non significativo». Un intervallo ampio che comprende lo zero indica generalmente che il test richiede più dati.
Questo è un calcolatore bayesiano? No. Usa un test z frequentista, il metodo più comunemente insegnato e utilizzato per i test A/B. Uno strumento bayesiano restituisce invece la probabilità che B superi A. Entrambi i metodi sono validi, ma rispondono a domande leggermente diverse.
Cosa succede se il calcolatore mostra un errore? Viene visualizzato un errore se il numero di conversioni è negativo, se supera il numero di visitatori oppure se il tasso di conversione complessivo dei due gruppi è 0% o 100%, perché in tal caso la formula del test z non può dividere per un errore standard pari a zero.