CRMsoftware.pro

Calculateur de test A/B

Vérifiez si votre test est gagnant, planifiez la taille d’échantillon et le nombre de semaines nécessaires, et voyez ce que la variante gagnante rapporte en chiffre d’affaires. Significativité, probabilité bayésienne de gagner, contrôle de la répartition de l’échantillon et tests sur le chiffre d’affaires réunis au même endroit. Gratuit, sans inscription.

Contrôle (A)

Variante (B)

%
Sert à détecter un déséquilibre de répartition de l’échantillon

Votre prochaine idée de test

Testez comme prochaine variante un agent IA qui répond aux questions des visiteurs sur votre page de tarifs.

CRMsoftware.pro répond aux questions sur votre site web, WhatsApp, Telegram et par e-mail en quelques secondes, jour et nuit, et transforme chaque conversation en un contact et une affaire mesurables.

  • Agent IA formé sur votre site web, vos documents et vos politiques
  • Transfert à un collègue avec tout le contexte
  • Chaque conversation devient un contact et une affaire dans votre pipeline

Offre gratuite, sans carte bancaire. Offres payantes à partir de 19 $/mois, facturation annuelle.

La méthode

Comment fonctionne la significativité d’un test A/B

Le calculateur effectue un test z de comparaison de deux proportions : l’écart entre A et B est-il plus grand que ce que le simple hasard produirait habituellement ?

z = (Taux B − Taux A) ÷ Erreur type

L’erreur type est calculée à partir du taux de conversion groupé des deux échantillons. Le score z est ensuite converti en valeur p (p-value) : la probabilité d’observer un écart aussi important si A et B étaient en réalité identiques. Une valeur p inférieure à 0,05 est significative au niveau de confiance de 95 %. L’intervalle de confiance de l’écart utilise l’erreur type non groupée.

Gagnant ?

5,0 % contre 5,8 %

z = 2.50, p = 0.012

10 000 visiteurs chacun, 500 contre 580 conversions. B progresse de 16 %, résultat significatif à 95 %. L’amélioration se situe probablement entre 3,5 % et 28,5 %.

Planification

Détecter une amélioration de 10 %

31 234 visiteurs par version

Avec un taux de conversion de 5 %, un niveau de confiance de 95 % et une puissance de 80 %. Avec 20 000 visiteurs par semaine, faites-le tourner 4 semaines complètes.

Chiffre d’affaires

Déployer une variante gagnante à +10 %

+100 conversions = 8 000 $ par mois

50 000 visiteurs par mois à 2 % et 80 $ par conversion. Soit 96 000 $ par an.

Avant de lancer

Taille d’échantillon et effet minimal détectable

Plus l’amélioration à détecter est faible, plus il faut de visiteurs. Diviser l’amélioration par deux multiplie environ par quatre la taille d’échantillon.

L’effet minimal détectable (MDE) est la plus petite amélioration que votre test peut détecter de façon fiable. Planifier mon test indique le nombre de visiteurs nécessaires pour votre MDE et, dans le tableau, la plus petite amélioration détectable si le test dure de 1 à 8 semaines. Si l’amélioration espérée est inférieure à ce que votre trafic permet de détecter, testez un changement plus marqué ou une page qui reçoit plus de trafic.

Tester plus de deux versions divise le trafic et impose un seuil plus strict. Le calculateur applique la correction de Bonferroni au niveau de confiance, afin que chaque comparaison avec le contrôle reste rigoureuse.

Durée

Combien de temps doit durer un test A/B ?

Jusqu’à atteindre la taille d’échantillon prévue, et par semaines entières.

Semaines entières

Couvrir tous les jours de la semaine

Les acheteurs ne se comportent pas de la même façon le lundi et le samedi. Arrondissez la durée à des semaines entières pour que chaque version reçoive le même mélange de visiteurs.

Pas de coup d’œil

Fixez l’échantillon d’abord

Consulter les résultats tous les jours et s’arrêter au premier moment significatif multiplie les faux gagnants. Fixez la taille d’échantillon à l’avance et lisez le résultat une seule fois.

Pas indéfiniment

Attention à la pollution

Les tests très longs subissent la perte de cookies, la saisonnalité et d’autres campagnes. S’il vous faut des mois, testez plutôt un changement plus important.

Un autre regard

Probabilité bayésienne de gagner

À côté de la valeur p, le résultat indique la probabilité que B soit meilleure que A, et ce que vous risquez de perdre si vous déployez B alors qu’elle est en réalité moins bonne.

Le calculateur utilise une loi a priori Beta(1, 1) pour chaque version et calcule la probabilité exacte que le taux réel de B soit supérieur à celui de A. Dans l’exemple, B a 99,4 % de chances d’être meilleure. Beaucoup d’équipes trouvent cela plus simple à expliquer qu’une valeur p, mais la question posée est différente : utilisez donc toujours le même seuil.

Qualité des données

Déséquilibre de répartition

Si vous répartissez le trafic à 50/50 mais qu’une version reçoit nettement plus de visiteurs, quelque chose est cassé dans la configuration et le résultat n’est pas fiable.

Le calculateur effectue un test du khi-deux sur le nombre de visiteurs par rapport à la répartition prévue. Une valeur p inférieure à 0,01 signale un déséquilibre. Les causes fréquentes sont des redirections qui perdent des visiteurs, des robots, un suivi qui ne se déclenche que sur une version, et la mise en cache. Corrigez la cause et relancez le test plutôt que de vous fier aux chiffres.

Pourquoi c’est important

Ce que vaut un test gagnant

Une hausse du taux de conversion ne devient de l’argent qu’à travers votre trafic et la valeur de vos commandes.

Chiffre d’affaires supplémentaire par mois = Visiteurs × Taux de conversion × Amélioration × Valeur par conversion

Impact sur le CA montre aussi ce que coûte chaque semaine de retard une fois que vous avez un gagnant, ainsi que l’effet à la borne basse d’un intervalle si vous saisissez une amélioration prudente. Pour le revenu par visiteur ou le panier moyen, utilisez Valeur moyenne : il applique le test t de Welch, qui ne suppose pas que les deux versions ont la même dispersion.

Tableurs

Formules de test A/B pour Excel et Google Sheets

A1 = visiteurs A, B1 = conversions A, C1 = visiteurs B, D1 = conversions B.

Amélioration de B par rapport à A

=(D1/C1)/(B1/A1)-1

Score z

=(D1/C1-B1/A1)/SQRT((B1+D1)/(A1+C1)*(1-(B1+D1)/(A1+C1))*(1/A1+1/C1))

Valeur p bilatérale (E1 = score z)

=2*(1-NORM.S.DIST(ABS(E1);TRUE))

Visiteurs par version (F1 = taux de référence, G1 = taux espéré)

=ROUNDUP((NORM.S.INV(0,975)*SQRT(2*(F1+G1)/2*(1-(F1+G1)/2))+NORM.S.INV(0,8)*SQRT(F1*(1-F1)+G1*(1-G1)))^2/(G1-F1)^2;0)

FAQ

Questions sur les tests A/B

Comment savoir si mon test A/B est statistiquement significatif ?

Saisissez les visiteurs et les conversions des deux versions. Si la valeur p est inférieure à 1 moins votre niveau de confiance, par exemple inférieure à 0,05 à 95 %, l’écart est significatif. Avec 500 sur 10 000 contre 580 sur 10 000, p = 0,012 : B gagne avec un niveau de confiance de 95 %.

De combien de visiteurs ai-je besoin pour un test A/B ?

Cela dépend de votre taux de conversion et de la plus petite amélioration qui vous intéresse. Avec un taux de conversion de 5 %, détecter une amélioration relative de 10 % avec un niveau de confiance de 95 % et une puissance de 80 % nécessite environ 31 234 visiteurs par version.

Combien de temps dois-je faire tourner un test A/B ?

Jusqu’à ce que chaque version atteigne la taille d’échantillon prévue, arrondie à des semaines entières. Divisez le nombre total de visiteurs nécessaires par votre trafic hebdomadaire, et n’arrêtez pas plus tôt parce que le résultat semble bon.

Quel est un bon niveau de confiance ?

95 % est la valeur par défaut la plus courante. Utilisez 99 % pour des changements coûteux à annuler et 90 % pour des tests rapides et peu risqués. Décidez-en avant de commencer.

Qu’est-ce que la puissance statistique ?

La puissance est la probabilité que votre test détecte une amélioration au moins égale à votre MDE lorsqu’elle existe réellement. 80 % est la norme ; 90 % demande environ un tiers de visiteurs en plus.

Bayésien ou fréquentiste : lequel choisir ?

Les deux utilisent les mêmes données. La valeur p contrôle la fréquence à laquelle vous désignez un faux gagnant ; la probabilité bayésienne de gagner indique à quel point il est probable que B soit meilleure. Choisissez une règle de décision et appliquez-la systématiquement.

Qu’est-ce qu’un déséquilibre de répartition de l’échantillon ?

Une répartition des visiteurs qui s’écarte du plan plus que le hasard ne le permet, par exemple 52/48 sur un trafic important avec une configuration 50/50. Elle signale généralement un bug de suivi ou de redirection : il faut corriger le test et le relancer.

Puis-je tester le chiffre d’affaires plutôt que le taux de conversion ?

Oui. Utilisez Valeur moyenne avec la moyenne et l’écart type du revenu par visiteur pour chaque version. Il applique le test t de Welch et donne l’écart avec un intervalle de confiance.

Références

Nos sources

  1. Taille d’échantillon pour les tests de conversion : Evan Miller
  2. Diagnostic du déséquilibre de répartition dans les expériences en ligne, KDD 2019 : Fabijan et al., ACM
  3. Test t de Welch : Wikipedia

Plus d’outils de vente gratuits

Transformez plus de visiteurs en conversations, et plus de conversations en affaires.

CRMsoftware.pro répond à vos visiteurs grâce à l’IA, capte chaque prospect et montre quelles conversations aboutissent à une vente. Offre gratuite, sans carte bancaire.

Commencer gratuitement →