Combien de visiteurs faut-il pour un test A/B ?
Publié le 17/06/2026 · 13 min de lecture · Outils marketing & SEO
Camille Laurent — Rédactrice Finance chez OneKitly
Fiscalité · Finances personnelles
Vérifié à partir de 3 sources
La taille d'échantillon dépend de trois choix faits avant le test : le taux de conversion de référence, le plus petit gain relatif que tu veux pouvoir détecter, et la fréquence à laquelle tu acceptes de te tromper. Le calcul standard sur deux proportions donne n par variante = [z(α/2) × √(2 p̄ (1 − p̄)) + z(β) × √(p1(1 − p1) + p2(1 − p2))]² ÷ (p2 − p1)², où z(α/2) = 1,96 pour un test bilatéral à 5 % et z(β) = 0,84 pour une puissance de 80 %, 1,28 pour 90 %. Sur une référence de 3 %, cela donne 2 518 visiteurs par variante pour détecter un gain relatif de 50 % à 80 % de puissance, 9 100 pour 25 %, 53 211 pour 10 % et 207 938 pour 5 %. Comme l'écart figure au dénominateur au carré, diviser par deux le gain visé multiplie le trafic nécessaire par environ quatre. Tout le problème de planification est là : un gain de 5 % réclame 416 000 visiteurs sur les deux bras, soit plus de 41 semaines à 10 000 visiteurs par semaine. Fixe cet horizon avant de lancer et n'arrête pas dès que le résultat devient significatif — regarder à répétition et s'arrêter au premier franchissement fait passer le taux de faux positifs de 5 % à environ 15 % après cinq coups d'œil et environ 20 % après dix.
La taille d'échantillon dépend de ton taux de conversion de référence et du gain relatif à détecter — et elle explose quand ce gain se réduit. Voici la formule, un tableau complet à 3 % de référence, et pourquoi arrêter tôt casse le test.
Quatre paramètres, et tu les choisis tous
Une taille d'échantillon ne se découvre pas, elle se spécifie. Quatre nombres entrent. Le taux de conversion de référence est celui que tu as déjà — mesure-le sur un nombre entier de semaines pour que le trafic de semaine et de week-end soient tous deux représentés. L'effet minimal détectable est la plus petite amélioration sur laquelle tu agirais vraiment, et il s'exprime normalement en gain relatif : un gain de 10 % sur une référence de 3 % signifie un taux de variante de 3,3 %. Le seuil de signification α est ta tolérance à déclarer un gagnant qui n'existe pas, conventionnellement 5 % bilatéral. Et la puissance est ta tolérance à rater un vrai gagnant, conventionnellement 80 %, soit une chance sur cinq de ne pas détecter un effet pourtant réel.
Celui que l'on se trompe le plus est l'effet minimal détectable, parce qu'il ressemble à un résultat plutôt qu'à un paramètre. Il n'en est pas un. C'est un engagement pris à l'avance : tu déclares qu'un gain inférieur à ce seuil ne vaut pas le trafic qu'il faudrait pour le prouver. Le choisir honnêtement est la chose la plus utile pour un programme de test, car le choisir avec optimisme produit des tests trop courts pour conclure, et le choisir timidement produit des tests que personne n'a le trafic de terminer.
La formule, chaque symbole nommé
Pour deux proportions indépendantes à groupes de taille égale, le résultat standard par approximation normale s'écrit n par variante = [z(α/2) × √(2 p̄ (1 − p̄)) + z(β) × √(p1(1 − p1) + p2(1 − p2))]² ÷ (p2 − p1)². Ici p1 est le taux de référence, p2 le taux de variante que tu veux pouvoir détecter, et p̄ leur moyenne, (p1 + p2) ÷ 2. Le terme z(α/2) est la valeur normale centrée réduite laissant α/2 dans chaque queue : 1,96 pour un test bilatéral à α = 0,05. Le terme z(β) est la valeur laissant β dans une queue, β valant un moins la puissance : 0,84 pour 80 % de puissance, 1,28 pour 90 %.
Deux faits structurels sortent directement de l'algèbre et valent plus que la formule elle-même. D'abord, l'écart p2 − p1 apparaît au carré au dénominateur : le trafic nécessaire varie donc comme l'inverse du carré de l'effet visé. Divise l'effet par deux et tu quadruples à peu près le trafic. Ensuite, passer de 80 % à 90 % de puissance multiplie l'exigence par un facteur fixe d'environ 1,34, quels que soient la référence et le gain, puisque la seule chose qui a changé est z(β) passant de 0,84 à 1,28. La confiance supplémentaire coûte cher, mais de façon prévisible ; un effet cible plus petit coûte cher d'une manière qui t'échappe.
À quelle vitesse cela explose, sur une référence de 3 %
Applique la formule à une référence de 3 % et la forme du problème saute aux yeux. Pour détecter un gain relatif de 50 % — de 3 % à 4,5 %, soit 1,50 point de pourcentage d'écart absolu — il faut 2 518 visiteurs par variante à 80 % de puissance, soit 5 036 au total. La moitié de deux jours de trafic à 10 000 par semaine. Pour un gain de 25 %, de 3 % à 3,75 %, l'écart tombe à 0,75 point et l'exigence bondit à 9 100 par variante, 18 200 au total, environ 1,8 semaine. Pour un gain de 10 %, de 3 % à 3,3 %, soit 0,30 point, il faut 53 211 par variante, 106 422 au total, plus de dix semaines. Et pour un gain de 5 %, de 3 % à 3,15 %, soit 0,15 point, il faut 207 938 par variante, 415 876 au total, plus de 41 semaines.
La référence compte autant que le gain, et dans le même sens : les pages qui convertissent peu sont chères à tester. Un gain relatif de 10 % demande 53 211 visiteurs par variante sur une référence de 3 %, mais seulement 14 751 sur 10 % et 3 763 sur 30 % — tandis que sur 1 %, il en faut 163 095. Les événements rares portent plus de bruit relatif : il faut observer plus longtemps pour le percer. C'est pourquoi les tests sur une étape de commande, qui tournent sur des pages à forte conversion, concluent en quelques jours, alors que les tests page d'accueil vers achat sur le même site ne concluent jamais.
Relatif ou absolu ? L'erreur qui divise un test par 463
Presque tous les outils de taille d'échantillon demandent l'effet sous l'une de deux formes, sans toujours préciser laquelle. Un gain relatif de 10 % sur une référence de 3 % signifie passer à 3,3 %. Une amélioration de 10 points de pourcentage sur la même référence signifie passer à 13 %. Ces deux nombres ne sont pas voisins : le premier réclame 53 211 visiteurs par variante, le second 115. Saisis le mauvais et ton test est 463 fois trop petit, atteindra sa taille prévue en un après-midi et rapportera le bruit qui traînait ce jour-là dans les données.
L'habitude qui l'évite ne coûte rien. Écris les deux formes avant de toucher au calculateur : le taux de référence, le taux de la variante et l'écart absolu en points de pourcentage. Si tu ne peux pas énoncer le taux de la variante comme un nombre, tu n'as pas spécifié d'effet. Cela discipline aussi la discussion avec les parties prenantes, car une demande de gain de 10 % paraît modeste jusqu'au moment où quelqu'un écrit noir sur blanc que cela veut dire passer de 3 % à 3,3 %, et que le prouver prend dix semaines de la totalité du trafic du site.
Le peeking : pourquoi « c'est devenu significatif » n'est pas un résultat
Le taux de faux positifs de 5 % promis par les tests de signification vaut pour un test, effectué une fois, sur un échantillon dont la taille était fixée d'avance. Surveille le tableau de bord chaque jour et arrête dès que la valeur p passe sous 0,05, et tu ne fais plus ce test-là. Tu exécutes une procédure qui reçoit de multiples occasions de franchir la ligne, et son taux d'erreur est la probabilité de la franchir au moins une fois — bien plus élevée.
L'ampleur de l'inflation est mesurable, et nous l'avons mesurée : un test A/A simulé — les deux bras exactement à 3 %, aucune différence réelle, 9 100 visiteurs par bras, 20 000 répétitions — a déclaré un gagnant dans 5,0 % des cas quand les données n'étaient examinées qu'une fois, à la fin. Examinées deux fois, 8,3 %. À cinq coups d'œil équirépartis, 14,6 %. À dix, 19,5 %. À vingt, 24,6 %. Ces chiffres reproduisent le profil publié par Armitage, McPherson et Rowe en 1969, et le phénomène continue : sous surveillance continue et sans règle d'arrêt, la probabilité de finir par franchir la ligne tend vers la certitude, même quand les deux variantes sont identiques. Une victoire sur cinq célébrée sur un tableau de bord consulté chaque jour pendant quinze jours n'est rien du tout.
Que faire à la place
Le correctif le plus simple consiste à fixer l'horizon et à le respecter. Calcule la taille d'échantillon avant le lancement, convertis-la en un nombre entier de semaines pour que chaque jour de la semaine soit représenté également, note cette date de fin, et lis le résultat une seule fois — à la fin. Tu peux regarder le tableau de bord entre-temps pour vérifier que le test est techniquement sain, que le trafic se répartit également et que rien n'est cassé. Tu ne peux pas arrêter sur ce que tu y vois. La distinction entre surveiller et décider est toute la protection.
Si tu as réellement besoin de pouvoir arrêter tôt — parce que la variante pourrait nuire au chiffre d'affaires, ou parce que le coût en trafic d'une exécution complète est prohibitif — utilise une méthode conçue pour cela plutôt que de casser celle que tu as. Les plans séquentiels groupés, dont les bornes de Pocock (1977) sont l'exemple classique, autorisent un nombre d'analyses déclaré à l'avance et répartissent ton budget d'erreur sur ces analyses en resserrant le seuil à chacune. Les approches séquentielles et bayésiennes proposées par plusieurs plateformes de test obtiennent le même résultat avec des bornes valides en continu. Toutes coûtent quelque chose : un seuil plus strict, un échantillon maximal plus grand, ou les deux. Ce coût est le prix honnête de la souplesse, et il est bien moindre que celui d'un programme qui déploie un quart de ses perdants comme des gagnants.
| Gain relatif à détecter | Taux de la variante | Par variante, puissance 80 % | Par variante, puissance 90 % | Semaines à 10 000/semaine, puissance 80 % |
|---|---|---|---|---|
| 50 % | 4,50 % | 2 518 | 3 370 | 0,5 |
| 25 % | 3,75 % | 9 100 | 12 182 | 1,8 |
| 10 % | 3,30 % | 53 211 | 71 233 | 10,6 |
| 5 % | 3,15 % | 207 938 | 278 370 | 41,6 |
Questions fréquentes
- Mon site n'a pas assez de trafic. Que puis-je tester ?
- Des changements plus gros, et des événements plus fréquents. Les deux leviers de la formule que tu maîtrises vraiment sont la taille de l'effet et le taux de référence. Tester la refonte complète d'une page plutôt que la couleur d'un bouton fait passer l'effet plausible de quelques pour cent à plusieurs dizaines, et un gain relatif de 50 % sur une référence de 3 % ne demande que 2 518 visiteurs par variante, contre 207 938 pour un gain de 5 %. Remonter l'événement mesuré dans l'entonnoir fait le même travail : un test mesuré sur l'ajout au panier, qui peut convertir à 10 %, demande 14 751 visiteurs par variante pour un gain de 10 %, contre 53 211 pour le même gain mesuré sur un taux d'achat de 3 %. Si aucune des deux options n'existe, déploie le changement sans test et juge-le en avant-après, mais appelle cela par son nom — une décision, pas une preuve.
- Faut-il choisir 80 % ou 90 % de puissance ?
- Quatre-vingts pour cent est la valeur par défaut, et l'amélioration coûte invariablement 34 % de trafic en plus : sur une référence de 3 % et un gain de 25 %, l'exigence passe de 9 100 à 12 182 visiteurs par variante, et pour un gain de 10 %, de 53 211 à 71 233. Le rapport ne change jamais, car seul z(β) a bougé, de 0,84 à 1,28. Achète la puissance supplémentaire quand un faux négatif coûte cher — quand la variante a mobilisé un quart du temps de l'équipe technique, quand la décision bloque une feuille de route, ou quand tu n'auras pas d'autre occasion de lancer ce test cette année. Reste à 80 % quand le changement est facile à réexaminer, car le trafic est mieux employé à un second test qu'à une troisième décimale de certitude sur le premier.
- Puis-je arrêter le test tôt si une variante gagne nettement ?
- Pas sur un plan à horizon fixe, non — c'est précisément le geste que ce plan ne peut pas absorber. Un test A/A simulé sans aucune différence réelle entre les bras a produit un résultat significatif dans 5,0 % des cas en lecture unique, 14,6 % à cinq coups d'œil et 19,5 % à dix. Une avance précoce est en outre la moins fiable qui soit, car les écarts sont les plus bruyants quand l'échantillon est le plus petit : un effet apparent énorme en semaine un est plus probablement un petit échantillon qu'un gros effet. Si l'arrêt anticipé est un vrai besoin et non de l'impatience, adopte un plan séquentiel groupé avec analyses intermédiaires déclarées et seuils ajustés, ou une plateforme qui publie des bornes valides en continu, et accepte l'échantillon maximal plus grand qui va avec.
- La taille d'échantillon désigne-t-elle des visiteurs ou des conversions ?
- Des visiteurs — plus précisément, les unités que tu as randomisées, comptées une fois chacune. Les chiffres du tableau sont des visiteurs par variante : 9 100 pour un gain de 25 % signifie 9 100 dans le témoin et 9 100 dans la variante, 18 200 au total. Randomise sur le visiteur, pas sur la session, sinon celui qui revient trois fois est compté trois fois et son comportement est corrélé entre ces visites, ce qui réduit discrètement ton échantillon réel sous le nombre que tu observes. Compte aussi le résultat de chaque visiteur une seule fois : un visiteur a converti pendant la fenêtre du test, ou non.
- Pourquoi un test doit-il durer un nombre entier de semaines ?
- Parce que les taux de conversion ont un rythme hebdomadaire et qu'un test s'arrêtant en milieu de semaine échantillonne ce rythme de façon déséquilibrée. Les visiteurs de semaine et de week-end diffèrent par l'intention, l'appareil et le temps disponible ; il en va de même autour d'une paie ou d'un envoi de newsletter hebdomadaire. Un test de onze jours donne à un week-end plus de poids qu'à l'autre dans l'arithmétique, ce qui ne se traduit par un écart entre bras que par hasard, mais se traduit de façon fiable par de l'instabilité dans le résultat. Arrondis la taille calculée au nombre entier de semaines supérieur, commence et termine le même jour de la semaine, et la saisonnalité s'annule entre les deux bras au lieu de fuir dans l'estimation.
Articles qui pourraient t'intéresser
Tous les guides →Outils similaires
Sources
- Journal of the Royal Statistical Society, Series A — Armitage, McPherson and Rowe (1969), Repeated Significance Tests on Accumulating Data
- Biometrika — Pocock (1977), Group Sequential Methods in the Design and Analysis of Clinical Trials
- Wiley — Fleiss, Levin and Paik, Statistical Methods for Rates and Proportions
Tu as repéré une erreur dans cet article ?