Aller au contenu
Kudos AI

La puissance et la malédiction du vainqueur

Pourquoi la taille d’échantillon se fixe avant le départ, ce que rapporte une expérience sous-dimensionnée quand elle atteint la significativité, et la raison pour laquelle diviser par deux l’effet visé quadruple le trafic nécessaire.

IntermédiaireModule 125 min · 100 XP
Une taille d’échantillon requise qui enfle à mesure que l’effet visé rétrécit, puis un nuage d’estimations d’expériences que le seuil de significativité balaie en ne gardant que la queue exagérée.

Deux expériences portent sur la même fonctionnalité. La première compte 14 751 utilisateurs par bras, trouve une hausse de 1,0 point et déploie. La seconde en compte 2 000, trouve une hausse de 2,4 points et déploie avec enthousiasme.

La seconde équipe est plus enthousiaste et plus dans l’erreur, et la raison relève de l’arithmétique plutôt que de la malchance.

Dimensionner le test

Supposons un taux de conversion de 10 % et une amélioration d’un point qui vous intéresserait. La taille par bras nécessaire pour avoir 80 % de chances de la détecter, au seuil habituel de 5 %, vaut

n≈(zα/22pˉ(1−pˉ)+zβp1(1−p1)+p2(1−p2))2(p2−p1)2n \approx \frac{\left(z_{\alpha/2}\sqrt{2\bar{p}(1-\bar{p})} + z_{\beta}\sqrt{p_1(1-p_1)+p_2(1-p_2)}\right)^2}{(p_2-p_1)^2}

soit 14 751 par bras. La forme qui compte est au dénominateur : l’effet est au carré.

effet à détecteréchantillon par bras
2,0 points3 841
1,0 point14 751
0,5 point57 763

Diviser l’effet par deux multiplie le trafic par 3,9. L’écart-type décroît en 1/n1/\sqrt{n} : résoudre un effet deux fois plus petit exige de diviser l’erreur par deux, ce qui demande quatre fois les données.

Ce seul fait réorganise la planification. La question n’est jamais « y a-t-il un effet » : il y a presque toujours un effet. La question est quel est le plus petit effet qui vaille la peine d’être détecté, car ce nombre fixe le coût de tout le test, et il revient à celui qui agira sur le résultat d’y répondre.

Ce que rapporte un test trop petit

Passons à la version sous-dimensionnée : 2 000 utilisateurs par bras, face à la même hausse réelle d’un point. Sa puissance est de 17,8 % : elle rate quatre fois sur cinq. Cette partie est attendue et n’est pas le problème.

Le problème est ce qui se produit sur les tirages qui atteignent la significativité. Sur 20 000 expériences simulées, l’effet mesuré moyen parmi les significatives vaut 2,38 fois la vérité. Et 0,8 % d’entre elles sont significatives dans le mauvais sens.

L’estimateur n’a rien de fautif. Moyenné sur les 20 000 tirages il est sans biais : l’estimation moyenne est l’effet réel. Ce qui est biaisé, c’est la moyenne sur le sous-ensemble qui a franchi un filtre, et ce filtre est « l’estimation était assez grande pour dépasser le seuil ». À faible puissance, dépasser le seuil exige que le bruit ait aidé.

C’est la malédiction du vainqueur, et c’est pourquoi un résultat enthousiasmant issu d’un petit test rétrécit si fidèlement quand on le reproduit à grande échelle.

La figure ci-dessous calcule tout cela en forme close plutôt que par simulation : l'exagération bouge donc continûment quand vous faites glisser la taille d'échantillon. Elle s'ouvre sur le test trop petit : 2 000 par groupe, 17,8 % de puissance, des gagnants qui surestiment la vérité d'un facteur 2,39, et 0,8 % d'entre eux significatifs à l'envers. Remontez le curseur jusqu'à 14 751 et deux choses arrivent ensemble. L'exagération s'effondre vers un, et la puissance affichée revient exactement à 80,0 % : la formule de dimensionnement et ce calcul s'accordent sur le même seuil.

Interactif : ce qu’un petit test annonce quand il gagne

Exact, non simulé. Le filtre est « assez grand pour franchir la barre ».

3x1x50060,000
Puissance
17.8%
Exagération
2.39x
Significatif, mauvais sens
0.8%
Requis pour 80 %
14,751
taux de baseeffet réel

À 2,000 par groupe, ce test trouve l’effet 17.8% du temps, et ce n’est pas le problème. Le problème est ce que disent les essais gagnants : en moyenne 2.39 fois l’effet réel, et 0.8% d’entre eux sont significatifs dans le mauvais sens. L’estimateur n’a rien de faux : sur l’ensemble des essais il est sans biais. Ce qui est biaisé, c’est la moyenne sur ceux qui ont passé un filtre. Le qualifier de préliminaire n’y change rien ; le dimensionner à 14,751 si.

Pourquoi « préliminaire » n’est pas une défense

La réponse habituelle consiste à qualifier le petit test de préliminaire et à traiter son chiffre comme indicatif. Cela ne fonctionne pas, pour une raison qui mérite d’être dite franchement.

Une expérience sous-dimensionnée n’est pas une version bruitée d’une bonne expérience. C’est une machine qui, chaque fois qu’elle parle, parle avec un nombre gravement gonflé et un intervalle de confiance d’apparence parfaitement saine autour. L’intervalle est correct au sens où il couvrirait la vérité 95 % du temps sur l’ensemble des tirages, mais vous ne regardez pas l’ensemble des tirages : vous regardez ceux qui étaient assez intéressants pour être rapportés.

La séquence est donc fixée :

  1. décider du plus petit effet sur lequel on agirait, avec celui qui agira
  2. calculer la taille d’échantillon qui le détecte
  3. si le trafic n’existe pas, attendre, élargir la population, réduire la variance (troisième leçon), ou ne pas lancer le test

Ne pas lancer un test est une issue légitime. En lancer un qui ne peut que tromper ne l’est pas.

Une note sur l’autre direction

La puissance est symétrique d’une façon qu’on oublie. Un test de puissance 17,8 % qui ne trouve rien ne vous a presque rien appris : l’absence de résultat significatif est parfaitement compatible avec l’effet que vous espériez. Rapporter cela comme « pas d’effet » est la même erreur en sens inverse.

Le compte rendu honnête d’un résultat nul est l’intervalle de confiance. « La hausse valait 0,2 point, intervalle à 95 % de −1,7 à 2,1 » dit clairement que l’expérience n’a pas su distinguer un gain important d’une perte importante. « Pas de différence significative » masque tout cela.

Ce que cela prépare

Bien dimensionner protège d’un mode de défaillance. La leçon suivante traite de celui qui survit à n’importe quelle taille d’échantillon : une expérience consultée à répétition, ou lue sur assez de métriques, finit par produire un vainqueur même quand il ne se passe strictement rien.

Références et lectures complémentaires

  • Ron Kohavi, Diane Tang, Ya Xu, Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing, Cambridge University Press, 2020· Bibliothèque de référence Kudos AI
  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Débloquez tout le parcours

Cette première leçon est gratuite. Inscrivez-vous pour passer le quiz de maîtrise, gagner de l’XP et débloquer tous les modules, avec d’autres exemples interactifs et exécutables.