La variable de contrôle qui invente une relation
Deux causes indépendantes et un effet commun. Contrôlez l’effet et les causes acquièrent une corrélation d’exactement -1 : une régression de A sur B donne un coefficient de +0,0030, et ajouter l’effet commun comme contrôle le transforme en -1,0000. La sélection d’un échantillon fait la même chose de manière invisible, et c’est pourquoi « contrôlez tout ce que vous avez mesuré » n’est pas une règle défendable.
Prérequis : Le traitement qui aide tout le monde et nuit à la moyenne
Voici tout le dispositif. Deux causes, indépendantes l’une de l’autre, et un effet qu’elles produisent toutes deux :
est un collisionneur : les flèches y entrent en collision. Rien ne relie à ; ce qui a engendré l’un ignorait tout de l’autre.
Contrôlez maintenant . Mettez-le dans la régression, ou stratifiez dessus, ou - le cas qui piège - constituez un échantillon où il est maintenu fixe.
A. La version binaire, exactement
Soit et deux tirages à pile ou face indépendants et équitables, et . Trois quarts de la population ont . Parmi eux :
La corrélation entre et vaut dans la population et dès qu’on conditionne à . Le raisonnement se fait de tête : si l’alarme a sonné et que ce n’était pas , c’était forcément . Connaître vous renseigne désormais sur , parce qu’on vous a déjà dit que l’un des deux s’était déclenché.
B. La version continue, et une régression
Soit et des lois normales centrées réduites indépendantes et . Sur 200 000 tirages :
| Régression | coefficient sur |
|---|---|
| sur | |
| sur et |
Ajouter une seule variable de contrôle fait passer un coefficient d’indiscernable-de-zéro à exactement moins un. Ce n’est pas un artefact d’échantillonnage : la corrélation partielle est exacte, car et
En se restreignant aux observations dont le est proche de zéro, on obtient sur 5 606 points : la même chose, faite par sélection plutôt que par ajustement.
C. Sélectionner, c’est conditionner, et cela ne se voit pas
La version par régression laisse au moins une trace : quelqu’un a choisi d’ajouter . La version par sélection n’en laisse aucune, car le conditionnement a eu lieu avant l’arrivée des données.
- Patients admis. Deux affections indépendantes augmentent chacune la probabilité d’admission. Parmi les admis, elles paraissent négativement associées, et l’une semble protéger de l’autre.
- Candidats recrutés. Si les entretiens pèsent l’expérience et les résultats aux tests, et que la barre est une combinaison des deux, alors parmi les recrutés les deux sont négativement corrélés même s’ils sont sans rapport dans le vivier. Toute remarque du type « nos meilleurs ingénieurs n’avaient pas les meilleurs scores » a ceci pour première explication candidate.
- Startups à succès, articles publiés, produits survivants. Tout échantillon défini par un seuil sur un résultat qu’alimentent plusieurs causes.
Le signe est toujours le même : la population d’analyse a été choisie en utilisant quelque chose situé en aval des variables comparées.
D. Ce qui en découle en pratique
- « Contrôlez tout ce que vous avez mesuré » n’est pas une règle, c’est un tirage à pile ou face. Ajuster sur un facteur de confusion supprime un biais ; ajuster sur un collisionneur en crée un. Les deux sont indiscernables dans les données et ne se distinguent que par la structure causale que vous acceptez d’énoncer.
- Dessinez le graphe avant de choisir les covariables. Il n’a pas besoin d’être juste dans le détail pour être utile ; il doit dire quelles variables sont en amont du traitement et lesquelles sont en aval du résultat.
- N’ajustez jamais sur quoi que ce soit causé par le résultat ou par le traitement. Cette seule interdiction couvre la plupart de ces cas, y compris toute la famille des « variables post-traitement ».
- Dites comment l’échantillon a été sélectionné, à chaque fois. Si la règle de sélection fait intervenir un résultat, l’analyse conditionne sur un collisionneur, que quelqu’un ait écrit une variable de contrôle ou non.
La figure réunit les deux sur un même graphe traitement-résultat, avec un facteur de confusion Z et un collisionneur C. Sous Contrôler pour, choisir Z supprime le biais, et ajouter C le fait revenir.
Interactif : chaque contrôle est une affirmation causale
Le critère graphique et l’arithmétique sont calculés séparément. Ils concordent toujours.
- Estimation
- 0.5400
- Effet réel
- 0.3000
- Erreur
- 0.2400
- Critère de porte dérobée
- non satisfait
Contrôler pour
Le chemin T - Z - Y reste ouvert : de l’association non causale continue d’y circuler et l’estimation se trompe de 0.2400. Z augmente la probabilité d’être traité et augmente le résultat par lui-même, donc le groupe traité aurait mieux fait de toute façon. Contrôler pour Z bloque la fourche et l’arithmétique tombe exactement sur la vérité.
Références et lectures complémentaires
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.