Aller au contenu
Kudos AI
Read in English
Causal Inférence

Le traitement qui aide tout le monde et nuit à la moyenne

Un traitement qui augmente la guérison d'exactement cinq points dans chaque sous-groupe tout en semblant l'abaisser globalement, pourquoi plus de données rend cette conclusion plus assurée et non plus juste, ce que la randomisation achète et que l'ajustement ne peut pas, et le cas où contrôler une variable fabrique une association à partir de rien.

8 min de lectureKudos AI

Prérequis : Probability and Statistical Foundations

Deux piles de patients se séparant par gravité si bien que le bras traité se remplit des cas les plus durs, les taux internes restant à cinq points d'écart pendant que les barres globales se croisent, et deux causes indépendantes devenant dépendantes des qu'un effet commun est conditionné.

Voici une série de nombres. Tous sont exacts, aucun n'est un tour de passe-passe, et ensemble ils disent quelque chose qui semble impossible.

Un traitement est donné à 60 patients et refusé à 60 autres. Chez les cas graves il augmente la guérison de 0,3500,350 à 0,4000,400. Chez les cas légers, de 0,6500,650 à 0,7000,700. Cinq points, dans les deux groupes.

Globalement, les traités guérissent 0,5000,500 et les non traités 0,5500,550. Le traitement semble nuire.

Chaque patient appartient à exactement un de ces deux groupes. Le traitement a aidé dans les deux. Et il a abaissé le taux global des cinq points mêmes dont il relève chaque groupe.

D'où viennent les nombres

traitésnon traités
graves16 / 40 = 0,4000,4007 / 20 = 0,3500,350
légers14 / 20 = 0,7000,70026 / 40 = 0,6500,650
global30 / 60 = 0,5000,50033 / 60 = 0,5500,550

Vérifiez l'addition : 16+14=3016 + 14 = 30 sur 40+20=6040 + 20 = 60, et 7+26=337 + 26 = 33 sur 20+40=6020 + 40 = 60. Les deux bras comptent 60 patients : la comparaison globale n'est donc pas faussée par des tailles inégales.

Ce qui diffère, c'est qui se trouve dans chaque bras. Deux tiers des traités étaient graves ; seulement un tiers des non traités l'étaient. Et les patients graves guérissent moins souvent quoi qu'on leur fasse.

Le chiffre global ne compare donc pas le traitement. Il compare un groupe majoritairement grave à un groupe majoritairement léger, et la composition pèse plus que les cinq points apportés par le traitement.

Interactif : le même traitement, deux verdicts

Les quatre taux par groupe ne changent jamais.

traitésnon traités
graves16 / 4040.0%7 / 2035.0%
légers14 / 2070.0%26 / 4065.0%
agrégé30 / 6050.0%33 / 6055.0%
Différence agrégée
-5.0
Différence standardisée
+5.0
Verdict agrégé
nuit

Les chiffres agrégés disent que le traitement nuit, de 5.0 points - et il a aidé chez les cas graves et aidé chez les cas légers. Chaque patient appartient à exactement une de ces deux lignes. Rien n’a bougé dans les quatre cases du haut : la seule chose que vous avez changée, c’est qui se trouve dans chaque bras. Deux tiers des traités sont ici des cas graves contre un tiers des non traités, et les cas graves guérissent moins souvent quoi qu’on leur fasse : la comparaison agrégée mesure donc la composition et l’appelle un effet du traitement.

Le mécanisme à un nom et une forme

La gravité à influencé qui a été traité - les médecins ont donné le médicament aux patients qui en avaient besoin - et elle influence qui guérit. Une variable portant ces deux flèches est un facteur de confusion.

Les deux flèches sont nécessaires. Une variable n'agissant que sur le résultat, tel un facteur de risque que personne n'a consulté au moment de prescrire, coûte de la précision sans biaiser la comparaison. Une variable n'agissant que sur l'attribution, comme une pièce, est tout aussi inoffensive. Le dégât exige une cause commune.

La réparation, et ce qu'elle donne

La gravité ayant été enregistrée, on peut l'ajuster. Calculez l'effet dans chaque strate, puis moyennez sur une composition commune au lieu de celle que chaque bras avait :

0,5×0,400+0,5×0,700=0,550contre0,5×0,350+0,5×0,650=0,5000,5 \times 0,400 + 0,5 \times 0,700 = 0,550 \qquad\text{contre}\qquad 0,5 \times 0,350 + 0,5 \times 0,650 = 0,500

Une différence d'exactement +0,05+0,05 - les cinq points mêmes visibles dans chaque strate, et le signe oppose au −0,05-0,05 naïf.

Pourquoi ce n'est pas un problème de taille d'échantillon

C'est la partie à intérioriser, car elle sépare une difficulté statistique d'une difficulté causale.

Le bruit d'échantillonnage diminue à mesure que les données s'accumulent. La confusion, non. Elle est une propriété de la façon dont les données sont apparues : recueillir un million de patients de plus avec les mêmes habitudes de prescription produit un intervalle de confiance de plus en plus étroit autour de la mauvaise réponse - et du mauvais signe.

Rien de ce qui se calcule sur le tableau n'annonce laquelle des deux estimations est causale. Les deux sont de l'arithmétique correcte sur les mêmes données. Ce qui les distingue est la connaissance de la façon dont le traitement a été attribué, et cela vient de l'extérieur des données.

Ce que la randomisation achète

Prenez maintenant un monde voisin, et non celui du tableau : la moitié des patients graves, une guérison sans traitement de 0,50,5 pour les graves et de 0,80,8 pour les légers, et un bénéfice vrai fixé à exactement +0,1000+0,1000 par construction. Calculez-le deux fois, en ne changeant que celui qui décide du traitement - des médecins qui traitent 80 % des graves et 20 % des légers, ou une pièce :

attributionestimation naïve
les médecins choisissent, selon la gravité−0,0800-0,0800
une pièce choisit+0,1000+0,1000

Ce sont les valeurs exactes de la population ; une simulation de 1 500 essais du même monde tombe à quelques millièmes, vers −0,082-0,082 et +0,098+0,098.

Le traitement est identique dans les deux cas. Quand les médecins attribuent, la gravité passe dans la variable de traitement et l'estimation s'inverse. Quand une pièce attribue, aucune caractéristique du patient ne peut influencer le bras, et la comparaison naïve retrouve l'effet.

Voilà tout l'argument en faveur de la randomisation, et il est plus fort que l'ajustement d'une manière précise : l'ajustement ne peut traiter que les facteurs que vous connaissez et avez enregistrés, et l'affirmation que votre liste est complète ne se vérifie pas de l'intérieur des données. La randomisation coupe d'un coup la flèche de toute cause non mesurée, sans avoir a en nommer aucune.

Il vaut la peine d'être précis sur la promesse. La randomisation équilibre les bras en moyenne ; un petit essai peut encore être malchanceux, et c'est pourquoi les essais sont dimensionnés délibérément et les tableaux de départ examinés. Et elle protège exactement un point de la chaine : l'attribution. Si des patients abandonnent ensuite pour des raisons liées à leur traitement, les groupes restants sont de nouveau confondus, et c'est pourquoi les analyses sont spécifiées en intention de traiter.

Le monde est spécifié assez précisément pour qu'aucune des deux lignes n'ait besoin d'être simulée, et la figure ci-dessous calcule les deux : -0,08 quand la gravité décide et +0,10 quand c'est une pièce, soit les valeurs exactes du tableau ci-dessus. Le curseur est l'exercice. Rapprochez les deux probabilités d'attribution et la première ligne devient la seconde, car le biais vaut exactement le déséquilibre de gravité multiplié par l'écart de 0,3 entre les taux de base. Et cela n'a jamais exigé une pièce équilibrée : n'importe quelle probabilité commune suffit.

Interactif : le même monde, attribué deux fois

Forme close. Le traitement est identique à chaque lecture.

treateduntreated
Comparaison naïve
-0.0800
Ajusté pour la gravité
+0.1000
Effet réel
+0.1000
Déséquilibre de gravité
+0.6000
Graves parmi les traités
80%
Graves parmi les non traités
20%

La gravité décide de l’attribution : le bras traité est 80% grave contre 20% dans l’autre, soit un déséquilibre de +0.6000. La comparaison naïve donne -0.0800 pour un effet réel de +0.1000. Le biais vaut exactement le déséquilibre multiplié par l’écart de 0,3 entre les taux de base.

L'ajustement qui aggrave les choses

La leçon jusqu'ici sonne comme « ajustez sur ce que vous pouvez ». C'est la que beaucoup d'analyses dérapent, car certains ajustements créent du biais.

Prenez deux causes réellement indépendantes - chacune survenant avec probabilité 1/21/2, sans aucun lien. Supposez qu'un cas soit admis dans une étude quand l'une ou l'autre cause est présente.

Parmi les admis :

  • la probabilité de la première cause vaut 2/32/3
  • mais sachant que la seconde est aussi présente, elle tombe à 1/21/2

La probabilité jointe parmi les admis vaut 1/31/3, tandis que le produit des marginales vaut 4/94/9. L'indépendance à disparu.

Rien n'a changé dans le monde. Conditionner sur un effet commun - un collider - a fabriqué une dépendance entre des causes qui n'en avaient aucune. Intuitivement : sachant qu'un cas a été admis, apprendre qu'une cause était présente explique l'admission et rend l'autre moins probable.

Voilà pourquoi « contrôlez tout ce que vous avez mesuré » n'est pas un bon conseil, et pourquoi ajouter des variables à une régression est une affirmation causale et non une précaution.

La figure ci-dessous vérifie un choix de contrôles dans les deux sens à la fois. Le côté graphe applique la d-séparation aux chemins énumérés ; le côté arithmétique applique la formule d’ajustement à la loi jointe. Aucun ne consulte l’autre, et ils ne se contredisent jamais. Ajoutez le collisionneur et regardez un critère échouer et une estimation bouger du même clic ; ajoutez ensuite le facteur de confusion, et constatez que le dégât demeure, car un mauvais contrôle n’est pas annulé par un bon.

Interactif : chaque contrôle est une affirmation causale

Le critère graphique et l’arithmétique sont calculés séparément. Ils concordent toujours.

Zfacteur de confusionTtraitementYrésultatCcollisionneur
Estimation
0.5400
Effet réel
0.3000
Erreur
0.2400
Critère de porte dérobée
non satisfait

Contrôler pour

Le chemin T - Z - Y reste ouvert : de l’association non causale continue d’y circuler et l’estimation se trompe de 0.2400. Z augmente la probabilité d’être traité et augmente le résultat par lui-même, donc le groupe traité aurait mieux fait de toute façon. Contrôler pour Z bloque la fourche et l’arithmétique tombe exactement sur la vérité.

La règle, et son prix

Dessiner les hypothèses en graphe rend la distinction lisible. Trois formes couvrent l'essentiel :

  • fourche (T←Z→YT \leftarrow Z \rightarrow Y) : une cause commune. Ajustez sur ZZ - c'est la confusion.
  • chaine (T→M→YT \rightarrow M \rightarrow Y) : un médiateur. Ajuster sur MM retiré une partie de l'effet même que vous mesurez.
  • collider (T→C←YT \rightarrow C \leftarrow Y) : un effet commun. Ajuster sur CC crée une association fallacieuse.

Le critère de porte dérobée en fait une règle : ajustez sur un ensemble de variables qui bloque tout chemin entrant dans le traitement par l'arrière et ne contient aucun descendant du traitement, afin de ne retirer aucun médiateur ni d'ouvrir aucun collider.

Quand les hypothèses tiennent, le résultat est exact et non approche. Dans un monde bâti pour que l'effet vrai vaille exactement 0,2000000,200000, la comparaison naïve donne 0,3753250,375325 - surestimant de 0,1753250,175325 - et l'ajustement par porte dérobée renvoie 0,2000000,200000 exactement. Les deux chiffres sont calcules en fractions exactes sans aucun échantillonnage : cet écart est du biais, non du bruit.

Le prix est l'honnêteté sur ce qui fondé les flèches. La corrélation est symétrique, la causalité ne l'est pas : plusieurs graphes différents peuvent engendrer le même tableau. Le graphe ne se lit pas dans les données ; il leur est apporté depuis la connaissance du fonctionnement des choses.

C'est une qualité. Cela force l'hypothèse au grand jour, ou elle peut être discutée, au lieu de la laisser implicite dans une liste de contrôles.

Ce qu'il faut emporter

Une comparaison entre traités et non traités ne répond à la question causale que si les groupes étaient par ailleurs semblables. Quand ils ne l'étaient pas, l'estimation n'est pas seulement imprécise - elle peut pointer dans le mauvais sens, et plus de données la rendra plus assurée plutôt que plus juste.

La question la plus utile devant tout résultat observationnel n'est donc ni quel test a été mène ni quelle était la taille de l'échantillon. C'est : comment ces groupes se sont-ils formes ?

Le parcours Inférence causale travaille les trois arguments en détail, avec chaque calcul exécutable et modifiable dans le navigateur.

Références et lectures complémentaires

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Lecture associée

4 min de lectureCausal Inférence

La variable de contrôle qui invente une relation

Deux causes indépendantes et un effet commun. Contrôlez l’effet et les causes acquièrent une corrélation d’exactement -1 : une régression de A sur B donne un coefficient de +0,0030, et ajouter l’effet commun comme contrôle le transforme en -1,0000. La sélection d’un échantillon fait la même chose de manière invisible, et c’est pourquoi « contrôlez tout ce que vous avez mesuré » n’est pas une règle défendable.

Statistique
6 min de lectureApprentissage non supervisé

La direction qui change quand vous changez d’unité

Douze personnes, deux mesures, et trois premières composantes principales différentes : en millimètres la réponse est presque uniquement la taille, en mètres presque uniquement le poids, et en centimètres un mélange équilibré - la corrélation restant fixée à 0,9500 dans les trois cas. Ce que cela dit de ce que l’ACP maximise, pourquoi une proportion de variance expliquée de 99,999 % peut être un énoncé sur les mètres plutôt que sur les personnes, et ce que la standardisation choisit réellement.

Apprentissage automatiqueStatistique
4 min de lectureTime Series

Un score qui perd contre ne rien faire

Un modèle des cinq plus proches voisins obtient 0,9983 en validation croisée aléatoire à cinq blocs sur une marche aléatoire, série dont les incréments sont par construction imprévisibles. Évalué en avançant dans le temps il obtient 0,6559, avec une RMSE 12,44 fois plus grande, et il perd contre la simple reconduction de la dernière valeur observée. C’est la découpe, non le modèle, qui a produit le premier nombre.

StatistiqueApprentissage automatique
← Retour à tous les articles