Le traitement qui aide tout le monde et nuit à la moyenne
Un traitement qui augmente la guérison d'exactement cinq points dans chaque sous-groupe tout en semblant l'abaisser globalement, pourquoi plus de données rend cette conclusion plus assurée et non plus juste, ce que la randomisation achète et que l'ajustement ne peut pas, et le cas où contrôler une variable fabrique une association à partir de rien.
Prérequis : Probability and Statistical Foundations
Voici une série de nombres. Tous sont exacts, aucun n'est un tour de passe-passe, et ensemble ils disent quelque chose qui semble impossible.
Un traitement est donné à 60 patients et refusé à 60 autres. Chez les cas graves il augmente la guérison de à . Chez les cas légers, de à . Cinq points, dans les deux groupes.
Globalement, les traités guérissent et les non traités . Le traitement semble nuire.
Chaque patient appartient à exactement un de ces deux groupes. Le traitement a aidé dans les deux. Et il a abaissé le taux global des cinq points mêmes dont il relève chaque groupe.
D'où viennent les nombres
| traités | non traités | |
|---|---|---|
| graves | 16 / 40 = | 7 / 20 = |
| légers | 14 / 20 = | 26 / 40 = |
| global | 30 / 60 = | 33 / 60 = |
Vérifiez l'addition : sur , et sur . Les deux bras comptent 60 patients : la comparaison globale n'est donc pas faussée par des tailles inégales.
Ce qui diffère, c'est qui se trouve dans chaque bras. Deux tiers des traités étaient graves ; seulement un tiers des non traités l'étaient. Et les patients graves guérissent moins souvent quoi qu'on leur fasse.
Le chiffre global ne compare donc pas le traitement. Il compare un groupe majoritairement grave à un groupe majoritairement léger, et la composition pèse plus que les cinq points apportés par le traitement.
Interactif : le même traitement, deux verdicts
Les quatre taux par groupe ne changent jamais.
| traités | non traités | |
|---|---|---|
| graves | 16 / 4040.0% | 7 / 2035.0% |
| légers | 14 / 2070.0% | 26 / 4065.0% |
| agrégé | 30 / 6050.0% | 33 / 6055.0% |
- Différence agrégée
- -5.0
- Différence standardisée
- +5.0
- Verdict agrégé
- nuit
Les chiffres agrégés disent que le traitement nuit, de 5.0 points - et il a aidé chez les cas graves et aidé chez les cas légers. Chaque patient appartient à exactement une de ces deux lignes. Rien n’a bougé dans les quatre cases du haut : la seule chose que vous avez changée, c’est qui se trouve dans chaque bras. Deux tiers des traités sont ici des cas graves contre un tiers des non traités, et les cas graves guérissent moins souvent quoi qu’on leur fasse : la comparaison agrégée mesure donc la composition et l’appelle un effet du traitement.
Le mécanisme à un nom et une forme
La gravité à influencé qui a été traité - les médecins ont donné le médicament aux patients qui en avaient besoin - et elle influence qui guérit. Une variable portant ces deux flèches est un facteur de confusion.
Les deux flèches sont nécessaires. Une variable n'agissant que sur le résultat, tel un facteur de risque que personne n'a consulté au moment de prescrire, coûte de la précision sans biaiser la comparaison. Une variable n'agissant que sur l'attribution, comme une pièce, est tout aussi inoffensive. Le dégât exige une cause commune.
La réparation, et ce qu'elle donne
La gravité ayant été enregistrée, on peut l'ajuster. Calculez l'effet dans chaque strate, puis moyennez sur une composition commune au lieu de celle que chaque bras avait :
Une différence d'exactement - les cinq points mêmes visibles dans chaque strate, et le signe oppose au naïf.
Pourquoi ce n'est pas un problème de taille d'échantillon
C'est la partie à intérioriser, car elle sépare une difficulté statistique d'une difficulté causale.
Le bruit d'échantillonnage diminue à mesure que les données s'accumulent. La confusion, non. Elle est une propriété de la façon dont les données sont apparues : recueillir un million de patients de plus avec les mêmes habitudes de prescription produit un intervalle de confiance de plus en plus étroit autour de la mauvaise réponse - et du mauvais signe.
Rien de ce qui se calcule sur le tableau n'annonce laquelle des deux estimations est causale. Les deux sont de l'arithmétique correcte sur les mêmes données. Ce qui les distingue est la connaissance de la façon dont le traitement a été attribué, et cela vient de l'extérieur des données.
Ce que la randomisation achète
Prenez maintenant un monde voisin, et non celui du tableau : la moitié des patients graves, une guérison sans traitement de pour les graves et de pour les légers, et un bénéfice vrai fixé à exactement par construction. Calculez-le deux fois, en ne changeant que celui qui décide du traitement - des médecins qui traitent 80 % des graves et 20 % des légers, ou une pièce :
| attribution | estimation naïve |
|---|---|
| les médecins choisissent, selon la gravité | |
| une pièce choisit |
Ce sont les valeurs exactes de la population ; une simulation de 1 500 essais du même monde tombe à quelques millièmes, vers et .
Le traitement est identique dans les deux cas. Quand les médecins attribuent, la gravité passe dans la variable de traitement et l'estimation s'inverse. Quand une pièce attribue, aucune caractéristique du patient ne peut influencer le bras, et la comparaison naïve retrouve l'effet.
Voilà tout l'argument en faveur de la randomisation, et il est plus fort que l'ajustement d'une manière précise : l'ajustement ne peut traiter que les facteurs que vous connaissez et avez enregistrés, et l'affirmation que votre liste est complète ne se vérifie pas de l'intérieur des données. La randomisation coupe d'un coup la flèche de toute cause non mesurée, sans avoir a en nommer aucune.
Il vaut la peine d'être précis sur la promesse. La randomisation équilibre les bras en moyenne ; un petit essai peut encore être malchanceux, et c'est pourquoi les essais sont dimensionnés délibérément et les tableaux de départ examinés. Et elle protège exactement un point de la chaine : l'attribution. Si des patients abandonnent ensuite pour des raisons liées à leur traitement, les groupes restants sont de nouveau confondus, et c'est pourquoi les analyses sont spécifiées en intention de traiter.
Le monde est spécifié assez précisément pour qu'aucune des deux lignes n'ait besoin d'être simulée, et la figure ci-dessous calcule les deux : -0,08 quand la gravité décide et +0,10 quand c'est une pièce, soit les valeurs exactes du tableau ci-dessus. Le curseur est l'exercice. Rapprochez les deux probabilités d'attribution et la première ligne devient la seconde, car le biais vaut exactement le déséquilibre de gravité multiplié par l'écart de 0,3 entre les taux de base. Et cela n'a jamais exigé une pièce équilibrée : n'importe quelle probabilité commune suffit.
Interactif : le même monde, attribué deux fois
Forme close. Le traitement est identique à chaque lecture.
- Comparaison naïve
- -0.0800
- Ajusté pour la gravité
- +0.1000
- Effet réel
- +0.1000
- Déséquilibre de gravité
- +0.6000
- Graves parmi les traités
- 80%
- Graves parmi les non traités
- 20%
La gravité décide de l’attribution : le bras traité est 80% grave contre 20% dans l’autre, soit un déséquilibre de +0.6000. La comparaison naïve donne -0.0800 pour un effet réel de +0.1000. Le biais vaut exactement le déséquilibre multiplié par l’écart de 0,3 entre les taux de base.
L'ajustement qui aggrave les choses
La leçon jusqu'ici sonne comme « ajustez sur ce que vous pouvez ». C'est la que beaucoup d'analyses dérapent, car certains ajustements créent du biais.
Prenez deux causes réellement indépendantes - chacune survenant avec probabilité , sans aucun lien. Supposez qu'un cas soit admis dans une étude quand l'une ou l'autre cause est présente.
Parmi les admis :
- la probabilité de la première cause vaut
- mais sachant que la seconde est aussi présente, elle tombe à
La probabilité jointe parmi les admis vaut , tandis que le produit des marginales vaut . L'indépendance à disparu.
Rien n'a changé dans le monde. Conditionner sur un effet commun - un collider - a fabriqué une dépendance entre des causes qui n'en avaient aucune. Intuitivement : sachant qu'un cas a été admis, apprendre qu'une cause était présente explique l'admission et rend l'autre moins probable.
Voilà pourquoi « contrôlez tout ce que vous avez mesuré » n'est pas un bon conseil, et pourquoi ajouter des variables à une régression est une affirmation causale et non une précaution.
La figure ci-dessous vérifie un choix de contrôles dans les deux sens à la fois. Le côté graphe applique la d-séparation aux chemins énumérés ; le côté arithmétique applique la formule d’ajustement à la loi jointe. Aucun ne consulte l’autre, et ils ne se contredisent jamais. Ajoutez le collisionneur et regardez un critère échouer et une estimation bouger du même clic ; ajoutez ensuite le facteur de confusion, et constatez que le dégât demeure, car un mauvais contrôle n’est pas annulé par un bon.
Interactif : chaque contrôle est une affirmation causale
Le critère graphique et l’arithmétique sont calculés séparément. Ils concordent toujours.
- Estimation
- 0.5400
- Effet réel
- 0.3000
- Erreur
- 0.2400
- Critère de porte dérobée
- non satisfait
Contrôler pour
Le chemin T - Z - Y reste ouvert : de l’association non causale continue d’y circuler et l’estimation se trompe de 0.2400. Z augmente la probabilité d’être traité et augmente le résultat par lui-même, donc le groupe traité aurait mieux fait de toute façon. Contrôler pour Z bloque la fourche et l’arithmétique tombe exactement sur la vérité.
La règle, et son prix
Dessiner les hypothèses en graphe rend la distinction lisible. Trois formes couvrent l'essentiel :
- fourche () : une cause commune. Ajustez sur - c'est la confusion.
- chaine () : un médiateur. Ajuster sur retiré une partie de l'effet même que vous mesurez.
- collider () : un effet commun. Ajuster sur crée une association fallacieuse.
Le critère de porte dérobée en fait une règle : ajustez sur un ensemble de variables qui bloque tout chemin entrant dans le traitement par l'arrière et ne contient aucun descendant du traitement, afin de ne retirer aucun médiateur ni d'ouvrir aucun collider.
Quand les hypothèses tiennent, le résultat est exact et non approche. Dans un monde bâti pour que l'effet vrai vaille exactement , la comparaison naïve donne - surestimant de - et l'ajustement par porte dérobée renvoie exactement. Les deux chiffres sont calcules en fractions exactes sans aucun échantillonnage : cet écart est du biais, non du bruit.
Le prix est l'honnêteté sur ce qui fondé les flèches. La corrélation est symétrique, la causalité ne l'est pas : plusieurs graphes différents peuvent engendrer le même tableau. Le graphe ne se lit pas dans les données ; il leur est apporté depuis la connaissance du fonctionnement des choses.
C'est une qualité. Cela force l'hypothèse au grand jour, ou elle peut être discutée, au lieu de la laisser implicite dans une liste de contrôles.
Ce qu'il faut emporter
Une comparaison entre traités et non traités ne répond à la question causale que si les groupes étaient par ailleurs semblables. Quand ils ne l'étaient pas, l'estimation n'est pas seulement imprécise - elle peut pointer dans le mauvais sens, et plus de données la rendra plus assurée plutôt que plus juste.
La question la plus utile devant tout résultat observationnel n'est donc ni quel test a été mène ni quelle était la taille de l'échantillon. C'est : comment ces groupes se sont-ils formes ?
Le parcours Inférence causale travaille les trois arguments en détail, avec chaque calcul exécutable et modifiable dans le navigateur.
Références et lectures complémentaires
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.