La confusion et le renversement
Un traitement qui aide de la meme marge dans chaque sous-groupe tout en paraissant nuire globalement, le mecanisme qui produit cela, et la standardisation qui retrouve la bonne reponse.
Commencez par des nombres qui semblent impossibles, et résistez à l'envie de chercher l'erreur de calcul. Il n'y en a pas.
Le tableau
Un traitement est donné à 60 patients et refusé à 60 autres.
| traités | non traités | |
|---|---|---|
| graves | 16 / 40 = | 7 / 20 = |
| légers | 14 / 20 = | 26 / 40 = |
| global | 30 / 60 = | 33 / 60 = |
Chez les cas graves, le traitement augmente la guérison de cinq points. Chez les cas légers, de cinq points également. Globalement, les traités font cinq points de moins.
Chaque patient appartient à exactement une strate. Les deux bras comptent 60 patients : il ne s'agit donc pas de tailles de groupes inégales. L'addition est juste.
Ce que le chiffre global compare vraiment
Regardez qui se trouve dans chaque bras.
- sur les 60 traités, 40 étaient graves - deux tiers
- sur les 60 non traités, 20 étaient graves - un tiers
Les médecins ont donné le médicament aux patients qui en avaient besoin, ce que ferait tout clinicien consciencieux. La conséquence est que le bras traité est chargé des cas les plus difficiles.
Les patients graves guérissent moins souvent quoi qu'on leur fasse. La comparaison globale ne mesure donc pas le traitement : elle compare un groupe majoritairement grave à un groupe majoritairement léger, et cette différence de composition pèse plus que les cinq points apportés par le traitement.
Interactif : le même traitement, deux verdicts
Les quatre taux par groupe ne changent jamais.
| traités | non traités | |
|---|---|---|
| graves | 16 / 4040.0% | 7 / 2035.0% |
| légers | 14 / 2070.0% | 26 / 4065.0% |
| agrégé | 30 / 6050.0% | 33 / 6055.0% |
- Différence agrégée
- -5.0
- Différence standardisée
- +5.0
- Verdict agrégé
- nuit
Les chiffres agrégés disent que le traitement nuit, de 5.0 points - et il a aidé chez les cas graves et aidé chez les cas légers. Chaque patient appartient à exactement une de ces deux lignes. Rien n’a bougé dans les quatre cases du haut : la seule chose que vous avez changée, c’est qui se trouve dans chaque bras. Deux tiers des traités sont ici des cas graves contre un tiers des non traités, et les cas graves guérissent moins souvent quoi qu’on leur fasse : la comparaison agrégée mesure donc la composition et l’appelle un effet du traitement.
La confusion, et les deux flèches qu'elle exige
La gravité a fait deux choses à la fois :
- elle à influencé qui a été traité
- elle influence qui guérit
Une variable qui fait les deux est un facteur de confusion, et les deux flèches sont requises.
Une variable n'agissant que sur le résultat - un facteur de risque que personne n'a consulté au moment de prescrire - coûte de la précision sans biaiser la comparaison, puisqu'elle se répartit également entre les bras. Une variable n'agissant que sur l'attribution, comme une pièce de monnaie, est inoffensive pour la même raison.
C'est la cause commune qui fait les dégâts, et c'est pourquoi la question qui compte devant toute comparaison observationnelle est : comment ces groupes se sont-ils formes ?
Standardiser
Comme la gravité a été enregistrée, on peut l'ajuster. Le chiffre global moyenne la guérison de chaque bras sur la composition propre à ce bras. Moyennez plutôt les taux internes sur une composition commune :
Une différence d'exactement : les cinq points mêmes visibles dans chaque strate, et le signe oppose au naïf.
Pourquoi plus de données n'aide pas
C'est le point qui sépare un problème statistique d'un problème causal, et il mérite d'être dit sans détour.
Le bruit d'échantillonnage diminue quand l'échantillon grandit. La confusion, non. Elle est une propriété de la façon dont les données sont apparues, pas de leur quantité.
Menez la même étude sur un million de patients avec les mêmes habitudes de prescription : l'estimation naïve converge - vers . Vous obtenez un intervalle de confiance étroit autour d'un nombre au mauvais signe, et toutes les vérifications habituelles auront l'air saines.
Remarquez aussi ce que les données ne peuvent pas dire. L'estimation naïve et l'estimation standardisée sont toutes deux des calculs corrects sur le même tableau. Rien à l'intérieur n'annonce laquelle répond à la question causale. Ce jugement vient de la connaissance de la façon dont le traitement a été attribué, c'est-à-dire du monde et non des nombres.
Ce que cela prépare
La standardisation a fonctionné parce que la gravité avait été enregistrée. C'est le cas favorable, et il repose sur une affirmation invérifiable de l'intérieur des données : que la gravité était la seule cause commune.
Deux questions suivent, et ce sont les deux leçons suivantes. Que faire si vous ne pouvez pas dresser la liste des facteurs de confusion - existe-t-il un moyen de les vaincre sans les nommer ? Et une fois que l'on ajuste, pour quelles variables faut-il ajuster, sachant que certains ajustements dégradent la réponse ?
Références et lectures complémentaires
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.
Débloquez tout le parcours
Cette première leçon est gratuite. Inscrivez-vous pour passer le quiz de maîtrise, gagner de l’XP et débloquer tous les modules, avec d’autres exemples interactifs et exécutables.