Aller au contenu
Kudos AI

La confusion et le renversement

Un traitement qui aide de la meme marge dans chaque sous-groupe tout en paraissant nuire globalement, le mecanisme qui produit cela, et la standardisation qui retrouve la bonne reponse.

IntermédiaireModule 125 min · 100 XP
Des patients se triant par gravité si bien que le bras traité se remplit des cas les plus durs, les barres de guérison internes restant à cinq points d'écart pendant que les barres globales se croisent, et la comparaison standardisée remettant le signe.

Commencez par des nombres qui semblent impossibles, et résistez à l'envie de chercher l'erreur de calcul. Il n'y en a pas.

Le tableau

Un traitement est donné à 60 patients et refusé à 60 autres.

traitésnon traités
graves16 / 40 = 0,4000,4007 / 20 = 0,3500,350
légers14 / 20 = 0,7000,70026 / 40 = 0,6500,650
global30 / 60 = 0,5000,50033 / 60 = 0,5500,550

Chez les cas graves, le traitement augmente la guérison de cinq points. Chez les cas légers, de cinq points également. Globalement, les traités font cinq points de moins.

Chaque patient appartient à exactement une strate. Les deux bras comptent 60 patients : il ne s'agit donc pas de tailles de groupes inégales. L'addition est juste.

Ce que le chiffre global compare vraiment

Regardez qui se trouve dans chaque bras.

  • sur les 60 traités, 40 étaient graves - deux tiers
  • sur les 60 non traités, 20 étaient graves - un tiers

Les médecins ont donné le médicament aux patients qui en avaient besoin, ce que ferait tout clinicien consciencieux. La conséquence est que le bras traité est chargé des cas les plus difficiles.

Les patients graves guérissent moins souvent quoi qu'on leur fasse. La comparaison globale ne mesure donc pas le traitement : elle compare un groupe majoritairement grave à un groupe majoritairement léger, et cette différence de composition pèse plus que les cinq points apportés par le traitement.

Interactif : le même traitement, deux verdicts

Les quatre taux par groupe ne changent jamais.

traitésnon traités
graves16 / 4040.0%7 / 2035.0%
légers14 / 2070.0%26 / 4065.0%
agrégé30 / 6050.0%33 / 6055.0%
Différence agrégée
-5.0
Différence standardisée
+5.0
Verdict agrégé
nuit

Les chiffres agrégés disent que le traitement nuit, de 5.0 points - et il a aidé chez les cas graves et aidé chez les cas légers. Chaque patient appartient à exactement une de ces deux lignes. Rien n’a bougé dans les quatre cases du haut : la seule chose que vous avez changée, c’est qui se trouve dans chaque bras. Deux tiers des traités sont ici des cas graves contre un tiers des non traités, et les cas graves guérissent moins souvent quoi qu’on leur fasse : la comparaison agrégée mesure donc la composition et l’appelle un effet du traitement.

La confusion, et les deux flèches qu'elle exige

La gravité a fait deux choses à la fois :

  1. elle à influencé qui a été traité
  2. elle influence qui guérit

Une variable qui fait les deux est un facteur de confusion, et les deux flèches sont requises.

Une variable n'agissant que sur le résultat - un facteur de risque que personne n'a consulté au moment de prescrire - coûte de la précision sans biaiser la comparaison, puisqu'elle se répartit également entre les bras. Une variable n'agissant que sur l'attribution, comme une pièce de monnaie, est inoffensive pour la même raison.

C'est la cause commune qui fait les dégâts, et c'est pourquoi la question qui compte devant toute comparaison observationnelle est : comment ces groupes se sont-ils formes ?

Standardiser

Comme la gravité a été enregistrée, on peut l'ajuster. Le chiffre global moyenne la guérison de chaque bras sur la composition propre à ce bras. Moyennez plutôt les taux internes sur une composition commune :

traites : 0,5×0,400+0,5×0,700=0,550\text{traites : } 0,5 \times 0,400 + 0,5 \times 0,700 = 0,550 non traites : 0,5×0,350+0,5×0,650=0,500\text{non traites : } 0,5 \times 0,350 + 0,5 \times 0,650 = 0,500

Une différence d'exactement +0,05+0,05 : les cinq points mêmes visibles dans chaque strate, et le signe oppose au −0,05-0,05 naïf.

Pourquoi plus de données n'aide pas

C'est le point qui sépare un problème statistique d'un problème causal, et il mérite d'être dit sans détour.

Le bruit d'échantillonnage diminue quand l'échantillon grandit. La confusion, non. Elle est une propriété de la façon dont les données sont apparues, pas de leur quantité.

Menez la même étude sur un million de patients avec les mêmes habitudes de prescription : l'estimation naïve converge - vers −0,05-0,05. Vous obtenez un intervalle de confiance étroit autour d'un nombre au mauvais signe, et toutes les vérifications habituelles auront l'air saines.

Remarquez aussi ce que les données ne peuvent pas dire. L'estimation naïve et l'estimation standardisée sont toutes deux des calculs corrects sur le même tableau. Rien à l'intérieur n'annonce laquelle répond à la question causale. Ce jugement vient de la connaissance de la façon dont le traitement a été attribué, c'est-à-dire du monde et non des nombres.

Ce que cela prépare

La standardisation a fonctionné parce que la gravité avait été enregistrée. C'est le cas favorable, et il repose sur une affirmation invérifiable de l'intérieur des données : que la gravité était la seule cause commune.

Deux questions suivent, et ce sont les deux leçons suivantes. Que faire si vous ne pouvez pas dresser la liste des facteurs de confusion - existe-t-il un moyen de les vaincre sans les nommer ? Et une fois que l'on ajuste, pour quelles variables faut-il ajuster, sachant que certains ajustements dégradent la réponse ?

Références et lectures complémentaires

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Débloquez tout le parcours

Cette première leçon est gratuite. Inscrivez-vous pour passer le quiz de maîtrise, gagner de l’XP et débloquer tous les modules, avec d’autres exemples interactifs et exécutables.