Comprendre Théorème de Bayes
Beaucoup de questions ont une direction naturelle inverse de ce qui est mesurable. Un test diagnostique se caractérise par la fréquence à laquelle il se déclenche quand la maladie est présente, c’est-à-dire P(positif | maladie). La quantité cliniquement utile est la conditionnelle opposée, P(maladie | positif). Le théorème de Bayes est l’identité qui les relie.
Il découle directement de la définition de la probabilité conditionnelle. Comme P(A ∩ B) s’écrit aussi bien P(A | B)P(B) que P(B | A)P(A), égaler les deux et diviser réarrange en la forme familière. Le théorème n’est donc ni une hypothèse ni un choix de modélisation ; c’est une conséquence algébrique des axiomes des probabilités.
Le contenu interprétatif tient dans les trois quantités de droite. L’a priori P(A) est ce qui était cru avant l’arrivée de l’indice. La vraisemblance P(B | A) dit à quel point l’indice serait attendu si l’hypothèse était vraie. Le terme de normalisation P(B) est la probabilité totale de voir cet indice, toutes hypothèses confondues. Leur combinaison donne l’a posteriori P(A | B).
La défaillance pratique dominante est la négligence de l’a priori. Quand une condition est rare, même un test exact produit surtout des faux positifs, car la grande population de personnes saines engendre plus de fausses alertes que la petite population de malades n’engendre de vraies. Raisonner à partir de la seule exactitude du test, sans le taux de base, donne une réponse pouvant se tromper d’un ordre de grandeur.
Comment calculer
P(A | B) = P(B | A) · P(A) / P(B)
où
- P(A | B)
- l’a posteriori : probabilité de A après avoir observé B
- P(B | A)
- la vraisemblance : probabilité d’observer B si A tient
- P(A)
- l’a priori : probabilité de A avant d’observer B
- P(B)
- l’évidence, ou vraisemblance marginale, d’observer B tout court
Exemple : Théorème de Bayes
Supposons qu’une maladie touche 1 personne sur 1 000. Un test la détecte chez 99 % de celles qui l’ont, et renvoie un faux positif pour 5 % de celles qui ne l’ont pas. Quelqu’un teste positif. Quelle est la probabilité qu’il soit malade ?
Prenez 100 000 personnes. Environ 100 ont la maladie, et le test en signale correctement 99. Les 99 900 autres sont saines, et 5 % d’entre elles, environ 4 995, sont signalées malgré tout. Il y a donc 99 + 4 995 = 5 094 résultats positifs au total, dont 99 seulement sont authentiques.
La probabilité d’être malade sachant un test positif est donc 99 / 5 094 ≈ 0,0194, soit moins de 2 %. Le test est réellement exact, et pourtant la grande majorité de ses positifs sont faux, uniquement parce que la population saine est mille fois plus grande. C’est l’effet du taux de base, et c’est pourquoi un résultat de dépistage positif est normalement suivi d’un second test indépendant.
Questions fréquentes
Quelle est la différence entre l’a priori et l’a posteriori ?
L’a priori est la probabilité attribuée à une hypothèse avant la prise en compte de l’indice ; l’a posteriori est la probabilité révisée ensuite. En appliquant le théorème de Bayes de façon répétée, l’a posteriori d’un tour d’indices devient l’a priori du suivant.
D’où vient l’a priori ?
De ce qui est connu au préalable : un taux de base connu, une fréquence historique, ou un choix délibérément peu informatif quand on sait peu de chose. La dépendance à un a priori est le principal point de discorde entre approches bayésienne et fréquentiste, même si, quand les données abondent, l’a posteriori est dominé par la vraisemblance et le choix de l’a priori compte moins.
Pourquoi le dénominateur est-il souvent ignoré en pratique ?
P(B) ne dépend pas de l’hypothèse : quand on compare des hypothèses face au même indice, c’est une constante commune. On peut l’omettre lorsque seul le classement relatif importe, ce que fait exactement un classifieur naïf de Bayes en choisissant la classe la plus probable.
En résumé
Le théorème de Bayes est la règle qui transforme un indice en croyance révisée, et sa force pratique tient à l’exigence d’inclure l’a priori. Sauter le taux de base est ce qui fait paraître des tests exacts bien plus concluants qu’ils ne le sont.