Aller au contenu
Kudos AI
Read in English
Fondements des probabilités

Le théorème de Bayes et la mise à jour des croyances

Démontrer le théorème de Bayes à partir de la définition de la probabilité conditionnelle, puis résoudre deux fois l’exemple du taux de base qui trompe presque tout le monde : une fois avec la formule, une fois par simple dénombrement.

6 min de lectureKudos AI

Prérequis : Les probabilités à partir de zéro

Dix mille personnes, réparties entre les 100 qui sont malades et les 9 900 qui ne le sont pas, puis filtrées selon qui teste positif : 90 vrais cas contre 495 fausses alertes, ce qui explique qu’un test « exact à 90 % » donne une probabilité a posteriori de 15,4 %.

Les probabilités à partir de zéro ont défini la probabilité conditionnelle P(a∣b)P(a \mid b) et laissé une question ouverte : que faire si la conditionnelle que l’on veut est l’inverse de celle que l’on possède ? Un test diagnostique vous dit à quelle fréquence il se déclenche lorsque la condition est présente. Ce que vous voulez réellement savoir, c’est si la condition est présente sachant qu’il s’est déclenché.

Le théorème de Bayes réalise cette inversion. Il tient en deux lignes d’algèbre, et ses conséquences sont assez déroutantes pour que des professionnels s’y trompent régulièrement.

A. Démonstration du théorème

Rappelons la définition de la probabilité conditionnelle, écrite dans les deux sens :

P(a∣b)=P(a and b)P(b),P(b∣a)=P(a and b)P(a).P(a \mid b) = \frac{P(a \text{ and } b)}{P(b)}, \qquad P(b \mid a) = \frac{P(a \text{ and } b)}{P(a)} .

Les deux contiennent la même probabilité conjointe P(a and b)P(a \text{ and } b). En résolvant la seconde pour cette quantité on obtient P(a and b)=P(b∣a) P(a)P(a \text{ and } b) = P(b \mid a)\,P(a), et la substitution dans la première donne le théorème de Bayes :

P(a∣b)=P(b∣a) P(a)P(b).P(a \mid b) = \frac{P(b \mid a)\, P(a)}{P(b)} .

Voilà toute la démonstration. Aucune hypothèse nouvelle n’est intervenue : c’est un simple réarrangement de la définition. Le nom des morceaux compte, en revanche :

  • P(a)P(a) est l’a priori - ce que vous croyiez avant l’indice.
  • P(b∣a)P(b \mid a) est la vraisemblance - comment l’indice se comporte lorsque aa est vrai.
  • P(a∣b)P(a \mid b) est l’a posteriori - la croyance mise à jour.
  • P(b)P(b) est l’évidence, une constante de normalisation.

Calculateur de taux de base

Un résultat positif n’équivaut pas à être atteint.

P(condition | positif)
15.4%
P(sain | négatif)
99.9%
Fausses alertes par détection
5.5

Le test trouve 90 cas réels, mais signale aussi 495 personnes saines. Comme un positif peut être l’un ou l’autre, la probabilité qu’il soit réel n’est que de 15.4%. Augmentez la prévalence et regardez-la grimper : c’est le taux de base, et non la précision du test, qui fait l’essentiel du travail.

B. La loi des probabilités totales

Le dénominateur P(b)P(b) vous est rarement donné directement. On le calcule en découpant le monde en cas exhaustifs et mutuellement exclusifs, puis en sommant :

P(b)=∑iP(b∣ai) P(ai).P(b) = \sum_i P(b \mid a_i)\, P(a_i) .

Pour un découpage en deux cas, aa et ¬a\neg a, cela devient simplement

P(b)=P(b∣a)P(a)+P(b∣¬a)P(¬a).P(b) = P(b \mid a)P(a) + P(b \mid \neg a)P(\neg a) .

C’est le dénominateur de pratiquement tout calcul bayésien, et le reconnaître au premier coup d’œil évite bien des confusions.

C. L’exemple résolu qui surprend tout le monde

Un test de dépistage recherche une condition présente chez 1 % de la population. Le test est décrit comme « exact à 90 % », ce qui signifie ici :

  • Sensibilité : il se déclenche pour 90 % des personnes qui ont la condition, donc P(positive∣condition)=0.90P(\text{positive} \mid \text{condition}) = 0.90.
  • Taux de faux positifs : il se déclenche aussi pour 5 % de celles qui ne l’ont pas, donc P(positive∣healthy)=0.05P(\text{positive} \mid \text{healthy}) = 0.05.

Votre test est positif. Quelle est la probabilité que vous ayez la condition ?

Étape 1 - l’a priori. P(condition)=0.01P(\text{condition}) = 0.01, donc P(healthy)=0.99P(\text{healthy}) = 0.99.

Étape 2 - les vraisemblances. 0.900.90 et 0.050.05, comme indiqué.

Étape 3 - probabilité totale d’un résultat positif.

P(positive)=0.90×0.01⏟true positives+0.05×0.99⏟false positives=0.009+0.0495=0.0585.P(\text{positive}) = \underbrace{0.90 \times 0.01}_{\text{true positives}} + \underbrace{0.05 \times 0.99}_{\text{false positives}} = 0.009 + 0.0495 = 0.0585 .

Étape 4 - diviser.

P(condition∣positive)=0.90×0.010.0585=0.0090.0585≈0.1538.P(\text{condition} \mid \text{positive}) = \frac{0.90 \times 0.01}{0.0585} = \frac{0.009}{0.0585} \approx 0.1538 .

Environ 15,4 %. Malgré un test qui semble très exact, un résultat positif signifie encore que vous n’avez probablement pas la condition.

D. Pourquoi : le taux de base domine

La raison est visible à l’étape 3. La condition est rare, si bien que le taux de faux positifs de 5 % s’applique à un très grand groupe de personnes saines (99 % de la population) tandis que la sensibilité de 90 % s’applique à un groupe minuscule (1 %). Les faux positifs - 0.04950.0495 - sont tout simplement plus de cinq fois plus nombreux que les vrais positifs - 0.0090.009.

C’est l’effet du taux de base, et c’est pourquoi un chiffre brut d’« exactitude » est quasiment dépourvu de sens pour une condition rare si la prévalence ne l’accompagne pas.

E. La même réponse par dénombrement, sans aucune formule

Si l’algèbre reste glissante, voici le calcul identique sous forme de simple comptabilité. Imaginons 10 000 personnes :

GroupeEffectifTest positifTest négatif
Ont la condition (1 %)100100×0.90=90100 \times 0.90 = 9010
Saines (99 %)9 9009,900×0.05=4959{,}900 \times 0.05 = 4959 405
Total10 0005859 415

Sur les 585 personnes dont le test est positif, seules 90 ont réellement la condition :

90585≈0.1538.\frac{90}{585} \approx 0.1538 .

Exactement les 15,4 % donnés par la formule, désormais visibles comme un simple comptage. Présenter les problèmes bayésiens en fréquences naturelles comme ici les rend nettement plus faciles à saisir, et vaut la peine dès qu’il faut expliquer un résultat à quelqu’un d’autre.

F. Vérification en code

Python

S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.

Les deux voies affichent 0.15380.1538, ce qui confirme que le tableau et la formule concordent.

G. Mettre à jour deux fois : l’a posteriori d’hier est l’a priori d’aujourd’hui

Bayes se compose. Prenons un deuxième test, indépendant, lui aussi positif. L’a posteriori issu du premier test, 0.15380.1538, devient le nouvel a priori :

P(positive2)=0.90×0.1538+0.05×0.8462=0.1384+0.0423=0.1807,P(\text{positive}_2) = 0.90 \times 0.1538 + 0.05 \times 0.8462 = 0.1384 + 0.0423 = 0.1807 , P(condition∣both positive)=0.90×0.15380.1807≈0.766.P(\text{condition} \mid \text{both positive}) = \frac{0.90 \times 0.1538}{0.1807} \approx 0.766 .

Deux résultats positifs font passer la croyance de 15,4 % à environ 76,6 %. L’indice n’a jamais été faible ; il luttait contre un taux de base extrêmement bas, et un seul tour n’a pas suffi à le surmonter.

La mise en garde sur l’indépendance, à nouveau. Enchaîner ainsi les mises à jour suppose que les deux tests échouent indépendamment, conditionnellement à l’état réel. S’ils partagent un mode de défaillance - le même réactif, le même instrument mal étalonné - un second positif porte bien moins d’information que le calcul ne lui en attribue, et 76,6 % est alors surestimé.

À retenir

  • Le théorème de Bayes est un réarrangement de la définition de la probabilité conditionnelle, non une hypothèse supplémentaire.
  • Les quatre morceaux sont l’a priori, la vraisemblance, l’a posteriori et le dénominateur d’évidence, que l’on calcule d’ordinaire par la loi des probabilités totales.
  • Pour une condition rare, les faux positifs peuvent noyer les vrais positifs : un test « exact à 90 % » n’a donné qu’une valeur prédictive positive de 15,4 %.
  • Réexprimer le problème en fréquences naturelles (90 sur 585) donne la même réponse sans aucune algèbre.
  • Les mises à jour se composent - l’a posteriori devient l’a priori suivant - mais seulement si les indices sont conditionnellement indépendants.

La suite

Jusqu’ici, les probabilités nous étaient données. Le reste de ce site porte surtout sur le problème inverse : les estimer à partir des données, et savoir quelle confiance accorder à l’estimation. C’est le sujet de Qu’est-ce que l’apprentissage statistique ?, qui introduit la séparation entre l’erreur que l’on peut réduire et celle que l’on ne peut pas.

Références et lectures complémentaires

  • Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· Bibliothèque de référence Kudos AI

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Lecture associée

8 min de lectureFondements des probabilités

Les probabilités à partir de zéro : le langage de l’incertitude

Construire les probabilités depuis la base : les mondes possibles, l’univers, les deux axiomes fondamentaux, puis les règles d’addition et de multiplication, chacune démontrée plutôt qu’affirmée, avec des exemples numériques résolus.

ProbabilitéMathématiquesIntelligence artificielle
4 min de lectureRaisonnement probabiliste

Cent mille échantillons, quatre cents qui comptent

Sur le réseau du cambriolage avec les deux voisins qui appellent, l’échantillonnage par rejet garde 183 tirages sur 100 000 et la pondération par vraisemblance les garde tous pour une taille d’échantillon efficace de 396. Les deux estimations s’écartent d’environ 10 % d’une probabilité a posteriori de 0,284172, et la raison se calcule exactement : 252 échantillons portent 76 % du poids et 99,975 % du poids au carré.

Intelligence artificielleProbabilité
7 min de lectureFondements de l’apprentissage statistique

Qu’est-ce que l’apprentissage statistique ?

Le cadre commun à tout modèle prédictif : estimer une fonction inconnue f à partir des données, la séparation entre erreur réductible et irréductible, et pourquoi prédiction et inférence tirent dans des directions opposées.

StatistiqueApprentissage automatiqueMathématiques
← Retour à tous les articles