Aller au contenu
Kudos AI
Read in English
Raisonnement probabiliste

Cent mille échantillons, quatre cents qui comptent

Sur le réseau du cambriolage avec les deux voisins qui appellent, l’échantillonnage par rejet garde 183 tirages sur 100 000 et la pondération par vraisemblance les garde tous pour une taille d’échantillon efficace de 396. Les deux estimations s’écartent d’environ 10 % d’une probabilité a posteriori de 0,284172, et la raison se calcule exactement : 252 échantillons portent 76 % du poids et 99,975 % du poids au carré.

4 min de lectureKudos AI

Prérequis : Réseaux bayésiens et inférence probabiliste

Des échantillons traversant un réseau et presque tous écartés au nœud d’évidence, puis les mêmes échantillons conservés avec des poids, la plupart si légers qu’empilés ils ne font rien.

Le réseau du cambriolage compte cinq variables binaires : un cambriolage et un séisme peuvent déclencher une alarme, et deux voisins, John et Mary, peuvent appeler ou non quand elle se déclenche. Tous deux appellent. Quelle est la probabilité qu’il y ait eu cambriolage ?

Par énumération, la réponse est exacte :

P(Burglary∣j,m)=0.284172,P(j,m)=0.00208410.P(\text{Burglary} \mid j, m) = 0.284172, \qquad P(j, m) = 0.00208410.

Faites-le maintenant par échantillonnage, avec cent mille échantillons, ce qui semble plus qu’assez pour deux chiffres significatifs.

A. Le rejet en garde 183

Tirez une affectation complète du réseau, écartez-la si les deux voisins n’ont pas appelé, puis faites la moyenne des cambriolages parmi les survivants. Sur 100 000 tirages :

183 conserveˊs (0,183%),P^=0.2568.183 \text{ conservés } (0{,}183\%), \qquad \hat{P} = 0.2568.

C’est exactement ce que prédit P(j,m)=0.00208P(j, m) = 0.00208. L’évidence est rare, presque tous les échantillons sont jetés, et l’estimation repose sur 183 d’entre eux. Elle s’écarte de 0,027, soit environ 10 % de la quantité estimée.

Ce n’est pas un défaut d’implémentation. Le taux d’acceptation est la probabilité de l’évidence : le coût de l’échantillonnage par rejet évolue donc en 1/P(e)1/P(e), et toute observation un peu spécifique le rend désespéré. Dix observations binaires à chances égales ne garderaient qu’un échantillon sur mille.

B. La pondération par vraisemblance les garde tous, et en vaut 396

Le remède habituel consiste à cesser d’échantillonner les variables observées. Fixez-les à leurs valeurs observées, échantillonnez le reste, et donnez à chaque échantillon un poids égal à la probabilité de l’évidence sachant ses parents. Rien n’est jeté.

L’estimation utilise désormais 100 000 échantillons, et la mesure honnête de ce qu’elle vaut est la taille d’échantillon efficace

ESS=(∑iwi)2∑iwi2.\text{ESS} = \frac{\left(\sum_i w_i\right)^2}{\sum_i w_i^2}.

Mesurée : 396,4, soit 0,396 % des échantillons tirés, pour une estimation de 0,2473.

Les deux méthodes, à budget identique, valent donc 183 et 396 échantillons. La pondération par vraisemblance mène d’un facteur deux, et sur ce tirage son estimation ponctuelle est la plus éloignée des deux de la vérité, ce qui est la bonne leçon sur ce qu’achètent 400 échantillons.

Dans la figure, passez à P(cambriolage | les deux appels). Son curseur échantillons tirés s’arrête à 50 000 sur une graine fixe : le rejet garde donc 102 échantillons, et non les 183 sur 100 000 d’ici, et la figure n’affiche pas la taille d’échantillon efficace.

Interactif : deux échantillonneurs face à la valeur exacte

La valeur exacte vient de l’énumération de la loi jointe, non des échantillonneurs.

0.3000
Exact
0.3000
Rejet
0.3045
Pondération
0.3029
Gardés par le rejet
289

Le rejet lit 0.3045 sur les 289 échantillons conservés parmi 1 000 ; la pondération lit 0.3029 sur la totalité ; la valeur exacte est 0.3000. Les deux estimateurs sont convergents, ce qui est une affirmation sur une limite : faites donc glisser la taille du tirage et regardez les deux nombres marcher vers le troisième. La part rejetée n’est pas du bruit, c’est 70.00% du travail.

C. D’où viennent les 396

Le poids ne prend ici que deux valeurs, parce que seul l’état de l’alarme importe à John et Mary :

w=0.9×0.7=0.63si l’alarme a sonneˊ,w=0.05×0.01=0.0005sinon.w = 0.9 \times 0.7 = 0.63 \quad \text{si l'alarme a sonné}, \qquad w = 0.05 \times 0.01 = 0.0005 \quad \text{sinon}.

L’alarme sonne avec une probabilité de 0,002516 : sur 100 000 échantillons, environ 251,6 reçoivent donc le grand poids. Ces 252 échantillons portent

  • 76,07 % du poids total, et
  • 99,975 % du poids au carré total,

et c’est le poids au carré que compte le dénominateur de l’ESS. La prédiction est ESS=434,8\text{ESS} = 434{,}8, contre 396,4 mesurés sur un tirage.

Rien ne cloche dans l’échantillonneur. Presque tous les échantillons qu’il tire sont des mondes où l’alarme n’a pas sonné, et dans un tel monde deux voisins qui appellent sont une coïncidence qui vaut un poids de 0,0005. Les 99 748 autres échantillons ne sont pas de l’information ; ce sont des erreurs d’arrondi dotées d’une variance.

D. Que faire

  • Rapportez l’ESS, jamais le nombre d’échantillons tirés. Trois lignes de code, et c’est le seul nombre qui décrit ce sur quoi repose l’estimation. Une ESS de 396 sur 100 000 tirages est un résultat ; « 100 000 échantillons » est un budget.
  • Attendez-vous à voir l’ESS chuter à mesure que l’évidence s’accumule. Chaque observation supplémentaire multiplie les poids par un facteur de plus, inférieur à un, et dans un réseau où l’évidence est en aval d’une cause rare, l’effondrement est immédiat plutôt que graduel.
  • Échantillonnez depuis quelque chose de plus proche de la loi a posteriori. C’est à cela que servent l’échantillonnage de Gibbs et le reste des méthodes MCMC : ils dépensent leur effort là où la loi a posteriori se trouve réellement, au lieu de tirer depuis la loi a priori en espérant.
  • Traitez un grand nombre d’échantillons annoncé dans un rapport comme une question sans réponse. Il dit ce qui a été dépensé, non ce qui a été appris.

Références et lectures complémentaires

  • Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· Bibliothèque de référence Kudos AI

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Lecture associée

9 min de lectureRaisonnement probabiliste

Réseaux bayésiens et inférence probabiliste

Comment un graphe et quelques petites tables tiennent lieu d’une loi jointe à des milliers d’entrées, comment y répondre exactement à une requête par énumération et élimination de variables, et que faire quand l’inférence exacte est hors de portée : échantillonnage par rejet, pondération par vraisemblance et échantillonnage de Gibbs, chacun travaillé sur les deux mêmes réseaux.

ProbabilitéIntelligence artificielle
5 min de lectureRaisonnement probabiliste

La semaine qui n’a pas pu avoir lieu

Prenez l’état le plus probable chaque jour, écrivez-les dans l’ordre, et vous obtenez un rapport auquel le modèle attribue une probabilité exactement nulle : sur un exemple de surveillance de machine sur quatre jours, la réponse jour par jour est sain, sain, en panne, en panne, et passer de sain à en panne est une transition impossible. Ce que sont réellement les deux questions, pourquoi le lissage et Viterbi n’y répondent pas de la même manière, et ce que signifie la probabilité a posteriori de 0,411 du meilleur chemin pour qui doit décider.

Intelligence artificielleProbabilité
11 min de lectureStatistical Inference

Ce qu'un échantillon peut et ne peut pas vous dire

Les estimateurs comme variables aléatoires dotées de leur propre distribution, le cas où l'estimateur sans biais est le moins bon, ce qu'un intervalle de confiance promet réellement et l'intervalle standard qui délivre 87 % là où il en annonce 95, et ce dont une valeur p est la probabilité - chaque chiffre calculé exactement ou par simulation à graine fixée.

StatistiqueProbabilité
← Retour à tous les articles