Cent mille échantillons, quatre cents qui comptent
Sur le réseau du cambriolage avec les deux voisins qui appellent, l’échantillonnage par rejet garde 183 tirages sur 100 000 et la pondération par vraisemblance les garde tous pour une taille d’échantillon efficace de 396. Les deux estimations s’écartent d’environ 10 % d’une probabilité a posteriori de 0,284172, et la raison se calcule exactement : 252 échantillons portent 76 % du poids et 99,975 % du poids au carré.
Prérequis : Réseaux bayésiens et inférence probabiliste
Le réseau du cambriolage compte cinq variables binaires : un cambriolage et un séisme peuvent déclencher une alarme, et deux voisins, John et Mary, peuvent appeler ou non quand elle se déclenche. Tous deux appellent. Quelle est la probabilité qu’il y ait eu cambriolage ?
Par énumération, la réponse est exacte :
Faites-le maintenant par échantillonnage, avec cent mille échantillons, ce qui semble plus qu’assez pour deux chiffres significatifs.
A. Le rejet en garde 183
Tirez une affectation complète du réseau, écartez-la si les deux voisins n’ont pas appelé, puis faites la moyenne des cambriolages parmi les survivants. Sur 100 000 tirages :
C’est exactement ce que prédit . L’évidence est rare, presque tous les échantillons sont jetés, et l’estimation repose sur 183 d’entre eux. Elle s’écarte de 0,027, soit environ 10 % de la quantité estimée.
Ce n’est pas un défaut d’implémentation. Le taux d’acceptation est la probabilité de l’évidence : le coût de l’échantillonnage par rejet évolue donc en , et toute observation un peu spécifique le rend désespéré. Dix observations binaires à chances égales ne garderaient qu’un échantillon sur mille.
B. La pondération par vraisemblance les garde tous, et en vaut 396
Le remède habituel consiste à cesser d’échantillonner les variables observées. Fixez-les à leurs valeurs observées, échantillonnez le reste, et donnez à chaque échantillon un poids égal à la probabilité de l’évidence sachant ses parents. Rien n’est jeté.
L’estimation utilise désormais 100 000 échantillons, et la mesure honnête de ce qu’elle vaut est la taille d’échantillon efficace
Mesurée : 396,4, soit 0,396 % des échantillons tirés, pour une estimation de 0,2473.
Les deux méthodes, à budget identique, valent donc 183 et 396 échantillons. La pondération par vraisemblance mène d’un facteur deux, et sur ce tirage son estimation ponctuelle est la plus éloignée des deux de la vérité, ce qui est la bonne leçon sur ce qu’achètent 400 échantillons.
Dans la figure, passez à P(cambriolage | les deux appels). Son curseur échantillons tirés s’arrête à 50 000 sur une graine fixe : le rejet garde donc 102 échantillons, et non les 183 sur 100 000 d’ici, et la figure n’affiche pas la taille d’échantillon efficace.
Interactif : deux échantillonneurs face à la valeur exacte
La valeur exacte vient de l’énumération de la loi jointe, non des échantillonneurs.
- Exact
- 0.3000
- Rejet
- 0.3045
- Pondération
- 0.3029
- Gardés par le rejet
- 289
Le rejet lit 0.3045 sur les 289 échantillons conservés parmi 1 000 ; la pondération lit 0.3029 sur la totalité ; la valeur exacte est 0.3000. Les deux estimateurs sont convergents, ce qui est une affirmation sur une limite : faites donc glisser la taille du tirage et regardez les deux nombres marcher vers le troisième. La part rejetée n’est pas du bruit, c’est 70.00% du travail.
C. D’où viennent les 396
Le poids ne prend ici que deux valeurs, parce que seul l’état de l’alarme importe à John et Mary :
L’alarme sonne avec une probabilité de 0,002516 : sur 100 000 échantillons, environ 251,6 reçoivent donc le grand poids. Ces 252 échantillons portent
- 76,07 % du poids total, et
- 99,975 % du poids au carré total,
et c’est le poids au carré que compte le dénominateur de l’ESS. La prédiction est , contre 396,4 mesurés sur un tirage.
Rien ne cloche dans l’échantillonneur. Presque tous les échantillons qu’il tire sont des mondes où l’alarme n’a pas sonné, et dans un tel monde deux voisins qui appellent sont une coïncidence qui vaut un poids de 0,0005. Les 99 748 autres échantillons ne sont pas de l’information ; ce sont des erreurs d’arrondi dotées d’une variance.
D. Que faire
- Rapportez l’ESS, jamais le nombre d’échantillons tirés. Trois lignes de code, et c’est le seul nombre qui décrit ce sur quoi repose l’estimation. Une ESS de 396 sur 100 000 tirages est un résultat ; « 100 000 échantillons » est un budget.
- Attendez-vous à voir l’ESS chuter à mesure que l’évidence s’accumule. Chaque observation supplémentaire multiplie les poids par un facteur de plus, inférieur à un, et dans un réseau où l’évidence est en aval d’une cause rare, l’effondrement est immédiat plutôt que graduel.
- Échantillonnez depuis quelque chose de plus proche de la loi a posteriori. C’est à cela que servent l’échantillonnage de Gibbs et le reste des méthodes MCMC : ils dépensent leur effort là où la loi a posteriori se trouve réellement, au lieu de tirer depuis la loi a priori en espérant.
- Traitez un grand nombre d’échantillons annoncé dans un rapport comme une question sans réponse. Il dit ce qui a été dépensé, non ce qui a été appris.
Références et lectures complémentaires
- Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· Bibliothèque de référence Kudos AI
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.