La semaine qui n’a pas pu avoir lieu
Prenez l’état le plus probable chaque jour, écrivez-les dans l’ordre, et vous obtenez un rapport auquel le modèle attribue une probabilité exactement nulle : sur un exemple de surveillance de machine sur quatre jours, la réponse jour par jour est sain, sain, en panne, en panne, et passer de sain à en panne est une transition impossible. Ce que sont réellement les deux questions, pourquoi le lissage et Viterbi n’y répondent pas de la même manière, et ce que signifie la probabilité a posteriori de 0,411 du meilleur chemin pour qui doit décider.
Prérequis : Raisonner sur un monde qui change
Une machine se trouve dans l’un de trois états : saine, en dégradation ou en panne. Elle ne peut pas passer directement de saine à en panne ; quelque chose doit d’abord se dégrader, ne serait-ce qu’un jour. Écrit comme modèle de transition, l’état de panne étant absorbant :
Un capteur de vibrations déclenche une alarme avec une probabilité de 0,1 quand la machine est saine, de 0,2 quand elle se dégrade et de 0,9 une fois qu’elle est tombée en panne. La machine démarre saine. Sur quatre jours, le capteur rapporte
A. La réponse jour par jour
Le calcul évident est, pour chaque jour, la probabilité de chaque état sachant les quatre observations. C’est le lissage, et c’est ce qu’affiche un tableau de bord de supervision. En sommant sur tous les chemins :
| Jour | saine | dégradation | panne | le plus probable |
|---|---|---|---|---|
| 1 | 1.000000 | 0.000000 | 0.000000 | saine |
| 2 | 0.505642 | 0.494358 | 0.000000 | saine |
| 3 | 0.362691 | 0.225978 | 0.411331 | panne |
| 4 | 0.333799 | 0.102335 | 0.563866 | panne |
Lisez la dernière colonne de haut en bas : saine, saine, en panne, en panne.
Ce rapport est impossible. Il place la machine saine au jour 2 et en panne au jour 3, et le modèle de transition donne à ce pas une probabilité nulle. La séquence n’est pas seulement improbable, ni un résumé approximatif de quelque chose de voisin. Sa probabilité vaut exactement
Rien n’a échoué dans le calcul. Chacun de ces quatre nombres est correct. Chacun répond à une question portant sur un seul jour, et empiler quatre réponses à quatre questions distinctes ne produit pas une réponse à une question portant sur la semaine.
B. La question à laquelle Viterbi répond
L’autre question est : quelle séquence entière est la plus probable ? C’est une maximisation unique sur les chemins, et l’algorithme de Viterbi l’effectue en temps linéaire en le nombre de jours. La réponse est ici
avec une probabilité a posteriori de 0,411331. C’est une séquence différente de celle obtenue jour par jour, et elle affirme notamment que la machine s’est dégradée au jour 2 - le jour même dont la marginale plaçait la dégradation en seconde position, à 0,494358 contre 0,505642 pour saine.
Cet écart résume toute la leçon. Le jour 2 est presque un pile ou face. La règle jour par jour retient le côté qui l’emporte de 1,1 point et ne se demande jamais à quoi ce choix l’engage. Viterbi ne raisonne que sur des séquences : il peut donc accepter un jour 2 légèrement moins bon en échange d’un jour 3 simplement atteignable.
La figure montre le même désaccord dans le monde du parapluie, où toute transition est permise : les marginales mises bout à bout n’y sont donc pas le chemin le plus probable, sans être pour autant un chemin impossible.
Interactif : ce que vous saviez alors, et ce que vous savez maintenant
Cliquez un jour pour basculer le parapluie.
- Jours de désaccord
- 2
- Sa probabilité
- 40.2%
Le jour 2, la marginale lissée et l’histoire la plus probable divergent. La marginale de ce jour vaut 0.554 : pris isolément, le jour était donc probablement pluvieux - et pourtant chaque histoire où il pleut ce jour-là est battue par une où il fait sec. Les deux nombres sont justes : la marginale somme des histoires qui, individuellement, perdent, alors que la séquence doit en choisir une. Voilà pourquoi enchaîner les gagnants pas à pas ne donne pas une histoire plausible, et pourquoi Viterbi est un autre algorithme et non une commodité.
C. La seconde hypothèse raconte tout autre chose
La deuxième semaine la plus probable n’est pas une petite variation de la première :
| Séquence | a posteriori |
|---|---|
| saine, dégradation, panne, panne | 0.411331 |
| saine, saine, saine, saine | 0.326541 |
| saine, saine, dégradation, panne | 0.097691 |
| saine, dégradation, dégradation, panne | 0.054844 |
La meilleure explication est que la machine est tombée en panne au jour 3. La deuxième, à 0,326541, est qu’il ne s’est rien passé du tout et qu’une machine saine a déclenché deux fausses alarmes de suite, ce qu’elle fait avec une probabilité sur n’importe quelle paire de jours. Ces deux récits ne peuvent pas être presque justes tous les deux. Ce sont des versions rivales, et l’écart entre elles est l’élément sur lequel repose réellement une décision de maintenance.
Cela remet aussi le chiffre principal à sa place. La séquence la plus probable porte 0,411331 de la masse a posteriori : la meilleure explication de la semaine est donc fausse environ 59 % du temps. Viterbi renvoie le mode d’une distribution sur les séquences, non une reconstitution de ce qui s’est passé, et le rapporter sans la masse qui le soutient masque l’étroitesse de la victoire.
D. Laquelle voulez-vous ?
Les deux questions sont réellement différentes, et chacune convient à un travail différent.
- Le lissage, jour par jour, est ce qu’il vous faut quand la décision est quotidienne : cette transaction était-elle frauduleuse, le patient était-il en fibrillation auriculaire pendant cette minute, faut-il mettre en quarantaine la production de ce jour. Chaque réponse est utilisée seule et jamais assemblée en récit.
- La séquence la plus probable est ce qu’il vous faut quand la sortie se lit comme une histoire : une transcription, une annotation de gènes, un rapport de panne, un étiquetage morphosyntaxique. Tout ce qu’un humain ou un programme en aval lira comme une séquence doit être cohérent, et seule la maximisation conjointe le garantit.
Le mode de défaillance à surveiller est un système qui calcule le premier et le présente comme la seconde. C’est fréquent, parce que les marginales sont déjà produites par un filtre et que les empiler ne coûte rien. Le rapport empilé paraîtra le plus souvent plausible. Dès que le modèle de transition contient un zéro structurel, comme presque tous les modèles réels, il sera parfois non seulement faux mais impossible, et rien dans la chaîne ne s’en apercevra.
E. La vérification qui ne coûte rien
Si vous empilez des marginales, vous pouvez détecter le problème sans changer de méthode. Prenez la séquence rapportée et évaluez sa probabilité sous le modèle de transition : multipliez les probabilités de transition le long du chemin. Si ce produit est nul, le rapport décrit quelque chose que le modèle déclare impossible.
Cela coûte un seul passage sur la sortie, et sur cet exemple le produit s’annule entre le jour 2 et le jour 3. Rapporter les quatre nombres quotidiens comme quatre nombres est honnête. C’est en les lisant de haut en bas que naît la semaine impossible.
Références et lectures complémentaires
- Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· Bibliothèque de référence Kudos AI
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.