Aller au contenu
Kudos AI
Read in English
Apprentissage par renforcement

Le paramètre que personne ne choisit

La récompense de survie d’un monde en grille est écrite une fois et jamais discutée, et la politique optimale en est une fonction en escalier : huit seuils entre -3 et 0, chacun retournant exactement une case. La valeur classique de -0,04 se trouve à 0,0048 de celle qui décide si l’agent prend le raccourci le long du puits, et au-dessus de -0,0221, quand les pas ne coûtent presque rien, le mouvement optimal dans un coin consiste à foncer volontairement dans un mur.

5 min de lectureKudos AI

Prérequis : Les processus de décision markoviens

Des balayages de Bellman calculés en direct sur un petit monde, les utilités se stabilisant case par case, et les flèches de la politique qui basculent à mesure que la valeur de rester sur place change.

Le monde en grille standard fait quatre cases sur trois, avec un mur en (2,2), un but valant +1 en (4,3) et un puits valant -1 en (4,2). Chaque action déplace l’agent comme prévu avec une probabilité de 0,8 et de côté avec une probabilité de 0,1 de chaque côté ; heurter un mur le laisse sur place. Le facteur d’actualisation vaut 1.

Et quelque part dans la spécification, généralement dans une phrase sur laquelle personne ne s’arrête, figure une récompense de survie : chaque case non terminale rapporte RR par pas, typiquement −0.04-0.04. Elle est là pour rendre la lenteur coûteuse. Elle n’est pas présentée comme un choix de modélisation, parce qu’elle n’en a pas l’air.

C’est le nombre le plus lourd de conséquences du problème.

A. Huit seuils

Résolvez le monde pour chaque RR entre −3-3 et 00 et la politique optimale ne dérive pas. Elle reste immobile, change dans une case, puis reste de nouveau immobile. En bissectant chaque changement jusqu’à six décimales :

Récompense de survieCaseAvantAprès
-1.649707(3,2)droitehaut
-1.564259(3,1)droitehaut
-0.731138(1,1)droitehaut
-0.452624(4,1)hautgauche
-0.084989(2,1)droitegauche
-0.044833(3,1)hautgauche
-0.027357(3,2)hautgauche
-0.022145(4,1)gauchebas

Neuf politiques optimales distinctes sur cet intervalle, séparées par huit nombres, et chacun des chiffres ci-dessus a été calculé deux fois : par itération sur les politiques, où chaque évaluation est une résolution linéaire exacte, et par itération sur les valeurs poussée jusqu’à une tolérance de 10−1410^{-14}. Les deux méthodes s’accordent sur chaque politique et sur chaque utilité à 9×10−149 \times 10^{-14} près.

Interactif : la politique, fonction en escalier de la récompense de survie

Le monde 4x3, 0,8 dans la direction voulue, 0,1 de chaque côté, sans actualisation.

(1,1)0.705(1,2)0.762(1,3)0.812(2,1)0.655(2,3)0.868(3,1)0.611(3,2)0.660(3,3)0.918(4,1)0.388(4,2)-1(4,3)+1-30-0.04-1-0.2
Utilité de la case (1,1)
0.705308
Intervalle de politique
7 sur 9
Cases différentes du manuel
0
Itération sur les valeurs vs exact
5.4e-15

À R = -0.04 la politique optimale est celle qui vaut pour toute récompense de survie entre -0.044833 et -0.027357, et U(1,1) vaut 0.705308. En (3,1) l’agent part à gauche, le long détour, aussi loin du puits que possible.

B. La valeur classique est à 0,0048 d’une falaise

Regardez la ligne en gras. À R=−0.04R = -0.04, l’agent placé en (3,1), en diagonale sous le puits et à sa gauche, va à gauche : le long chemin, par le bas puis en remontant le côté opposé, sans jamais poser le pied sur une case voisine du puits. C’est la politique imprimée dans tous les manuels, et celle dont l’intuition de chacun tire sa compréhension de ce monde.

À R=−0.05R = -0.05, il va en haut : sur (3,2), la case juste à gauche du puits, en prenant la route courte et en acceptant un risque réel d’être poussé de côté dans le −1-1.

La bascule se situe à R=−0.044833R = -0.044833. Le réglage canonique est à 0.0048330.004833 au-dessus. Une récompense de survie de −0.04-0.04 et une de −0.05-0.05 relèvent du même choix pour qui que ce soit, et elles produisent deux récits différents de ce que fait un agent rationnel dans ce monde.

Les utilités, elles, évoluent continûment : U(1,1)U(1,1) vaut 0.7053080.705308 à R=−0.04R = -0.04, −1.600186-1.600186 à R=−0.4R = -0.4 et −10.815340-10.815340 à R=−2R = -2. C’est la politique, c’est-à-dire ce que vous déployez réellement, qui est une fonction en escalier.

C. Deux politiques qui ressemblent à des bogues

Au-dessus de -0,022145, l’agent fonce volontairement dans un mur. Pour toute récompense de survie entre −0.022145-0.022145 et 00, les pas les moins chers de tout l’intervalle, l’action optimale en (4,1), le coin inférieur droit, est bas. Il n’y a rien en dessous ; le mouvement heurte le sol et l’agent reste sur place avec une probabilité de 0,8, glissant de côté avec 0,1 de chaque côté, dont l’un heurte également un mur.

Ce n’est pas un bogue. La case juste au-dessus de (4,1) est le puits. Quand le temps ne coûte presque rien, la chose la moins chère à faire dans ce coin est de ne rien faire, et l’action qui réalise le mieux ce rien est de pousser contre le sol. Tout mouvement délibéré risque de dériver vers le haut, dans le −1-1.

À l’autre extrémité, l’agent plonge dans le puits. Pour R<−1.649707R < -1.649707, l’action optimale en (3,2) est d’aller à droite, directement dans le terminal −1-1. Dès qu’un pas supplémentaire coûte plus de 1,649707, la sortie la plus rapide l’emporte, et le puits est la sortie la plus proche. U(1,1)=−10.815340U(1,1) = -10.815340 à R=−2R = -2 : l’agent n’est pas confus, il est dans un monde où exister coûte cher.

Les deux comportements sont une optimisation correcte. Les deux seraient signalés comme des bogues par quiconque n’aurait pas regardé la récompense de survie, et ni l’un ni l’autre ne se corrige en changeant d’algorithme.

D. Que faire

Les conséquences pratiques sont courtes et précises.

  • Balayez le paramètre que vous ne pensiez pas choisir. Neuf politiques sur un intervalle n’a rien d’exotique ; c’est l’allure d’un argmax constant par morceaux. Le balayage est bon marché : chaque résolution ici est un système linéaire 11×1111 \times 11.
  • Rapportez l’intervalle, pas le point. « La politique optimale pour −0.0448<R<−0.0274-0.0448 < R < -0.0274 » est une affirmation qui survit à un arrondi de la récompense de survie. « La politique optimale pour R=−0.04R = -0.04 » porte sur un seul nombre, et c’est l’énoncé le plus faible bien qu’il paraisse plus précis.
  • Une récompense réglée est un paramètre ajusté. Retoucher un coût de pas jusqu’à ce que l’agent fasse ce qu’il faut, c’est de l’ajustement, et la valeur obtenue hérite de toutes les réserves qui accompagnent un paramètre ajusté. En particulier, elle ne devrait pas ensuite être présentée comme une propriété de l’environnement.
  • Vérifiez les deux bords de l’intervalle auquel vous croyez. Si votre conviction est « le temps coûte un peu, quelques pour cent par pas », résolvez aux deux bouts de « quelques pour cent ». Ici, cet intervalle contient trois seuils.

La version profonde du propos est que la fonction de récompense n’est pas une description du monde. Elle est la spécification complète de ce à quoi sert l’agent, et une de ses pièces écrite une fois dans un fichier de configuration, jamais relue, jamais variée, pèse plus lourd que tout ce sur quoi l’on discute.

Références et lectures complémentaires

  • Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· Bibliothèque de référence Kudos AI

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Lecture associée

9 min de lectureApprentissage par renforcement

Les processus de décision markoviens

Comment planifier quand les actions ne font pas fiablement ce qu’on veut : états, modèle de transition, récompenses et actualisation, l’équation de Bellman, et l’itération sur les valeurs menée numériquement jusqu’à son point fixe.

Apprentissage par renforcementProbabilitéIntelligence artificielle
5 min de lectureRaisonnement probabiliste

La semaine qui n’a pas pu avoir lieu

Prenez l’état le plus probable chaque jour, écrivez-les dans l’ordre, et vous obtenez un rapport auquel le modèle attribue une probabilité exactement nulle : sur un exemple de surveillance de machine sur quatre jours, la réponse jour par jour est sain, sain, en panne, en panne, et passer de sain à en panne est une transition impossible. Ce que sont réellement les deux questions, pourquoi le lissage et Viterbi n’y répondent pas de la même manière, et ce que signifie la probabilité a posteriori de 0,411 du meilleur chemin pour qui doit décider.

Intelligence artificielleProbabilité
5 min de lectureRecherche et jeux

Le correctif qui a changé le taux de succès bien plus que le coût

Autoriser les déplacements latéraux fait passer l’escalade sur les 8 reines de 14,75 % de parties résolues à 94,55 %, ce qui se lit comme une amélioration d’un facteur six et n’en est pas une : avec redémarrages aléatoires, le coût attendu d’une solution passe de 21,9 à 23,1 pas, et, compté en coups évalués, il baisse de 16 %, de 1 547 à 1 298. Le recuit simulé résout 98,8 % et coûte 1 622 évaluations. Ce qui a changé, c’est surtout la statistique, pas le travail.

Intelligence artificielle
← Retour à tous les articles