L’apprentissage par renforcement et le Q-learning
Apprendre à bien agir sans modèle du monde : mises à jour par différence temporelle, la règle du Q-learning, exploration contre exploitation, et une exécution qui retrouve l’optimum planifié à partir de la seule expérience.
Prérequis : Les processus de décision markoviens
Les processus de décision markoviens ont résolu le problème de planification : étant donnés et , l’itération sur les valeurs renvoie une politique optimale. Mais un agent lâché dans un environnement inconnu n’a ni l’un ni l’autre. Il ne sait pas ce que font ses actions, ni où sont les récompenses. Il doit le découvrir en agissant.
C’est le problème de l’apprentissage par renforcement, et il est bien plus proche de la situation où se trouve tout agent réel.
A. Apprendre de la différence entre estimations successives
Supposons que l’agent suive une politique dans le monde de Russell & Norvig, où chaque pas coûte et où les récompenses ne sont pas actualisées (), et croie actuellement et . Il observe alors une transition de vers . Si cette transition se produisait à chaque fois, les deux utilités devraient satisfaire la relation de Bellman pour , - et elles ne la satisfont pas tout à fait. L’estimation en semble un peu basse. (Avec le utilisé plus loin dans cet article, la cible vaudrait , et la même estimation semblerait haute.)
Le remède est de la pousser vers la cohérence. En observant une transition :
où est un taux d’apprentissage. C’est la mise à jour par différence temporelle (TD), ainsi nommée parce qu’elle est pilotée par la différence entre les estimations d’utilité à des pas de temps successifs.
La quantité entre parenthèses est l’erreur TD : ce que nous venons d’observer, , moins ce que nous croyions, . Une erreur nulle signifie que nos estimations sont localement cohérentes et rien ne change. Toutes les méthodes TD fonctionnent ainsi - en ajustant les estimations vers l’équilibre qui tient quand elles sont correctes.
Pourquoi c’est remarquable. La mise à jour ne mentionne aucune probabilité. L’agent n’estime jamais . Pourtant, parce que les transitions sont échantillonnées depuis le vrai modèle, les transitions fréquentes déclenchent la mise à jour proportionnellement souvent, et le moyennage se fait implicitement. Le modèle n’est jamais appris, seulement obéi.
B. Des utilités aux valeurs d’action
Le TD tel qu’écrit apprend - à quel point un état est bon. Ce n’est pas directement actionnable : pour choisir, un agent doit savoir à quel point chaque action disponible est bonne, et convertir en un choix suppose de savoir où mènent les actions, c’est-à-dire précisément le modèle dont nous ne disposons pas.
Apprenons donc plutôt des valeurs d’action. Définissons comme l’utilité espérée de prendre l’action dans l’état . Les deux sont reliées par
et un agent détenant peut agir sans aucun modèle : consulter la ligne de l’état courant et prendre la plus grande entrée.
C. La mise à jour du Q-learning
Elle s’applique chaque fois que l’action est prise en et mène à . C’est l’idée TD, l’utilité d’état étant remplacée par la meilleure valeur d’action disponible à l’état suivant.
Le est le détail crucial. L’agent remonte la valeur de la meilleure action en , indépendamment de ce qu’il fait ensuite. Cela rend le Q-learning hors politique : il apprend la politique optimale tout en se comportant selon une autre, plus exploratoire.
Son proche parent SARSA - pour state, action, reward, state, action - utilise à la place l’action réellement prise :
Cela rend SARSA sur politique : il apprend la valeur de la politique suivie, exploration comprise. Pour un agent purement glouton les deux coïncident. Dès qu’il y a exploration ils diffèrent, et la différence compte : le Q-learning peut apprendre un bon comportement même guidé par une politique d’exploration aléatoire ou hostile, tandis que SARSA est plus réaliste quand la politique échappe en partie au contrôle de l’agent - par exemple quand d’autres agents partagent l’environnement.
D. La mécanique, pas à pas
Reprenons le monde de l’article précédent : états non terminaux avec
, terminaux GOAL et PIT , et . Toutes les
valeurs partent de zéro. Prenons .
Supposons que l’agent fasse GOAL, deux fois.
Mise à jour 1, . Tous les valent encore :
Mise à jour 2, GOAL, dont la valeur est :
Mise à jour 3, à nouveau - mais a désormais une valeur :
Mise à jour 4, GOAL :
.
| Mise à jour | Paire | Avant | Après |
|---|---|---|---|
| 1 | 0.0000 | −0.0200 | |
| 2 | 0.0000 | 0.4300 | |
| 3 | −0.0200 | 0.1635 | |
| 4 | 0.4300 | 0.6450 |
Remarquez comment la valeur se propage à rebours : rien d’utile n’atteint avant que ait appris quelque chose.
Cette séquence particulière converge vers le mauvais nombre, et c’est tout l’intérêt. Les deux épisodes ci-dessus ont été choisis à la main pour atteindre
GOAL. Ne répéter qu’eux pousse vers - la valeur d’un Right qui réussit toujours. Mais Right n’atteintGOALque 80 % du temps ; les 20 % restants il tombe dansPIT. La valeur correcte est . Le Q-learning y parvient uniquement parce que l’expérience réelle échantillonne les deux issues dans la bonne proportion. Un échantillon biaisé donne une réponse biaisée.
E. Exploration contre exploitation
Un agent qui prend toujours sa meilleure action courante peut ne jamais en découvrir une meilleure. Un agent qui agit toujours au hasard apprend sur tout et n’exploite rien. C’est le compromis exploration–exploitation.
La réponse praticable la plus simple est l’-glouton : agir de façon gloutonne avec probabilité , au hasard avec probabilité . Pourvu que décroisse avec le temps, l’agent explore assez tôt pour trouver les bonnes actions et exploite assez tard pour accumuler de la récompense. Des schémas plus raffinés utilisent une fonction d’exploration qui gonfle la valeur des paires état–action rarement essayées, ce qui demande de tenir des compteurs de visites.
La figure ci-dessous applique la même mise à jour dans un monde légèrement différent, si bien que ses nombres ne sont pas ceux du tableau : deux états A et B, un terminal valant atteint en allant à droite depuis B, et un Right qui échoue 20 % du temps en ramenant l’agent en A plutôt que dans un piège. Elle commence par cinq trajets scriptés qui réussissent tous, dans l’ordre B, B, A, B, A. Parcourez-les et observez l’ordre plutôt que les nombres. A reste exactement à zéro pendant les deux premiers trajets, car aucun ne part de A, et sa première mise à jour trouve alors B déjà à . Échantillonnez ensuite l’environnement réel de l’agent. Un régime de trajets toujours réussis converge vers 0,8600 pour B, la valeur d’un monde où aller à droite marche toujours. Seul le dérapage enseigne le contraire.
Interactif : la valeur remonte d’un pas à la fois
Les cinq trajets de la leçon, puis l’environnement réel de l’agent.
La table Q
- Q(A, droite)
- 0.0000
- Q(B, droite)
- 0.0000
- Trajets effectués
- 0
- Dernière erreur TD
- -
Toutes les valeurs Q partent de zéro, y compris celle du terminal : l’agent n’y est jamais allé et ignore qu’il paie. Voilà pourquoi le premier trajet depuis B fait baisser la valeur à -0,02 au lieu de la monter : tout ce qu’il a appris, c’est que vivre coûte 0,04.
F. Retrouve-t-il vraiment l’optimum planifié ?
L’article précédent a calculé la réponse exacte en planifiant avec pleine connaissance du modèle : et . Un Q-learner ne voit jamais ce modèle. Exécutons-le sur 200 000 épisodes avec et un taux d’apprentissage décroissant :
S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.
Il affiche :
| Paire | appris |
|---|---|
| 0.3847 | |
| 0.3082 | |
| 0.3253 | |
| 0.4926 |
Prendre donne et , contre les et planifiés - et la politique gloutonne lue sur ces valeurs est Right dans les deux états, exactement la politique produite par l’itération sur les valeurs. L’agent a retrouvé le comportement optimal sans qu’on lui dise jamais ce que font ses actions.
Le petit écart résiduel est une honnête erreur d’échantillonnage, non un bug : les estimations sont des moyennes sur un nombre fini de transitions échantillonnées, et elles se resserrent lentement à mesure que le taux d’apprentissage décroît. C’est le compromis standard - le Q-learning vous demande bien moins que l’itération sur les valeurs, et le paie en efficacité d’échantillonnage.
G. Les limites
Tout ce qui précède suppose une table à une entrée par paire état–action. C’est très bien pour quatre entrées et sans espoir pour les échecs ou pour tout environnement à état continu. Les vrais problèmes exigent de la généralisation : approximer par une fonction paramétrée plutôt que l’énumérer, et c’est là que l’apprentissage par renforcement rejoint le reste de l’apprentissage automatique.
Une seconde limite est que les agents Q-learning ne peuvent pas anticiper. Ne sachant pas où mènent les actions, ils ne peuvent pas planifier une séquence comme le fait un agent fondé sur un modèle - ils ne peuvent que comparer les valeurs d’action apprises. L’affranchissement du modèle s’achète au prix de la prévoyance.
À retenir
- L’apprentissage par renforcement abandonne l’hypothèse du PDM selon laquelle le modèle est connu ; l’agent apprend de l’expérience à la place.
- La mise à jour TD pousse les estimations vers la cohérence locale, sans aucune probabilité - l’échantillonnage fournit le moyennage implicitement.
- rend la sélection d’action indépendante du modèle, avec .
- La règle du Q-learning remonte , ce qui la rend hors politique ; SARSA remonte l’action réellement prise et est sur politique.
- La valeur se propage à rebours depuis les récompenses, une mise à jour par pas.
- Un échantillon de transitions biaisé donne un biaisé ; la correction repose sur le fait d’expérimenter les issues dans leurs vraies proportions.
- Notre apprenant a atteint et contre les et planifiés, retrouvant la politique optimale sans modèle.
- Le tabulaire ne passe pas à l’échelle ; la généralisation est le pont vers le reste de l’apprentissage automatique.
La suite
Le problème d’exploration, l’erreur d’échantillonnage ci-dessus et la question de l’attribution du mérite ont toutes une saveur théorie de l’information. L’entropie et l’information rend précise la notion de « combien d’incertitude reste-t-il ».
Références et lectures complémentaires
- Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, Pearson (3rd edition), 2010· Bibliothèque de référence Kudos AI
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.