Comprendre Apprentissage Q
Une fonction de valeur sur les seuls états n’est pas directement actionnable sans modèle : savoir qu’un état voisin est précieux ne dit pas quelle action y mène, à moins que les probabilités de transition ne soient connues. Une fonction Q contourne cela en attachant des valeurs directement aux paires état-action, si bien que la meilleure action dans un état est simplement celle de plus grande valeur Q.
Russell et Norvig rendent la conséquence explicite : parce qu’un apprenant détenant une fonction Q n’a besoin d’aucun modèle de transition, ni pour apprendre ni pour choisir ses actions, l’apprentissage Q est une méthode sans modèle. Il se relie à la fonction de valeur d’état par l’identité selon laquelle la valeur d’un état est la valeur Q maximale sur les actions qui y sont disponibles.
L’apprentissage procède par mises à jour de différence temporelle. Après avoir joué une action et observé la récompense ainsi que l’état résultant, l’agent forme une cible : la récompense reçue plus la meilleure valeur Q actualisée disponible au nouvel état. L’écart entre cette cible et l’estimation courante est l’erreur de différence temporelle, et l’estimation est déplacée vers la cible d’une fraction fixée par le taux d’apprentissage.
L’algorithme est hors politique, et c’est sa propriété structurelle la plus utile. La mise à jour prend toujours le maximum sur les actions suivantes : elle apprend donc la politique optimale quel que soit le comportement effectif de l’agent pendant la collecte de l’expérience. Cela autorise une exploration délibérée, typiquement ε-gloutonne, prenant la meilleure action connue la plupart du temps et une action au hasard à l’occasion, sans corrompre ce qui est appris.
Comment calculer
Q(s, a) ← Q(s, a) + α [ r + γ max_{a′} Q(s′, a′) − Q(s, a) ]
où
- Q(s, a)
- le retour estimé si l’on joue a dans s puis agit optimalement
- α
- le taux d’apprentissage, de combien l’estimation se déplace vers la cible
- r
- la récompense effectivement observée pour cette transition
- γ
- le facteur d’actualisation sur la valeur future
- max_{a′} Q(s′, a′)
- la meilleure valeur disponible depuis l’état résultant
Exemple : Apprentissage Q
Dans un monde en grille, l’agent tient une table à une entrée par paire état-action, initialisée arbitrairement. Il agit de façon ε-gloutonne, observe la récompense et la case suivante, et applique la mise à jour. Au début, les estimations n’ont aucun sens et le comportement paraît aléatoire.
L’information se propage à rebours depuis la récompense. La première fois que le but est atteint, la valeur Q de l’action qui y est entrée augmente. Lors d’une visite ultérieure à l’état précédent, la mise à jour voit un maximum désormais plus grand à l’état suivant, si bien que sa propre valeur augmente aussi. La valeur se répand depuis le but à raison d’un pas par visite.
Cette propagation à rebours est aussi la faiblesse pratique de la méthode : avec des récompenses rares, il peut falloir un très grand nombre d’épisodes pour que le signal atteigne les états où se prennent les décisions initiales décisives. Le façonnage des récompenses et les techniques de rejeu existent en grande partie pour l’accélérer.
Questions fréquentes
Que signifie « sans modèle » ici ?
Que l’agent n’a jamais besoin de connaître ni d’estimer la probabilité d’atteindre un état depuis un autre. Il apprend uniquement des transitions et récompenses observées, ce qui importe car dans la plupart des environnements réalistes ces probabilités sont indisponibles.
Quelle différence entre apprentissage sur politique et hors politique ?
Les méthodes hors politique comme l’apprentissage Q apprennent la politique optimale tout en suivant une autre politique, exploratoire, parce que la mise à jour prend le maximum sur les actions suivantes. Les méthodes sur politique comme SARSA apprennent la valeur de la politique effectivement suivie, exploration comprise.
En quoi l’apprentissage Q profond diffère-t-il ?
Une table demande une entrée par paire état-action, ce qui est impossible pour de grands espaces d’états ou des espaces continus. Les réseaux Q profonds remplacent la table par un réseau de neurones approximant Q, ce qui permet de généraliser entre états semblables au prix des garanties de stabilité dont jouit la version tabulaire.
En résumé
L’apprentissage Q estime directement de l’expérience la valeur de chaque action dans chaque état, sans modèle de l’environnement et en tolérant un comportement exploratoire tout en convergeant vers la politique optimale. Introduit dans la thèse de Watkins en 1989, il reste la base conceptuelle d’une grande partie de l’apprentissage par renforcement profond moderne.