Models of Delayed Reinforcement Learning
Christopher J. C. H. Watkins · 1989 · Thèse de doctorat, département de psychologie, université de Cambridge
Résumé
Développe le Q-learning, un algorithme qui estime directement la valeur de chaque action dans chaque état à partir de l’expérience, sans exiger de modèle des probabilités de transition de l’environnement.
Pourquoi c’est important
Il a fourni un moyen d’apprendre un comportement optimal par essais et erreurs sans savoir comment fonctionne l’environnement, ce qui est la situation normale en pratique. Russell et Norvig créditent cette thèse du développement du Q-learning, et elle reste la base conceptuelle des réseaux Q profonds et d’une grande partie de l’apprentissage par renforcement moderne.