Aller au contenu
Kudos AI

Models of Delayed Reinforcement Learning

Christopher J. C. H. Watkins · 1989 · Thèse de doctorat, département de psychologie, université de Cambridge

Apprentissage par renforcementApprentissage automatiqueVoir la source ↗

Résumé

Développe le Q-learning, un algorithme qui estime directement la valeur de chaque action dans chaque état à partir de l’expérience, sans exiger de modèle des probabilités de transition de l’environnement.

Pourquoi c’est important

Il a fourni un moyen d’apprendre un comportement optimal par essais et erreurs sans savoir comment fonctionne l’environnement, ce qui est la situation normale en pratique. Russell et Norvig créditent cette thèse du développement du Q-learning, et elle reste la base conceptuelle des réseaux Q profonds et d’une grande partie de l’apprentissage par renforcement moderne.