Models of Delayed Reinforcement Learning
Christopher J. C. H. Watkins · 1989 · أطروحة دكتوراه، قسم علم النفس، جامعة كامبريدج
ملخّص
يطوّر تعلّم Q، وهي خوارزمية تقدّر قيمة كل فعل في كل حالة مباشرةً من التجربة، بلا حاجة إلى نموذج لاحتمالات انتقال البيئة.
لماذا تهمّ
وفّر سبيلاً لتعلّم السلوك الأمثل بالتجربة والخطأ دون معرفة كيف تعمل البيئة، وهي الحالة الطبيعية عملياً. ويعزو راسل ونورفيغ تطوير تعلّم Q إلى هذه الأطروحة، وتبقى الأساس المفاهيمي لشبكات Q العميقة ولكثير من التعلّم المعزّز الحديث.