Markov Decision Processes
How to plan when actions do not reliably do what you intend: states, transition models, rewards and discounting, the Bellman equation, and value iteration worked numerically to its fixed point.
تكرار القيمة وتكرار السياسة وQ-learning على عالم الشبكة نفسه، لمقارنة مُخطِّط يعرف النموذج مباشرةً بمُتعلِّم لا يعرفه.
عملية قرار ماركوفية صغيرة تُستخدم بيئةً مضبوطة لمقارنة التخطيط بالتعلّم. يُنفَّذ أولًا تكرار القيمة وتكرار السياسة، بمعرفة كاملة بنموذج الانتقال، لحساب دالة القيمة والسياسة المثلى بدقّة. ثم يُنفَّذ Q-learning على العالم نفسه دون أي نموذج، متعلِّمًا من انتقالات مُعايَنة فقط، وتُقارَن تقديراته بالحقيقة المرجعية المُخطَّطة - وهذا ما يجعل المقارنة مُفيدة: يستعيد المُتعلِّم السياسة المثلى نفسها بينما تبقى تقديراته للقيمة منحرفة قليلًا، والفجوة المتبقّية خطأ معاينة لا خلل. ويكشف المختبر أيضًا المعاملات التي تحكم السلوك فعليًا: عامل الخصم ومعدّل التعلّم وجدول الاستكشاف، إذ يُظهر المسح على إبسيلون لماذا قد يستقرّ مُتعلِّم جشِع بحت على سياسة أسوأ. التنفيذ جارٍ ولم يُنشر بعد أي مستودع للمصدر.
How to plan when actions do not reliably do what you intend: states, transition models, rewards and discounting, the Bellman equation, and value iteration worked numerically to its fixed point.
Learning to act well without a model of the world: temporal-difference updates, the Q-learning rule, exploration versus exploitation, and a run that recovers the planned optimum from experience alone.