تخطّي إلى المحتوى
Kudos AI

Gridworld RL Lab

تكرار القيمة وتكرار السياسة وQ-learning على عالم الشبكة نفسه، لمقارنة مُخطِّط يعرف النموذج مباشرةً بمُتعلِّم لا يعرفه.

Python (NumPy)نشط

عملية قرار ماركوفية صغيرة تُستخدم بيئةً مضبوطة لمقارنة التخطيط بالتعلّم. يُنفَّذ أولًا تكرار القيمة وتكرار السياسة، بمعرفة كاملة بنموذج الانتقال، لحساب دالة القيمة والسياسة المثلى بدقّة. ثم يُنفَّذ Q-learning على العالم نفسه دون أي نموذج، متعلِّمًا من انتقالات مُعايَنة فقط، وتُقارَن تقديراته بالحقيقة المرجعية المُخطَّطة - وهذا ما يجعل المقارنة مُفيدة: يستعيد المُتعلِّم السياسة المثلى نفسها بينما تبقى تقديراته للقيمة منحرفة قليلًا، والفجوة المتبقّية خطأ معاينة لا خلل. ويكشف المختبر أيضًا المعاملات التي تحكم السلوك فعليًا: عامل الخصم ومعدّل التعلّم وجدول الاستكشاف، إذ يُظهر المسح على إبسيلون لماذا قد يستقرّ مُتعلِّم جشِع بحت على سياسة أسوأ. التنفيذ جارٍ ولم يُنشر بعد أي مستودع للمصدر.

أبرز النقاط

  • تكرار القيمة وتكرار السياسة حتى التقارب مقابل نموذج انتقال معلوم
  • Q-learning على العالم ذاته دون نموذج، مُقارَنًا بالأمثل المُخطَّط
  • التقارب مُتتبَّع في كل مسح، فيغدو الانكماش نحو النقطة الثابتة مرئيًا
  • مسح جدول إبسيلون لإظهار مُتعلِّم جشِع يتقارب نحو سياسة أسوأ

مقالات ذات صلة

قراءة 9 دقيقةReinforcement Learning

Markov Decision Processes

How to plan when actions do not reliably do what you intend: states, transition models, rewards and discounting, the Bellman equation, and value iteration worked numerically to its fixed point.

التعلّم المعزّزالاحتمالاتالذكاء الاصطناعي
قراءة 9 دقيقةReinforcement Learning

Reinforcement Learning and Q-Learning

Learning to act well without a model of the world: temporal-difference updates, the Q-learning rule, exploration versus exploitation, and a run that recovers the planned optimum from experience alone.

التعلّم المعزّزتعلّم الآلةالذكاء الاصطناعي