فهم تعلّم Q
دالة القيمة على الحالات وحدها ليست قابلة للتنفيذ مباشرةً بلا نموذج: فمعرفة أن حالة مجاورة ثمينة لا تخبرك أي فعل يبلغها، ما لم تكن احتمالات الانتقال معلومة. وتتجاوز دالة Q هذا بإلحاق القيم بأزواج الحالة-الفعل مباشرةً، فيكون أفضل فعل في حالةٍ هو ببساطة صاحب أعلى قيمة Q.
ويوضّح راسل ونورفيغ النتيجة صراحةً: لأن المتعلّم الحائز لدالة Q لا يحتاج نموذج انتقال لا للتعلّم ولا لاختيار الفعل، فتعلّم Q طريقة بلا نموذج. وهو يتصل بدالة قيمة الحالة عبر المطابقة القائلة إن قيمة الحالة هي أعظم قيمة Q على الأفعال المتاحة فيها.
ويمضي التعلّم عبر تحديثات الفرق الزمني. فبعد أخذ فعل ورصد المكافأة والحالة الناتجة، يكوّن العميل هدفًا: المكافأة المتلقاة زائد أفضل قيمة Q مخصومة متاحة عند الحالة الجديدة. والفجوة بين هذا الهدف والتقدير الحالي هي خطأ الفرق الزمني، ويُدفع التقدير نحو الهدف بكسر يحدّده معدل التعلّم.
والخوارزمية خارج السياسة، وهذه أنفع خصائصها البنيوية. فالتحديث يأخذ دائمًا الأعظم على الأفعال التالية، فيتعلم السياسة المثلى بصرف النظر عن سلوك العميل الفعلي أثناء جمع التجربة. وهذا يتيح استكشافًا مقصودًا، عادةً بنهج ε-الجشع: أخذ أفضل فعل معلوم في معظم الأحيان وفعل عشوائي أحيانًا، دون إفساد ما يُتعلَّم.
كيفية الحساب
Q(s, a) ← Q(s, a) + α [ r + γ max_{a′} Q(s′, a′) − Q(s, a) ]
حيث
- Q(s, a)
- العائد المقدَّر من أخذ a في s ثم التصرف على النحو الأمثل
- α
- معدل التعلّم، أي كم يتحرك التقدير نحو الهدف
- r
- المكافأة المرصودة فعلًا لهذا الانتقال
- γ
- معامل الخصم على القيمة المستقبلية
- max_{a′} Q(s′, a′)
- أفضل قيمة متاحة من الحالة الناتجة
مثال على تعلّم Q
في عالم شبكي يحتفظ العميل بجدول فيه مدخل لكل زوج حالة-فعل، مهيّأ اعتباطيًا. ويتصرف على نهج ε-الجشع، ويرصد المكافأة والخلية التالية، ويطبّق التحديث. وفي البداية تكون التقديرات بلا معنى ويبدو السلوك عشوائيًا.
وتنتشر المعلومات رجوعًا من المكافأة. ففي أول مرة يُبلَغ فيها الهدف ترتفع قيمة Q للفعل الذي دخل الهدف. وفي زيارة لاحقة للحالة التي تسبقه يرى التحديثُ أعظمَ قيمةٍ صارت أكبر عند الحالة التالية، فترتفع قيمته هو أيضًا. وهكذا تنتشر القيمة من الهدف خطوةً واحدة لكل زيارة.
وهذا الانتشار الرجعي هو أيضًا الضعف العملي للطريقة: فمع المكافآت المتناثرة قد يلزم عدد هائل من الحلقات لتبلغ الإشارةُ الحالاتِ التي تُتخذ فيها القرارات المبكرة الحاسمة. وتشكيل المكافأة وتقنيات إعادة التشغيل موجودة في معظمها لتسريعه.
الأسئلة الشائعة
ماذا يعني «بلا نموذج» هنا؟
أن العميل لا يحتاج قط إلى معرفة أو تقدير احتمال بلوغ حالة من أخرى. فهو يتعلم من الانتقالات والمكافآت المرصودة وحدها، وهذا مهم لأن تلك الاحتمالات غير متوافرة في معظم البيئات الواقعية.
ما الفرق بين التعلّم داخل السياسة وخارجها؟
الطرق خارج السياسة مثل تعلّم Q تتعلم السياسة المثلى بينما تتبع سياسة استكشافية مغايرة، لأن التحديث يأخذ الأعظم على الأفعال التالية. أما الطرق داخل السياسة مثل SARSA فتتعلم قيمة السياسة المتبَعة فعلًا، بما فيها الاستكشاف.
كيف يختلف تعلّم Q العميق؟
الجدول يحتاج مدخلًا لكل زوج حالة-فعل، وهذا مستحيل في فضاءات الحالات الكبيرة أو المتصلة. وتستبدل شبكات Q العميقة بالجدول شبكةً عصبية تقارب Q، فتتيح التعميم عبر الحالات المتشابهة على حساب ضمانات الاستقرار التي تتمتع بها الصيغة الجدولية.
الخلاصة
يقدّر تعلّم Q قيمة كل فعل في كل حالة من التجربة مباشرةً، دون حاجة إلى نموذج للبيئة ومع تحمّل السلوك الاستكشافي مع بقائه متقاربًا نحو السياسة المثلى. وقد قُدِّم في أطروحة واتكينز سنة 1989، ويظل الأساس المفاهيمي لكثير من التعلّم المعزَّز العميق الحديث.