تخطّي إلى المحتوى
Kudos AI

جدول معدّل التعلّم

قاعدة تغيّر حجم الخطوة عبر التدريب: كبيرةً في البداية ليستطيع التنفيذ السفر، وصغيرةً في النهاية ليستطيع الاستقرار.

يُعرف أيضاً باسم: جدول حجم الخطوة, تضاؤل معدّل التعلّم

فهم جدول معدّل التعلّم

حجم الخطوة هو الوسيط الفائق الوحيد الذي لا بد أن يكون خاطئًا في لحظةٍ ما من التدريب إن ظل ثابتًا. ففي البداية تكون الوسائط بعيدة عن أي صغرى والخطوات الكبيرة هي ما يقدّم؛ وفي النهاية يغلب ضجيجُ الدفعات الصغيرة على تقدير التدرّج، فتحيل الخطوة الكبيرة ذلك الضجيج خطأً دائمًا. والجدول يحلّ التعارض بجعل الخطوة دالةً في الزمن.

والمطلوب دقيق. فقد بيّن روبنز ومونرو أن التقريب العشوائي يتقارب حين تحقق الخطوات شرطين معًا: أن يتباعد مجموعها كي يظل بوسع المتكرِّر بلوغ أمثلٍ مهما بعُد، وأن يكون مجموع مربعاتها منتهيًا كي يكون الضجيج المحقون قابلًا للجمع. والخطوة الثابتة تحقق الأول وتخفق في الثاني، وهذا بعينه سبب ركودها عند أرضية. والخطوة المتضائلة كـ‎1/t²‎ تحقق الثاني وتخفق في الأول، وقد ينفد منها السفر قبل الوصول.

والإحماء - رفع المعدّل من قرابة الصفر خلال أول مئات أو آلاف الخطوات - يُذكر كثيرًا في نفس النفَس مع التضاؤل، لكنه يجيب عن سؤال آخر. فحدّ الاستقرار على خطوة التدرّج هو ‎η < 2/L‎، وفي شبكة غير مدرَّبة يتحرك ‎L‎ سريعًا في الخطوات الأولى. والانطلاق من دون الحدّ ثم الصعود إليه يتفادى تباعدًا لا صلة له بالضجيج أصلًا.

وعمليًا يقترن الجدول بطريقة تكيّفية بدل أن يُختار بديلًا عنها. فآدم والزخم يغيّران اتجاه الخطوة وحجمها الفعّال؛ والجدول يحكم المقياس الإجمالي. والاثنان يحلّان نصفَي المسألة الواحدة - تقدّم سريع مبكرًا، وكرة ضجيج تُغلق في النهاية - ولهذا تنصّ كل وصفة تدريب منشورة تقريبًا على الاثنين.

كيفية الحساب

Σ_t η_t = ∞, Σ_t η_t² < ∞

حيث

η_t
معدّل التعلّم عند الخطوة t
Σ_t η_t = ∞
يحتفظ التنفيذ بسفرٍ كلي يكفي لبلوغ الأمثل من أي منطلق
Σ_t η_t² < ∞
الضجيج المحقون على امتداد التنفيذ منتهٍ، فيستطيع المتكرِّر الاستقرار

مثال على جدول معدّل التعلّم

مسألةُ مربعات صغرى تُشغَّل بدفعات صغيرة من 8 وخطوة ثابتة قدرها ‎0.20‎ تستقر على مسافة جذر متوسط مربعات قدرها ‎0.109343‎ من الأمثل وتلبث فيها مهما طال التشغيل. وتنصيف الخطوة إلى ‎0.10‎ لا يزحزح الأرضية إلا إلى ‎0.075358‎، لأن نصف القطر ينمو بمقدار ‎√η‎.

واستبدال ‎η_t = 0.20/(1 + t/500)‎ بالثابت - المعدّل الابتدائي نفسه، والبيانات نفسها، والبذرة نفسها - يبلغ بالتنفيذ ‎0.009909‎ على الأفق ذاته، أي أقرب أحد عشر ضعفًا، وهو لا يزال يتحسّن حين أُوقف.

وسرعة التضاؤل نفسها اختيار: على هذا الأفق يبلغ ‎τ = 500‎ مقدار ‎0.009909‎، ويبلغ ‎τ = 2000‎ مقدار ‎0.019304‎، ولا يزال ‎τ = 10٬000‎ عند ‎0.040247‎. والجدول الشديد البطء في التضاؤل يقضي التنفيذ عند الأرضية التي يسعى إلى مغادرتها.

المزايا والعيوب

المزايا

  • يزيل أرضية الضجيج التي تثبّت تنفيذًا ذا خطوة ثابتة دون الأمثل.
  • يتيح خطوةً أولى كبيرة لتقدّم سريع دون دفع ثمنها في النهاية.
  • لا يكلّف شيئًا: فهو تغيير في عدد قياسي واحد لكل خطوة، لا في النموذج ولا في البيانات.

العيوب

  • يضيف وسائطه الفائقة - المعدّل الابتدائي وشكل التضاؤل والأفق - وهي تتفاعل مع حجم الدفعة.
  • الجدول المضبوط لطول تنفيذ معيّن قد يكون سيئًا جدًا لطول آخر، إذ تُعرَّف معظم الأشكال نسبةً إلى عدد الخطوات الكلي.
  • والتضاؤل المبكر جدًا يجمّد التقدّم عند ما تصادف أن تكون عليه الوسائط.

الأسئلة الشائعة

لماذا لا نوقف التدريب ببساطة حين تستوي الخسارة؟

لأن الاستواء تحت خطوة ثابتة ليس صغرى عادةً - بل هو حافة كرة ضجيج يحدّد حجمُ الخطوة نصفَ قطرها. وتضاؤل المعدّل عند تلك اللحظة يُحدث عادةً هبوطًا إضافيًا في الخسارة، وهو ما يجعل الجداول الدرَجية تبدو بهذا الوقع على منحنى التدريب.

هل يُغني آدم عن الجدول؟

لا. فآدم يعيد قياس الخطوة لكل إحداثي، وهذا شرطُ مسألة لا خفضُ ضجيج - وهو يستقر في كرة كذلك، بل في كرة أوسع قليلًا لأنه يقطع مسافة أكبر في الخطوة. وعلى التنفيذات الطويلة ينتهي ‎SGD‎ بسيطًا مع جدول أقرب إلى الأمثل من آدم بخطوة ثابتة مرارًا.

هل التضاؤل الجيبي أفضل من الدرَجي؟

الفرق بين الجداول المعقولة ضئيل أمام الفرق بين وجود جدول وعدمه. والجيبي شائع لأنه لا يطلب إلا ميزانية خطوات كلية ولا حافة فيه؛ والدرَجي أيسر في التعقّل حين يحتمل طول التدريب أن يتغير أثناءه.

الخلاصة

جدول معدّل التعلّم هو ما يحوّل انحدار التدرّج العشوائي من طريقة تدور حول الأمثل إلى طريقة تبلغه. وشرطا روبنز-مونرو يقولان ما يجب أن يفعله أي جدول صالح، واختيار الشكل أقل أهمية بكثير من الالتزام بهما.