فهم التنظيم
ملاءمة نموذج بتصغير خطأ التدريب وحده تمنحه كل الدوافع للالتواء نحو عيّنة التدريب. ويغيّر التنظيم الهدف: فبدل تصغير الخطأ وحده، يصغّر النموذج الخطأ زائد عقوبة تنمو مع حجم بارامتراته. وعلى الملاءمات الكبيرة المتقنة أن تبرّر نفسها الآن أمام تلك الكلفة، فيرضى النموذج بملاءمة أبسط ما لم تدعم البيانات فعلاً ما هو أكثر.
وتتصرّف العقوبتان الكلاسيكيتان تصرّفاً مختلفاً. فعقوبة L2، وهي مجموع مربّعات المعاملات، تعطي انحدار ريدج. وتدرّجها متناسب مع المعامل نفسه، فتقلّص كل معامل نحو الصفر تقليصاً ناعماً دون بلوغه؛ وتميل المتنبّئات المترابطة إلى تقاسم التأثير بينها. أما عقوبة L1، وهي مجموع القيم المطلقة، فتعطي لاسو. وتدرّجها ثابت المقدار، وهو ما يكفي لدفع معاملات إلى الصفر تماماً، فيؤدّي النموذج المُلائَم اختياراً للمتغيّرات وينتج نتيجةً متناثرة أيسر تفسيراً.
وكلتاهما تعبير عن مقايضة التحيّز والتباين. فتقليص المعاملات بعيداً عن قيم المربّعات الصغرى يُدخل تحيّزاً، إذ لم يعد النموذج المُلائَم أفضل ملاءمة ممكنة لبيانات التدريب. وفي المقابل تصير الملاءمة أقل حساسية بكثير لأي مشاهدات صودف سحبها. وحين تكثر المتنبّئات أو تتداخل خطياً، تكون تلك المقايضة مؤاتية بقوة عادةً.
وتتعمّم الفكرة إلى ما وراء النماذج الخطية بكثير. ففي الشبكات العصبية تظهر عقوبة L2 نفسها باسم اضمحلال الأوزان، وتعمل أدوات أخرى - الإسقاط العشوائي والإيقاف المبكر وتوسيع البيانات - منظِّمات وإن لم تضف حدّ عقوبة صريحاً. وكلها تحدّ من دقة مطابقة النموذج لعيّنة تدريبه.
كيفية الحساب
minimize L(θ) + λ · P(θ), where P(θ) = Σⱼ θⱼ² (L2) or Σⱼ |θⱼ| (L1)
حيث
- L(θ)
- الخسارة الاعتيادية المقيسة على بيانات التدريب
- P(θ)
- العقوبة على مقدار البارامترات
- λ
- قوة التنظيم، وهي تضبط المقايضة
مثال على التنظيم
انظر في انحدار بمتنبّئات كثيرة، عدّة منها شديدة الارتباط. تستطيع المربّعات الصغرى الاعتيادية إنتاج معاملات كبيرة متعاكسة الإشارة يلغي بعضها بعضاً: فتكون الملاءمة جيدة على بيانات التدريب لكنها غير مستقرة بشدّة، إذ ستعطي عيّنة مختلفة قليلاً معاملات مختلفة جداً.
وتطبيق عقوبة L2 يكبح ذلك السلوك. فالمعاملات المتعاكسة الكبيرة مكلفة، فتوزّع الملاءمة التأثير توزيعاً أكثر تساوياً على المتنبّئات المترابطة وتصير المعاملات أثبت بكثير عبر العيّنات.
أما تطبيق عقوبة L1 بقوة مماثلة فيفعل شيئاً مختلفاً نوعياً: إذ يدفع معظم معاملات المتنبّئات المترابطة إلى الصفر تماماً ويُبقي واحداً. والنتيجة أكثر تناثراً وأيسر تفسيراً، لكن أي متنبّئ ينجو قد يكون اعتباطياً بعض الشيء حين تكون المجموعة المترابطة شبه متبادلة.
الأسئلة الشائعة
كيف تُختار قوة العقوبة؟
بالتحقّق المتقاطع. فالقوة لا يمكن ملاءمتها من بيانات التدريب، لأن العقوبات الأكبر ترفع خطأ التدريب دائماً بحكم البناء. فتُقيَّم شبكة من القيم المرشّحة بالتحقّق المتقاطع وتُختار التي تصغّر خطأ الاختبار المقدَّر.
هل يُعاقَب المقطع؟
عادةً لا. فالمقطع يمثّل المستوى الأساس للاستجابة لا تأثير أي متنبّئ، ومعاقبته ستجعل الملاءمة تتوقّف على موضع تمركز الاستجابة.
لماذا يجب توحيد مقاييس السمات قبل التنظيم؟
العقوبة تُطبَّق على مقادير المعاملات، ومقدار المعامل يتوقّف على وحدات سمته. وبلا توحيد المقاييس، تنال سمةٌ مقيسة بوحدات صغيرة معاملاً كبيراً فتُعاقَب أشدّ لمجرّد مقياسها.
الخلاصة
يبادل التنظيم قدراً مضبوطاً من التحيّز بخفض أكبر في التباين بجعل التعقيد مكلفاً. فـL2 يقلّص المعاملات تقليصاً ناعماً ويثبّت المتنبّئات المترابطة؛ وL1 يصفّرها ويختار السمات. وفي الحالين تكون القوة بارامتراً فائقاً لا تحدّده إلا بيانات محجوزة.