التنظيم: ريدج ولاسو
إضافة عقوبة على حجم المعاملات لمبادلة قليل من التحيّز بخفض كبير في التباين، ولماذا تصفّر عقوبة L1 معاملات بعينها تماماً بينما تكتفي L2 بتقليصها، مع ملاءمة الاثنتين عددياً.
المتطلبات المسبقة: الانحدار الخطي من المبادئ الأولى, مقايضة التحيّز والتباين
للمربّعات الصغرى هدف واحد: تصغير RSS قدر الإمكان على بيانات التدريب. وقد أظهرت مقايضة التحيّز والتباين لماذا لا يعني ذلك أن تكون مصيباً، وأظهر الانحدار اللوجستي معاملات تنطلق إلى حين لا يكبحها شيء.
يضيف التنظيم حدّاً ثانياً إلى دالة الهدف يجعل المعاملات الكبيرة مكلفة. والنتيجة أسوأ عمداً على بيانات التدريب، وأفضل كثيراً في الغالب على بيانات جديدة.
أ. انحدار ريدج
يصغّر ريدج RSS مضافاً إليها عقوبة تتناسب مع مجموع مربّعات المعاملات:
ويتحكّم بارامتر الضبط في المبادلة. فعند تختفي العقوبة ونستعيد المربّعات الصغرى. وحين تهيمن العقوبة وتُدفَع كل المعاملات نحو الصفر.
وثمّة تفصيلان مهمّان. المقطع لا يُعاقَب - فهو يحدّد المستوى العام فحسب، وتقليصه بلا معنى. ولأن العقوبة تعمل على مقادير المعاملات، يجب توحيد مقاييس المتنبّئات أولاً: وإلا لغيّر قياس متغيّر بالغرامات بدل الكيلوغرامات مقدارَ معاقبته، وهو خطأ بيّن.
ب. لاسو
يستبدل لاسو بالعقوبة التربيعية عقوبةً بالقيمة المطلقة:
يستخدم ريدج عقوبة ، ويستخدم لاسو عقوبة . ولهذا التغيير المفرد نتيجة لا تتناسب مع حجمه: فعقوبة تُجبر بعض المعاملات على أن تساوي الصفر تماماً متى صار كبيراً بما يكفي. أما ريدج فيقلّص المعاملات نحو الصفر لكنه، إلا في النهاية الحدّية، لا يبلغه أبداً.
والنموذج الذي يحوي أصفاراً تامّة يتجاهل تلك المتنبّئات كلياً، ومن ثم يؤدي لاسو اختيار المتغيّرات وينتج نماذج متناثرة - وهي عادةً أسهل تفسيراً بكثير من ملاءمة ريدج التي تُبقي المتنبّئات الـ جميعاً بمعاملات صغيرة.
ج. مراقبتهما وهما يتقلّصان
باستخدام مجموعة المشاهدات الخمس من الانحدار الخطي من المبادئ الأولى (، )، التي كانت ملاءمتها بالمربّعات الصغرى :
| ميل ريدج | مقطع ريدج | ميل لاسو | مقطع لاسو | |
|---|---|---|---|---|
| 0 | 0.6000 | 2.2000 | 0.6000 | 2.2000 |
| 0.1 | 0.5941 | 2.2178 | 0.5950 | 2.2150 |
| 1 | 0.5455 | 2.3636 | 0.5500 | 2.3500 |
| 5 | 0.4000 | 2.8000 | 0.3500 | 2.9500 |
| 10 | 0.3000 | 3.1000 | 0.1000 | 3.7000 |
| 12 | 0.2727 | 3.1818 | 0.0000 | 4.0000 |
| 20 | 0.2000 | 3.4000 | 0.0000 | 4.0000 |
تجذب الطريقتان الميل إلى أسفل كلما كبر ، ويرتفع المقطع تعويضاً - فهو غير معاقَب، ومن ثم يمتصّ المستوى.
والفارق في كيفية اقترابهما من الصفر هو بيت القصيد. ريدج يقسم: ميله ، فعند يساوي ، أي ثلث قيمته الأصلية، لكنه حيّ. أما لاسو فيطرح: ميله ، فيبلغ تماماً عند ويلبث عنده. ومن ثم يصبح النموذج مجرّد - أي أن المتنبّئ أُطفئ تماماً.
هذه الأرقام تلائم الخام لا موحَّد المقياس. ومع متنبّئ واحد لا يغيّر ذلك إلا قيمةَ التي تُنتج كل صف، لا شكلَ أيٍّ من المسارين.
يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.
يطبع تشغيله كل صف من الجدول، بما في ذلك
lambda=12 ridge 0.2727 3.1818 lasso 0.0000 4.0000. وانتبه إلى المقياس:
فـLasso في scikit-learn يقسم RSS على ، ومن ثم فإن alpha فيه تساوي
. ولو مُرِّرت كما هي لَلُوئم كل صف من صفوف لاسو بعقوبة أكبر
بعشر مرات من صف ريدج المجاور له.
تحفّظ على هذا العرض. مع متنبّئ واحد وخمس مشاهدات لا يوجد ما يُختار - فالتناثر لا يصير مثيراً للاهتمام إلا حين تكون بعض المتنبّئات غير ذات صلة فعلاً ويستطيع لاسو إطفاءها مع إبقاء البقية. يعرض الجدول الآلية بأمانة، لا السياق الذي تؤتي فيه ثمارها.
تفاعلي: ما الذي تفعله العقوبتان بمعامل
ثمانية متنبئات، ثلاثة منها صفر حقيقةً.
- لاسو: مُطفأة
- 3 من 8
- منها ضجيج حقيقي
- 3 / 3
- ريدج: مُطفأة
- 0 من 8
عند هذه العقوبة صيّر لاسو 3 من 8 معاملات صفرًا تمامًا، ومنها 3 من الثلاثة التي هي ضجيج حقيقةً. أما ريدج فلم يصيّر أيًّا منها صفرًا، ولن يفعل عند أي عقوبة: فمساراته تقترب من المحور اقترابًا مقاربًا. وهذا الفرق هو اختيار المتغيّرات بتمامه. ولاحظ أيضًا ترتيب الإطفاء عند لاسو: الأضعف أولًا، وهو السلوك النافع وهو كذلك السلوك الخطر حين يترابط متنبئان فيُبقي أحدهما اعتباطًا.
د. لماذا تتصرّف العقوبتان تصرّفاً مختلفاً
السرد الهندسي هو الأوضح. يمكن كتابة المسألتين هكذا: صغّر RSS تحت ميزانية على حجم المعاملات -
في بُعدين تكون ميزانية ريدج دائرة وميزانية لاسو معيّناً رؤوسه على المحاور. ويقع الحل حيث تلمس كنتورات RSS الإهليلجية منطقةَ الميزانية لأول مرة.
الدائرة بلا رؤوس، فلا تكاد نقطة التماس تقع على محور بالضبط - ويبقى المعاملان غير صفريين. أما رؤوس المعيّن فتقع على المحاور، والكنتورات المتمدّدة تصيب رأساً بسهولة. والرأس يعني أن أحد المعاملين صفر تماماً. وفي الأبعاد الأعلى يزداد عدد رؤوس المعيّن وحوافّه وأوجهه، وإصابة أحدها تصفّر عدة معاملات دفعةً واحدة.
هـ. لماذا يخفض هذا الخطأ
التنظيم هو مقايضة التحيّز والتباين مطبَّقةً عن عمد. فتقليص المعاملات بعيداً عن قيم المربّعات الصغرى يُدخل تحيّزاً: إذ لم يعد المقدّر متمركزاً على الحقيقة. لكنه يجعل الملاءمة أيضاً أقل حساسية بكثير لأي عيّنة بعينها سحبتها، وهو ما يخفض التباين.
وحين يهبط التباين أسرع مما يرتفع مربّع التحيّز، يهبط الخطأ الكلي المتوقّع. وهذا أرجح ما يكون حين تكون المربّعات الصغرى غير مستقرة: متنبّئات كثيرة قياساً بالمشاهدات، أو متنبّئات شديدة الارتباط. وفي الحالة القصوى لا يوجد للمربّعات الصغرى حلّ وحيد أصلاً. أما ريدج فيبقى له حلّ واحد بالضبط، ويبقى للاسو حلول لكنها ليست بالضرورة وحيدة (فعمودان متطابقان يمكنهما اقتسام وزنهما بطرق كثيرة بالكلفة نفسها).
ينمو التحيّز نمواً مطّرداً مع ويهبط التباين هبوطاً مطّرداً، ومن ثم توجد قيمة مثلى داخلية - ولا يمكن إيجادها من خطأ التدريب، الذي يفضّل دائماً. بل تُختار بـالتحقّق المتقاطع على شبكة من قيم .
و. الاختيار بينهما
| ريدج () | لاسو () | |
|---|---|---|
| المعاملات | مقلَّصة، وكلها مُبقاة | بعضها صفر تماماً |
| اختيار المتغيّرات | لا | نعم |
| قابلية التفسير | كل المتنبّئات | مجموعة جزئية متناثرة |
| الأفضل حين | متنبّئات كثيرة تهمّ قليلاً | متنبّئات قليلة تهمّ كثيراً |
| المتنبّئات المترابطة | يوزّع الوزن بينها | يميل إلى انتقاء واحد اعتباطاً |
لا يتفوّق أحدهما مطلقاً. إنها مسألة تجريبية خاصة بالمسألة، تُحسَم بالتحقّق المتقاطع لكليهما. والصف الأخير مطبّ عملي: فمع مجموعة من المتنبّئات المترابطة قد يكون اختيار لاسو الاعتباطي غير مستقر عبر إعادات المعاينة، ولهذا وُجدت الشبكة المرنة (elastic net) التي تجمع العقوبتين.
الخلاصات الأساسية
- يضيف التنظيم إلى RSS عقوبة على حجم المعاملات، يضبطها ، مبادلاً ملاءمة التدريب بالاستقرار.
- ريدج () يقلّص المعاملات نحو الصفر؛ ولاسو () يصفّر بعضها تماماً، فيؤدي اختياراً للمتغيّرات.
- يجب توحيد مقاييس المتنبّئات، ولا يُعاقَب المقطع أبداً.
- الفرق هندسي: الميزانية الدائرية بلا رؤوس، والمعيّن له رؤوس على المحاور.
- يعمل عبر مبادلة قليل من التحيّز بخفض كبير في التباين؛ ويجب اختيار بالتحقّق المتقاطع، لا بخطأ التدريب أبداً.
ما التالي
كان كل نموذج حتى الآن صيغة عامة واحدة. وثمّة استراتيجية مختلفة: تقطيع فضاء المتنبّئات إلى مناطق والتنبّؤ بثابت في كل منها - وهو ما يعالج التفاعلات واللاخطية دون أن يحدّدها أحد سلفاً. وذلك هو أشجار القرار والتجميعات.
المراجع والقراءات الإضافية
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗
تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.