التعميم وحدّ الاتّحاد
الفجوة بين الخطأ الذي تقيسه والخطأ الذي ستتحمّله، ولماذا يوسّع اختيار الأفضل من بين مرشّحين كثيرين تلك الفجوة، وحجّة العدّ التي تحوّلها إلى ضمانة.
كلّ نموذج تلائمه يورد درجةً على البيانات التي لوئم عليها. وذلك الرقم ليس ما تريد معرفته. فالذي تريده هو كيف سيؤدّي النموذج على بيانات لم يرَها قطّ، والفجوة بين الاثنين ليست تفصيلاً: إنّها موضوع هذا المسار كلّه.
خطآن، لا يُرى منهما إلّا واحد
ثبّت فرضيةً : قاعدةً تأخذ مدخلاً وتتنبّأ بعنوان.
خطؤها الحقيقي هو معدّل خطئها عبر المجتمع كلّه الذي أتت منه البيانات. وهذا هو المقدار الذي يعنيك، ولن تستطيع حسابه أبداً.
خطؤها التدريبي هو معدّل خطئها على عيّنتك. وهذا يُحسب، وهو الشيء الوحيد الذي ترصده على الإطلاق.
وللفرضية الواحدة المثبّتة يتقارب الاثنان، والسبب عاديّ: كلّ نقطة في العيّنة تجربة مستقلّة، فيكون خطأ التدريب متوسّطاً لسحوب مستقلّة، والمتوسّطات تتركّز. ومتباينة هوفدينغ تضبط ذلك، إذ تحدّ احتمال أن يبعد متوسّط حدّاً مستقلاً محدوداً عن توقّعه.
إلى هنا لا مشكلة. المشكلة تأتي مع كلمة مثبّتة.
الاختيار ليس مجّانياً
المتعلّم لا ينتقي فرضيته سلفاً. بل ينظر في البيانات ويختار الأعلى درجةً. وذلك الاختيار دالّةٌ في العيّنة نفسها، وهو يهدم الضمانة هدماً.
وإليك حجم الضرر، مقيساً على بيانات صُمّمت كي لا يكون فيها شيء يُتعلَّم. كلّ فرضية ضجيج محض خطؤها الحقيقي 0.5 بالضبط؛ ولا واحدة أفضل من أخرى. اسحب عيّنة من 200، وقيّمها كلّها، وأورد الأفضل:
| المرشّحون | خطأ التدريب للأفضل، تحت الحقيقة |
|---|---|
| 1 | |
| 10 | |
| 100 | |
| 1000 |
مع مرشّح واحد لا شيء يُختار، فيقع خطأ التدريب على بعد من الحقيقة. ومع ألف، يقع الخطأ المورَد تحتها: نموذج يبدو أفضل من الصدفة بوضوح وهو الصدفة بعينها.
ولا شيء في ذلك الجدول يخصّ جودة الفرضيات. فهي متطابقة. والذي يختلف هو الحظّ، وأخذ الأصغر هو أخذ الأوفر حظّاً. وهذه هي الآليّة وراء كلّ لوحة صدارة لا تتكرّر، وكلّ سمة تُنتقى على البيانات التي تُقوَّم عليها بعدُ، وكلّ «جرّبنا بضع معماريات فنجحت هذه».
دفع ثمن البحث
الإصلاح أن تكفّ عن السؤال عن الفرضية المختارة وتسأل عنها جميعاً دفعةً واحدة.
فإن صحّت الضمانة في آنٍ واحد لكلّ فرضية في الفئة، صحّت بالخصوص للفرضية التي انتقاها المتعلّم، أيّاً كانت طريقة الانتقاء. والأداة هي حدّ الاتّحاد، وهو من البساطة ما يكاد يُحرج: احتمال وقوع واحد على الأقلّ من عدّة أحداث لا يتجاوز مجموع احتمالاتها المفردة.
طبّق هوفدينغ على كلّ فرضية، واجمع احتمالات الإخفاق، وحلّ لحجم العيّنة:
اقرأها قائمة أسعار. أنت تختار ، أي التسامح الذي تقبله، و، أي معدّل ما تسمح به من إخفاق الضمانة. وحجم الفئة هو ما يكلّفه بحثك.
اللوغاريتم هو القصّة كلّها
ضع فيها أرقاماً. عند و:
| حجم الفئة | العيّنات المطلوبة |
|---|---|
| 2 | 220 |
| 10 | 300 |
| 1000 | 530 |
| 1048576 | 878 |
الانتقال من فرضيتين إلى أكثر من مليون - أي نصف مليون ضعف - يكلّف 658 عيّنة إضافية. لا 658 ضعفاً؛ بل 658 زيادة.
هذا ما يشتريه ، وهو سبب كون تعلّم الآلة ممكناً أصلاً. فلو نما المطلب مع بدل لوغاريتمه لما صارت أيّ فئة نماذج مثيرة للاهتمام قابلة للتعلّم يوماً. وبدل ذلك، مضاعفة الفئة تضيف ثابتاً، فينمو المطلب مع عدد خانات حجم الفئة.
الجدولان كلاهما في الشكل أدناه، وليس فيهما محاكاة. فأفضل m فرضية متطابقة هو أصغر m سحبة ذات حدّين، فالمجاملة مجموع منتهٍ لا متوسّط مئتي تجربة. وهذا يصحّح مدخلًا واحدًا: فعند مرشّح واحد تكون الفجوة المتوقّعة صفرًا تمامًا، و0.0002 أعلاه هي ضجيج المحاكاة نفسها. وانتقل إلى اللوحة الثانية وادفع حجم الصنف إلى المليار لترى الميزانية تأبى أن تتبعه.
تفاعلي: ماذا يكلّف البحث، وماذا يشتري اللوغاريتم
حساب مضبوط: أفضل m مرشّح هو أصغر m سحبة ذات حدّين.
- المجاملة
- 0.0000
- الخطأ المُعلَن للأفضل
- 0.5000
مرشّح واحد، ولا خيار، فالمجاملة المتوقّعة 0 بالضبط. وجدول الدرس يذكر هنا 0.0002، وهي ضجيج محاكاته ذات المئتي تجربة لا انحياز في الإجراء. وهذا الشكل يحسب التوقّع بدل تقديره.
لماذا يجب أن تكون منتظمة
تفصيل واحد يستحقّ أن يُذكر على حدة، لأنّ تخطّيه أشيع سوء فهم.
الحدّ يصحّ لـكلّ فرضية في الفئة دفعةً واحدة. لا للأفضل؛ ولا لفرضية نمطية. بل لها كلّها في آنٍ معاً.
وهذا هو المطلوب بالضبط، ولا يكفي ما هو أضعف. فمخرَج المتعلّم يتوقّف على العيّنة، أي إنّه ليس مثبَّتاً سلفاً، وضمانةٌ تخصّ فرضيةً محدّدة مسبقاً لا تقول عنه شيئاً. ووحده قولٌ يغطّي الفئة كلّها يضمن تغطية ما انتقته البيانات.
وهذا يفسّر أيضاً كون الحدّ ثنائي الطرف وكونه متشائماً. فعليه أن يصمد أمام خصم ينظر في عيّنتك ويختار أسوأ الحالات، وذاك مطلب قويّ. والأداء الحقيقي عادةً أفضل بكثير ممّا يعد به الحدّ، ولا بأس: فمهمّة الحدّ أن تقول أيّ مقدار يحكم التعميم، لا أن تتنبّأ بخطأ اختبارك.
ما يتركه هذا مفتوحاً
الحجّة تعدّ الفرضيات، وهذا ينجح متى كانت منتهية العدد. وأكثر الفئات الواقعية لانهائية - كلّ العتبات على مستقيم، وكلّ فوق-المستويات في فضاء - فيصير عندئذٍ ، وهذا ليس حدّاً البتّة.
ومع ذلك فتلك الفئات تعمّم بوضوح. إذن فعدّ الأعضاء مقياس خاطئ للسعة، والدرس التالي يستبدل به المقياس الصحيح: لا كم فرضية تضمّ الفئة، بل كم شيئاً مختلفاً حقّاً تستطيع فعله على البيانات التي بين يديك.
المراجع والقراءات الإضافية
- Shai Shalev-Shwartz, Shai Ben-David, Understanding Machine Learning: From Theory to Algorithms, Cambridge University Press, 2014المصدر ↗
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗
تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.
افتح المسار كاملًا
هذا الدرس الأول مجاني. سجّل لتخوض اختبار الإتقان وتكسب نقاط الخبرة وتفتح جميع الوحدات، مع مزيد من الأمثلة التفاعلية القابلة للتشغيل.