لماذا ينجح التعلّم من البيانات أصلاً
الفجوة بين الخطأ الذي تقيسه والخطأ الذي ستتحمّله، ولماذا يجعل انتقاء الأفضل من ألف فرضية متطابقة الأمر يبدو أفضل من الصدفة بـ0.1149، وكيف تُعدّ السعة لفئات النماذج اللانهائية، والنظرية التي تُساوي بين كلّ المتعلّمين - مع الافتراض الذي يصدّقها.
المتطلبات المسبقة: The Bias-Variance Trade-off
النموذج المُلاءَم على بيانات يورد درجةً على تلك البيانات. والكلّ يعلم ألّا يثق بها. وأقلّ من ذلك من يستطيع أن يقول بدقّة ما الخطأ فيها، وبكم، وما الذي ينبغي أن يصحّ كي تكون جديرة بالثقة.
ولتلك الأسئلة أجوبة دقيقة، وهي أطرف من التحذير. وهذا المقال يشتغل على ثلاثة منها، محسوباً كلّ رقم لا منقولاً.
الرقم الذي تراه تقرير عن بحث
ثبّت قاعدةً قبل أن تنظر في البيانات. سيكون خطؤها على عيّنتك قريباً من خطئها على العالم، لأنّ النقاط سحوب مستقلّة والمتوسّطات تتركّز. هذه إحصاء عاديّ، ولا شيء معطوب بعد.
والمتعلّمون لا يعملون هكذا. إنّهم ينظرون في البيانات ثمّ يختارون. وذلك الاختيار دالّة في العيّنة، وهو يهدم الضمانة.
وإليك حجم الضرر، مقيساً على بيانات بُنيت كي لا يكون فيها شيء يُتعلَّم. كلّ فرضية مرشّحة ضجيج محض خطؤها الحقيقي 0.5 بالضبط. اسحب 200 نقطة، وقيّمها كلّها، واحتفظ بالأفضل:
| المرشّحون | كم تبدو الأفضل تحت الحقيقة |
|---|---|
| 1 | |
| 10 | |
| 100 | |
| 1000 |
مع مرشّح واحد لا شيء يُختار وتكون الدرجة أمينةً في حدود . ومع ألف، يقع الخطأ المورَد تحت الحقيقة - نموذج يبدو أفضل من الصدفة بوضوح وهو الصدفة بعينها.
ولا واحدة من تلك الألف أفضل من أخرى. فهي متطابقة في الحقيقة. والذي يختلف هو الحظّ على هذه العيّنة، وأخذ الأفضل هو أخذ الأوفر حظّاً.
وهذه هي الآليّة وراء النتيجة التي لا تتكرّر، والسمة المنتقاة على البيانات التي تُقوَّم عليها بعدُ، و«جرّبنا عدّة معماريات فنجحت هذه». فدرجة التدريب لا تقدّر الأداء المقبل؛ إنّها تقرير عن بحث.
دفع ثمن البحث، باللوغاريتمات
الإصلاح أن تكفّ عن سؤال الفائز وتسأل المرشّحين جميعاً دفعةً واحدة. فإن صحّت ضمانة في آنٍ واحد لهم كلّهم، غطّت الذي انتقته البيانات، أيّاً كان الانتقاء.
وهذا حدّ الاتّحاد، وهو مع متباينة هوفدينغ يعطي مطلباً في العيّنات:
اقرأها قائمة أسعار: هو التسامح المقبول، و معدّل ما تسمح به من إخفاق الضمانة، و ما يكلّفه بحثك. عند و:
| الفرضيات | العيّنات |
|---|---|
| 2 | 220 |
| 10 | 300 |
| 1000 | 530 |
| 1048576 | 878 |
نصف مليون ضعف من الفرضيات يكلّف 658 عيّنة إضافية. لا 658 ضعفاً - بل 658 زيادة.
وذلك اللوغاريتم هو سبب إمكان تعلّم الآلة. فلو نما المطلب مع حجم الفئة بدل عدد خاناتها لما كانت أيّ فئة نماذج نافعة في المتناول.
الجدولان كلاهما في الشكل أدناه، وليس فيهما محاكاة. فأفضل m فرضية متطابقة هو أصغر m سحبة ذات حدّين، فالمجاملة مجموع منتهٍ لا متوسّط مئتي تجربة. وهذا يصحّح مدخلًا واحدًا: فعند مرشّح واحد تكون الفجوة المتوقّعة صفرًا تمامًا، و0.0002 أعلاه هي ضجيج المحاكاة نفسها. وانتقل إلى اللوحة الثانية وادفع حجم الصنف إلى المليار لترى الميزانية تأبى أن تتبعه.
تفاعلي: ماذا يكلّف البحث، وماذا يشتري اللوغاريتم
حساب مضبوط: أفضل m مرشّح هو أصغر m سحبة ذات حدّين.
- المجاملة
- 0.0000
- الخطأ المُعلَن للأفضل
- 0.5000
مرشّح واحد، ولا خيار، فالمجاملة المتوقّعة 0 بالضبط. وجدول الدرس يذكر هنا 0.0002، وهي ضجيج محاكاته ذات المئتي تجربة لا انحياز في الإجراء. وهذا الشكل يحسب التوقّع بدل تقديره.
السعة، حين يُخفق العدّ
الحجّة تعدّ الفرضيات، وأكثر الفئات النافعة تضمّ عدداً لانهائياً منها: كلّ العتبات على مستقيم، وكلّ فوق-المستويات في فضاء. ومع ذلك تعمّم تلك الفئات جيّداً تماماً، فعدّ الأعضاء يقيس الشيء الخطأ إذن.
والعلاج أن تنظر إلى البيانات بدلاً من ذلك. فالفرضيتان اللتان تُسندان العناوين نفسها إلى نقاطك لا تتمايزان عليها مهما فعلتا في غيرها. والمقدار المهمّ إذن هو كم عنونة متمايزة تستطيع الفئة إنتاجها - وهو عدد يبقى منتهياً وإن لم تكن الفئة كذلك.
تُشظّى مجموعة نقاط متى كانت كلّ عنونة ممكنة لها قابلة للتحقّق. والبُعد VC هو حجم أكبر مجموعة مشظّاة.
والمجالات على مستقيم تجعل ذلك ملموساً. نقطتان: يستطيع المجال أخذ كلتيهما، أو إحداهما، أو لا شيء - العنونات الأربع، مشظّاة. ثلاث نقاط: تبلغ الفئة 7 من 8، والغائبة هي
لأنّ المجال الذي يضمّ النقطتين الخارجيّتين يجب أن يضمّ الوسطى. وسبع من ثماني إخفاق
- فالتشظية كلّ شيء أو لا شيء - فيكون البُعد VC 2 بالضبط، يحدّه نمط واحد غير قابل للتحقّق.
والمستطيلات الموازية للمحاور تشظّي أربع نقاط في معيّن وتخفق عند خمس، بحجّة تستحقّ الحفظ: من بين خمس نقاط، أربع على الأكثر يمكن أن تكون أطرافاً (يساراً ويميناً وأعلى وأسفل)، والنقطة الباقية محاصَرة بها. وأيّ مستطيل يضمّ الأطراف الأربعة يضمّها هي أيضاً.
لماذا ينفع هذا
لِمّة ساور تحوّل البُعد المنتهي إلى عدّ كثير حدود. فالفئة ذات البُعد VC = تحقّق على نقطة ما لا يزيد عن عنونة. عند البُعد 2:
| القابلة للتحقّق | دون قيد | |
|---|---|---|
| 3 | 7 | 8 |
| 10 | 56 | 1024 |
| 20 | 211 | 1048576 |
ولم يحتج حدّ الاتّحاد قطّ إلى الفرضيات، بل إلى سلوكياتها المتمايزة. ضع كثير الحدود مكان ، وخذ اللوغاريتم، فيصير الثمن نحو - بطيئاً بما يكفي كي تنضبط الضمانة مع تراكم البيانات. وتكفّ السعة عن كونها عدّاً للفرضيات وتصير عدّاً للسلوكيات.
النظرية التي تُساوي بين الجميع
إذن فالسعة تُقاس وتُدفَع. فأيّ الخوارزميات أفضل؟
خذ مجالاً من خمس نقاط، فيكون عدد الدوالّ الهدف الممكنة . يرى المتعلّم ثلاثة عناوين ويتنبّأ بالباقيَين. توسّط درجته على الأهداف الاثنين والثلاثين. أربع استراتيجيات مختلفة عن عمد - «تنبّأ دائماً بـ1»، واتّباع الأكثرية المرئية، وتجاهل البيانات والتناوب، أو عكس الأكثرية - تحصل كلٌّ منها على
النصف بالضبط، محسوباً بكسور دقيقة على الأهداف الاثنين والثلاثين. حتى الاستراتيجية المصمّمة لتكون سيّئة.
والآليّة لا علاقة لها بالمتعلّمين. ثبّت عناوين التدريب وخذ أيّ نقطة غير مرئية: تأتي الأهداف المتّسقة أزواجاً، متطابقةً إلّا عند تلك النقطة، حيث يقول أحدهما 0 والآخر 1. فأيّ تنبّؤ صائب لواحد وخاطئ لتوأمه. والمتعلّم لا يدخل الحجّة أبداً.
والخطوة التي تعيد التعلّم
اسمح الآن بالأهداف الستّة التي تنتقل من 0 إلى 1 مرّةً واحدة على الأكثر، أي دوالّ العتبة 00000 و00001 و00011 و00111 و01111 و11111 - واستعمل متعلّماً مبنيّاً لتلك الهيئة. تصير الإصابة .
ولم يُتعلَّم شيء عن العالم بين الحسابين، ولم تصل بيانات جديدة. الذي تغيّر هو أيّ العوالم عُدّت ممكنة.
وهذا هو التحيّز الاستقرائي، ومنه يأتي التعميم.
ما يُحمَّل النظرية قوله
تُنقل هكذا: «لا خوارزمية أفضل من أخرى»، وهو ما يُسقط الافتراض الذي يقوم بالعمل كلّه.
فالمساواة تصحّ عند التوسّط بانتظام على كلّ الأهداف الممكنة. وتساءل ماذا يضمّ ذلك التوزيع: من كلّ الدوالّ على مجالٍ ما، الأغلبية الساحقة بلا بنية - ضجيج غير قابل للضغط، لا شيء يُستخرج. ولا تتفوّق طريقة على الصدفة عليها، وهي تحكم المتوسّط.
والمسائل الحقيقية تسكن ركناً متناهي الصغر عالي البنية من ذلك الفضاء. والمتوسّط المنتظم على كلّ الدوالّ ليس نموذجاً لأيّ مسألة حقيقية.
فالنظرية إذن ليست دعوةً إلى اليأس ولا رخصةً لعدّ الطرائق كلّها سواء. إنّها تقول شيئاً أحدّ: لا تحصل على تعميم من لا شيء. فالأداء يأتي من افتراضات، وهي قد تكون خاطئة، والطريقة التي تبدو ناجحة في كلّ مكان لم تلتقِ بالمسألة التي تخطئ فيها.
وهذا يجعل اختيار فئة النماذج دعوى جوهرية عن العالم - تستحقّ أن تُتّخذ عمداً وأن تُعلن صراحةً.
مسار النظرية الإحصائية للتعلّم يشتغل على الحجج الثلاث بالتفصيل، وكلّ حساب فيه قابل للتشغيل والتعديل داخل المتصفّح.
المراجع والقراءات الإضافية
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗
تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.