تخطّي إلى المحتوى
Kudos AI

التعميم وحدّ الاتّحاد

الفجوة بين الخطأ الذي تقيسه والخطأ الذي ستتحمّله، ولماذا يوسّع اختيار الأفضل من بين مرشّحين كثيرين تلك الفجوة، وحجّة العدّ التي تحوّلها إلى ضمانة.

متقدّمالوحدة 130 دقيقة · 120 XP
فرضية واحدة تهبط قرب خطئها الحقيقي، ثمّ مرشّحون كثيرون يتبعثرون حولها بينما ينجرف أوفرهم حظّاً تحت الحقيقة، ثمّ مطلب العيّنات يتسلّق مع عدد خانات حجم الفئة فحسب.

كلّ نموذج تلائمه يورد درجةً على البيانات التي لوئم عليها. وذلك الرقم ليس ما تريد معرفته. فالذي تريده هو كيف سيؤدّي النموذج على بيانات لم يرَها قطّ، والفجوة بين الاثنين ليست تفصيلاً: إنّها موضوع هذا المسار كلّه.

خطآن، لا يُرى منهما إلّا واحد

ثبّت فرضيةً hh: قاعدةً تأخذ مدخلاً وتتنبّأ بعنوان.

خطؤها الحقيقي هو معدّل خطئها عبر المجتمع كلّه الذي أتت منه البيانات. وهذا هو المقدار الذي يعنيك، ولن تستطيع حسابه أبداً.

خطؤها التدريبي هو معدّل خطئها على عيّنتك. وهذا يُحسب، وهو الشيء الوحيد الذي ترصده على الإطلاق.

وللفرضية الواحدة المثبّتة يتقارب الاثنان، والسبب عاديّ: كلّ نقطة في العيّنة تجربة مستقلّة، فيكون خطأ التدريب متوسّطاً لسحوب مستقلّة، والمتوسّطات تتركّز. ومتباينة هوفدينغ تضبط ذلك، إذ تحدّ احتمال أن يبعد متوسّط nn حدّاً مستقلاً محدوداً عن توقّعه.

إلى هنا لا مشكلة. المشكلة تأتي مع كلمة مثبّتة.

الاختيار ليس مجّانياً

المتعلّم لا ينتقي فرضيته سلفاً. بل ينظر في البيانات ويختار الأعلى درجةً. وذلك الاختيار دالّةٌ في العيّنة نفسها، وهو يهدم الضمانة هدماً.

وإليك حجم الضرر، مقيساً على بيانات صُمّمت كي لا يكون فيها شيء يُتعلَّم. كلّ فرضية ضجيج محض خطؤها الحقيقي 0.5 بالضبط؛ ولا واحدة أفضل من أخرى. اسحب عيّنة من 200، وقيّمها كلّها، وأورد الأفضل:

المرشّحونخطأ التدريب للأفضل، تحت الحقيقة
10.00020.0002
100.05490.0549
1000.08870.0887
10000.11490.1149

مع مرشّح واحد لا شيء يُختار، فيقع خطأ التدريب على بعد 0.00020.0002 من الحقيقة. ومع ألف، يقع الخطأ المورَد 0.11490.1149 تحتها: نموذج يبدو أفضل من الصدفة بوضوح وهو الصدفة بعينها.

ولا شيء في ذلك الجدول يخصّ جودة الفرضيات. فهي متطابقة. والذي يختلف هو الحظّ، وأخذ الأصغر هو أخذ الأوفر حظّاً. وهذه هي الآليّة وراء كلّ لوحة صدارة لا تتكرّر، وكلّ سمة تُنتقى على البيانات التي تُقوَّم عليها بعدُ، وكلّ «جرّبنا بضع معماريات فنجحت هذه».

دفع ثمن البحث

الإصلاح أن تكفّ عن السؤال عن الفرضية المختارة وتسأل عنها جميعاً دفعةً واحدة.

فإن صحّت الضمانة في آنٍ واحد لكلّ فرضية في الفئة، صحّت بالخصوص للفرضية التي انتقاها المتعلّم، أيّاً كانت طريقة الانتقاء. والأداة هي حدّ الاتّحاد، وهو من البساطة ما يكاد يُحرج: احتمال وقوع واحد على الأقلّ من عدّة أحداث لا يتجاوز مجموع احتمالاتها المفردة.

طبّق هوفدينغ على كلّ فرضية، واجمع احتمالات الإخفاق، وحلّ لحجم العيّنة:

n  ≥  ln⁡∣H∣+ln⁡(2/δ)2ε2n \;\ge\; \frac{\ln|H| + \ln(2/\delta)}{2\varepsilon^2}

اقرأها قائمة أسعار. أنت تختار ε\varepsilon، أي التسامح الذي تقبله، وδ\delta، أي معدّل ما تسمح به من إخفاق الضمانة. وحجم الفئة ∣H∣|H| هو ما يكلّفه بحثك.

اللوغاريتم هو القصّة كلّها

ضع فيها أرقاماً. عند ε=0.1\varepsilon = 0.1 وδ=0.05\delta = 0.05:

حجم الفئةالعيّنات المطلوبة
2220
10300
1000530
1048576878

الانتقال من فرضيتين إلى أكثر من مليون - أي نصف مليون ضعف - يكلّف 658 عيّنة إضافية. لا 658 ضعفاً؛ بل 658 زيادة.

هذا ما يشتريه log⁡∣H∣\log|H|، وهو سبب كون تعلّم الآلة ممكناً أصلاً. فلو نما المطلب مع ∣H∣|H| بدل لوغاريتمه لما صارت أيّ فئة نماذج مثيرة للاهتمام قابلة للتعلّم يوماً. وبدل ذلك، مضاعفة الفئة تضيف ثابتاً، فينمو المطلب مع عدد خانات حجم الفئة.

الجدولان كلاهما في الشكل أدناه، وليس فيهما محاكاة. فأفضل m فرضية متطابقة هو أصغر m سحبة ذات حدّين، فالمجاملة مجموع منتهٍ لا متوسّط مئتي تجربة. وهذا يصحّح مدخلًا واحدًا: فعند مرشّح واحد تكون الفجوة المتوقّعة صفرًا تمامًا، و0.0002 أعلاه هي ضجيج المحاكاة نفسها. وانتقل إلى اللوحة الثانية وادفع حجم الصنف إلى المليار لترى الميزانية تأبى أن تتبعه.

تفاعلي: ماذا يكلّف البحث، وماذا يشتري اللوغاريتم

حساب مضبوط: أفضل m مرشّح هو أصغر m سحبة ذات حدّين.

0.200
المجاملة
0.0000
الخطأ المُعلَن للأفضل
0.5000

مرشّح واحد، ولا خيار، فالمجاملة المتوقّعة 0 بالضبط. وجدول الدرس يذكر هنا 0.0002، وهي ضجيج محاكاته ذات المئتي تجربة لا انحياز في الإجراء. وهذا الشكل يحسب التوقّع بدل تقديره.

لماذا يجب أن تكون منتظمة

تفصيل واحد يستحقّ أن يُذكر على حدة، لأنّ تخطّيه أشيع سوء فهم.

الحدّ يصحّ لـكلّ فرضية في الفئة دفعةً واحدة. لا للأفضل؛ ولا لفرضية نمطية. بل لها كلّها في آنٍ معاً.

وهذا هو المطلوب بالضبط، ولا يكفي ما هو أضعف. فمخرَج المتعلّم يتوقّف على العيّنة، أي إنّه ليس مثبَّتاً سلفاً، وضمانةٌ تخصّ فرضيةً محدّدة مسبقاً لا تقول عنه شيئاً. ووحده قولٌ يغطّي الفئة كلّها يضمن تغطية ما انتقته البيانات.

وهذا يفسّر أيضاً كون الحدّ ثنائي الطرف وكونه متشائماً. فعليه أن يصمد أمام خصم ينظر في عيّنتك ويختار أسوأ الحالات، وذاك مطلب قويّ. والأداء الحقيقي عادةً أفضل بكثير ممّا يعد به الحدّ، ولا بأس: فمهمّة الحدّ أن تقول أيّ مقدار يحكم التعميم، لا أن تتنبّأ بخطأ اختبارك.

ما يتركه هذا مفتوحاً

الحجّة تعدّ الفرضيات، وهذا ينجح متى كانت منتهية العدد. وأكثر الفئات الواقعية لانهائية - كلّ العتبات على مستقيم، وكلّ فوق-المستويات في فضاء - فيصير log⁡∣H∣\log|H| عندئذٍ log⁡∞\log\infty، وهذا ليس حدّاً البتّة.

ومع ذلك فتلك الفئات تعمّم بوضوح. إذن فعدّ الأعضاء مقياس خاطئ للسعة، والدرس التالي يستبدل به المقياس الصحيح: لا كم فرضية تضمّ الفئة، بل كم شيئاً مختلفاً حقّاً تستطيع فعله على البيانات التي بين يديك.

المراجع والقراءات الإضافية

  • Shai Shalev-Shwartz, Shai Ben-David, Understanding Machine Learning: From Theory to Algorithms, Cambridge University Press, 2014المصدر ↗
  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

افتح المسار كاملًا

هذا الدرس الأول مجاني. سجّل لتخوض اختبار الإتقان وتكسب نقاط الخبرة وتفتح جميع الوحدات، مع مزيد من الأمثلة التفاعلية القابلة للتشغيل.