تخطّي إلى المحتوى
Kudos AI
Read in English
Statistical Learning Theory

المبرهنة التي لا تقول شيئًا عن مسألتك

بالمتوسّط على الدوالّ الـ256 من ثلاث بتّات إلى واحدة، يسجّل متعلّمُ أقرب جار ومتعلّمٌ بُني ليخطئ عمدًا 0.500000 بالضبط خارج بيانات التدريب. تلك هي مبرهنة انعدام الغداء المجّاني، وهي صحيحة بالضبط، وما إن يُقصَر المتوسّط على الدوالّ الستّ التي تعتمد على بتّ واحد حتى يفترق الاثنان إلى 0.333333 و0.666667.

قراءة 3 دقيقةKudos AI

المتطلبات المسبقة: لماذا ينجح التعلّم من البيانات أصلاً

كل الدوالّ على فضاء دخل صغير معدودةً في شبكة، ومتعلّمٌ يُقيَّم في مواجهة كلٍّ منها بدورها، والمتوسّط الجاري يستقرّ عند النصف بالضبط.

ثلاثة مداخل ثنائيّة، أي ثماني نقاط ممكنة، ودالّةٌ تُسنِد وسمًا لكلٍّ منها. وعدد هذه الدوالّ 28=2562^8 = 256، وهي كلّها.

أرِ متعلّمًا أربعًا من النقاط الثماني بأوسامها الحقيقيّة، وقيّمه على الأربع الباقية. افعل ذلك لكلٍّ من الدوالّ الـ256 وخُذ المتوسّط:

المتعلّممتوسّط الخطأ خارج التدريب
توقّع 0 دائمًا0.500000
توقّع 1 دائمًا0.500000
أقرب جار بمسافة هامنغ0.500000
نقيض أقرب جار0.500000

والسطر الأخير متعلّمٌ بُني ليخطئ: يجد أقرب نقطة تدريب ويتوقّع عكس وسمها. وبمتوسّط على كل الدوالّ يكون جيّدًا تمامًا كأقرب جار، وهو جيّد تمامًا كتجاهل البيانات رأسًا.

هذه هي مبرهنة انعدام الغداء المجّاني، والجدول ليس تقريبًا. فكل خانة تعدادٌ مضبوط لـ256 دالّة.

أ. لماذا لا يمكن أن تخرج على غير ذلك

لأيّ أربع نقاط محجوزة تنتظم الدوالّ الـ256 أزواجًا. فلكل دالّة ff أخرى تطابقها على نقاط التدريب الأربع وتخالفها على نقاط الاختبار الأربع. والمتعلّم يرى بيانات التدريب نفسها في الحالتين، فيتوقّع الشيء نفسه، فيكون مجموع أخطائه على الزوج أربعةً من أربع. وبالمتوسّط على الزوج: النصف بالضبط.

ولا يدخل في هذه الحجّة شيء من صفات المتعلّم. فهي تصدق على شبكة عميقة، وعلى جدول بحث، وعلى مولّد أعداد عشوائيّة.

ب. ولماذا لا تنطبق

المبرهنة تأخذ متوسّطًا على توزيع منتظم على كل الدوالّ. وهذا هو الفرض الذي يقوم بالعمل، وليس فرضًا هيّنًا: فتحته تكون أوسام النقاط التي لم ترَها مستقلّةً عن أوسام التي رأيتها. وعالَمٌ يُسحب هكذا لا يحوي بنيةً قابلة للتعلّم بالبناء، والمبرهنة تقول ذلك.

اقصُر المتوسّط نفسه على الدوالّ الستّ التي تعتمد على بتّ واحد - f(x)=xif(x) = x_i أو f(x)=¬xif(x) = \neg x_i، وهي أبسط بنية ممكنة - فتعطي المتعلّمات الأربعة نفسها:

المتعلّمالخطأ على الستّ
توقّع 0 دائمًا0.500000
توقّع 1 دائمًا0.500000
أقرب جار0.333333
نقيض أقرب جار0.666667

فيظهر الترتيب فورًا، وهو الترتيب الذي يتوقّعه أيّ أحد: التنبّؤ بالتشابه ينفع حين تحمل المدخلات المتشابهة أوسامًا متشابهة، وصار النقيض سيّئًا بمقدار ما المتعلّم جيّد بالضبط.

وهذان الرقمان يخصّان التقسيم المعتمد في المقال كلّه، حيث يُرى المتعلّم النقاط الأربع التي بتّها الأوّل 0؛ أمّا بالمتوسّط على الطرق الـ70 لاختيار نقاط التدريب الأربع فتعطي الدوالّ الستّ 0.342857 لأقرب جار و0.657143 لنقيضه، بالترتيب نفسه.

وستٌّ من 256 هي 2.3% من فضاء الدوالّ. وكل مسألة واقعيّة تعيش في جزء لا يقلّ عن ذلك خصوصيّةً، وغالبًا أكثر بكثير.

تفاعلي: لا غداء مجانيًا، الدوال الـ256 كلها

ثلاث بتات، أربع نقاط معروضة وأربع محجوبة، وكل الدوال معدودة.

معروضةمحجوبة10001001101010111100110111101111هذه fالمتوسط الجاريتوقّع 0 دائمًا00001.000.500000توقّع 1 دائمًا11110.000.500000أقرب جار11110.000.500000نقيض أقرب جار00001.000.500000
الدوال المحسوب متوسطها
256 من 256
أقرب جار، متوسط الخطأ
0.500000
نقيض أقرب جار، متوسط الخطأ
0.500000
الحصة من فضاء الدوال
100%

الدالة 255، بالأوسام 11111111 هي آخر الـ256، وعلى مجموعها ينال كل متعلم 0.500000 تمامًا خارج بيانات التدريب، ومنهم المتعلم المصمَّم ليخطئ. فلكل دالة شريكة تتفق معها على النقاط الأربع المعروضة وتعكس الأربع المحجوبة كلها؛ ولا يستطيع أي متعلم التمييز بينهما، فمجموع خطئه على الزوج أربعة من أربعة دائمًا.

ج. فيمَ تنفع المبرهنة فعلًا

ليست حجّةً على أنّ الطرائق كلّها سواء. بل هي برهانٌ على أنّه لا طريقة أفضل على الإطلاق، وهذا له لازم دقيق ونافع: أن نجاح متعلّمٍ على صنف من المسائل يُشترى بمطابقته لذلك الصنف، ويُدفع ثمنه إخفاقًا على مُتمّمه.

وهذا هو المضمون الحقيقي، ويحسن ذكره بالصورة التي يأخذها عمليًّا:

  • لكل متعلّم تحيّز استقرائي، حتى الذي لا يعلن عن واحد. فأقرب الجيران يفترض أنّ المدخلات المتقاربة تتشارك الأوسام؛ والنماذج الخطّيّة تفترض آثارًا تجميعيّة؛ والشبكات الالتفافيّة تفترض أنّ الانسحاب يهمّ وأنّ الموضعيّة تنفع. ولا شيء من ذلك محايد، ولا يمكن أن يكون.
  • نتيجة أيّ معيار قياس قولٌ عن صنف من المسائل. فـ«الطريقة س تتفوّق على الطريقة ص» دعوى عن التوزيع الذي سُحب منه المعيار، لا عن التعلّم عمومًا.
  • السؤال النافع ليس أبدًا أيّ خوارزميّة أفضل. بل أيّ الفروض تحقّقها مسألتك فعلًا، وأيّ طريقة مبنيّة عليها.

د. وفيمَ لا تنفع

كثيرًا ما تُستدعى المبرهنة لإنهاء نقاشات لا تحسمها: أنّ اختيار النموذج عبث، أو أنّ معرفة المجال لا تُرمَّز نافعةً، أو أنّ مقارنة الطرائق بلا معنى. والثلاثة يدحضها الجدول الثاني. فتحت بنية رقيقة كـ«الوسم يعتمد على واحد من ثلاث بتّات» يكون متعلّمٌ ضعفَ آخر جودةً، ويلزم 256 تقييمًا مضبوطًا لإظهار ذلك.

المراجع والقراءات الإضافية

  • Ian Goodfellow, Yoshua Bengio, Aaron Courville, Deep Learning, MIT Press (Adaptive Computation and Machine Learning), 2016المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 3 دقيقةStatistical Learning Theory

وسيط واحد، وسعة لا نهائيّة

مصنّف بوسيط حقيقي واحد يحقّق جميع الوسوم الـ1,048,576 لعشرين نقطة في كل مرّة، ثم يتنبّأ بالنقطة الحادية والعشرين بدقّة 0.5038 على عشرين ألف تجربة. فعدّ الوسائط لا يحدّ سعة صنف النماذج من أعلى ولا من أسفل، ولهذا وجب قياس السعة بطريق آخر.

تعلّم الآلةالرياضيات
قراءة 3 دقيقةأسس الاحتمالات

أيّ توزيع خاطئ تريد؟

هدفٌ ثنائي المنوال، وغاوسيّة واحدة، واتّجاهان للتباعد نفسه. تصغير KL(P||Q) يمدّ الغاوسيّة على المنوالين بلا كتلة تُذكر حيث يقيم الهدف فعلًا؛ وتصغير KL(Q||P) يضعها على منوال واحد عند 0.6931 نات، وهي ln 2 حتى أربعة أرقام عشرية لا مصادفة. وكل مواءمة يحكم عليها المعيار الآخر بالكارثة: 2.0976 مقابل 15.2799.

تعلّم الآلةالرياضيات
قراءة 2 دقيقةأسس الاحتمالات

السمتان اللتان تبدوان ضجيجًا

متغيّرٌ يحدّد آخر بارتباط قدره 0.0000000000 بالضبط، وزوجُ سماتٍ كل معلومة متبادلة ثنائيّة بينهما وبين الهدف تساوي صفرًا بالضبط بينما يحدّدانه معًا تمامًا. والغربلة أحاديّة المتغيّر تطرح الاثنتين، والحالة الثانية هي المهمّة: فالسمات التي تحذفها تُحذف لأنّها مهمّة.

تعلّم الآلةالرياضيات
← العودة إلى كل المقالات