تخطّي إلى المحتوى
Kudos AI
Read in English
أسس التعلّم الإحصائي

ما هو التعلّم الإحصائي؟

الإطار الكامن وراء كل نموذج تنبّؤي: تقدير دالة مجهولة f من البيانات، والفصل بين الخطأ القابل للتقليص وغير القابل له، ولماذا يشدّ التنبّؤ والاستدلال في اتجاهين متعاكسين.

قراءة 6 دقيقةKudos AI

المتطلبات المسبقة: الاحتمالات من الصفر

عمود الخطأ ينزل إلى أرضية ضجيج مقدارها 0.25 ثم يتوقّف عندها تمامًا، مهما تحسّنت الملاءمة.

كل نموذج موجَّه في هذا الموقع - الانحدار الخطي، والأشجار، والشبكات العصبية - هو إجابة عن السؤال نفسه، مطروحاً بالترميز نفسه. وقبل مقارنة الطرق يجدر بنا صياغة ذلك السؤال بدقة، لأنه يخبرك أيضاً أي جزء من خطئك يمكنك أن تأمل في إزالته وأي جزء ستبقى عالقاً به مهما كانت طريقتك جيدة.

أ. الإطار

نرصد استجابة YY وpp من المتنبّئات X=(X1,X2,…,Xp)X = (X_1, X_2, \dots, X_p). ونفترض وجود علاقة ما بينها، تُكتب في الصورة العامة

Y=f(X)+ε.Y = f(X) + \varepsilon .

هنا ff دالة ثابتة لكنها مجهولة تمثّل المعلومات المنهجية التي يقدّمها XX عن YY، وε\varepsilon حدّ خطأ عشوائي مستقل عن XX ومتوسطه صفر.

التعلّم الإحصائي هو مجموعة الأساليب المستخدَمة لتقدير ff.

يُكتب التقدير f^\hat f، والتنبّؤ الذي يُنتجه هو Y^=f^(X)\hat Y = \hat f(X).

ب. الخطأ القابل للتقليص وغير القابل له

لنفترض للحظة أن f^\hat f وXX ثابتان. إلى أي مدى يكون Y^\hat Y خاطئاً كتنبّؤ بـ YY؟ باتّباع جيمس وزملائه، يتفكّك الخطأ التربيعي المتوقّع إلى جزأين متمايزين مفاهيمياً:

E[(Y−Y^)2]=[f(X)−f^(X)]2⏟reducible+Var⁡(ε)⏟irreducible.\mathbb{E}\big[(Y - \hat Y)^2\big] = \underbrace{\big[f(X) - \hat f(X)\big]^2}_{\text{reducible}} + \underbrace{\operatorname{Var}(\varepsilon)}_{\text{irreducible}} .

الحدّ الأول قابل للتقليص: فـ f^\hat f ليس تقديراً مثالياً لـ ff، ويمكننا تضييق تلك الفجوة باختيار طريقة أفضل أو بجمع مزيد من البيانات.

والحدّ الثاني غير قابل للتقليص، وهو المهم. فحتى مع تقدير مثالي - حتى لو كان f^=f\hat f = f تماماً - سيظل التنبّؤ خاطئاً بمقدار ε\varepsilon، لأن YY يعتمد على ε\varepsilon، وε\varepsilon بحكم التعريف غير قابل للتنبّؤ به من XX.

لماذا يكون الخطأ غير القابل للتقليص أكبر من الصفر؟ لسببين، يستحق كلاهما الاستيعاب. أولاً، قد يحتوي ε\varepsilon على متغيّرات غير مقيسة كانت ستساعد في التنبّؤ بـ YY - وبما أننا لم نقِسها، لا يمكن لأي ff مبنيّ على XX أن يستخدمها. وثانياً، قد يحتوي على تباين غير قابل للقياس فعلاً: فالمدخلات نفسها في يومين مختلفين لا تنتج ببساطة مخرجات متطابقة.

والنتيجة العملية سقف صلب. إن Var⁡(ε)\operatorname{Var}(\varepsilon) حدّ أعلى لما يمكن أن يبلغه أي نموذج، وهو مجهول في الممارسة العملية غالباً. والنموذج الذي يبدو أنه تجاوزه ليس انتصاراً، بل علامة على أنك تقيس خطأ الاختبار على بيانات سبق للنموذج أن رآها.

ج. التنبّؤ في مقابل الاستدلال

هناك سببان لتقدير ff، وهما يشدّان في اتجاهين متعاكسين.

في التنبّؤ، كل ما يهمّك أن يكون Y^\hat Y قريباً من YY. ويمكن أن يكون التقدير f^\hat f صندوقاً أسود بالكامل - فلن تفتّشه أبداً - ما دام دقيقاً.

أما في الاستدلال، فأنت تريد فهم العلاقة: أي المتنبّئات مهمّ فعلاً، وهل يرفع كلٌّ منها الاستجابة أم يخفضها، وهل يكفي ملخّص خطي بسيط. وهنا لا يمكن أن يكون f^\hat f صندوقاً أسود، لأن شكل النموذج هو الإجابة.

ويتكرّر هذا التوتّر باستمرار:

التنبّؤالاستدلال
الهدفY^\hat Y دقيقفهم ff
النموذج المفضّلمرن، وربما معتممقيَّد، قابل للتفسير
الاختيار المعتادالتجميعات، الشبكات العصبيةالنماذج الخطية والخطية المعمّمة

النموذج المُختار للدقة وحدها سيكون غالباً نموذجاً لا تستطيع شرحه، والنموذج المُختار للشرح سيترك غالباً بعض الدقة على الطاولة. ومعرفة أيّ المهمتين تؤدّي شرطٌ مسبق لأي اختيار رشيد.

د. التقدير البارامتري وغير البارامتري

هناك على وجه العموم استراتيجيتان لإنتاج f^\hat f.

الطرق البارامترية تختزل المسألة إلى تقدير مجموعة ثابتة من الأعداد. إذ تفترض أولاً صورة دالّية - وأبسطها أن يكون ff خطياً:

f(X)=β0+β1X1+β2X2+⋯+βpXp,f(X) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \dots + \beta_p X_p ,

فلا يبقى إلا تقدير المعاملات الـp+1p+1 بدل دالة اعتباطية في pp بُعداً. وهذا تبسيط هائل. والخطر واضح بالقدر نفسه: إن كان ff الحقيقي بعيداً عن الخطية، فلن يلائمه أي اختيار للمعاملات، ويكون النموذج خاطئاً على نحو لا تُصلحه زيادة البيانات.

أما الطرق غير البارامترية فلا تفترض ذلك وتترك البيانات تحدّد الشكل. ويمكنها ملاءمة مدى أوسع بكثير من الدوال الحقيقية، لكن لأنها لا تختزل المسألة إلى بضعة بارامترات، فهي تحتاج إلى مشاهدات أكثر بكثير لتثبيت الشكل بموثوقية.

هـ. لماذا المرونة ليست مجانية

من المغري أن نستنتج أن الطرق غير البارامترية المرنة أفضل ببساطة. وهي ليست كذلك، لسببين.

أولاً، كما ذُكر، هي أشدّ نهماً للبيانات. وثانياً - وهو أقل بداهة - يمكن لطريقة بالغة المرونة أن تتبع الضجيج ε\varepsilon في عيّنة التدريب كأنه إشارة. فتبدو الملاءمة للبيانات التي بحوزتك رائعة بينما يتدهور الأداء على بيانات لم ترَها.

يرسم الشكل منحنيات تخطيطية، لا ملاءمات كثيرات الحدود أدناه: فكلّما رفعت تعقيد النموذج هبط خطأ التدريب باطّراد، بينما يعود خطأ الاختبار إلى الصعود.

تفاعلي: المفاضلة بين التحيز والتباين

خطأ التدريب مقابل خطأ الاختبار مع تزايد تعقيد النموذج.

0.00.51.0الضجيج غير القابل للاختزال→ تعقيد النموذج
خطأ الاختبارخطأ التدريبالتعقيد الأمثل
النظام
مطابقة جيدة
خطأ التدريب
0.25
خطأ الاختبار
0.55

قرب النقطة المثلى: خطأ الاختبار قريب من أدنى قيمة له.

ينخفض خطأ التدريب دائماً كلما ازداد النموذج مرونة، لذا فهو دليل مضلِّل. أما خطأ الاختبار فهو bias² + variance + irreducible noise: يبلغ أدناه حيث تتوازن القوتان، ثم يرتفع عندما يبدأ النموذج بمطابقة الضجيج. أضف بيانات (ارفع حجم العينة) فيتقلّص حد التباين، دافعاً النقطة المثلى نحو تعقيد أعلى وخافضاً منحنى الاختبار بأكمله.

يُظهر ما يلي هذه النقطة على بيانات نعرف حقيقتها، فنستطيع مقارنة الملاءمة بـ ff نفسه لا بمشاهدات مشوّشة:

Python

يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.

يطبع تشغيله:

degree  1:  training MSE 0.1985   error vs true f 0.2465
degree  3:  training MSE 0.0542   error vs true f 0.0235
degree 15:  training MSE 0.0258   error vs true f 730.5159

اقرأ العمودين أحدهما مقابل الآخر. يهبط متوسط مربّع خطأ التدريب هبوطاً مطّرداً مع المرونة - فالدرجة 15 تلائم النقاط المرصودة أفضل من الاثنتين الأخريين، عند 0.02580.0258. ومع ذلك يبلغ خطؤها مقابل ff الحقيقي 730.5730.5: لا أسوأ هامشياً من 0.02350.0235 للدرجة 3، بل أسوأ نحو ثلاثين ألف مرة.

يستحق هذا الانفجار الفهم لا مجرد التسجيل. فكثير حدود من الدرجة 15 مُلائَم على 25 نقطة يملك حرية كافية للتلوّي عبر الضجيج، وتصير التموّجات اللازمة لذلك عنيفة قرب حدّي الفترة، حيث تقلّ النقاط التي تقيّده. وعند التقييم على الشبكة الكثيفة، تهيمن تلك النزوات الحدّية على المتوسط. وهذا نمط إخفاق حقيقي ومعروف جيداً في ملاءمات كثيرات الحدود عالية الدرجة، لا أثر جانبي لبذرة العشوائية.

في المقابل تُظهر الدرجة 1 الإخفاق المعاكس: خطؤها التدريبي أسوأ بكثير من خطأ الدرجة 15، لكنها صادقة في ذلك - إذ إن الخطأ مقابل الحقيقة، 0.24650.2465، قريب من خطئها التدريبي، لأن المستقيم أصلب من أن يطارد الضجيج. إنه ببساطة الشكل الخاطئ لموجة جيبية.

وتفوز الدرجة 3 في العمود الوحيد الذي يهمّ. وهذه الفجوة بين «ملاءمة العيّنة» و«التقاط الحقيقة» هي الظاهرة المركزية في هذا الموضوع، ولها تفكيك دقيق.

الخلاصات الأساسية

  • يقدّر التعلّم الإحصائي دالة مجهولة ff في Y=f(X)+εY = f(X) + \varepsilon.
  • ينقسم خطأ التنبّؤ إلى جزء قابل للتقليص يمكن للطرق الأفضل تصغيره، وجزء غير قابل للتقليص هو Var⁡(ε)\operatorname{Var}(\varepsilon) لا يقلّصه شيء.
  • يوجد الخطأ غير القابل للتقليص بسبب تباين غير مقيس وآخر غير قابل للقياس؛ وهو سقف صلب لدقة أي نموذج.
  • يفضّل التنبّؤ النماذج المرنة المعتمة؛ ويفضّل الاستدلال النماذج المقيَّدة القابلة للتفسير. فقرّر أولاً أيّهما تفعل.
  • الطرق البارامترية تفترض صورة وتقدّر بارامترات قليلة؛ والطرق غير البارامترية تفترض أقل لكنها تحتاج بيانات أكثر بكثير.
  • زيادة المرونة تحسّن خطأ التدريب دائماً، وبعد حدّ معيّن تُفسِد الدقة على البيانات الجديدة.

ما التالي

تستحق الملاحظة الأخيرة سرداً دقيقاً لا حكايةً عابرة. فالخطأ القابل للتقليص ينقسم هو نفسه إلى جزأين متنافسين - أحدهما يتقلّص كلما ازدادت النماذج مرونة والآخر ينمو - ومجموعهما هو ما تدفعه فعلاً. وذلك هو مقايضة التحيّز والتباين.

المراجع والقراءات الإضافية

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 6 دقيقةالتعلّم الموجَّه

الانحدار الخطي من المبادئ الأولى

اشتقاق معاملات المربّعات الصغرى باشتقاق مجموع مربّعات البواقي، ثم تنفيذ ملاءمة كاملة على خمس مشاهدات يدوياً: المعاملات والقيم المُلائَمة والبواقي وRSS ومعامل التحديد، وكلٌّ منها متحقَّق منه عددياً.

الإحصاءتعلّم الآلةالرياضيات
قراءة 6 دقيقةأسس الاحتمالات

الاحتمالات من الصفر: لغة اللايقين

بناء الاحتمالات من الأساس: العوالم الممكنة، وفضاء العيّنة، والبديهيتان الأساسيتان، ثم قاعدتا الجمع والضرب، كلٌّ منها مشتقّة لا مُسلَّم بها، مع أمثلة عددية محلولة.

الاحتمالاتالرياضياتالذكاء الاصطناعي
قراءة 5 دقيقةأسس الاحتمالات

مبرهنة بايز وتحديث الاعتقاد

اشتقاق مبرهنة بايز من تعريف الاحتمال الشرطي، ثم حلّ مثال معدّل الأساس الذي يخدع الجميع تقريباً مرتين: مرة بالصيغة ومرة بالعدّ الخالص.

الاحتمالاتالرياضياتالذكاء الاصطناعي
← العودة إلى كل المقالات