تخطّي إلى المحتوى
Kudos AI
Read in English
أسس التعلّم الإحصائي

التحقّق المتقاطع وإعادة المعاينة

لماذا يكون خطأ التدريب تقديراً متحيّزاً لخطأ الاختبار، وكيف تعالج ذلك مجموعة التحقّق وطريقة ترك واحد وطريقة الطيّات k، مع حساب LOOCV على خمس مشاهدات مشاهدةً مشاهدة.

قراءة 6 دقيقةKudos AI

المتطلبات المسبقة: مقايضة التحيّز والتباين

خمس نقاط تُلاءَم مرة واحدة ويُقرأ خطأ التدريب، ثم تُحجَب كل نقطة بدورها بينما يُعاد ملاءمة المستقيم بدونها، ثم تُتوسَّط الفجوات الخمس في تقدير أكبر ثلاث مرات.

انتهت مقالة مقايضة التحيّز والتباين بجدول تشخيصي يقارن خطأ التدريب بخطأ الاختبار. وتفترض تلك المقارنة أنك تملك خطأ اختبار. وعادةً لا تملكه: فكل مشاهدة بحوزتك أُنفقت بالفعل على الملاءمة. وتحلّ طرق إعادة المعاينة هذه المشكلة بإعادة ملاءمة النموذج مراراً على مجموعات جزئية من البيانات، واستخدام الأجزاء المحجوزة لتقدير الأداء على بيانات لم يرَها النموذج.

أ. لماذا ليس خطأ التدريب تقديراً لخطأ الاختبار

يُقاس خطأ التدريب على المشاهدات نفسها التي استُخدمت لاختيار البارامترات، فتكون عملية الملاءمة قد تكيّفت أصلاً مع أي ضجيج تحمله تلك النقاط. ومن ثم فهو متحيّز إلى أسفل بوصفه تقديراً للأداء على بيانات جديدة، ويزداد التحيّز مع مرونة النموذج.

وليس هذا تصحيحاً صغيراً يمكن إهماله. بل هو بالضبط المقدار الذي جعل كثير الحدود من الدرجة 15 يبدو الأفضل في المقالات السابقة بينما كان أسوأ النماذج الثلاثة. وأي إجراء اختيار تقوده أخطاء التدريب سيختار حتماً أكثر المرشّحين مرونة.

ب. أسلوب مجموعة التحقّق

أبسط علاج: قسّم المشاهدات عشوائياً إلى مجموعة تدريب ومجموعة تحقّق، ولائم على الأولى وقِس الخطأ على الثانية. ولأن مشاهدات التحقّق لم تشارك في الملاءمة، فالخطأ الناتج تقدير أمين.

وله عيبان معروفان:

  1. التقدير شديد التقلّب. فهو يتوقّف على المشاهدات التي صادف وقوعها في مجموعة التحقّق. وتقسيم مختلف يعطي رقماً مختلفاً بوضوح.
  2. يهدر البيانات. إذ لا يُستخدم للملاءمة سوى جزء، والطرق الإحصائية تؤدي عادةً أسوأ مع عدد أقل من المشاهدات، فيميل خطأ التحقّق إلى المبالغة في تقدير خطأ النموذج الذي كنت ستلائمه على البيانات كاملة.

ج. التحقّق المتقاطع بترك واحد

تعالج LOOCV الأمرين. فمع nn مشاهدة، احجز مشاهدة واحدة (xi,yi)(x_i, y_i)، ولائم على الـn−1n-1 المتبقية، وتنبّأ بالمتروكة. كرّر ذلك لكل ii، ثم خذ المتوسط:

CV(n)=1n∑i=1nMSEi,MSEi=(yi−y^i)2.\mathrm{CV}_{(n)} = \frac{1}{n}\sum_{i=1}^{n} \mathrm{MSE}_i , \qquad \mathrm{MSE}_i = (y_i - \hat y_i)^2 .

تستخدم كل ملاءمة n−1n-1 مشاهدة، فالتحيّز إلى أعلى أقل بكثير منه مع مجموعة تدريب بنصف الحجم، ولأنها تأخذ المتوسط على كل حجب مفرد ممكن فلا عشوائية في التقسيم إطلاقاً - شغّلها مرتين تحصل على الإجابة نفسها.

د. LOOCV محسوبة بالكامل

مجموعة البيانات صغيرة بما يكفي لتنفيذ كل طيّة صراحةً. خمس مشاهدات، ومتنبّئ واحد:

iixix_iyiy_i
112
224
335
444
555

تعطي ملاءمة انحدار خطي بسيط على الخمس جميعاً y^=2.2+0.6x\hat y = 2.2 + 0.6x - وهي الملاءمة المشتقّة خطوةً خطوة في الانحدار الخطي من المبادئ الأولى. وتعيد LOOCV ملاءمته خمس مرات، تحذف في كل مرة صفاً:

الطيّةالمحذوفالتنبّؤ y^i\hat y_iالفعلي yiy_i(yi−y^i)2(y_i - \hat y_i)^2
1(1,2)(1, 2)4.000024.0000
2(2,4)(2, 4)3.142940.7347
3(3,5)(3, 5)3.750051.5625
4(4,4)(4, 4)4.857140.7347
5(5,5)(5, 5)5.500050.2500
CV(5)=4.0000+0.7347+1.5625+0.7347+0.25005=7.28195=1.4564.\mathrm{CV}_{(5)} = \frac{4.0000 + 0.7347 + 1.5625 + 0.7347 + 0.2500}{5} = \frac{7.2819}{5} = 1.4564 .

قارن ذلك بمتوسط مربّع خطأ التدريب للملاءمة الكاملة، وهو RSS/n=2.4/5=0.48\mathrm{RSS}/n = 2.4/5 = 0.48. فالتقدير الأمين، 1.45641.4564، أكبر ثلاث مرات. وتلك الفجوة هي بالضبط التفاؤل الذي افتُتحت به هذه المقالة.

ولاحظ أيضاً الطيّة 1: حذف (1,2)(1,2) - النقطة الأبعد أسفل المستقيم - يدع الأربع الباقية تجذب الملاءمة إلى أعلى، فيخطئ التنبّؤ بمقدار 2.0 أي خطأ تربيعي 4.0، وهو أكثر من نصف المجموع. فمع خمس مشاهدات فقط، تهيمن نقطة واحدة مؤثّرة. وهذه خاصية حقيقية للتقدير، لا عيب في الطريقة.

Python

يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.

يعيد تشغيله إنتاج الجدول صفاً صفاً ويطبع LOOCV MSE: 1.4564، مؤكّداً الحساب اليدوي.

تفاعلي: استبعاد نقطة واحدة، خمس مرات

كل طيّة تعيد ملاءمة المستقيم دون إحدى النقاط.

2345612345x2.0014.000020.734731.562540.734750.2500CV 1.4564تدريب 0.48
النقطة المستبعدة
(1, 2)
المستقيم المُعاد ملاءمته
ŷ = 3.80 + 0.20x
التنبؤ
4.0000
الخطأ التربيعي
4.0000
تقدير LOOCV أي CV(5)
1.4564
متوسط خطأ التدريب
0.48

تستبعد الطيّة 1 النقطة (1, 2). تعيد النقاط الأربع الأخرى ملاءمة المستقيم إلى ŷ = 3.80 + 0.20x، فيتنبأ بالقيمة 4.0000 حيث القيمة الحقيقية 2: فارق قدره 2.0000 وخطأ تربيعي قدره 4.0000، أي 54.9% من مجموع الطيّات الخمس. استبعاد النقطة الأبعد تحت المستقيم يترك الأربع الباقية تشدّ الملاءمة إلى الأعلى، فتحمل هذه الطيّة وحدها أكثر من نصف التقدير. مع خمس مشاهدات فقط، تهيمن نقطة مؤثرة واحدة.

هـ. التحقّق المتقاطع بـ k طيّات

تتطلّب LOOCV nn ملاءمة، وهو مكلف حين يكون nn كبيراً أو الملاءمة بطيئة. أما التحقّق المتقاطع بـ k طيّات فيقسّم المشاهدات إلى kk مجموعة متقاربة الحجم، ويحجز كل مجموعة بدورها، ثم يأخذ المتوسط:

CV(k)=1k∑j=1kMSEj.\mathrm{CV}_{(k)} = \frac{1}{k}\sum_{j=1}^{k} \mathrm{MSE}_j .

وLOOCV هي الحالة الخاصة k=nk = n. واستخدام k=5k = 5 أو k=10k = 10 لا يحتاج سوى 5 أو 10 ملاءمات بدل nn.

و. لماذا k=5 أو k=10 لا k=n

القراءة البديهية أن kk الأصغر مجرّد مساومة حسابية. وليس الأمر كذلك - فهناك مقايضة تحيّز-تباين في التقدير نفسه.

التحيّز يحبّذ kk الكبيرة. فكل ملاءمة في LOOCV تستخدم n−1n-1 مشاهدة، أي البيانات كلها تقريباً، فلا تكاد تبالغ في تقدير الخطأ. أما ملاءمات الطيّات الخمس فلا تستخدم سوى 80٪ من البيانات، فتبالغ أكثر قليلاً.

التباين يحبّذ kk المعتدلة. ففي LOOCV تُدرَّب النماذج الـnn على بيانات شبه متطابقة - إذ لا يختلف أي اثنين إلا في مشاهدتين - فتكون أخطاؤها شديدة الارتباط الموجب. ومتوسّط كميات شديدة الارتباط يخفض التباين أقل بكثير من متوسّط كميات ضعيفة الارتباط. ومع k=5k = 5 أو 1010 تتداخل مجموعات التدريب أقل، فتقلّ ارتباطات الأخطاء ويصبح المتوسط أثبت.

وباتّباع جيمس وزملائه، ثبت تجريبياً أن k=5k = 5 وk=10k = 10 تعطيان تقديرات لخطأ الاختبار لا تعاني تحيّزاً مفرطاً ولا تبايناً عالياً جداً. وهذا سبب الاصطلاح، وهو نتيجة تجريبية لا مبرهنة.

ز. طريقتان للخطأ في هذا

اختيار السمات قبل التحقّق المتقاطع. إذا غربلت المتنبّئات باستخدام البيانات كاملة ثم أجريت تحقّقاً متقاطعاً للنموذج المبنيّ على الناجين، تكون الطيّات المحجوزة قد أثّرت أصلاً في اختيار السمات. وسيكون التقدير متفائلاً، أحياناً بشكل صارخ. فكل اختيار يعتمد على البيانات يجب أن يقع داخل الحلقة.

التحقّق المتقاطع لمشاهدات مترابطة بتقسيم عشوائي. تفترض الطريقة أن المشاهدات المحجوزة مستقلة عن مشاهدات التدريب. ومع السلاسل الزمنية، أو القياسات المتكرّرة على الشخص نفسه، أو البيانات المجمّعة، يسرّب التقسيم العشوائي معلومات عبر الحدّ. استخدم تقسيماً يحترم البنية - التسلسل الأمامي للزمن، والطيّات المجمّعة للعناقيد.

وفي التصنيف ينتقل كل ما سبق كما هو مع استبدال مقياس الخطأ التربيعي بمعدّل الخطأ في التصنيف؛ ومنطق الطيّات واحد.

الخلاصات الأساسية

  • خطأ التدريب متحيّز إلى أسفل بوصفه تقديراً لخطأ الاختبار، ويسوء مع المرونة، فلا يصلح لاختيار النماذج.
  • تقسيم التحقّق أمين لكنه عالي التباين ويهدر البيانات.
  • LOOCV تأخذ متوسط nn حجباً مفرداً: لا عشوائية تقسيم، وتحيّز ضئيل. وعلى بياناتنا ذات الخمس نقاط أعطت 1.45641.4564 مقابل خطأ تدريب 0.480.48.
  • طيّات k بـk=5k = 5 أو 1010 هي المساومة القياسية - أرخص من LOOCV وأفضل تجريبياً لأن الملاءمات الأقل ارتباطاً تتوسّط بفعالية أكبر.
  • كل قرار يعتمد على البيانات يجب أن يقع داخل حلقة إعادة المعاينة، ويجب أن تحترم بنية الطيّات الترابط الموجود في البيانات.

ما التالي

استخدمنا الملاءمة الخطية مثالاً متكرّراً ثلاث مرات حتى الآن دون اشتقاقها. وتلك هي الثغرة التي يجب سدّها: الانحدار الخطي من المبادئ الأولى يبني مقدّر المربّعات الصغرى من الصفر ويبيّن من أين جاء y^=2.2+0.6x\hat y = 2.2 + 0.6x.

المراجع والقراءات الإضافية

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 3 دقيقةTime Series

درجةٌ تخسر أمام عدم الفعل

نموذج الجيران الخمسة الأقرب يسجّل 0.9983 في التحقّق المتقاطع العشوائي بخمسة أثلاث على مشية عشوائيّة، وهي سلسلة زياداتها غير قابلة للتنبّؤ بالبناء. وبتقييمه تقدّمًا في الزمن يسجّل 0.6559 بجذر متوسّط خطأ تربيعي أكبر 12.44 مرّة، ويخسر أمام إبقاء آخر قيمة مرصودة كما هي. فالقسمة، لا النموذج، هي التي أنتجت الرقم الأوّل.

الإحصاءتعلّم الآلة
قراءة 6 دقيقةأسس التعلّم الإحصائي

مقايضة التحيّز والتباين

التفكيك الدقيق لخطأ الاختبار المتوقّع إلى مربّع التحيّز والتباين والضجيج غير القابل للتقليص، مبرهَناً عددياً بمحاكاة من 2000 تكرار تُقاس فيها الحدود الثلاثة كلٌّ على حدة ويُتحقّق من أن مجموعها يطابق.

الإحصاءتعلّم الآلةالرياضيات
قراءة 5 دقيقةالتعلّم غير المُشرَف عليه

الاتّجاه الذي يتغيّر حين تغيّر وحدة القياس

اثنا عشر شخصًا، وقياسان لكلٍّ منهم، وثلاث مكوّنات رئيسة أولى مختلفة: بالمليمترات يكون الجواب الطول وحده تقريبًا، وبالأمتار الوزن وحده تقريبًا، وبالسنتيمترات مزيجًا متوازنًا - مع بقاء الارتباط عند 0.9500 في الحالات الثلاث. وما يقوله ذلك عمّا تعظّمه المكوّنات الرئيسة، ولماذا قد تكون نسبة تباين مفسَّر تبلغ 99.999% قولًا عن الأمتار لا عن الأشخاص، وما الذي تختاره المعيرة فعلًا.

تعلّم الآلةالإحصاء
← العودة إلى كل المقالات