تخطّي إلى المحتوى
Kudos AI
Read in English
التعلّم غير المُشرَف عليه

الاتّجاه الذي يتغيّر حين تغيّر وحدة القياس

اثنا عشر شخصًا، وقياسان لكلٍّ منهم، وثلاث مكوّنات رئيسة أولى مختلفة: بالمليمترات يكون الجواب الطول وحده تقريبًا، وبالأمتار الوزن وحده تقريبًا، وبالسنتيمترات مزيجًا متوازنًا - مع بقاء الارتباط عند 0.9500 في الحالات الثلاث. وما يقوله ذلك عمّا تعظّمه المكوّنات الرئيسة، ولماذا قد تكون نسبة تباين مفسَّر تبلغ 99.999% قولًا عن الأمتار لا عن الأشخاص، وما الذي تختاره المعيرة فعلًا.

قراءة 5 دقيقةKudos AI

المتطلبات المسبقة: التعلّم غير المُشرَف عليه: بنية بلا وسوم

سحابة نقاط يمرّ فيها اتّجاه يدور، والقطع المتبقّية إلى ذلك المستقيم تتقلّص حتى يستقرّ، ثم السحابة نفسها تُرسَم على محور ممدود فينتقل الاتّجاه المستقرّ إلى اتّجاه آخر.

هؤلاء اثنا عشر شخصًا، قِيس كلٌّ منهم مرّتين.

الطول168172175177180181183185186188191193
الوزن586361687066747278758280

الطول بالسنتيمترات والوزن بالكيلوغرامات. اسأل تحليل المكوّنات الرئيسة عن الاتّجاه الأوحد الذي يتباين هؤلاء على امتداده أكثر ما يتباينون، فيجيب

ϕ1=(0.7054,  0.7088),\phi_1 = (0.7054,\; 0.7088),

أي مزيجًا متوازنًا على وجه التقريب من القياسين، يحمل 97.500% من التباين الكلّي.

والآن سجّل الأطوال بالمليمترات. لم يزدد أحد طولًا. فيصير الجواب ϕ1=(0.9955,  0.0951)\phi_1 = (0.9955,\; 0.0951): الطول وحده تقريبًا، حاملًا 99.904%.

سجّلها بالأمتار. فيصير الجواب ϕ1=(0.0095,  1.0000)\phi_1 = (0.0095,\; 1.0000): الوزن وحده تقريبًا، حاملًا 99.999%.

ثلاثة اتّجاهات مختلفة، وثلاث حكايات مختلفة عمّا يحرّك التباين في هذه المجموعة، ولم يتغيّر رقم واحد في البيانات نفسها. فالارتباط بين الطول والوزن يساوي 0.9500 في الحالات الثلاث، لأنّ الارتباط بلا وحدة، والمكوّنة الرئيسة الأولى ليست كذلك.

أ. ما الذي تعظّمه الطريقة فعلًا

المكوّنة الرئيسة الأولى هي الاتّجاه ϕ1\phi_1، ذو الطول الواحد، الذي يعظّم تباين البيانات المُسقَطة:

max⁡∥ϕ∥=1Var⁡ ⁣(ϕ⊤x).\max_{\|\phi\|=1} \operatorname{Var}\!\left(\phi^{\top} x\right).

يستعمل الشكل ست نقاط بلا وحدات بدل الأشخاص الاثني عشر، ليُظهر الهدف نفسه: أدِر اتّجاه المستقيم تجد أنّ الاتّجاه الذي يلتقط أكبر تباين هو الذي يترك أصغر مسافة مربّعة إلى المستقيم.

تفاعلي: ما الذي يبقيه الإسقاط وما الذي يفقده

ست نقاط، ومستقيم واحد، وكل الزوايا متاحة.

التباين المحفوظ
2.0000
المسافة المربّعة المفقودة
6.1667
مجموعهما
8.1667

يُحفظ 2.0000 من التباين. وانظر خاصةً إلى المقياس الثالث: فالأوّلان يتحركان في اتجاهين متعاكسين ومجموعهما لا يتغيّر أبدًا مهما كانت الزاوية. فتعظيم التباين المحفوظ وتصغير المسافة العمودية إلى المستقيم ليسا معيارين تصادف اتفاقهما، بل معيار واحد مكتوب بطريقتين. ولا زاوية تتفوّق على المركّبة الرئيسة؛ حاول أن تجد واحدة.

القيد ∥ϕ∥=1\|\phi\| = 1 هو ما يجعل المسألة حسنة الطرح، وهو أيضًا المدخل الذي تدخل منه الوحدات. فتثبيت طول ϕ\phi عند الواحد يعامل خطوةً مقدارها واحد في الإحداثي الأوّل كخطوةٍ مقدارها واحد في الثاني. وبالسنتيمترات والكيلوغرامات هذا ادّعاء يمكن الدفاع عنه: فالسنتيمتر والكيلوغرام كسران متقاربان من تشتّت هذه المجموعة. أمّا بالمليمترات والكيلوغرامات فهو يقول إنّ مليمترًا من الطول يساوي كيلوغرامًا من الوزن، وهو ما لا يقوله أحد جهرًا. تقوله الطريقة صامتةً، ثمّ تجيب عن السؤال الذي طُرح عليها حقًّا.

ويظهر ذلك في التباينات. فالطول يتباين بمقدار

5790.2 mm2,57.9015 cm2,0.005790 m2,5790.2\ \text{mm}^2, \qquad 57.9015\ \text{cm}^2, \qquad 0.005790\ \text{m}^2,

تبعًا لطريقة تدوينه لا غير، بينما يبقى الوزن عند 58.4470 kg258.4470\ \text{kg}^2. والتباين بوحدات مربّعة، فتغيير الوحدة بعامل عشرة يغيّر التباين بعامل مئة. واتّجاه أكبر تباين يتبع المتغيّر المسجَّل بأصغر وحدة.

ب. النسبة التي لا تفسّر شيئًا

جواب الأمتار هو الجدير بالوقوف عنده. فمكوّنته الأولى تحمل 99.999% من التباين، وهو الرقم الذي يُنهي التحليل عادةً: رقم واحد يحلّ محلّ رقمين بلا خسارة تُذكر، ومخطّط الركام يهبط بعد المكوّنة الأولى هبوطًا لا يكون أحدّ منه.

وهو قول عن الأمتار. فالطول بالأمتار يتباين بمقدار 0.0058، والوزن بالكيلوغرامات بمقدار 58.45، ونسبة عشرة آلاف إلى واحد تعني أنّه لم يبقَ للاتّجاه الثاني ما يحمله تقريبًا. فالمكوّنة «تفسّر» 99.999% من مجموعٍ يكاد الوزن وحده أن يكونه. ولو كانت الأطوال بالأمتار والأوزان بالغرامات لأعلن الحساب نفسه أنّ الطول هو الحكاية كلّها.

ونسبة التباين المفسَّر لا تقيس تركّزًا إلّا بعد وضع المتغيّرات على أساس أنت مستعدّ للدفاع عنه. وقبل ذلك هي قياس لجدول بياناتك.

ج. ما الذي تختاره المعيرة

العلاج المعتاد هو المعيرة: قسمة كل متغيّر على انحرافه المعياري قبل التحليل، وهو نفسه إجراء التحليل على مصفوفة الارتباط. عندئذٍ يتباين كل متغيّر بمقدار واحد بالضبط، ولا تبقى وحدة تميل بالجواب.

ولهؤلاء الاثني عشر يعطي ذلك

ϕ1=(0.7071,  0.7071),PVE=0.975002.\phi_1 = (0.7071,\; 0.7071), \qquad \text{PVE} = 0.975002.

والرقمان يستحقّان نظرةً ثانية. فـ 0.70710.7071 هو 1/21/\sqrt{2}، وليس ذلك مصادفة: فمع متغيّرين معيَّرين تحمل مصفوفة الارتباط الواحد على قطرها و rr خارجه، ومتّجهاتها الذاتيّة هي دائمًا (1,1)/2(1, 1)/\sqrt{2} و (1,−1)/2(1, -1)/\sqrt{2} مهما كان rr. أي أنّ الاتّجاه كان مثبَّتًا قبل أن ينظر أحد في البيانات. والإشارة وحدها تحمل معلومة، وعن إشارة rr فقط.

والنسبة محدَّدة كذلك: فالقيم الذاتيّة هي 1+r1 + r و 1−r1 - r، ومن ثمّ

PVE=1+r2=1+0.9500042=0.975002,\text{PVE} = \frac{1 + r}{2} = \frac{1 + 0.950004}{2} = 0.975002,

أي الارتباط نفسه مُعاد صياغته. فعلى متغيّرين معيَّرين يستعيد التحليل ما قاله الارتباط ولا يضيف شيئًا. وليس هذا حجّةً ضدّ المعيرة، بل تذكيرٌ بأنّ الطريقة لا تملك مصدر معلومات خاصًّا بها: فهي تُخبر عن بنية التغاير التي تُسلَّم إليها، والمعيرة قرارٌ في اختيار بنية التغاير التي تُسلَّم.

د. فمتى لا ينبغي أن تعاير؟

المعيرة صائبة حين تقيس المتغيّرات أشياء مختلفة بوحدات مختلفة، وهو الغالب. وهي خاطئة حين تكون فروق المقياس نفسها هي الإشارة:

  • شدّات البكسل. كل القنوات بالوحدة نفسها وعلى المدى نفسه. والقناة التي تكاد لا تتباين بين الصور قليلة الإفادة فعلًا، والمعيرة ترفع ضجيجها إلى مرتبة البنية الحقيقيّة.
  • عوائد الأصول. الوحدة واحدة، والأصل المتقلّب متقلّب. والمعيرة تمحو بالضبط ما يبحث عنه تفكيك المخاطر.
  • قياسات متكرّرة لكمّيّة واحدة، كطيفٍ أو سلسلة زمنيّة مأخوذة عند نقاط كثيرة. فالأحجام النسبيّة على امتداد المحور جزء من الشكل.

والمحكّ ليس إحصائيًّا. اسأل: هل خطوة مقدارها وحدة في المتغيّر الأوّل تقابل خطوة مقدارها وحدة في الثاني؟ فإن كان الجواب نعم فاترك البيانات كما هي. وإن كان السؤال بلا معنًى أصلًا فالمعيرة هي طريقتك في الامتناع عن الإجابة، والجواب الذي تحصل عليه بعدها عن ارتباطات لا عن مقادير.

هـ. ما يعلّمنا إيّاه اثنا عشر شخصًا

كثيرًا ما يُقدَّم تحليل المكوّنات الرئيسة كأنّه يجد بنيةً موجودة ببساطة، كما يجد الانحدار ميلًا موجودًا ببساطة. والأجوبة الثلاثة أعلاه خرجت من جدول بيانات واحد وطريقة واحدة، وهي متناقضة تمامًا.

ما يجده التحليل هو اتّجاه أكبر تباين في الإحداثيات التي قدّمتها أنت. واختيار تلك الإحداثيات - مليمترات أم أمتار، خامًا أم معيَّرة - قرار نمذجة بثقل اختيار متنبّئ، ويُتَّخذ سواء انتبه إليه أحد أم لا. والصيغة الأمينة لتقرير عن مكوّنات رئيسة تذكر أيّ اختيار اتُّخذ ولماذا، وأسرع طريقة لمعرفة هل كان له أثر هي أن تتّخذ الاختيار الآخر وتنظر.

المراجع والقراءات الإضافية

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

قراءات ذات صلة

قراءة 6 دقيقةالتعلّم غير المُشرَف عليه

التعلّم غير المُشرَف عليه: بنية بلا وسوم

ما الذي يتغيّر حين لا توجد استجابة تُتنبَّأ: المكوّنات الرئيسة بوصفها اتّجاه التباين الأقصى، وخوارزميّة المتوسّطات K والنهايات المحلّية التي تستقرّ عندها، والعنقدة الهرميّة والوصل الذي يقرّر الجواب - ولماذا لا يمكن التحقّق من أيٍّ من الاختيارات المطلوبة كما يُتحقَّق من مصنّف.

تعلّم الآلةالإحصاء
قراءة 3 دقيقةTime Series

درجةٌ تخسر أمام عدم الفعل

نموذج الجيران الخمسة الأقرب يسجّل 0.9983 في التحقّق المتقاطع العشوائي بخمسة أثلاث على مشية عشوائيّة، وهي سلسلة زياداتها غير قابلة للتنبّؤ بالبناء. وبتقييمه تقدّمًا في الزمن يسجّل 0.6559 بجذر متوسّط خطأ تربيعي أكبر 12.44 مرّة، ويخسر أمام إبقاء آخر قيمة مرصودة كما هي. فالقسمة، لا النموذج، هي التي أنتجت الرقم الأوّل.

الإحصاءتعلّم الآلة
قراءة 6 دقيقةAnomaly Detection

الكاشف الذي لا يُطلِق إنذاراً أبداً دقيق بنسبة 99.5٪

عند معدّل أساس واقعيّ يفوز الكاشف الخامل في الدقّة، وROC قدره 0.9468 يخفي طابور إنذارات كاذباً بنسبة 64٪، والمسافة عن المتوسّط تقع تحت الصدفة حين يجلس الشذوذ في المركز، وعشرون شاذّاً متجمّعاً يخفي بعضها بعضاً عن المنهج المصمَّم لإيجادها.

تعلّم الآلةالإحصاء
← العودة إلى كل المقالات