فهم عدد الشرط
قرب الصغرى يشبه سطحُ الخسارة وعاءً تربيعيًا، وشكل ذلك الوعاء هو هسّيانه. وعدد الشرط نسبة أكبر قيمة ذاتية L لتلك المصفوفة إلى أصغرها μ. فعند κ = 1 تكون خطوط المستوى دوائر ويشير التدرّج إلى الصغرى مباشرةً من أي موضع. وكلما كبر κ استطالت إلى قطوع ناقصة، وصار التدرّج - وهو دائمًا عمودي على خط المستوى - يشير عَرضًا عبر الوادي أكثر مما يشير إلى أسفله.
وليس هذا استعارةً للبطء بل حسابًا له. فخطوة التدرّج تضرب الخطأ على امتداد كل اتجاه ذاتي انحناؤه λ في 1 − ηλ، باستقلال عن سائر الاتجاهات. وكل اتجاه يجب أن ينكمش، فيُسقَف حجم الخطوة بأشدّها انحناءً عند η < 2/L؛ وأبطأ الاتجاهات انكماشًا هو أكثرها استواءً. والقيدان معًا هما ما يجعل κ، لا سواه من خصائص المسألة، يحدّد المعدّل.
وموازنتهما تعطي الخطوة المثلى η = 2/(L + μ) وانكماشًا مقداره (κ − 1)/(κ + 1) في الخطوة. ويجدر تحويل هذا الرقم إلى عدد خطوات قبل الاستخفاف به: فحتى κ معتدل قدره 24 ينكمش بمقدار 0.919488 في الخطوة، فيستغرق قسم الخطأ على مليون 165 خطوة - في مسألة ذات وسيطين. والشبكات الواقعية أعداد شرطها بالآلاف.
ولأن κ خاصية للتوسيط لا للمسألة الكامنة، يمكن تغييره دون تغيير ما يُتعلَّم. فإعادة قياس عمود دخل تزيح القيم الذاتية للهسّيان؛ وكذلك تقييس المتغيّرات، وكذلك التسوية بالدفعة أو بالطبقة. ولهذا تسرّع هذه التقنيات التدريبَ بهذا الاطّراد: ليست تنميقًا إحصائيًا، بل هي شرط المسألة، وشرط المسألة هو المعدّل.
كيفية الحساب
κ = L/μ = λ_max(H) / λ_min(H), ρ_GD = (κ − 1)/(κ + 1)
حيث
- H
- هسّيان الخسارة عند الصغرى
- L
- أكبر قيمة ذاتية: أشدّ انحناء
- μ
- أصغر قيمة ذاتية: أكثر الانحناءات استواءً
- ρ_GD
- العامل الذي يتقلّص به الخطأ في كل خطوة، عند الخطوة المثلى
مثال على عدد الشرط
جُعلت مسألةُ مربعات صغرى سيئة الشرط عمدًا بقسمة أحد أعمدة مصفوفة تصميمها على خمسة. فصار هسّيانها L = 1.760627 وμ = 0.073849، أي κ = 23.8410، والانكماش المتوقَّع (κ − 1)/(κ + 1) = 0.919488 في الخطوة.
وقياس التنفيذ - أخذ المسافة إلى الأمثل عند الخطوتين 20 و100 ثم استخراج النسبة لكل خطوة - يعطي 0.919488. ولم يُلاءم شيء: فالتنبؤ يستعمل قيمتين ذاتيتين ويعيد إنتاج تنفيذ لا يعلم عنهما شيئًا. وبتحويله إلى عدد خطوات، يتنبأ 0.919488 بـ164.6 خطوة لقسمة الخطأ على مليون، والتنفيذ يأخذ 165.
والزخم في المسألة نفسها، بـβ = 0.435629، يبلغ الدقة ذاتها في 42 خطوة. والمعدّل المقارب (√κ − 1)/(√κ + 1) = 0.660022 يتنبأ بتوفير بعامل أربعة إلى خمسة، والتوفير المقيس 165/42 = 3.9؛ والنقص حقيقي ومتوقَّع، لأن معدّل بولياك مقارب ولأن هذا التنفيذ يبلغ دقة الآلة قبل أن يحين المقارب.
الأسئلة الشائعة
كيف أعرف عدد شرط مسألتي دون حساب هسّيان؟
في النماذج الكبيرة لا يُحسب بالضبط بل يُستدل عليه. فالتنفيذ الذي يتذبذب عند رفع معدّل التعلّم قليلًا ويزحف عند خفضه إنما يبلّغ عن κ كبير. والاستجابة العملية واحدة في الحالين: سوِّ المدخلات، وأضف طبقات تسوية، واستعمل الزخم أو طريقة تكيّفية.
هل عدد الشرط الكبير يعني أن النموذج رديء؟
لا. فهو خاصية لطريقة توسيط المسألة لا لما يستطيع النموذج تمثيله. وصنف الدوال نفسه في إحداثيات مختلفة قد يكون κ فيه 1 أو 10٬000 مع حلول متطابقة - وهذا بعينه سبب قدرة إعادة القياس على تحويل زمن التدريب دون أي تغيير في النموذج.
لماذا ينال الزخم √κ بدل κ؟
لأن سرعته متوسط متضائل للتدرّجات السابقة. فعلى الاتجاه المستوي تتوافق التدرّجات المتعاقبة فيتراكم المتوسط؛ وعلى الاتجاه الحادّ تتناوب في الإشارة فيلغي معظمها. فآلية عمياء واحدة تضخّم الاتجاه البطيء بالضبط وتخمد المتذبذب بالضبط، والمعدّل الناتج يتوقف على √κ.
الخلاصة
عدد الشرط أنفع ما يُعرف عن مسألة أمثلة قبل الشروع فيها: يتنبأ بمعدّل التقارب إلى عدة منازل عشرية، ويفسّر نجاح قياس المتغيّرات والتسوية، وجذرُه هو ما يشتريه الزخم والطرائق التكيّفية.