تخطّي إلى المحتوى
Kudos AI

تقدير الأرجحية العظمى

طريقة لملاءمة نموذج تختار قيم المعاملات التي تجعل البيانات المرصودة أكثر ما تكون احتمالًا.

يُعرف أيضاً باسم: MLE

فهم تقدير الأرجحية العظمى

تقلب الأرجحية العظمى الاتجاه المعتاد للاستدلال الاحتمالي. ففي العادة يُثبَّت النموذج فيسند احتمالات إلى مجموعات البيانات الممكنة. أما هنا فالبيانات ثابتة لأنها رُصدت، والمعاملات هي المتغيّرة: تخبرنا دالة الأرجحية، لكل قيمة مرشّحة، كم كانت البيانات المرصودة محتملة تحتها. والتقدير هو القيمة التي تعظّمها.

وعمليًا يُعظَّم لوغاريتم الأرجحية. فأرجحية مشاهدات مستقلة جداءُ أعداد صغيرة كثيرة، وهو يتدنّى عدديًا إلى الصفر ويصعب اشتقاقه. وأخذ اللوغاريتم يحوّل الجداء إلى مجموع دون أن يزحزح موضع الأعظمية، لأن اللوغاريتم رتيب.

ويوضّح جيمس وزملاؤه الصلة بالطرق المألوفة صراحةً: الأرجحية العظمى هي المنهج العام المستخدم لملاءمة الانحدار اللوجستي وكثير من النماذج غير الخطية، وفي إطار الانحدار الخطي فإن المربعات الصغرى نفسها حالة خاصة منها. فتصغير الخطأ التربيعي هو ما تؤول إليه الأرجحية العظمى حين تُفترض الأخطاء طبيعية بتباين ثابت.

والمطابقة نفسها تصلها بالتعلّم العميق. فتعظيم لوغاريتم أرجحية التسميات المرصودة هو ذاته تصغير الإنتروبيا المتقاطعة، ومن ثمّ فالشبكة المدرَّبة بخسارة إنتروبيا متقاطعة إنما تجري تقديرًا بالأرجحية العظمى. ولهذا تتشابه دوال الخسارة في الإحصاء والتعلم العميق إلى هذا الحد متى كُتبت.

كيفية الحساب

θ̂ = argmax_θ Πᵢ P(xᵢ | θ) = argmax_θ Σᵢ log P(xᵢ | θ)

حيث

θ
المعاملات المراد تقديرها
xᵢ
المشاهدة رقم i من البيانات
P(xᵢ | θ)
احتمال (أو كثافة) تلك المشاهدة تحت θ
θ̂
تقدير الأرجحية العظمى

مثال على تقدير الأرجحية العظمى

تُرمى قطعة نقد 10 مرات فتقع على الوجه 7 مرات. وبمعاملة الرميات كمستقلة باحتمال وجه p مجهول، تكون الأرجحية متناسبة مع ‎p⁷(1 − p)³‎.

وبتعظيم لوغاريتم الأرجحية ‎7 log p + 3 log(1 − p)‎ عبر إصفار مشتقّته ‎7/p − 3/(1 − p)‎ نحصل على ‎7(1 − p) = 3p‎، ومنه ‎p̂ = 0.7‎. فالتقدير هو ببساطة النسبة المرصودة، وهو أمر مطمئن.

ويكشف المثال كذلك ضعف الطريقة الأساسي. فلو وقعت القطعة على الوجه في الرميات العشر كلها لأعلنت الأرجحية العظمى ‎p̂ = 1.0‎، مؤكدةً استحالة الظهر استنادًا إلى عشر رميات. والتنظيم أو التوزيع القَبْلي البايزي هو ما يمنع هذا النوع من الاستنتاج المفرط في الثقة من عينات صغيرة.

الأسئلة الشائعة

ما الفرق بين الأرجحية والاحتمال؟

هما الدالة نفسها مقروءة في اتجاهين متعاكسين. الاحتمال يثبّت المعاملات ويسأل عن مدى احتمال مجموعات بيانات شتى؛ والأرجحية تثبّت البيانات المرصودة وتسأل كم تفسّرها قيم معاملات شتى. والأرجحية ليست توزيعًا احتماليًا على المعاملات ولا يساوي تكاملها واحدًا.

لماذا نعظّم اللوغاريتم بدل الأرجحية نفسها؟

لأن اللوغاريتم متزايد تمامًا فأعظميته في الموضع نفسه، وهو في الوقت ذاته يحوّل جداء احتمالات صغيرة كثيرة إلى مجموع مستقر عدديًا وأسهل اشتقاقًا بكثير.

ما علاقتها بالتقدير البايزي؟

الأرجحية العظمى تستخدم الأرجحية وحدها؛ أما التقدير البايزي فيضربها في توزيع قَبْلي ويعمل على التوزيع البَعْدي الناتج. وتتطابق الأرجحية العظمى مع تقدير الأعظمية البعدية البايزي حين يكون التوزيع القَبْلي منتظمًا.

الخلاصة

تختار الأرجحية العظمى المعاملات التي كانت البيانات المرصودة أرجح ما تكون تحتها. وهي توحّد المربعات الصغرى والانحدار اللوجستي والتدريب بالإنتروبيا المتقاطعة، وميلها إلى فرط الثقة على العينات الصغيرة هو تحديدًا ما وُجد التنظيم والتوزيعات القَبْلية لتلطيفه.