تخطّي إلى المحتوى
Kudos AI

الإنتروبيا المتقاطعة

مقياس للفارق بين توزيعين احتماليين، يُستخدم دالةَ خسارة قياسية في التصنيف.

يُعرف أيضاً باسم: خسارة لوغاريتمية, سالب اللوغاريتم الاحتمالي

فهم الإنتروبيا المتقاطعة

تسأل الإنتروبيا المتقاطعة عن كلفة وصف نتائج مسحوبة من توزيع حقيقي باستخدام ترميز بُني لتوزيع متنبَّأ به. فإن طابق التنبؤ الواقع كانت الكلفة أدنى ما يمكن وساوت إنتروبيا التوزيع الحقيقي نفسه. وكلما اتسع الفارق ازدادت البتات المهدورة، فتصبح الكمية مقياسًا طبيعيًا لمدى خطأ التوزيع المتنبَّأ به.

في التصنيف يكون التوزيع الحقيقي عادةً متجهًا أحاديّ التفعيل: الفئة الصحيحة احتمالها 1 وسائر الفئات صفر. عندئذ ينكمش المجموع إلى حدٍّ واحد هو سالب لوغاريتم الاحتمال الذي أعطاه النموذج للفئة الصحيحة. فالتنبؤ بـ 0.9 للفئة الصحيحة يكلّف ‎−log(0.9) ≈ 0.105‎، بينما يكلّف التنبؤ بـ 0.1 مقدار ‎−log(0.1) ≈ 2.303‎، أي أكثر من عشرين ضعفًا.

هذا اللاتماثل مقصود ومهم. فحين يقترب الاحتمال المتنبَّأ به للفئة الحقيقية من الصفر تنمو الخسارة بلا حدّ. النموذج الواثق المخطئ يُعاقَب بقسوة، وهذا يثبّط فرط الثقة الذي تتسامح معه خسارة متماثلة كالخطأ التربيعي.

واقترانها بمخرجات softmax أو sigmoid هو ما يجعلها عملية. فاللوغاريتم وحده مشتقّته غير مريحة، لكنه مع هاتين الدالتين يبسّط تدرج الخسارة بالنسبة إلى المخرج ما قبل التفعيل إلى فرق بسيط بين الاحتمال المتنبَّأ به والتسمية الحقيقية. فيصير التدرج متناسبًا مع الخطأ، لا يتشبّع، ويبقى مستقرًا عدديًا، وهذا بالضبط سبب كون هذا الاقتران هو الخيار الافتراضي.

كيفية الحساب

H(p, q) = − Σᵢ p(xᵢ) log q(xᵢ); for one-hot labels this reduces to −log q(correct class)

حيث

p
التوزيع الحقيقي، وهو عادةً أحاديّ التفعيل على الفئات
q
التوزيع الذي تنبأ به النموذج
H(p, q)
الإنتروبيا المتقاطعة، أي متوسط كلفة ترميز p باستخدام q

مثال على الإنتروبيا المتقاطعة

مسألة بثلاث فئات فئتها الصحيحة B تعطي هدفًا أحاديّ التفعيل ‎(0, 1, 0)‎. فإن تنبأ النموذج بـ ‎(0.2, 0.7, 0.1)‎ كانت الخسارة ‎−log(0.7) ≈ 0.357‎.

وإن تنبأ بدل ذلك بـ ‎(0.2, 0.1, 0.7)‎ فوضع جُلّ ثقته على الفئة الخاطئة، صارت الخسارة ‎−log(0.1) ≈ 2.303‎. انقسم الاحتمال المعطى للفئة الصحيحة على سبعة، فتضاعفت الخسارة نحو ستة أضعاف ونصف.

أما التنبؤ الصحيح شبه اليقيني عند 0.99 فلا يكلّف سوى ‎−log(0.99) ≈ 0.01‎، بينما يكلّف التنبؤ الخاطئ شبه اليقيني عند 0.01 نحو 4.61. هذا الانحدار الحادّ في الجانب الخاطئ هو ما يبعد النموذج عن الأخطاء الواثقة أثناء التدريب.

الأسئلة الشائعة

لماذا لا نستخدم الخطأ التربيعي في التصنيف؟

الخطأ التربيعي مع مخرج sigmoid ينتج هدفًا غير محدّب تتلاشى تدرجاته تحديدًا حيث يكون النموذج أشدّ خطأ، فيتعثّر التعلّم عند الأمثلة الأهم. أما الإنتروبيا المتقاطعة فتُبقي التدرج متناسبًا مع الخطأ وتظل محدّبة في الانحدار اللوجستي.

ما علاقة الإنتروبيا المتقاطعة بالأرجحية العظمى؟

هما التحسين نفسه. فأرجحية التسميات المرصودة جداءٌ لاحتمالات متنبَّأ بها، وأخذ سالب لوغاريتمه يحوّل الجداء إلى المجموع الذي يعرّف الإنتروبيا المتقاطعة. تصغير إحداهما هو تعظيم الأخرى.

ما الفرق بين الإنتروبيا المتقاطعة وتباعد كولباك-لايبلر؟

الإنتروبيا المتقاطعة تساوي إنتروبيا التوزيع الحقيقي مضافًا إليها تباعد كولباك-لايبلر من الحقيقي إلى المتنبَّأ به. وبما أن التوزيع الحقيقي ثابت أثناء التدريب فإنتروبياه ثابتة، ومن ثمّ فتصغير الإنتروبيا المتقاطعة وتصغير التباعد أمر واحد.

الخلاصة

تقيّم الإنتروبيا المتقاطعة توزيعًا متنبَّأ به بلوغاريتم الاحتمال الذي أعطاه لما وقع فعلًا، فتعاقب الأخطاء الواثقة بلا حدّ. ومع softmax تمنح التدرج النظيف غير المتشبّع الذي جعلها خسارة التصنيف الافتراضية.