تخطّي إلى المحتوى
Kudos AI

المرجع الذي يصعب تجاوزه

مصفوفة تقييمات فارغة بنسبة 82٪، والإزاحتان اللتان تفسّران معظم ما فيها، والعوامل الكامنة التي تكسب الثلث الباقي.

متوسّطالوحدة 125 دقيقة · 100 XP
مصفوفة تقييمات فارغة في معظمها، وصفّان من الإزاحات ينزلان إلى موضعيهما فيمتصّان معظم الخطأ، ثمّ متّجهات كامنة تظهر إلى جانب كلّ مستخدم وكلّ عنصر لتطالب بالباقي.

يبدأ الجميع نظام التوصية بالنموذج المثير. ابدأ بالمملّ بدلاً من ذلك، فعلى كتالوغ محاكًى من 800 مستخدم و300 عنصر يوصلك إلى ثلثي الطريق.

الجدول

مصفوفة التقييمات فيها المستخدمون على جانب والعناصر على الآخر، ولا شيء تقريباً في الوسط. وفي المحاكاة المستعملة في هذا المسار كلّه، 17.7٪ من الخانات ممتلئة، والنصف الأقلّ تقييماً من الكتالوغ لا يحمل إلّا 23٪ من التقييمات.

وهذا التفرّق ليس مجرّد إزعاج. فالخانة الغائبة ليست غائبة عشوائياً. إنّها غائبة لأنّ ذلك الشخص لم يصادف العنصر قطّ، وما يصادفه الناس يتوقّف على ما كان شائعاً، وما جرى الترويج له، وما اختار نظام توصية سابق أن يعرضه عليهم.

فكلّ تقدير يُبنى على الخانات الممتلئة يصف جمهوراً انتقاه الإجراء نفسه الذي تحاول تحسينه. وهذا هو شكل مشكلة الخلط بعينه، وسيعود في الدرس الثالث برقم مرافق.

ثلاثة نماذج، بترتيب الطموح

تنبّأ بالمتوسّط العامّ لكلّ خانة. الخطأ الجذري 0.9368. وهو مرجع حقيقيّ يستحقّ الحساب، لأنّه يبيّن مقياس كلّ ما يليه.

أضف إزاحتين. واحدة لكلّ مستخدم تلتقط من يقيّم بسخاء، وواحدة لكلّ عنصر تلتقط ما يحبّه أكثر الناس:

r^(u,i)=μ+bu+bi\hat{r}(u,i) = \mu + b_u + b_i

الخطأ الجذري 0.6761.

أضف عوامل كامنة. أعطِ كلّ مستخدم متّجهاً قصيراً pup_u وكلّ عنصر متّجهاً qiq_i، ليعبّر جداؤهما القياسيّ عن أنّ هذا النوع من الناس يحبّ ذلك النوع من العناصر:

r^(u,i)=μ+bu+bi+pu⋅qi\hat{r}(u,i) = \mu + b_u + b_i + p_u \cdot q_i

بثمانية عوامل، الخطأ الجذري 0.5393.

النموذجالخطأ الجذريحصّته من التحسّن الكلّي
المتوسّط العامّ0.9368-
+ إزاحتا المستخدم والعنصر0.676166٪
+ 8 عوامل كامنة0.5393100٪

فالإزاحتان تحملان الثلثين. وهذا هو الشكل النافع للمسألة: جزء كبير من أيّ تقييم لا يتعلّق بالتوافق بين شخص وعنصر البتّة، بل بمقيِّم يمنح كلّ شيء درجات عالية وبعنصر يحبّه أكثر الناس.

لماذا التقليص ليس إجراءً شكلياً

انظر في مقام هذا التحديث:

bi=∑u(rui−μ−bu)ni+λb_i = \frac{\sum_{u} (r_{ui} - \mu - b_u)}{n_i + \lambda}

من دون λ\lambda، ينال عنصر قُيِّم ثلاث مرّات إزاحةً ملائَمة على ثلاثة أعداد، ويُوثَق به تماماً كما يُوثَق بإزاحة ملائَمة على ثلاثمئة. وفي كتالوغ تتفاوت فيه الأعداد بمراتب من حيث القدر، هكذا يصل عنصر مغمور بأربعة تقييمات متحمّسة إلى رأس كلّ قائمة.

وإضافة λ\lambda تجرّ كلّ إزاحة نحو الصفر بقدر قلّة البيانات التي تسندها. فالعنصر ذو التقييمات الثلاثة يكاد لا يتحرّك عن المتوسّط العامّ؛ وذو الثلاثمئة يُترك وشأنه تقريباً. وهي فكرة انحدار الحرف نفسها، وهي هنا تؤدّي معظم عمل إبقاء النموذج عاقلاً.

وعدم التناظر في هذه المخرجات هو المقصود كلّه. فعند λ=8\lambda = 8 يحتفظ العنصر النحيل بـ27٪ من جودته الظاهرة بينما يحتفظ الجيّد الرصد بـ97٪.

يحوّل الشكل أدناه ذلك المقام إلى مؤشّر، ويُظهر ما يقرّره: لا الإزاحات، بل الترتيب. أنزِل الثابت إلى الصفر يتصدّرِ القائمةَ فيلمٌ قصير قيّمه أربعة أشخاص، لأن عدد التقييمات لا يدخل الحساب أصلًا بلا انكماش. وليس في الحساب خطأ: فذاك حقًّا متوسّط ما قاله أولئك الأربعة. لكنه ليس تقديرًا لما سيراه القادم التالي، ولا يعرف الفرق إلا ذلك الثابت.

تفاعلي: الثابت الذي يقرّر صدارة القائمة

اسحب ثابت الانكماش وراقب صدارة القائمة تنتقل من يد إلى يد.

كلاسيكي محبوب300 تقييمًا+3وثائقي متخصّص11 تقييمًا+1مفضّل ثابت96 تقييمًا+2جزء ثانٍ رائج180 تقييمًا+2فيلم قصير ذو جمهور خاص4 تقييمًا-4عمل يرضي الجمهور العريض420 تقييمًا+1ألبوم نفدت نسخه3 تقييمًا-5تجربة مثيرة للانقسام27 تقييمًا
المتوسّط الخامالإزاحة المُلائَمة
λ
8
صدارة القائمة
كلاسيكي محبوب
ذو التقييمات الأربعة يحتفظ بـ
33%
ذو الثلاثمئة يحتفظ بـ
97%

عند λ = 8 لا يحتفظ العنصر ذو التقييمات الأربعة إلا بـ 33% من جودته الظاهرة، بينما يحتفظ ذو الثلاثمئة بـ 97%، وتعود الصدارة إلى كلاسيكي محبوب بـ 300 تقييمًا. وهذه اللاتماثلية هي الآلية كلها: إذ تُجذَب كل إزاحة نحو الصفر بمقدار ضآلة ما يسندها من بيانات، فالصف الرقيق يكاد لا يبرح المتوسّط العام، والصف السميك يُترك وشأنه تقريبًا. وادفع λ أبعد فينهار الفهرس كله نحو المتوسّط، وهذه هي المقايضة التي يضبطها الثابت.

ما الذي تضيفه العوامل

الثلث الباقي من التحسّن يأتي من حدّ التفاعل. فيأخذ كلّ مستخدم متّجهاً، ويأخذ كلّ عنصر متّجهاً، ويقول الجداء القياسيّ إن كان هذا اتّجاه الذوق يوافق ذلك اتّجاه العنصر.

ولا أحد يسمّي تلك الاتّجاهات مسبقاً. إنّها ما يفسّر البواقي، وهي غير محدَّدة إلّا إلى دوران، ما يعني أنّ أيّ تفسير تضعه على محور بعينه حكايةٌ عن أساس واحد اعتباطيّ من بين كثير. وقد يصادف أن يوافق اتّجاهٌ شيئاً معروفاً. لا تبنِ ميزة منتج على افتراض حدوث ذلك.

ونتيجتان عمليّتان:

  • زيادة العوامل تلائم بيانات التدريب أفضل دائماً، وتبدأ بحفظ الصفوف المتفرّقة. فعدد العوامل وثابتة التقليص يجب أن يُختارا معاً على بيانات تحقّق
  • لا يملك النموذج ما يقوله عن مستخدم أو عنصر لم يره قطّ، إذ لم يُلائَم متّجهه أصلاً. وهذا موضوع الدرس التالي

ما الذي يمهّد له هذا

الأرقام هنا متوسّطات على مجموعة اختبار. والدرس التالي يفكّك خطأ النموذج نفسه بحسب مقدار تاريخ كلّ مستخدم، فيجد أنّه أسوأ ما يكون تحديداً عند الأشخاص الذين يحتاج نظام التوصية إلى إقناعهم أكثر من غيرهم.

المراجع والقراءات الإضافية

  • Charu C. Aggarwal, Recommender Systems: The Textbook, Springer, 2016· مكتبة مراجع Kudos AI
  • Kevin P. Murphy, Probabilistic Machine Learning: An Introduction, MIT Press (Adaptive Computation and Machine Learning), 2022المصدر ↗

تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.

افتح المسار كاملًا

هذا الدرس الأول مجاني. سجّل لتخوض اختبار الإتقان وتكسب نقاط الخبرة وتفتح جميع الوحدات، مع مزيد من الأمثلة التفاعلية القابلة للتشغيل.