النموذج الذي يختار بيانات تدريبه بنفسه
إزاحتان ملاءَمتان تقدّمان 66٪ من مكسب الدقّة في نظام التوصية قبل تعلّم أيّ عامل كامن، والخطأ أسوأ 1.28 مرّة عند المستخدمين الأقلّ كلاماً، ولا يبلغ إلّا 30٪ من الكتالوغ قائمة العشرة الأولى لأيّ أحد بلا حدّ صريح للشيوع في النموذج، وبعد ستّ جولات من بيانات منتقاة ذاتياً يصير النظام أسوأ 1.14 مرّة حيث كفّ عن النظر بالضبط.
المتطلبات المسبقة: Supervised Machine Learning
كلّ نموذج تدرّبه تقريباً دالّة مطبَّقة على بيانات ثابتة. أمّا نظام التوصية فلا. إنّه يقرّر ما يُعرَض، وما يُعرَض يقرّر ما يُقيَّم، وما يُقيَّم يصير مجموعة تدريبه التالية.
وهذه الخاصّية وحدها تغيّر معنى الدقّة، وتستحقّ أرقاماً. وكلّ ما يلي مقيس على كتالوغ محاكًى 800 في 300 تُعرَف فيه التفضيلات الحقيقية، وهو ما لا تمنحه البيانات الواقعية أبداً.
معظم الدقّة يصل قبل النموذج
المصفوفة مرصودة بنسبة 17.7٪. وثلاثة نماذج، بترتيب الطموح:
| النموذج | الخطأ الجذري | حصّته من التحسّن الكلّي |
|---|---|---|
| التنبّؤ بالمتوسّط العامّ | 0.9368 | - |
| + إزاحة لكلّ مستخدم ولكلّ عنصر | 0.6761 | 66٪ |
| + 8 عوامل كامنة | 0.5393 | 100٪ |
فعددان لكلّ مستخدم ولكلّ عنصر - من يقيّم بسخاء، وأيّ العناصر يحبّه أكثر الناس - يقدّمان ثلثي كلّ ما يبلغه النموذج الكامل.
وهذا هو الشكل النافع للمسألة. فجزء كبير من أيّ تقييم لا يتعلّق بالتوافق بين شخص وعنصر البتّة، وملاءمة ذلك الجزء أوّلاً رخيصة ومتينة على الصفوف المتفرّقة وسهلة الشرح لمن يسأل لماذا أُوصي بعنصر.
وتكسب العوامل الثلث الباقي بالتقاط أيّ أنواع الناس تحبّ أيّ أنواع العناصر. ولا أحد يسمّي تلك الاتّجاهات مسبقاً، والتحليل غير محدَّد إلّا إلى دوران: فأيّ تفسير لمحور بعينه حكاية عن أساس اعتباطيّ واحد من بين كثير.
لماذا التقليص ليس تفصيلاً
من دون ، ينال عنصر قُيِّم ثلاث مرّات إزاحةً ملائَمة على ثلاثة أعداد، ويُوثَق به تماماً كما يُوثَق بإزاحة على ثلاثمئة. وعند ، يحتفظ عنصر تزيد تقييماته الثلاثة بمتوسّط 1.2 عن المتوسّط بـ0.327 منها، أي 27٪، بينما يحتفظ عنصر له ثلاثمئة تقييم مماثل بـ1.169، أي 97٪.
وعدم التناظر هذا هو المقصود كلّه، وهو ما يمنع أربعة تقييمات متحمّسة من رفع عنصر مغمور إلى رأس كلّ قائمة.
يحوّل الشكل أدناه ذلك المقام إلى مؤشّر، ويُظهر ما يقرّره: لا الإزاحات، بل الترتيب. أنزِل الثابت إلى الصفر يتصدّرِ القائمةَ فيلمٌ قصير قيّمه أربعة أشخاص، لأن عدد التقييمات لا يدخل الحساب أصلًا بلا انكماش. وليس في الحساب خطأ: فذاك حقًّا متوسّط ما قاله أولئك الأربعة. لكنه ليس تقديرًا لما سيراه القادم التالي، ولا يعرف الفرق إلا ذلك الثابت.
تفاعلي: الثابت الذي يقرّر صدارة القائمة
اسحب ثابت الانكماش وراقب صدارة القائمة تنتقل من يد إلى يد.
- λ
- 8
- صدارة القائمة
- كلاسيكي محبوب
- ذو التقييمات الأربعة يحتفظ بـ
- 33%
- ذو الثلاثمئة يحتفظ بـ
- 97%
عند λ = 8 لا يحتفظ العنصر ذو التقييمات الأربعة إلا بـ 33% من جودته الظاهرة، بينما يحتفظ ذو الثلاثمئة بـ 97%، وتعود الصدارة إلى كلاسيكي محبوب بـ 300 تقييمًا. وهذه اللاتماثلية هي الآلية كلها: إذ تُجذَب كل إزاحة نحو الصفر بمقدار ضآلة ما يسندها من بيانات، فالصف الرقيق يكاد لا يبرح المتوسّط العام، والصف السميك يُترك وشأنه تقريبًا. وادفع λ أبعد فينهار الفهرس كله نحو المتوسّط، وهذه هي المقايضة التي يضبطها الثابت.
الخطأ ليس موزّعاً بالتساوي
خطأ النموذج الكامل الجذري 0.5393. قسّم مجموعة الاختبار نفسها بحسب تاريخ كلّ مستخدم:
| تقييمات المستخدم في التدريب | الخطأ الجذري | صفوف الاختبار |
|---|---|---|
| أكثر من 30 | 0.5210 | 6928 |
| من 10 إلى 30 | 0.6018 | 1319 |
| أقلّ من 10 | 0.6693 | 254 |
غرامة 1.28× على الأقلّ تقييماً، وانظر العمود الثالث. فالمقيِّمون الكثيفون يقدّمون 6928 من 8501 صفّ اختبار، فيحدّدون الرقم المعلن وحدهم تقريباً، وهم بالضبط من يعرفهم النموذج أصلاً.
والمستخدم الجديد لا يعيش نموذج 0.5210، بل نموذج 0.6693. فالمتوسّط على صفوف الاختبار لا على المستخدمين، وهذا الترجيح بالصفوف يسلّمه إلى المجموعة الأقلّ حاجةً إلى المساعدة، وهذا يجعله الرقم الخطأ للتحسين والرقم الخطأ للعرض.
ولمستخدم بلا شيء لا يحمل الحدّ المخصَّص أي معلومة: فهيّئ المتّجه غير المُلائَم على الصفر أو أسقط الحدّ، فيبقى : الجودة والشيوع، أي القائمة نفسها للجميع. وهو افتراضيّ معقول يستحقّ التسمية بأمانة، وهو يضع السقف لكلّ ما تبنيه للمستخدمين الجدد.
الترتيب يتركّز من تلقاء نفسه
قيّم كلّ عنصر غير مقيَّم لكلّ مستخدم، وخذ أوّل عشرة لكلّ واحد، وعُدّ العناصر المتمايزة في 8000 موضع: 91 من 300، أي 30٪ من الكتالوغ.
وليس في النموذج أيّ حدّ صريح للشيوع. ولا يدخله عدد التقييمات إلّا عبر التقليص، الذي يجذب العناصر القليلة التقييم نحو المتوسّط. وفيما عدا ذلك يأتي التركّز من أنّ إزاحات العناصر تلتقط الجودة، وأنّ الجودة مشتركة: فالعنصر الذي يحبّه أكثر الناس يقع قرب القمّة عند أكثرهم، والتخصيص يعيد ترتيب البركة لا يستبدلها.
وهذا مهمّ لأنّه يغيّر العلاج. فالتركّز ليس عيباً أدخلته سمة شيوع يمكن نزعها؛ إنّه ما يحدث حين يلتقي نظام ترتيب بأذواق مترابطة: فإن كانت تغطية الكتالوغ تهمّك فيجب أن تكون هدفاً صريحاً، لأنّ تحسين مقياس الدقّة لن ينتجها.
ثمّ تنغلق الحلقة
دع النظام يعمل. في كلّ جولة يعرض على كلّ مستخدم أفضل خمسة عناصر لم تُعرَض عليه، ولا يقيّم المستخدمون إلّا ما عُرض عليهم، ويعيد النموذج الملاءمة. ستّ جولات. ولتبقى الحلقة بسيطة، فالنموذج هنا هو الإزاحتان وحدهما، ، فيُرتَّب كلّ مستخدم بحسب : القائمة نفسها للجميع، ناقصاً ما عُرض على كلّ منهم من قبل.
بعدها يكون 28٪ من المصفوفة قد عُرض في وقت ما. وبمقارنة النموذج المعاد ملاءمته بالحقيقة المعلومة:
| المنطقة | الخطأ الجذري في مقابل الحقيقة |
|---|---|
| عناصر عرضها | 0.5441 |
| عناصر لم يعرضها قطّ | 0.6213 |
بقعة عمياء بمقدار 1.14×، في المنطقة التي اختار ألّا ينظر إليها بالضبط. ففي كلّ جولة تقرّر معتقداته الحالية ما الذي سيُقيَّم لاحقاً، فتصير بياناته المقبلة عيّنةً من آرائه الحاضرة. وحيث كان واثقاً ومصيباً جمع تأكيداً؛ وحيث كان واثقاً ومخطئاً لم يجمع شيئاً، ولم يأتِ ما يصحّحه.
لماذا لا يرى التقييم دون اتّصال ذلك
سجلّاتك تحوي تقييمات للعناصر التي عرضتها. ومجموعة اختبارك دون اتّصال شريحة محجوزة من السجلّ نفسه. فيجري التقييم في المنطقة التي يكون فيها النموذج دقيقاً. ففي مقابل الحقيقة يخطئ النموذج هناك بـ0.5441، وبـ0.6213 في كلّ ما عداها، لكنّ السجلّ لا يحوي إلّا المنطقة الأولى، وتقييمات مشوبة بالضجيج عنها: فإذا قُيِّم عليها، أي على الخلايا المعروضة التي لوئم عليها، أعلن النموذج نفسه 0.611، وهو رقم لا يحمل أيّ أثر للمنطقة التي لم يعرضها قطّ. وحجز شريحة من السجلّ بدلاً من ذلك لا يزحزح الرقم إلّا قليلاً، لأن الشريحة المحجوزة من السجلّ تبقى داخل المنطقة المعروضة.
فالنموذج الذي كفّ بهدوء عن فهم الـ72٪ من المصفوفة التي لم يعرضها سيبدو ممتازاً في كلّ مقياس دون اتّصال لديك، وسيظلّ كذلك بينما تتّسع البقعة العمياء.
ما الذي يفيد، مقيساً بأمانة
احجز موضعاً من كلّ خمسة لعنصر عشوائيّ وأعد الجولات الستّ. يهبط الخطأ على غير المعروض من 0.6213 إلى 0.6162، وتضيق البقعة العمياء من 1.14× إلى 1.12×، ويعود ذلك جزئياً إلى ارتفاع الخطأ على العناصر المعروضة من 0.5441 إلى 0.5497.
وهذا أثر صغير، والقراءة الأمينة لأثر مقيس صغير أنّه صغير. فخُمس مواضعك اشترى تصحيحاً بأقلّ من واحد بالمئة في المنطقة التي كانت تقلقك. والاستكشاف تأمين لا علاج: يمنع ذيل الكتالوغ من الاختفاء تماماً، ولا يبطل ستّ جولات من بيانات منتقاة ذاتياً.
وتدبيران يكلّفان أكثر ويفعلان أكثر:
- سجّل الميل - احتمال أن يعرض النظام كلّ عنصر لحظة عرضه. فبتسجيله يمكن إعادة وزن التقديرات دون اتّصال لتصحيح الانتقاء، وهي فكرة الوزن العكسيّ نفسها في الاستدلال السببيّ. ويجب أن يُقرَّر قبل الحاجة إليه، فالميول لا تُستعاد بعد الأمر.
- جرّب على السياسة لا على النموذج - وزّع المستخدمين عشوائياً على أنظمة ترتيب وقِس النتيجة التي تهمّك. وهي الطريقة الوحيدة التي تقيس النظام كما نُشر.
الخاصّية التي تحت هذا كلّه
إزاحتان تحملان ثلثي مكسب الدقّة، فأكثر ما يعرفه نظام التوصية هو «من يقيّم بسخاء» و«ما هو الجيّد» لا «من يحبّ ماذا». والخطأ أسوأ ما يكون عند المستخدمين الذين تقرّر تجربتهم بقاءهم. والترتيب يتركّز دون أن يُطلَب منه. والنظام المدرَّب على مخرَجه هو يعمى في المنطقة التي كفّ عن عرضها بينما تبقى كلّ مقاييسه حسنة المظهر.
والأربعة تتبع شيئاً واحداً: مخرَج النموذج يحدّد مجموعة تدريبه التالية. ومتى صحّ ذلك كفّت الدقّة على البيانات المسجّلة عن كونها قياساً للجودة وصارت قياساً للعادة، والمخرج الوحيد كسر الحلقة عمداً: بالاستكشاف، أو بتسجيل سبب كلّ اختيار، أو باختبار السياسة نفسها.
المراجع والقراءات الإضافية
- Charu C. Aggarwal, Recommender Systems: The Textbook, Springer, 2016· مكتبة مراجع Kudos AI
- Kevin P. Murphy, Probabilistic Machine Learning: An Introduction, MIT Press (Adaptive Computation and Machine Learning), 2022المصدر ↗
تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.