الانتباه والانتباه الذاتي
الاستعلامات والمفاتيح والقيم مبنيةً من الأساس: لماذا وُجد الانتباه، وكيف يُحسب انتباه الجداء القياسي المقيس، ولماذا يُقسم على جذر البُعد، وكيف يعمل الإقناع السببي، مع حساب كل مصفوفة والتحقّق منها.
المتطلبات المسبقة: الانتشار العكسي والنزول التدرّجي
الانتباه الذاتي هو الآلية التي جعلت نماذج اللغة الحديثة ممكنة. فهي تتيح لكل موضع في متتالية أن ينظر في كل موضع آخر ويقرّر بنفسه أيّها يهمّ. وتبني هذه المقالة تلك الآلية من المشكلة التي تحلّها حتى الحساب المصفوفي الكامل، محلولةً كل رقم على مثال من ثلاث وحدات صغير بما يكفي للتحقّق يدوياً.
أ. المشكلة التي يحلّها الانتباه
فكّر في تحديد مرجع الضمير «هو» في جملة. المعلومة اللازمة تقع في مكان آخر من المتتالية، وموضعها يتوقّف كلياً على الجملة. ولا تستطيع مقاربة النافذة الثابتة التعبير عن «انظر إلى الوراء نحو الكلمة السابقة التي تعتمد عليها هذه فعلاً».
يجعل الانتباه ذلك الاعتماد مُتعلَّماً ومعتمداً على البيانات: إذ يحسب كل موضع، من محتوى الوحدات نفسها، كم يستمدّ من كل موضع آخر.
مستكشف أوزان الانتباه
استعلام واحد ينتبه إلى أربعة أزواج مفتاح/قيمة.
- أكبر وزن
- 29.7%
- تشتّت الانتباه
- 0.990
| الرمز | q · k | ÷ √dₖ | الوزن | |
|---|---|---|---|---|
| the | 0.40 | 0.20 | 22.0% | |
| cat | 1.00 | 0.50 | 29.7% | |
| sat | 0.92 | 0.46 | 28.5% | |
| down | 0.20 | 0.10 | 19.9% |
متجه الاستعلام
المخرَج - المجموع الموزون لمتجهات القيمة
[0.220, 0.297, 0.285, 0.199]
الانتباه متوسط موزون، والسوفت‑ماكس هو ما يحدّد الأوزان. اخفض درجة الحرارة فيتركّز على رمز واحد، وارفعها فينتشر الانتباه بالتساوي. وتعطيل القسمة على √dₖ يباعد بين الدرجات الخام ويدفع السوفت‑ماكس نحو التشبّع، وهذا بالضبط سبب وجود هذا العامل.
ب. الاستعلامات والمفاتيح والقيم
يُسقَط كل تضمين وحدة دخل إلى ثلاثة متجهات بثلاث مصفوفات أوزان مُتعلَّمة:
وتشبيه قاعدة البيانات ملائم فعلاً:
- الاستعلام هو ما يبحث عنه هذا الموضع؛
- والمفتاح هو ما يعلنه كل موضع عن نفسه؛
- والقيمة هي ما يسهم به كل موضع فعلاً إن التُفت إليه.
ومطابقة استعلام بمفتاح تقيس الصلة؛ والقيم هي ما يُمزج. وفصل «ما يعرّف الوحدة» (المفتاح) عن «ما تسهم به» (القيمة) هو ما يمنح الآلية مرونتها - و تُتعلَّم بالمرور الخلفي من الانتشار العكسي والنزول التدرّجي.
ج. انتباه الجداء القياسي المقيس
الآلية كلها، لكل المواضع دفعةً واحدة:
اقرأها في أربع خطوات: سجّل درجة كل استعلام مقابل كل مفتاح ()، وقِسها على ، وسوِّ كل صف ليجمع إلى 1 (softmax)، ثم خذ متوسط القيم مرجّحاً بذلك.
ويلاحظ راشكا أن هذا يُسمّى انتباه الجداء القياسي المقيس، وأنه الآلية المستخدَمة في المحوّل الأصلي وفي عائلة GPT.
د. حلّها بالكامل
ثلاث وحدات، و. ولإبقاء الحساب قابلاً للتحقّق نأخذ و مُسقَطَين بالفعل ومتساويين، مع قيم متمايزة:
الخطوة 1 - درجات الانتباه. المدخلة هي :
تحقّق من واحدة: الصف 3 العمود 3 هو ، وهي أكبر درجة في المصفوفة - فاستعلام الوحدة 3 يطابق مفتاحها هي أفضل مطابقة.
الخطوة 2 - القياس. اقسم على :
الخطوة 3 - softmax لكل صف. في الصف 1، يعطي الأُسّ ، و، و، ومجموعها . وبالقسمة:
الصفوف الثلاثة:
يجمع كل صف إلى 1 - فهذه ترجيحات حقيقية. ويضع الصف 3 وزن على الموضع 3، مطابقاً أقوى درجة من الخطوة 1.
الخطوة 4 - القيم المرجّحة. اضرب في . الصف 1، المركّبة الأولى:
وكل صف خرج مزيج من متجهات القيم الثلاثة، ممزوجة بصلة مُتعلَّمة.
يعمل في متصفحك. تُنزّل عملية التشغيل الأولى بيئة بايثون (~10 ميغابايت)، ثم تُخزّن مؤقتًا.
يعيد تشغيله إنتاج المصفوفتين ويطبع matches: True True.
هـ. لماذا القسمة على جذر البُعد
القياس ليس تجميلاً. فالجداء القياسي لمتجهين ذوي بُعد يجمع حدّاً، فينمو مقداره مع - بمقدار تقريباً لمركّبات مستقلة وحيدة التباين.
والدرجات الكبيرة مشكلة لدالة softmax. فمع كبر المدخلات تقترب softmax من متجه أحادي: وزن قريب من 1 والبقية قرب 0. وفي ذلك النظام المشبَع تكون تدرّجاتها ضئيلة جداً، فـيتعثّر التعلّم. والقسمة على تُبقي الدرجات في مدى تظلّ فيه softmax حسّاسة وتظلّ التدرّجات متدفّقة.
ومع تكون الدرجات غير المقيسة أكبر نحو ثماني مرات من المقيسة - وهو كافٍ بيسر للإشباع.
الشكل أدناه هو الرأس نفسه، وفيه أمران يمكنك تحريكهما. فإدارة استعلام الرمز الثالث تُديره في المستوي الذي تعيش فيه مفاتيحه، ولا يستجيب سوى الصف الثالث من المصفوفة: أما المفاتيح والقيم فلا تتزحزح، وهذا بالضبط ما يجعل الاستعلام استعلامًا. ثم ارفع البُعد. مع وجود القسمة لا يحدث شيء البتة: فالمصفوفة عند 512 بُعدًا هي المصفوفة أعلاه حتى آخر منزلة عشرية. أوقف القسمة ثم ارفع البُعد من جديد، وراقب الصف وهو ينهار على رمز واحد. وهذا الانهيار هو كل سبب وجود الجذر التربيعي في الصيغة.
تفاعلي: وجّه استعلامًا ثم غيّر البُعد
يتحرك استعلام الرمز الثالث وحده. أما المفاتيح والقيم فتبقى كما وضعتها الدرس.
أوزان الانتباه، صفًا صفًا
- المقسوم عليه
- 1.4142
- أكبر وزن
- 0.5035
- انتشار الصف 3
- 1.496 بت
- مخرج الصف 3
- 1.76, 1.00
مع وجود القسمة لا تعتمد مصفوفة الانتباه على d_k إطلاقًا: اسحب البُعد من 2 إلى 512 ولن يتزحزح وزن واحد. وهذه الثبوتية هي كل مضمون الجذر التربيعي: فهو يُبقي الدرجات المقسومة بحجم ثابت بينما تنمو الجداءات القياسية الخام مثل sqrt(d_k)، فيبقى الـsoftmax في المدى الذي ما زال فيه تدرّج يُعاد. والصف الثالث منتشر على 1.496 بت من أصل 1.585 ممكنة.
و. الإقناع السببي
النموذج الذي يولّد النص من اليسار إلى اليمين يجب ألا يرى المستقبل. فلو استطاع الموضع 2 الالتفات إلى الموضع 3، لدُرّب النموذج ومعه الإجابة ولأخفق وقت التوليد، حين لا يكون المستقبل موجوداً فعلاً.
ويمنع الانتباه السببي ذلك بالإقناع: فقبل softmax، تُضبَط كل درجة عند على ، فيكون وتنال تلك المواضع وزناً صفرياً. وتُعاد تسوية الأوزان الباقية لتجمع إلى 1.
وبتطبيق ذلك على درجاتنا المقيسة:
يلتفت الصف 1 إلى نفسه فقط، فيُجبَر وزنه على . ويتوزّع الصف 2 بين الموضعين 1 و2 - ولاحظ أن هاتين ليستا قيمتي الصف 2 غير المُقنَعتين و؛ فمع إزالة الموضع 3، تُعاد تسوية الباقيتين بمجموعهما هما، ، فتعطيان و. (وحمل القيم المقرّبة يدوياً يعطي و؛ والأرقام أعلاه من الحساب بالدقة الكاملة.) أما الصف 3، الذي لم يُسمح له قط برؤية ما بعد الموضع 3، فلم يتغيّر.
ويلاحظ راشكا أيضاً أن قناع إسقاط عشوائي (dropout) كثيراً ما يُطبَّق على أوزان الانتباه أثناء التدريب، للحدّ من فرط الملاءمة.
ز. رؤوس متعدّدة
يلتقط حساب انتباه واحد نوعاً واحداً من العلاقات. أما الانتباه متعدّد الرؤوس فيشغّل عدة حسابات بالتوازي بـ منفصلة، ثم يسلسل المخرجات ويُسقطها ثانيةً إلى الأسفل. ويمكن للرؤوس المختلفة أن تتخصّص - رأس يتتبّع الاعتماديات النحوية، وآخر روابط موضوعية أبعد مدى - ولا يُجبَر النموذج على حشر كل علاقة في ترجيح واحد.
الخلاصات الأساسية
- يتيح الانتباه لكل موضع أن يقرّر، من المحتوى، كم يستمدّ من كل موضع آخر.
- تُسقَط كل وحدة إلى استعلام ومفتاح وقيمة؛ فتُطابَق الاستعلامات بالمفاتيح، والقيم هي ما يُمزج.
- الآلية هي - درجة، فقياس، فتسوية، فمزج.
- المقسوم عليه يمنع إشباع softmax ويُبقي التدرّجات صالحة.
- الإقناع السببي يضبط درجات المستقبل على فتُعاد تسوية الأوزان على الماضي وحده.
- الانتباه متعدّد الرؤوس يشغّل عدة نسخ بالتوازي لالتقاط علاقات مختلفة.
ما التالي
الانتباه هو لبّ المحوّل، لكن نموذج اللغة العامل يحتاج أيضاً إلى تقطيع وتضمينات ومعلومات موضعية وكتل تغذية أمامية وهدف تدريب. وتُغطّى هذه الأجزاء عبر بقية هذا المسار، أما النظير في الذكاء الاصطناعي الكلاسيكي لفكرة «ابحث في فضاء الاحتمالات» فيُطوَّر في البحث التنافسي والمينيماكس.
المراجع والقراءات الإضافية
- Sebastian Raschka, Build a Large Language Model (From Scratch), Manning, 2025· مكتبة مراجع Kudos AI
تُذكر الأعمال المحمية بحقوق النشر للمرجعية فقط ولا تُستضاف هنا؛ يرجى الرجوع إلى الناشر للوصول إليها.