الانتباه والانتباه الذاتي
الاستعلامات والمفاتيح والقيم مبنيةً من الأساس: لماذا وُجد الانتباه، وكيف يُحسب انتباه الجداء القياسي المقيس، ولماذا يُقسم على جذر البُعد، وكيف يعمل الإقناع السببي، مع حساب كل مصفوفة والتحقّق منها.
حرّر متجه الاستعلام وشاهد انتباه الجداء القياسي المُقيَّس وهو يتحوّل إلى أوزان سوفت‑ماكس ثم إلى مجموع موزون، مع درجة الحرارة والقسمة على √dₖ كمفتاحين يمكنك تبديلهما.
استعلام واحد ينتبه إلى أربعة أزواج مفتاح/قيمة.
| الرمز | q · k | ÷ √dₖ | الوزن | |
|---|---|---|---|---|
| the | 0.40 | 0.20 | 22.0% | |
| cat | 1.00 | 0.50 | 29.7% | |
| sat | 0.92 | 0.46 | 28.5% | |
| down | 0.20 | 0.10 | 19.9% |
المخرَج - المجموع الموزون لمتجهات القيمة
[0.220, 0.297, 0.285, 0.199]
الانتباه متوسط موزون، والسوفت‑ماكس هو ما يحدّد الأوزان. اخفض درجة الحرارة فيتركّز على رمز واحد، وارفعها فينتشر الانتباه بالتساوي. وتعطيل القسمة على √dₖ يباعد بين الدرجات الخام ويدفع السوفت‑ماكس نحو التشبّع، وهذا بالضبط سبب وجود هذا العامل.
يعمل بالكامل داخل متصفّحك. لا يُرفع أي شيء تُدخله ولا يُخزَّن.
الاستعلامات والمفاتيح والقيم مبنيةً من الأساس: لماذا وُجد الانتباه، وكيف يُحسب انتباه الجداء القياسي المقيس، ولماذا يُقسم على جذر البُعد، وكيف يعمل الإقناع السببي، مع حساب كل مصفوفة والتحقّق منها.
تركيب GPT من الانتباه: إسقاطات متعدّدة الرؤوس، وتسوية الطبقة محلولةً يدوياً، ولماذا تنقذ وصلات الاختصار التدرّج، وتوسّع شبكة التغذية الأمامية أربع مرات، وعدّ بارامترات يعيد إنتاج GPT-2 الصغير عند 124 مليوناً بالضبط.
كيف يصير النص أرقاماً يستطيع النموذج التدرّب عليها: بناء مفردات، ولماذا لا يحتاج ترميز أزواج البايتات إلى وحدة «مجهول» قط، وطبقة التضمين بوصفها استرجاعاً يمكن البرهان على أنه متجه أحادي مضروب في مصفوفة، ولماذا يجب إعادة حقن الموضع يدوياً.