الذكاء الاصطناعي التوليدي
نماذج تُنتِج بدل أن تصنّف: الأرجحية ونماذج المتغيّرات الكامنة، والانتشار، والوجه التوليدي للمحوّل.
المسارات (1)
الموسوعة (4)
التقطيع إلى رموز
عملية تقسيم النص إلى الوحدات المنفصلة التي يعمل عليها نموذج اللغة فعلًا، وهي عادةً أجزاء كلمات لا كلمات كاملة.
الانتباه الذاتي
آلية تتيح لكل موضع في متتالية أن ينتبه إلى كل موضع آخر، فيُحسب كل مخرج مجموعًا موزونًا لقيم تأتي أوزانها من تشابه الاستعلامات والمفاتيح.
المحوّل
معمارية عصبية مبنية على طبقات مكدّسة من الانتباه الذاتي والتغذية الأمامية، حلّت محلّ التكرارية معيارًا لنمذجة المتتاليات.
التدريب المسبق والضبط الدقيق
الوصفة ذات المرحلتين: تدريب نموذج أولًا على متن عام كبير، ثم تكييفه لمهمة محددة بمجموعة بيانات موسومة أصغر بكثير.
المقالات (4)
التقطيع إلى وحدات والتضمينات
كيف يصير النص أرقاماً يستطيع النموذج التدرّب عليها: بناء مفردات، ولماذا لا يحتاج ترميز أزواج البايتات إلى وحدة «مجهول» قط، وطبقة التضمين بوصفها استرجاعاً يمكن البرهان على أنه متجه أحادي مضروب في مصفوفة، ولماذا يجب إعادة حقن الموضع يدوياً.
معمارية المحوّل
تركيب GPT من الانتباه: إسقاطات متعدّدة الرؤوس، وتسوية الطبقة محلولةً يدوياً، ولماذا تنقذ وصلات الاختصار التدرّج، وتوسّع شبكة التغذية الأمامية أربع مرات، وعدّ بارامترات يعيد إنتاج GPT-2 الصغير عند 124 مليوناً بالضبط.
التدريب المسبق والضبط الدقيق
كيف يحوّل التنبّؤ بالكلمة التالية نصاً غير موسوم إلى إشراف، ولماذا الإنتروبيا المتقاطعة ليست إلا سالب متوسط لوغاريتم الاحتمال، وماذا تقيس الحيرة فعلاً، ولماذا يظلّ نموذج يُكمل النص بطلاقة عاجزاً عن اتّباع تعليمة.
الانتباه والانتباه الذاتي
الاستعلامات والمفاتيح والقيم مبنيةً من الأساس: لماذا وُجد الانتباه، وكيف يُحسب انتباه الجداء القياسي المقيس، ولماذا يُقسم على جذر البُعد، وكيف يعمل الإقناع السببي، مع حساب كل مصفوفة والتحقّق منها.
الأدوات (1)
البحث (4)
Attention Is All You Need
يعرض المحوّل، وهو معمارية مبنيّة كلياً من طبقات انتباه وتغذية أمامية بلا تكرار، طُوّرت أصلاً للترجمة الآلية.
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
يدرّب مسبقاً مُرمِّز محوّل على التنبّؤ بوحدات مقنَّعة باستخدام السياق من الجهتين، ثم يضبط النموذج نفسه ضبطاً دقيقاً على مهام لاحقة برأس صغير خاص بالمهمة.
Language Models are Few-Shot Learners
يصف GPT-3 ويبيّن أن نموذج لغة بمفكِّك ترميز وحده وبحجم كافٍ يستطيع أداء مهام جديدة من حفنة أمثلة تُقدَّم في مطالبته، بلا أي تحديث تدرّجي.
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
يطبّق محوّلاً معيارياً على الصور مباشرةً بتقطيع كل صورة إلى رقع ثابتة الحجم ومعاملة متتالية الرقع كوحدات، بلا أي التفاف.