التعلّم العميق
الشبكات العصبية من المبادئ الأولى: الانتشار العكسي، والبِنى، وتعلّم التمثيلات، ولماذا يشتري العمق ما لا يشتريه العرض.
المسارات (2)
أسس التعلّم العميق
ما الذي تحسبه الشبكة العصبية فعلًا، وكيف تسلّم قاعدة السلسلة كل التدرّجات في تمريرة خلفية واحدة، ولماذا يكون الالتفاف هو الافتراض المسبق الصحيح للصورة.
نماذج اللغة والذكاء الاصطناعي التوليدي
كيف يصير النصّ أرقامًا، وكيف يتيح الانتباه لرمزٍ أن يجمع السياق من التسلسل كلّه، وما الذي يفعله التدريب المسبق ثم الضبط الدقيق بالأوزان فعلًا.
الموسوعة (8)
الانتشار العكسي
الخوارزمية التي تحسب تدرّج خسارة الشبكة العصبية بالنسبة إلى كل وزن، بتطبيق قاعدة السلسلة إلى الوراء عبر الشبكة.
الإنتروبيا المتقاطعة
مقياس للفارق بين توزيعين احتماليين، يُستخدم دالةَ خسارة قياسية في التصنيف.
الشبكة العصبية
نموذج مؤلَّف من طبقات وحدات بسيطة، تحسب كلٌّ منها مجموعًا موزونًا يتبعه دالة غير خطية، ويُلاءَم بنزول التدرج باستخدام الانتشار العكسي.
دالة التفعيل
الدالة غير الخطية المطبَّقة على مخرج الطبقة، والتي بدونها تنهار شبكة بأي عمق إلى تحويل خطي واحد.
الشبكة العصبية الالتفافية
شبكة عصبية تطبّق مرشّحات متعلَّمة عبر الامتداد المكاني للمدخل، وتتشارك الأوزان فيُكتشف النمط نفسه أينما ورد.
الانتباه الذاتي
آلية تتيح لكل موضع في متتالية أن ينتبه إلى كل موضع آخر، فيُحسب كل مخرج مجموعًا موزونًا لقيم تأتي أوزانها من تشابه الاستعلامات والمفاتيح.
المحوّل
معمارية عصبية مبنية على طبقات مكدّسة من الانتباه الذاتي والتغذية الأمامية، حلّت محلّ التكرارية معيارًا لنمذجة المتتاليات.
التدريب المسبق والضبط الدقيق
الوصفة ذات المرحلتين: تدريب نموذج أولًا على متن عام كبير، ثم تكييفه لمهمة محددة بمجموعة بيانات موسومة أصغر بكثير.
المقالات (8)
ما الذي يجعل التدريب يتقارب حقًا
فرقٌ بنسبة اثنين في المئة في معدّل التعلّم يفصل تنفيذًا متقاربًا عن آخر يبعد خمس مراتب عشرية، وعددُ شرطٍ يتنبأ بمعدّل التقارب إلى ست منازل عشرية، وانحدارُ التدرّج العشوائي بخطوة ثابتة لا يتقارب أبدًا - بل يستقر في كرة ينمو نصف قطرها بجذر الخطوة. وكل رقم هنا حُسب على مسألة يُعرف أمثلها بالضبط.
ما هي الشبكة العصبية؟
الطبقات بوصفها تحويلات مُبارَمة، والمرور الأمامي، ولماذا ليست العمقُ واللاخطية اختياريتين: برهان على أن طبقة خطية واحدة لا تستطيع حساب XOR، وشبكة من طبقتين تفعل ذلك، محلولة يدوياً بالكامل.
التقطيع إلى وحدات والتضمينات
كيف يصير النص أرقاماً يستطيع النموذج التدرّب عليها: بناء مفردات، ولماذا لا يحتاج ترميز أزواج البايتات إلى وحدة «مجهول» قط، وطبقة التضمين بوصفها استرجاعاً يمكن البرهان على أنه متجه أحادي مضروب في مصفوفة، ولماذا يجب إعادة حقن الموضع يدوياً.
معمارية المحوّل
تركيب GPT من الانتباه: إسقاطات متعدّدة الرؤوس، وتسوية الطبقة محلولةً يدوياً، ولماذا تنقذ وصلات الاختصار التدرّج، وتوسّع شبكة التغذية الأمامية أربع مرات، وعدّ بارامترات يعيد إنتاج GPT-2 الصغير عند 124 مليوناً بالضبط.
التدريب المسبق والضبط الدقيق
كيف يحوّل التنبّؤ بالكلمة التالية نصاً غير موسوم إلى إشراف، ولماذا الإنتروبيا المتقاطعة ليست إلا سالب متوسط لوغاريتم الاحتمال، وماذا تقيس الحيرة فعلاً، ولماذا يظلّ نموذج يُكمل النص بطلاقة عاجزاً عن اتّباع تعليمة.
الشبكات الالتفافية للرؤية
الالتفاف مُعرَّفاً بدقة، وكاشف حواف سوبل محلولاً يدوياً على صورة 5×5، ولماذا يتفوّق تمرير نواة صغيرة واحدة على الصورة على طبقة كثيفة بخمس مراتب عشرية في عدد البارامترات، وما الذي تغيّر حين كفّت النوى عن التصميم وصارت تُتعلَّم.
الانتشار العكسي والنزول التدرّجي
كيف تتعلّم الشبكة العصبية: الخسارة بوصفها دالة في الأوزان، والنزول التدرّجي، والانتشار العكسي بوصفه قاعدة السلسلة مطبَّقةً إلى الوراء، مع حساب كل مشتقّة جزئية لشبكة صغيرة يدوياً والتحقّق منها مقابل الاشتقاق التلقائي.
الانتباه والانتباه الذاتي
الاستعلامات والمفاتيح والقيم مبنيةً من الأساس: لماذا وُجد الانتباه، وكيف يُحسب انتباه الجداء القياسي المقيس، ولماذا يُقسم على جذر البُعد، وكيف يعمل الإقناع السببي، مع حساب كل مصفوفة والتحقّق منها.
الأدوات (1)
مجموعات البيانات (2)
البحث (7)
The Perceptron: A Perceiving and Recognizing Automaton
يعرض البِرسِبترون، وحدةً قابلة للتدريب تحسب مجموعاً مرجّحاً لمدخلاتها وتشتعل إن تجاوز المجموع عتبة، مع قاعدة لضبط الأوزان من أمثلة موسومة.
Learning Internal Representations by Error Propagation
يقدّم الانتشار العكسي طريقةً عامة لتدريب الشبكات متعدّدة الطبقات، مبيّناً أن الطبقات المخفية تستطيع تعلّم تمثيلات داخلية نافعة بدل الحاجة إلى تصميمها يدوياً.
Neural Machine Translation of Rare Words with Subword Units
يكيّف ترميز أزواج البايتات لتقطيع النص، ببناء مفردات فرعية عبر دمج أكثر أزواج الرموز المتجاورة تكراراً مراراً، فتتفكّك الكلمات النادرة إلى شظايا معروفة.
Attention Is All You Need
يعرض المحوّل، وهو معمارية مبنيّة كلياً من طبقات انتباه وتغذية أمامية بلا تكرار، طُوّرت أصلاً للترجمة الآلية.
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
يدرّب مسبقاً مُرمِّز محوّل على التنبّؤ بوحدات مقنَّعة باستخدام السياق من الجهتين، ثم يضبط النموذج نفسه ضبطاً دقيقاً على مهام لاحقة برأس صغير خاص بالمهمة.
Language Models are Few-Shot Learners
يصف GPT-3 ويبيّن أن نموذج لغة بمفكِّك ترميز وحده وبحجم كافٍ يستطيع أداء مهام جديدة من حفنة أمثلة تُقدَّم في مطالبته، بلا أي تحديث تدرّجي.
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
يطبّق محوّلاً معيارياً على الصور مباشرةً بتقطيع كل صورة إلى رقع ثابتة الحجم ومعاملة متتالية الرقع كوحدات، بلا أي التفاف.
المشاريع (2)
GPT From Scratch
محوّل بمفكّك ترميز فقط، مبني مكوّنًا تلو الآخر - المُرمِّز، التضمينات، الانتباه، الكتل، وحلقة التدريب المسبق - دون أي شيفرة نمذجة مستوردة من مكتبة.
Neural Network From Scratch
شبكة أمامية التغذية في NumPy مع انتشار خلفي مُشتقّ يدويًا، مُتحقَّق منه بالتدرّجات العددية، فيُبرهَن حساب التفاضل بدل الوثوق به.