تخطّي إلى المحتوى
Kudos AI

التعلّم العميق

الشبكات العصبية من المبادئ الأولى: الانتشار العكسي، والبِنى، وتعلّم التمثيلات، ولماذا يشتري العمق ما لا يشتريه العرض.

30 عناصر

المسارات (2)

الموسوعة (8)

الانتشار العكسي

الخوارزمية التي تحسب تدرّج خسارة الشبكة العصبية بالنسبة إلى كل وزن، بتطبيق قاعدة السلسلة إلى الوراء عبر الشبكة.

الإنتروبيا المتقاطعة

مقياس للفارق بين توزيعين احتماليين، يُستخدم دالةَ خسارة قياسية في التصنيف.

الشبكة العصبية

نموذج مؤلَّف من طبقات وحدات بسيطة، تحسب كلٌّ منها مجموعًا موزونًا يتبعه دالة غير خطية، ويُلاءَم بنزول التدرج باستخدام الانتشار العكسي.

دالة التفعيل

الدالة غير الخطية المطبَّقة على مخرج الطبقة، والتي بدونها تنهار شبكة بأي عمق إلى تحويل خطي واحد.

الشبكة العصبية الالتفافية

شبكة عصبية تطبّق مرشّحات متعلَّمة عبر الامتداد المكاني للمدخل، وتتشارك الأوزان فيُكتشف النمط نفسه أينما ورد.

الانتباه الذاتي

آلية تتيح لكل موضع في متتالية أن ينتبه إلى كل موضع آخر، فيُحسب كل مخرج مجموعًا موزونًا لقيم تأتي أوزانها من تشابه الاستعلامات والمفاتيح.

المحوّل

معمارية عصبية مبنية على طبقات مكدّسة من الانتباه الذاتي والتغذية الأمامية، حلّت محلّ التكرارية معيارًا لنمذجة المتتاليات.

التدريب المسبق والضبط الدقيق

الوصفة ذات المرحلتين: تدريب نموذج أولًا على متن عام كبير، ثم تكييفه لمهمة محددة بمجموعة بيانات موسومة أصغر بكثير.

المقالات (8)

ما الذي يجعل التدريب يتقارب حقًا

فرقٌ بنسبة اثنين في المئة في معدّل التعلّم يفصل تنفيذًا متقاربًا عن آخر يبعد خمس مراتب عشرية، وعددُ شرطٍ يتنبأ بمعدّل التقارب إلى ست منازل عشرية، وانحدارُ التدرّج العشوائي بخطوة ثابتة لا يتقارب أبدًا - بل يستقر في كرة ينمو نصف قطرها بجذر الخطوة. وكل رقم هنا حُسب على مسألة يُعرف أمثلها بالضبط.

ما هي الشبكة العصبية؟

الطبقات بوصفها تحويلات مُبارَمة، والمرور الأمامي، ولماذا ليست العمقُ واللاخطية اختياريتين: برهان على أن طبقة خطية واحدة لا تستطيع حساب XOR، وشبكة من طبقتين تفعل ذلك، محلولة يدوياً بالكامل.

التقطيع إلى وحدات والتضمينات

كيف يصير النص أرقاماً يستطيع النموذج التدرّب عليها: بناء مفردات، ولماذا لا يحتاج ترميز أزواج البايتات إلى وحدة «مجهول» قط، وطبقة التضمين بوصفها استرجاعاً يمكن البرهان على أنه متجه أحادي مضروب في مصفوفة، ولماذا يجب إعادة حقن الموضع يدوياً.

معمارية المحوّل

تركيب GPT من الانتباه: إسقاطات متعدّدة الرؤوس، وتسوية الطبقة محلولةً يدوياً، ولماذا تنقذ وصلات الاختصار التدرّج، وتوسّع شبكة التغذية الأمامية أربع مرات، وعدّ بارامترات يعيد إنتاج GPT-2 الصغير عند 124 مليوناً بالضبط.

التدريب المسبق والضبط الدقيق

كيف يحوّل التنبّؤ بالكلمة التالية نصاً غير موسوم إلى إشراف، ولماذا الإنتروبيا المتقاطعة ليست إلا سالب متوسط لوغاريتم الاحتمال، وماذا تقيس الحيرة فعلاً، ولماذا يظلّ نموذج يُكمل النص بطلاقة عاجزاً عن اتّباع تعليمة.

الشبكات الالتفافية للرؤية

الالتفاف مُعرَّفاً بدقة، وكاشف حواف سوبل محلولاً يدوياً على صورة 5×5، ولماذا يتفوّق تمرير نواة صغيرة واحدة على الصورة على طبقة كثيفة بخمس مراتب عشرية في عدد البارامترات، وما الذي تغيّر حين كفّت النوى عن التصميم وصارت تُتعلَّم.

الانتشار العكسي والنزول التدرّجي

كيف تتعلّم الشبكة العصبية: الخسارة بوصفها دالة في الأوزان، والنزول التدرّجي، والانتشار العكسي بوصفه قاعدة السلسلة مطبَّقةً إلى الوراء، مع حساب كل مشتقّة جزئية لشبكة صغيرة يدوياً والتحقّق منها مقابل الاشتقاق التلقائي.

الانتباه والانتباه الذاتي

الاستعلامات والمفاتيح والقيم مبنيةً من الأساس: لماذا وُجد الانتباه، وكيف يُحسب انتباه الجداء القياسي المقيس، ولماذا يُقسم على جذر البُعد، وكيف يعمل الإقناع السببي، مع حساب كل مصفوفة والتحقّق منها.

الأدوات (1)

مجموعات البيانات (2)

البحث (7)

The Perceptron: A Perceiving and Recognizing Automaton

يعرض البِرسِبترون، وحدةً قابلة للتدريب تحسب مجموعاً مرجّحاً لمدخلاتها وتشتعل إن تجاوز المجموع عتبة، مع قاعدة لضبط الأوزان من أمثلة موسومة.

Learning Internal Representations by Error Propagation

يقدّم الانتشار العكسي طريقةً عامة لتدريب الشبكات متعدّدة الطبقات، مبيّناً أن الطبقات المخفية تستطيع تعلّم تمثيلات داخلية نافعة بدل الحاجة إلى تصميمها يدوياً.

Neural Machine Translation of Rare Words with Subword Units

يكيّف ترميز أزواج البايتات لتقطيع النص، ببناء مفردات فرعية عبر دمج أكثر أزواج الرموز المتجاورة تكراراً مراراً، فتتفكّك الكلمات النادرة إلى شظايا معروفة.

Attention Is All You Need

يعرض المحوّل، وهو معمارية مبنيّة كلياً من طبقات انتباه وتغذية أمامية بلا تكرار، طُوّرت أصلاً للترجمة الآلية.

BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

يدرّب مسبقاً مُرمِّز محوّل على التنبّؤ بوحدات مقنَّعة باستخدام السياق من الجهتين، ثم يضبط النموذج نفسه ضبطاً دقيقاً على مهام لاحقة برأس صغير خاص بالمهمة.

Language Models are Few-Shot Learners

يصف GPT-3 ويبيّن أن نموذج لغة بمفكِّك ترميز وحده وبحجم كافٍ يستطيع أداء مهام جديدة من حفنة أمثلة تُقدَّم في مطالبته، بلا أي تحديث تدرّجي.

An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

يطبّق محوّلاً معيارياً على الصور مباشرةً بتقطيع كل صورة إلى رقع ثابتة الحجم ومعاملة متتالية الرقع كوحدات، بلا أي التفاف.

المشاريع (2)

مواضيع ذات صلة