فهم التدريب المسبق والضبط الدقيق
تدريب نموذج كفؤ من الصفر لكل مهمة سيتطلب مجموعة بيانات موسومة كبيرة في كل مرة، وهي نادرة التوافر. ويفصل المنهج ذو المرحلتين تعلّمَ المجال عمومًا عن تعلّم المهمة المحددة. فالمرحلة الأولى باهظة وتُنفَّذ مرة واحدة؛ والثانية رخيصة وتتكرر لكل تطبيق.
والتدريب المسبق ينجح لأن هدفه ذاتي الإشراف. فالتنبؤ بالرمز التالي لا يحتاج تعليقًا توضيحيًا: النص نفسه يوفّر الجواب، فيمكن استعمال نصوص خام بلا حدّ فعليًا. وليتنبأ النموذج جيدًا عليه أن يكتسب قدرًا كبيرًا من الكفاءة العَرَضية في النحو والاقتران الوقائعي وبنية الخطاب، وتلك الكفاءة هي ما يستثمره الضبط الدقيق لاحقًا.
ويواصل الضبط الدقيق التدريب على بيانات خاصة بالمهمة، بمعدل تعلّم أصغر بكثير عادةً كي تُعدَّل المعرفة المدرَّبة مسبقًا لا أن تُطمس. ولأن التمثيلات جيدة أصلًا، فكمية البيانات الموسومة المطلوبة صغيرة، وكثيرًا ما تكون بضعة آلاف من الأمثلة حيث يحتاج التدريب من الصفر ملايين. ويصوغ راشكا التمييز بوصفه ضبطًا دقيقًا بالتعليمات وضبطًا دقيقًا للتصنيف يُطبَّقان بعد تدريب نموذج أساس مسبقًا.
واقتصاديات هذا الانقسام تفسّر كثيرًا من المشهد الحالي. فكلف التدريب المسبق هائلة ومتركّزة بين منظمات قليلة، بينما الضبط الدقيق في متناول أي أحد تقريبًا، فينجب نموذج أساس واحد أحفادًا متخصصين كثيرين. والطرق المقتصدة في المعاملات، التي تحدّث مجموعة صغيرة من المعاملات المضافة وتترك أوزان الأساس مجمّدة، تخفض الكلفة أكثر.
مثال على التدريب المسبق والضبط الدقيق
يُدرَّب نموذج لغة أساس مسبقًا على متن نصي ضخم جدًا بهدف واحد: التنبؤ بالرمز التالي. ولا يُخبَر قط عن تحليل المشاعر ولا التلخيص ولا الإجابة عن الأسئلة، ومع ذلك يكتسب الكفاءة اللغوية التي تعتمد عليها تلك المهام.
ولبناء مصنّف مشاعر منه، تُضاف رأس تصنيف صغيرة ويُضبَط النموذج دقيقًا على بضعة آلاف من المراجعات الموسومة. فهو يفهم أصلًا النفي وإشارات السخرية وأدوات التوكيد من التدريب المسبق، ولا يبقى عليه إلا تعلّم الربط بوسوم المشاعر.
والضبط بالتعليمات هو الآلية نفسها مطبَّقةً بوجه آخر: فالضبط الدقيق على أمثلة تعليمات مقرونة باستجابات جيدة يحوّل متنبئًا خامًا بالرمز التالي إلى شيء يمتثل للطلبات. فالقدرة الكامنة جاءت من التدريب المسبق؛ والضبط الدقيق شكّل طريقة التعبير عنها.
الأسئلة الشائعة
لماذا لا يحتاج التدريب المسبق وسومًا؟
لأن الهدف مبنيّ من البيانات نفسها. فبإعطاء مقطع نصي يكون الرمز التالي معلومًا سلفًا، فإشارة الإشراف مجانية. وهذا الإشراف الذاتي هو ما يتيح التدريب على متون أكبر بكثير مما يمكن أن تبلغه أي مجموعة موسومة.
ما النسيان الكارثي؟
أن يطمس الضبط الدقيق المعرفة المدرَّبة مسبقًا، فيكسب النموذج المهمة الضيقة ويفقد القدرة العامة. ويُخفَّف باستعمال معدلات تعلّم صغيرة، أو الضبط لخطوات قليلة، أو تجميد معظم المعاملات وتدريب مجموعة مضافة صغيرة فقط.
كيف يختلف هذا عن التحفيز ببضعة أمثلة؟
الضبط الدقيق يغيّر أوزان النموذج ويدوم. أما التحفيز ببضعة أمثلة فلا يغيّر شيئًا: توضع الأمثلة في نافذة السياق ولا تؤثر إلا في ذلك الطلب وحده. فالتحفيز فوري ومجاني؛ والضبط الدقيق أدوم وأدقّ عادةً لمهمة ضيقة ثابتة.
الخلاصة
يشتري التدريب المسبق قدرة عريضة من بيانات غير موسومة بكلفة كبيرة مرة واحدة؛ ويحوّلها الضبط الدقيق إلى كفاءة محددة بثمن زهيد وبصورة متكررة. وهذا الانقسام هو سبب جلوس حفنة من النماذج الأساس تحت عدد هائل من التطبيقات.