Language Models are Few-Shot Learners
Tom B. Brown et al. · 2020 · arXiv:2005.14165
Résumé
Décrit GPT-3 et montre qu’un modèle de langue décodeur seul suffisamment grand peut accomplir de nouvelles tâches à partir d’une poignée d’exemples fournis dans son invite, sans aucune mise à jour de gradient.
Pourquoi c’est important
Il a démontré que l’échelle à elle seule change ce qu’un modèle sait faire, et a introduit l’apprentissage en contexte comme alternative à l’affinage. Raschka identifie cet article comme celui qui décrit le modèle GPT-3 décodeur seul, source d’inspiration des grands modèles de langue modernes et gabarit pour en construire un depuis le début.