BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Jacob Devlin et al. · 2018 · arXiv:1810.04805
Résumé
Préentraîne un encodeur transformeur à prédire des tokens masqués en utilisant le contexte des deux côtés, puis affine le même modèle sur des tâches en aval avec une petite tête spécifique.
Pourquoi c’est important
Il a fait du préentraînement-puis-affinage la recette standard du traitement automatique des langues. Parce que le masquage permet au modèle de conditionner sur le contexte gauche et droit, les représentations apprises se sont révélées bien plus fortes pour les tâches de compréhension que le préentraînement de gauche à droite, et le flux en deux étapes est devenu la norme du domaine.