IA générative
Des modèles qui produisent au lieu de classer : vraisemblance et modèles à variables latentes, diffusion, et le versant génératif du transformeur.
Parcours (1)
Encyclopédie (4)
Tokenisation
Le découpage du texte en unités discrètes sur lesquelles un modèle de langue opère réellement, typiquement des fragments de sous-mots plutôt que des mots entiers.
Auto-attention
Un mécanisme qui permet à chaque position d’une séquence de prêter attention à toutes les autres, chaque sortie étant une somme pondérée de valeurs dont les poids viennent de la similarité entre requêtes et clés.
Transformeur
Une architecture neuronale bâtie sur un empilement de couches d’auto-attention et de couches à propagation avant, qui a remplacé la récurrence comme standard de la modélisation de séquences.
Préentraînement et affinage
La recette en deux temps consistant à entraîner d’abord un modèle sur un grand corpus générique, puis à l’adapter à une tâche précise avec un jeu de données étiquetées bien plus petit.
Articles (4)
La tokenisation et les plongements
Comment le texte devient des nombres sur lesquels un modèle peut s’entraîner : construire un vocabulaire, pourquoi le codage par paires d’octets n’a jamais besoin d’un token inconnu, la couche de plongement comme une consultation qui est prouvablement un one-hot fois une matrice, et pourquoi la position doit être réinjectée à la main.
L’architecture du transformeur
Assembler un GPT à partir de l’attention : projections multi-têtes, normalisation de couche déroulée à la main, pourquoi les connexions de raccourci sauvent le gradient, l’expansion x4 du réseau à propagation avant, et un décompte de paramètres qui reproduit exactement les 124 millions de GPT-2 small.
Le préentraînement et l’affinage
Comment la prédiction du mot suivant transforme du texte non annoté en supervision, pourquoi l’entropie croisée n’est que l’opposé de la log-probabilité moyenne, ce que mesure vraiment la perplexité, et pourquoi un modèle qui complète le texte avec fluidité ne sait toujours pas suivre une instruction.
L’attention et l’auto-attention
Requêtes, clés et valeurs construites depuis la base : pourquoi l’attention existe, comment se calcule l’attention par produit scalaire mis à l’échelle, pourquoi elle est divisée par la racine carrée de la dimension, et comment fonctionne le masquage causal, avec chaque matrice calculée et vérifiée.
Outils (1)
Recherche (4)
Attention Is All You Need
Introduit le transformeur, une architecture bâtie entièrement sur des couches d’attention et de propagation avant, sans récurrence, développée à l’origine pour la traduction automatique.
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Préentraîne un encodeur transformeur à prédire des tokens masqués en utilisant le contexte des deux côtés, puis affine le même modèle sur des tâches en aval avec une petite tête spécifique.
Language Models are Few-Shot Learners
Décrit GPT-3 et montre qu’un modèle de langue décodeur seul suffisamment grand peut accomplir de nouvelles tâches à partir d’une poignée d’exemples fournis dans son invite, sans aucune mise à jour de gradient.
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
Applique un transformeur standard directement aux images en découpant chaque image en imagettes de taille fixe et en traitant la suite d’imagettes comme des tokens, sans aucune convolution.