Aller au contenu
Kudos AI

Transformeur

Une architecture neuronale bâtie sur un empilement de couches d’auto-attention et de couches à propagation avant, qui a remplacé la récurrence comme standard de la modélisation de séquences.

Comprendre Transformeur

Les réseaux récurrents traitent une séquence une étape à la fois, chaque étape dépendant de la sortie de la précédente. Cette dépendance sérielle empêche le parallélisme sur la séquence pendant l’entraînement et oblige les dépendances à longue portée à traverser de nombreuses étapes intermédiaires. La contribution du transformeur a été de montrer que l’attention seule, sans récurrence, suffisait, ce qui a supprimé les deux problèmes d’un coup. Raschka rappelle que l’architecture a été introduite dans l’article de 2017 « Attention Is All You Need » et développée à l’origine pour la traduction automatique.

Abandonner la récurrence coûte au modèle son sens de l’ordre, car l’attention traite son entrée comme un ensemble : permuter les jetons permuterait identiquement les sorties. L’information de position doit donc être ajoutée explicitement, en ajoutant un vecteur dépendant de la position à chaque embedding de jeton avant la première couche. La conception originale utilisait des sinusoïdes fixes ; les embeddings de position appris ou rotatifs sont des alternatives courantes, mais l’exigence elle-même est incontournable.

Chaque bloc de transformeur contient deux sous-couches au travail complémentaire. L’auto-attention multi-têtes mélange l’information entre les positions, décidant ce que chaque jeton doit lire du reste de la séquence. Un réseau à propagation avant appliqué position par position transforme ensuite chaque position indépendamment, avec les mêmes poids partout. Les deux sous-couches sont enveloppées de connexions résiduelles et de normalisation de couche, ce qui rend entraînable l’empilement de plusieurs dizaines d’entre elles.

Trois agencements dominent. Les modèles encodeur seul comme BERT voient toute l’entrée d’un coup et conviennent aux tâches de compréhension telles que la classification. Les modèles décodeur seul, la famille GPT, emploient un masquage causal pour que chaque position ne voie que ce qui la précède, et sont entraînés à prédire le jeton suivant, ce qui les rend naturellement génératifs. Les modèles encodeur-décodeur conservent les deux moitiés et servent là où une séquence d’entrée doit être transformée en séquence de sortie, comme en traduction. Les grands modèles de langue modernes sont très majoritairement décodeur seul.

Exemple : Transformeur

Un modèle de langue décodeur seul plonge chaque jeton dans un embedding, ajoute un encodage positionnel, puis fait passer la séquence par de nombreux blocs identiques. Dans chaque bloc, l’auto-attention masquée permet à chaque position de rassembler du contexte depuis les positions antérieures, et la sous-couche à propagation avant traite chaque position indépendamment.

En sortie, une dernière couche linéaire envoie la représentation de chaque position vers un score pour chaque jeton du vocabulaire, et un softmax les convertit en une distribution de probabilité sur ce qui vient ensuite. L’entraînement minimise l’entropie croisée contre le jeton suivant réel, sur des quantités énormes de texte.

Le même squelette se transpose au-delà du langage. Raschka signale le transformeur de vision, introduit dans « An Image is Worth 16x16 Words » (2020), qui découpe une image en parcelles et traite chaque parcelle comme un jeton, montrant que l’architecture n’est pas liée au texte.

Questions fréquentes

Pourquoi l’encodage positionnel est-il nécessaire ?

L’auto-attention non masquée est équivariante par permutation : elle n’a aucune notion intrinsèque d’ordre, si bien que « le chien mord l’homme » et « l’homme mord le chien » seraient représentés identiquement. L’information de position doit être fournie explicitement pour que le modèle les distingue (un masque causal porte lui-même un peu d’ordre, mais dans une seule direction).

Qu’apporte la sous-couche à propagation avant ?

L’attention déplace l’information entre les positions mais n’applique aucune transformation substantielle par position. Le réseau à propagation avant fournit cette capacité de traitement, appliquée identiquement et indépendamment à chaque position. Les deux sous-couches font des travaux véritablement différents.

Pourquoi les modèles de langue modernes sont-ils décodeur seul ?

La prédiction du jeton suivant est un objectif unique qui n’exige aucune donnée étiquetée, s’applique à tout texte et passe proprement à l’échelle. À échelle suffisante, elle produit des modèles compétents sur des tâches qui réclamaient autrefois des architectures distinctes : la conception la plus simple l’a emporté par sa scalabilité.

En résumé

Le transformeur a remplacé la récurrence par l’attention, gagnant l’entraînement parallèle et des liaisons directes à longue portée au prix d’une information de position explicite. Ses variantes encodeur seul, décodeur seul et encodeur-décodeur sous-tendent aujourd’hui l’essentiel de la modélisation du langage.