Apprentissage profond
Les réseaux de neurones depuis les principes premiers : rétropropagation, architectures, apprentissage de représentations, et ce que la profondeur achète que la largeur n’achète pas.
Parcours (2)
Fondements de l’apprentissage profond
Ce qu'un réseau de neurones calcule réellement, comment la règle de dérivation en chaîne livre tous les gradients en une seule passe arrière, et pourquoi la convolution est le bon a priori pour une image.
Modèles de langage et IA générative
Comment le texte devient des nombres, comment l'attention permet à un jeton de recueillir du contexte dans toute la séquence, et ce que le pré-entraînement puis l'affinage font réellement aux poids.
Encyclopédie (8)
Rétropropagation
L’algorithme qui calcule le gradient de la perte d’un réseau de neurones par rapport à chaque poids, en appliquant la règle de dérivation en chaîne à rebours à travers le réseau.
Entropie croisée
Une mesure de la différence entre deux distributions de probabilité, utilisée comme fonction de perte standard en classification.
Réseau de neurones
Un modèle composé de couches d’unités simples, chacune calculant une somme pondérée suivie d’une fonction non linéaire, ajusté par descente de gradient au moyen de la rétropropagation.
Fonction d’activation
La fonction non linéaire appliquée à la sortie d’une couche, sans laquelle un réseau de profondeur quelconque se réduirait à une unique transformation linéaire.
Réseau de neurones convolutif
Un réseau de neurones qui applique des filtres appris sur toute l’étendue spatiale d’une entrée, en partageant les poids pour que le même motif soit détecté où qu’il se trouve.
Auto-attention
Un mécanisme qui permet à chaque position d’une séquence de prêter attention à toutes les autres, chaque sortie étant une somme pondérée de valeurs dont les poids viennent de la similarité entre requêtes et clés.
Transformeur
Une architecture neuronale bâtie sur un empilement de couches d’auto-attention et de couches à propagation avant, qui a remplacé la récurrence comme standard de la modélisation de séquences.
Préentraînement et affinage
La recette en deux temps consistant à entraîner d’abord un modèle sur un grand corpus générique, puis à l’adapter à une tâche précise avec un jeu de données étiquetées bien plus petit.
Articles (8)
Ce qui fait vraiment converger un entraînement
Deux pour cent d’écart sur le taux d’apprentissage séparent une exécution convergée d’une autre à cinq ordres de grandeur, un conditionnement prédit le taux de convergence à six décimales, et la descente de gradient stochastique à pas fixe ne converge jamais - elle se stabilise dans une boule dont le rayon croît comme la racine carrée du pas. Chaque chiffre a été calculé sur un problème dont l’optimum exact est connu.
Qu’est-ce qu’un réseau de neurones ?
Les couches comme transformations paramétrées, la passe avant, et pourquoi profondeur et non-linéarité ne sont pas optionnelles : une preuve qu’aucune couche linéaire seule ne peut calculer le XOR, et un réseau à deux couches qui y parvient, entièrement déroulé à la main.
La tokenisation et les plongements
Comment le texte devient des nombres sur lesquels un modèle peut s’entraîner : construire un vocabulaire, pourquoi le codage par paires d’octets n’a jamais besoin d’un token inconnu, la couche de plongement comme une consultation qui est prouvablement un one-hot fois une matrice, et pourquoi la position doit être réinjectée à la main.
L’architecture du transformeur
Assembler un GPT à partir de l’attention : projections multi-têtes, normalisation de couche déroulée à la main, pourquoi les connexions de raccourci sauvent le gradient, l’expansion x4 du réseau à propagation avant, et un décompte de paramètres qui reproduit exactement les 124 millions de GPT-2 small.
Le préentraînement et l’affinage
Comment la prédiction du mot suivant transforme du texte non annoté en supervision, pourquoi l’entropie croisée n’est que l’opposé de la log-probabilité moyenne, ce que mesure vraiment la perplexité, et pourquoi un modèle qui complète le texte avec fluidité ne sait toujours pas suivre une instruction.
Les réseaux convolutifs pour la vision
La convolution définie proprement, un détecteur de contours de Sobel déroulé à la main sur une image 5x5, pourquoi faire glisser un petit noyau sur une image bat une couche dense de cinq ordres de grandeur en paramètres, et ce qui a changé quand les noyaux ont cessé d’être conçus pour être appris.
La rétropropagation et la descente de gradient
Comment un réseau de neurones apprend : la perte comme fonction des poids, la descente de gradient, et la rétropropagation comme règle de dérivation en chaîne appliquée à rebours, avec toutes les dérivées partielles d’un petit réseau calculées à la main et vérifiées contre autograd.
L’attention et l’auto-attention
Requêtes, clés et valeurs construites depuis la base : pourquoi l’attention existe, comment se calcule l’attention par produit scalaire mis à l’échelle, pourquoi elle est divisée par la racine carrée de la dimension, et comment fonctionne le masquage causal, avec chaque matrice calculée et vérifiée.
Outils (1)
Jeux de données (2)
MNIST, chiffres manuscrits
70 000 images étiquetées de chiffres manuscrits - le premier test standard qu’une implémentation de réseau de neurones fonctionne, tout simplement.
Critiques de films IMDB
50 000 critiques de films étiquetées positives ou négatives - une référence de classification binaire de textes, équilibrée par construction.
Recherche (7)
The Perceptron: A Perceiving and Recognizing Automaton
Introduit le perceptron, une unité entraînable qui calcule une somme pondérée de ses entrées et s’active si la somme dépasse un seuil, avec une règle d’ajustement des poids à partir d’exemples étiquetés.
Learning Internal Representations by Error Propagation
Présente la rétropropagation comme méthode générale d’entraînement des réseaux multicouches, en montrant que les couches cachées peuvent apprendre des représentations internes utiles au lieu de devoir être conçues à la main.
Neural Machine Translation of Rare Words with Subword Units
Adapte le codage par paires d’octets à la segmentation du texte, en construisant un vocabulaire sous-lexical par fusion répétée de la paire de symboles adjacents la plus fréquente, de sorte que les mots rares se décomposent en fragments connus.
Attention Is All You Need
Introduit le transformeur, une architecture bâtie entièrement sur des couches d’attention et de propagation avant, sans récurrence, développée à l’origine pour la traduction automatique.
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
Préentraîne un encodeur transformeur à prédire des tokens masqués en utilisant le contexte des deux côtés, puis affine le même modèle sur des tâches en aval avec une petite tête spécifique.
Language Models are Few-Shot Learners
Décrit GPT-3 et montre qu’un modèle de langue décodeur seul suffisamment grand peut accomplir de nouvelles tâches à partir d’une poignée d’exemples fournis dans son invite, sans aucune mise à jour de gradient.
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
Applique un transformeur standard directement aux images en découpant chaque image en imagettes de taille fixe et en traitant la suite d’imagettes comme des tokens, sans aucune convolution.
Projets (2)
GPT From Scratch
Un transformeur décodeur construit composant par composant - tokeniseur, plongements, attention, blocs, boucle de pré-entraînement - sans aucun code de modélisation importé d’une bibliothèque.
Neural Network From Scratch
Un réseau à propagation avant en NumPy, avec rétropropagation dérivée à la main et validée par gradients numériques : le calcul différentiel est prouvé, non pas supposé.