Aller au contenu
Kudos AI

Explorateur des poids d’attention

Modifiez un vecteur de requête et voyez l’attention par produit scalaire mis à l’échelle se résoudre en poids softmax puis en somme pondérée, avec la température et la mise à l’échelle √dₖ comme interrupteurs.

GratuitIA générativeApprentissage profondTraitement du langage naturel

Explorateur des poids d’attention

Une requête portant sur quatre paires clé/valeur.

Poids le plus élevé
29.7%
Étalement de l’attention
0.990
Jetonq · k÷ √dₖPoids
the0.400.2022.0%
cat1.000.5029.7%
sat0.920.4628.5%
down0.200.1019.9%

Vecteur de requête

Mise à l’échelle par √dₖ

Sortie - somme pondérée des vecteurs de valeur

[0.220, 0.297, 0.285, 0.199]

L’attention est une moyenne pondérée, et le softmax en fixe les poids. Baissez la température et elle se concentre sur un seul jeton ; augmentez-la et l’attention se répartit uniformément. Désactiver la mise à l’échelle √dₖ écarte davantage les scores bruts et pousse le softmax vers la saturation : c’est précisément la raison d’être de ce facteur.

Fonctionne entièrement dans votre navigateur. Rien de ce que vous saisissez n’est envoyé ni conservé.

Les idées derrière cet outil

8 min de lectureConstruire un modèle de langue

L’attention et l’auto-attention

Requêtes, clés et valeurs construites depuis la base : pourquoi l’attention existe, comment se calcule l’attention par produit scalaire mis à l’échelle, pourquoi elle est divisée par la racine carrée de la dimension, et comment fonctionne le masquage causal, avec chaque matrice calculée et vérifiée.

IA générativeApprentissage profondTraitement du langage naturel
10 min de lectureConstruire un modèle de langue

L’architecture du transformeur

Assembler un GPT à partir de l’attention : projections multi-têtes, normalisation de couche déroulée à la main, pourquoi les connexions de raccourci sauvent le gradient, l’expansion x4 du réseau à propagation avant, et un décompte de paramètres qui reproduit exactement les 124 millions de GPT-2 small.

IA générativeApprentissage profondTraitement du langage naturel
8 min de lectureConstruire un modèle de langue

La tokenisation et les plongements

Comment le texte devient des nombres sur lesquels un modèle peut s’entraîner : construire un vocabulaire, pourquoi le codage par paires d’octets n’a jamais besoin d’un token inconnu, la couche de plongement comme une consultation qui est prouvablement un one-hot fois une matrice, et pourquoi la position doit être réinjectée à la main.

IA générativeTraitement du langage naturelApprentissage profond