Aller au contenu
Kudos AI

Réseau de neurones convolutif

Un réseau de neurones qui applique des filtres appris sur toute l’étendue spatiale d’une entrée, en partageant les poids pour que le même motif soit détecté où qu’il se trouve.

Aussi appelé : CNN, ConvNet

Un noyau 3x3 balayant une image, les mêmes neuf poids s’allumant à chaque arrêt - le partage de poids comme affirmation sur le monde, non comme économie.

Comprendre Réseau de neurones convolutif

Une couche entièrement connectée appliquée à une image traite chaque pixel comme une entrée sans lien avec les autres, ce qui jette le fait que les pixels voisins sont apparentés et qu’un motif signifie la même chose où qu’il apparaisse. Elle est aussi ruineusement coûteuse : relier une image modeste à une couche cachée modeste demande des millions de poids.

Une couche convolutive remplace cela par un petit filtre, disons 3×3, glissé sur toute l’entrée. À chaque position, il calcule une somme pondérée de la parcelle locale, produisant une carte de caractéristiques qui enregistre où, dans l’image, le motif de ce filtre a été trouvé. Point crucial, les mêmes poids sont utilisés à chaque position.

Le partage des poids apporte deux bénéfices à la fois. Le nombre de paramètres s’effondre, puisqu’un filtre 3×3 a neuf poids quelle que soit la taille de l’image : une couche coûte quelques milliers de paramètres plutôt que des millions. Et comme le même filtre est appliqué partout, un motif appris dans une partie de l’image est automatiquement détecté ailleurs, au lieu de devoir être appris séparément pour chaque emplacement.

La profondeur bâtit ensuite une hiérarchie. Les premières couches, ne voyant que de petites parcelles, apprennent une structure locale simple comme les contours et les transitions de couleur. Les couches ultérieures opèrent sur les cartes produites par les précédentes, leur vue effective de l’image d’origine est donc plus large, et elles combinent les caractéristiques simples en parties puis en objets entiers. Chollet note que les réseaux convolutifs et la rétropropagation étaient tous deux bien compris dès 1990, et que ce qui a changé après 2012 est la disponibilité des données et de la puissance de calcul, non les idées centrales.

Exemple : Réseau de neurones convolutif

Un filtre 3×3 aux grands poids positifs sur une colonne et aux grands poids négatifs sur une autre répond fortement partout où la luminosité change horizontalement, et faiblement sur les régions plates. Glissé sur l’image, il produit une carte des contours verticaux. De tels filtres ne sont pas conçus ; ils émergent de l’entraînement.

Considérez l’arithmétique des paramètres sur une image couleur 224×224. Une couche entièrement connectée vers 1 000 unités demande 224 × 224 × 3 × 1 000 ≈ 150 millions de poids. Une couche convolutive à 64 filtres de taille 3×3×3 demande 64 × 27 ≈ 1 728 poids plus les biais, soit environ cinq ordres de grandeur de moins.

Des couches de sous-échantillonnage sont typiquement intercalées pour réduire la résolution spatiale, ce qui élargit la région de l’image d’origine à laquelle chaque unité ultérieure répond et ajoute une tolérance aux petits décalages. Le schéma général du réseau est un échange progressif du détail spatial contre l’abstraction sémantique.

Questions fréquentes

Pourquoi les couches convolutives valent-elles mieux que les couches entièrement connectées pour les images ?

Elles exploitent deux faits qu’une couche entièrement connectée ignore : que la structure pertinente est locale, et qu’un motif signifie la même chose où qu’il apparaisse. Cela donne bien moins de paramètres et une bien meilleure généralisation à quantité de données égale.

À quoi sert le sous-échantillonnage ?

Il réduit la résolution d’une carte de caractéristiques, typiquement en prenant le maximum sur chaque petite fenêtre. Cela réduit le calcul, élargit la région de l’entrée que les couches ultérieures voient effectivement, et rend la représentation quelque peu insensible aux petites translations.

Les réseaux convolutifs ne servent-ils qu’aux images ?

Non. La même idée s’applique partout où les données ont une structure de grille avec une localité significative : les convolutions unidimensionnelles servent à l’audio et aux séries temporelles, et des architectures convolutives ont été appliquées au texte, même si les modèles à attention y dominent désormais.

En résumé

Les réseaux convolutifs inscrivent la localité et la réutilisation par translation directement dans l’architecture : un motif est appris une fois et détecté partout, à une fraction du coût en paramètres. Les empiler produit une hiérarchie apprise des contours aux objets, et c’est pourquoi ils ont défini la vision par ordinateur pendant une décennie.