La régularisation : ridge et lasso
Ajouter une pénalité sur la taille des coefficients pour échanger un peu de biais contre une forte réduction de variance, et pourquoi la pénalité L1 annule exactement des coefficients quand L2 se contente de les rétrécir, les deux ajustées numériquement.
Prérequis : La régression linéaire à partir des premiers principes, Le compromis biais-variance
Les moindres carrés n’ont qu’un objectif : rendre la RSS aussi petite que possible sur les données d’entraînement. Le compromis biais-variance a montré pourquoi cela ne revient pas à avoir raison, et La régression logistique a montré des coefficients filant vers quand rien ne les retient.
La régularisation ajoute à l’objectif un second terme qui rend les grands coefficients coûteux. Le résultat est délibérément moins bon sur les données d’entraînement et souvent bien meilleur sur des données nouvelles.
A. La régression ridge
Ridge minimise la RSS plus une pénalité proportionnelle à la somme des coefficients au carré :
Le paramètre de réglage contrôle l’échange. En la pénalité disparaît et l’on retrouve les moindres carrés. Quand la pénalité domine et tous les coefficients sont poussés vers zéro.
Deux détails comptent. L’ordonnée à l’origine n’est pas pénalisée - elle ne fixe que le niveau global et la rétrécir n’aurait aucun sens. Et comme la pénalité agit sur les amplitudes des coefficients, les prédicteurs doivent d’abord être standardisés : sinon, mesurer une variable en grammes plutôt qu’en kilogrammes changerait la force de sa pénalisation, ce qui est manifestement faux.
B. Le lasso
Le lasso remplace la pénalité au carré par une pénalité en valeur absolue :
Ridge utilise une pénalité , le lasso une pénalité . Ce seul changement a une conséquence disproportionnée : la pénalité force certains coefficients à valoir exactement zéro dès que est assez grand. Ridge rétrécit les coefficients vers zéro mais, sauf à la limite, jamais jusqu’à zéro.
Un modèle comportant des zéros exacts ignore entièrement ces prédicteurs : le lasso effectue donc une sélection de variables et produit des modèles parcimonieux - en général bien plus faciles à interpréter qu’un ajustement ridge qui conserve les prédicteurs avec de petits coefficients.
C. Les regarder rétrécir
En utilisant le jeu de cinq observations de La régression linéaire à partir des premiers principes (, ), dont l’ajustement par moindres carrés était :
| pente ridge | ordonnée ridge | pente lasso | ordonnée lasso | |
|---|---|---|---|---|
| 0 | 0.6000 | 2.2000 | 0.6000 | 2.2000 |
| 0.1 | 0.5941 | 2.2178 | 0.5950 | 2.2150 |
| 1 | 0.5455 | 2.3636 | 0.5500 | 2.3500 |
| 5 | 0.4000 | 2.8000 | 0.3500 | 2.9500 |
| 10 | 0.3000 | 3.1000 | 0.1000 | 3.7000 |
| 12 | 0.2727 | 3.1818 | 0.0000 | 4.0000 |
| 20 | 0.2000 | 3.4000 | 0.0000 | 4.0000 |
Les deux méthodes tirent la pente vers le bas quand croît, et l’ordonnée à l’origine monte pour compenser - elle n’est pas pénalisée, elle absorbe donc le niveau.
La différence dans la manière d’approcher zéro est tout l’enjeu. Ridge divise : sa pente vaut , donc à elle vaut , le tiers de sa valeur initiale, mais vivante. Le lasso soustrait : sa pente vaut , qui atteint exactement à et y reste. Dès lors le modèle n’est plus que - le prédicteur a été complètement débranché.
Ces nombres ajustent le brut, non standardisé. Avec un seul prédicteur, cela change seulement quel produit chaque ligne, pas la forme des chemins.
S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.
Son exécution affiche chaque ligne du tableau, y compris
lambda=12 ridge 0.2727 3.1818 lasso 0.0000 4.0000. Attention à l’échelle :
le Lasso de scikit-learn divise la RSS par , donc son alpha vaut
. Passer tel quel ajusterait chaque ligne lasso à une
pénalité dix fois plus forte que la ligne ridge voisine.
Une réserve sur cette démonstration. Avec un seul prédicteur et cinq observations, il n’y a rien à sélectionner - la parcimonie n’a d’intérêt que lorsque certains prédicteurs sont réellement hors sujet et que le lasso peut les débrancher en conservant les autres. Le tableau montre honnêtement le mécanisme, pas le contexte où il rapporte.
Interactif : ce que les deux pénalités font à un coefficient
Huit prédicteurs, dont trois véritablement nuls.
- Lasso : désactivés
- 3 sur 8
- dont bruit véritable
- 3 / 3
- Ridge : désactivés
- 0 sur 8
À cette pénalité, le lasso a mis 3 coefficients sur 8 exactement à zéro, et 3 des 3 prédicteurs véritablement bruités en font partie. Ridge n’en a mis aucun à zéro, et n’en mettra jamais, quelle que soit la pénalité : ses chemins approchent l’axe de façon asymptotique. Cette différence est toute la sélection de variables. Observez aussi l’ordre dans lequel le lasso désactive : les prédicteurs les plus faibles d’abord, ce qui est le comportement utile et aussi le comportement dangereux quand deux prédicteurs sont corrélés et qu’il en garde un arbitrairement.
D. Pourquoi les pénalités se comportent différemment
Le récit géométrique est le plus clair. Les deux problèmes peuvent s’écrire : minimiser la RSS sous un budget de taille des coefficients -
En deux dimensions, le budget ridge est un cercle et le budget lasso un losange dont les sommets sont sur les axes. La solution se trouve là où les contours elliptiques de la RSS touchent pour la première fois la région budgétaire.
Un cercle n’a pas de sommets : le point de contact ne tombe donc presque jamais exactement sur un axe - les deux coefficients restent non nuls. Les sommets du losange sont sur les axes, et des contours en expansion en atteignent un facilement. Un sommet signifie qu’un coefficient vaut exactement zéro. En dimension supérieure le losange a toujours plus de sommets, d’arêtes et de faces, et en atteindre un annule plusieurs coefficients d’un coup.
E. Pourquoi cela réduit l’erreur
La régularisation est le compromis biais-variance appliqué délibérément. Rétrécir les coefficients loin de leurs valeurs des moindres carrés introduit du biais : l’estimateur n’est plus centré sur la vérité. Mais cela rend aussi l’ajustement bien moins sensible à l’échantillon particulier que vous avez tiré, ce qui réduit la variance.
Quand la variance baisse plus vite que le biais au carré ne monte, l’erreur totale espérée baisse. C’est le plus probable quand les moindres carrés sont instables : beaucoup de prédicteurs par rapport aux observations, ou des prédicteurs fortement corrélés. Dans le cas extrême , les moindres carrés n’ont aucune solution unique. Ridge en a encore exactement une ; le lasso a encore des solutions, mais pas forcément une seule (deux colonnes identiques peuvent se partager leur poids de bien des façons au même coût).
Le biais croît de façon monotone avec et la variance décroît de façon monotone : il existe donc un optimum intérieur - et il ne peut pas être trouvé à partir de l’erreur d’entraînement, qui préfère toujours . On le choisit par validation croisée sur une grille de valeurs de .
F. Choisir entre les deux
| Ridge () | Lasso () | |
|---|---|---|
| Coefficients | Rétrécis, tous conservés | Certains exactement nuls |
| Sélection de variables | Non | Oui |
| Interprétabilité | Les prédicteurs | Sous-ensemble parcimonieux |
| Idéal quand | Beaucoup de prédicteurs comptent un peu | Peu de prédicteurs comptent beaucoup |
| Prédicteurs corrélés | Répartit le poids entre eux | Tend à en choisir un arbitrairement |
Aucun ne domine. C’est une question empirique propre au problème, tranchée en validant les deux de façon croisée. La dernière ligne est un piège pratique : avec un groupe de prédicteurs corrélés, le choix arbitraire du lasso peut être instable d’un rééchantillonnage à l’autre, et c’est la raison d’être de l’elastic net, qui combine les deux pénalités.
À retenir
- La régularisation ajoute à la RSS une pénalité sur la taille des coefficients, contrôlée par , échangeant l’ajustement d’entraînement contre de la stabilité.
- Ridge () rétrécit les coefficients vers zéro ; le lasso () en annule exactement certains, réalisant une sélection de variables.
- Les prédicteurs doivent être standardisés, et l’ordonnée à l’origine n’est jamais pénalisée.
- La différence est géométrique : un budget circulaire n’a pas de sommets, un losange en a sur les axes.
- Cela fonctionne en échangeant un peu de biais contre une forte réduction de variance ; doit être choisi par validation croisée, jamais par l’erreur d’entraînement.
La suite
Tous les modèles vus jusqu’ici sont une unique formule globale. Une autre stratégie consiste à découper l’espace des prédicteurs en régions et à prédire une constante dans chacune - ce qui gère interactions et non-linéarités sans que personne ne les spécifie à l’avance. C’est Les arbres de décision et les ensembles.
Références et lectures complémentaires
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.