Aller au contenu
Kudos AI

Les moindres carrés par la dérivée

Minimiser la somme des carrés des résidus sous forme close, le sens de la formule de la pente, et pourquoi le R carré ne peut comparer des modèles de tailles différentes.

IntermédiaireModule 130 min · 120 XP
Les carrés des résidus dessinés littéralement, rétrécissant à mesure que la droite s’ajuste, puis les cinq résidus additionnés à l’écran pour donner exactement zéro.

La régression linéaire est d’ordinaire présentée comme une formule à appliquer. On la comprend mieux comme la réponse à une question de calcul différentiel : quelle droite rend les erreurs au carré les plus petites ? Une fois la question posée ainsi, les coefficients tombent de deux dérivées et il ne reste rien à mémoriser.

L’objectif

Ajustez y^i=β0+β1xi\hat y_i = \beta_0 + \beta_1 x_i et mesurez le désajustement par la somme des carrés des résidus :

RSS(β0,β1)=∑i=1n(yi−β0−β1xi)2.\mathrm{RSS}(\beta_0, \beta_1) = \sum_{i=1}^{n}\big(y_i - \beta_0 - \beta_1 x_i\big)^2 .

L’élévation au carré fait deux choses : elle empêche les erreurs positives et négatives de s’annuler, et elle fait de la RSS une fonction lisse et convexe, si bien qu’annuler les dérivées trouve le minimum global plutôt qu’un simple point stationnaire.

Dériver

Par rapport à l’ordonnée à l’origine :

∂RSS∂β0=−2∑i=1n(yi−β0−β1xi)=0⟹∑i=1nei=0,\frac{\partial \mathrm{RSS}}{\partial \beta_0} = -2\sum_{i=1}^{n}\big(y_i - \beta_0 - \beta_1 x_i\big) = 0 \quad\Longrightarrow\quad \sum_{i=1}^{n} e_i = 0 ,

en notant eie_i le résidu. La condition sur l’ordonnée à l’origine garantit que les résidus somment exactement à zéro - de façon équivalente, que la droite ajustée passe par le point des moyennes (xˉ,yˉ)(\bar x, \bar y). Ce n’est ni une coïncidence ni une convention ; c’est ce que dit cette seule dérivée.

Par rapport à la pente, et en substituant β0=yˉ−β1xˉ\beta_0 = \bar y - \beta_1 \bar x :

β^1=∑i(xi−xˉ)(yi−yˉ)∑i(xi−xˉ)2,β^0=yˉ−β^1xˉ.\hat\beta_1 = \frac{\sum_i (x_i - \bar x)(y_i - \bar y)}{\sum_i (x_i - \bar x)^2}, \qquad \hat\beta_0 = \bar y - \hat\beta_1 \bar x .

Exemple résolu

Cinq points : x=(1,2,3,4,5)x = (1,2,3,4,5), y=(2.1,3.9,6.2,7.8,10.1)y = (2.1, 3.9, 6.2, 7.8, 10.1).

xˉ=3.0\bar x = 3.0, yˉ=6.02\bar y = 6.02. Alors

Sxy=∑(xi−xˉ)(yi−yˉ)=19.90,Sxx=∑(xi−xˉ)2=10.00,S_{xy} = \sum (x_i - \bar x)(y_i - \bar y) = 19.90 , \qquad S_{xx} = \sum (x_i - \bar x)^2 = 10.00 ,

donc

β^1=19.9010.00=1.9900,β^0=6.02−1.99×3=0.0500.\hat\beta_1 = \frac{19.90}{10.00} = 1.9900 , \qquad \hat\beta_0 = 6.02 - 1.99 \times 3 = 0.0500 .

Les résidus valent (0.06, −0.13, 0.18, −0.21, 0.10)(0.06,\, -0.13,\, 0.18,\, -0.21,\, 0.10) - et ils somment exactement à 00, comme la dérivée en l’ordonnée à l’origine le promettait. Vérifiez-le vous-même ; cette somme est le moyen le plus rapide d’attraper une erreur de calcul.

Python

S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.

Le R², et son piège

R2=1−RSSTSS,TSS=∑i(yi−yˉ)2.R^2 = 1 - \frac{\mathrm{RSS}}{\mathrm{TSS}}, \qquad \mathrm{TSS} = \sum_i (y_i - \bar y)^2 .

Ici TSS=39.7080\mathrm{TSS} = 39.7080 et RSS=0.1070\mathrm{RSS} = 0.1070, donnant R2=0.9973R^2 = 0.9973 - la droite explique 99,73 % de la variation de yy.

Pourquoi le R2R^2 ne peut pas classer des modèles de tailles différentes. Ajouter n’importe quel prédicteur, fût-ce du bruit pur, donne aux moindres carrés strictement plus de liberté pour réduire la RSS. La RSS ne peut donc jamais augmenter quand on ajoute un prédicteur, et le R2R^2 ne peut jamais décroître. Une métrique qui récompense toujours davantage de prédicteurs ne peut pas servir à décider si un prédicteur mérite d’être gardé. Les comparaisons exigent quelque chose qui pénalise la taille - R2R^2 ajusté, un critère d’information, ou une estimation hors échantillon par validation croisée.

Voyez les carrés. La figure ci-dessous utilise cinq autres points, (1,2),(2,4),(3,5),(4,4),(5,5)(1,2), (2,4), (3,5), (4,4), (5,5), bien plus dispersés que ceux de l’exemple traité. Chaque résidu y est tracé avec son carré, si bien que la RSS (SCR dans la figure) est leur aire totale, mise en regard de la TSS (SCT) que laisse la moyenne constante. Déplacez Ordonnée à l’origine et Pente, ou cliquez sur Aller à la droite des moindres carrés : on arrive à y^=2.2+0.6x\hat y = 2.2 + 0.6x, où RSS=2.4\mathrm{RSS} = 2.4, TSS=6\mathrm{TSS} = 6 et R2=0.6R^2 = 0.6, et les résidus ont de nouveau une somme exactement nulle.

Interactif : les carrés que minimisent les moindres carrés

La SCR est l’aire totale des carrés.

012345670123456(x̄, ȳ)cette droitemoyenne4.056
SCR
4.05
SCT
6
R²
0.325
Somme des résidus
-0.5

Les carrés couvrent SCR = 4.05, donc R² vaut 0.325. Inclinez et déplacez la droite pour réduire l’aire totale, et regardez la barre empilée descendre vers son plancher de 2,40, ou allez-y directement.

Voyez-le bouger. Les moindres carrés sont un membre d’une famille plus large : faites glisser le paramètre et regardez une log-vraisemblance culminer exactement là où l’estimateur atterrit.

Interactif : gravir la vraisemblance

Un échantillon fixe de 40 comptages d’événements observés.

log-vraisemblanceMLE 1.550.511.522.533.5lambda0123456
ObservéPoisson ajustée (λ)
λ choisi
0.80
Log-vraisemblance
-72.9
MLE (moyenne empirique)
1.55

Le maximum de vraisemblance demande : quel λ rend les données observées les plus probables ? Déplacez λ et la log-vraisemblance monte vers un pic unique, exactement à la moyenne empirique (1.55), et les barres ajustées s’alignent alors sur les fréquences observées. Chaque GLM de ce site est cette même montée, simplement en plus de dimensions.

Essayez-le en direct. Ajustez un modèle linéaire généralisé en itérant jusqu’à convergence la même étape d’équation normale :

A Poisson GLM by hand (IRLS, numpy)

S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.

Avant le quiz

Sachez dire ce que garantit ∂RSS/∂β0=0\partial \mathrm{RSS}/\partial \beta_0 = 0, et pourquoi le R2R^2 est le mauvais outil pour la sélection de modèles. Dérivation complète : La régression linéaire à partir des premiers principes.

Références et lectures complémentaires

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Débloquez tout le parcours

Cette première leçon est gratuite. Inscrivez-vous pour passer le quiz de maîtrise, gagner de l’XP et débloquer tous les modules, avec d’autres exemples interactifs et exécutables.