Aller au contenu
Kudos AI
Read in English
Apprentissage supervisé

La régression linéaire à partir des premiers principes

Dériver les coefficients des moindres carrés en différenciant la somme des carrés des résidus, puis mener à la main un ajustement complet sur cinq observations : coefficients, valeurs ajustées, résidus, RSS et R², chacun vérifié numériquement.

7 min de lectureKudos AI

Prérequis : Qu’est-ce que l’apprentissage statistique ?

Les carrés des résidus dessinés littéralement, rétrécissant à mesure que la droite s’ajuste, puis les cinq résidus additionnés à l’écran pour donner exactement zéro.

La régression linéaire est ancienne, simple, et reste la bonne première chose à essayer. C’est aussi l’endroit le plus net pour voir le schéma que suit toute autre méthode supervisée : écrire une mesure de la mauvaise qualité de l’ajustement, puis choisir les paramètres qui la minimisent. Ici, cette minimisation se fait exactement, en forme close, avec le calcul différentiel que vous possédez déjà.

A. Le modèle

Avec un seul prédicteur, nous supposons

Y≈β0+β1X,Y \approx \beta_0 + \beta_1 X ,

où β0\beta_0 est l’ordonnée à l’origine et β1\beta_1 la pente. Ensemble elles forment les coefficients du modèle. Les estimer à partir des données donne β^0\hat\beta_0 et β^1\hat\beta_1, et les prédictions

y^i=β^0+β^1xi.\hat y_i = \hat\beta_0 + \hat\beta_1 x_i .

Le ii-ème résidu est ei=yi−y^ie_i = y_i - \hat y_i, l’écart entre ce que nous avons observé et ce que nous avons prédit.

B. Ce que « meilleur ajustement » veut dire

Il nous faut un nombre unique mesurant à quel point une droite candidate ajuste mal. Le choix standard est la somme des carrés des résidus :

RSS=∑i=1nei2=∑i=1n(yi−β0−β1xi)2.\mathrm{RSS} = \sum_{i=1}^{n} e_i^2 = \sum_{i=1}^{n}\big(y_i - \beta_0 - \beta_1 x_i\big)^2 .

L’élévation au carré fait deux choses : elle donne le même poids aux écarts positifs et négatifs, et elle pénalise un grand écart plus lourdement que plusieurs petits. Elle est en outre différentiable partout, ce qui rend possible la solution en forme close ci-dessous.

Les moindres carrés choisissent β^0,β^1\hat\beta_0, \hat\beta_1 qui minimisent la RSS.

C. Dériver les coefficients

La RSS est une fonction lisse de deux variables : son minimum se situe là où les deux dérivées partielles s’annulent.

Par rapport à l’ordonnée à l’origine :

∂ RSS∂β0=∑i=1n2(yi−β0−β1xi)(−1)=0  ⟹  ∑i=1n(yi−β0−β1xi)=0.\frac{\partial\,\mathrm{RSS}}{\partial \beta_0} = \sum_{i=1}^n 2\big(y_i - \beta_0 - \beta_1 x_i\big)(-1) = 0 \;\Longrightarrow\; \sum_{i=1}^n \big(y_i - \beta_0 - \beta_1 x_i\big) = 0 .

En divisant par nn on obtient yˉ−β0−β1xˉ=0\bar y - \beta_0 - \beta_1 \bar x = 0, donc

β^0=yˉ−β^1xˉ.\hat\beta_0 = \bar y - \hat\beta_1 \bar x .

Deux conséquences immédiates : les résidus somment à zéro, et la droite ajustée passe toujours par (xˉ,yˉ)(\bar x, \bar y).

Par rapport à la pente :

∂ RSS∂β1=∑i=1n2(yi−β0−β1xi)(−xi)=0.\frac{\partial\,\mathrm{RSS}}{\partial \beta_1} = \sum_{i=1}^n 2\big(y_i - \beta_0 - \beta_1 x_i\big)(-x_i) = 0 .

En substituant β0=yˉ−β1xˉ\beta_0 = \bar y - \beta_1\bar x et en réarrangeant, on obtient

β^1=∑i=1n(xi−xˉ)(yi−yˉ)∑i=1n(xi−xˉ)2.\hat\beta_1 = \frac{\sum_{i=1}^n (x_i - \bar x)(y_i - \bar y)}{\sum_{i=1}^n (x_i - \bar x)^2} .

Le numérateur est la covariance empirique de xx et yy (à une constante près) et le dénominateur la variance empirique de xx. La pente est donc la mesure de combien xx et yy bougent ensemble, rapportée à combien xx bouge seul - ce qu’une pente doit être exactement.

D. Un ajustement complet, mené à la main

Cinq observations :

iixix_iyiy_i
112
224
335
444
555

Étape 1 - les moyennes.

xˉ=1+2+3+4+55=3,yˉ=2+4+5+4+55=4.\bar x = \frac{1+2+3+4+5}{5} = 3, \qquad \bar y = \frac{2+4+5+4+5}{5} = 4 .

Étape 2 - les produits d’écarts.

xi−xˉx_i - \bar xyi−yˉy_i - \bar yproduit(xi−xˉ)2(x_i - \bar x)^2
−2-2−2-24444
−1-1000011
00110000
11000011
22112244
somme6\mathbf{6}10\mathbf{10}

Étape 3 - les coefficients.

β^1=610=0.6=35,β^0=4−0.6×3=4−1.8=2.2=115.\hat\beta_1 = \frac{6}{10} = 0.6 = \tfrac{3}{5}, \qquad \hat\beta_0 = 4 - 0.6 \times 3 = 4 - 1.8 = 2.2 = \tfrac{11}{5} .

La droite ajustée est

y^=2.2+0.6 x.\hat y = 2.2 + 0.6\,x .

Étape 4 - valeurs ajustées et résidus.

xix_iy^i=2.2+0.6xi\hat y_i = 2.2 + 0.6x_iyiy_ieie_iei2e_i^2
12.82−0.8-0.80.64
23.440.60.60.36
34.051.01.01.00
44.64−0.6-0.60.36
55.25−0.2-0.20.04
0.02.40

Les résidus somment exactement à zéro, comme la dérivation le promettait, et la droite passe par (3,4)=(xˉ,yˉ)(3, 4) = (\bar x, \bar y) - vérifiez la ligne 3.

RSS=2.40.\mathrm{RSS} = 2.40 .

E. La qualité de l’ajustement

La RSS seule est ininterprétable : elle dépend des unités et de la taille de l’échantillon. Comparez-la plutôt à la somme totale des carrés, l’erreur de la meilleure prédiction constante possible yˉ\bar y :

TSS=∑(yi−yˉ)2=4+0+1+0+1=6.\mathrm{TSS} = \sum (y_i - \bar y)^2 = 4 + 0 + 1 + 0 + 1 = 6 .

Alors

R2=1−RSSTSS=1−2.46=0.6.R^2 = 1 - \frac{\mathrm{RSS}}{\mathrm{TSS}} = 1 - \frac{2.4}{6} = 0.6 .

Le prédicteur explique 60 % de la variabilité de yy ; les 40 % restants lui échappent. Le R2R^2 appartient à [0,1][0,1] pour un modèle ajusté avec ordonnée à l’origine, et il est sans unité, ce qui le rend comparable d’un problème à l’autre.

Le R2R^2 ne décroît jamais quand on ajoute un prédicteur, fût-ce une colonne de bruit pur, car la liberté supplémentaire ne peut que réduire la RSS. Il ne peut donc pas servir à départager des modèles de tailles différentes - c’est à cela que sert la validation croisée.

Interactif : les carrés que minimisent les moindres carrés

La SCR est l’aire totale des carrés.

012345670123456(x̄, ȳ)cette droitemoyenne4.056
SCR
4.05
SCT
6
R²
0.325
Somme des résidus
-0.5

Les carrés couvrent SCR = 4.05, donc R² vaut 0.325. Inclinez et déplacez la droite pour réduire l’aire totale, et regardez la barre empilée descendre vers son plancher de 2,40, ou allez-y directement.

F. Vérifier chaque nombre

Python

S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.

Son exécution reproduit le tableau à l’identique - pente 0.60.6, ordonnée à l’origine 2.22.2, résidus sommant à 00 (à la précision machine), RSS=2.4\mathrm{RSS} = 2.4, TSS=6.0\mathrm{TSS} = 6.0, R2=0.6R^2 = 0.6 - ainsi que sklearn: 2.2 0.6 0.6, une confirmation indépendante.

G. Ce que le modèle suppose

Les moindres carrés renvoient toujours une réponse. Qu’elle ait un sens dépend d’hypothèses qu’il vaut mieux énoncer clairement :

  • Linéarité. La relation est réellement une droite. Si elle s’incurve, l’ajustement est biaisé quelle que soit la quantité de données collectées - le mode de défaillance de Le compromis biais-variance.
  • Erreurs indépendantes. Des résidus corrélés (séries temporelles, données groupées) laissent les coefficients utilisables mais rendent les erreurs types bien trop petites.
  • Variance d’erreur constante. Si la dispersion croît avec xx, l’ajustement surpondère la région bruitée.
  • Points influents. Avec n=5n = 5, une seule valeur aberrante déplace sensiblement la droite - comme l’a montré le pli 1 de la LOOCV, retirer (1,2)(1,2) y a fait passer la prédiction de 2.82.8 à 4.04.0, un déplacement de 1.21.2.

Tracer les résidus contre les valeurs ajustées vérifie les deux hypothèses centrales plus vite que n’importe quel test formel.

À retenir

  • Les moindres carrés minimisent la RSS, et annuler les deux dérivées partielles donne des coefficients en forme close - aucune itération requise.
  • β^1\hat\beta_1 est la covariance de xx et yy sur la variance de xx ; β^0\hat\beta_0 force la droite à passer par (xˉ,yˉ)(\bar x, \bar y).
  • La dérivation garantit que les résidus somment à zéro.
  • Notre ajustement : y^=2.2+0.6x\hat y = 2.2 + 0.6x, RSS=2.4\mathrm{RSS} = 2.4, TSS=6\mathrm{TSS} = 6, R2=0.6R^2 = 0.6.
  • Le R2R^2 ne décroît jamais quand on ajoute des prédicteurs : il ne peut donc pas comparer des modèles de tailles différentes.

La suite

L’erreur quadratique est la mauvaise cible lorsque la réponse est une catégorie plutôt qu’un nombre - une droite ajustée prédira volontiers une probabilité de 1.41.4. Adapter le modèle linéaire à la classification, c’est La régression logistique et la classification.

Références et lectures complémentaires

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Lecture associée

7 min de lectureFondements de l’apprentissage statistique

Qu’est-ce que l’apprentissage statistique ?

Le cadre commun à tout modèle prédictif : estimer une fonction inconnue f à partir des données, la séparation entre erreur réductible et irréductible, et pourquoi prédiction et inférence tirent dans des directions opposées.

StatistiqueApprentissage automatiqueMathématiques
7 min de lectureFondements de l’apprentissage statistique

Le compromis biais-variance

La décomposition exacte de l’erreur de test espérée en biais au carré, variance et bruit irréductible, démontrée numériquement par une simulation de 2 000 tirages où les trois termes sont mesurés séparément et vérifiés comme s’additionnant.

StatistiqueApprentissage automatiqueMathématiques
8 min de lectureApprentissage supervisé

La régression logistique et la classification

Pourquoi une droite ne peut pas modéliser une probabilité, comment la fonction logistique y remédie, et ce que signifient les coefficients en log-cotes, avec un pas de montée de gradient et un ajustement convergé calculés et vérifiés numériquement.

StatistiqueApprentissage automatiqueOptimisation
← Retour à tous les articles