La régression linéaire à partir des premiers principes
Dériver les coefficients des moindres carrés en différenciant la somme des carrés des résidus, puis mener à la main un ajustement complet sur cinq observations : coefficients, valeurs ajustées, résidus, RSS et R², chacun vérifié numériquement.
Prérequis : Qu’est-ce que l’apprentissage statistique ?
La régression linéaire est ancienne, simple, et reste la bonne première chose à essayer. C’est aussi l’endroit le plus net pour voir le schéma que suit toute autre méthode supervisée : écrire une mesure de la mauvaise qualité de l’ajustement, puis choisir les paramètres qui la minimisent. Ici, cette minimisation se fait exactement, en forme close, avec le calcul différentiel que vous possédez déjà.
A. Le modèle
Avec un seul prédicteur, nous supposons
où est l’ordonnée à l’origine et la pente. Ensemble elles forment les coefficients du modèle. Les estimer à partir des données donne et , et les prédictions
Le -ème résidu est , l’écart entre ce que nous avons observé et ce que nous avons prédit.
B. Ce que « meilleur ajustement » veut dire
Il nous faut un nombre unique mesurant à quel point une droite candidate ajuste mal. Le choix standard est la somme des carrés des résidus :
L’élévation au carré fait deux choses : elle donne le même poids aux écarts positifs et négatifs, et elle pénalise un grand écart plus lourdement que plusieurs petits. Elle est en outre différentiable partout, ce qui rend possible la solution en forme close ci-dessous.
Les moindres carrés choisissent qui minimisent la RSS.
C. Dériver les coefficients
La RSS est une fonction lisse de deux variables : son minimum se situe là où les deux dérivées partielles s’annulent.
Par rapport à l’ordonnée à l’origine :
En divisant par on obtient , donc
Deux conséquences immédiates : les résidus somment à zéro, et la droite ajustée passe toujours par .
Par rapport à la pente :
En substituant et en réarrangeant, on obtient
Le numérateur est la covariance empirique de et (à une constante près) et le dénominateur la variance empirique de . La pente est donc la mesure de combien et bougent ensemble, rapportée à combien bouge seul - ce qu’une pente doit être exactement.
D. Un ajustement complet, mené à la main
Cinq observations :
| 1 | 1 | 2 |
| 2 | 2 | 4 |
| 3 | 3 | 5 |
| 4 | 4 | 4 |
| 5 | 5 | 5 |
Étape 1 - les moyennes.
Étape 2 - les produits d’écarts.
| produit | |||
|---|---|---|---|
| somme |
Étape 3 - les coefficients.
La droite ajustée est
Étape 4 - valeurs ajustées et résidus.
| 1 | 2.8 | 2 | 0.64 | |
| 2 | 3.4 | 4 | 0.36 | |
| 3 | 4.0 | 5 | 1.00 | |
| 4 | 4.6 | 4 | 0.36 | |
| 5 | 5.2 | 5 | 0.04 | |
| 0.0 | 2.40 |
Les résidus somment exactement à zéro, comme la dérivation le promettait, et la droite passe par - vérifiez la ligne 3.
E. La qualité de l’ajustement
La RSS seule est ininterprétable : elle dépend des unités et de la taille de l’échantillon. Comparez-la plutôt à la somme totale des carrés, l’erreur de la meilleure prédiction constante possible :
Alors
Le prédicteur explique 60 % de la variabilité de ; les 40 % restants lui échappent. Le appartient à pour un modèle ajusté avec ordonnée à l’origine, et il est sans unité, ce qui le rend comparable d’un problème à l’autre.
Le ne décroît jamais quand on ajoute un prédicteur, fût-ce une colonne de bruit pur, car la liberté supplémentaire ne peut que réduire la RSS. Il ne peut donc pas servir à départager des modèles de tailles différentes - c’est à cela que sert la validation croisée.
Interactif : les carrés que minimisent les moindres carrés
La SCR est l’aire totale des carrés.
- SCR
- 4.05
- SCT
- 6
- R²
- 0.325
- Somme des résidus
- -0.5
Les carrés couvrent SCR = 4.05, donc R² vaut 0.325. Inclinez et déplacez la droite pour réduire l’aire totale, et regardez la barre empilée descendre vers son plancher de 2,40, ou allez-y directement.
F. Vérifier chaque nombre
S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.
Son exécution reproduit le tableau à l’identique - pente , ordonnée à
l’origine , résidus sommant à (à la précision machine),
, , - ainsi que
sklearn: 2.2 0.6 0.6, une confirmation indépendante.
G. Ce que le modèle suppose
Les moindres carrés renvoient toujours une réponse. Qu’elle ait un sens dépend d’hypothèses qu’il vaut mieux énoncer clairement :
- Linéarité. La relation est réellement une droite. Si elle s’incurve, l’ajustement est biaisé quelle que soit la quantité de données collectées - le mode de défaillance de Le compromis biais-variance.
- Erreurs indépendantes. Des résidus corrélés (séries temporelles, données groupées) laissent les coefficients utilisables mais rendent les erreurs types bien trop petites.
- Variance d’erreur constante. Si la dispersion croît avec , l’ajustement surpondère la région bruitée.
- Points influents. Avec , une seule valeur aberrante déplace sensiblement la droite - comme l’a montré le pli 1 de la LOOCV, retirer y a fait passer la prédiction de à , un déplacement de .
Tracer les résidus contre les valeurs ajustées vérifie les deux hypothèses centrales plus vite que n’importe quel test formel.
À retenir
- Les moindres carrés minimisent la RSS, et annuler les deux dérivées partielles donne des coefficients en forme close - aucune itération requise.
- est la covariance de et sur la variance de ; force la droite à passer par .
- La dérivation garantit que les résidus somment à zéro.
- Notre ajustement : , , , .
- Le ne décroît jamais quand on ajoute des prédicteurs : il ne peut donc pas comparer des modèles de tailles différentes.
La suite
L’erreur quadratique est la mauvaise cible lorsque la réponse est une catégorie plutôt qu’un nombre - une droite ajustée prédira volontiers une probabilité de . Adapter le modèle linéaire à la classification, c’est La régression logistique et la classification.
Références et lectures complémentaires
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.