Comprendre Régression linéaire
La régression linéaire modélise la réponse comme une ordonnée à l’origine plus une somme pondérée des prédicteurs. Ajuster, c’est choisir les poids qui minimisent la somme des carrés des résidus, les écarts verticaux entre valeurs observées et prédites. L’élévation au carré fait compter les erreurs positives comme les négatives et pénalise les grands écarts de façon disproportionnée.
L’estimation admet une forme explicite, obtenue en annulant les dérivées du critère des moindres carrés, ce qui donne les équations normales. C’est un véritable avantage pratique : l’ajustement est exact et immédiat plutôt qu’approché itérativement, et il n’y a ni taux d’apprentissage ni comportement de convergence à surveiller.
L’interprétation d’un coefficient est précise et facilement mal énoncée. C’est la variation attendue de la réponse pour une augmentation d’une unité de ce prédicteur, tous les autres restant constants. Cette clause « à autres constants » fait un travail réel. Quand les prédicteurs sont corrélés, les données contiennent peu d’information sur ce qui se produit lorsque l’un bouge et pas les autres, et les coefficients individuels deviennent instables et difficiles à interpréter alors même que le modèle prédit bien dans son ensemble.
Le mot « linéaire » contraint les coefficients, pas les prédicteurs. Ajouter un terme carré, un logarithme ou le produit de deux prédicteurs comme nouvelle colonne laisse le modèle linéaire en ses paramètres : les relations courbes et les interactions sont donc parfaitement accessibles. Ce que la régression linéaire ne sait véritablement pas faire, c’est apprendre elle-même une telle transformation.
Comment calculer
ŷ = β₀ + β₁x₁ + … + βₚxₚ, fitted by minimizing Σᵢ (yᵢ − ŷᵢ)²
où
- ŷ
- la réponse prédite
- β₀
- l’ordonnée à l’origine, la prédiction quand tous les prédicteurs sont nuls
- βⱼ
- le coefficient du prédicteur j
- yᵢ − ŷᵢ
- le résidu de l’observation i
Exemple : Régression linéaire
Prédire le prix d’un logement à partir de sa surface pourrait donner prix = 50 000 + 1 200 × surface. L’ordonnée à l’origine est la valeur ajustée à surface nulle, dépourvue ici de sens physique et à ne pas surinterpréter ; la pente indique que chaque mètre carré supplémentaire est associé à environ 1 200 de plus.
Ajouter un second prédicteur, disons la distance au centre-ville, change le sens du premier coefficient. Il estime désormais l’effet de la surface parmi les logements situés à la même distance. Si les grands logements se trouvent plutôt en périphérie, les deux coefficients différeront sensiblement de ce que chaque prédicteur donne isolément.
L’association n’est pas causale. Le coefficient décrit comment prix et surface varient conjointement dans cet échantillon, étant donné les autres prédicteurs du modèle. Savoir si agrandir un logement en augmenterait le prix de 1 200 par mètre carré est une autre question, à laquelle la régression seule ne peut répondre.
Avantages et inconvénients
Avantages
- Très interprétable : chaque coefficient a un sens direct et énonçable.
- S’ajuste sous forme explicite, sans hyperparamètre à régler.
- Accompagnée d’une inférence bien développée : erreurs types, intervalles de confiance et tests.
Inconvénients
- Ne peut représenter de structure non linéaire à moins qu’elle ne soit fournie manuellement comme nouvelles variables.
- Sensible aux valeurs aberrantes, puisque l’élévation au carré amplifie les grands résidus.
- Les prédicteurs corrélés rendent les coefficients individuels instables et difficiles à interpréter.
Questions fréquentes
Que mesure réellement le R² ?
La proportion de variance de la réponse expliquée par le modèle. Il ne diminue jamais quand on ajoute des prédicteurs, fussent-ils inutiles, et ne peut donc servir à comparer des modèles de tailles différentes ; il faut lui préférer le R² ajusté ou une estimation d’erreur par validation croisée.
La régression linéaire exige-t-elle des données normalement distribuées ?
Ni les prédicteurs ni la réponse n’ont à être normaux. La normalité des résidus est une hypothèse des procédures d’inférence classiques, les tests t et les intervalles de confiance, non de l’ajustement par moindres carrés lui-même, qui reste bien défini quoi qu’il en soit.
Que faire des prédicteurs corrélés ?
On peut supprimer les prédicteurs redondants, les combiner, ou appliquer la régression ridge, qui stabilise les coefficients en pénalisant leur amplitude. La précision prédictive survit souvent intacte à la colinéarité ; c’est l’interprétation des coefficients qui en souffre.
En résumé
La régression linéaire prédit une issue numérique comme une somme pondérée, s’ajuste sous forme explicite et fournit des coefficients énonçables en langage clair. Ses limites sont la non-linéarité, les valeurs aberrantes et les prédicteurs corrélés, et elle reste la référence que des modèles plus complexes devraient être tenus de battre.