Comprendre Régression logistique
Appliquer directement la régression linéaire à une issue binaire échoue pour une raison structurelle : une fonction linéaire n’est pas bornée, elle prédira donc des valeurs inférieures à 0 et supérieures à 1, qui ne peuvent être des probabilités. La régression logistique conserve la combinaison linéaire mais la fait passer par la fonction logistique, qui envoie toute la droite réelle dans l’intervalle ouvert (0, 1). James et ses coauteurs l’introduisent exactement en ces termes, comme la façon de modéliser une probabilité par une fonction qui reste dans les bornes pour toute valeur des prédicteurs.
La transformation a une réciproque interprétable. Résoudre en la partie linéaire montre qu’elle égale le log-cote, le logarithme de p/(1 − p). Ainsi, si l’effet d’un prédicteur sur la probabilité est non linéaire, son effet sur le log-cote est exactement linéaire, et chaque coefficient se lit comme la variation du log-cote par unité de son prédicteur. Exponentier un coefficient le convertit en rapport de cotes, généralement plus facile à communiquer.
L’ajustement se fait par maximum de vraisemblance et non par moindres carrés. La vraisemblance multiplie la probabilité prédite de l’issue correcte sur l’ensemble des observations, et les coefficients retenus sont ceux qui la maximisent. Il n’existe pas de solution explicite, l’optimisation est donc itérative, mais l’objectif est convexe, ce qui signifie qu’il y a un unique optimum et aucun risque de converger vers un mauvais optimum local.
La frontière de décision est linéaire. Classer au seuil de 0,5 revient à annuler la partie linéaire, ce qui définit un hyperplan dans l’espace des prédicteurs. La régression logistique ne peut donc pas séparer des classes divisées par une frontière véritablement courbe à moins que des termes non linéaires ne soient fournis comme variables, exactement comme pour la régression linéaire.
Comment calculer
p(X) = e^(β₀+β₁X) / (1 + e^(β₀+β₁X)), equivalently log(p/(1−p)) = β₀ + β₁X
où
- p(X)
- la probabilité prédite de la classe positive
- β₀, β₁
- l’ordonnée à l’origine et le coefficient, estimés par maximum de vraisemblance
- p/(1−p)
- la cote de la classe positive
- log(p/(1−p))
- le log-cote, ou logit, qui est linéaire en X
Exemple : Régression logistique
Supposons qu’un modèle du risque de défaut en fonction du solde du compte donne β₀ = −4 et β₁ = 0,05. Pour un solde de 100, la partie linéaire vaut −4 + 0,05 × 100 = 1,00, et la probabilité prédite est 1/(1 + e^−1,00) ≈ 0,7311.
Pour un solde de 150, la partie linéaire vaut 3,50 et la probabilité ≈ 0,9707. La même hausse de 50 unités a déplacé le log-cote d’exactement 2,5 dans les deux cas, mais la probabilité a monté de 0,24 la première fois et monterait bien moins depuis un point de départ déjà élevé. C’est la non-linéarité qu’introduit la fonction logistique.
Le coefficient se communique le mieux comme rapport de cotes : e^0,05 ≈ 1,051, donc chaque unité supplémentaire de solde multiplie la cote de défaut par environ 1,05. Remarquez qu’il s’agit d’un énoncé multiplicatif sur les cotes, non sur la probabilité.
Questions fréquentes
Pourquoi appeler « régression » une méthode de classification ?
Parce qu’elle régresse une quantité continue, le log-cote, sur les prédicteurs. La classification vient ensuite, quand la probabilité ajustée est comparée à un seuil. Le nom décrit le mécanisme sous-jacent plutôt que l’usage final.
Le seuil de classification doit-il être 0,5 ?
Non. C’est une décision sur le coût relatif des faux positifs et des faux négatifs, non une propriété du modèle. Pour des problèmes déséquilibrés ou des coûts asymétriques, un autre seuil est souvent bien plus approprié.
Comment se compare-t-elle à un SVM linéaire ?
Tous deux produisent une frontière linéaire, mais optimisent des objectifs différents. La régression logistique maximise la vraisemblance et fournit des probabilités calibrées ; une machine à vecteurs de support maximise la marge et fournit une décision sans probabilité associée.
En résumé
La régression logistique adapte le modèle linéaire à la classification par deux changements : une fonction logistique de compression pour que la sortie soit une probabilité valide, et le maximum de vraisemblance à la place des moindres carrés. Ses coefficients restent interprétables sur l’échelle des log-cotes et sa frontière reste linéaire.