Comprendre Courbe ROC
Un classifieur qui produit un score ne devient une règle de décision qu’une fois un seuil fixé. La valeur par défaut d’un demi est une convention, non un résultat, et elle enfouit l’hypothèse qu’un faux positif et un faux négatif coûtent autant. Partout où c’est faux - et c’est habituellement faux - le seuil est un paramètre du problème plutôt que du modèle, et il devrait être choisi délibérément.
La matrice de confusion est le premier pas hors du chiffre unique : elle sépare les erreurs en faux positifs et faux négatifs, d’où découlent la sensibilité (la proportion de vrais positifs correctement identifiés) et la spécificité (la même chose pour les vrais négatifs). Déplacer le seuil déplace les deux, en sens opposés, et la courbe ROC est simplement le relevé de chacune de ces paires à mesure que le seuil balaie d’une extrémité à l’autre.
Un classifieur parfait atteint le coin supérieur gauche, où tout positif est attrapé sans qu’aucun négatif ne soit signalé ; un classifieur sans information suit la diagonale. L’aire sous la courbe condense l’ensemble du tableau en un nombre à la lecture probabiliste exacte : c’est la probabilité qu’un positif tiré au hasard reçoive un score plus élevé qu’un négatif tiré au hasard. L’équivalence avec la statistique U de Mann–Whitney est une identité, non une approximation.
Ce que la mesure ignore délibérément mérite d’être dit. Comme seul l’ordre des scores compte, l’AUC est inchangée par toute transformation monotone de ceux-ci, ce qui la rend utile pour comparer des modèles avant qu’un seuil ne soit choisi, et inutile pour vérifier si les probabilités prédites sont croyables. Sur des problèmes fortement déséquilibrés, la courbe précision-rappel montre souvent des écarts que la courbe ROC aplatit.
Comment calculer
AUC = P(score(X⁺) > score(X⁻)), sensitivity = TP/(TP+FN), specificity = TN/(TN+FP)
où
- X⁺, X⁻
- une observation positive et une observation négative tirées au hasard
- TP, FN
- vrais positifs et faux négatifs - positifs attrapés et positifs manqués
- TN, FP
- vrais négatifs et faux positifs - négatifs écartés et fausses alertes
- threshold
- le score au-dessus duquel une prédiction est dite positive ; le balayer trace la courbe
Exemple : Courbe ROC
Un classifieur discriminant quadratique sur 200 000 points de test a un taux d’erreur global de 0,093480 au seuil par défaut, ce qui dissimule une véritable asymétrie : sensibilité 0,961083 contre spécificité 0,851753. Vérifier la règle optimale sur le même problème donne 0,952845 et 0,861738 : le déséquilibre est donc une propriété du problème et non un défaut de l’ajustement.
Abaisser le seuil de 0,5 à 0,1 porte la sensibilité à 0,995928 et fait tomber la spécificité à 0,750784, tandis que le taux d’erreur global monte de 0,093480 à 0,126415. Le modèle est identique d’un bout à l’autre - seul le seuil a bougé - et l’intérêt de l’échange dépend entièrement du coût relatif d’un positif manqué et d’une fausse alerte.
Résumé sur tous les seuils, ce classifieur a une AUC de 0,965269 contre 0,933488 pour un classifieur discriminant linéaire sur les mêmes données. Calculer cette aire par la règle du trapèze sur la courbe ROC et calculer la statistique de Mann–Whitney sur les scores bruts concordent exactement.
Questions fréquentes
Quand l’exactitude est-elle le mauvais résumé ?
Dès que les deux types d’erreur ont des coûts différents, et dès que les classes sont fortement déséquilibrées - un classifieur qui prédit toujours la classe majoritaire peut atteindre une exactitude élevée tout en étant inutile. La matrice de confusion devrait être le rapport par défaut, l’exactitude en étant dérivée plutôt que citée seule.
Comment choisir le seuil ?
D’après les coûts, non d’après les données. Si un positif manqué coûte dix fois une fausse alerte, le seuil qui minimise le coût espéré est loin d’un demi. Là où les coûts ne se quantifient pas, une cible explicite de sensibilité ou de spécificité est en général une contrainte plus honnête que la minimisation du taux d’erreur.
Une AUC plus élevée signifie-t-elle toujours un meilleur modèle ?
Pas nécessairement. L’AUC moyenne sur des seuils qui peuvent tous être hors sujet pour l’usage prévu : un modèle à AUC plus faible peut donc être préférable s’il se comporte mieux dans la région de la courbe où l’on opérera réellement. Et l’AUC ne dit rien de la fiabilité des probabilités prédites elles-mêmes.
En résumé
Rapportez la matrice de confusion avant l’exactitude, traitez le seuil comme une décision sur les coûts plutôt que comme un réglage par défaut, et lisez la courbe ROC comme le menu des échanges offerts par un modèle fixé. L’AUC classe ; elle ne calibre pas.