Qu’est-ce que l’apprentissage statistique ?
Le cadre commun à tout modèle prédictif : estimer une fonction inconnue f à partir des données, la séparation entre erreur réductible et irréductible, et pourquoi prédiction et inférence tirent dans des directions opposées.
Prérequis : Les probabilités à partir de zéro
Tout modèle supervisé de ce site - régression linéaire, arbres, réseaux de neurones - est une réponse à la même question, posée dans la même notation. Avant de comparer les méthodes, il vaut la peine d’énoncer cette question exactement, car elle vous dit aussi quelle part de votre erreur vous pouvez espérer supprimer et quelle part vous restera quelle que soit la qualité de votre méthode.
A. Le cadre
Nous observons une réponse et prédicteurs . Nous supposons qu’il existe une relation entre eux, écrite sous la forme générale
Ici est une fonction fixe mais inconnue représentant l’information systématique que apporte sur , et est un terme d’erreur aléatoire, indépendant de , de moyenne nulle.
L’apprentissage statistique est l’ensemble des approches permettant d’estimer .
L’estimation se note , et la prédiction qu’elle produit est .
B. Erreur réductible et erreur irréductible
Supposons un instant que et soient fixés. À quel point est-il faux comme prédiction de ? Suivant James et al., l’erreur quadratique espérée se décompose en deux morceaux conceptuellement distincts :
Le premier terme est réductible : n’est pas une estimation parfaite de , et nous pouvons réduire cet écart en choisissant une meilleure méthode ou en réunissant davantage de données.
Le second terme est irréductible, et c’est celui qui compte. Même avec une estimation parfaite - même si exactement - la prédiction resterait fausse de , puisque dépend de et que est par définition imprévisible à partir de .
Pourquoi l’erreur irréductible est-elle supérieure à zéro ? Deux raisons, toutes deux à intérioriser. D’abord, peut contenir des variables non mesurées qui aideraient à prédire - comme nous ne les avons pas mesurées, aucun construit sur ne peut les utiliser. Ensuite, il peut contenir une variation authentiquement non mesurable : les mêmes entrées, deux jours différents, ne produisent tout simplement pas des sorties identiques.
La conséquence pratique est un plafond dur. est une borne supérieure sur ce que peut atteindre n’importe quel modèle, et elle est presque toujours inconnue en pratique. Un modèle qui semble la dépasser n’est pas un triomphe : c’est le signe que vous mesurez l’erreur de test sur des données que le modèle a déjà vues.
C. Prédiction contre inférence
Il y a deux raisons d’estimer , et elles tirent en sens contraires.
Pour la prédiction, seul importe que soit proche de . L’estimation peut être une boîte noire complète - vous ne l’inspecterez jamais - pourvu qu’elle soit exacte.
Pour l’inférence, vous voulez comprendre la relation : quels prédicteurs comptent réellement, si chacun élève ou abaisse la réponse, si un résumé linéaire simple suffit. Là, ne peut pas être une boîte noire, car la forme du modèle est la réponse.
Cette tension revient sans cesse :
| Prédiction | Inférence | |
|---|---|---|
| Objectif | exact | Comprendre |
| Modèle préféré | Souple, éventuellement opaque | Restrictif, interprétable |
| Choix typique | Ensembles, réseaux de neurones | Modèles linéaires et linéaires généralisés |
Un modèle choisi uniquement pour son exactitude sera souvent inexplicable, et un modèle choisi pour l’explication laissera souvent de l’exactitude sur la table. Savoir laquelle des deux tâches vous accomplissez est un préalable à tout choix sensé.
D. Estimation paramétrique et non paramétrique
En gros, il existe deux stratégies pour produire .
Les méthodes paramétriques réduisent le problème à l’estimation d’un nombre fixe de valeurs. On suppose d’abord une forme fonctionnelle - au plus simple, que est linéaire :
et il ne reste alors qu’à estimer les coefficients plutôt qu’une fonction -dimensionnelle arbitraire. C’est une simplification énorme. Le risque est tout aussi clair : si le vrai est loin d’être linéaire, aucun choix de coefficients ne l’ajustera, et le modèle est faux d’une manière que davantage de données ne corrigera pas.
Les méthodes non paramétriques ne font pas cette hypothèse et laissent les données déterminer la forme. Elles peuvent ajuster une gamme bien plus large de fonctions vraies, mais comme elles ne réduisent pas le problème à quelques paramètres, elles exigent nettement plus d’observations pour fixer la forme de façon fiable.
E. Pourquoi la souplesse n’est pas gratuite
On serait tenté d’en conclure que les méthodes non paramétriques souples sont tout simplement meilleures. Elles ne le sont pas, pour deux raisons.
D’abord, comme on l’a dit, elles sont plus gourmandes en données. Ensuite - et c’est moins évident - une méthode très souple peut suivre le bruit de l’échantillon d’entraînement comme s’il s’agissait de signal. L’ajustement aux données dont vous disposez paraît superbe pendant que la performance sur des données jamais vues se dégrade.
La figure trace des courbes schématiques, et non les ajustements polynomiaux ci-dessous : à mesure que vous augmentez la Complexité du modèle, l’erreur d’entraînement baisse régulièrement tandis que l’erreur de test finit par remonter.
Interactif : le compromis biais-variance
Erreur d’entraînement contre erreur de test à mesure que la complexité augmente.
- Régime
- Bon ajustement
- Erreur d’entraînement
- 0.25
- Erreur de test
- 0.55
Proche du point idéal : l’erreur de test est proche de son minimum.
L’erreur d’entraînement diminue toujours à mesure que le modèle devient plus flexible : c’est donc un guide trompeur. L’erreur de test vaut biais² + variance + bruit irréductible : elle atteint son minimum là où les deux forces s’équilibrent, puis remonte lorsque le modèle s’ajuste au bruit. Ajoutez des données (augmentez la taille de l’échantillon) et le terme de variance diminue, déplaçant le point idéal vers une complexité plus élevée et abaissant toute la courbe de test.
Ce qui suit le démontre sur des données dont la vérité est connue, ce qui permet de comparer l’ajustement à lui-même plutôt qu’à des observations bruitées :
S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.
Son exécution affiche :
degree 1: training MSE 0.1985 error vs true f 0.2465
degree 3: training MSE 0.0542 error vs true f 0.0235
degree 15: training MSE 0.0258 error vs true f 730.5159
Lisez les deux colonnes l’une contre l’autre. L’EQM d’entraînement décroît de façon monotone avec la souplesse - le degré 15 ajuste les points observés mieux que les deux autres, à . Pourtant son erreur face au vrai vaut : non pas marginalement pire que le du degré 3, mais environ trente mille fois pire.
Cette explosion mérite d’être comprise et pas seulement constatée. Un polynôme de degré 15 ajusté sur 25 points dispose d’assez de liberté pour se faufiler à travers le bruit, et les ondulations nécessaires deviennent violentes près des bords de l’intervalle, là où le moins de points le contraignent. Évaluées sur la grille dense, ces excursions de bord dominent la moyenne. C’est un mode de défaillance réel et bien connu des ajustements polynomiaux de degré élevé, non un artefact de la graine aléatoire.
Le degré 1 montre pendant ce temps la défaillance inverse : son erreur d’entraînement est bien pire que celle du degré 15, mais il est honnête à ce sujet - l’erreur face à la vérité, , est à peu près égale à son erreur d’entraînement, car une droite est trop rigide pour poursuivre le bruit. Elle est simplement la mauvaise forme pour une sinusoïde.
Le degré 3 l’emporte sur la seule colonne qui compte. Cet écart entre « ajuster l’échantillon » et « capturer la vérité » est le phénomène central de la discipline, et il admet une décomposition précise.
À retenir
- L’apprentissage statistique estime un inconnu dans .
- L’erreur de prédiction se scinde en une part réductible, que de meilleures méthodes peuvent réduire, et une part irréductible , que rien ne peut réduire.
- L’erreur irréductible existe à cause de variations non mesurées et non mesurables ; c’est un plafond dur sur l’exactitude de tout modèle.
- La prédiction favorise les modèles souples et opaques ; l’inférence favorise les modèles restrictifs et interprétables. Décidez d’abord ce que vous faites.
- Les méthodes paramétriques supposent une forme et estiment peu de paramètres ; les méthodes non paramétriques supposent moins mais exigent bien plus de données.
- Davantage de souplesse améliore toujours l’erreur d’entraînement et, au-delà d’un certain point, dégrade l’exactitude sur données nouvelles.
La suite
Cette dernière observation mérite un compte rendu exact plutôt qu’une anecdote. L’erreur réductible se scinde elle-même en deux morceaux concurrents - l’un qui diminue à mesure que les modèles gagnent en souplesse, l’autre qui augmente - et c’est leur somme que vous payez réellement. C’est Le compromis biais-variance.
Références et lectures complémentaires
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.