Comprendre Surapprentissage
Un modèle est ajusté sur un échantillon mais jugé sur des données qu’il n’a jamais vues. Le surapprentissage survient lorsqu’il traite les caractéristiques accidentelles de cet échantillon particulier, bruit de mesure, hasard des observations tirées, comme s’il s’agissait de structure réelle. L’erreur d’entraînement continue de baisser tandis que la capacité à généraliser se dégrade silencieusement.
La souplesse en est le mécanisme. Un modèle suffisamment souple peut passer exactement par chaque point d’entraînement ; une courbe enfilée à travers tous les points affichera une erreur d’entraînement nulle et aucune valeur prédictive. Plus la capacité est grande relativement à la quantité de données qui la contraint, plus le modèle peut absorber le bruit de l’échantillon.
Ce mode de défaillance a un symétrique. Un modèle trop rigide, une droite ajustée à une relation réellement courbe, ne peut représenter la structure véritable quelle que soit la quantité de données. C’est le sous-apprentissage, et aucune donnée supplémentaire n’y remédie. Choisir la complexité d’un modèle, c’est naviguer entre ces deux échecs, ce qui est précisément le compromis biais-variance.
Comme l’erreur d’entraînement est une estimation biaisée et optimiste des performances futures, détecter le surapprentissage exige des données sur lesquelles le modèle n’a pas été ajusté. C’est la raison d’être d’un jeu de test mis de côté, et de la validation croisée lorsque les données sont trop rares pour en sacrifier une grande part.
Exemple : Surapprentissage
Supposons dix points engendrés par une relation quadratique douce, augmentée d’un peu de bruit de mesure. Ajustez une droite : elle manquera la courbure, et les erreurs d’entraînement comme de test resteront élevées. C’est du sous-apprentissage.
Ajustez maintenant un polynôme de degré neuf. Il dispose d’assez de liberté pour passer exactement par les dix points, ramenant l’erreur d’entraînement à zéro. Mais entre ces points et au-delà, il oscille violemment, car ces oscillations épousent le bruit et non le signal. Son erreur de test est bien pire que celle de la droite.
Un ajustement quadratique, correspondant au processus qui a réellement engendré les données, présente une faible erreur d’entraînement et une erreur de test comparable. La leçon est que le meilleur modèle est celui dont la complexité correspond à la structure des données, non celui qui épouse le mieux l’échantillon d’entraînement.
Questions fréquentes
Comment savoir si mon modèle surapprend ?
Comparez les performances sur les données d’ajustement et sur des données jamais vues. Une faible erreur d’entraînement accompagnée d’une erreur de validation ou de test nettement plus élevée est la signature du surapprentissage. Si les deux erreurs sont élevées et proches, il s’agit au contraire de sous-apprentissage.
Davantage de données corrige-t-il le surapprentissage ?
Cela aide généralement, car une souplesse donnée se répartit sur davantage de contraintes, laissant moins de liberté pour épouser le bruit. Cela ne corrige en rien le sous-apprentissage, où la limite tient à la forme du modèle et non à la quantité de données.
Une erreur d’entraînement nulle signifie-t-elle toujours du surapprentissage ?
Pas nécessairement, mais c’est un signal d’alerte fort qui impose une vérification sur données mises de côté. Sur des problèmes réellement faciles et peu bruités, un bon modèle peut légitimement ajuster presque parfaitement les données d’entraînement tout en généralisant.
En résumé
Le surapprentissage est l’incapacité à distinguer le signal du bruit dans un échantillon fini. On le maîtrise en accordant la souplesse du modèle aux preuves disponibles, et on ne peut le détecter que sur des données que le modèle n’a pas vues, ce qui rend une validation rigoureuse indispensable.