Comprendre Calendrier de taux d’apprentissage
La taille du pas est le seul hyperparamètre qui sera forcément mauvais à un moment de l’entraînement s’il reste constant. Au début, les paramètres sont loin de tout minimum et ce sont les grands pas qui font avancer ; à la fin, l’estimation du gradient est dominée par le bruit des mini-lots, et un grand pas transforme ce bruit en erreur permanente. Un calendrier résout le conflit en faisant du pas une fonction du temps.
L’exigence est précise. Robbins et Monro ont montré qu’une approximation stochastique converge lorsque les pas satisfont deux conditions à la fois : leur somme diverge, pour que l’itéré puisse encore atteindre un optimum si loin soit-il, et la somme de leurs carrés est finie, pour que le bruit injecté soit sommable. Un pas constant satisfait la première et échoue à la seconde, ce qui explique exactement pourquoi il stagne à un plancher. Un pas décroissant en 1/t² satisfait la seconde et échoue à la première, et peut manquer de trajet avant d’arriver.
L’échauffement - faire monter le taux depuis presque zéro pendant les premières centaines ou milliers de pas - est souvent évoqué dans la même phrase que la décroissance, mais il répond à une autre question. La limite de stabilité d’un pas de gradient est η < 2/L, et dans un réseau non entraîné L bouge vite dans les premiers pas. Partir sous la limite et y monter évite une divergence qui n’a rien à voir avec le bruit.
En pratique, un calendrier accompagne une méthode adaptative au lieu de s’y substituer. Adam et l’inertie changent la direction et la taille effective du pas ; le calendrier en gouverne l’échelle globale. Les deux résolvent les deux moitiés du même problème - progression rapide au début, et fermeture de la boule de bruit à la fin - ce qui explique que presque toute recette d’entraînement publiée précise les deux.
Comment calculer
Σ_t η_t = ∞, Σ_t η_t² < ∞
où
- η_t
- le taux d’apprentissage au pas t
- Σ_t η_t = ∞
- l’exécution conserve assez de trajet total pour atteindre l’optimum d’où qu’elle parte
- Σ_t η_t² < ∞
- le bruit injecté sur toute l’exécution est fini, donc l’itéré peut se poser
Exemple : Calendrier de taux d’apprentissage
Un problème de moindres carrés exécuté avec des mini-lots de 8 et un pas fixe de 0,20 se stabilise à une distance quadratique moyenne de 0,109343 de l’optimum et y reste, quelle que soit la durée. Diviser le pas par deux à 0,10 ne déplace le plancher qu’à 0,075358, car le rayon croît en √η.
Remplacer la constante par η_t = 0,20/(1 + t/500) - même taux initial, mêmes données, même germe aléatoire - amène l’exécution à 0,009909 sur le même horizon, onze fois plus près, et elle progresse encore au moment de l’arrêt.
La vitesse de décroissance est elle-même un choix : sur cet horizon, τ = 500 atteint 0,009909, τ = 2000 atteint 0,019304 et τ = 10 000 en est encore à 0,040247. Un calendrier qui décroît trop lentement passe l’exécution au plancher qu’il cherche à quitter.
Avantages et inconvénients
Avantages
- Supprime le plancher de bruit qui fige une exécution à pas constant en deçà de l’optimum.
- Autorise un grand pas au début, pour progresser vite, sans le payer à la fin.
- Ne coûte rien : c’est un changement d’un scalaire par pas, pas du modèle ni des données.
Inconvénients
- Ajoute ses propres hyperparamètres - taux initial, forme de la décroissance, horizon - qui interagissent avec la taille de lot.
- Un calendrier réglé pour une durée d’exécution peut être très mauvais pour une autre, la plupart des formes étant définies relativement au nombre total de pas.
- Décroître trop tôt fige la progression sur les paramètres du moment.
Questions fréquentes
Pourquoi ne pas simplement arrêter l’entraînement quand la perte plafonne ?
Parce qu’un plateau à pas constant n’est généralement pas un minimum : c’est le bord d’une boule de bruit dont le rayon est fixé par la taille du pas. Faire décroître le taux à cet instant produit typiquement une nouvelle chute de la perte, ce qui donne aux calendriers par paliers leur allure si spectaculaire sur une courbe d’entraînement.
Adam rend-il un calendrier inutile ?
Non. Adam remet le pas à l’échelle coordonnée par coordonnée, ce qui est du conditionnement, pas de la réduction de bruit : il se stabilise toujours dans une boule, et comme il avance davantage par pas, dans une boule un peu plus large. Sur les longues exécutions, une SGD simple avec calendrier finit régulièrement plus près de l’optimum qu’un Adam à pas constant.
La décroissance en cosinus vaut-elle mieux que par paliers ?
L’écart entre calendriers raisonnables est faible devant l’écart entre en avoir un et ne pas en avoir. Le cosinus est populaire parce qu’il ne demande qu’un budget total de pas et n’a pas de rupture ; la décroissance par paliers se raisonne plus facilement quand la durée d’entraînement peut changer en cours de route.
En résumé
Un calendrier de taux d’apprentissage est ce qui transforme la descente de gradient stochastique, méthode qui tourne autour de l’optimum, en méthode qui l’atteint. Les deux conditions de Robbins-Monro disent ce que tout calendrier viable doit faire, et le choix de la forme importe bien moins que leur respect.