Composantes principales et variance
La direction de variance maximale, la contrainte qui rend la question bien posée, la proportion de variance expliquée, et pourquoi la mise à l'échelle n'est pas optionnelle.
Six points, deux mesures chacun. À la fin de cette leçon, un seul nombre remplacera les deux et conservera 98,83 % de tout ce qui variait.
C’est là toute l’idée des composantes principales : la plupart des jeux de données à nombreuses colonnes ne sont pas si larges en réalité. Les colonnes bougent ensemble, et ce mouvement se tient près d’une forme de dimension plus basse. Trouver cette forme permet de porter presque toute l’information avec bien moins de nombres.
Le piège, c’est qu’il n’y a rien pour vérifier votre réponse. Tout, dans le parcours supervisé, avait une réponse à prédire : un modèle pouvait donc avoir tort ou raison. Ici il n’y a aucune réponse - seulement les données - et « quelle structure contiennent-elles » est une question franchement plus difficile ne serait-ce qu’à poser. Le premier travail est donc de dire précisément ce que serait une bonne réponse.
L’analyse en composantes principales rend la question précise d’une manière : trouver un petit nombre de directions le long desquelles les données varient autant que possible, et les employer à la place des variables d’origine.
La première composante principale
La première composante principale est la combinaison linéaire normalisée
de plus grande variance. La contrainte n’est pas décorative. Sans elle, vous pourriez doubler chaque , quadrupler la variance, et recommencer indéfiniment : la maximisation n’aurait aucune solution. Fixer la norme à un rend le problème affaire de direction et non de magnitude.
Le vecteur est le vecteur de charges. Il décrit une direction dans l’espace des variables et appartient au jeu de données pris comme un tout. Projeter les observations dessus donne les scores , un par observation.
Charges et scores répondent à des questions différentes. Une charge dit combien une variable contribue à une composante ; un score dit où se situe une observation le long de celle-ci. Les confondre est la façon la plus courante de mal lire une sortie d’ACP.
James et al. ajoutent une seconde caractérisation équivalente, qu’il vaut la peine de retenir : la direction de la première composante est aussi la droite la plus proche des observations, au sens des distances perpendiculaires au carré. Maximiser la variance des projections et minimiser la distance à la droite sont un seul et même problème.
Exemple travaillé
Six observations sur deux variables :
En centrant les colonnes, la matrice de covariance empirique est
Ses valeurs propres sont et , et le premier vecteur propre - le premier vecteur de charges - vaut
Les deux charges sont positives et la seconde est plus grande : la composante est donc essentiellement « les deux variables ensemble, pondérées vers la seconde ». Les scores sont
et leur variance empirique vaut - exactement . Ce n’est pas une coïncidence : la valeur propre est la variance captée par sa composante.
S'exécute dans votre navigateur. La première exécution télécharge l'environnement Python (~10 Mo), puis il est mis en cache.
Interactif : ce qu’une projection garde, et ce qu’elle perd
Six points, une droite, tous les angles possibles.
- Variance conservée
- 2.0000
- Distance au carré perdue
- 6.1667
- Leur somme
- 8.1667
On conserve 2.0000 de variance. Regardez surtout la troisième mesure : les deux premières évoluent en sens inverse et leur somme ne change jamais, quel que soit l’angle. Maximiser la variance conservée et minimiser la distance perpendiculaire à la droite ne sont pas deux critères qui se trouvent concorder : c’est un seul critère écrit de deux façons. Aucun angle ne bat la composante principale ; essayez d’en trouver un.
Proportion de variance expliquée
Chaque composante capte une part de la variance totale, et la proportion de variance expliquée (PVE) la rapporte :
Ici et . Une seule direction porte 98,83 % de la variation d’un jeu de données à deux variables : remplacer les deux variables par un unique score ne perd presque rien.
Un éboulis (scree plot) place la PVE de chaque composante dans l’ordre, et le conseil habituel est de chercher un coude. Il vaut la peine d’être franc sur ce que c’est : un jugement à l’œil, non un test. Il n’existe pas de méthode objective largement acceptée pour décider combien de composantes suffisent, et en contexte non supervisé il n’y a pas non plus d’erreur hors échantillon à invoquer - c’est précisément la difficulté de n’avoir pas de .
Pourquoi la standardisation n’est pas optionnelle
L’ACP maximise la variance, et la variance a des unités. Mesurez une longueur en millimètres plutôt qu’en mètres et sa variance est multipliée par : cette variable dominera la première composante sans autre raison que le choix de la règle.
Le remède est de mettre chaque variable à écart-type un avant de calculer les composantes - ce qui revient à faire l’ACP sur la matrice de corrélation plutôt que de covariance. James et al. décrivent cela comme la pratique usuelle, et l’exception mérite d’être nommée : quand les variables sont déjà dans les mêmes unités et que leurs variances différentes sont réellement significatives, mettre à l’échelle jetterait une information véritable.
Avant le quiz
Sachez énoncer ce que maximise la première composante et pourquoi la contrainte de norme est nécessaire, distinguer une charge d’un score, calculer une PVE à partir des valeurs propres, et dire ce qui se gâte si l’on saute la standardisation. L’entrée d’encyclopédie Analyse en composantes principales couvre le même matériel comme référence.
Références et lectures complémentaires
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.
Débloquez tout le parcours
Cette première leçon est gratuite. Inscrivez-vous pour passer le quiz de maîtrise, gagner de l’XP et débloquer tous les modules, avec d’autres exemples interactifs et exécutables.