Comprendre Autocorrélation
Des observations indépendantes apportent chacune leur propre information. Des observations dépendantes, non : si aujourd’hui ressemble beaucoup à hier, la seconde mesure ajoute moins que la première. L’autocorrélation quantifie ce « moins » en corrélant la série avec elle-même à un décalage, et elle est simultanément ce qui rend la prévision possible et ce qui invalide les formules usuelles.
Le générateur de mémoire le plus simple est le processus AR(1), où chaque valeur est une fraction phi de la précédente plus du bruit neuf. Son autocorrélation théorique au décalage k vaut exactement phi^k. Mesurée sur 39 800 points avec phi = 0,7, elle donne aux décalages 1, 2, 3 et 5 les valeurs 0,7039, 0,4980, 0,3527 et 0,1796, contre une théorie de 0,7, 0,49, 0,343 et 0,1681, soit un accord à moins de 0,012. La décroissance est géométrique : un choc est transmis, s’affaiblit à chaque pas, mais n’est jamais annulé.
La conséquence pratique est une pénalité précise et calculable. La variance de la moyenne empirique d’une série AR(1) dépasse la formule des données indépendantes d’un facteur (1+phi)/(1-phi), soit 5,6667 à phi = 0,7. Comme l’écart-type est la racine de la variance, il est sous-estimé d’environ 2,4 fois quand on le calcule comme si les points étaient indépendants. Les intervalles sont trop étroits, les tests rejettent trop souvent, et rien en surface ne l’indique.
Lire le graphique d’autocorrélation est aussi la façon dont commence l’identification du modèle : une décroissance géométrique suggère un terme autorégressif, une coupure nette après quelques décalages un terme de moyenne mobile, et un pic à distance fixe de la saisonnalité. Chaque décalage supplémentaire est un paramètre estimé sur un échantillon fini et effectivement plus petit, si bien que le contrôle honnête d’un ordre ainsi choisi est la performance de prévision sur des données postérieures.
Comment calculer
ρ_k = Corr(X_t, X_{t+k}); AR(1): ρ_k = φ^k; Var(X̄) inflated by (1+φ)/(1−φ)
où
- ρ_k
- l’autocorrélation au décalage k : la corrélation de la série avec elle-même à k pas d’écart
- φ
- le coefficient AR(1) ; stationnaire quand son module est inférieur à un
- (1+φ)/(1−φ)
- de combien la variance d’une moyenne dépasse la formule des données indépendantes
- n effectif
- la taille nominale d’échantillon divisée par ce facteur de gonflement
Exemple : Autocorrélation
AR(1) avec phi = 0,7 sur 39 800 points : autocorrélations de 0,7039, 0,4980, 0,3527 et 0,1796 aux décalages 1, 2, 3 et 5, contre un phi^k théorique de 0,7, 0,49, 0,343 et 0,1681.
À ce phi, la variance de la moyenne empirique vaut 5,6667 fois la valeur des données indépendantes : un écart-type naïf est donc sous-estimé d’environ 2,4 fois et la taille d’échantillon effective vaut à peu près un sixième de la taille nominale.
Cette même dépendance est ce qui rend trompeuse une découpe de validation mélangée : sur une série dépendante, interpoler un point retenu à partir des points d’entraînement qui l’entourent donne une RMSE de 0,7515 tandis que prévoir honnêtement vers l’avant donne 4,2074.
Questions fréquentes
L’autocorrélation est-elle un problème ou une ressource ?
Les deux, et cela dépend de la question. C’est ce qui rend la valeur suivante prévisible à partir de la dernière, et c’est ce qui casse toute procédure supposant des observations indépendantes. La prévision l’exploite ; l’inférence doit en tenir compte.
Et si l’autocorrélation ne semble jamais décroître ?
Une autocorrélation empirique qui reste élevée sur de nombreux décalages indique en général une non-stationnarité plutôt qu’une très longue mémoire. Différenciez la série et regardez de nouveau ; si le motif disparaît, c’est que le niveau errait.
Puis-je simplement ajouter des valeurs retardées comme variables dans une régression ?
Souvent oui, et c’est précisément ce qu’est un modèle autorégressif. Ce qui ne suit pas, c’est la machinerie des écarts-types : il faut vérifier l’absence d’autocorrélation résiduelle, car toute mémoire que le modèle n’a pas captée s’y trouve encore.
En résumé
L’autocorrélation est la mémoire d’une série, et elle décide à la fois de ce qui peut être prévu et de ce que vaut réellement toute estimation issue de cette série. Son coût est exact et calculable : à phi = 0,7, une moyenne porte environ un sixième de l’information que sa taille d’échantillon laisse croire.