Stationnarité et régression fallacieuse
Deux séries sans aucun lien, régressées l’une sur l’autre et déclarées significatives dans 82,8 % des cas, la propriété des données qui le provoque, et la transformation d’une ligne qui rétablit un test honnête.
Voici un résultat reproductible en dix lignes, et il devrait inquiéter.
Prenez deux séries qui n’ont strictement aucun rapport entre elles : engendrées à partir de nombres aléatoires distincts, sur des lignes distinctes d’un script, sans la moindre entrée commune. Régressez l’une sur l’autre et testez la pente au seuil habituel de 5 %.
Sur 2 000 paires de 200 points, la pente ressort significative dans 82,8 % des cas.
Pas 5 %, ce qu’un test valide devrait donner sur des données sans lien. Quatre-vingt-trois pour cent. L’arithmétique est juste, les nombres aléatoires sont corrects, et les p-values sortent de la formule qui fonctionne ailleurs.
Ce qu’étaient ces séries
Chacune est une marche aléatoire : partir de zéro et ajouter à chaque pas un tirage indépendant d’une loi normale standard.
Rien n’y est caché. Deux séries construites sur des tirages séparés sont indépendantes par construction, et aucune contemplation ne rendra l’une informative sur l’autre.
Pourquoi le test échoue
Une marche aléatoire n’a aucun niveau où revenir. Quelle que soit la valeur atteinte, le pas suivant repart de là plutôt que d’une position de repos, si bien que l’écart s’accumule au lieu de se compenser.
Cela se voit sur une variance qui croît avec le temps. Mesurée sur 3 000 réplications :
| instant | variance de |
|---|---|
| 50 | 48,9 |
| 200 | 194,1 |
| 800 | 757,4 |
À peu près lui-même, ce qui est la réponse théorique : la somme de pas indépendants de variance unitaire a pour variance .
Imaginez maintenant deux telles séries sur 200 points. Chacune part quelque part et y reste un moment, parce que s’éloigner est facile et revenir ne l’est pas. Sur toute fenêtre finie, deux séries errantes dérivent très souvent dans une direction cohérente l’une par rapport à l’autre, et le nuage de points de l’une contre l’autre ressemble à une droite.
La régression n’a aucun moyen d’en tenir compte. Elle a été construite en supposant des observations indépendantes : elle compte 200 points de dérive partagée comme 200 éléments de preuve indépendants. Ils en valent plutôt un.
Une seule paire ne prouverait rien : vous seriez en droit de supposer qu’on vous a montré celle qui s’alignait par chance. La figure ci-dessous montre donc une paire et, à côté, le taux de rejet sur quatre cents autres tirées de la même façon. Tirez une autre paire autant de fois que vous voulez. Passez ensuite aux différences premières : ce sont les mêmes paires, rien n’a changé dans les données, et le taux tombe de quatre sur cinq à un sur vingt.
Interactif : deux séries sans aucun rapport
Nombres aléatoires distincts, aucune entrée commune. Tirez une autre paire.
Les deux séries
L’une contre l’autre
- |t| sur la pente
- 4.41
- R carré
- 0.090
- Au seuil de 5 %
- significatif
- Sur 400 paires
- 81.8%
|t| vaut 4.41 pour une valeur critique de 1.972 : cette paire est donc significative, et sur 400 paires indépendantes le test rejette 81.8% du temps, là où un test valide sur des données sans rapport devrait rejeter 5 %. Aucune des deux séries ne connaît l’existence de l’autre. La régression compte 200 points de dérive commune comme 200 preuves indépendantes, alors qu’elles en valent presque une : une marche n’a pas de niveau où revenir, sa variance croît avec le temps, et deux marches passent de longues périodes à dériver de concert. Passez maintenant aux différences premières.
La stationnarité, énoncée
Une série est stationnaire quand son comportement statistique ne dépend pas du moment où on la regarde. La version stricte dit que la loi jointe de tout bloc d’observations est inchangée par décalage temporel. La version utilisée en pratique, dite faible ou de covariance, demande trois choses :
- la moyenne ne dépend pas de
- la variance ne dépend pas de
- la covariance ne dépend que de l’écart , et non de l’endroit où se place la fenêtre
La marche aléatoire échoue aux deux dernières. Sa variance vaut , et sa structure de covariance se déplace avec la fenêtre.
Pourquoi cela compte davantage pour l’inférence que pour la description : toute estimation emprunte de la force à l’ensemble des observations, ce qui n’a de sens que si ces observations décrivent le même processus. Quand le niveau erre, une moyenne sur la fenêtre est une moyenne sur des mondes différents, et un intervalle de confiance autour d’elle décrit une quantité qui n’a jamais existé.
La réparation, et son coût
Une marche aléatoire est la somme cumulée de ses pas : prendre les différences premières les restitue.
Ces pas sont indépendants, de moyenne nulle et de variance constante, exactement les conditions dont le test a besoin. Régresser les mêmes 2 000 paires en différences premières donne un taux de significativité de 4,2 %, contre les 5 % qu’un test valide doit produire.
Le coût n’est pas nul, et mieux vaut l’énoncer que l’enfouir. Le modèle différencié relie les variations d’une série aux variations de l’autre. Si la question portait sur les niveaux, elle a été remplacée par une autre question, et la réponse doit être présentée comme la réponse à celle-là.
La différenciation n’est pas non plus un remède universel. Elle retire une tendance stochastique, mais appliquée à une série déjà stationnaire elle ajoute du bruit pour rien. Une tendance déterministe droite se traite mieux en l’ajustant puis en la soustrayant. Une variance qui croît multiplicativement appelle d’abord un logarithme.
L’habitude que cela doit laisser
Davantage de données ne vous sauve pas ici. Le taux de rejet fallacieux ne baisse pas quand la série s’allonge : il monte, parce qu’une fenêtre plus longue laisse aux deux séries plus de place pour errer. C’est la signature d’un biais et non d’un bruit, et c’est la même forme de problème que la confusion : une propriété de la façon dont les données sont nées, pas de leur quantité.
La première question sur toute série est donc la stabilité de son comportement dans le temps, et le premier outil honnête est un graphique. Un niveau errant ou une dispersion qui s’élargit se voient en général. Des tests formels existent, mais leur puissance est faible contre des alternatives lentes : un test qui ne rejette pas est une preuve faible de stationnarité, pas un feu vert.
Ce que cela prépare
La stationnarité est la condition qui donne un sens au reste de la boîte à outils. La question suivante est ce que cette boîte mesure alors : si une série est stationnaire, sa dépendance à son propre passé est une chose stable et estimable, et cette dépendance est à la fois ce qui rend la prévision possible et ce qui rend les écarts-types usuels faux d’un facteur calculable.
Références et lectures complémentaires
- Rob J Hyndman, George Athanasopoulos, Forecasting: Principles and Practice, OTexts, 2014source ↗
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.
Débloquez tout le parcours
Cette première leçon est gratuite. Inscrivez-vous pour passer le quiz de maîtrise, gagner de l’XP et débloquer tous les modules, avec d’autres exemples interactifs et exécutables.