Aller au contenu
Kudos AI

Puissance statistique

La probabilité qu’un test rejette l’hypothèse nulle lorsqu’une alternative précise est vraie. C’est la chance de détecter un effet réellement présent, et elle est fixée par le protocole avant toute collecte de données.

Aussi appelé : Sensibilité d’un test, 1 − β

Comprendre Puissance statistique

Un test peut se tromper de deux façons, et elles ne sont pas symétriques. Il peut rejeter une nulle vraie, ce qui arrive au taux alpha que l’analyste choisit, ou échouer à rejeter alors qu’un effet est bien présent, ce qui arrive à un taux bêta largement hérité du protocole. La puissance vaut 1 - bêta : la probabilité de détecter l’effet.

La puissance est toujours puissance contre quelque chose. Elle dépend de la taille de l’effet recherché, de la variabilité des mesures, de la taille d’échantillon et du alpha retenu ; l’annoncer sans nommer une taille d’effet ne veut rien dire. L’usage est d’exprimer l’effet en écarts-types, de sorte qu’« un demi écart-type » décrive une différence comparable d’une échelle de mesure à l’autre.

La conséquence pratique est qu’un résultat non significatif n’est pas un constat d’absence d’effet, sauf si l’étude pouvait plausiblement en trouver un. Un test t bilatéral à un échantillon cherchant un demi écart-type a une puissance de 0,293176 à n = 10, 0,669708 à n = 25, 0,933898 à n = 50 et 0,998610 à n = 100. L’étude de 25 qui ne rapporte rien aurait manqué un effet réel de cette taille un tiers du temps ; à un cinquième d’écart-type, le même protocole le manque cinq fois sur six.

Les travaux sous-dimensionnés abîment aussi les résultats qui atteignent la signification. Si une hypothèse sur dix est vraie et la puissance vaut 0,8, alors pour 100 hypothèses les tests donnent 8 détections vraies et 4,5 fausses alertes : 0,36 des découvertes significatives sont fausses. Abaisser la puissance augmente cette fraction, car cela réduit les découvertes vraies au dénominateur sans toucher aux faux positifs du numérateur - c’est pourquoi la puissance est une question sur la crédibilité d’une littérature, et pas seulement sur une expérience.

Comment calculer

power = 1 − β = P(reject H₀ | H₁ true), with β = P(type II error)

où

α
le taux d’erreur de première espèce : rejeter une nulle vraie, choisi par l’analyste (souvent 0,05)
β
le taux d’erreur de seconde espèce : ne pas rejeter alors que l’alternative tient
H₁
une alternative précise, taille d’effet comprise - sans elle la puissance n’est pas définie
δ√n
le paramètre de décentrage : taille d’effet en écarts-types multipliée par la racine de n

Exemple : Puissance statistique

Test t bilatéral à un échantillon, alpha 0,05, effet d’un demi écart-type, calculé à partir de la loi de Student décentrée plutôt que simulé : puissance 0,293176 à n = 10, 0,669708 à n = 25, 0,933898 à n = 50, 0,998610 à n = 100. Atteindre les 80 % conventionnels demande n = 34.

Le même protocole cherchant un cinquième d’écart-type a une puissance de 0,160504 à n = 25. Une telle étude manque un effet réel cinq fois sur six : son résultat nul n’apporte presque aucune information.

Avec 10 % des hypothèses testées vraies, alpha 0,05 et puissance 0,8, le taux de fausses découvertes parmi les résultats significatifs vaut (0,9 × 0,05) / (0,1 × 0,8 + 0,9 × 0,05) = 0,36. Mener 20 tests indépendants sur des nulles vraies produit au moins un résultat significatif 0,641514 du temps ; un seuil de Bonferroni à 0,0025 ramène cela à 0,048830.

Questions fréquentes

Peut-on calculer la puissance après coup à partir de l’effet observé ?

Pas utilement. Une puissance calculée sur l’effet que l’étude a justement observé est une reformulation de la valeur p, non une information nouvelle. La puissance est une grandeur de protocole, et la taille d’effet retenue doit être la plus petite qui vaille la peine d’être détectée.

Combien de données coûte un gain de puissance ?

Plus que l’intuition ne le suggère, car la précision progresse comme la racine carrée de la taille d’échantillon. Passer d’une puissance de 0,669708 à 0,933898 pour un effet d’un demi écart-type signifie passer de 25 à 50 observations, et les rendements décroissent ensuite.

Pourquoi ne pas simplement abaisser alpha par prudence ?

Parce que les deux erreurs s’échangent. Abaisser alpha réduit les faux positifs et réduit directement la puissance, augmentant le risque de manquer des effets réels. Bonferroni à 0,0025 pour 20 tests contrôle l’erreur par famille à 0,048830, et le paie sur chaque test individuel.

En résumé

La puissance se décide avant que la moindre donnée existe, et elle fixe la valeur des deux issues possibles de l’étude : ce qu’un résultat nul autorise à conclure, et quelle fraction des résultats significatifs d’un domaine est réelle. C’est la chose la moins coûteuse à régler et la plus coûteuse à découvrir après coup.