Aller au contenu
Kudos AI

Valeur p

La probabilité d’observer des données au moins aussi extrêmes que celles dont on dispose, calculée en supposant l’hypothèse nulle vraie. Elle mesure à quel point l’échantillon serait inhabituel dans un monde où l’effet est absent, et rien d’autre.

Aussi appelé : Probabilité de signification, Niveau de signification observé

Comprendre Valeur p

Commencez par l’hypothèse dont on veut douter. Un test statistique suppose d’abord que l’hypothèse nulle tient - aucune différence, aucun effet, rien qui se passe - puis pose aux données une seule question : si cela était vrai, à quelle fréquence un échantillon paraîtrait-il au moins aussi extrême ? Cette probabilité est la valeur p. Tout son sens découle du fait que la nulle a été supposée vraie pour la calculer.

C’est pourquoi la lecture la plus répandue n’est pas seulement imprécise mais inversée. La valeur p ne peut pas être la probabilité que l’hypothèse nulle soit vraie, puisque le calcul l’a déjà fixée comme vraie ; une quantité conditionnée à une hypothèse ne peut simultanément être une probabilité portant sur cette hypothèse. Elle n’est pas davantage la probabilité que le résultat soit un hasard, ni le complément de la probabilité de réplication.

La distribution sous la nulle rend la définition concrète. Si la nulle tient et que le test est valide, la valeur p suit une loi uniforme : chaque valeur entre 0 et 1 est également probable. Simuler 50 000 échantillons de taille 25 sous une nulle vraie donne une statistique de Kolmogorov-Smirnov de 0,004299 contre l’uniforme, avec 0,0499 des valeurs p sous 0,05. Rien ne distingue une valeur p de 0,03 d’une de 0,53, sinon que quelqu’un a déclaré la première région intéressante.

Ce qu’une petite valeur p établit bel et bien, c’est que les données seraient inhabituelles si la nulle était vraie, ce qui constitue une preuve réelle. Ce qu’elle ne peut faire seule, c’est indiquer combien croire à l’alternative, car cela dépend de sa plausibilité préalable et de la taille d’effet que l’étude pouvait détecter. Une valeur p juste sous un seuil, issue d’une petite étude, sur une hypothèse peu vraisemblable au départ, est une preuve faible déguisée en découverte.

Comment calculer

p = P(T(X) ≥ t_obs | H₀), and under H₀ valid: p ~ Uniform(0,1)

où

H₀
l’hypothèse nulle, supposée vraie pendant tout le calcul
T(X)
la statistique de test calculée sur une répétition hypothétique de l’étude
t_obs
la valeur de cette statistique effectivement observée sur les données
≥
à lire « au moins aussi extrême que » ; pour un test bilatéral la queue est prise des deux côtés

Exemple : Valeur p

Sous une nulle vraie, 50 000 tests t bilatéraux simulés sur des échantillons de 25 produisent des valeurs p dont la distance de Kolmogorov-Smirnov à l’uniforme est 0,004299 (valeur p du test KS : 0,3129), et 0,0499 d’entre elles tombent sous 0,05. Le taux de 5 % est la définition du seuil, non une propriété des données.

Menez 20 tests indépendants sur des hypothèses toutes nulles : la probabilité qu’au moins un ressorte significatif à 0,05 vaut 1 - 0,95^20 = 0,641514. Rien n’a dysfonctionné : chaque test se trompe 5 % du temps comme annoncé, et 20 occasions suffisent à rendre cela probable au moins une fois.

Supposons qu’une hypothèse sur dix soit réellement vraie et que chaque test ait une puissance de 0,8 à alpha 0,05. Pour 100 hypothèses, 8 effets réels sont détectés et 4,5 fausses alertes proviennent des 90 nulles : 0,36 des résultats significatifs sont donc faux. Chaque test se comporte exactement comme spécifié ; c’est le taux de base qui a fait les dégâts.

Questions fréquentes

Une valeur p sous 0,05 signifie-t-elle que l’effet est réel ?

Elle signifie que les données seraient inhabituelles s’il n’y avait aucun effet. Que l’effet soit réel dépend aussi de sa plausibilité préalable et de la puissance de l’étude. Avec 10 % d’hypothèses testées vraies et 80 % de puissance, plus d’un tiers des résultats significatifs à 0,05 sont de faux positifs.

Une grande valeur p signifie-t-elle qu’il n’y a pas d’effet ?

Non. Elle signifie que l’étude n’a pas trouvé l’effet, ce qui n’informe qu’à proportion de sa puissance. Un test t bilatéral à un échantillon à n = 25 détecte un effet d’un demi écart-type seulement 0,669708 du temps, et un effet d’un cinquième d’écart-type seulement 0,160504 du temps.

Pourquoi 0,05 ?

Par convention, et une convention explicitement arbitraire. Elle fixe le taux de faux positifs à long terme parmi les nulles vraies : c’est donc un énoncé sur la fréquence à laquelle on accepte d’avoir tort. Les disciplines qui testent de nombreuses hypothèses à la fois exigent couramment des seuils bien plus petits, précisément pour cette raison.

En résumé

Une valeur p répond bien à une seule question étroite : à quel point ces données surprendraient-elles s’il ne se passait rien ? Elle ne peut répondre à la question que l’on se pose vraiment - combien croire à l’effet - car celle-ci exige la plausibilité préalable de l’hypothèse et la puissance de l’étude derrière elle.