Aller au contenu
Kudos AI
Read in English
Statistical Inference

L’intervalle à 95 % qui couvre 81 % du temps

L’intervalle de confiance classique pour une proportion a une couverture exacte que l’on calcule en sommant sur les n+1 échantillons possibles, et à n = 30 avec p = 0,10 elle vaut 0,8085 au lieu de 0,95. La couverture ne s’améliore pas de façon monotone avec n, et dans un contexte d’événements rares elle peut tomber à 0,0392. Deux solutions d’une ligne corrigent cela.

4 min de lectureKudos AI

Prérequis : Ce qu'un échantillon peut et ne peut pas vous dire

De nombreux intervalles tracés les uns au-dessus des autres face à une valeur vraie fixe, ceux qui la manquent mis en évidence, et le décompte courant de ceux qui l’ont couverte se stabilisant sous le niveau promis.

Un intervalle de confiance à 95 % promet une chose : sur des échantillons répétés, l’intervalle contient le vrai paramètre 95 % du temps. Pour une proportion, cela se vérifie exactement. Il n’y a que n+1n + 1 échantillons possibles : on peut donc construire l’intervalle pour chacun, demander s’il contient pp, et additionner les probabilités binomiales de ceux qui le font. Aucune simulation, aucune approximation.

Faites-le pour l’intervalle standard p^±1.96p^(1−p^)/n\hat{p} \pm 1.96\sqrt{\hat{p}(1-\hat{p})/n}, à n=30n = 30 et p=0.10p = 0.10 :

couverture=0.8085.\text{couverture} = 0.8085.

Un échantillon sur cinq produit un intervalle qui ne contient pas la vérité. L’intervalle est étiqueté 95 %.

A. Ce n’est pas une réserve sur les petits échantillons

La défense habituelle est que 30 est un petit échantillon. Voici le même calcul sur toute une gamme de situations, avec deux solutions de rechange :

nnppWaldWilsonAgresti-Coull
300.100.80850.97420.9742
400.050.86810.95200.9861
1000.050.87750.96590.9659
200.200.92080.95630.9563
500.300.93470.95670.9567
1000.500.94310.94310.9431

Cent observations d’un événement à 5 % donnent encore 0,8775. Et la dernière ligne mérite d’être notée pour elle-même : à la proportion la plus favorable qui soit, avec cent observations, l’intervalle couvre encore 94,31 % et non 95 %. Il n’est jamais tout à fait juste, et dans le coin de l’espace des paramètres où vivent la plupart des vraies questions - événements rares, échantillons moyens - il n’en est pas près.

B. Plus de données ne corrige pas de façon monotone

La couverture ne monte pas à mesure que nn grandit. À p=0.10p = 0.10 :

nn2530354045505560
couverture0.91870.80850.87130.91450.93560.87890.91530.9413

Passer de 25 observations à 30 fait tomber la couverture de 0,9187 à 0,8085. Passer de 45 à 50 la fait tomber de 0,9356 à 0,8789.

Dans la figure, choisissez 0,10 à côté de vrai p et faites glisser taille d’échantillon n jusqu’à 30 : Couverture à n affiche 80,9 %, soit le 0,8085 ci-dessus.

Interactif : la couverture réelle d’un intervalle à 95 %

Exacte, par énumération. Une binomiale n’a que n + 1 issues.

95%80%n = 20200
Couverture à n
95.1%
Manque
0.0%
Tailles qui reculent
29
Échantillons sans succès
0.6%
vrai p

À n = 23, l’intervalle annonçant 95 % en livre 95.1%. Regardez la forme : la couverture ne monte pas vers la ligne, elle la traverse 29 fois sur cette seule plage, chaque dent correspondant à une valeur atteignable de plus. Passez de 23 à 24 et huit points disparaissent avec une seule observation supplémentaire.

L’oscillation n’est pas du bruit, car il n’y a pas de bruit ici : chaque entrée est une somme exacte. Elle vient de ce que l’ensemble des p^\hat{p} atteignables est discret : quand nn change, l’un des n+1n + 1 résultats possibles franchit la frontière du « contient pp » et emporte avec lui toute sa probabilité binomiale. Toute affirmation du type « l’intervalle va bien dès que nn est assez grand » doit survivre à ce tableau, et les règles empiriques habituelles (np^>5n\hat{p} > 5, etc.) n’y survivent pas.

C. Le cas dégénéré

Prenez n=40n = 40 et p=0.001p = 0.001. La couverture de l’intervalle standard vaut

0.0392.0.0392.

Un intervalle à 95 % qui contient la vérité dans 4 % des échantillons. Le mécanisme est immédiat : P(k=0)=0.9608P(k = 0) = 0.9608, et lorsque k=0k = 0 l’estimation est p^=0\hat{p} = 0, l’erreur type vaut 0⋅1/n=0\sqrt{0 \cdot 1 / n} = 0, et l’intervalle est le point unique [0,0][0, 0], qui ne contient pas 0.0010.001. La formule affiche une certitude parfaite exactement là où elle n’a rien vu.

C’est le cas qui se présente en production : la panne rare, le clic rare, l’effet indésirable rare.

D. Que faire à la place

Les deux solutions du tableau tiennent en une ligne et n’exigent aucune idée nouvelle.

  • Wilson. Inversez le test plutôt que l’estimation : gardez les valeurs de pp que les données ne rejetteraient pas. L’intervalle n’est plus centré sur p^\hat{p} et ne se réduit jamais à un point.
  • Agresti-Coull. Ajoutez deux succès et deux échecs, puis appliquez la formule ordinaire aux effectifs ajustés. C’est l’intervalle de Wald avec l’estimation éloignée du bord, et dans le tableau ci-dessus c’est le plus conservateur des deux.

La leçon générale est celle que le calcul exact rend disponible : la couverture se calcule, donc calculez-la. Pour une proportion, c’est une somme finie. Pour tout le reste, simuler la loi d’échantillonnage et compter combien de fois l’intervalle contient la valeur qui a servi à générer les données prend quelques lignes, et c’est le seul moyen de savoir si le nombre sur l’étiquette est celui que vous obtenez.

Références et lectures complémentaires

  • Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Lecture associée

11 min de lectureStatistical Inference

Ce qu'un échantillon peut et ne peut pas vous dire

Les estimateurs comme variables aléatoires dotées de leur propre distribution, le cas où l'estimateur sans biais est le moins bon, ce qu'un intervalle de confiance promet réellement et l'intervalle standard qui délivre 87 % là où il en annonce 95, et ce dont une valeur p est la probabilité - chaque chiffre calculé exactement ou par simulation à graine fixée.

StatistiqueProbabilité
6 min de lectureApprentissage non supervisé

La direction qui change quand vous changez d’unité

Douze personnes, deux mesures, et trois premières composantes principales différentes : en millimètres la réponse est presque uniquement la taille, en mètres presque uniquement le poids, et en centimètres un mélange équilibré - la corrélation restant fixée à 0,9500 dans les trois cas. Ce que cela dit de ce que l’ACP maximise, pourquoi une proportion de variance expliquée de 99,999 % peut être un énoncé sur les mètres plutôt que sur les personnes, et ce que la standardisation choisit réellement.

Apprentissage automatiqueStatistique
4 min de lectureCausal Inférence

La variable de contrôle qui invente une relation

Deux causes indépendantes et un effet commun. Contrôlez l’effet et les causes acquièrent une corrélation d’exactement -1 : une régression de A sur B donne un coefficient de +0,0030, et ajouter l’effet commun comme contrôle le transforme en -1,0000. La sélection d’un échantillon fait la même chose de manière invisible, et c’est pourquoi « contrôlez tout ce que vous avez mesuré » n’est pas une règle défendable.

Statistique
← Retour à tous les articles