L’intervalle à 95 % qui couvre 81 % du temps
L’intervalle de confiance classique pour une proportion a une couverture exacte que l’on calcule en sommant sur les n+1 échantillons possibles, et à n = 30 avec p = 0,10 elle vaut 0,8085 au lieu de 0,95. La couverture ne s’améliore pas de façon monotone avec n, et dans un contexte d’événements rares elle peut tomber à 0,0392. Deux solutions d’une ligne corrigent cela.
Prérequis : Ce qu'un échantillon peut et ne peut pas vous dire
Un intervalle de confiance à 95 % promet une chose : sur des échantillons répétés, l’intervalle contient le vrai paramètre 95 % du temps. Pour une proportion, cela se vérifie exactement. Il n’y a que échantillons possibles : on peut donc construire l’intervalle pour chacun, demander s’il contient , et additionner les probabilités binomiales de ceux qui le font. Aucune simulation, aucune approximation.
Faites-le pour l’intervalle standard , à et :
Un échantillon sur cinq produit un intervalle qui ne contient pas la vérité. L’intervalle est étiqueté 95 %.
A. Ce n’est pas une réserve sur les petits échantillons
La défense habituelle est que 30 est un petit échantillon. Voici le même calcul sur toute une gamme de situations, avec deux solutions de rechange :
| Wald | Wilson | Agresti-Coull | ||
|---|---|---|---|---|
| 30 | 0.10 | 0.8085 | 0.9742 | 0.9742 |
| 40 | 0.05 | 0.8681 | 0.9520 | 0.9861 |
| 100 | 0.05 | 0.8775 | 0.9659 | 0.9659 |
| 20 | 0.20 | 0.9208 | 0.9563 | 0.9563 |
| 50 | 0.30 | 0.9347 | 0.9567 | 0.9567 |
| 100 | 0.50 | 0.9431 | 0.9431 | 0.9431 |
Cent observations d’un événement à 5 % donnent encore 0,8775. Et la dernière ligne mérite d’être notée pour elle-même : à la proportion la plus favorable qui soit, avec cent observations, l’intervalle couvre encore 94,31 % et non 95 %. Il n’est jamais tout à fait juste, et dans le coin de l’espace des paramètres où vivent la plupart des vraies questions - événements rares, échantillons moyens - il n’en est pas près.
B. Plus de données ne corrige pas de façon monotone
La couverture ne monte pas à mesure que grandit. À :
| 25 | 30 | 35 | 40 | 45 | 50 | 55 | 60 | |
|---|---|---|---|---|---|---|---|---|
| couverture | 0.9187 | 0.8085 | 0.8713 | 0.9145 | 0.9356 | 0.8789 | 0.9153 | 0.9413 |
Passer de 25 observations à 30 fait tomber la couverture de 0,9187 à 0,8085. Passer de 45 à 50 la fait tomber de 0,9356 à 0,8789.
Dans la figure, choisissez 0,10 à côté de vrai p et faites glisser taille d’échantillon n jusqu’à 30 : Couverture à n affiche 80,9 %, soit le 0,8085 ci-dessus.
Interactif : la couverture réelle d’un intervalle à 95 %
Exacte, par énumération. Une binomiale n’a que n + 1 issues.
- Couverture à n
- 95.1%
- Manque
- 0.0%
- Tailles qui reculent
- 29
- Échantillons sans succès
- 0.6%
À n = 23, l’intervalle annonçant 95 % en livre 95.1%. Regardez la forme : la couverture ne monte pas vers la ligne, elle la traverse 29 fois sur cette seule plage, chaque dent correspondant à une valeur atteignable de plus. Passez de 23 à 24 et huit points disparaissent avec une seule observation supplémentaire.
L’oscillation n’est pas du bruit, car il n’y a pas de bruit ici : chaque entrée est une somme exacte. Elle vient de ce que l’ensemble des atteignables est discret : quand change, l’un des résultats possibles franchit la frontière du « contient » et emporte avec lui toute sa probabilité binomiale. Toute affirmation du type « l’intervalle va bien dès que est assez grand » doit survivre à ce tableau, et les règles empiriques habituelles (, etc.) n’y survivent pas.
C. Le cas dégénéré
Prenez et . La couverture de l’intervalle standard vaut
Un intervalle à 95 % qui contient la vérité dans 4 % des échantillons. Le mécanisme est immédiat : , et lorsque l’estimation est , l’erreur type vaut , et l’intervalle est le point unique , qui ne contient pas . La formule affiche une certitude parfaite exactement là où elle n’a rien vu.
C’est le cas qui se présente en production : la panne rare, le clic rare, l’effet indésirable rare.
D. Que faire à la place
Les deux solutions du tableau tiennent en une ligne et n’exigent aucune idée nouvelle.
- Wilson. Inversez le test plutôt que l’estimation : gardez les valeurs de que les données ne rejetteraient pas. L’intervalle n’est plus centré sur et ne se réduit jamais à un point.
- Agresti-Coull. Ajoutez deux succès et deux échecs, puis appliquez la formule ordinaire aux effectifs ajustés. C’est l’intervalle de Wald avec l’estimation éloignée du bord, et dans le tableau ci-dessus c’est le plus conservateur des deux.
La leçon générale est celle que le calcul exact rend disponible : la couverture se calcule, donc calculez-la. Pour une proportion, c’est une somme finie. Pour tout le reste, simuler la loi d’échantillonnage et compter combien de fois l’intervalle contient la valeur qui a servi à générer les données prend quelques lignes, et c’est le seul moyen de savoir si le nombre sur l’étiquette est celui que vous obtenez.
Références et lectures complémentaires
- Gareth James, Daniela Witten, Trevor Hastie, Robert Tibshirani, An Introduction to Statistical Learning, with Applications in R, Springer (Springer Texts in Statistics 103), 2013source ↗
Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.