Aller au contenu
Kudos AI
Read in English
Fondements des probabilités

Les deux variables qui ressemblent à du bruit

Une variable qui en détermine une autre avec une corrélation d’exactement 0,0000000000, et un couple de variables dont chaque information mutuelle par paire avec la cible vaut exactement zéro alors que les deux ensemble la déterminent entièrement. Le filtrage univarié écarte les deux, et le second cas est celui qui compte : les variables qu’il supprime le sont parce qu’elles comptent.

3 min de lectureKudos AI

Prérequis : L’entropie et l’information

Deux colonnes de valeurs avec un nuage sans la moindre inclinaison, et à côté une table conjointe dont les cases ne sont manifestement pas le produit de ses marges.

Soit XX uniforme sur {−2,−1,1,2}\{-2, -1, 1, 2\} et Y=∣X∣Y = |X|. Connaître XX donne YY avec certitude. La corrélation entre les deux vaut

ρ(X,Y)=0.0000000000,\rho(X, Y) = 0.0000000000,

exactement, par symétrie. La corrélation mesure une chose : la part de YY qui varie linéairement avec XX. Ici, aucune, et pourtant tout est déterminé.

L’information mutuelle ne s’y laisse pas prendre :

H(X)=2 bits,H(Y)=1 bit,I(X;Y)=1 bit.H(X) = 2 \text{ bits}, \qquad H(Y) = 1 \text{ bit}, \qquad I(X;Y) = 1 \text{ bit}.

Connaître XX supprime toute l’incertitude sur YY. Cette partie de l’histoire est familière, et la conclusion habituelle est « utilisez l’information mutuelle plutôt que la corrélation ». C’est la seconde construction qui doit inquiéter, car l’information mutuelle n’en sauve pas non plus.

A. Trois variables, aucune paire informative

Soit AA et BB deux bits équitables indépendants et C=A⊕BC = A \oplus B, le ou exclusif. Toutes les informations mutuelles par paire :

I(A;B)=I(A;C)=I(B;C)=0.0000000000 bit.I(A;B) = I(A;C) = I(B;C) = 0.0000000000 \text{ bit}.

Deux quelconques des trois sont indépendantes. Regardez AA seul et CC ressemble à un tirage à pile ou face. Regardez BB seul et CC ressemble à un tirage à pile ou face. Pourtant

I(A,B ; C)=1 bit,I(A, B \,;\, C) = 1 \text{ bit},

c’est-à-dire tout CC. Le couple détermine entièrement la cible et aucun de ses deux membres n’en porte le moindre bit.

Ouvrez le second onglet de la figure, la paire qui se cache ensemble, pour ce couple XOR : chaque entrée seule porte 0 bit sur la cible, et le couple en porte 1.

Interactif : ce qu’un canal transporte, et ce qu’il ne récupère jamais

Exact, depuis la loi jointe. Aucun échantillonnage nulle part.

1 bit0.5
Bits par usage
0.5310
Après traitement
0.3199
Perdu au traitement
0.2111
Inversion composée
0.1800

Un canal qui inverse avec la probabilité 0.10 a raison 90 % du temps et ne transporte pourtant que 0.5310 bits par usage. L’exactitude et l’information ne sont pas la même monnaie. Faites passer la sortie dans un second canal à 0.10 : l’inversion composée vaut 0.1800 et il reste 0.3199 bits. Cela a baissé, et cela baissera toujours.

B. Ce que cela fait à la sélection de variables

La première étape standard sur un jeu de données large est le filtrage univarié : noter chaque variable face à la cible, garder les meilleures, modéliser celles-là. Corrélation, information mutuelle, AUC à une variable, test du khi-deux - peu importe laquelle, elles s’accordent toutes ici.

Sur les données XOR, toute méthode de filtrage note AA et BB à exactement zéro et les écarte toutes les deux. Un filtre gardant les 10 % meilleures parmi mille variables les écarterait ; un filtre gardant les 90 % meilleures les écarterait aussi. Elles ne sont pas près du seuil, elles sont au plancher.

Et cet échec n’est pas un coin rare. Toute variable qui agit par interaction y ressemble à un degré ou à un autre :

  • un médicament qui aide un génotype et nuit à un autre, sans effet principal
  • un réglage qui ne compte qu’au-dessus d’une température
  • la différence entre deux mesures dont aucune n’est informative seule
  • toute cible qui dépend d’une parité, d’un rapport, ou d’une correspondance entre deux champs

C. Que faire à la place

  • Filtrez avec un modèle capable de voir des paires. Un arbre boosté peu profond sur toutes les variables, noté par importance de permutation, trouve AA et BB immédiatement, car un arbre de profondeur deux représente XOR et une coupure unique ne le peut pas.
  • Filtrez par blocs plutôt qu’une à une, quand les variables ont une structure connue : les deux bouts d’une mesure, l’avant et l’après, le couple de champs qui sont comparés en aval.
  • Construisez l’interaction si vous en soupçonnez une. Une différence, un rapport ou un produit calculé avant le filtrage transforme un effet de paire en effet univarié, et se vérifie en une ligne.
  • Traitez « aucune variable n’était prédictive » comme une hypothèse, pas comme un résultat. La table XOR est à quoi ressemble cette conclusion quand elle est fausse.

L’énoncé général mérite d’être gardé sous la forme exacte que lui donnent les nombres. L’indépendance de chaque paire n’entraîne pas l’indépendance de l’ensemble : la loi conjointe de (A,B,C)(A, B, C) n’est pas le produit de ses marges alors même que toutes les marges à deux se factorisent. Toute procédure de filtrage qui note les variables une à une suppose le contraire.

Références et lectures complémentaires

  • Thomas M. Cover, Joy A. Thomas, Elements of Information Theory, Wiley (2nd edition), 2006· Bibliothèque de référence Kudos AI

Les œuvres protégées par le droit d’auteur sont citées à titre de référence uniquement et ne sont pas hébergées ici ; veuillez consulter l’éditeur pour y accéder.

Lecture associée

7 min de lectureInformation Theory

La borne qui est vraiment atteinte

L’entropie n’est pas un résumé de distribution mais un plancher que le meilleur code atteint à la dernière décimale, le supplément payé pour la mauvaise distribution est exactement la perte que tout classifieur minimise déjà, et l’information mutuelle pose un plafond dur sur tout ce qui suit un capteur. Trois résultats, chacun d’une netteté inhabituelle.

MathématiquesApprentissage automatique
4 min de lectureFondements des probabilités

Quelle mauvaise loi voulez-vous ?

Une cible bimodale, une gaussienne, et deux directions de la même divergence. Minimiser KL(P||Q) étale la gaussienne sur les deux modes avec presque aucune masse là où la cible se trouve réellement ; minimiser KL(Q||P) la pose sur un mode, à 0,6931 nats, soit ln 2 à quatre décimales, et ce n’est pas une coïncidence. Chaque ajustement est jugé catastrophique par l’autre critère, 2,0976 contre 15,2799.

Apprentissage automatiqueMathématiques
4 min de lectureStatistical Learning Theory

Le théorème qui ne dit rien de votre problème

Moyenné sur les 256 fonctions de trois bits vers un, un apprenant par plus proche voisin et un apprenant construit pour se tromper exprès obtiennent tous deux exactement 0,500000 hors échantillon d’apprentissage. C’est le théorème du « pas de repas gratuit », il est exactement vrai, et dès que la moyenne est restreinte aux six fonctions qui dépendent d’un seul bit, les deux se séparent à 0,333333 et 0,666667.

Apprentissage automatiqueMathématiques
← Retour à tous les articles