Probabilité
Le langage du raisonnement dans l’incertitude : variables aléatoires, lois, conditionnement, et les règles qui transforment une information partielle en une croyance défendable.
Parcours (7)
Fondements des probabilités et de la statistique
Raisonner rigoureusement sur l'incertitude, puis aborder le problème central de l'apprentissage : séparer l'erreur que l'on peut supprimer de celle que l'on ne peut pas.
Apprentissage par renforcement
Bien agir quand les issues sont incertaines : l'equation de Bellman et comment la resoudre, puis ce qui change lorsque l'environnement est inconnu et que l'agent doit apprendre par la seule experience.
Raisonnement probabiliste avec les réseaux bayésiens
Représenter une loi jointe sur de nombreuses variables par un graphe et une poignée de petites tables, puis y répondre aux requêtes exactement quand la structure le permet et par échantillonnage quand elle ne le permet pas.
Raisonnement probabiliste dans le temps
Suivre un monde qui change pendant que vous l'observez à travers un capteur bruité : les deux hypothèses qui rendent le problème traitable, les récursions progressive et rétrograde qui répondent à toute requête sur le passé et le présent, et l'algorithme distinct qu'exige l'histoire la plus probable.
Décider dans l’incertitude
Combinez ce que vous croyez et ce que vous voulez : l’utilité espérée comme critère, la courbe qui explique pourquoi des gens sensés refusent des paris favorables, et un prix de l’information qui reste nul tant qu’elle ne vous fait pas changer d’avis.
Décider sous observabilité partielle
Un agent qui ne voit pas dans quel état il se trouve doit agir sur une distribution à la place. Cette distribution est, elle, toujours observable, ce qui ramène le problème à un MDP - sur un espace continu, où les algorithmes exacts ne se referment pas.
Inférence statistique
Ce qu'un échantillon peut et ne peut pas dire de la population qui l'a produit : comment un estimateur se trompe, ce qu'un intervalle de confiance promet réellement, et ce qu'est une valeur p - avec les trois endroits où chacun est couramment lu comme quelque chose de plus fort qu'il n'est.
Encyclopédie (16)
Théorème de Bayes
Une règle de mise à jour de la probabilité d’une hypothèse à la lumière d’un indice nouveau, par inversion d’une probabilité conditionnelle.
Naïf de Bayes
Un classifieur qui applique le théorème de Bayes en supposant toutes les variables conditionnellement indépendantes étant donné la classe.
Réseau bayésien
Un graphe orienté acyclique dont les nœuds sont des variables aléatoires et dont les arêtes expriment une influence directe, avec une table de probabilités conditionnelles à chaque nœud, qui définissent ensemble une loi jointe complète comme un produit de facteurs locaux.
Entropie
Une mesure de l’incertitude d’une variable aléatoire, égale au nombre moyen de bits nécessaires pour encoder son issue.
Estimation par maximum de vraisemblance
Une méthode d’ajustement d’un modèle qui choisit les valeurs de paramètres rendant les données observées les plus probables.
Modèle de Markov caché
Un modèle temporel dans lequel une unique variable d’état discrète évolue comme une chaîne de Markov et émet une observation par pas de temps, si bien que l’état doit être inféré à partir d’un indicateur bruité plutôt qu’observé directement.
État de croyance
La loi de probabilité qu’un agent entretient sur les états où il pourrait se trouver, compte tenu de tout ce qu’il a fait et perçu - ce sur quoi il peut agir quand l’état lui-même est caché.
MDP partiellement observable
Un processus de décision markovien dans lequel l’agent ne peut pas observer son état directement, mais seulement des perceptions bruitées de celui-ci - résolu en principe en traitant la distribution sur les états comme l’état d’un MDP ordinaire, totalement observable.
Processus de décision markovien
Un modèle formel de prise de décision séquentielle dont les issues sont en partie aléatoires, défini par des états, des actions, des probabilités de transition et des récompenses.
Utilité espérée
La moyenne des utilités des issues possibles d’une action, pondérée par leurs probabilités, et la quantité qu’un agent rationnel maximise lorsqu’il choisit quoi faire dans l’incertitude.
Valeur p
La probabilité d’observer des données au moins aussi extrêmes que celles dont on dispose, calculée en supposant l’hypothèse nulle vraie. Elle mesure à quel point l’échantillon serait inhabituel dans un monde où l’effet est absent, et rien d’autre.
Intervalle de confiance
Un intervalle calculé à partir des données par une procédure qui, répétée sur de nombreux échantillons, contient la vraie valeur une proportion annoncée du temps. Cette proportion est une propriété de la procédure, non d’un intervalle particulier qu’elle produit.
Puissance statistique
La probabilité qu’un test rejette l’hypothèse nulle lorsqu’une alternative précise est vraie. C’est la chance de détecter un effet réellement présent, et elle est fixée par le protocole avant toute collecte de données.
Filtre de Kalman
L’algorithme de filtrage exact pour un état continu qui évolue linéairement avec un bruit gaussien et qui est mesuré linéairement avec un bruit gaussien, la croyance entière tenant dans une moyenne et une variance.
Algorithme de Viterbi
Un algorithme de programmation dynamique qui trouve l’unique séquence d’états cachés la plus probable étant donné une séquence d’observations, en propageant le meilleur chemin vers chaque état plutôt que la probabilité totale de l’atteindre.
A priori conjugué
Un a priori choisi pour que l’a posteriori appartienne à la même famille, ce qui réduit la mise à jour bayésienne à de l’arithmétique sur les paramètres et rend l’a priori lisible comme un nombre d’observations imaginaires.
Articles (12)
La semaine qui n’a pas pu avoir lieu
Prenez l’état le plus probable chaque jour, écrivez-les dans l’ordre, et vous obtenez un rapport auquel le modèle attribue une probabilité exactement nulle : sur un exemple de surveillance de machine sur quatre jours, la réponse jour par jour est sain, sain, en panne, en panne, et passer de sain à en panne est une transition impossible. Ce que sont réellement les deux questions, pourquoi le lissage et Viterbi n’y répondent pas de la même manière, et ce que signifie la probabilité a posteriori de 0,411 du meilleur chemin pour qui doit décider.
Cent mille échantillons, quatre cents qui comptent
Sur le réseau du cambriolage avec les deux voisins qui appellent, l’échantillonnage par rejet garde 183 tirages sur 100 000 et la pondération par vraisemblance les garde tous pour une taille d’échantillon efficace de 396. Les deux estimations s’écartent d’environ 10 % d’une probabilité a posteriori de 0,284172, et la raison se calcule exactement : 252 échantillons portent 76 % du poids et 99,975 % du poids au carré.
Ce qu'un échantillon peut et ne peut pas vous dire
Les estimateurs comme variables aléatoires dotées de leur propre distribution, le cas où l'estimateur sans biais est le moins bon, ce qu'un intervalle de confiance promet réellement et l'intervalle standard qui délivre 87 % là où il en annonce 95, et ce dont une valeur p est la probabilité - chaque chiffre calculé exactement ou par simulation à graine fixée.
Apprendre les nombres d’un modèle probabiliste
D’où viennent réellement les nombres d’un réseau bayésien ou d’une gaussienne : la recette en trois temps du maximum de vraisemblance déroulée sur des paramètres discrets puis continus, l’a priori Beta qui répare ce qu’elle fait d’un événement jamais vu, Bayes naïf et l’unique effectif nul qui le détruit, et l’algorithme EM pour le cas où les effectifs ne peuvent pas être relevés du tout - chaque chiffre calculé plutôt qu’affirmé.
Agir quand on ne voit pas l’état
Ce qui change quand un agent reçoit des perceptions bruitées au lieu de son état : l’état de croyance qui le remplace et la mise à jour par filtrage qui le maintient, la réduction exacte d’un POMDP à un MDP sur les croyances, la fonction de valeur linéaire par morceaux et convexe qui rend cette réduction calculable en principe, et les raisons mesurées pour lesquelles elle ne l’est pas en pratique - avec le point fixe de la croyance, les vecteurs alpha et la fonction de valeur calculés et non affirmés.
Les décisions dans l’incertitude : utilité et information
Pourquoi il peut être rationnel de refuser un pari dont la valeur monétaire espérée est positive, ce que mesure la courbure d’une fonction d’utilité, et comment donner un prix à une observation avant de l’acheter - y compris dans le cas fréquent où le prix honnête est nul.
Raisonner sur un monde qui change
Comment deux hypothèses de Markov transforment un historique non borné en deux petites tables, les récursions progressive et rétrograde qui répondent à toute question sur le présent et le passé, pourquoi la séquence la plus probable exige un algorithme à elle seule, et ce qui change quand l’état est un nombre réel plutôt qu’une liste.
Réseaux bayésiens et inférence probabiliste
Comment un graphe et quelques petites tables tiennent lieu d’une loi jointe à des milliers d’entrées, comment y répondre exactement à une requête par énumération et élimination de variables, et que faire quand l’inférence exacte est hors de portée : échantillonnage par rejet, pondération par vraisemblance et échantillonnage de Gibbs, chacun travaillé sur les deux mêmes réseaux.
Les probabilités à partir de zéro : le langage de l’incertitude
Construire les probabilités depuis la base : les mondes possibles, l’univers, les deux axiomes fondamentaux, puis les règles d’addition et de multiplication, chacune démontrée plutôt qu’affirmée, avec des exemples numériques résolus.
L’entropie et l’information
Mesurer l’incertitude en bits : l’entropie de Shannon et pourquoi le logarithme est en base 2, le gain d’information déroulé sur une division, et comment l’entropie croisée et la divergence de Kullback-Leibler se rattachent à l’entropie et aux fonctions de perte qui entraînent les classifieurs.
Le théorème de Bayes et la mise à jour des croyances
Démontrer le théorème de Bayes à partir de la définition de la probabilité conditionnelle, puis résoudre deux fois l’exemple du taux de base qui trompe presque tout le monde : une fois avec la formule, une fois par simple dénombrement.
Les processus de décision markoviens
Comment planifier quand les actions ne font pas fiablement ce qu’on veut : états, modèle de transition, récompenses et actualisation, l’équation de Bellman, et l’itération sur les valeurs menée numériquement jusqu’à son point fixe.
Outils (5)
Calculateur de taux de base
Saisissez une prévalence, une sensibilité et un taux de faux positifs pour voir ce que vaut réellement un test positif - en probabilité et en nombre de personnes sur dix mille.
Calculateur d’entropie et d’information
Modifiez deux distributions côte à côte et lisez l’entropie, l’entropie croisée et la divergence KL en bits, avec l’identité H(p, q) = H(p) + KL(p ‖ q) affichée en permanence.
Simulateur d’intervalles de confiance
Tirez trente échantillons, formez un intervalle de confiance pour chacun et comptez ceux qui couvrent la vérité - la façon la plus claire de voir que le niveau de confiance décrit la procédure, pas un intervalle isolé.
Explorateur de distributions
Changez les paramètres des distributions qui reviennent sans cesse dans le contenu et observez la forme, la moyenne et la dispersion réagir.
Explorateur du maximum de vraisemblance
Déplacez un paramètre le long de la courbe de log-vraisemblance d’un échantillon fixe et voyez la distribution ajustée suivre, le sommet se trouvant exactement à l’estimateur du maximum de vraisemblance.
Jeux de données (2)
Défauts de carte de crédit (simulé)
Un ensemble simulé de titulaires de cartes servant à introduire la classification - et une illustration nette de la façon dont l’exactitude induit en erreur sur des événements rares.
Mouvements quotidiens du S&P 500
Variations quotidiennes en pourcentage du S&P 500 de 2001 à 2005 - un problème de classification délibérément difficile où la réponse honnête est « à peine mieux que le hasard ».
Recherche (2)
A Mathematical Theory of Communication
Définit quantitativement l’information, introduit l’entropie comme mesure de l’incertitude d’une source, et démontre des limites à la compression sans perte et à la transmission fiable sur un canal bruité.
Games with Incomplete Information Played by Bayesian Players
Montre comment des jeux où les joueurs sont incertains des gains les uns des autres peuvent être transformés en jeux à information complète mais imparfaite, en dotant chaque joueur d’un « type » tiré au sort.
Projets (2)
Gridworld RL Lab
Itération sur la valeur, itération sur la politique et Q-learning sur le même monde en grille, pour comparer directement un planificateur qui connaît le modèle à un apprenant qui l’ignore.
Bayesian Inference Playground
Mise à jour du prior au posterior avec familles conjuguées, accompagnée d’un explorateur d’entropie et de divergence KL qui mesure ce que chaque observation a réellement appris.