Encyclopédie
Une référence concise et interconnectée. Chaque entrée renvoie aux concepts liés et aux articles qui approfondissent.
Parcourir par sujet
A
A priori conjugué
Un a priori choisi pour que l’a posteriori appartienne à la même famille, ce qui réduit la mise à jour bayésienne à de l’arithmétique sur les paramètres et rend l’a priori lisible comme un nombre d’observations imaginaires.
Algorithme de Viterbi
Un algorithme de programmation dynamique qui trouve l’unique séquence d’états cachés la plus probable étant donné une séquence d’observations, en propageant le meilleur chemin vers chaque état plutôt que la probabilité totale de l’atteindre.
Analyse discriminante linéaire
Un classifieur génératif qui modélise chaque classe par une gaussienne et retourne ces modèles par le théorème de Bayes ; une matrice de covariance partagée par toutes les classes donne une frontière linéaire, une par classe donne une frontière quadratique.
Analyse en composantes principales
Une technique qui réexprime les données dans de nouvelles coordonnées non corrélées, ordonnées selon la variance que chacune explique, permettant de réduire la dimension en ne gardant que les premières.
Apprentissage PAC
Une definition de l'apprenabilite ou un algorithme doit renvoyer, avec forte probabilite, une hypothese dont l'erreur vraie reste dans une tolerance choisie - en utilisant un nombre d'echantillons borne a l'avance plutot que decouvert apres coup.
Apprentissage Q
Un algorithme d’apprentissage par renforcement qui apprend directement de l’expérience la valeur de chaque action dans chaque état, sans modèle de l’environnement.
Arbre de décision
Un modèle qui prédit en appliquant une suite de tests à seuil sur des variables isolées, divisant les données en groupes de plus en plus homogènes.
Auto-attention
Un mécanisme qui permet à chaque position d’une séquence de prêter attention à toutes les autres, chaque sortie étant une somme pondérée de valeurs dont les poids viennent de la similarité entre requêtes et clés.
Autocorrélation
La corrélation d’une série avec une copie décalée d’elle-même, qui mesure combien de temps persiste l’influence d’une observation. C’est la structure qui rend les séries temporelles informatives et la raison pour laquelle les écarts-types usuels ne s’y appliquent pas.
B
C
Calendrier de taux d’apprentissage
Une règle qui fait varier la taille du pas au fil de l’entraînement : grand au début pour que l’exécution puisse voyager, petit à la fin pour qu’elle puisse se poser.
Classification hiérarchique
Une méthode non supervisée qui construit un arbre de classes emboîtées en fusionnant à répétition les deux groupes les moins dissemblables, de sorte que couper l'arbre à n'importe quelle hauteur donne un regroupement.
Cohérence d’arc
Une propriété d’un problème de contraintes où chaque valeur de chaque domaine possède au moins une valeur de soutien dans chaque domaine voisin, et l’algorithme qui l’impose en supprimant celles qui n’en ont pas.
Comparaisons multiples
L’inflation des faux positifs qui survient dès que plus d’un test, d’une métrique, d’un segment ou d’un point d’arrêt peut produire le résultat annoncé. Chaque chance supplémentaire augmente la probabilité que quelque chose franchisse le seuil par pure chance.
Compromis biais-variance
La décomposition de l’erreur de prédiction espérée d’un modèle en biais, variance et bruit irréductible, et la tension par laquelle réduire l’un des deux premiers augmente généralement l’autre.
Conditionnement
Le rapport entre la plus grande et la plus petite courbure d’une surface de perte, qui détermine à lui seul la vitesse à laquelle la descente de gradient peut y converger.
Courbe ROC
Un tracé du taux de vrais positifs d’un classifieur contre son taux de faux positifs à mesure que le seuil de décision balaie toute son étendue, résumant tous les arbitrages disponibles entre les deux types d’erreur.
D
Descente de gradient
Un algorithme d’optimisation itératif qui minimise une fonction en avançant de façon répétée dans la direction opposée à son gradient.
Descente de gradient stochastique
Une descente de gradient où chaque pas utilise le gradient d’un petit échantillon aléatoire des données plutôt que de leur totalité, échangeant une direction exacte contre bien plus de pas par unité de calcul.
Détection d’anomalies
Trouver les rares observations qui n’ont pas été produites par le processus ayant produit les autres. La difficulté propre au domaine n’est pas l’algorithme mais le taux de base : à 0,5 % d’anomalies, un détecteur qui ne se déclenche jamais est juste à 99,5 %, et la plupart des métriques standard héritent de ce nombre au lieu de mesurer une compétence.
Dilemme du prisonnier
Un jeu où chaque joueur dispose d’une stratégie dominante, et où le fait que tous deux la jouent produit un résultat pire pour chacun que la coopération mutuelle.
Dimension de Vapnik-Chervonenkis
La taille du plus grand ensemble de points qu'une famille de classifieurs peut etiqueter de toutes les facons possibles. Elle mesure la capacite par ce qu'une classe sait faire plutot que par le nombre de ses membres, ce qui la rend utilisable pour des familles infinies.
Divergence de Kullback-Leibler
Le nombre de bits supplémentaires payés par symbole pour décrire une distribution avec un code construit pour une autre. Elle est nulle seulement quand les deux coïncident, jamais négative, et non symétrique : c’est un coût plutôt qu’une distance.
E
Entropie
Une mesure de l’incertitude d’une variable aléatoire, égale au nombre moyen de bits nécessaires pour encoder son issue.
Entropie croisée
Une mesure de la différence entre deux distributions de probabilité, utilisée comme fonction de perte standard en classification.
Espérance–Maximisation
Une méthode itérative d’estimation par maximum de vraisemblance lorsque certaines variables ne sont pas observées : elle calcule la loi a posteriori des variables cachées sous les paramètres courants, puis réajuste les paramètres comme si ces effectifs espérés avaient été observés.
Estimation par maximum de vraisemblance
Une méthode d’ajustement d’un modèle qui choisit les valeurs de paramètres rendant les données observées les plus probables.
É
Équation de Bellman
La condition de cohérence selon laquelle l’utilité d’un état égale sa récompense immédiate plus la valeur actualisée de la meilleure action disponible, moyennée sur les issues que cette action ne contrôle pas.
Équilibre de Nash
Une combinaison de stratégies, une par joueur, telle qu’aucun joueur ne peut améliorer son résultat en changeant seul de stratégie.
État de croyance
La loi de probabilité qu’un agent entretient sur les états où il pourrait se trouver, compte tenu de tout ce qu’il a fait et perçu - ce sur quoi il peut agir quand l’état lui-même est caché.
F
Facteur de confusion
Une variable qui influence a la fois le traitement et le resultat, de sorte qu'une comparaison entre traites et non traites mesure la difference entre les groupes autant que l'effet du traitement.
Factorisation matricielle
Un modèle qui explique une table d’interactions creuse comme le produit de deux petites matrices, donnant à chaque utilisateur et à chaque article un court vecteur de traits appris dont le produit scalaire prédit les cases manquantes.
Filtre de Kalman
L’algorithme de filtrage exact pour un état continu qui évolue linéairement avec un bruit gaussien et qui est mesuré linéairement avec un bruit gaussien, la croyance entière tenant dans une moyenne et une variance.
Fonction d’activation
La fonction non linéaire appliquée à la sortie d’une couche, sans laquelle un réseau de profondeur quelconque se réduirait à une unique transformation linéaire.
G
Graphe causal
Un dessin des relations de cause a effet supposees, sous forme de fleches entre variables, servant a decider quelles variables doivent etre ajustees et lesquelles ne doivent pas l'etre - question a laquelle les donnees seules ne repondent pas.
Graphe de planification
Une structure en couches alternant niveaux de littéraux et niveaux d’actions, annotée de liens d’exclusion mutuelle, qui borne en temps polynomial ce qu’un problème de planification peut atteindre à une étape donnée.
I
Information mutuelle
Le nombre de bits que l’observation d’une variable vous apprend sur une autre. Elle est nulle exactement quand les deux sont indépendantes, elle capte une dépendance de n’importe quelle forme et non seulement linéaire, et rien calculé en aval ne peut l’augmenter.
Intervalle de confiance
Un intervalle calculé à partir des données par une procédure qui, répétée sur de nombreux échantillons, contient la vraie valeur une proportion annoncée du temps. Cette proportion est une propriété de la procédure, non d’un intervalle particulier qu’elle produit.
K
L
M
Machine à vecteurs de support
Un classifieur qui sépare les classes par la frontière laissant la plus large marge possible, déterminée par les seuls points d’entraînement les plus proches.
MDP partiellement observable
Un processus de décision markovien dans lequel l’agent ne peut pas observer son état directement, mais seulement des perceptions bruitées de celui-ci - résolu en principe en traitant la distribution sur les états comme l’état d’un MDP ordinaire, totalement observable.
Minimax
Une règle de décision pour les jeux à somme nulle à deux joueurs, où chacun choisit le coup qui maximise son pire résultat face à une opposition optimale.
Modèle de Markov caché
Un modèle temporel dans lequel une unique variable d’état discrète évolue comme une chaîne de Markov et émet une observation par pas de temps, si bien que l’état doit être inféré à partir d’un indicateur bruité plutôt qu’observé directement.
N
P
Partitionnement en k moyennes
Un algorithme non supervisé qui partitionne les observations en k groupes en alternant l’affectation des points au centroïde le plus proche et le recalcul des centroïdes.
Perplexité
L’exponentielle de l’entropie croisée moyenne d’un modèle, lue comme le nombre d’options équiprobables entre lesquelles il choisit effectivement à chaque pas.
Planification automatique
Trouver une suite d’actions qui atteint un but, où les états sont des ensembles de fluents instanciés et les actions des schémas ne décrivant que ce qu’elles changent.
Précision et rappel
Deux taux qui séparent ce que l’exactitude masque : la précision est la part des positifs prédits qui sont réels, le rappel est la part des positifs réels qui ont été trouvés.
Préentraînement et affinage
La recette en deux temps consistant à entraîner d’abord un modèle sur un grand corpus générique, puis à l’adapter à une tâche précise avec un jeu de données étiquetées bien plus petit.
Problème de satisfaction de contraintes
Un problème énoncé comme un ensemble de variables, un domaine de valeurs permises pour chacune, et des contraintes restreignant les combinaisons de valeurs qui peuvent être prises simultanément, de sorte qu’un solveur générique puisse raisonner sur sa structure sans aucune connaissance du domaine.
Processus de décision markovien
Un modèle formel de prise de décision séquentielle dont les issues sont en partie aléatoires, défini par des états, des actions, des probabilités de transition et des récompenses.
Puissance statistique
La probabilité qu’un test rejette l’hypothèse nulle lorsqu’une alternative précise est vraie. C’est la chance de détecter un effet réellement présent, et elle est fixée par le protocole avant toute collecte de données.
R
Recherche A*
Une recherche en graphe du meilleur d’abord qui développe le nœud minimisant la somme du coût déjà engagé et d’une estimation du coût restant.
Régression linéaire
Un modèle qui prédit une réponse numérique comme une somme pondérée des prédicteurs, ajusté en minimisant l’erreur quadratique.
Régression logistique
Un modèle de classification qui prédit la probabilité d’une classe en faisant passer une combinaison linéaire des prédicteurs par la fonction logistique.
Régularisation
Toute technique qui contraint la complexité effective d’un modèle afin de réduire la variance et d’améliorer la généralisation, typiquement en pénalisant les grandes valeurs de paramètres.
Réseau bayésien
Un graphe orienté acyclique dont les nœuds sont des variables aléatoires et dont les arêtes expriment une influence directe, avec une table de probabilités conditionnelles à chaque nœud, qui définissent ensemble une loi jointe complète comme un produit de facteurs locaux.
Réseau de neurones
Un modèle composé de couches d’unités simples, chacune calculant une somme pondérée suivie d’une fonction non linéaire, ajusté par descente de gradient au moyen de la rétropropagation.
Réseau de neurones convolutif
Un réseau de neurones qui applique des filtres appris sur toute l’étendue spatiale d’une entrée, en partageant les poids pour que le même motif soit détecté où qu’il se trouve.
Rétropropagation
L’algorithme qui calcule le gradient de la perte d’un réseau de neurones par rapport à chaque poids, en appliquant la règle de dérivation en chaîne à rebours à travers le réseau.
S
Softmax
Une fonction qui transforme un vecteur de scores réels en distribution de probabilité en exponentiant chaque score et en divisant par le total, ce qui préserve leur ordre tout en les rendant positifs et de somme un.
Spline
Un polynôme par morceaux raccordé en des points choisis appelés nœuds, contraint de sorte que la fonction et ses dérivées d’ordre inférieur y restent continues, ce qui donne une souplesse locale sans le comportement sauvage d’un polynôme de haut degré.
Stationnarité
Propriété d’une série dont le comportement statistique ne dépend pas du moment où on la regarde : la moyenne, la variance et la structure de corrélation sont les mêmes dans toutes les fenêtres. Presque toutes les méthodes classiques la supposent, et la plupart des séries réelles ne l’ont pas.
Stratégie dominante
Une stratégie qui donne un meilleur résultat qu’une autre quoi que fassent les autres joueurs, et une stratégie dominante si elle bat toutes les alternatives.
Stratégie mixte
Une stratégie qui choisit parmi les actions disponibles selon une distribution de probabilité plutôt qu’en en retenant une de façon déterministe.
Surapprentissage
Situation où un modèle apprend le bruit et les particularités de ses données d’entraînement plutôt que la structure sous-jacente, si bien qu’il excelle à l’entraînement et échoue sur des données nouvelles.
T
Théorème de Bayes
Une règle de mise à jour de la probabilité d’une hypothèse à la lumière d’un indice nouveau, par inversion d’une probabilité conditionnelle.
Tokenisation
Le découpage du texte en unités discrètes sur lesquelles un modèle de langue opère réellement, typiquement des fragments de sous-mots plutôt que des mots entiers.
Transformeur
Une architecture neuronale bâtie sur un empilement de couches d’auto-attention et de couches à propagation avant, qui a remplacé la récurrence comme standard de la modélisation de séquences.
U
V
Valeur p
La probabilité d’observer des données au moins aussi extrêmes que celles dont on dispose, calculée en supposant l’hypothèse nulle vraie. Elle mesure à quel point l’échantillon serait inhabituel dans un monde où l’effet est absent, et rien d’autre.
Validation croisée
Une méthode de rééchantillonnage qui estime l’erreur de test d’un modèle en l’ajustant à répétition sur une partie des données et en l’évaluant sur la partie mise de côté.