Aller au contenu
Kudos AI

Apprentissage automatique

Apprendre une fonction à partir de données. Méthodes supervisées et non supervisées, généralisation et surapprentissage, et la théorie qui dit quand l’apprentissage est seulement possible.

96 éléments

Parcours (14)

Apprentissage automatique supervisé

Démontrer les méthodes supervisées de référence au lieu de simplement les appeler : moindres carrés, régression logistique, pénalités de rétrécissement et ensembles d'arbres.

Apprentissage non supervisé

Trouver de la structure dans des données sans réponse à prédire, et en assumer la conséquence : sans y il n'y a pas d'erreur hors échantillon, et chaque choix doit donc être défendu autrement.

Machines à vecteurs de support

Classer en choisissant la bande la plus large qui sépare deux classes, puis l’assouplir pour que quelques points puissent s’y installer, et enfin la courber sans jamais construire l’espace dans lequel elle se courbe.

Au-delà de la linéarité

Gardez les moindres carrés et changez ce sur quoi vous régressez : des fonctions de base fixées achètent de la courbure, des contraintes achètent de la régularité, et une pénalité achète une courbe qui choisit elle-même sa souplesse.

Apprendre des modèles probabilistes

Quand les données sont complètes, apprendre un modèle probabiliste revient à compter - la dérivée de la log-vraisemblance fait le reste. Quand des variables sont cachées, il n’y a rien à compter, et le remède consiste à deviner les effectifs, réajuster, et recommencer jusqu’à ce que la vraisemblance cesse de monter.

Méthodes de classification comparées

Il existe un classifieur qu’aucune méthode ne peut battre, et il lui faut la réponse pour se construire. Tout le reste - plus proches voisins, analyse discriminante, régression logistique - est une supposition différente sur ce qu’il aurait fait, et les suppositions échouent dans des directions différentes.

Optimisation pour l’apprentissage

Tous les modèles de ce site sont ajustés par la même boucle : regarder la pente, faire un pas. Ce qui décide si cette boucle converge en quarante pas ou diverge en trois n’est pas le modèle - c’est la courbure, le bruit et la taille du pas. Les trois se mesurent avant la première époque.

Theorie statistique de l'apprentissage

Pourquoi ajuster un echantillon vous apprend quoi que ce soit sur le monde dont il provient, ce que mesure reellement la capacite d'une classe de modeles, et le theoreme selon lequel aucune methode n'est la meilleure partout - avec ce que ce theoreme ne dit pas.

Inference causale

Pourquoi une comparaison entre traites et non traites peut porter le mauvais signe, ce que la randomisation achete reellement, et la regle qui dit sur quelles variables ajuster - y compris celles qui degradent la reponse.

Séries temporelles

Ce qui casse quand les observations ne sont pas indépendantes : une régression qui trouve une relation entre deux séries sans rapport, des écarts-types faux d’un facteur connu, et une découpe de validation qui annonce un modèle plus de cinq fois meilleur qu’il ne l’est.

Théorie de l’information

Le seul endroit du domaine où une borne est atteinte exactement : l’entropie est la longueur minimale d’un code, le meilleur code l’atteint, et le supplément payé pour la mauvaise distribution est la fonction de perte que vous entraînez déjà.

Expérimentation et tests A/B

Ce que rapporte une expérience en ligne trop petite, consultée trop souvent ou lue sur trop de métriques : un effet gonflé 2,4 fois, un taux de faux positifs de 19 % au lieu de 5 %, et un segment vainqueur dans près de la moitié des expériences où il ne s’est rien passé.

Systèmes de recommandation

Deux décalages ajustés qui livrent les deux tiers du gain d’exactitude avant l’apprentissage du moindre facteur latent, un modèle 1,28 fois pire pour les utilisateurs qui lui ont le moins parlé, et l’angle mort qui s’ouvre quand un système ne voit jamais que les notes de ce qu’il a choisi de montrer.

Détection d’anomalies

Un détecteur qui ne se déclenche jamais obtient 99,5 % de justesse, une ROC de 0,9468 masque une file d’alertes fausse à 64 %, la distance à la moyenne se classe sous le hasard quand les anomalies siègent au centre, et vingt anomalies groupées se cachent les unes les autres de la méthode conçue pour les trouver.

Encyclopédie (41)

Descente de gradient

Un algorithme d’optimisation itératif qui minimise une fonction en avançant de façon répétée dans la direction opposée à son gradient.

Descente de gradient stochastique

Une descente de gradient où chaque pas utilise le gradient d’un petit échantillon aléatoire des données plutôt que de leur totalité, échangeant une direction exacte contre bien plus de pas par unité de calcul.

Conditionnement

Le rapport entre la plus grande et la plus petite courbure d’une surface de perte, qui détermine à lui seul la vitesse à laquelle la descente de gradient peut y converger.

Calendrier de taux d’apprentissage

Une règle qui fait varier la taille du pas au fil de l’entraînement : grand au début pour que l’exécution puisse voyager, petit à la fin pour qu’elle puisse se poser.

Surapprentissage

Situation où un modèle apprend le bruit et les particularités de ses données d’entraînement plutôt que la structure sous-jacente, si bien qu’il excelle à l’entraînement et échoue sur des données nouvelles.

Compromis biais-variance

La décomposition de l’erreur de prédiction espérée d’un modèle en biais, variance et bruit irréductible, et la tension par laquelle réduire l’un des deux premiers augmente généralement l’autre.

Validation croisée

Une méthode de rééchantillonnage qui estime l’erreur de test d’un modèle en l’ajustant à répétition sur une partie des données et en l’évaluant sur la partie mise de côté.

Régularisation

Toute technique qui contraint la complexité effective d’un modèle afin de réduire la variance et d’améliorer la généralisation, typiquement en pénalisant les grandes valeurs de paramètres.

Naïf de Bayes

Un classifieur qui applique le théorème de Bayes en supposant toutes les variables conditionnellement indépendantes étant donné la classe.

Entropie croisée

Une mesure de la différence entre deux distributions de probabilité, utilisée comme fonction de perte standard en classification.

Régression linéaire

Un modèle qui prédit une réponse numérique comme une somme pondérée des prédicteurs, ajusté en minimisant l’erreur quadratique.

Régression logistique

Un modèle de classification qui prédit la probabilité d’une classe en faisant passer une combinaison linéaire des prédicteurs par la fonction logistique.

Arbre de décision

Un modèle qui prédit en appliquant une suite de tests à seuil sur des variables isolées, divisant les données en groupes de plus en plus homogènes.

Bagging et forêts aléatoires

Des méthodes d’ensemble qui réduisent la variance en moyennant de nombreux modèles ajustés à des rééchantillons bootstrap, les forêts aléatoires décorrélant en outre les arbres en restreignant les variables disponibles à chaque division.

Spline

Un polynôme par morceaux raccordé en des points choisis appelés nœuds, contraint de sorte que la fonction et ses dérivées d’ordre inférieur y restent continues, ce qui donne une souplesse locale sans le comportement sauvage d’un polynôme de haut degré.

Machine à vecteurs de support

Un classifieur qui sépare les classes par la frontière laissant la plus large marge possible, déterminée par les seuls points d’entraînement les plus proches.

Partitionnement en k moyennes

Un algorithme non supervisé qui partitionne les observations en k groupes en alternant l’affectation des points au centroïde le plus proche et le recalcul des centroïdes.

Espérance–Maximisation

Une méthode itérative d’estimation par maximum de vraisemblance lorsque certaines variables ne sont pas observées : elle calcule la loi a posteriori des variables cachées sous les paramètres courants, puis réajuste les paramètres comme si ces effectifs espérés avaient été observés.

k plus proches voisins

Un classifieur non paramétrique qui prédit la classe d’un point par un vote majoritaire parmi les k observations d’entraînement les plus proches de lui.

Analyse discriminante linéaire

Un classifieur génératif qui modélise chaque classe par une gaussienne et retourne ces modèles par le théorème de Bayes ; une matrice de covariance partagée par toutes les classes donne une frontière linéaire, une par classe donne une frontière quadratique.

Courbe ROC

Un tracé du taux de vrais positifs d’un classifieur contre son taux de faux positifs à mesure que le seuil de décision balaie toute son étendue, résumant tous les arbitrages disponibles entre les deux types d’erreur.

Classification hiérarchique

Une méthode non supervisée qui construit un arbre de classes emboîtées en fusionnant à répétition les deux groupes les moins dissemblables, de sorte que couper l'arbre à n'importe quelle hauteur donne un regroupement.

Analyse en composantes principales

Une technique qui réexprime les données dans de nouvelles coordonnées non corrélées, ordonnées selon la variance que chacune explique, permettant de réduire la dimension en ne gardant que les premières.

Réseau de neurones

Un modèle composé de couches d’unités simples, chacune calculant une somme pondérée suivie d’une fonction non linéaire, ajusté par descente de gradient au moyen de la rétropropagation.

Préentraînement et affinage

La recette en deux temps consistant à entraîner d’abord un modèle sur un grand corpus générique, puis à l’adapter à une tâche précise avec un jeu de données étiquetées bien plus petit.

Apprentissage Q

Un algorithme d’apprentissage par renforcement qui apprend directement de l’expérience la valeur de chaque action dans chaque état, sans modèle de l’environnement.

Dimension de Vapnik-Chervonenkis

La taille du plus grand ensemble de points qu'une famille de classifieurs peut etiqueter de toutes les facons possibles. Elle mesure la capacite par ce qu'une classe sait faire plutot que par le nombre de ses membres, ce qui la rend utilisable pour des familles infinies.

Apprentissage PAC

Une definition de l'apprenabilite ou un algorithme doit renvoyer, avec forte probabilite, une hypothese dont l'erreur vraie reste dans une tolerance choisie - en utilisant un nombre d'echantillons borne a l'avance plutot que decouvert apres coup.

Facteur de confusion

Une variable qui influence a la fois le traitement et le resultat, de sorte qu'une comparaison entre traites et non traites mesure la difference entre les groupes autant que l'effet du traitement.

Graphe causal

Un dessin des relations de cause a effet supposees, sous forme de fleches entre variables, servant a decider quelles variables doivent etre ajustees et lesquelles ne doivent pas l'etre - question a laquelle les donnees seules ne repondent pas.

Stationnarité

Propriété d’une série dont le comportement statistique ne dépend pas du moment où on la regarde : la moyenne, la variance et la structure de corrélation sont les mêmes dans toutes les fenêtres. Presque toutes les méthodes classiques la supposent, et la plupart des séries réelles ne l’ont pas.

Autocorrélation

La corrélation d’une série avec une copie décalée d’elle-même, qui mesure combien de temps persiste l’influence d’une observation. C’est la structure qui rend les séries temporelles informatives et la raison pour laquelle les écarts-types usuels ne s’y appliquent pas.

Divergence de Kullback-Leibler

Le nombre de bits supplémentaires payés par symbole pour décrire une distribution avec un code construit pour une autre. Elle est nulle seulement quand les deux coïncident, jamais négative, et non symétrique : c’est un coût plutôt qu’une distance.

Information mutuelle

Le nombre de bits que l’observation d’une variable vous apprend sur une autre. Elle est nulle exactement quand les deux sont indépendantes, elle capte une dépendance de n’importe quelle forme et non seulement linéaire, et rien calculé en aval ne peut l’augmenter.

Comparaisons multiples

L’inflation des faux positifs qui survient dès que plus d’un test, d’une métrique, d’un segment ou d’un point d’arrêt peut produire le résultat annoncé. Chaque chance supplémentaire augmente la probabilité que quelque chose franchisse le seuil par pure chance.

Factorisation matricielle

Un modèle qui explique une table d’interactions creuse comme le produit de deux petites matrices, donnant à chaque utilisateur et à chaque article un court vecteur de traits appris dont le produit scalaire prédit les cases manquantes.

Softmax

Une fonction qui transforme un vecteur de scores réels en distribution de probabilité en exponentiant chaque score et en divisant par le total, ce qui préserve leur ordre tout en les rendant positifs et de somme un.

Perplexité

L’exponentielle de l’entropie croisée moyenne d’un modèle, lue comme le nombre d’options équiprobables entre lesquelles il choisit effectivement à chaque pas.

A priori conjugué

Un a priori choisi pour que l’a posteriori appartienne à la même famille, ce qui réduit la mise à jour bayésienne à de l’arithmétique sur les paramètres et rend l’a priori lisible comme un nombre d’observations imaginaires.

Précision et rappel

Deux taux qui séparent ce que l’exactitude masque : la précision est la part des positifs prédits qui sont réels, le rappel est la part des positifs réels qui ont été trouvés.

Détection d’anomalies

Trouver les rares observations qui n’ont pas été produites par le processus ayant produit les autres. La difficulté propre au domaine n’est pas l’algorithme mais le taux de base : à 0,5 % d’anomalies, un détecteur qui ne se déclenche jamais est juste à 99,5 %, et la plupart des métriques standard héritent de ce nombre au lieu de mesurer une compétence.

Articles (27)

Quelle mauvaise loi voulez-vous ?

Une cible bimodale, une gaussienne, et deux directions de la même divergence. Minimiser KL(P||Q) étale la gaussienne sur les deux modes avec presque aucune masse là où la cible se trouve réellement ; minimiser KL(Q||P) la pose sur un mode, à 0,6931 nats, soit ln 2 à quatre décimales, et ce n’est pas une coïncidence. Chaque ajustement est jugé catastrophique par l’autre critère, 2,0976 contre 15,2799.

Les deux variables qui ressemblent à du bruit

Une variable qui en détermine une autre avec une corrélation d’exactement 0,0000000000, et un couple de variables dont chaque information mutuelle par paire avec la cible vaut exactement zéro alors que les deux ensemble la déterminent entièrement. Le filtrage univarié écarte les deux, et le second cas est celui qui compte : les variables qu’il supprime le sont parce qu’elles comptent.

Le théorème qui ne dit rien de votre problème

Moyenné sur les 256 fonctions de trois bits vers un, un apprenant par plus proche voisin et un apprenant construit pour se tromper exprès obtiennent tous deux exactement 0,500000 hors échantillon d’apprentissage. C’est le théorème du « pas de repas gratuit », il est exactement vrai, et dès que la moyenne est restreinte aux six fonctions qui dépendent d’un seul bit, les deux se séparent à 0,333333 et 0,666667.

La direction la plus lente impose le rythme

Le pas que vous avez le droit de prendre est fixé par la direction la plus raide et le nombre de pas nécessaires par la plus plate : le coût de la descente de gradient est donc leur rapport. Le même ajustement des moindres carrés, aux mêmes dix décimales, demande 1742 pas dans une base, 147 dans une base remise à l’échelle et exactement 1 dans une base orthonormée, et l’inertie ne rachète que la racine carrée du rapport.

La direction qui change quand vous changez d’unité

Douze personnes, deux mesures, et trois premières composantes principales différentes : en millimètres la réponse est presque uniquement la taille, en mètres presque uniquement le poids, et en centimètres un mélange équilibré - la corrélation restant fixée à 0,9500 dans les trois cas. Ce que cela dit de ce que l’ACP maximise, pourquoi une proportion de variance expliquée de 99,999 % peut être un énoncé sur les mètres plutôt que sur les personnes, et ce que la standardisation choisit réellement.

Un paramètre, une capacité infinie

Un classifieur à un seul paramètre réel réalise les 1 048 576 étiquetages de vingt points, à chaque fois, et prédit un vingt et unième avec une exactitude de 0,5038 sur vingt mille essais. Compter les paramètres ne borne la capacité d’une classe de modèles ni par le haut ni par le bas, et c’est pourquoi la capacité doit se mesurer autrement.

Un score qui perd contre ne rien faire

Un modèle des cinq plus proches voisins obtient 0,9983 en validation croisée aléatoire à cinq blocs sur une marche aléatoire, série dont les incréments sont par construction imprévisibles. Évalué en avançant dans le temps il obtient 0,6559, avec une RMSE 12,44 fois plus grande, et il perd contre la simple reconduction de la dernière valeur observée. C’est la découpe, non le modèle, qui a produit le premier nombre.

Ce qui fait vraiment converger un entraînement

Deux pour cent d’écart sur le taux d’apprentissage séparent une exécution convergée d’une autre à cinq ordres de grandeur, un conditionnement prédit le taux de convergence à six décimales, et la descente de gradient stochastique à pas fixe ne converge jamais - elle se stabilise dans une boule dont le rayon croît comme la racine carrée du pas. Chaque chiffre a été calculé sur un problème dont l’optimum exact est connu.

Le détecteur qui ne se déclenche jamais est juste à 99,5 %

À un taux de base réaliste, le détecteur inerte gagne sur la justesse, une ROC de 0,9468 masque une file d’alertes fausse à 64 %, la distance à la moyenne se classe sous le hasard quand les anomalies siègent au centre, et vingt anomalies groupées se cachent les unes les autres de la méthode conçue pour les trouver.

Pourquoi apprendre à partir de données fonctionne

L'écart entre l'erreur mesurée et l'erreur subie, pourquoi choisir la meilleure de mille hypothèses identiques la fait paraître 0,1149 meilleure que le hasard, comment se compte la capacité d'une classe infinie, et le théorème qui égalise tous les apprenants - avec l'hypothèse qui le rend vrai.

Le traitement qui aide tout le monde et nuit à la moyenne

Un traitement qui augmente la guérison d'exactement cinq points dans chaque sous-groupe tout en semblant l'abaisser globalement, pourquoi plus de données rend cette conclusion plus assurée et non plus juste, ce que la randomisation achète et que l'ajustement ne peut pas, et le cas où contrôler une variable fabrique une association à partir de rien.

La régression qui trouve une relation qui n’existe pas

Deux séries engendrées à partir de nombres aléatoires distincts ressortent significativement liées dans 82,8 % des cas, un écart-type sur données dépendantes est trop étroit d’un facteur calculable de 2,4, et la découpe de validation habituelle annonce un prévisionniste plus de cinq fois meilleur qu’il ne l’est. Trois échecs, une seule cause, et les vérifications qui attrapent chacun d’eux.

Le modèle qui choisit ses propres données d’entraînement

Deux décalages ajustés livrent 66 % du gain d’exactitude d’un recommandeur avant l’apprentissage du moindre facteur latent, l’erreur est 1,28 fois pire pour les utilisateurs qui ont le moins parlé, seuls 30 % du catalogue atteignent le top dix de qui que ce soit sans aucun terme explicite de popularité, et après six tours de données auto-sélectionnées le système est 1,14 fois pire exactement là où il a cessé de regarder.

L’expérience qui allait gagner de toute façon

Un test de 2 000 utilisateurs par bras rapporte des effets 2,4 fois trop grands. Un test A/A consulté dix fois ressort significatif 19 % du temps. Vingt métriques nulles indépendantes produisent un vainqueur 64 % du temps, et douze segments nuls 46 %. Quatre nombres, une seule cause, et les décisions à prendre avant l’arrivée des données.

La borne qui est vraiment atteinte

L’entropie n’est pas un résumé de distribution mais un plancher que le meilleur code atteint à la dernière décimale, le supplément payé pour la mauvaise distribution est exactement la perte que tout classifieur minimise déjà, et l’information mutuelle pose un plafond dur sur tout ce qui suit un capteur. Trois résultats, chacun d’une netteté inhabituelle.

Comparer les classifieurs, et ce que l’exactitude dissimule

Le classifieur de Bayes que rien ne peut battre et le plancher d’erreur qu’il laisse, les k plus proches voisins comme imitation non paramétrique avec k pour bouton de flexibilité, l’analyse discriminante et pourquoi une covariance partagée impose une droite, et la matrice de confusion, les seuils et la courbe ROC qu’un unique chiffre d’exactitude dissimule - chaque nombre calculé sur des données simulées où l’optimum est connu.

Machines à vecteurs de support : marges et noyaux

Pourquoi la bande la plus large entre deux classes est une bonne frontière, pourquoi en exiger une parfaite est contre-productif, comment un budget de violations rachète de la stabilité, et comment un noyau courbe la frontière en travaillant dans un espace qu’il n’a jamais à construire.

Au-delà de la linéarité : splines et modèles additifs

Comment ajuster des relations courbes sans quitter les moindres carrés : les fonctions de base, les contraintes qui transforment un polynôme par morceaux cassé en une spline, l’unique colonne supplémentaire par nœud qui les impose gratuitement, et la pénalité de rugosité qui laisse une courbe choisir sa propre souplesse.

Apprentissage non supervisé : de la structure sans étiquettes

Ce qui change quand il n’y a pas de réponse à prédire : les composantes principales comme direction de variance maximale, les K-moyennes et les optima locaux où elles se figent, la classification hiérarchique et le saut qui décide de la réponse - et pourquoi aucun des choix requis ne peut être validé comme l’est un classifieur.

Qu’est-ce que l’apprentissage statistique ?

Le cadre commun à tout modèle prédictif : estimer une fonction inconnue f à partir des données, la séparation entre erreur réductible et irréductible, et pourquoi prédiction et inférence tirent dans des directions opposées.

L’apprentissage par renforcement et le Q-learning

Apprendre à bien agir sans modèle du monde : mises à jour par différence temporelle, la règle du Q-learning, exploration contre exploitation, et une exécution qui retrouve l’optimum planifié à partir de la seule expérience.

Le compromis biais-variance

La décomposition exacte de l’erreur de test espérée en biais au carré, variance et bruit irréductible, démontrée numériquement par une simulation de 2 000 tirages où les trois termes sont mesurés séparément et vérifiés comme s’additionnant.

La validation croisée et le rééchantillonnage

Pourquoi l’erreur d’entraînement est une estimation biaisée de l’erreur de test, et comment l’ensemble de validation, le leave-one-out et le k-fold y remédient, avec une LOOCV à cinq observations calculée point par point.

La régression linéaire à partir des premiers principes

Dériver les coefficients des moindres carrés en différenciant la somme des carrés des résidus, puis mener à la main un ajustement complet sur cinq observations : coefficients, valeurs ajustées, résidus, RSS et R², chacun vérifié numériquement.

La régression logistique et la classification

Pourquoi une droite ne peut pas modéliser une probabilité, comment la fonction logistique y remédie, et ce que signifient les coefficients en log-cotes, avec un pas de montée de gradient et un ajustement convergé calculés et vérifiés numériquement.

La régularisation : ridge et lasso

Ajouter une pénalité sur la taille des coefficients pour échanger un peu de biais contre une forte réduction de variance, et pourquoi la pénalité L1 annule exactement des coefficients quand L2 se contente de les rétrécir, les deux ajustées numériquement.

Les arbres de décision et les ensembles

Comment la division binaire récursive construit un arbre, pourquoi l’indice de Gini bat le taux d’erreur comme critère de division, et comment le bagging et les forêts aléatoires transforment un apprenant à forte variance en un apprenant puissant, avec l’arithmétique d’une division déroulée.

Outils (3)

Jeux de données (4)

Recherche (6)

The Perceptron: A Perceiving and Recognizing Automaton

Introduit le perceptron, une unité entraînable qui calcule une somme pondérée de ses entrées et s’active si la somme dépasse un seuil, avec une règle d’ajustement des poids à partir d’exemples étiquetés.

Classification and Regression Trees

Établit la méthodologie CART : faire croître un arbre de décision en choisissant récursivement la division qui améliore le plus la pureté des nœuds, puis l’élaguer à l’aide de données mises de côté.

Learning Internal Representations by Error Propagation

Présente la rétropropagation comme méthode générale d’entraînement des réseaux multicouches, en montrant que les couches cachées peuvent apprendre des représentations internes utiles au lieu de devoir être conçues à la main.

Models of Delayed Reinforcement Learning

Développe le Q-learning, un algorithme qui estime directement la valeur de chaque action dans chaque état à partir de l’expérience, sans exiger de modèle des probabilités de transition de l’environnement.

Support-Vector Networks

Introduit la machine à vecteurs de support à marge souple, qui sépare les classes par la marge la plus large possible tout en autorisant des violations bornées, et utilise des noyaux pour obtenir des frontières non linéaires.

Bagging Predictors

Introduit l’agrégation bootstrap : ajuster un modèle sur de nombreux rééchantillons bootstrap des données d’entraînement et moyenner les prédictions, ce qui réduit la variance sans augmenter le biais.

Projets (1)

Thèmes liés