Aller au contenu
Kudos AI

Étiquetés « intermediate »

46 articles.

4 min de lectureFondements des probabilités

Quelle mauvaise loi voulez-vous ?

Une cible bimodale, une gaussienne, et deux directions de la même divergence. Minimiser KL(P||Q) étale la gaussienne sur les deux modes avec presque aucune masse là où la cible se trouve réellement ; minimiser KL(Q||P) la pose sur un mode, à 0,6931 nats, soit ln 2 à quatre décimales, et ce n’est pas une coïncidence. Chaque ajustement est jugé catastrophique par l’autre critère, 2,0976 contre 15,2799.

Apprentissage automatiqueMathématiques
5 min de lectureRaisonnement probabiliste

La semaine qui n’a pas pu avoir lieu

Prenez l’état le plus probable chaque jour, écrivez-les dans l’ordre, et vous obtenez un rapport auquel le modèle attribue une probabilité exactement nulle : sur un exemple de surveillance de machine sur quatre jours, la réponse jour par jour est sain, sain, en panne, en panne, et passer de sain à en panne est une transition impossible. Ce que sont réellement les deux questions, pourquoi le lissage et Viterbi n’y répondent pas de la même manière, et ce que signifie la probabilité a posteriori de 0,411 du meilleur chemin pour qui doit décider.

Intelligence artificielleProbabilité
3 min de lectureFondements des probabilités

Les deux variables qui ressemblent à du bruit

Une variable qui en détermine une autre avec une corrélation d’exactement 0,0000000000, et un couple de variables dont chaque information mutuelle par paire avec la cible vaut exactement zéro alors que les deux ensemble la déterminent entièrement. Le filtrage univarié écarte les deux, et le second cas est celui qui compte : les variables qu’il supprime le sont parce qu’elles comptent.

Apprentissage automatiqueMathématiques
4 min de lectureStatistical Learning Theory

Le théorème qui ne dit rien de votre problème

Moyenné sur les 256 fonctions de trois bits vers un, un apprenant par plus proche voisin et un apprenant construit pour se tromper exprès obtiennent tous deux exactement 0,500000 hors échantillon d’apprentissage. C’est le théorème du « pas de repas gratuit », il est exactement vrai, et dès que la moyenne est restreinte aux six fonctions qui dépendent d’un seul bit, les deux se séparent à 0,333333 et 0,666667.

Apprentissage automatiqueMathématiques
5 min de lectureRéseaux de neurones

La direction la plus lente impose le rythme

Le pas que vous avez le droit de prendre est fixé par la direction la plus raide et le nombre de pas nécessaires par la plus plate : le coût de la descente de gradient est donc leur rapport. Le même ajustement des moindres carrés, aux mêmes dix décimales, demande 1742 pas dans une base, 147 dans une base remise à l’échelle et exactement 1 dans une base orthonormée, et l’inertie ne rachète que la racine carrée du rapport.

Apprentissage automatiqueMathématiques
5 min de lectureApprentissage par renforcement

Le paramètre que personne ne choisit

La récompense de survie d’un monde en grille est écrite une fois et jamais discutée, et la politique optimale en est une fonction en escalier : huit seuils entre -3 et 0, chacun retournant exactement une case. La valeur classique de -0,04 se trouve à 0,0048 de celle qui décide si l’agent prend le raccourci le long du puits, et au-dessus de -0,0221, quand les pas ne coûtent presque rien, le mouvement optimal dans un coin consiste à foncer volontairement dans un mur.

Intelligence artificielle
5 min de lectureRecherche et jeux

Le correctif qui a changé le taux de succès bien plus que le coût

Autoriser les déplacements latéraux fait passer l’escalade sur les 8 reines de 14,75 % de parties résolues à 94,55 %, ce qui se lit comme une amélioration d’un facteur six et n’en est pas une : avec redémarrages aléatoires, le coût attendu d’une solution passe de 21,9 à 23,1 pas, et, compté en coups évalués, il baisse de 16 %, de 1 547 à 1 298. Le recuit simulé résout 98,8 % et coûte 1 622 évaluations. Ce qui a changé, c’est surtout la statistique, pas le travail.

Intelligence artificielle
6 min de lectureApprentissage non supervisé

La direction qui change quand vous changez d’unité

Douze personnes, deux mesures, et trois premières composantes principales différentes : en millimètres la réponse est presque uniquement la taille, en mètres presque uniquement le poids, et en centimètres un mélange équilibré - la corrélation restant fixée à 0,9500 dans les trois cas. Ce que cela dit de ce que l’ACP maximise, pourquoi une proportion de variance expliquée de 99,999 % peut être un énoncé sur les mètres plutôt que sur les personnes, et ce que la standardisation choisit réellement.

Apprentissage automatiqueStatistique
4 min de lectureCausal Inférence

La variable de contrôle qui invente une relation

Deux causes indépendantes et un effet commun. Contrôlez l’effet et les causes acquièrent une corrélation d’exactement -1 : une régression de A sur B donne un coefficient de +0,0030, et ajouter l’effet commun comme contrôle le transforme en -1,0000. La sélection d’un échantillon fait la même chose de manière invisible, et c’est pourquoi « contrôlez tout ce que vous avez mesuré » n’est pas une règle défendable.

Statistique
4 min de lectureStatistical Inference

L’intervalle à 95 % qui couvre 81 % du temps

L’intervalle de confiance classique pour une proportion a une couverture exacte que l’on calcule en sommant sur les n+1 échantillons possibles, et à n = 30 avec p = 0,10 elle vaut 0,8085 au lieu de 0,95. La couverture ne s’améliore pas de façon monotone avec n, et dans un contexte d’événements rares elle peut tomber à 0,0392. Deux solutions d’une ligne corrigent cela.

Statistique
5 min de lectureStatistical Learning Theory

Un paramètre, une capacité infinie

Un classifieur à un seul paramètre réel réalise les 1 048 576 étiquetages de vingt points, à chaque fois, et prédit un vingt et unième avec une exactitude de 0,5038 sur vingt mille essais. Compter les paramètres ne borne la capacité d’une classe de modèles ni par le haut ni par le bas, et c’est pourquoi la capacité doit se mesurer autrement.

Apprentissage automatiqueMathématiques
4 min de lectureTime Series

Un score qui perd contre ne rien faire

Un modèle des cinq plus proches voisins obtient 0,9983 en validation croisée aléatoire à cinq blocs sur une marche aléatoire, série dont les incréments sont par construction imprévisibles. Évalué en avançant dans le temps il obtient 0,6559, avec une RMSE 12,44 fois plus grande, et il perd contre la simple reconduction de la dernière valeur observée. C’est la découpe, non le modèle, qui a produit le premier nombre.

StatistiqueApprentissage automatique
4 min de lectureLogique et connaissances

Un million de clauses, ou soixante et une

Convertir une formule courte en forme normale conjonctive par distribution donne 1 048 576 clauses et 20 971 520 littéraux ; nommer les sous-formules en donne 61 et 160, soit un facteur 131 072 sur les littéraux, et ne perd rien du tout : les deux ont le même nombre de modèles, vérifié par énumération. C’est le codage, et non le solveur, qui décide du sort d’un problème de satisfiabilité.

Intelligence artificielleMathématiques
4 min de lectureRaisonnement probabiliste

Cent mille échantillons, quatre cents qui comptent

Sur le réseau du cambriolage avec les deux voisins qui appellent, l’échantillonnage par rejet garde 183 tirages sur 100 000 et la pondération par vraisemblance les garde tous pour une taille d’échantillon efficace de 396. Les deux estimations s’écartent d’environ 10 % d’une probabilité a posteriori de 0,284172, et la raison se calcule exactement : 252 échantillons portent 76 % du poids et 99,975 % du poids au carré.

Intelligence artificielleProbabilité
11 min de lectureRéseaux de neurones

Ce qui fait vraiment converger un entraînement

Deux pour cent d’écart sur le taux d’apprentissage séparent une exécution convergée d’une autre à cinq ordres de grandeur, un conditionnement prédit le taux de convergence à six décimales, et la descente de gradient stochastique à pas fixe ne converge jamais - elle se stabilise dans une boule dont le rayon croît comme la racine carrée du pas. Chaque chiffre a été calculé sur un problème dont l’optimum exact est connu.

OptimisationApprentissage profondApprentissage automatique
8 min de lectureAnomaly Detection

Le détecteur qui ne se déclenche jamais est juste à 99,5 %

À un taux de base réaliste, le détecteur inerte gagne sur la justesse, une ROC de 0,9468 masque une file d’alertes fausse à 64 %, la distance à la moyenne se classe sous le hasard quand les anomalies siègent au centre, et vingt anomalies groupées se cachent les unes les autres de la méthode conçue pour les trouver.

Apprentissage automatiqueStatistique
8 min de lectureCausal Inférence

Le traitement qui aide tout le monde et nuit à la moyenne

Un traitement qui augmente la guérison d'exactement cinq points dans chaque sous-groupe tout en semblant l'abaisser globalement, pourquoi plus de données rend cette conclusion plus assurée et non plus juste, ce que la randomisation achète et que l'ajustement ne peut pas, et le cas où contrôler une variable fabrique une association à partir de rien.

StatistiqueApprentissage automatique
9 min de lectureTime Series

La régression qui trouve une relation qui n’existe pas

Deux séries engendrées à partir de nombres aléatoires distincts ressortent significativement liées dans 82,8 % des cas, un écart-type sur données dépendantes est trop étroit d’un facteur calculable de 2,4, et la découpe de validation habituelle annonce un prévisionniste plus de cinq fois meilleur qu’il ne l’est. Trois échecs, une seule cause, et les vérifications qui attrapent chacun d’eux.

StatistiqueApprentissage automatique
8 min de lectureRecommender Systems

Le modèle qui choisit ses propres données d’entraînement

Deux décalages ajustés livrent 66 % du gain d’exactitude d’un recommandeur avant l’apprentissage du moindre facteur latent, l’erreur est 1,28 fois pire pour les utilisateurs qui ont le moins parlé, seuls 30 % du catalogue atteignent le top dix de qui que ce soit sans aucun terme explicite de popularité, et après six tours de données auto-sélectionnées le système est 1,14 fois pire exactement là où il a cessé de regarder.

Apprentissage automatiqueStatistique
8 min de lectureExperimentation

L’expérience qui allait gagner de toute façon

Un test de 2 000 utilisateurs par bras rapporte des effets 2,4 fois trop grands. Un test A/A consulté dix fois ressort significatif 19 % du temps. Vingt métriques nulles indépendantes produisent un vainqueur 64 % du temps, et douze segments nuls 46 %. Quatre nombres, une seule cause, et les décisions à prendre avant l’arrivée des données.

StatistiqueApprentissage automatique
7 min de lectureInformation Theory

La borne qui est vraiment atteinte

L’entropie n’est pas un résumé de distribution mais un plancher que le meilleur code atteint à la dernière décimale, le supplément payé pour la mauvaise distribution est exactement la perte que tout classifieur minimise déjà, et l’information mutuelle pose un plafond dur sur tout ce qui suit un capteur. Trois résultats, chacun d’une netteté inhabituelle.

MathématiquesApprentissage automatique
11 min de lectureStatistical Inference

Ce qu'un échantillon peut et ne peut pas vous dire

Les estimateurs comme variables aléatoires dotées de leur propre distribution, le cas où l'estimateur sans biais est le moins bon, ce qu'un intervalle de confiance promet réellement et l'intervalle standard qui délivre 87 % là où il en annonce 95, et ce dont une valeur p est la probabilité - chaque chiffre calculé exactement ou par simulation à graine fixée.

StatistiqueProbabilité
11 min de lectureRaisonnement probabiliste

Apprendre les nombres d’un modèle probabiliste

D’où viennent réellement les nombres d’un réseau bayésien ou d’une gaussienne : la recette en trois temps du maximum de vraisemblance déroulée sur des paramètres discrets puis continus, l’a priori Beta qui répare ce qu’elle fait d’un événement jamais vu, Bayes naïf et l’unique effectif nul qui le détruit, et l’algorithme EM pour le cas où les effectifs ne peuvent pas être relevés du tout - chaque chiffre calculé plutôt qu’affirmé.

ProbabilitéStatistiqueIntelligence artificielle
11 min de lectureApprentissage supervisé

Comparer les classifieurs, et ce que l’exactitude dissimule

Le classifieur de Bayes que rien ne peut battre et le plancher d’erreur qu’il laisse, les k plus proches voisins comme imitation non paramétrique avec k pour bouton de flexibilité, l’analyse discriminante et pourquoi une covariance partagée impose une droite, et la matrice de confusion, les seuils et la courbe ROC qu’un unique chiffre d’exactitude dissimule - chaque nombre calculé sur des données simulées où l’optimum est connu.

Apprentissage automatiqueStatistique
7 min de lectureMachines à vecteurs de support

Machines à vecteurs de support : marges et noyaux

Pourquoi la bande la plus large entre deux classes est une bonne frontière, pourquoi en exiger une parfaite est contre-productif, comment un budget de violations rachète de la stabilité, et comment un noyau courbe la frontière en travaillant dans un espace qu’il n’a jamais à construire.

Apprentissage automatiqueOptimisation
7 min de lectureApprentissage supervisé

Au-delà de la linéarité : splines et modèles additifs

Comment ajuster des relations courbes sans quitter les moindres carrés : les fonctions de base, les contraintes qui transforment un polynôme par morceaux cassé en une spline, l’unique colonne supplémentaire par nœud qui les impose gratuitement, et la pénalité de rugosité qui laisse une courbe choisir sa propre souplesse.

Apprentissage automatiqueStatistique
7 min de lectureDécisions séquentielles et apprentissage par renforcement

Les décisions dans l’incertitude : utilité et information

Pourquoi il peut être rationnel de refuser un pari dont la valeur monétaire espérée est positive, ce que mesure la courbure d’une fonction d’utilité, et comment donner un prix à une observation avant de l’acheter - y compris dans le cas fréquent où le prix honnête est nul.

Intelligence artificielleProbabilité
7 min de lectureRecherche et jeux

La planification classique : schémas, relaxations et graphes

Pourquoi la planification reçoit sa propre représentation au lieu d’être une note de bas de page de la recherche, comment supprimer des morceaux de la description d’une action produit une heuristique gratuitement, et ce qu’un graphe de planification remarque que les heuristiques but par but manquent systématiquement.

Intelligence artificielleRecherche et planification
9 min de lectureRaisonnement probabiliste

Réseaux bayésiens et inférence probabiliste

Comment un graphe et quelques petites tables tiennent lieu d’une loi jointe à des milliers d’entrées, comment y répondre exactement à une requête par énumération et élimination de variables, et que faire quand l’inférence exacte est hors de portée : échantillonnage par rejet, pondération par vraisemblance et échantillonnage de Gibbs, chacun travaillé sur les deux mêmes réseaux.

ProbabilitéIntelligence artificielle
8 min de lectureApprentissage non supervisé

Apprentissage non supervisé : de la structure sans étiquettes

Ce qui change quand il n’y a pas de réponse à prédire : les composantes principales comme direction de variance maximale, les K-moyennes et les optima locaux où elles se figent, la classification hiérarchique et le saut qui décide de la réponse - et pourquoi aucun des choix requis ne peut être validé comme l’est un classifieur.

Apprentissage automatiqueStatistique
10 min de lectureConstruire un modèle de langue

L’architecture du transformeur

Assembler un GPT à partir de l’attention : projections multi-têtes, normalisation de couche déroulée à la main, pourquoi les connexions de raccourci sauvent le gradient, l’expansion x4 du réseau à propagation avant, et un décompte de paramètres qui reproduit exactement les 124 millions de GPT-2 small.

IA générativeApprentissage profondTraitement du langage naturel
10 min de lectureLogique et connaissances

La logique et la représentation des connaissances

Raisonner sur ce qui doit être vrai : modèles et conséquence logique déroulés par énumération exhaustive, correction et complétude, pourquoi la logique propositionnelle épuise son pouvoir expressif, et là où la logique du premier ordre prend le relais.

Représentation des connaissancesIntelligence artificielle
11 min de lectureRéseaux de neurones

Les réseaux convolutifs pour la vision

La convolution définie proprement, un détecteur de contours de Sobel déroulé à la main sur une image 5x5, pourquoi faire glisser un petit noyau sur une image bat une couche dense de cinq ordres de grandeur en paramètres, et ce qui a changé quand les noyaux ont cessé d’être conçus pour être appris.

Apprentissage profondVision par ordinateur
10 min de lectureFondements des probabilités

L’entropie et l’information

Mesurer l’incertitude en bits : l’entropie de Shannon et pourquoi le logarithme est en base 2, le gain d’information déroulé sur une division, et comment l’entropie croisée et la divergence de Kullback-Leibler se rattachent à l’entropie et aux fonctions de perte qui entraînent les classifieurs.

Théorie de l'informationProbabilitéMathématiques
10 min de lectureApprentissage par renforcement

L’apprentissage par renforcement et le Q-learning

Apprendre à bien agir sans modèle du monde : mises à jour par différence temporelle, la règle du Q-learning, exploration contre exploitation, et une exécution qui retrouve l’optimum planifié à partir de la seule expérience.

Apprentissage par renforcementApprentissage automatiqueIntelligence artificielle
7 min de lectureFondements de l’apprentissage statistique

Le compromis biais-variance

La décomposition exacte de l’erreur de test espérée en biais au carré, variance et bruit irréductible, démontrée numériquement par une simulation de 2 000 tirages où les trois termes sont mesurés séparément et vérifiés comme s’additionnant.

StatistiqueApprentissage automatiqueMathématiques
9 min de lectureApprentissage par renforcement

Les processus de décision markoviens

Comment planifier quand les actions ne font pas fiablement ce qu’on veut : états, modèle de transition, récompenses et actualisation, l’équation de Bellman, et l’itération sur les valeurs menée numériquement jusqu’à son point fixe.

Apprentissage par renforcementProbabilitéIntelligence artificielle
7 min de lectureFondements de l’apprentissage statistique

La validation croisée et le rééchantillonnage

Pourquoi l’erreur d’entraînement est une estimation biaisée de l’erreur de test, et comment l’ensemble de validation, le leave-one-out et le k-fold y remédient, avec une LOOCV à cinq observations calculée point par point.

StatistiqueApprentissage automatique
7 min de lectureApprentissage supervisé

La régression linéaire à partir des premiers principes

Dériver les coefficients des moindres carrés en différenciant la somme des carrés des résidus, puis mener à la main un ajustement complet sur cinq observations : coefficients, valeurs ajustées, résidus, RSS et R², chacun vérifié numériquement.

StatistiqueApprentissage automatiqueMathématiques
8 min de lectureApprentissage supervisé

La régression logistique et la classification

Pourquoi une droite ne peut pas modéliser une probabilité, comment la fonction logistique y remédie, et ce que signifient les coefficients en log-cotes, avec un pas de montée de gradient et un ajustement convergé calculés et vérifiés numériquement.

StatistiqueApprentissage automatiqueOptimisation
7 min de lectureApprentissage supervisé

La régularisation : ridge et lasso

Ajouter une pénalité sur la taille des coefficients pour échanger un peu de biais contre une forte réduction de variance, et pourquoi la pénalité L1 annule exactement des coefficients quand L2 se contente de les rétrécir, les deux ajustées numériquement.

StatistiqueApprentissage automatiqueOptimisation
8 min de lectureApprentissage supervisé

Les arbres de décision et les ensembles

Comment la division binaire récursive construit un arbre, pourquoi l’indice de Gini bat le taux d’erreur comme critère de division, et comment le bagging et les forêts aléatoires transforment un apprenant à forte variance en un apprenant puissant, avec l’arithmétique d’une division déroulée.

Apprentissage automatiqueStatistique
8 min de lectureRéseaux de neurones

La rétropropagation et la descente de gradient

Comment un réseau de neurones apprend : la perte comme fonction des poids, la descente de gradient, et la rétropropagation comme règle de dérivation en chaîne appliquée à rebours, avec toutes les dérivées partielles d’un petit réseau calculées à la main et vérifiées contre autograd.

Apprentissage profondOptimisationMathématiques
8 min de lectureConstruire un modèle de langue

L’attention et l’auto-attention

Requêtes, clés et valeurs construites depuis la base : pourquoi l’attention existe, comment se calcule l’attention par produit scalaire mis à l’échelle, pourquoi elle est divisée par la racine carrée de la dimension, et comment fonctionne le masquage causal, avec chaque matrice calculée et vérifiée.

IA générativeApprentissage profondTraitement du langage naturel
7 min de lectureRecherche et jeux

La recherche adversariale et le minimax

Comment un programme joue contre un adversaire qui cherche à le battre : la valeur minimax, pourquoi l’élagage alpha-bêta atteint la même réponse en examinant moins de nœuds, et un arbre de jeu élagué coup par coup.

Intelligence artificielleRecherche et planificationThéorie des jeux
8 min de lectureRecherche et jeux

La théorie des jeux et l’équilibre de Nash

Le raisonnement stratégique quand les joueurs ne sont pas strictement opposés : stratégies dominantes, le dilemme du prisonnier déroulé depuis sa matrice de gains, l’équilibre de Nash, l’optimalité de Pareto, et pourquoi équilibre et efficacité peuvent s’opposer.

Théorie des jeuxIntelligence artificielleMathématiques