Partir des probabilités et finir capable d’énoncer précisément ce qu’un modèle estime, pourquoi il ne peut pas être parfait, et comment mesurer honnêtement son erreur.
Étape 1
Raisonner sur l’incertitude
Univers, les deux axiomes, et les règles d’addition et de multiplication, puis l’inversion d’une conditionnelle par Bayes et le constat de la façon dont les taux de base trompent l’intuition.
Parcours: Fondements des probabilités et de la statistique · 130 min de leçons
Lectures: probability from zero, bayes theorem and belief updating
ProbabilitéMathématiques
Étape 2
Lire un échantillon honnêtement
Ce qu’une estimation dit et ne dit pas de la population qui la sous-tend : le biais contre la variance, ce qu’un intervalle de confiance promet sur la procédure plutôt que sur votre intervalle, et de quoi une p-value est la probabilité.
Parcours: Inférence statistique · 85 min de leçons
Lectures: what a sample can and cannot tell you
StatistiqueProbabilité
Étape 3
Respecter l’ordre des données
Ce qui casse quand les lignes ne sont pas indépendantes : une régression qui trouve une relation entre deux séries sans rapport, un écart-type trop étroit d’un facteur calculable, et la découpe de validation qui mesure l’interpolation au lieu de la prévision.
Parcours: Séries temporelles · 85 min de leçons
Lectures: the regression that finds a relationship that is not there
StatistiqueApprentissage automatique
Étape 4
Distinguer une cause d’une corrélation
Pourquoi une comparaison entre traités et non traités peut porter le mauvais signe, ce que la randomisation achète et que l’ajustement ne peut pas, et la règle décidant des variables à contrôler, y compris celles qui fabriquent du biais.
Parcours: Inference causale · 80 min de leçons
Lectures: the treatment that helps everyone and harms the average
StatistiqueApprentissage automatique
Étape 5
Savoir pourquoi tout cela généralise
Ce que rapporte vraiment un score d’entraînement, la mesure de capacité qui survit à une classe d’hypothèses infinie, et le théorème de moyenne qui chiffre les hypothèses que tout apprenant doit faire.
Parcours: Theorie statistique de l'apprentissage · 85 min de leçons
Lectures: why learning from data works at all
Apprentissage automatiqueMathématiques
Étape 6
Mener une expérience à laquelle on peut croire
Dimensionner un test avant son départ, l’exagération que rapporte un test sous-dimensionné, les faux vainqueurs produits par les coups d’œil, les métriques et les segments supplémentaires, et le passage d’un effet mesuré à une décision.
Parcours: Expérimentation et tests A/B · 85 min de leçons
Lectures: the experiment that was going to win anyway
StatistiqueApprentissage automatique
Étape 7
Mesurer l’information elle-même
L’entropie comme longueur minimale d’un code plutôt que comme résumé, le supplément payé pour la mauvaise distribution qui se révèle être la perte que vous minimisez déjà, et le plafond que l’information mutuelle pose sur tout ce qui suit une variable.
Parcours: Théorie de l’information · 85 min de leçons
Lectures: the bound that is actually reached
MathématiquesApprentissage automatique
Étape 8
Poser le problème d’apprentissage
Le cadre Y = f(X) + e, la séparation entre erreur réductible et irréductible, et la décision de savoir si vous faites de la prédiction ou de l’inférence.
Lectures: what is statistical learning
StatistiqueApprentissage automatique
Étape 9
Mesurer l’erreur honnêtement
La décomposition biais-variance exacte, et l’usage de la validation croisée en k blocs pour estimer l’erreur de test à partir des données dont vous disposez déjà.
Lectures: the bias variance tradeoff, cross validation and resampling
StatistiqueApprentissage automatique
Les plans d’étude sont l’ordonnancement propre à ce site, non le programme officiel d’une quelconque institution.