Data Science
Construire, évaluer et valider un modèle, des données à la décision
De la première droite de régression jusqu'à la validation croisée : apprends à construire un modèle, à l'évaluer honnêtement et à éviter les pièges, entièrement sur des données NBA.
Modules
- 1
Qu'est-ce que l'apprentissage automatique ?
GratuitPeut-on prédire les points d'un joueur à partir de ses tirs tentés, et estimer sa valeur ? Et d'abord, que veut dire « prédire » ? On oppose une règle de bon sens à un modèle appris, et on installe le réflexe d'évaluer sur des joueurs jamais vus.
≈ 45 minPython interactif - 2
Variables explicatives et cible
Un front office veut estimer le salaire d'un joueur depuis son profil. Comment transformer poste, équipe, taille et box scores en un X que le modèle peut lire, sans se faire piéger par une fuite de données ?
≈ 50 minPython interactif - 3
Régression linéaire simple
Combien vaut un point au marché des salaires NBA ? Une droite donne le tarif, et ses résidus dénoncent les rookies sous-payés et les vétérans surpayés.
≈ 55 minPython interactif - 4
Comment un modèle apprend
D'où sortent vraiment la pente (1,47 million par point) et l'ordonnée à l'origine ? On les retrouve nous-mêmes, pas à pas, par la descente de gradient, et on découvre pourquoi mettre les stats à la même échelle change tout.
≈ 50 minPython interactif - 5
Régression linéaire multiple
Qu'est-ce qui fait vraiment grimper le plus-minus d'un joueur : scorer, passer, défendre, protéger le ballon ? Et la surprise : son équipe pèse plus lourd que ses propres stats.
≈ 55 minPython interactif - 6
Évaluer une régression
Notre modèle prédit le salaire d'un joueur à partir de ses stats. Mais de combien de millions se trompe-t-il, et se trompe-t-il autant sur un role player que sur une superstar ?
≈ 55 minPython interactif - 7
Généralisation et sur-apprentissage
Notre modèle prédit 96 % des victoires des 30 équipes de 2026. Mais a-t-il appris à prédire le basket, ou juste mémorisé ces 30 équipes ? On le démasque en lui cachant des données.
≈ 55 minPython interactif - 8
Validation croisée
Un rookie explose sur dix matchs : à quel point peut-on croire ce chiffre ? La validation croisée k-fold donne une estimation honnête de performance, avec sa marge.
≈ 55 minPython interactif - 9
Régression logistique
Rien qu'avec les stats d'un joueur, peut-on deviner si son équipe est allée en playoffs ? La réponse tient dans une probabilité, pas dans un oui sec.
≈ 55 minPython interactif - 10
Évaluer un classifieur
Un détecteur d'élite scoreur affiche 91 % d'exactitude sans repérer le moindre joueur. Pourquoi l'exactitude ment sur les événements rares, et comment juger un classifieur pour de vrai.
≈ 55 minPython interactif - 11
Régularisation : Ridge et Lasso
Pour prédire le salaire d'un joueur, on dispose de dizaines de statistiques. Comment éviter que le modèle mémorise au lieu d'apprendre, et laisser le Lasso désigner seul les stats qui font vraiment un salaire NBA ?
≈ 55 minPython interactif - 12
Ingénierie des variables
Une seule variable bien construite (l'interaction production × expérience) peut-elle battre dix colonnes brutes pour prédire un salaire NBA ? On le mesure en validation croisée.
≈ 55 minPython interactif - 13
Séries temporelles
À la pause All-Star, combien de victoires reste-t-il à une équipe sur ses 42 derniers matchs, vu ses 40 premiers ? Tendance, forme glissante, et pourquoi la prévision naïve est si dure à battre.
≈ 55 minPython interactif - 14
Projet de synthèse : le flux data science de A à Z
Prédire le salaire d'un joueur depuis son seul profil de jeu : cadrer, nettoyer, choisir la bonne mesure d'erreur, valider par validation croisée et conclure honnêtement, qui est sous-coté, où le modèle se trompe.
≈ 65 minPython interactif