Tous les parcours
03Avancé14 modules · 30 h estimées

Data Science

Construire, évaluer et valider un modèle, des données à la décision

De la première droite de régression jusqu'à la validation croisée : apprends à construire un modèle, à l'évaluer honnêtement et à éviter les pièges, entièrement sur des données NBA.
Commencer gratuitementLe premier module est gratuit, sans inscription.

Modules

  1. 1

    Qu'est-ce que l'apprentissage automatique ?

    Gratuit

    Peut-on prédire les points d'un joueur à partir de ses tirs tentés, et estimer sa valeur ? Et d'abord, que veut dire « prédire » ? On oppose une règle de bon sens à un modèle appris, et on installe le réflexe d'évaluer sur des joueurs jamais vus.

    ≈ 45 minPython interactif
  2. 2

    Variables explicatives et cible

    Réservé aux abonnés

    Un front office veut estimer le salaire d'un joueur depuis son profil. Comment transformer poste, équipe, taille et box scores en un X que le modèle peut lire, sans se faire piéger par une fuite de données ?

    ≈ 50 minPython interactif
  3. 3

    Régression linéaire simple

    Réservé aux abonnés

    Combien vaut un point au marché des salaires NBA ? Une droite donne le tarif, et ses résidus dénoncent les rookies sous-payés et les vétérans surpayés.

    ≈ 55 minPython interactif
  4. 4

    Comment un modèle apprend

    Réservé aux abonnés

    D'où sortent vraiment la pente (1,47 million par point) et l'ordonnée à l'origine ? On les retrouve nous-mêmes, pas à pas, par la descente de gradient, et on découvre pourquoi mettre les stats à la même échelle change tout.

    ≈ 50 minPython interactif
  5. 5

    Régression linéaire multiple

    Réservé aux abonnés

    Qu'est-ce qui fait vraiment grimper le plus-minus d'un joueur : scorer, passer, défendre, protéger le ballon ? Et la surprise : son équipe pèse plus lourd que ses propres stats.

    ≈ 55 minPython interactif
  6. 6

    Évaluer une régression

    Réservé aux abonnés

    Notre modèle prédit le salaire d'un joueur à partir de ses stats. Mais de combien de millions se trompe-t-il, et se trompe-t-il autant sur un role player que sur une superstar ?

    ≈ 55 minPython interactif
  7. 7

    Généralisation et sur-apprentissage

    Réservé aux abonnés

    Notre modèle prédit 96 % des victoires des 30 équipes de 2026. Mais a-t-il appris à prédire le basket, ou juste mémorisé ces 30 équipes ? On le démasque en lui cachant des données.

    ≈ 55 minPython interactif
  8. 8

    Validation croisée

    Réservé aux abonnés

    Un rookie explose sur dix matchs : à quel point peut-on croire ce chiffre ? La validation croisée k-fold donne une estimation honnête de performance, avec sa marge.

    ≈ 55 minPython interactif
  9. 9

    Régression logistique

    Réservé aux abonnés

    Rien qu'avec les stats d'un joueur, peut-on deviner si son équipe est allée en playoffs ? La réponse tient dans une probabilité, pas dans un oui sec.

    ≈ 55 minPython interactif
  10. 10

    Évaluer un classifieur

    Réservé aux abonnés

    Un détecteur d'élite scoreur affiche 91 % d'exactitude sans repérer le moindre joueur. Pourquoi l'exactitude ment sur les événements rares, et comment juger un classifieur pour de vrai.

    ≈ 55 minPython interactif
  11. 11

    Régularisation : Ridge et Lasso

    Réservé aux abonnés

    Pour prédire le salaire d'un joueur, on dispose de dizaines de statistiques. Comment éviter que le modèle mémorise au lieu d'apprendre, et laisser le Lasso désigner seul les stats qui font vraiment un salaire NBA ?

    ≈ 55 minPython interactif
  12. 12

    Ingénierie des variables

    Réservé aux abonnés

    Une seule variable bien construite (l'interaction production × expérience) peut-elle battre dix colonnes brutes pour prédire un salaire NBA ? On le mesure en validation croisée.

    ≈ 55 minPython interactif
  13. 13

    Séries temporelles

    Réservé aux abonnés

    À la pause All-Star, combien de victoires reste-t-il à une équipe sur ses 42 derniers matchs, vu ses 40 premiers ? Tendance, forme glissante, et pourquoi la prévision naïve est si dure à battre.

    ≈ 55 minPython interactif
  14. 14

    Projet de synthèse : le flux data science de A à Z

    Réservé aux abonnés

    Prédire le salaire d'un joueur depuis son seul profil de jeu : cadrer, nettoyer, choisir la bonne mesure d'erreur, valider par validation croisée et conclure honnêtement, qui est sous-coté, où le modèle se trompe.

    ≈ 65 minPython interactif
Data Science · Malyaipfy