← Parcours
🤖

Machine Learning classique

Intermédiaire
🧠Comprendre en lisant n'est pas savoir écrire.🧠Un module est fini quand tu peux le reproduire fenêtre fermée.🧠Écris le problème en français avant d'écrire du code.🧠Une question impossible cache trois questions faciles.🧠Retape le code à la main. Puis referme et réécris-le.🧠Essaie d'abord, cherche ensuite.🧠Cherche « comment on écrit ça », jamais « qu'est-ce que je dois faire ».🧠Pour comprendre du code, casse-le.⌨️Une fonction qui plante sur un cas limite n'est pas finie.⌨️Si un bloc a un nom clair, il mérite d'être une fonction.⌨️Savoir lire une erreur vaut plus que connaître dix méthodes.⌨️Diagnostiquer, c'est éliminer dans l'ordre — pas essayer au hasard.⌨️Une optimisation sans mesure avant/après est une croyance.🔍Regarde le fichier avant de le charger.🔍Une performance anormalement bonne est une hypothèse à réfuter.🔍Cette valeur existe-t-elle à l'instant où je dois prédire ?🔍fit sur le train, transform partout.🔍Un chiffre qu'on ne sait pas raconter est un chiffre qu'on n'a pas compris.🔍Un graphique sans question n'a rien à dire.🤖Un score d'entraînement parfait n'est jamais une bonne nouvelle.🤖Le jeu de test ne se regarde qu'une fois.🤖Plus tu essaies de configurations, plus ton meilleur score est optimiste.🤖Un seuil de décision est un arbitrage économique, pas un réglage technique.🤖Commence toujours par une baseline. Note son score.🤖Le meilleur modèle n'est pas le plus précis, c'est celui qu'on peut maintenir.🚀Un modèle en production n'est pas un livrable, c'est un système vivant.🚀Un secret publié est un secret compromis.🚀Pour chaque permission : que se passe-t-il si cette machine est compromise ?🚀Un post-mortem qui cherche un coupable ne produit aucune amélioration.🚀« Nous n'utilisons pas cette variable » n'est pas une garantie d'équité.🚀Rends l'arbitrage explicite et chiffré. Ne le tranche pas en silence.🚀Un résultat qu'on ne sait pas reproduire est une anecdote.

🎯 Objectifs d'apprentissage

À l'issue de ce module, tu seras capable de :

  • 01Choisir l'algorithme adapté au type de problème et au volume de données
  • 02Diagnostiquer sur-apprentissage et sous-apprentissage via les courbes d'apprentissage
  • 03Sélectionner la métrique d'évaluation alignée sur l'enjeu métier
  • 04Optimiser les hyperparamètres avec une recherche bayésienne (Optuna)
  • 05Expliquer une prédiction individuelle avec SHAP

Prérequis

Modules Feature Engineering et Mathématiques

Le paradigme du ML supervisé

50 min

Le ML supervisé apprend une fonction f : X → y à partir d'exemples étiquetés.

Le pipeline universel :
1. Séparer les données : train / validation / test (ex. 70/15/15)

2. Entraîner sur train, régler les hyperparamètres sur validation, évaluer UNE FOIS sur test

3. Ne jamais laisser le test "fuiter" dans l'entraînement (data leakage)

Le compromis biais-variance — le concept le plus important du ML :
- Sous-apprentissage (biais élevé) : modèle trop simple, mauvais partout

- Surapprentissage (variance élevée) : modèle qui mémorise le train mais généralise mal

from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)

Remèdes au surapprentissage : plus de données, régularisation (L1/L2), modèles plus simples, validation croisée.

✍️ Exercices de la leçon

2 exercices

Fais-les dans l'ordre, dans un vrai fichier .py — pas dans ta tête. Ne déplie la correction qu'après avoir écrit quelque chose, même faux.

🔧

Exercice AVoir le surapprentissage de ses yeux

Application directe · Tu appliques ce que tu viens de lire.

Sur le dataset du cancer du sein (from sklearn.datasets import load_breast_cancer) :

  1. 1.découpe en train / test (80/20)
  2. 2.entraîne un arbre de décision pour chaque profondeur de 1 à 20
  3. 3.enregistre à chaque fois le score sur le train et le score sur le test
  4. 4.trace les deux courbes sur le même graphique
  5. 5.identifie la profondeur où les courbes se séparent

Écris ensuite en deux phrases ce que la zone de séparation signifie.

🎯

Exercice BQuatre modèles, quatre diagnostics

Page blanche · Aucun squelette : à toi de choisir la méthode.

Page blanche. Diagnostic pur, aucun code imposé.

Quatre modèles ont été entraînés sur le même problème. Voici leurs scores :

| Modèle | Train | Validation | Test |
|---|---|---|---|

| A | 0.62 | 0.61 | 0.60 |

| B | 1.00 | 0.74 | 0.72 |

| C | 0.89 | 0.87 | 0.86 |

| D | 0.91 | 0.90 | 0.71 |

Pour chacun :
1. pose le diagnostic

2. explique ce qui le montre

3. propose deux remèdes concrets

Le modèle D est le plus intéressant des quatre. Prends le temps de comprendre ce qui a pu se passer avant de répondre.

🤖

Un point pas clair ? Clique sur 💬 Demander au tuteur en bas à droite.