Module 0 — Pourquoi ces bibliothèques avant le Machine Learning
Avant d’entraîner le moindre modèle, un data scientist passe l’essentiel de son temps à charger, nettoyer, transformer et visualiser des données. Ce module pose les fondations techniques utilisées dans tout le reste du cours.
Pourquoi ne pas utiliser Python « pur » ?
Section titled “Pourquoi ne pas utiliser Python « pur » ?”Python sait déjà manipuler des listes et des boucles. Mais dès qu’un jeu de données dépasse quelques centaines de lignes, deux problèmes apparaissent :
- La lenteur : une boucle Python qui parcourt un million de valeurs est des centaines de fois plus lente que le même calcul effectué par du code compilé.
- L’expressivité : écrire « la moyenne des ventes de chaque région » avec des boucles et des dictionnaires imbriqués prend vite dix lignes, contre une seule avec le bon outil.
Quatre bibliothèques répondent à ces deux problèmes, chacune avec un rôle précis :
| Bibliothèque | Rôle | Analogie |
|---|---|---|
| NumPy | Calcul numérique vectorisé sur des tableaux | Le moteur de calcul, sous le capot de tout le reste |
| pandas | Tables de données étiquetées (lignes/colonnes nommées) | Un tableur programmable |
| Matplotlib / Seaborn | Visualisation de données | L’œil du data scientist |
| scikit-learn | Modèles de Machine Learning prêts à l’emploi | La boîte à outils de modélisation |
Ce module couvre les trois premières ; le tour d’horizon de scikit-learn clôt le module, juste avant que les modules suivants n’entrent dans le détail de chaque famille de modèles.
Mise en place de l’environnement
Section titled “Mise en place de l’environnement”Ce cours utilise Anaconda, une distribution Python pensée pour la data science : elle installe Python et un gestionnaire d’environnements (conda) qui isole les bibliothèques d’un projet à l’autre, exactement comme le ferait un venv, mais avec une gestion plus robuste des dépendances scientifiques (beaucoup de ces bibliothèques s’appuient sur du code C/Fortran compilé, que conda sait installer proprement sur toutes les plateformes).
Pour créer l’environnement utilisé dans ce module :
conda create -n ml-course python=3.11 numpy pandas matplotlib seaborn scikit-learn statsmodels jupyter ipykernelconda activate ml-courseVous pouvez vérifier que tout est en place :
import numpy, pandas, matplotlib, seaborn, sklearnprint(numpy.__version__, pandas.__version__, sklearn.__version__)2.4.6 3.0.5 1.9.1(Les numéros de version exacts peuvent différer selon la date d’installation — c’est normal, ces bibliothèques évoluent souvent sans casser la compatibilité.)
Ce que vous allez apprendre dans ce module
Section titled “Ce que vous allez apprendre dans ce module”- NumPy : créer et manipuler des tableaux, l’indexation avancée, le broadcasting, les statistiques vectorisées.
- pandas : charger des données réelles, les nettoyer, les regrouper et les agréger.
- Visualisation : transformer un tableau de chiffres en graphique lisible.
- scikit-learn : le vocabulaire commun à tous les modèles (
fit,predict,transform) avant de plonger dans chaque famille de modèles dans les modules suivants.
Prochaine étape
Section titled “Prochaine étape”👉 NumPy : calculer vite et bien sur des tableaux
Junior TSAFACK – 12/09/2026