Skip to content

Module 0 — Pourquoi ces bibliothèques avant le Machine Learning

Avant d’entraîner le moindre modèle, un data scientist passe l’essentiel de son temps à charger, nettoyer, transformer et visualiser des données. Ce module pose les fondations techniques utilisées dans tout le reste du cours.


Pourquoi ne pas utiliser Python « pur » ?

Section titled “Pourquoi ne pas utiliser Python « pur » ?”

Python sait déjà manipuler des listes et des boucles. Mais dès qu’un jeu de données dépasse quelques centaines de lignes, deux problèmes apparaissent :

  • La lenteur : une boucle Python qui parcourt un million de valeurs est des centaines de fois plus lente que le même calcul effectué par du code compilé.
  • L’expressivité : écrire « la moyenne des ventes de chaque région » avec des boucles et des dictionnaires imbriqués prend vite dix lignes, contre une seule avec le bon outil.

Quatre bibliothèques répondent à ces deux problèmes, chacune avec un rôle précis :

Bibliothèque Rôle Analogie
NumPy Calcul numérique vectorisé sur des tableaux Le moteur de calcul, sous le capot de tout le reste
pandas Tables de données étiquetées (lignes/colonnes nommées) Un tableur programmable
Matplotlib / Seaborn Visualisation de données L’œil du data scientist
scikit-learn Modèles de Machine Learning prêts à l’emploi La boîte à outils de modélisation

Ce module couvre les trois premières ; le tour d’horizon de scikit-learn clôt le module, juste avant que les modules suivants n’entrent dans le détail de chaque famille de modèles.


Ce cours utilise Anaconda, une distribution Python pensée pour la data science : elle installe Python et un gestionnaire d’environnements (conda) qui isole les bibliothèques d’un projet à l’autre, exactement comme le ferait un venv, mais avec une gestion plus robuste des dépendances scientifiques (beaucoup de ces bibliothèques s’appuient sur du code C/Fortran compilé, que conda sait installer proprement sur toutes les plateformes).

Pour créer l’environnement utilisé dans ce module :

Terminal window
conda create -n ml-course python=3.11 numpy pandas matplotlib seaborn scikit-learn statsmodels jupyter ipykernel
conda activate ml-course

Vous pouvez vérifier que tout est en place :

import numpy, pandas, matplotlib, seaborn, sklearn
print(numpy.__version__, pandas.__version__, sklearn.__version__)
2.4.6 3.0.5 1.9.1

(Les numéros de version exacts peuvent différer selon la date d’installation — c’est normal, ces bibliothèques évoluent souvent sans casser la compatibilité.)


Ce que vous allez apprendre dans ce module

Section titled “Ce que vous allez apprendre dans ce module”
  • NumPy : créer et manipuler des tableaux, l’indexation avancée, le broadcasting, les statistiques vectorisées.
  • pandas : charger des données réelles, les nettoyer, les regrouper et les agréger.
  • Visualisation : transformer un tableau de chiffres en graphique lisible.
  • scikit-learn : le vocabulaire commun à tous les modèles (fit, predict, transform) avant de plonger dans chaque famille de modèles dans les modules suivants.

👉 NumPy : calculer vite et bien sur des tableaux


Junior TSAFACK – 12/09/2026