Pré-entraînement, fine-tuning et RLHF des modèles de fondation
Bonne lecture et bon apprentissage ! Junior TSAFACK – 11/09/2026 ⏱️ Temps de lecture estimé : 13 minutes
Quand l’ingénierie des prompts et le RAG ne suffisent plus à obtenir le comportement souhaité, il reste la voie de l’entraînement proprement dit. Ce chapitre distingue les différentes étapes d’entraînement d’un modèle de fondation et les techniques qui rendent l’ajustement accessible sans les moyens d’un pré-entraînement complet.
Pré-entraînement, ajustement, pré-entraînement continu
Section titled “Pré-entraînement, ajustement, pré-entraînement continu”| Étape | Type d’apprentissage | Données nécessaires | Coût |
|---|---|---|---|
| Pré-entraînement | Autosupervisé | Téraoctets/pétaoctets de données non structurées | Très élevé (millions d’heures GPU) |
| Ajustement (fine-tuning) | Supervisé | Jeu de données étiquetées, spécifique à la tâche | Modéré |
| Pré-entraînement continu | Autosupervisé | Nouvelles données non étiquetées | Modéré à élevé selon le volume |
Le pré-entraînement forme le LLM à partir de zéro sur d’énormes volumes de données non structurées, en apprentissage autosupervisé — c’est l’étape la plus coûteuse, réservée à un tout petit nombre d’organisations dans le monde.
L’ajustement (fine-tuning) part d’un modèle déjà pré-entraîné et l’affine avec un jeu de données étiquetées, propre à votre domaine ou à votre tâche. Il s’agit d’apprentissage supervisé : on transmet des invites au modèle, on compare ses réponses aux réponses attendues (les étiquettes), on calcule une perte, et on met à jour les pondérations en conséquence. Amazon SageMaker JumpStart permet d’ajuster un LLM sur votre propre jeu de données.
Le pré-entraînement continu poursuit l’entraînement d’un modèle déjà pré-entraîné, mais avec de nouvelles données non étiquetées — utile pour maintenir un modèle à jour sur de nouveaux sujets, genres ou contextes sans repartir de zéro. Sur Amazon Bedrock, les modèles Titan Text Express et Titan Text Lite peuvent être personnalisés ainsi, avec vos propres données non étiquetées, dans un environnement sécurisé et géré.
L’oubli catastrophique : le piège de l’ajustement mono-tâche
Section titled “L’oubli catastrophique : le piège de l’ajustement mono-tâche”Ajuster un modèle sur une seule tâche améliore ses performances sur cette tâche — mais peut dégrader ses performances sur d’autres tâches qu’il maîtrisait auparavant. C’est l’oubli catastrophique. La question à se poser avant tout ajustement : ai-je besoin que ce modèle reste généraliste, ou puis-je accepter qu’il se spécialise au détriment du reste ?
Deux parades principales :
- L’ajustement multitâche : le jeu de données d’entraînement mélange des exemples pour plusieurs tâches à la fois (résumé, traduction de code, révision…), ce qui produit un modèle « ajusté aux instructions » compétent sur plusieurs fronts simultanément — au prix d’un volume de données nécessaire bien plus important.
- Les techniques PEFT (voir ci-dessous), qui limitent structurellement le risque en ne touchant qu’une petite partie des pondérations.
PEFT et LoRA : ajuster sans tout réentraîner
Section titled “PEFT et LoRA : ajuster sans tout réentraîner”Un ajustement complet met à jour tous les paramètres du modèle — ce qui exige autant de mémoire GPU que le pré-entraînement initial (pondérations, gradients, optimiseur, activations). L’ajustement efficace des paramètres (PEFT — Parameter-Efficient Fine-Tuning) résout ce problème : les pondérations d’origine du modèle de fondation restent figées, et seul un petit nombre de nouveaux paramètres (des « adaptateurs ») est entraîné.
LoRA (Low-Rank Adaptation) est la technique PEFT la plus répandue : elle fige les pondérations d’origine et insère de petites matrices de « bas rang » entraînables dans chaque couche de l’architecture transformeur. Résultat : un ajustement beaucoup moins gourmand en mémoire et en calcul, pour une perte de performance généralement négligeable.
Une autre approche, le ReFT (Representation Fine-Tuning), fige elle aussi le modèle de base mais apprend des interventions ciblées sur les représentations cachées plutôt que sur les pondérations — en s’appuyant sur l’idée que des concepts sont encodés dans des sous-espaces linéaires du réseau.
L’ajustement par adaptation au domaine (domain adaptation fine-tuning) est un cas d’usage fréquent de ces techniques : adapter un modèle généraliste à un jargon spécifique — juridique, médical, technique — avec un volume de données limité mais ciblé.
| Technique | Ce qui est entraîné | Avantage principal |
|---|---|---|
| Ajustement complet | Tous les paramètres | Performance maximale, mais coûteux |
| PEFT / LoRA | Un petit ensemble d’adaptateurs | Coût réduit, pondérations d’origine préservées |
| ReFT | Représentations cachées ciblées | Ajustement très ciblé, modèle de base intact |
RLHF : aligner un modèle sur les préférences humaines
Section titled “RLHF : aligner un modèle sur les préférences humaines”L’apprentissage par renforcement à partir des commentaires humains (RLHF) répond à un problème différent : même un modèle très performant peut produire un langage toxique, agressif ou peu utile, hérité de ses données d’entraînement issues d’Internet. Le RLHF vise à mieux aligner ses réponses sur ce que des humains jugent utile, honnête et inoffensif.
Le processus :
- Des évaluateurs humains comparent plusieurs réponses du modèle à la même invite et indiquent leur préférence.
- Ces préférences entraînent un modèle de récompense distinct, capable de prédire le score qu’un humain donnerait à une réponse.
- Le LLM est ensuite affiné par apprentissage par renforcement pour maximiser la récompense prédite par ce modèle.
Amazon SageMaker Ground Truth facilite la collecte de ces préférences humaines : plusieurs réponses sont présentées à des évaluateurs, à qui l’on demande de les classer (par exemple par niveau de clarté).
Préparer ses données pour l’ajustement, sur AWS
Section titled “Préparer ses données pour l’ajustement, sur AWS”| Besoin | Service AWS |
|---|---|
| Préparation de données low-code, sans écrire de code | Amazon SageMaker Canvas (avec Data Wrangler) |
| Traitement à grande échelle | Apache Spark / Hive / Presto, intégrés à SageMaker Studio, ou AWS Glue (sessions interactives sans serveur) |
| Requêtes SQL sur les données de préparation | Jupyter Lab dans SageMaker Studio |
| Détection de biais dans les données d’entraînement | Amazon SageMaker Clarify |
| Étiquetage des données | Amazon SageMaker Ground Truth |
| Découverte et réutilisation de caractéristiques | Amazon SageMaker Feature Store |
Un jeu de données d’instructions préparé est ensuite scindé en entraînement / validation / test, exactement comme pour un modèle ML classique (voir module 1) — la précision de validation guide les itérations, la précision de test valide le résultat final.
Points clés à retenir
Section titled “Points clés à retenir”- Trois niveaux d’entraînement existent : pré-entraînement (à partir de zéro), ajustement/fine-tuning (supervisé, sur des données étiquetées), et pré-entraînement continu (nouvelles données non étiquetées).
- L’oubli catastrophique est le risque principal d’un ajustement mono-tâche : le modèle peut régresser sur d’autres tâches qu’il maîtrisait.
- PEFT et sa technique la plus connue, LoRA, permettent d’ajuster un modèle en ne touchant qu’un petit nombre de paramètres additionnels, pondérations d’origine figées.
- Le RLHF aligne un modèle sur les préférences humaines via un modèle de récompense entraîné sur des comparaisons de réponses.
- SageMaker Canvas, Clarify, Ground Truth et Feature Store couvrent respectivement la préparation low-code, la détection de biais, l’étiquetage et la réutilisation de caractéristiques.
Glossaire
Section titled “Glossaire”| Terme | Définition |
|---|---|
| Oubli catastrophique | Dégradation des performances d’un modèle sur des tâches antérieures suite à un ajustement trop ciblé. |
| PEFT | Parameter-Efficient Fine-Tuning — techniques d’ajustement ne modifiant qu’un petit sous-ensemble de paramètres. |
| LoRA | Low-Rank Adaptation — technique PEFT insérant des matrices de bas rang entraînables dans un transformeur. |
| RLHF | Reinforcement Learning from Human Feedback — alignement d’un modèle via un modèle de récompense entraîné sur des préférences humaines. |
Prochain chapitre
Section titled “Prochain chapitre”Une fois un modèle ajusté, comment vérifier objectivement qu’il répond mieux à vos objectifs métier que la version pré-entraînée de départ ?
👉 Chapitre 4 : Évaluer un modèle de fondation — benchmarks, métriques et intégration
Junior TSAFACK – 11/09/2026