Skip to content

Pré-entraînement, fine-tuning et RLHF des modèles de fondation

Bonne lecture et bon apprentissage ! Junior TSAFACK – 11/09/2026 ⏱️ Temps de lecture estimé : 13 minutes


Quand l’ingénierie des prompts et le RAG ne suffisent plus à obtenir le comportement souhaité, il reste la voie de l’entraînement proprement dit. Ce chapitre distingue les différentes étapes d’entraînement d’un modèle de fondation et les techniques qui rendent l’ajustement accessible sans les moyens d’un pré-entraînement complet.


Pré-entraînement, ajustement, pré-entraînement continu

Section titled “Pré-entraînement, ajustement, pré-entraînement continu”
Étape Type d’apprentissage Données nécessaires Coût
Pré-entraînement Autosupervisé Téraoctets/pétaoctets de données non structurées Très élevé (millions d’heures GPU)
Ajustement (fine-tuning) Supervisé Jeu de données étiquetées, spécifique à la tâche Modéré
Pré-entraînement continu Autosupervisé Nouvelles données non étiquetées Modéré à élevé selon le volume

Le pré-entraînement forme le LLM à partir de zéro sur d’énormes volumes de données non structurées, en apprentissage autosupervisé — c’est l’étape la plus coûteuse, réservée à un tout petit nombre d’organisations dans le monde.

L’ajustement (fine-tuning) part d’un modèle déjà pré-entraîné et l’affine avec un jeu de données étiquetées, propre à votre domaine ou à votre tâche. Il s’agit d’apprentissage supervisé : on transmet des invites au modèle, on compare ses réponses aux réponses attendues (les étiquettes), on calcule une perte, et on met à jour les pondérations en conséquence. Amazon SageMaker JumpStart permet d’ajuster un LLM sur votre propre jeu de données.

Le pré-entraînement continu poursuit l’entraînement d’un modèle déjà pré-entraîné, mais avec de nouvelles données non étiquetées — utile pour maintenir un modèle à jour sur de nouveaux sujets, genres ou contextes sans repartir de zéro. Sur Amazon Bedrock, les modèles Titan Text Express et Titan Text Lite peuvent être personnalisés ainsi, avec vos propres données non étiquetées, dans un environnement sécurisé et géré.


L’oubli catastrophique : le piège de l’ajustement mono-tâche

Section titled “L’oubli catastrophique : le piège de l’ajustement mono-tâche”

Ajuster un modèle sur une seule tâche améliore ses performances sur cette tâche — mais peut dégrader ses performances sur d’autres tâches qu’il maîtrisait auparavant. C’est l’oubli catastrophique. La question à se poser avant tout ajustement : ai-je besoin que ce modèle reste généraliste, ou puis-je accepter qu’il se spécialise au détriment du reste ?

Deux parades principales :

  • L’ajustement multitâche : le jeu de données d’entraînement mélange des exemples pour plusieurs tâches à la fois (résumé, traduction de code, révision…), ce qui produit un modèle « ajusté aux instructions » compétent sur plusieurs fronts simultanément — au prix d’un volume de données nécessaire bien plus important.
  • Les techniques PEFT (voir ci-dessous), qui limitent structurellement le risque en ne touchant qu’une petite partie des pondérations.

PEFT et LoRA : ajuster sans tout réentraîner

Section titled “PEFT et LoRA : ajuster sans tout réentraîner”

Un ajustement complet met à jour tous les paramètres du modèle — ce qui exige autant de mémoire GPU que le pré-entraînement initial (pondérations, gradients, optimiseur, activations). L’ajustement efficace des paramètres (PEFT — Parameter-Efficient Fine-Tuning) résout ce problème : les pondérations d’origine du modèle de fondation restent figées, et seul un petit nombre de nouveaux paramètres (des « adaptateurs ») est entraîné.

LoRA (Low-Rank Adaptation) est la technique PEFT la plus répandue : elle fige les pondérations d’origine et insère de petites matrices de « bas rang » entraînables dans chaque couche de l’architecture transformeur. Résultat : un ajustement beaucoup moins gourmand en mémoire et en calcul, pour une perte de performance généralement négligeable.

Une autre approche, le ReFT (Representation Fine-Tuning), fige elle aussi le modèle de base mais apprend des interventions ciblées sur les représentations cachées plutôt que sur les pondérations — en s’appuyant sur l’idée que des concepts sont encodés dans des sous-espaces linéaires du réseau.

L’ajustement par adaptation au domaine (domain adaptation fine-tuning) est un cas d’usage fréquent de ces techniques : adapter un modèle généraliste à un jargon spécifique — juridique, médical, technique — avec un volume de données limité mais ciblé.

Technique Ce qui est entraîné Avantage principal
Ajustement complet Tous les paramètres Performance maximale, mais coûteux
PEFT / LoRA Un petit ensemble d’adaptateurs Coût réduit, pondérations d’origine préservées
ReFT Représentations cachées ciblées Ajustement très ciblé, modèle de base intact

RLHF : aligner un modèle sur les préférences humaines

Section titled “RLHF : aligner un modèle sur les préférences humaines”

L’apprentissage par renforcement à partir des commentaires humains (RLHF) répond à un problème différent : même un modèle très performant peut produire un langage toxique, agressif ou peu utile, hérité de ses données d’entraînement issues d’Internet. Le RLHF vise à mieux aligner ses réponses sur ce que des humains jugent utile, honnête et inoffensif.

Le processus :

  1. Des évaluateurs humains comparent plusieurs réponses du modèle à la même invite et indiquent leur préférence.
  2. Ces préférences entraînent un modèle de récompense distinct, capable de prédire le score qu’un humain donnerait à une réponse.
  3. Le LLM est ensuite affiné par apprentissage par renforcement pour maximiser la récompense prédite par ce modèle.

Amazon SageMaker Ground Truth facilite la collecte de ces préférences humaines : plusieurs réponses sont présentées à des évaluateurs, à qui l’on demande de les classer (par exemple par niveau de clarté).


Préparer ses données pour l’ajustement, sur AWS

Section titled “Préparer ses données pour l’ajustement, sur AWS”
Besoin Service AWS
Préparation de données low-code, sans écrire de code Amazon SageMaker Canvas (avec Data Wrangler)
Traitement à grande échelle Apache Spark / Hive / Presto, intégrés à SageMaker Studio, ou AWS Glue (sessions interactives sans serveur)
Requêtes SQL sur les données de préparation Jupyter Lab dans SageMaker Studio
Détection de biais dans les données d’entraînement Amazon SageMaker Clarify
Étiquetage des données Amazon SageMaker Ground Truth
Découverte et réutilisation de caractéristiques Amazon SageMaker Feature Store

Un jeu de données d’instructions préparé est ensuite scindé en entraînement / validation / test, exactement comme pour un modèle ML classique (voir module 1) — la précision de validation guide les itérations, la précision de test valide le résultat final.


  • Trois niveaux d’entraînement existent : pré-entraînement (à partir de zéro), ajustement/fine-tuning (supervisé, sur des données étiquetées), et pré-entraînement continu (nouvelles données non étiquetées).
  • L’oubli catastrophique est le risque principal d’un ajustement mono-tâche : le modèle peut régresser sur d’autres tâches qu’il maîtrisait.
  • PEFT et sa technique la plus connue, LoRA, permettent d’ajuster un modèle en ne touchant qu’un petit nombre de paramètres additionnels, pondérations d’origine figées.
  • Le RLHF aligne un modèle sur les préférences humaines via un modèle de récompense entraîné sur des comparaisons de réponses.
  • SageMaker Canvas, Clarify, Ground Truth et Feature Store couvrent respectivement la préparation low-code, la détection de biais, l’étiquetage et la réutilisation de caractéristiques.

Terme Définition
Oubli catastrophique Dégradation des performances d’un modèle sur des tâches antérieures suite à un ajustement trop ciblé.
PEFT Parameter-Efficient Fine-Tuning — techniques d’ajustement ne modifiant qu’un petit sous-ensemble de paramètres.
LoRA Low-Rank Adaptation — technique PEFT insérant des matrices de bas rang entraînables dans un transformeur.
RLHF Reinforcement Learning from Human Feedback — alignement d’un modèle via un modèle de récompense entraîné sur des préférences humaines.

Une fois un modèle ajusté, comment vérifier objectivement qu’il répond mieux à vos objectifs métier que la version pré-entraînée de départ ?

👉 Chapitre 4 : Évaluer un modèle de fondation — benchmarks, métriques et intégration


Junior TSAFACK – 11/09/2026