Skip to content

Concevoir une application avec un modèle de fondation – RAG, agents et bases vectorielles

Bonne lecture et bon apprentissage ! Junior TSAFACK – 11/09/2026 ⏱️ Temps de lecture estimé : 14 minutes


Le module 3 est le plus pondéré de l’examen AWS Certified AI Practitioner (28 %) : il porte sur l’application concrète des modèles de fondation. Ce premier chapitre couvre les décisions de conception à prendre en amont — quel modèle choisir, comment régler son comportement à l’inférence, et comment lui donner accès à des connaissances externes via le RAG et les agents.


Choisir un modèle pré-entraîné : les critères qui pèsent

Section titled “Choisir un modèle pré-entraîné : les critères qui pèsent”

Au-delà de la modalité et des performances brutes (voir chapitre 2 du module 2), trois familles de critères méritent une attention particulière :

Le coût contre la précision. Un modèle précis à 98 % mais coûtant des centaines de milliers de dollars à entraîner n’est pas automatiquement le bon choix face à un modèle à 97 % de précision, dix fois moins cher. Tout dépend des enjeux du cas d’usage.

La latence d’inférence. Un système de véhicule autonome exige des décisions quasi instantanées — un modèle dont l’essentiel du calcul se fait pendant l’inférence (comme un modèle K-Nearest Neighbors) serait inadapté, quelle que soit sa précision par ailleurs.

La transparence et l’explicabilité. Ce sont deux notions distinctes : l’interprétabilité signifie qu’on peut expliquer mathématiquement pourquoi un modèle produit telle prédiction (possible pour une régression linéaire ou un arbre de décision) ; l’explicabilité consiste à observer les entrées/sorties d’un modèle traité comme une boîte noire pour en déduire le comportement, sans comprendre son fonctionnement interne. Les modèles de fondation, extrêmement complexes, ne sont jamais interprétables par conception — seulement explicables. Si votre contexte réglementaire exige une interprétabilité totale, un modèle de fondation n’est probablement pas le bon choix.

Facteur Question à se poser
Coût Le gain de précision justifie-t-il le coût d’entraînement/d’usage ?
Latence Le cas d’usage tolère-t-il une réponse différée, ou exige-t-il l’instantané ?
Modalité Texte, image, code, multilingue ?
Interprétabilité Une exigence réglementaire impose-t-elle de savoir pourquoi le modèle décide ainsi ?

Les paramètres d’inférence : régler le comportement du modèle

Section titled “Les paramètres d’inférence : régler le comportement du modèle”

Les paramètres d’inférence sont des réglages que vous ajustez au moment d’interroger un modèle, sans le réentraîner. Sur Amazon Bedrock :

Paramètre Effet
Température Contrôle le caractère aléatoire des réponses : basse = plus déterministe et prévisible, haute = plus créatif et varié.
Top K Limite le choix du prochain jeton aux K jetons les plus probables.
Top P Limite le choix aux jetons dont la probabilité cumulée atteint P — une alternative plus dynamique à Top K.
Longueur de réponse / séquences d’arrêt Bornent la taille de la complétion générée.

💡 Il n’existe pas de réglage universellement « bon » : il faut expérimenter pour trouver l’équilibre entre diversité, cohérence et coût de calcul — puis surveiller et ajuster ces paramètres en continu une fois en production.


RAG : donner à un modèle des connaissances qu’il n’a jamais vues

Section titled “RAG : donner à un modèle des connaissances qu’il n’a jamais vues”

Un modèle de fondation a des connaissances figées au moment de son entraînement — il ne « sait » rien de ce qui s’est passé après, ni de vos données internes d’entreprise. La génération augmentée par récupération (RAG — Retrieval Augmented Generation) répond à ce problème en connectant le modèle à un système de connaissances externe, interrogé au moment de l’inférence, sans avoir à réentraîner le modèle.

Le fonctionnement, étape par étape :

  1. Votre invite est transmise à un encodeur de requête, qui la convertit en vecteur (embedding) dans le même format que les données externes indexées.
  2. Ce vecteur est comparé aux vecteurs stockés dans une base de données vectorielle, qui renvoie les données les plus sémantiquement proches.
  3. Ces données récupérées sont jointes à l’invite d’origine.
  4. L’invite enrichie est envoyée au modèle de fondation, qui génère une réponse ancrée dans ces informations réelles — réduisant fortement le risque d’hallucination.

Amazon Bedrock propose des bases de connaissances (Knowledge Bases) qui automatisent tout ce pipeline : vous y déposez vos sources de données, et Bedrock se charge de l’indexation vectorielle et de la récupération.

Où stocker les embeddings ? Les bases de données vectorielles AWS

Section titled “Où stocker les embeddings ? Les bases de données vectorielles AWS”
Service Particularité
Amazon OpenSearch Service Recherche et agrégations à faible latence, recherche sémantique native
Amazon OpenSearch Serverless Moteur vectoriel sans gestion d’infrastructure
Amazon Aurora / Amazon RDS pour PostgreSQL Extension pgvector pour stocker et interroger des embeddings
Amazon Neptune Base de graphes, utile quand les relations entre entités comptent autant que la similarité vectorielle
Amazon DocumentDB (compatible MongoDB) Pour des documents semi-structurés enrichis d’embeddings

Une base de données vectorielle n’est pas qu’un simple stockage de nombres : elle ajoute la gestion des données, la tolérance aux pannes, l’authentification, le contrôle d’accès et un moteur de requête performant — indispensable pour une recherche sémantique à grande échelle.


Les agents : passer de la réponse à l’action

Section titled “Les agents : passer de la réponse à l’action”

Un modèle de fondation seul peut répondre à une question, mais ne peut pas agir — réserver un vol, traiter un bon de commande. Ces actions nécessitent des données et des flux de travail spécifiques à l’organisation, généralement via des API.

Agents for Amazon Bedrock est une fonctionnalité entièrement gérée qui orchestre ce passage à l’action : un agent peut décomposer automatiquement une tâche complexe en étapes, générer la logique nécessaire, appeler des API en toute sécurité, et invoquer une base de connaissances pour enrichir sa réponse avant de la renvoyer. Exemple concret : un agent qui aide un client à réserver des vacances de plongée sous-marine en croisant ses préférences, la disponibilité et le prix.


  • Le choix d’un modèle pré-entraîné doit arbitrer coût, latence d’inférence et besoin d’interprétabilité — les modèles de fondation sont explicables mais jamais interprétables par conception.
  • Les paramètres d’inférence (température, Top K, Top P) permettent d’ajuster le comportement d’un modèle sans le réentraîner.
  • Le RAG connecte un modèle à des connaissances externes actualisées au moment de l’inférence, via une base de données vectorielle, réduisant les hallucinations sans réentraînement.
  • Les agents orchestrent des tâches multi-étapes en appelant des API et des bases de connaissances, transformant une simple réponse en action concrète.

Terme Définition
RAG Retrieval Augmented Generation — enrichissement d’un modèle génératif par une base de connaissances externe consultée à l’inférence.
Base de données vectorielle Système de stockage optimisé pour la recherche par similarité entre embeddings.
Agent Logiciel orchestrant des appels d’API et de bases de connaissances pour accomplir une tâche multi-étapes au nom d’un modèle de fondation.
Top K / Top P Paramètres d’inférence limitant l’ensemble des jetons candidats lors de la génération.

Le RAG et les agents enrichissent un modèle en données — l’ingénierie des prompts, elle, façonne directement la façon dont on lui parle. C’est l’objet du chapitre suivant.

👉 Chapitre 2 : L’ingénierie des prompts — techniques, espace latent et risques


Junior TSAFACK – 11/09/2026