Qu'est-ce qu'un RAG (Retrieval-Augmented Generation) ?

Publié le 2026-06-28 · Nicolas Pepin — Progresi

Un RAG (Retrieval-Augmented Generation, ou génération augmentée par récupération) est une architecture d'IA qui ancre les réponses d'un modèle de langage sur vos propres documents, plutôt que sur sa seule mémoire d'entraînement. À chaque question, le système recherche les passages pertinents dans votre base documentaire, puis demande au modèle de répondre à partir de ces sources — avec traçabilité.

Comment fonctionne un RAG, étape par étape

  1. Indexation : vos documents (procédures, contrats, code, FAQ) sont découpés et transformés en vecteurs (embeddings).
  2. Recherche : la question de l'utilisateur est vectorisée ; le moteur récupère les passages les plus proches (recherche hybride mots-clés + vectorielle, affinée par un semantic ranker).
  3. Génération : le modèle rédige une réponse fondée sur ces passages, idéalement avec citation des sources.

Pourquoi utiliser un RAG ?

RAG, Azure AI Search et Azure AI Foundry

Progresi conçoit des assistants RAG sur cette stack, avec function calling pour déclencher des actions métier réelles (consulter, créer, modifier).

Limites à connaître

Un RAG ne vaut que par la qualité de sa base et de son indexation. Le poste souvent sous-estimé est l'ingénierie du comportement de l'agent (prompt, garde-fous, logique de réponse), co-construite avec les équipes métier.

En résumé

Le RAG est la fondation des chatbots d'entreprise fiables : il combine recherche sur vos documents et génération par LLM pour des réponses contextualisées et traçables.

Échanger sur votre projet