Qu'est-ce qu'un RAG (Retrieval-Augmented Generation) ?
Un RAG (Retrieval-Augmented Generation, ou génération augmentée par récupération) est une architecture d'IA qui ancre les réponses d'un modèle de langage sur vos propres documents, plutôt que sur sa seule mémoire d'entraînement. À chaque question, le système recherche les passages pertinents dans votre base documentaire, puis demande au modèle de répondre à partir de ces sources — avec traçabilité.
Comment fonctionne un RAG, étape par étape
- Indexation : vos documents (procédures, contrats, code, FAQ) sont découpés et transformés en vecteurs (embeddings).
- Recherche : la question de l'utilisateur est vectorisée ; le moteur récupère les passages les plus proches (recherche hybride mots-clés + vectorielle, affinée par un semantic ranker).
- Génération : le modèle rédige une réponse fondée sur ces passages, idéalement avec citation des sources.
Pourquoi utiliser un RAG ?
- Réduit les hallucinations : le modèle répond à partir de sources réelles, pas « de mémoire ».
- Traçabilité : on sait d'où vient la réponse.
- Fraîcheur : on met à jour la base sans réentraîner le modèle.
- Confidentialité : vos données restent dans votre périmètre.
RAG, Azure AI Search et Azure AI Foundry
- Azure AI Search fournit le moteur de recherche (hybride + vectoriel + semantic ranker) qui alimente le RAG en passages pertinents.
- Azure AI Foundry orchestre les modèles et les agents.
Progresi conçoit des assistants RAG sur cette stack, avec function calling pour déclencher des actions métier réelles (consulter, créer, modifier).
Limites à connaître
Un RAG ne vaut que par la qualité de sa base et de son indexation. Le poste souvent sous-estimé est l'ingénierie du comportement de l'agent (prompt, garde-fous, logique de réponse), co-construite avec les équipes métier.
En résumé
Le RAG est la fondation des chatbots d'entreprise fiables : il combine recherche sur vos documents et génération par LLM pour des réponses contextualisées et traçables.