Comprendre le RAG : la génération augmentée par récupération

Le RAG (Retrieval-Augmented Generation) associe un modèle de langage à une base de connaissances externe. Plutôt que de répondre uniquement avec ce qu’il a mémorisé, le modèle va d’abord chercher des documents pertinents, puis rédige sa réponse à partir d’eux.

Comment fonctionne le RAG

La question de l’utilisateur est transformée en vecteur, comparée à un index de documents eux-mêmes vectorisés, une approche de recherche sémantique par embeddings, et les passages les plus proches sont récupérés puis injectés dans le prompt du modèle.

Fait clé : le RAG réduit les hallucinations d’environ 40 % par rapport à un modèle seul, car les réponses sont ancrées dans des sources vérifiables.

Architecture typique

Un pipeline RAG combine un index vectoriel et, de plus en plus, un re-ranker en deux étapes : une première récupération large, puis un tri fin des passages les plus utiles avant génération.

Quand l’utiliser

Le RAG est idéal quand la connaissance évolue vite ou qu’elle est propre à l’entreprise, une approche de génération augmentée par récupération. Il évite de ré-entraîner le modèle à chaque mise à jour de la documentation.

Cette souplesse rappelle les principes de la récupération après l’effort : tout comme un coureur optimise sa récupération pour progresser, un système RAG optimise sa base de connaissances pour rester performant sans repartir de zéro.

Pour choisir la meilleure approche LLM, il faut comparer le RAG à d’autres méthodes comme le fine-tuning ou le prompting avancé, dont la classification few-shot qui apprend avec peu d’exemples, selon la fréquence de mise à jour des données et le besoin de traçabilité.