Comprendre le RAG : la génération augmentée par récupération
Le RAG (Retrieval-Augmented Generation) associe un modèle de langage à une base de connaissances externe. Plutôt que de répondre uniquement avec ce qu’il a mémorisé, le modèle va d’abord chercher des documents pertinents, puis rédige sa réponse à partir d’eux.
Comment fonctionne le RAG
La question de l’utilisateur est transformée en vecteur, comparée à un index de documents eux-mêmes vectorisés, et les passages les plus proches sont récupérés puis injectés dans le prompt du modèle.
Fait clé : le RAG réduit les hallucinations d’environ 40 % par rapport à un modèle seul, car les réponses sont ancrées dans des sources vérifiables.
Architecture typique
Un pipeline RAG combine un index vectoriel et, de plus en plus, un re-ranker en deux étapes : une première récupération large, puis un tri fin des passages les plus utiles avant génération.
Quand l’utiliser
Le RAG est idéal quand la connaissance évolue vite ou qu’elle est propre à l’entreprise. Il évite de ré-entraîner le modèle à chaque mise à jour de la documentation.
