R

RAG (Retrieval-Augmented Generation)

L'IA va chercher dehors avant de répondre, soyez justement ce qu'elle trouve.

Définition

Le RAG (Retrieval-Augmented Generation) est l'architecture qui combine deux étapes : d'abord récupérer des documents pertinents dans une base externe, puis générer une réponse en s'appuyant dessus. Plutôt que de répondre depuis sa seule mémoire, le modèle va chercher des passages, les place dans son contexte, et rédige à partir d'eux. C'est le moyen technique le plus courant d'obtenir du grounding : le RAG est la plomberie, le grounding est le résultat.

Pourquoi ça compte

Comprendre le RAG, c'est comprendre où se gagne ou se perd une citation. La phase de récupération ne lit pas des pages entières : elle découpe les sources en passages, les transforme en vecteurs et sélectionne les fragments les plus proches de la requête. Tout se joue donc au niveau du passage, pas de la page - un contenu dont aucun fragment n'est autonome et sémantiquement net ne sera pas récupéré, donc jamais transmis à l'étape de génération, donc jamais cité. C'est la raison technique profonde derrière la répondabilité et la SRO : on optimise pour être récupérable au bon endroit, pas pour un rang.

Exemple concret

Un assistant doit répondre « différence entre rupture conventionnelle et licenciement à l'amiable ». Le système RAG découpe les sources disponibles, calcule la proximité de chaque passage avec la question, et ne retient que les 3-4 fragments les mieux notés - qu'il donne au modèle pour rédiger. Une page qui contient un passage explicite « La rupture conventionnelle se distingue du licenciement par… » est récupérée et nourrit la réponse. Une page qui traite le même sujet en le diluant sur plusieurs paragraphes liés entre eux ne produit aucun fragment assez net : elle n'est jamais sélectionnée, même si elle « contient » la réponse.

Comment optimiser pour le RAG

  • Écrire des passages autonomes : chaque fragment doit être compréhensible et pertinent hors de son contexte, car c'est ainsi qu'il est récupéré.
  • Un passage = une intention : éviter de mêler plusieurs idées dans un même bloc, ce qui brouille sa proximité sémantique avec une requête.
  • Nommer explicitement les entités et concepts : la récupération s'appuie sur le sens des mots, pas sur des correspondances exactes - soyez précis.
  • Structurer (titres-questions, listes, définitions) : autant de repères qui isolent proprement les fragments récupérables.

Erreurs fréquentes

  • Raisonner « page » alors que le RAG raisonne « passage » : optimiser la page entière sans soigner ses fragments.
  • Croire qu'un contenu exhaustif est forcément bien récupéré : la longueur ne remplace pas la netteté des passages.
  • Diluer l'information sur des paragraphes interdépendants, impossibles à isoler.
  • Confondre RAG (l'architecture) et grounding (son objectif) ou le réduire à « du SEO pour l'IA ».

Termes liés

FAQ

RAG et grounding, quelle différence ? Le RAG est l'architecture (récupérer puis générer) ; le grounding est l'objectif qu'elle sert (ancrer la réponse dans des sources réelles). Le RAG est le moyen le plus répandu d'obtenir du grounding, mais ce n'est pas le seul.

Faut-il être développeur pour « optimiser pour le RAG » ? Non. L'optimisation côté contenu est éditoriale : écrire des passages autonomes, nets et explicites. C'est la même discipline que la répondabilité, formulée du point de vue de la machine qui récupère.

Pourquoi un bon contenu peut-il ne jamais être récupéré ? Parce que le RAG sélectionne des fragments, pas des pages. Si aucun passage de votre page n'est assez autonome et précis pour matcher la requête, le contenu n'atteint jamais l'étape de génération - il reste invisible.