- RAG signifie Retrieval-Augmented Generation, génération augmentée par récupération. Le principe : avant de répondre, le moteur va chercher des passages de pages réelles et les donne à lire au modèle, qui compose sa réponse à partir de ce qu'il vient de lire.
- C'est l'architecture derrière toutes les réponses qui citent des sources : ChatGPT Search, Perplexity, les AI Overviews, Claude en mode recherche.
- Ce qui compte n'est donc pas votre page mais vos passages. Le moteur ne lit pas un document entier, il retrouve des fragments de quelques centaines de mots et ne voit que ceux-là.
- Conséquence directe, formulée par Lily Ray dans le rapport Similarweb 2026 : la récupération passe par les index de recherche, donc une visibilité organique qui baisse entraîne la visibilité IA avec elle.
- Le RAG explique aussi pourquoi une page peut être citée sans être bien classée : Ahrefs mesure que seules 37,9 % des citations des AI Overviews viennent du top 10 Google.
C'est le mécanisme qu'il faut comprendre avant tout le reste. La plupart des recommandations GEO qui circulent en découlent directement, et beaucoup de fausses intuitions viennent de ce qu'on imagine un modèle qui « connaît » un site, alors qu'il le découvre au moment de répondre.
Le mécanisme en quatre étapes
Le détail qui change tout est à l'étape 2 : la récupération travaille sur des passages, pas sur des pages. Un document est découpé en fragments de quelques centaines de mots, chacun indexé séparément. Le moteur retrouve les fragments dont le sens est le plus proche de la question, et le modèle ne voit que ceux-là. Il ne lit ni votre menu, ni votre pied de page, ni les autres sections de la page. Voir le chunking et l'écriture par passages.
RAG, grounding, entraînement : trois choses différentes
Ces trois mots sont utilisés de façon interchangeable dans les contenus GEO, à tort. Ils décrivent des moments distincts.
| Notion | Quand | Ce que ça implique pour vous |
|---|---|---|
| Entraînement | Avant, une fois, sur un corpus figé | Le modèle a une connaissance vague de votre marque, sans lien ni source vérifiable. Rien n'est mis à jour entre deux versions. |
| RAG | Au moment de la question | Le moteur retrouve des passages dans un index et les fournit au modèle. C'est là que se gagne une citation avec lien. |
| Grounding | Au moment de la question | Terme plus large : ancrer la réponse dans des sources récupérées. Le RAG en est la forme la plus courante, mais un simple appel web en direct compte aussi. |
Cette distinction a une conséquence pratique immédiate sur le réglage des crawlers IA : bloquer les robots d'entraînement n'empêche pas d'être retrouvé au moment de la réponse, bloquer les robots de récupération si.
Elle explique aussi une confusion fréquente. Un modèle non ancré qui « cite » une source produit souvent une référence mémorisée, parfois inexacte, parfois inventée. Une citation avec lien cliquable vient presque toujours d'une récupération réelle.
Six conséquences concrètes pour un éditeur
- Le SEO reste le socle. La récupération s'appuie sur des index de recherche. C'est l'argument de Lily Ray dans le rapport Similarweb : si la visibilité organique baisse, la visibilité IA suit. Ce n'est pas une opinion, c'est une conséquence de l'architecture. Voir GEO et SEO.
- Mais bien se classer ne suffit plus. Ahrefs mesure 37,9 % de citations issues du top 10, 31,2 % des positions 11 à 100 et 31,0 % de pages hors du top 100. La récupération sémantique va chercher des passages que le classement ne remonte pas.
- Écrivez des passages autonomes. Un fragment qui commence par « comme on l'a vu plus haut » ne veut rien dire hors contexte. Chaque section doit se tenir seule, avec son sujet nommé explicitement plutôt qu'en pronom.
- Le contenu doit être dans le HTML. Ce qui est injecté par JavaScript après chargement n'est pas garanti d'être vu par un robot de récupération. C'est la limite que l'analyseur d'URL signale en premier.
- Un ensemble de pages bat une page isolée. Quand le moteur éclate une question en sous-requêtes (le query fan-out), il faut une page pour chacune. C'est le raisonnement des clusters thématiques, et ce que mesure l'étude EcoGEO.
- La fraîcheur redevient un signal fort. Le RAG existe précisément pour donner accès à ce que l'entraînement ignore. Une page datée, avec une date visible et balisée, est plus facile à préférer qu'une page sans repère temporel.
Ce que le RAG ne garantit pas
- Il ne supprime pas les erreurs. Le modèle peut mal résumer un passage correct, ou attribuer à une source un propos voisin. C'est le cas du site documenté par The Verge, où un classement inventé s'est retrouvé repris en moins de 24 heures.
- Il ne rend pas la citation prévisible. La volatilité des sources d'une semaine à l'autre est mesurée : voir le citation drift.
- Il n'est pas identique d'un moteur à l'autre. Perplexity maintient son propre index, Gemini décide requête par requête s'il va chercher le web, les AI Overviews s'appuient sur l'index Google. Voir les fiches par moteur dans la rubrique comment chaque moteur choisit ses sources.
- Le détail des implémentations n'est pas public. Aucun éditeur ne publie sa méthode de découpage, son modèle d'embedding ni ses règles de reclassement. Tout ce qui circule à ce sujet, y compris sur cette page, relève de l'inférence à partir de comportements observés.
- Le chunking et l'écriture par passages. La suite logique de cette page.
- L'accès des crawlers IA. Sans accès, pas de récupération.
- Le front-loading. Où placer la réponse dans un passage.
- Citation et absorption. Être cité n'est pas être repris.
- GEO-SFE. L'effet mesuré de la structure, à contenu constant.
- La définition courte dans le glossaire.
L'auteur de cette page
Éditeur de sites et consultant SEO, spécialisé en GEO. Drôme, France.
Josselin Leydier a mis en ligne son premier site en 2006 et en édite aujourd'hui environ 200, qui lui servent de terrain de test en conditions réelles. Il est consultant SEO senior chez Semjuice. Il tient LLM-GEO.fr, une bibliothèque d'études sur le GEO où chaque chiffre est vérifié dans sa source primaire avant d'être relayé, et où les limites de chaque étude sont documentées.
En savoir plus sur l'auteur · Le contacter · Toutes les études GEO