Crawl (exploration)
Le robot suit vos liens, guidez-le avec méthode.
Définition
Le crawl (exploration) est le processus par lequel un robot de moteur de recherche - ou d'IA - parcourt le web en suivant les liens pour découvrir et lire les pages. C'est la première étape de toute visibilité : avant d'être indexée, classée ou citée, une page doit d'abord être explorée. Le robot (Googlebot, Bingbot, crawlers d'IA…) récupère le contenu de la page, suit ses liens, et alimente ainsi l'index du moteur.
Pourquoi ça compte
Si une page n'est pas explorée, elle n'existe pour aucun moteur : pas de crawl, pas d'indexation, pas de citation. C'est le maillon zéro de la couche découvrabilité. Or plusieurs obstacles peuvent empêcher ou gêner l'exploration, un blocage dans le robots.txt, un contenu chargé uniquement en JavaScript que le robot n'exécute pas, une architecture où des pages ne sont liées par rien. S'assurer que ses pages importantes sont accessibles aux robots est donc un prérequis avant tout autre travail SEO ou GEO.
Exemple concret
Un site publie une nouvelle page de service, mais aucune autre page ne pointe vers elle et elle n'est pas dans le sitemap : un robot qui explore le site en suivant les liens ne la trouve jamais — elle reste invisible, faute d'être explorée. À l'inverse, une page bien reliée (depuis le menu, d'autres contenus, le sitemap) est découverte rapidement. Le contenu peut être excellent : sans chemin pour y accéder, le robot ne le verra pas.
Comment l'optimiser
- Faciliter l'accès aux robots : ne pas bloquer par erreur des pages importantes dans le robots.txt.
- Soigner le maillage interne : chaque page importante doit être atteignable par des liens depuis d'autres pages.
- Fournir un sitemap à jour : il aide les robots à découvrir l'ensemble des pages, y compris les plus récentes.
- Servir un contenu lisible sans JavaScript (SSR) : beaucoup de crawlers, surtout côté IA, n'exécutent pas le JS.
Erreurs fréquentes
- Bloquer involontairement des pages utiles dans le robots.txt.
- Laisser des pages orphelines, sans aucun lien interne, donc indécouvrables par exploration.
- Charger le contenu uniquement côté client, invisible aux robots qui n'exécutent pas le JavaScript.
- Confondre crawl et indexation : être exploré ne garantit pas d'être indexé.
Termes liés
- Indexation
- Crawl budget (budget d'exploration)
- Découvrabilité (couche AI SEO)
- SSR (Server-Side Rendering)
- Maillage interne
- SEO technique
FAQ
Quelle différence entre crawl et indexation ?
Le crawl est l'exploration (le robot lit la page) ; l'indexation est l'enregistrement de la page dans l'index du moteur. Une page peut être explorée sans être indexée, par exemple si elle porte une directive noindex.
Comment savoir si mes pages sont explorées ? Les outils pour webmasters (Google Search Console, Bing Webmaster Tools) indiquent quelles pages ont été explorées, quand, et les éventuels problèmes d'accès rencontrés par les robots.
Faut-il laisser explorer tout le site ? Pas forcément : certaines pages sans valeur (paramètres, doublons techniques) peuvent être tenues à l'écart de l'exploration pour concentrer l'attention des robots sur les pages utiles. C'est l'enjeu du budget d'exploration.