Apprendre
Debug indexabilité : pourquoi Google n’indexe pas votre page
Un workflow pratique pour les pages crawlées mais non indexées : ce que signifient les états de Search Console, les signaux qui décident de l’indexation et comment corriger chaque cause.
Lancez un audit DomainLens frais et utilisez le rapport comme liste de priorités.
Crawlée mais non indexée : ce que signifient les états
Crawl et indexation sont deux étapes distinctes. Google peut récupérer une URL (la crawler) et décider quand même de ne pas la stocker dans l’index — c’est pourquoi une page peut renvoyer 200, s’afficher normalement et ne jamais apparaître en recherche. Le rapport Indexation des pages de Search Console nomme l’état exact, et la correction dépend entièrement de celui que vous voyez.
Chaque état courant signifie quelque chose de précis : « Explorée, actuellement non indexée » signale souvent un jugement de qualité ou de duplication ; « Détectée, actuellement non indexée » pointe vers le crawl budget ou la charge serveur ; « Exclue par une balise noindex » est une directive que vous avez posée ; « Page alternative avec balise canonique correcte » signifie que Google a choisi une autre URL comme canonique ; et « En double, Google a choisi une autre canonique » signifie que votre indice canonique a été outrepassé.
Les signaux qui contrôlent l’indexation
Une page n’est indexable que si chacun de ces signaux confirme qu’elle doit l’être. Un seul signal contradictoire suffit à l’exclure.
- Statut HTTP : l’URL doit renvoyer 200. Un 3xx, 4xx ou soft 404 l’écarte.
- robots.txt : il ne doit pas interdire le chemin — une page bloquée peut rester indexée en URL seule mais son noindex ne peut pas être lu.
- Meta robots / X-Robots-Tag : ni la balise meta HTML ni l’en-tête HTTP ne doivent dire noindex.
- Canonique : la canonique de la page doit pointer vers elle-même, pas vers une autre URL qui l’absorbe.
- Qualité et unicité du contenu : les pages minces, boilerplate ou quasi dupliquées sont crawlées puis écartées.
Comment déboguer une URL, étape par étape
- Passez l’URL dans l’Inspection d’URL de Search Console et lisez le statut exact et le motif de couverture.
- Utilisez « Tester l’URL en direct » et affichez le HTML rendu — confirmez que le contenu et la meta robots présentés à Googlebot correspondent, pas seulement à votre navigateur.
- Récupérez les en-têtes (curl -I) et vérifiez un X-Robots-Tag: noindex qu’aucune vue HTML ne révélerait.
- Confirmez que robots.txt autorise le chemin, puis que la canonique du HTML rendu pointe vers cette URL.
- Si tout passe et que c’est encore « Explorée, non indexée », jugez le contenu face à l’intention : mérite-t-il vraiment une place, ou est-ce un quasi-doublon de template ?
Comment corriger chaque cause
- noindex non voulu : retirez la balise meta ou l’en-tête X-Robots-Tag, puis demandez l’indexation.
- Mauvaise canonique : pointez la canonique vers la page elle-même et faites pointer les liens internes vers la même URL canonique.
- Bloquée dans robots.txt mais à indexer : débloquez le chemin — n’utilisez pas robots.txt pour désindexer, utilisez noindex.
- Doublon / quasi-doublon : consolidez avec une canonique vers la version principale, ou rendez le contenu réellement distinct.
- Détectée, non indexée : réduisez le gaspillage de crawl (moins d’URLs à faible valeur, serveur plus rapide) et renforcez les liens internes vers la page.
Les erreurs qui excluent les pages de l’index
- Utiliser robots.txt pour retirer une page — une page interdite garde son entrée d’index car Google ne peut plus lire le noindex.
- N’auditer que le HTML source alors que le noindex ou la canonique est injecté par JavaScript après le rendu.
- Demander l’indexation en boucle au lieu de corriger le signal qui la bloque.
- Supposer qu’un statut 200 signifie indexable, en ignorant un soft 404 où le corps dit « introuvable ».
Comment confirmer que la page est indexable
Après la correction, utilisez à nouveau « Tester l’URL en direct » et confirmez que le HTML rendu, les en-têtes et la canonique s’accordent sur l’indexation, puis demandez l’indexation et suivez le changement d’état dans le rapport les jours suivants.
DomainLens réunit ces signaux au même endroit — code de statut, directives robots, cible canonique et leurs conflits — pour repérer la contradiction avant d’attendre des jours que Search Console confirme le problème.