Outils SEO
Validateur de sitemap : trouver et vérifier un sitemap XML
Cherche le sitemap comme le ferait un robot — d’abord la déclaration dans robots.txt, puis les emplacements conventionnels — puis vérifie que le document se parse en XML et compte les URL qu’il contient.
Ce que teste ce validateur
L’ordre de découverte compte. La déclaration dans robots.txt est le seul emplacement communiqué à un robot sans devinette : un sitemap qui existe mais n’est jamais déclaré travaille moins qu’il ne le devrait.
- Si un sitemap est trouvable, en partant de la ligne Sitemap: du fichier robots.txt.
- Si la réponse est en 200 et servie en XML plutôt qu’en HTML.
- Si le document se parse, et s’il s’agit d’un urlset ou d’un index de sitemaps.
- Combien d’URL il déclare, en suivant l’index vers ses fichiers enfants si nécessaire.
Ce qu’un sitemap valide ne garantit pas
La validité syntaxique et l’utilité sont deux propriétés différentes. Un fichier parfaitement formé nuit quand même si un tiers de ses URL redirigent, renvoient 404 ou portent une directive noindex : il se lit alors comme une liste de pages que vous n’avez pas su décrire correctement.
Une fois ce contrôle passé, échantillonnez les URL elles-mêmes : prenez-en vingt au hasard et vérifiez que chacune renvoie 200, est canonique vers elle-même et reste indexable.
Défaillances courantes
Pour le format lui-même, les éléments obligatoires et le découpage d’un gros fichier, voir le guide sur le sitemap XML.
| Symptôme | Cause | Correction |
|---|---|---|
| Introuvable | Aucune déclaration et un chemin non standard | Le déclarer dans robots.txt |
| Renvoie du HTML | Un soft 404 ou une route attrape-tout de SPA | Servir du vrai XML avec le bon type de contenu |
| Derrière une redirection | Une règle d’hôte ou de slash intercepte le fichier | Le servir directement à l’URL déclarée |
| Se parse mais vide | Un index dont les enfants ne sont jamais générés | Générer les fichiers enfants |
- Un sitemap force-t-il Google à indexer mes pages ?
- Non. Un sitemap est une aide à la découverte. Il aide Google à trouver des URL et n’influence en rien son jugement sur l’intérêt de les indexer.
- Le sitemap doit-il être à /sitemap.xml ?
- C’est la convention forte, et l’emplacement racine compte aussi techniquement : un sitemap ne peut lister que des URL situées au niveau de son propre répertoire ou en dessous.
Autres outils
Récupère le fichier robots.txt de l’hôte saisi, indique s’il existe et s’il bloque tous les robots, et lit au passage les directives robots au niveau de la page.
Lit l’URL canonique déclarée par la page, puis récupère cette adresse pour confirmer qu’elle répond, qu’elle ne redirige pas et qu’elle n’est pas en noindex — les trois façons dont une balise canonique devient silencieusement inopérante.
Analyse les données structurées de la page saisie, liste les types schema.org trouvés et signale les blocs qui ne se parsent pas ou auxquels manquent les propriétés requises par leur type.
Suit l’URL saisie à travers chaque saut, en indiquant le code de statut à chaque étape et la destination finale — le détail que le navigateur masque dès que la barre d’adresse se stabilise.
Contrôle tous les signaux qui décident si une page a le droit d’entrer dans l’index : le code de statut, l’accès dans robots.txt, la meta robots, l’en-tête X-Robots-Tag et la balise canonique.