Herramientas SEO
Validador de sitemap: encontrar y comprobar un sitemap XML
Busca el sitemap igual que lo haría un rastreador —primero la declaración en robots.txt y después las ubicaciones convencionales— y luego confirma que el documento se analiza como XML y cuenta las URL que contiene.
Qué comprueba este validador
El orden de descubrimiento importa. La declaración en robots.txt es la única ubicación que se le comunica a un rastreador sin adivinanzas: un sitemap que existe pero nunca se declara rinde menos de lo que podría.
- Si es posible encontrar un sitemap, empezando por la línea Sitemap: de robots.txt.
- Si la respuesta es 200 y se sirve como XML en lugar de como página HTML.
- Si el documento se analiza y si es un urlset o un índice de sitemaps.
- Cuántas URL declara, siguiendo el índice hasta sus archivos hijos cuando hace falta.
Lo que un sitemap válido no garantiza
La validez sintáctica y la utilidad son propiedades distintas. Un archivo perfectamente formado sigue perjudicando si un tercio de sus URL redirige, devuelve 404 o lleva una directiva noindex: entonces se lee como una lista de páginas que no supiste describir con precisión.
Cuando esta comprobación pase, revisa las URL en sí: toma veinte al azar y confirma que cada una devuelve 200, es canónica hacia sí misma y sigue siendo indexable.
Fallos habituales
Para el formato en sí, los elementos obligatorios y cómo dividir un archivo grande, consulta la guía del sitemap XML.
| Síntoma | Causa | Corrección |
|---|---|---|
| No se encuentra | Sin declaración y con una ruta no estándar | Declararlo en robots.txt |
| Devuelve HTML | Un soft 404 o una ruta comodín de la SPA | Servir XML real con el tipo de contenido correcto |
| Tras una redirección | Una regla de host o de barra intercepta el archivo | Servirlo directamente en la URL declarada |
| Se analiza pero vacío | Un índice cuyos hijos nunca se generan | Generar los archivos hijos |
- ¿Un sitemap hace que Google indexe mis páginas?
- No. Un sitemap es una ayuda al descubrimiento. Ayuda a Google a encontrar URL y no influye en si las considera dignas de indexación.
- ¿El sitemap debe estar en /sitemap.xml?
- Es la convención firme, y la ubicación en la raíz también importa técnicamente: un sitemap solo puede listar URL de su propio directorio o por debajo.
Otras herramientas
Descarga el archivo robots.txt del host que indiques, informa de si existe y de si bloquea a todos los rastreadores, y lee de paso las directivas de robots a nivel de página.
Lee la URL canónica que declara la página y después descarga esa dirección para confirmar que responde, que no redirige y que no lleva noindex: las tres formas en que un canonical deja de funcionar en silencio.
Analiza los datos estructurados de la página que indiques, enumera los tipos de schema.org encontrados y señala los bloques que no se analizan o a los que les faltan las propiedades que su tipo exige.
Sigue la URL que indiques por cada salto, mostrando el código de estado en cada paso y el destino final: el detalle que el navegador oculta en cuanto la barra de direcciones se estabiliza.
Revisa todas las señales que deciden si una página puede entrar en el índice: el código de estado, el acceso según robots.txt, meta robots, la cabecera X-Robots-Tag y el canonical.