Herramientas SEO
Comprobador de robots.txt: qué pueden rastrear los buscadores
Descarga el archivo robots.txt del host que indiques, informa de si existe y de si bloquea a todos los rastreadores, y lee de paso las directivas de robots a nivel de página.
Qué comprueba esta herramienta
Las tres se comprueban juntas a propósito. Controlar el rastreo y controlar la indexación son mecanismos distintos que se confunden con frecuencia, y una directiva en un sitio contradice a menudo otra puesta en otro lugar.
- Si /robots.txt existe en el host y devuelve 200 en lugar de una página de error HTML.
- Si el grupo de user-agent comodín bloquea todo el sitio con Disallow: /.
- La directiva meta robots de la página, que controla la indexación y no el rastreo.
- La cabecera X-Robots-Tag, que hace lo mismo para cualquier tipo de recurso.
Cómo leer el resultado
Un archivo que devuelve 500 es peor que uno ausente: Google puede pausar el rastreo de todo el host hasta que se recupere, mientras que un 404 limpio se interpreta como «no hay nada bloqueado».
| Hallazgo | Qué significa | Corrección habitual |
|---|---|---|
| Falta robots.txt | No hay archivo, o no devuelve 200 | Añadir uno, aunque sea para declarar el sitemap |
| Bloquea a todos | Disallow: / en el grupo comodín | Quitarlo — las reglas de staging llegan a producción por accidente |
| meta robots noindex | La página pide quedar fuera del índice | Confirmar si es intencionado |
| X-Robots-Tag noindex | La misma señal a nivel de servidor | Revisar la configuración del servidor o el CDN, no el HTML |
Lo que un archivo robots.txt no puede hacer
robots.txt controla el acceso de rastreo y nada más. No retira una página de la búsqueda, no garantiza privacidad y no consolida duplicados. Bloquear una URL impide precisamente que Google vea una etiqueta noindex en ella, y por eso ambas cosas juntas dejan páginas atrapadas en el índice. Para elegir el control correcto, consulta noindex frente a robots.txt.
- ¿Comprueba un user-agent concreto?
- Lee el grupo comodín, que es el que se aplica a cualquier rastreador sin reglas propias. Un bot con su propio grupo obedece solo a ese, así que las reglas específicas se revisan leyendo el archivo directamente.
- ¿Por qué dice que falta el archivo si yo puedo abrirlo?
- Lo más común es que la URL devuelva una página HTML con estado 200 en lugar de texto plano, o que el archivo esté en www mientras la comprobación siguió el host sin www. En ambos casos no hay un robots.txt utilizable.
Otras herramientas
Busca el sitemap igual que lo haría un rastreador —primero la declaración en robots.txt y después las ubicaciones convencionales— y luego confirma que el documento se analiza como XML y cuenta las URL que contiene.
Lee la URL canónica que declara la página y después descarga esa dirección para confirmar que responde, que no redirige y que no lleva noindex: las tres formas en que un canonical deja de funcionar en silencio.
Analiza los datos estructurados de la página que indiques, enumera los tipos de schema.org encontrados y señala los bloques que no se analizan o a los que les faltan las propiedades que su tipo exige.
Sigue la URL que indiques por cada salto, mostrando el código de estado en cada paso y el destino final: el detalle que el navegador oculta en cuanto la barra de direcciones se estabiliza.
Revisa todas las señales que deciden si una página puede entrar en el índice: el código de estado, el acceso según robots.txt, meta robots, la cabecera X-Robots-Tag y el canonical.