DomainLens

Herramientas SEO

Comprobador de robots.txt: qué pueden rastrear los buscadores

Descarga el archivo robots.txt del host que indiques, informa de si existe y de si bloquea a todos los rastreadores, y lee de paso las directivas de robots a nivel de página.

Pega una URL completa para revisar una página concreta, o solo el dominio para la página de inicio.

Qué comprueba esta herramienta

Las tres se comprueban juntas a propósito. Controlar el rastreo y controlar la indexación son mecanismos distintos que se confunden con frecuencia, y una directiva en un sitio contradice a menudo otra puesta en otro lugar.

  • Si /robots.txt existe en el host y devuelve 200 en lugar de una página de error HTML.
  • Si el grupo de user-agent comodín bloquea todo el sitio con Disallow: /.
  • La directiva meta robots de la página, que controla la indexación y no el rastreo.
  • La cabecera X-Robots-Tag, que hace lo mismo para cualquier tipo de recurso.

Cómo leer el resultado

Un archivo que devuelve 500 es peor que uno ausente: Google puede pausar el rastreo de todo el host hasta que se recupere, mientras que un 404 limpio se interpreta como «no hay nada bloqueado».

HallazgoQué significaCorrección habitual
Falta robots.txtNo hay archivo, o no devuelve 200Añadir uno, aunque sea para declarar el sitemap
Bloquea a todosDisallow: / en el grupo comodínQuitarlo — las reglas de staging llegan a producción por accidente
meta robots noindexLa página pide quedar fuera del índiceConfirmar si es intencionado
X-Robots-Tag noindexLa misma señal a nivel de servidorRevisar la configuración del servidor o el CDN, no el HTML

Lo que un archivo robots.txt no puede hacer

robots.txt controla el acceso de rastreo y nada más. No retira una página de la búsqueda, no garantiza privacidad y no consolida duplicados. Bloquear una URL impide precisamente que Google vea una etiqueta noindex en ella, y por eso ambas cosas juntas dejan páginas atrapadas en el índice. Para elegir el control correcto, consulta noindex frente a robots.txt.

¿Comprueba un user-agent concreto?
Lee el grupo comodín, que es el que se aplica a cualquier rastreador sin reglas propias. Un bot con su propio grupo obedece solo a ese, así que las reglas específicas se revisan leyendo el archivo directamente.
¿Por qué dice que falta el archivo si yo puedo abrirlo?
Lo más común es que la URL devuelva una página HTML con estado 200 en lugar de texto plano, o que el archivo esté en www mientras la comprobación siguió el host sin www. En ambos casos no hay un robots.txt utilizable.

Otras herramientas