DomainLens

SEO-інструменти

Перевірка robots.txt: що дозволено сканувати пошуковим роботам

Завантажує robots.txt для вказаного хоста, повідомляє, чи існує файл і чи не блокує він усіх роботів, і паралельно читає директиви робота на рівні сторінки.

Вставте повний URL, щоб перевірити конкретну сторінку, або лише домен — для головної.

Що перевіряє цей інструмент

Усі три перевіряються разом навмисно. Керування скануванням і керування індексацією — це різні механізми, які регулярно плутають, і директива в одному місці часто суперечить директиві в іншому.

  • Чи існує /robots.txt на хості й чи повертає він 200, а не HTML-сторінку помилки.
  • Чи не блокує група з символом * увесь сайт директивою Disallow: /.
  • Директиву meta robots сторінки, яка керує індексацією, а не скануванням.
  • Заголовок відповіді X-Robots-Tag, який робить те саме для будь-якого типу ресурсу.

Як читати результат

Файл, який віддає 500, гірший за відсутній: Google може призупинити сканування всього хоста до відновлення, тоді як чистий 404 трактується як «нічого не заблоковано».

ЗнахідкаЩо це означаєТипове виправлення
robots.txt відсутнійФайлу немає або він не віддає 200Додати хоча б заради оголошення карти сайту
Блокує всіх роботівDisallow: / у групі з символом *Прибрати — правила зі staging часто потрапляють у продакшн
meta robots noindexСторінка просить не індексувати їїПереконатися, що це навмисно
X-Robots-Tag noindexТой самий сигнал на рівні сервераДивитися конфіг сервера або CDN, а не HTML

Чого robots.txt зробити не може

robots.txt керує доступом до сканування — і більше нічим. Він не прибирає сторінку з пошуку, не забезпечує приватність і не об’єднує дублі. Блокування URL навпаки заважає Google побачити на ньому тег noindex, тому разом ці два інструменти залишають сторінки застряглими в індексі. Про вибір правильного інструмента читайте в матеріалі noindex проти robots.txt.

Чи перевіряє інструмент конкретного робота?
Він читає групу з символом *, яка застосовується до будь-якого робота без власних правил. Бот із власною групою підкоряється лише їй, тому специфічні правила треба дивитися у файлі напряму.
Чому написано, що файлу немає, хоча я можу його відкрити?
Найчастіше URL віддає HTML-сторінку зі статусом 200 замість простого тексту, або файл лежить на www, а перевірка пішла на хост без www. Обидва випадки означають відсутність придатного robots.txt.

Інші інструменти

Валідатор карти сайту

Шукає карту сайту так само, як це робить пошуковий робот — спершу оголошення в robots.txt, потім стандартні розташування — після чого перевіряє, що документ парситься як XML, і рахує URL усередині.

Перевірка canonical

Читає канонічний URL, який оголошує сторінка, а потім завантажує цю адресу, щоб переконатися, що вона доступна, не редиректить і не має noindex — три способи, якими canonical тихо перестає працювати.

Валідатор schema-розмітки

Розбирає структуровані дані вказаної сторінки, перелічує знайдені типи schema.org і позначає блоки, які не парсяться або яким бракує обовʼязкових для їхнього типу властивостей.

Перевірка редиректів

Проходить за вказаним URL через кожен крок, показуючи статус-код на кожному з них і кінцеву адресу — деталі, які браузер ховає, щойно адресний рядок заспокоївся.

Перевірка індексованості

Перевіряє кожен сигнал, який вирішує, чи дозволено сторінці потрапити в індекс: статус-код, доступ у robots.txt, meta robots, заголовок X-Robots-Tag і canonical.