SEO-інструменти
Перевірка robots.txt: що дозволено сканувати пошуковим роботам
Завантажує robots.txt для вказаного хоста, повідомляє, чи існує файл і чи не блокує він усіх роботів, і паралельно читає директиви робота на рівні сторінки.
Що перевіряє цей інструмент
Усі три перевіряються разом навмисно. Керування скануванням і керування індексацією — це різні механізми, які регулярно плутають, і директива в одному місці часто суперечить директиві в іншому.
- Чи існує /robots.txt на хості й чи повертає він 200, а не HTML-сторінку помилки.
- Чи не блокує група з символом * увесь сайт директивою Disallow: /.
- Директиву meta robots сторінки, яка керує індексацією, а не скануванням.
- Заголовок відповіді X-Robots-Tag, який робить те саме для будь-якого типу ресурсу.
Як читати результат
Файл, який віддає 500, гірший за відсутній: Google може призупинити сканування всього хоста до відновлення, тоді як чистий 404 трактується як «нічого не заблоковано».
| Знахідка | Що це означає | Типове виправлення |
|---|---|---|
| robots.txt відсутній | Файлу немає або він не віддає 200 | Додати хоча б заради оголошення карти сайту |
| Блокує всіх роботів | Disallow: / у групі з символом * | Прибрати — правила зі staging часто потрапляють у продакшн |
| meta robots noindex | Сторінка просить не індексувати її | Переконатися, що це навмисно |
| X-Robots-Tag noindex | Той самий сигнал на рівні сервера | Дивитися конфіг сервера або CDN, а не HTML |
Чого robots.txt зробити не може
robots.txt керує доступом до сканування — і більше нічим. Він не прибирає сторінку з пошуку, не забезпечує приватність і не об’єднує дублі. Блокування URL навпаки заважає Google побачити на ньому тег noindex, тому разом ці два інструменти залишають сторінки застряглими в індексі. Про вибір правильного інструмента читайте в матеріалі noindex проти robots.txt.
- Чи перевіряє інструмент конкретного робота?
- Він читає групу з символом *, яка застосовується до будь-якого робота без власних правил. Бот із власною групою підкоряється лише їй, тому специфічні правила треба дивитися у файлі напряму.
- Чому написано, що файлу немає, хоча я можу його відкрити?
- Найчастіше URL віддає HTML-сторінку зі статусом 200 замість простого тексту, або файл лежить на www, а перевірка пішла на хост без www. Обидва випадки означають відсутність придатного robots.txt.
Інші інструменти
Шукає карту сайту так само, як це робить пошуковий робот — спершу оголошення в robots.txt, потім стандартні розташування — після чого перевіряє, що документ парситься як XML, і рахує URL усередині.
Читає канонічний URL, який оголошує сторінка, а потім завантажує цю адресу, щоб переконатися, що вона доступна, не редиректить і не має noindex — три способи, якими canonical тихо перестає працювати.
Розбирає структуровані дані вказаної сторінки, перелічує знайдені типи schema.org і позначає блоки, які не парсяться або яким бракує обовʼязкових для їхнього типу властивостей.
Проходить за вказаним URL через кожен крок, показуючи статус-код на кожному з них і кінцеву адресу — деталі, які браузер ховає, щойно адресний рядок заспокоївся.
Перевіряє кожен сигнал, який вирішує, чи дозволено сторінці потрапити в індекс: статус-код, доступ у robots.txt, meta robots, заголовок X-Robots-Tag і canonical.