SEO-інструменти
Валідатор карти сайту: знайти й перевірити XML-sitemap
Шукає карту сайту так само, як це робить пошуковий робот — спершу оголошення в robots.txt, потім стандартні розташування — після чого перевіряє, що документ парситься як XML, і рахує URL усередині.
Що перевіряє цей валідатор
Порядок пошуку має значення. Оголошення в robots.txt — єдине розташування, про яке роботу повідомляють без здогадок, тож карта сайту, яка існує, але ніде не оголошена, працює гірше, ніж могла б.
- Чи взагалі можна знайти карту сайту, починаючи з рядка Sitemap: у robots.txt.
- Чи відповідь має статус 200 і віддається як XML, а не як HTML-сторінка.
- Чи документ парситься і чи це urlset, чи індекс карт сайту.
- Скільки URL оголошено, з переходом від індексу до дочірніх файлів за потреби.
Чого валідна карта сайту не гарантує
Синтаксична валідність і користь — різні властивості. Ідеально сформований файл усе одно шкодить, якщо третина його URL редиректить, віддає 404 або має директиву noindex: тоді він читається як перелік сторінок, які ви не змогли описати точно.
Після того як ця перевірка пройде, перевірте самі URL: візьміть двадцять навмання й переконайтеся, що кожен віддає 200, канонічний сам на себе й доступний для індексації.
Типові збої карти сайту
Про сам формат, обовʼязкові елементи й поділ великого файлу читайте в матеріалі про XML-карту сайту.
| Симптом | Причина | Виправлення |
|---|---|---|
| Не знайдено | Немає оголошення в robots.txt і нестандартний шлях | Оголосити її в robots.txt |
| Віддає HTML | М’який 404 або catch-all маршрут SPA | Віддавати справжній XML із XML-типом вмісту |
| За редиректом | Правило хоста або слеша перехоплює файл | Віддавати напряму за оголошеним URL |
| Парситься, але порожня | Індекс, дочірні файли якого не генеруються | Згенерувати дочірні файли |
- Чи змусить карта сайту Google проіндексувати мої сторінки?
- Ні. Карта сайту — це підказка для виявлення. Вона допомагає Google знайти URL і жодним чином не впливає на рішення, чи варті вони індексації.
- Чи має карта сайту бути за адресою /sitemap.xml?
- Це усталена конвенція, і коренева адреса важлива ще й технічно: карта сайту може перелічувати лише URL на рівні своєї директорії або нижче.
Інші інструменти
Завантажує robots.txt для вказаного хоста, повідомляє, чи існує файл і чи не блокує він усіх роботів, і паралельно читає директиви робота на рівні сторінки.
Читає канонічний URL, який оголошує сторінка, а потім завантажує цю адресу, щоб переконатися, що вона доступна, не редиректить і не має noindex — три способи, якими canonical тихо перестає працювати.
Розбирає структуровані дані вказаної сторінки, перелічує знайдені типи schema.org і позначає блоки, які не парсяться або яким бракує обовʼязкових для їхнього типу властивостей.
Проходить за вказаним URL через кожен крок, показуючи статус-код на кожному з них і кінцеву адресу — деталі, які браузер ховає, щойно адресний рядок заспокоївся.
Перевіряє кожен сигнал, який вирішує, чи дозволено сторінці потрапити в індекс: статус-код, доступ у robots.txt, meta robots, заголовок X-Robots-Tag і canonical.