Навчання
Indexability debugging: чому Google не індексує сторінку
Практичний workflow для сторінок, які проскановані, але не індексуються: що означають стани в Search Console, які сигнали вирішують індексацію і як виправити кожну причину.
Запусти свіжий аудит DomainLens і використовуй звіт як список пріоритетів.
Просканована, але не проіндексована: що означають стани
Crawling та indexing — це два різні кроки. Google може завантажити URL (просканувати), але все одно вирішити не зберігати його в індексі. Саме тому сторінка може віддавати 200, нормально виглядати в браузері й ніколи не зʼявлятися в пошуку. Звіт Page Indexing у Search Console називає точний стан, і виправлення повністю залежить від того, який саме ти бачиш.
Кожен поширений стан означає щось конкретне: «Crawled – currently not indexed» зазвичай сигналізує про судження щодо якості чи дублювання; «Discovered – currently not indexed» вказує на crawl budget або навантаження сервера; «Excluded by ‘noindex’ tag» — це директива, яку ти сам задав; «Alternate page with proper canonical tag» означає, що Google обрав канонічним інший URL; а «Duplicate, Google chose different canonical» означає, що твою підказку canonical перекрили.
Сигнали, що керують індексацією
Сторінка індексується лише коли кожен із цих сигналів згоден, що вона має бути в індексі. Одного суперечливого сигналу достатньо, щоб її не пустити.
- HTTP-статус: URL має віддавати 200. 3xx, 4xx або soft 404 виключають його з розгляду.
- robots.txt: він не має забороняти шлях — врахуй, що заблокована сторінка може індексуватися лише як URL, але її noindex не буде прочитано.
- Robots meta / X-Robots-Tag: ані HTML meta robots, ані HTTP-заголовок не повинні казати noindex.
- Canonical: canonical сторінки має вказувати на неї саму, а не на інший URL, який її потім поглинає.
- Якість і унікальність контенту: тонкі, шаблонні або майже-дубльовані сторінки скануються й відкидаються.
Як продебажити один URL, крок за кроком
- Прожени URL через URL Inspection у Search Console й прочитай точний статус і причину «Coverage».
- Скористайся «Test live URL» і переглянь rendered HTML — підтверди, що контент і meta robots справді віддаються Googlebot, а не лише твоєму браузеру.
- Витягни заголовки відповіді (curl -I) і перевір X-Robots-Tag: noindex, якого не видно в жодному HTML-перегляді.
- Підтверди, що robots.txt дозволяє шлях, а потім що canonical у rendered HTML вказує на цей URL.
- Якщо все проходить, а сторінка все ще «Crawled – not indexed», оціни контент проти інтенту запиту: він справді вартий місця чи це майже-дублікат шаблону?
Як виправити кожну причину
- Ненавмисний noindex: прибери meta-тег або заголовок X-Robots-Tag, потім запроси індексацію.
- Неправильний canonical: спрямуй canonical на саму сторінку й зроби так, щоб внутрішні посилання вели на той самий canonical URL.
- Заблоковано в robots.txt, але хочеш індексувати: розблокуй шлях — не використовуй robots.txt для деіндексації, для цього є noindex.
- Дублікат / майже-дублікат: обʼєднай через canonical на основну версію або зроби контент справді унікальним.
- Discovered – not indexed: зменш марнування crawl (менше малоцінних URL, швидший сервер), щоб Google дійшов до сторінки, і посиль внутрішні посилання на неї.
Помилки, що тримають сторінки поза індексом
- Використовувати robots.txt, щоб прибрати сторінку — заборонена сторінка зберігає наявний запис в індексі, бо Google більше не може прочитати noindex.
- Перевіряти лише source HTML, коли noindex чи canonical вставляє JavaScript після рендера.
- Раз за разом запитувати індексацію замість виправлення сигналу, що її блокує.
- Вважати, що статус 200 означає indexable, ігноруючи soft 404, де в тілі сторінки написано «не знайдено».
Як підтвердити, що сторінка індексується
Після виправлення знову скористайся «Test live URL» і переконайся, що rendered HTML, заголовки й canonical згодні, що сторінку слід індексувати, потім запроси індексацію й стеж, як стан змінюється у звіті Page Indexing наступними днями.
DomainLens збирає ці сигнали в одному місці — статус-код, robots-директиви, ціль canonical і чи є між ними конфлікт — тож ти помітиш суперечність ще до того, як чекатимеш кілька днів, поки Search Console підтвердить, що не так.