DomainLens

Навчання

Indexability debugging: чому Google не індексує сторінку

Практичний workflow для сторінок, які проскановані, але не індексуються: що означають стани в Search Console, які сигнали вирішують індексацію і як виправити кожну причину.

Перевір сайт перед виправленнями

Запусти свіжий аудит DomainLens і використовуй звіт як список пріоритетів.

Запустити безкоштовний SEO-аудит

Просканована, але не проіндексована: що означають стани

Crawling та indexing — це два різні кроки. Google може завантажити URL (просканувати), але все одно вирішити не зберігати його в індексі. Саме тому сторінка може віддавати 200, нормально виглядати в браузері й ніколи не зʼявлятися в пошуку. Звіт Page Indexing у Search Console називає точний стан, і виправлення повністю залежить від того, який саме ти бачиш.

Кожен поширений стан означає щось конкретне: «Crawled – currently not indexed» зазвичай сигналізує про судження щодо якості чи дублювання; «Discovered – currently not indexed» вказує на crawl budget або навантаження сервера; «Excluded by ‘noindex’ tag» — це директива, яку ти сам задав; «Alternate page with proper canonical tag» означає, що Google обрав канонічним інший URL; а «Duplicate, Google chose different canonical» означає, що твою підказку canonical перекрили.

Сигнали, що керують індексацією

Сторінка індексується лише коли кожен із цих сигналів згоден, що вона має бути в індексі. Одного суперечливого сигналу достатньо, щоб її не пустити.

  • HTTP-статус: URL має віддавати 200. 3xx, 4xx або soft 404 виключають його з розгляду.
  • robots.txt: він не має забороняти шлях — врахуй, що заблокована сторінка може індексуватися лише як URL, але її noindex не буде прочитано.
  • Robots meta / X-Robots-Tag: ані HTML meta robots, ані HTTP-заголовок не повинні казати noindex.
  • Canonical: canonical сторінки має вказувати на неї саму, а не на інший URL, який її потім поглинає.
  • Якість і унікальність контенту: тонкі, шаблонні або майже-дубльовані сторінки скануються й відкидаються.

Як продебажити один URL, крок за кроком

  • Прожени URL через URL Inspection у Search Console й прочитай точний статус і причину «Coverage».
  • Скористайся «Test live URL» і переглянь rendered HTML — підтверди, що контент і meta robots справді віддаються Googlebot, а не лише твоєму браузеру.
  • Витягни заголовки відповіді (curl -I) і перевір X-Robots-Tag: noindex, якого не видно в жодному HTML-перегляді.
  • Підтверди, що robots.txt дозволяє шлях, а потім що canonical у rendered HTML вказує на цей URL.
  • Якщо все проходить, а сторінка все ще «Crawled – not indexed», оціни контент проти інтенту запиту: він справді вартий місця чи це майже-дублікат шаблону?

Як виправити кожну причину

  • Ненавмисний noindex: прибери meta-тег або заголовок X-Robots-Tag, потім запроси індексацію.
  • Неправильний canonical: спрямуй canonical на саму сторінку й зроби так, щоб внутрішні посилання вели на той самий canonical URL.
  • Заблоковано в robots.txt, але хочеш індексувати: розблокуй шлях — не використовуй robots.txt для деіндексації, для цього є noindex.
  • Дублікат / майже-дублікат: обʼєднай через canonical на основну версію або зроби контент справді унікальним.
  • Discovered – not indexed: зменш марнування crawl (менше малоцінних URL, швидший сервер), щоб Google дійшов до сторінки, і посиль внутрішні посилання на неї.

Помилки, що тримають сторінки поза індексом

  • Використовувати robots.txt, щоб прибрати сторінку — заборонена сторінка зберігає наявний запис в індексі, бо Google більше не може прочитати noindex.
  • Перевіряти лише source HTML, коли noindex чи canonical вставляє JavaScript після рендера.
  • Раз за разом запитувати індексацію замість виправлення сигналу, що її блокує.
  • Вважати, що статус 200 означає indexable, ігноруючи soft 404, де в тілі сторінки написано «не знайдено».

Як підтвердити, що сторінка індексується

Після виправлення знову скористайся «Test live URL» і переконайся, що rendered HTML, заголовки й canonical згодні, що сторінку слід індексувати, потім запроси індексацію й стеж, як стан змінюється у звіті Page Indexing наступними днями.

DomainLens збирає ці сигнали в одному місці — статус-код, robots-директиви, ціль canonical і чи є між ними конфлікт — тож ти помітиш суперечність ще до того, як чекатимеш кілька днів, поки Search Console підтвердить, що не так.

Схожі ресурси