Чем «Обнаружена, не проиндексирована» отличается от «Просканирована, но не проиндексирована»

Разница статусов GSC «Обнаружена, не проиндексирована» и «Просканирована, но не проиндексирована»: где застряла страница, как это проверить и что чинить в каждом случае.

Статусы «Страница обнаружена, но пока не проиндексирована» и «Страница просканирована, но пока не проиндексирована» в отчёте Search Console описывают два разных этапа одного конвейера. В первом случае Google знает URL, но ни разу его не скачивал. Во втором — скачал, разобрал и отложил решение о включении в индекс. Путать их опасно: лечение одного статуса бесполезно против другого.

Короткая диагностика выглядит так: откройте инструмент проверки URL в Search Console, посмотрите поле «Последнее сканирование». Пустое поле — страница только обнаружена. Дата есть, а страницы в индексе нет — она просканирована и отклонена на этапе отбора.

Конвейер индексации: где застревает страница при каждом статусе

Поисковая система обрабатывает URL в три этапа: обнаружение, сканирование, индексирование. На этапе обнаружения краулер узнаёт адрес из ссылки, карты сайта или внешнего сигнала и ставит его в очередь обхода. На этапе сканирования Googlebot скачивает HTML и, при необходимости, рендерит JavaScript. На этапе индексирования алгоритм решает, попадёт ли документ в поисковую базу и под каким каноническим адресом.

«Обнаружена, не проиндексирована» означает остановку между первым и вторым этапом. Справка Google по отчёту об индексировании называет типичную причину: робот планировал обход, но перенёс его, чтобы не перегружать сайт. На практике сюда же попадают страницы, до которых краулер не добрался из-за слабой внутренней перелинковки или низкого приоритета раздела.

«Просканирована, но пока не проиндексирована» — остановка между вторым и третьим этапом. Контент скачан, технических препятствий нет, но алгоритм не счёл документ достаточным для включения в индекс прямо сейчас. Повторная отправка на сканирование здесь почти ничего не меняет: краулер уже видел страницу.

Диагностические признаки: как отличить статусы за пять минут

  • Поле «Последнее сканирование» в инструменте проверки URL. Для обнаруженной страницы оно пустое, для просканированной — содержит дату и время последнего визита робота.
  • Логи сервера. Отфильтруйте обращения по User-Agent Googlebot к нужному URL. Обнаруженная страница в логах не встречается вовсе; просканированная — встречается, с кодом ответа 200.
  • Кеш-копия и выдача. Ни один из статусов не даёт сниппета в выдаче, но просканированная страница может на короткое время появляться в индексе и выпадать — волнообразное поведение характерно именно для неё.
  • Масштаб. «Обнаружена» чаще накрывает целые разделы и типовые страницы (пагинация, фильтры, свежие товарные карточки). «Просканирована» чаще бьёт по отдельным документам со слабым или дублирующимся содержанием.

Причины и порядок действий для «Обнаружена, не проиндексирована»

Этот статус — вопрос доставки краулера, а не качества текста. Отдельный случай — когда в этом статусе висит не ваша страница, а сторонняя страница с размещённой ссылкой: порядок проверки такого донора разобран в материале о проверке индексации страниц-доноров. Разбирать его стоит в таком порядке.

  1. Проверьте скорость и стабильность ответа сервера. Снимите время ответа по проблемному разделу: если сервер отвечает дольше одной-двух секунд или периодически отдаёт 5xx, робот сокращает обход. В отчёте «Статистика сканирования» Search Console это видно как рост среднего времени ответа и падение числа запросов в день.
  2. Посчитайте внутренние ссылки на страницу. Документ, на который ведёт одна ссылка с третьего уровня вложенности, краулер откладывает на потом. Добавьте ссылки из хабовых страниц раздела и из свежих материалов — изменение очереди обхода обычно заметно в течение одной-двух недель.
  3. Сверьте sitemap.xml. URL должен присутствовать в карте с корректной датой lastmod. Карта, которая месяцами отдаёт одну и ту же дату для всех адресов, перестаёт быть сигналом свежести.
  4. Отправьте URL на индексацию принудительно. Для собственного сайта — кнопкой «Запросить индексирование» в инструменте проверки URL. Для списка из сотен адресов ручная отправка не масштабируется: массовую доставку краулера на страницы решают сервисы ускорения индексации, а итог сверяют через проверку статуса списка URL в индексе Google — отчёт покажет, какие адреса дошли до индекса, а какие остались за бортом.

Причины и порядок действий для «Просканирована, но пока не проиндексирована»

  1. Оцените уникальность и полноту содержимого. Тонкие страницы — короткие карточки, пустые ветки форума, дубли с параметрами — первые кандидаты на этот статус. Решение: наполнить, объединить или закрыть от индексации осознанно.
  2. Проверьте канонические сигналы. Если rel=»canonical» указывает на другой адрес или Google выбрал канонической другую версию, текущий URL останется вне индекса штатно. Это видно в инструменте проверки URL в блоке «Выбранный канонический адрес».
  3. Посмотрите на раздел целиком. Когда статус накрывает десятки однотипных страниц, алгоритм оценил шаблон, а не конкретный документ. Точечные правки одной страницы картину не изменят — меняют шаблон: убирают дублирующиеся блоки, добавляют уникальные данные.
  4. Подождите и перепроверьте. Для нормальных страниц статус нередко рассасывается за две-шесть недель без вмешательства. Контрольную сверку ставят на 30-й день.

Сравнение статусов

Признак Обнаружена, не проиндексирована Просканирована, но не проиндексирована
Этап остановки До скачивания HTML После скачивания, до включения в индекс
Поле «Последнее сканирование» Пустое Дата визита робота
Googlebot в логах Нет обращений Обращения с кодом 200
Типичная причина Перенос обхода, слабая перелинковка, медленный сервер Тонкий контент, дубли, канонические конфликты
Что помогает Доставка краулера: ссылки, sitemap, отправка на индексацию Работа с контентом и шаблоном
Что бесполезно Переписывание текста без изменения обхода Повторные отправки на сканирование

Частые вопросы

Может ли страница перейти из «обнаружена» в «просканирована, но не проиндексирована»?
Да, и это движение вперёд: робот скачал документ. Дальше вопрос решает этап отбора, а не обхода.

Сколько страница может висеть в статусе «обнаружена»?
От нескольких дней до месяцев. Фиксированного срока нет: очередь обхода зависит от авторитетности сайта, скорости сервера и числа ссылок на документ.

Влияет ли статус на уже проиндексированные страницы сайта?
Напрямую нет. Но массовые «обнаружена» по разделу — симптом нехватки краулингового бюджета, который со временем задевает и обновление уже проиндексированных документов.

Эти статусы — ошибки, которые нужно «исправить» до нуля?
Нет. В отчёте почти любого крупного сайта есть обе группы: пагинация, фильтры и служебные адреса могут оставаться вне индекса штатно. Разбирают только те URL, которые должны приносить трафик.

Есть ли аналог этих статусов в Яндекс Вебмастере?
Прямого аналога пары статусов нет. Ближайшая картина — раздел «Страницы в поиске»: страница может быть известна роботу, но отсутствовать в поиске с собственной формулировкой причины. Подробный разбор этой ситуации — в статье о странице, которая есть в Вебмастере, но не ищется в Яндексе.

Чем проверить статус для чужой страницы, где нет доступа к Search Console?
Инструмент проверки URL работает только для подтверждённых ресурсов. Для сторонних адресов остаются операторы выдачи и массовые чекеры индексации — они показывают итог (в индексе или нет), но не промежуточный статус.

Что будет со статусами дальше

Google последовательно ужесточает отбор: доля просканированных, но не проиндексированных страниц в отчётах растёт с каждым годом — выборочная индексация стала нормой, а не сбоем. Полное описание обоих статусов и других причин исключения даёт справка Google по отчёту об индексировании страниц. Практический план на ближайшие десять минут: откройте отчёт, выгрузите обе группы URL, отделите страницы, которым положено быть в индексе, и для каждой определите этап остановки по полю «Последнее сканирование». Дальше лечите именно тот этап, на котором страница застряла.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *