Как происходит сканирование

Поисковый робот начинает с уже известных адресов, переходит по ссылкам и загружает страницы. Новые URL он также может получить из карты сайта, внешних ссылок и других источников поисковой системы.

При каждом обращении сервер возвращает код ответа и содержимое. Робот учитывает перенаправления, запреты на обход, канонические адреса и доступность ресурсов, необходимых для отображения страницы.

Сканирование не означает индексацию

Загрузка страницы — только один этап. После неё поисковая система обрабатывает материал и решает, добавлять ли его в индекс. Страница может регулярно сканироваться, но не участвовать в поиске из-за дублей, низкой ценности, технических сигналов или другого решения системы.

Следующий этап подробно разобран в определении индексирования.

Что может мешать обходу

  • запреты в robots.txt;
  • ошибки сервера и длинные цепочки перенаправлений;
  • страницы, на которые не ведут внутренние ссылки;
  • бесконечные комбинации фильтров и технических параметров;
  • контент, доступный только после действий, которые робот не выполняет.

Задача технического SEO — открыть важные страницы и не расходовать ресурсы обхода на адреса без самостоятельной ценности.

Как проверить сканирование

Для проверки используют журналы сервера, отчёты поисковых систем и инструменты просмотра конкретного URL. Они показывают, обращался ли робот к странице, какой ответ получил и мог ли обработать основной контент.

Источник

Google Search Central: обзор сканирования и индексирования