Как происходит сканирование
Поисковый робот начинает с уже известных адресов, переходит по ссылкам и загружает страницы. Новые URL он также может получить из карты сайта, внешних ссылок и других источников поисковой системы.
При каждом обращении сервер возвращает код ответа и содержимое. Робот учитывает перенаправления, запреты на обход, канонические адреса и доступность ресурсов, необходимых для отображения страницы.
Сканирование не означает индексацию
Загрузка страницы — только один этап. После неё поисковая система обрабатывает материал и решает, добавлять ли его в индекс. Страница может регулярно сканироваться, но не участвовать в поиске из-за дублей, низкой ценности, технических сигналов или другого решения системы.
Следующий этап подробно разобран в определении индексирования.
Что может мешать обходу
- запреты в
robots.txt; - ошибки сервера и длинные цепочки перенаправлений;
- страницы, на которые не ведут внутренние ссылки;
- бесконечные комбинации фильтров и технических параметров;
- контент, доступный только после действий, которые робот не выполняет.
Задача технического SEO — открыть важные страницы и не расходовать ресурсы обхода на адреса без самостоятельной ценности.
Как проверить сканирование
Для проверки используют журналы сервера, отчёты поисковых систем и инструменты просмотра конкретного URL. Они показывают, обращался ли робот к странице, какой ответ получил и мог ли обработать основной контент.