Индексация сайта — это процесс обработки и добавления страниц в базу поисковой системы. Если страница находится в индексе, Яндекс или Google может показывать её пользователям по подходящим запросам.
Попадание в индекс не гарантирует высоких позиций и большого трафика. Оно означает, что поисковая система знает о странице, обработала доступную информацию и допускает её участие в поиске.
Страница может быть технически доступна посетителям, но отсутствовать в индексе. Возможна и обратная ситуация: адрес страницы известен поисковой системе, хотя её содержимое не было полноценно просканировано.
Как происходит индексация сайта
В упрощённом виде работа поисковой системы состоит из нескольких этапов.
Обнаружение страницы
Сначала поисковому роботу необходимо узнать, что URL существует.
Новые страницы могут быть обнаружены через:
- внутренние ссылки сайта;
- ссылки с других ресурсов;
- файл Sitemap;
- Яндекс Вебмастер или Google Search Console;
- протокол IndexNow;
- ранее известные адреса;
- перенаправления с других страниц.
Sitemap содержит ссылки на актуальные страницы и помогает поисковым системам понимать структуру сайта. При этом наличие URL в карте сайта не является гарантией его индексирования.
Сканирование страницы
Поисковый робот обращается к URL и получает ответ сервера. Этот этап также называют обходом или краулингом.
Робот анализирует:
- код ответа сервера;
- HTML-код;
- текст;
- заголовки;
- ссылки;
- изображения;
- мета-теги;
- канонический адрес;
- правила индексирования;
- часть подключённых ресурсов.
Если сервер не отвечает, возвращает ошибку или блокирует робота, обработка страницы может быть затруднена.
Обработка содержимого
Поисковая система старается определить:
- о чём страница;
- является ли содержимое уникальным;
- какую потребность пользователя она решает;
- не дублирует ли она другой URL;
- какой адрес считать основным;
- допускается ли её показ в поиске.
Для страниц, содержимое которых формируется с помощью JavaScript, может потребоваться дополнительная обработка. Поэтому важный текст и ссылки должны быть доступны поисковому роботу, а не появляться только после обязательного действия пользователя.
Добавление в индекс
После обработки страница может быть добавлена в поисковый индекс, исключена из него или признана второстепенной копией другого URL.
Причины исключения могут быть техническими и содержательными. Например, страница может быть закрыта через noindex, возвращать ошибку, дублировать другой документ или не представлять самостоятельной ценности.
Ранжирование
Когда пользователь вводит запрос, поисковая система выбирает из индекса подходящие страницы и определяет порядок их отображения.
Индексация и ранжирование — разные процессы:
- индексация отвечает за возможность участия страницы в поиске;
- ранжирование определяет её позицию по конкретному запросу.
Поэтому страница может находиться в индексе, но не появляться на заметных позициях.
Какие страницы должны индексироваться
В индекс обычно должны попадать страницы, которые представляют самостоятельную ценность для пользователя:
- основные услуги;
- товарные категории;
- карточки доступных товаров;
- статьи;
- кейсы;
- страницы специалистов;
- полезные инструкции;
- контакты и информация о компании.
Не все технически существующие URL нужно показывать в поиске.
Обычно ограничивают или отдельно анализируют:
- страницы авторизации;
- личные кабинеты;
- корзину и оформление заказа;
- результаты внутреннего поиска;
- технические параметры фильтра;
- служебные страницы;
- дубли;
- тестовые версии;
- адреса с неконтролируемыми параметрами;
- страницы без самостоятельного содержания.
Цель технической оптимизации состоит не в максимальном количестве URL в индексе, а в наличии там полезных и актуальных страниц.
Почему страница не индексируется
Отсутствие страницы в поиске может быть связано с разными причинами.
Поисковый робот не нашёл URL
Такое происходит, если на страницу не ведут внутренние ссылки, она отсутствует в Sitemap и нигде не упоминается.
Страница, доступная только после использования фильтра, формы или JavaScript-сценария, также может остаться незамеченной.
Индексирование запрещено
Запрет может быть установлен через:
-
метатег
robotsсо значениемnoindex; -
HTTP-заголовок
X-Robots-Tag; - настройки CMS;
- пароль или ограничение доступа;
- правила серверной конфигурации.
Чтобы noindex сработал, робот должен получить доступ к странице и прочитать директиву. Если URL одновременно закрыт в robots.txt, поисковая система может не увидеть метатег. На эту особенность отдельно указывают Яндекс и Google.
Сервер возвращает неправильный ответ
Важная страница может:
- отдавать ошибку 404 или 500;
- попадать в бесконечную цепочку перенаправлений;
- долго не отвечать;
- возвращать пустой документ;
- быть недоступной только для поискового робота.
Иногда пользователь видит привычную страницу ошибки, но сервер возвращает код 200 OK. Поисковой системе сложнее правильно интерпретировать такой ответ.
Страница дублирует другой URL
Одинаковое или почти одинаковое содержимое может быть доступно:
- с параметрами и без них;
- со слешем и без слеша;
- по HTTP и HTTPS;
-
с
wwwи безwww; - через несколько категорий;
- по разным адресам фильтрации.
Поисковая система может выбрать один вариант основным, а остальные исключить из индекса.
Содержимое недостаточно полезно
Страница может быть доступной и технически корректной, но не попасть в поиск, если она:
- почти не содержит информации;
- автоматически создана без понятной задачи;
- полностью повторяет другие страницы;
- состоит из шаблонных элементов;
- не отвечает на самостоятельный запрос пользователя.
Яндекс позволяет отдельно просматривать страницы, исключённые как малоценные или маловостребованные, и рекомендует дорабатывать важные URL из этой группы.
Основной контент недоступен роботу
Проблема встречается на сайтах, где информация загружается только после клика, прокрутки или выполнения скрипта.
Особенно важно проверить:
- каталоги;
- бесконечную прокрутку;
- вкладки;
- фильтры;
- карточки товаров;
- мобильную версию;
- страницы одностраничных приложений.
Как проверить индексацию сайта
Для полноценной диагностики желательно использовать несколько источников.
Яндекс Вебмастер
Сервис позволяет посмотреть:
- страницы в поиске;
- исключённые страницы;
- причины исключения;
- дату обхода;
- ответ сервера;
- обнаруженные мета-теги;
- выбранный канонический адрес;
- возможность индексирования.
Инструмент анализа URL проверяет ответ страницы, robots.txt, метатег robots и другие параметры.
Google Search Console
Инструмент проверки URL показывает:
- известна ли страница Google;
- разрешено ли индексирование;
- какой адрес выбран каноническим;
- когда робот посещал страницу;
- обнаружены ли технические ограничения.
Поисковый оператор site:
Запрос вида site:example.ru помогает быстро найти часть страниц домена в выдаче.
Однако этот способ не показывает точное и полное количество URL. Для технической проверки лучше использовать панели поисковых систем и данные обхода.
Серверные журналы
Логи сервера позволяют увидеть, какие страницы реально посещали поисковые роботы, какие ответы получили и как часто возвращались.
Такой анализ особенно полезен для крупных сайтов, интернет-магазинов и проектов со сложной структурой.
Как улучшить индексацию сайта
Чтобы важные страницы стабильно обнаруживались и обрабатывались, необходимо проверить несколько уровней сайта.
- Добавить внутренние ссылки на значимые страницы.
- Поддерживать актуальный Sitemap.
-
Исключить случайные запреты в
robots.txtи метатегах. - Настроить корректные коды ответа сервера.
- Устранить дубли и цепочки перенаправлений.
- Указать основные версии страниц.
- Сделать важное содержимое доступным без обязательного клика.
- Улучшить страницы с недостаточным содержанием.
- Удалить из Sitemap технические и закрытые URL.
- Проверить скорость и стабильность сервера.
- Сообщать поисковым системам о значимых новых страницах.
В Яндекс Вебмастере можно отправить приоритетные URL на переобход. Для автоматического сообщения о новых, изменённых и удалённых страницах также используется IndexNow.
Можно ли ускорить индексацию
Поисковой системе можно помочь быстрее обнаружить изменение, но гарантировать конкретный срок нельзя.
Для новой или обновлённой страницы полезно:
- поставить внутренние ссылки;
- включить URL в Sitemap;
- отправить его на переобход;
- убедиться в отсутствии запретов;
- проверить ответ сервера;
- добавить содержательный и уникальный материал;
- разместить ссылку в подходящем разделе сайта.
Массовая отправка слабых страниц на переобход не решает проблему качества. Если поисковая система регулярно исключает URL, необходимо устранить причину, а не только повторно сообщать об их существовании.
Почему важно контролировать не только отсутствие, но и избыток страниц
Проблемой может быть не только неполная, но и избыточная индексация.
На крупных сайтах поисковый робот может тратить ресурсы на:
- бесконечные комбинации фильтров;
- сортировки;
- параметры отслеживания;
- пустые категории;
- дубли товаров;
- архивные служебные страницы.
В результате важные разделы обходятся реже, а в поиске появляются слабые URL, которые не должны конкурировать с основными страницами.
Поэтому индексацию оценивают не по принципу «чем больше, тем лучше», а по соответствию структуры индекса полезной структуре сайта.
Коротко об индексации сайта
Индексация — это добавление страницы в базу поисковой системы. Она необходима для показа в поиске, но сама по себе не гарантирует хорошие позиции.
Для нормальной индексации важно, чтобы страница:
- была доступна поисковому роботу;
- возвращала корректный ответ;
- не содержала случайного запрета;
- имела внутренние ссылки;
- не дублировала другой URL;
- содержала полезную информацию;
- соответствовала назначению сайта.