Краулинговый бюджет: почему не все страницы обходятся одинаково
Поисковый робот Яндекса (он называется YandexBot) не обходит весь интернет бесконечно и не перечитывает каждый сайт каждый день. У него ограниченные ресурсы, которые он распределяет между миллиардами страниц. Этот ресурс принято называть краулинговым бюджетом.
Краулинговый бюджет — это не фиксированное число. Это динамическая квота, которую Яндекс выделяет вашему сайту исходя из нескольких факторов.
От чего зависит краулинговый бюджет сайта
- Авторитетность сайта. Чем старше домен, чем больше у него входящих ссылок и качественного контента, тем чаще робот возвращается. Новый сайт без истории обходится реже, чем давно работающий ресурс с репутацией.
- Скорость ответа сервера. Если сайт загружается медленно или периодически недоступен, робот будет обходить его осторожнее — чтобы не нагружать нестабильный сервер. Быстрый сервер позволяет роботу обойти больше страниц за один визит.
- Частота обновления контента. Сайт, на котором регулярно появляются новые страницы, привлекает робота чаще. Если сайт не обновлялся несколько месяцев, частота обходов снижается.
- Количество страниц. Маленький сайт из 50 страниц обходится относительно быстро: робот успевает пройтись по всему сайту за один-два визита. Крупный интернет-магазин с сотнями тысяч страниц обходится иначе: при ограниченном бюджете робот каждый раз видит только часть сайта, и новые страницы могут ждать своей очереди неделями.
Вот почему проблема «страница не индексируется» особенно актуальна для крупных сайтов. На небольшом корпоративном сайте новая страница попадает в индекс быстро: бюджета хватает на весь сайт с запасом. На интернет-магазине с огромным каталогом робот может обходить лишь часть страниц за визит, и приоритет получают те, к которым легче добраться.
Следить за тем, как Яндекс обходит ваш сайт, можно в Яндекс Вебмастере: раздел «Индексирование» → «Страницы в поиске» показывает, сколько страниц включено в индекс, а «Статистика обхода» — как менялась активность робота во времени. Подробнее о регулярном мониторинге сайта в Вебмастере рассказывает статья о еженедельном контроле сайта через Яндекс Вебмастер.
XML-Sitemap: как помочь роботу найти новые страницы
XML-Sitemap — это файл, в котором вы перечисляете адреса всех страниц сайта. Робот получает готовый список и не должен искать страницы самостоятельно, переходя по ссылкам. Это особенно важно для новых страниц, на которые ещё нет внутренних ссылок.
Требования к формату sitemap
Яндекс принимает стандартный формат XML-Sitemap. Несколько требований, о которых стоит помнить:
- Только реальные страницы. В sitemap включают только те URL, которые должны быть в индексе. Страницы с тегом noindex, параметрические дубли, технические страницы корзины — в sitemap не попадают. Включить такие страницы означает дать роботу противоречивый сигнал.
- Соответствие robots.txt. URL в sitemap не должен быть закрыт в robots.txt. Если страница закрыта от обхода, но указана в sitemap, Яндекс увидит противоречие и может проигнорировать и то, и другое.
- Актуальность файла. Удалённые страницы нужно убирать из sitemap. Битые ссылки в файле снижают доверие к нему и тратят краулинговый бюджет впустую.
- Тег lastmod. Атрибут даты последнего изменения помогает роботу расставить приоритеты: недавно обновлённые страницы он обойдёт раньше. Но Яндекс проверяет, соответствует ли указанная дата реальным изменениям на странице. Если обновлять дату без изменения контента, это не принесёт пользы.
Как добавить sitemap в Яндекс Вебмастер
Есть два пути. Первый — указать sitemap в файле robots.txt строкой Sitemap: https://ваш-сайт.ru/sitemap.xml. Яндекс найдёт её автоматически при следующем обходе robots.txt.
Второй — добавить sitemap вручную через Яндекс Вебмастер: раздел «Индексирование» → «Файлы Sitemap» → «Добавить файл». После добавления Яндекс начнёт читать файл при ближайшем плановом визите.
Важный нюанс: добавление sitemap не означает мгновенную индексацию. Яндекс прочитает файл, узнает о страницах, но решение о времени обхода и включении в индекс принимает самостоятельно. Sitemap сокращает время обнаружения страниц, но не гарантирует конкретный срок индексации.
Когда sitemap особенно важен
Для небольшого сайта с хорошей внутренней перелинковкой sitemap скорее дополнительная страховка: робот найдёт страницы и по ссылкам. Но sitemap критически важен в трёх ситуациях:
- Новый сайт или свежезапущенный раздел — страницы ещё нет ни одной внешней ссылки и мало внутренних.
- Крупный сайт с тысячами страниц — sitemap помогает роботу видеть весь масштаб сайта и не пропускать разделы с небольшим количеством внутренних ссылок.
- Страницы с динамическими URL или сложной структурой — там, где обходу по ссылкам мешают JavaScript-рендеринг или нестандартная архитектура.
Внутренняя перелинковка для краулинга: глубина имеет значение
Поисковый робот движется по сайту, следуя за ссылками. Если на новую страницу нет ни одной внутренней ссылки, робот может её просто не найти, даже если она указана в sitemap. Внутренние ссылки — это дороги, по которым робот добирается до контента.
Почему «глубина» страницы важна для индексации
Глубина страницы — это количество кликов от главной страницы до нужного URL. Страница на глубине одного клика (прямая ссылка с главной) будет обнаружена и проиндексирована намного быстрее, чем страница на глубине четырёх-пяти кликов.
Причина простая: при каждом визите робот начинает с наиболее авторитетных страниц (обычно главной и разделов верхнего уровня) и двигается вглубь. Если краулинговый бюджет исчерпается на третьем уровне, страницы глубже робот в этот раз не увидит.
Как использовать перелинковку для ускорения индексации
- Ссылка с главной или популярных разделов. Если вы опубликовали важную страницу (акция, новая услуга, ключевая статья), добавьте ссылку на неё с главной страницы или из раздела-рубрики. Это сигнализирует роботу: страница важна. Он обойдёт её быстрее.
- Ссылки из популярного контента. Если на сайте есть страницы, которые Яндекс обходит часто (высокопосещаемые статьи, часто обновляемые разделы), добавьте в них ссылку на новую страницу. Вместе с ближайшим плановым обходом популярной страницы робот найдёт и новую.
- Навигационные блоки. Меню, хлебные крошки, блоки «Похожие статьи» — всё это не только помогает пользователю ориентироваться, но и даёт роботу дополнительные пути к страницам. Страница, доступная из нескольких мест на сайте, индексируется надёжнее.
- Раздел «Новости» или «Обновления». Если на сайте есть раздел, который обновляется часто и Яндекс это знает, именно туда стоит добавлять ссылки на свежий контент. Робот заходит в часто обновляемые разделы охотнее.
Подробнее о том, как выстроить внутреннюю перелинковку стратегически — не только для краулинга, но и для передачи ссылочного веса, — можно прочитать в статье о внутренней перелинковке сайта.
Инструмент «Переобход страниц» в Яндекс Вебмастере
Яндекс Вебмастер предоставляет инструмент для ручной отправки URL на приоритетный обход. Он позволяет сообщить Яндексу: вот конкретная страница, обойдите её в приоритетном порядке.
Как пользоваться инструментом
В Яндекс Вебмастере перейдите в раздел «Индексирование» → «Переобход страниц». Введите URL страницы и отправьте его в очередь на приоритетный обход. Это именно инструмент постановки в очередь — не диагностический. Если нужно проверить, что именно видит робот при обходе и нет ли технических блокеров, для этого есть отдельный инструмент: «Проверка страницы» (раздел «Индексирование» → «Проверка страницы»).
Лимиты и когда инструмент помогает
У инструмента есть ограничения по количеству URL, которые можно добавить за день. Это делает его подходящим для точечных задач: опубликовали новую важную страницу или исправили критическую ошибку на существующей. Не для массовой переиндексации тысяч страниц.
Инструмент ускоряет обход, но не гарантирует мгновенное попадание в индекс. Яндекс обойдёт страницу и только потом примет решение об индексации. Если страница не прошла проверку качества, она останется за пределами индекса даже после приоритетного обхода.
Что делать, если страница не индексируется после добавления
Причин может быть несколько. Прежде чем делать выводы, убедитесь, что нет технических блокеров (о них подробно в следующем разделе). Если блокеров нет, а страница всё равно не появляется в индексе после нескольких недель, можно обратиться в поддержку Яндекс Вебмастера. Для этого в интерфейсе Вебмастера есть раздел «Поддержка» с формой обращения.
Технические блокеры: что мешает индексации
Прежде чем искать способы ускорить индексацию, стоит убедиться, что ей ничто не мешает. Самые распространённые технические причины, по которым страница не попадает в индекс:
| Блокер | Как возникает | Как проверить |
|---|---|---|
| Тег noindex | Поставлен по ошибке при публикации (часто в CMS переходит с черновика на готовую страницу) | Открыть исходный код страницы, найти <meta name="robots"> |
| Закрытие в robots.txt | Раздел или маска URL закрыты правилом Disallow | Проверить через Яндекс Вебмастер → «Инструменты» → «Проверка robots.txt» |
| Canonical на другую страницу | Тег rel=canonical указывает на другой URL как основной; текущая страница считается дублем | Проверить в исходном коде тег <link rel="canonical"> |
| Цепочка редиректов | Несколько последовательных 301-редиректов увеличивают время ответа и создают риск, что робот не дойдёт до конечного URL | Проверить через инструменты типа Redirect Checker или в консоли разработчика браузера |
| Ответ сервера не 200 | Страница возвращает код 404, 403, 500 или другой, отличный от 200 | Проверить через инструмент «Проверка страницы» в Яндекс Вебмастере или через курл |
| JavaScript-рендеринг без серверного | Содержимое страницы формируется только JavaScript; робот не видит текста в HTML | Отключить JS в браузере и проверить, отображается ли контент |
Чеклист проверки перед отправкой в очередь
- Открыть исходный код страницы. Найти мета-тег robots. Убедиться, что там нет значения noindex.
- Проверить тег canonical: он должен указывать на этот же URL, а не на другой.
- Зайти в robots.txt и убедиться, что URL не попадает под Disallow.
- Проверить HTTP-статус страницы: должен быть 200.
- Убедиться, что нет длинных цепочек редиректов: желательно максимум один переход.
- Проверить скорость загрузки: очень медленные страницы получают меньший приоритет при обходе.
Если хотите провести полную техническую проверку сайта, включая все перечисленные проблемы и другие факторы, которые влияют на видимость в поиске, — читайте статью о техническом SEO-аудите сайта.
Особенности для крупных сайтов: управление краулинговым бюджетом
На сайте с тысячами и десятками тысяч страниц задача не просто «ускорить индексацию новой страницы», а обеспечить, чтобы краулинговый бюджет тратился на нужные страницы, а не распылялся на технический мусор.
Закрыть мусорные разделы от обхода
Если на сайте есть разделы, которые не должны быть в поиске (личные кабинеты, страницы корзины, технические страницы сравнения, страницы с параметрами сессий), их нужно закрыть от обхода в robots.txt. Каждый визит к таким страницам — потраченный краулинговый бюджет без пользы.
Убрать дублирующиеся параметры URL
Фильтры, сортировки, UTM-метки в URL создают множество технических дублей. Например, страница /catalog/chairs/ доступна по десяткам адресов: с параметрами ?sort=price, ?color=black,?utm_source=email. Для пользователя это одна страница, для поискового робота — разные URL.
Решения: закрыть параметрические URL в robots.txt, добавить canonical на основную версию страницы, настроить канонизацию параметров в Яндекс Вебмастере через раздел «Индексирование» → «Параметры URL».
Пагинация: что индексировать, что нет
Страницы пагинации (вторая, третья, десятая страница каталога) создают нагрузку на краулинговый бюджет. При этом страницы с глубокой пагинацией часто не несут самостоятельной ценности для пользователей из поиска.
Распространённый подход: закрыть страницы пагинации от индексации через noindex, оставив обход открытым, чтобы робот по ссылкам на них мог найти товары и страницы в каталоге. Но это решение зависит от структуры конкретного сайта: иногда страницы пагинации сами по себе получают трафик из поиска по высокочастотным запросам.
Как выделить приоритет для важных страниц
Логика простая: чем короче путь от главной страницы к важной странице и чем больше ссылок на неё ведёт, тем чаще робот её обходит. Для ключевых страниц (новые услуги, лендинги акций, важные статьи) это означает:
- Добавить прямую ссылку с главной страницы или из меню навигации.
- Включить страницу в sitemap с актуальной датой lastmod.
- Добавить ссылку на неё из двух-трёх существующих популярных страниц.
- Подать URL через инструмент «Переобход страниц» в Вебмастере.
Сроки индексации: что считать нормой и когда бить тревогу
Нет единого стандарта «страница должна проиндексироваться за X дней». Скорость зависит от множества факторов: возраста домена, частоты обновления сайта, количества входящих ссылок, качества контента и технического состояния сайта.
| Тип сайта | Ориентировочный срок | Что влияет |
|---|---|---|
| Новый домен (до года) | От нескольких недель до 2–3 месяцев | Нет истории у домена; робот обходит редко |
| Устоявшийся сайт с регулярными обновлениями | От нескольких дней до 2 недель | Высокая частота обходов; хорошая внутренняя перелинковка |
| Крупный сайт с большим каталогом | От 1 до 4 недель | Зависит от приоритета: страница в sitemap и с внутренними ссылками попадёт быстрее |
| Страница без внутренних ссылок | Непредсказуемо, возможно никогда | Робот может просто не добраться до страницы |
Когда стоит обратиться в поддержку
Если страница без технических блокеров не появляется в индексе в течение нескольких недель после того, как вы исправили всё по чеклисту выше, — это повод написать в поддержку Яндекс Вебмастера. Особенно если речь идёт о коммерчески важной странице.
В обращении укажите: URL страницы, дату публикации, что именно вы проверили (robots.txt, canonical, noindex), скриншот или данные из «Переобхода страниц» в Вебмастере. Конкретика ускоряет разбор обращения.
Как проверить, попала ли страница в индекс
Самый простой способ: ввести в строку поиска Яндекса полный URL страницы в кавычках. Если страница есть в индексе, Яндекс её покажет. Также можно воспользоваться запросом site:ваш-сайт.ru/путь-к-странице — он покажет, проиндексирован ли конкретный URL.
В Яндекс Вебмастере инструмент «Проверка страницы» (раздел «Индексирование» → «Проверка страницы») позволяет напрямую проверить, что именно видит робот при обходе конкретного URL: доступна ли страница, нет ли технических блокеров при обходе.
Коротко о главном
- Краулинговый бюджет — ресурс Яндекса на обход вашего сайта. Чем авторитетнее сайт и быстрее сервер, тем больше страниц робот обходит за визит.
- XML-Sitemap помогает роботу узнать о страницах быстрее. Включайте только реальные индексируемые страницы, убирайте удалённые, поддерживайте актуальный lastmod.
- Внутренние ссылки — главный инструмент управления краулингом. Страница без внутренних ссылок может не проиндексироваться вообще. Ссылка с главной или популярного раздела резко ускоряет обход.
- Инструмент «Переобход страниц» в Яндекс Вебмастере позволяет добавить URL в очередь на приоритетный обход — используйте для точечных задач, а не для массовой переиндексации.
- Перед отправкой URL проверьте технические блокеры: noindex, Disallow в robots.txt, неправильный canonical, цепочки редиректов, ошибки сервера.
- Для крупных сайтов управление краулинговым бюджетом важнее разовых инструментов: закройте мусорные разделы от обхода, устраните параметрические дубли, выстройте правильную приоритизацию через перелинковку и sitemap.
