← Все статьи

Что такое краулинговый бюджет

08.09.20262 мин чтения
Готовил · Проверил и отредактировал

Краулинговый бюджет

Краулинговый бюджет — это количество страниц, которые поисковый робот (Яндекс или Google) готов обойти на сайте за один визит. Роботы работают в условиях ограниченных ресурсов: каждый раз, когда бот заходит на сайт, он может обработать определённое число URL — и уходит, когда лимит исчерпан. Для небольшого сайта с сотней страниц это практически незаметно. Но для крупного интернет-магазина с десятками тысяч карточек товаров или новостного сайта с ежедневными публикациями краулинговый бюджет определяет, какие страницы попадут в индекс поисковика в ближайшие дни, а какие будут ждать следующего визита — недели или месяцы.

Размер краулингового бюджета не фиксирован: он формируется индивидуально для каждого сайта и постоянно меняется. Поисковик смотрит на несколько факторов: насколько быстро сервер отвечает на запросы робота, как часто обновляются страницы, насколько авторитетен домен и сколько страниц уже находится в индексе. Медленный хостинг — прямой враг краулинга: если страницы грузятся долго, робот обойдёт их меньше за один визит и быстрее уйдёт. Обратное тоже верно: быстрый сайт с регулярно обновляемым контентом сигнализирует поисковику, что сюда стоит приходить чаще и выделять больше ресурсов.

Главная проблема возникает, когда бюджет уходит на страницы, которые не нужны в поиске. Самые типичные «пожиратели»: дубли URL с UTM-метками, страницы с параметрами сортировки и пагинации, бесконечные фильтры каталога, генерирующие тысячи адресов для одного набора товаров, и технические разделы — корзина, личный кабинет, результаты внутреннего поиска по сайту. Если робот обходит тысячи таких страниц, он попросту не добирается до важных: новых категорий, свежих статей, обновлённых карточек. Именно отсюда берётся ситуация, когда сайт работает нормально, а страницы месяцами не появляются в выдаче.

Управлять краулинговым бюджетом помогают несколько инструментов. Первый — robots.txt: закрыть через Disallow всё, что не нужно в поиске — параметрические URL, технические разделы, дубли. Второй — XML-карта сайта (sitemap): она явно указывает роботу, какие страницы важны и требуют регулярного обхода. Третий — склейка дублей через canonical или редиректы 301: если одна страница доступна по нескольким адресам, лучше оставить один. Статистику краулинга для Яндекса смотрят в разделе «Статистика обхода» в Яндекс.Вебмастере — там видно, сколько страниц обходит робот в сутки и есть ли ошибки при обходе.