← Все статьи

Что такое robots.txt

01.09.20262 мин чтения
Готовил · Проверил и отредактировал

Robots.txt

Robots.txt — текстовый файл, который лежит в корне сайта по адресу site.ru/robots.txt и сообщает поисковым роботам, какие страницы можно обходить и индексировать, а какие нет. Это первое, что проверяет робот перед тем, как начать обход сайта. Файл пишется в простом формате: директива User-agent задаёт, к какому роботу относятся правила (звёздочка * — ко всем), Disallow закрывает страницы или разделы от индексации, Allow явно открывает их. Дополнительно в файл вписывают строку Sitemap — ссылку на XML-карту сайта, чтобы робот нашёл её автоматически.

Главная задача robots.txt — управлять обходом сайта, а не защищать данные. Закрытые через Disallow страницы не исчезают из интернета: пользователь может открыть их напрямую по ссылке, а робот просто не будет их индексировать. Чаще всего закрывают служебные разделы — корзину, личный кабинет, страницы с параметрами фильтрации, дубли URL с UTM-метками. Это экономит поисковый бюджет сканирования (crawl budget): робот тратит ресурс на страницы, которые должны попасть в выдачу, а не на служебные дубли без коммерческой ценности.

Неправильный robots.txt может выключить сайт из поиска. Самая распространённая ошибка — строка Disallow: / (закрыть весь сайт) случайно оказывается в живом файле: такое случается при переезде на новый хостинг или копировании настроек с тестового домена. Через несколько дней Яндекс и Google перестают видеть страницы, трафик падает до нуля. Другая ошибка — случайно закрыть главные посадочные страницы или категории каталога. Роботы добросовестно выполняют запрет, и эти страницы выпадают из индекса без каких-либо предупреждений.

Пример корректного robots.txt для интернет-магазина выглядит так: User-agent: * / Disallow: /cart/ / Disallow: /checkout/ / Disallow: /account/ / Allow: / / Sitemap: https://site.ru/sitemap.xml — здесь закрыты корзина, оформление заказа и личный кабинет, всё остальное открыто, а карта сайта указана в файле явно. Проверить robots.txt можно через Яндекс.Вебмастер (раздел «Инструменты» → «Анализ robots.txt») или Google Search Console — оба сервиса покажут, какие URL закрыты, нет ли конфликта между директивами и видит ли поисковик карту сайта.