Представьте, что ваш сайт — это огромный библиотека, а поисковые боты (Googlebot, Yandex и другие) — это читатели, которые хотят найти самые интересные книги. Файл robots.txt — это правила этой библиотеки. Он говорит посетителям: «Вот эти залы открыты для вас, а вот в тот подвал лучше не заходить, там пыль и технические помещения».
Если настроить robots.txt неправильно, поисковики будут тратить время на «мусорные» страницы, а ваш полезный контент может остаться без внимания. В этой статье мы разберем, как грамотно составить файл robots.txt, сэкономить краулинговый бюджет и ускорить индексацию действительно важных страниц.
Что такое robots.txt и как он работает?
robots.txt — это текстовый файл, который располагается в корневой директории сайта (например, site.com/robots.txt). Он работает на основе Протокола исключения роботов (Robot Exclusion Protocol).
Важное правило SEO: Файл robots.txt управляет сканированием (краулингом), а не самой индексацией.
- Если вы закроете страницу в
robots.txt, бот не будет ее скачивать. - Но если на эту закрытую страницу будут ссылаться другие сайты, поисковик может добавить ее в индекс без текста (по ссылке).
- Чтобы полностью удалить страницу из поиска, используйте мета-тег
<meta name="robots" content="noindex">или HTTP-заголовокX-Robots-Tag.
Базовый синтаксис: язык, на котором говорят с ботами
Файл состоит из пар «директива: значение». Основные директивы:
- User-agent — указывает, для какого бота применяются правила. Звездочка (
*) означает всех ботов. - Disallow — запрещает сканирование указанной директории или файла.
- Allow — разрешает сканирование (используется для переопределения
Disallowдля конкретных файлов). - Sitemap — указывает ботам путь к карте сайта (XML).
- Crawl-delay — задает задержку между запросами бота (в секундах). Примечание: Google игнорирует эту директиву, но она может быть полезна для снижения нагрузки на сервер от других ботов.
5 шагов к улучшению индексации через robots.txt
1. Экономим краулинговый бюджет
У каждого сайта есть «краулинговый бюджет» — лимит страниц, которые поисковик готов сканировать за один визит. Если бот тратит время на технические дубли, он может не дойти до новых статей или товаров.
Что обязательно нужно закрыть:
- Административные панели (
/admin/,/wp-admin/). - Корзину и оформление заказов (
/cart/,/checkout/). - Внутренний поиск по сайту (
/search?q=...). - Служебные скрипты и API (
/api/). - Страницы сессий и сортировки (если они создают миллионы дублей).
2. Указываем на карту сайта (Sitemap)
Директива Sitemap — это лучший способ подсказать ботам, где лежат все ваши актуальные ссылки. Это критически важно для быстрого индексирования новых страниц.
<code>Sitemap: https://example.com/sitemap.xml Sitemap: https://example.com/sitemap-news.xml</code>
Размещайте директиву Sitemap в самом низу файла, и она должна применяться ко всем User-agent.
3. Осторожно работаем с параметрами URL (UTM-метки, фильтры)
Если у вас интернет-магазин или блог, ссылки с UTM-метками (?utm_source=...) или параметрами сортировки (?sort=price) создают тысячи дублей.
Закрывать их через robots.txt можно, но лучше использовать группировку параметров в Яндекс.Вебмастере (директива Clean-param) и канонические ссылки (rel="canonical").
Если вы все же закрываете параметры в robots.txt, используйте символ $ (конец строки) или точные совпадения, чтобы случайно не отрезать нужный контент:
<code># Плохо: закроет и /catalog/?sort=price, и /catalog/apple/ Disallow: /catalog/? # Хорошо: закрывает только конкретный параметр в корне Disallow: /*?utm_source=</code>
4. Управляем ИИ-ботами (Тренд 2026 года)
Сегодня поисковые системы — это не только Google и Yandex. Ваш контент могут сканировать боты для обучения нейросетей (GPTBot, ClaudeBot, Applebot-Extended).
Если вы не хотите, чтобы ваш эксклюзивный контент или статьи использовались для обучения ИИ, вы можете закрыть их в robots.txt:
<code>User-agent: GPTBot User-agent: ClaudeBot User-agent: Applebot-Extended Disallow: /</code>
Если вы, наоборот, хотите, чтобы ИИ цитировал ваш сайт, просто не добавляйте эти правила.
5. НИКОГДА не блокируйте CSS и JavaScript!
Это главная ошибка вебмастеров. Современные поисковики (особенно Google с его Mobile-First индексацией) рендерят страницы как обычные пользователи. Если вы закроете папки //css/ или /js/ в robots.txt, поисковик увидит «сломанную» верстку, не сможет прочитать контент и понизит сайт в выдаче.
Топ-3 фатальные ошибки в robots.txt
1. Случайная блокировка всего сайта.
Ошибка: Disallow: / (без указания User-agent). Это закроет сайт для всех ботов, и он исчезнет из поиска.
Решение: Всегда проверяйте синтаксис перед загрузкой на сервер.
2. Игнорирование слешей (слэшей).
Директива Disallow: /catalog заблокирует не только /catalog, но и /catalogs, /catalog-item, /catalogy.
Решение: Используйте Disallow: /catalog/ или Disallow: /catalog$.
3. Попытка удалить страницы из индекса.
Как упоминалось выше, robots.txt не удаляет страницы. Если страница уже в индексе, а вы закрываете ее в robots.txt, поисковик перестанет ее обновлять, но она там останется.
Решение: Используйте noindex или настройте 301-редирект.
Пример идеального robots.txt для интернет-магазина
<code># Правила для всех ботов User-agent: * Disallow: /admin/ Disallow: /cart/ Disallow: /checkout/ Disallow: /personal/ Disallow: /search/ Disallow: /*?utm_ Disallow: /*?sort= Disallow: /api/ # Разрешаем важные ресурсы (на случай, если выше есть широкие запреты) Allow: //css/ Allow: /js/ Allow: /images/ # Указываем карты сайта Sitemap: https://example.com/sitemap.xml Sitemap: https://example.com/sitemap-products.xml</code>
Как проверить robots.txt?
Перед публикацией файл нужно обязательно протестировать. Опечатка в один символ может стоить вам трафика.
- Яндекс.Вебмастер: Инструмент «Анализ robots.txt». Позволяет проверить, как бот Яндекса понимает ваш файл, и увидеть, какие страницы будут заблокированы.
- Google Search Console: Раздел «Настройки сканирования» (или отчеты по индексации). Google показывает, какие ресурсы заблокированы и есть ли ошибки в файле.
- Сторонние валидаторы: Например,
technicalseo.com/tools/robots-txt/— отлично подсвечивают синтаксические ошибки.
Резюме
robots.txt — это не магия, которая мгновенно выведет сайт в ТОП-1. Это гигиена сайта. Грамотно настроенный файл:
- Освобождает краулинговый бюджет для ваших новых и важных страниц.
- Защищает от попадания в индекс технического мусора и дублей.
- Помогает ботам быстрее находить свежий контент через Sitemap.
- Дает вам контроль над тем, как ваш контент используется современными ИИ-алгоритмами.
Регулярно audits ваш robots.txt при каждом редизайне или переезде сайта, и поисковые системы отблагодарят вас быстрой индексацией и ростом органического трафика!
