Как пользоваться
- Выберите пресет — WordPress, Laravel, интернет-магазин или закрыть AI-ботов — либо начните с пустой группы
User-agent: *. - В каждой группе выберите бота из списка (Googlebot, YandexBot, GPTBot, ClaudeBot…) или впишите свой, добавьте строки
Disallow/Allow. Enter в поле пути создаёт следующее правило. - Впишите адреса карт сайта — по одному в строку. Готовый файл справа обновляется на лету; Копировать или Скачать robots.txt.
- Проверьте результат: вставьте URL или путь, выберите бота — инструмент скажет «разрешён» или «запрещён» и покажет сработавшее правило.
- Уже есть robots.txt? Нажмите Импорт, вставьте файл — он разберётся в группы, а устаревшие директивы вроде
Hostбудут отмечены.
Как краулер читает robots.txt
Файл лежит в корне хоста (https://site.com/robots.txt) и состоит из групп: одна или несколько строк User-agent, затем правила Disallow и Allow. Бот ищет группу со своим токеном (Googlebot-Image сначала ищет Googlebot-Image, потом Googlebot), и только если ничего не нашёл — берёт группу *. Правила из чужих групп он не читает вообще: если для Googlebot есть отдельная группа, запреты из * на него не действуют.
При конфликте правил побеждает то, чей путь длиннее (по числу символов), а при равной длине — Allow. Так Disallow: /admin вместе с Allow: /admin/public закроет всю админку, кроме публичной папки. Звёздочка * заменяет любую последовательность символов, $ в конце — «здесь путь заканчивается»: Disallow: /*.pdf$ закроет PDF, но не /file.pdf?dl=1. Пустой Disallow: ничего не запрещает. Проверялка в инструменте реализует именно этот алгоритм (RFC 9309, он же — реализация Google).
Что понимают Google и Яндекс, а что нет
| Директива | Яндекс | Комментарий | |
|---|---|---|---|
User-agent, Disallow, Allow | да | да | основа стандарта; * и $ понимают оба |
Sitemap | да | да | полный URL, можно несколько, положение в файле не важно |
Crawl-delay | игнорирует | игнорирует с 2018 | частоту обхода задают в Search Console и Вебмастере; читают Bing и часть SEO-ботов |
Clean-param | нет | да | параметры, не меняющие контент (utm_*, sort) — Яндекс склеит дубли |
Host | нет | нет | устарела: главное зеркало задаётся 301-редиректом и в Вебмастере |
Noindex | нет | нет | закрывать от индекса надо meta robots или заголовком X-Robots-Tag |
AI-боты в 2026 году
Отдельная задача — решить, кого из ИИ-краулеров пускать. Пресет «Закрыть AI-ботов, оставить поиск» блокирует ботов, собирающих данные для обучения: GPTBot, ClaudeBot, anthropic-ai, CCBot, Bytespider, PerplexityBot, Google-Extended, Applebot-Extended, meta-externalagent, Amazonbot. Обычный поиск он не трогает: Google-Extended — отдельный токен для Gemini, на ранжирование в Google он не влияет. А вот OAI-SearchBot и ChatGPT-User отвечают за показ вашего сайта в поиске ChatGPT и переходы по ссылкам — их закрывать стоит только осознанно, иначе исчезнете из ИИ-ответов вместе с трафиком.
Частые ошибки
- Закрыть CSS и JS. Google рендерит страницы; без стилей и скриптов он увидит «сломанную» вёрстку и может понизить страницу. Пресеты явно разрешают
/*.css$и/*.js$. - Надеяться, что Disallow уберёт страницу из индекса. Не уберёт: Google может показывать URL без сниппета, если на него ведут ссылки. Для удаления нужен
noindexпри открытом для обхода URL. - Путь без слэша в начале (
Disallow: admin) — правило не сработает; инструмент подсветит это в статусе. - Забыть про регистр. Пути чувствительны к регистру:
/Adminи/admin— разные строки.
Частые вопросы
Как закрыть сайт от индексации через robots.txt?
Пресет «Закрыть сайт» даёт User-agent: * и Disallow: /. Но помните: это запрет на обход, а не на индекс — уже известные URL могут остаться в выдаче без описания. Надёжнее вместе с этим отдавать meta robots noindex или закрыть сайт паролем.
Что сильнее — Allow или Disallow?
Побеждает правило с более длинным путём. Если длины равны, Google и Яндекс выбирают Allow. Поэтому Allow: /admin/public перекрывает Disallow: /admin, а Allow: /$ открывает только главную при закрытом остальном сайте.
Google учитывает Crawl-delay?
Нет, Google полностью игнорирует эту директиву, Яндекс перестал её читать в 2018 году. Скорость обхода регулируется в Search Console и Яндекс Вебмастере. Crawl-delay ещё понимают Bing, Yahoo и часть SEO-краулеров вроде AhrefsBot.
Как запретить GPTBot и другие AI-боты, но не потерять Google?
Заведите отдельные группы для GPTBot, ClaudeBot, CCBot, Bytespider, PerplexityBot, Google-Extended с Disallow: /, а группу * оставьте открытой — так делает пресет «Закрыть AI-ботов». Googlebot и YandexBot читают только свою или общую группу, запреты для других ботов их не касаются.
Нужна ли директива Host для Яндекса?
Нет, Яндекс отказался от Host в 2018 году. Главное зеркало теперь определяется 301-редиректом между версиями сайта и настройками в Вебмастере. При импорте старого файла инструмент отметит Host как устаревший и не перенесёт его в результат.
Проверка URL здесь совпадает с Search Console?
Инструмент реализует алгоритм из RFC 9309 и открытой библиотеки Google: выбор группы по токену бота, самый длинный совпавший путь, поддержка * и $, приоритет Allow при равенстве. Разница возможна только для нестандартных краулеров с собственными правилами разбора.