Конструктор robots.txt онлайн

Соберите robots.txt из групп правил или загрузите готовый, выберите пресет и сразу проверьте, пустит ли файл конкретного бота на конкретный URL — по тому же алгоритму, что у Google.

работает в браузере · данные никуда не отправляются

Пресеты заменяют текущие группы
Группы правил Enter в поле пути — новое правило

    
Проверить URL по этому файлу алгоритм Google: длиннее путь — сильнее

Как пользоваться

  1. Выберите пресет — WordPress, Laravel, интернет-магазин или закрыть AI-ботов — либо начните с пустой группы User-agent: *.
  2. В каждой группе выберите бота из списка (Googlebot, YandexBot, GPTBot, ClaudeBot…) или впишите свой, добавьте строки Disallow / Allow. Enter в поле пути создаёт следующее правило.
  3. Впишите адреса карт сайта — по одному в строку. Готовый файл справа обновляется на лету; Копировать или Скачать robots.txt.
  4. Проверьте результат: вставьте URL или путь, выберите бота — инструмент скажет «разрешён» или «запрещён» и покажет сработавшее правило.
  5. Уже есть robots.txt? Нажмите Импорт, вставьте файл — он разберётся в группы, а устаревшие директивы вроде Host будут отмечены.

Как краулер читает robots.txt

Файл лежит в корне хоста (https://site.com/robots.txt) и состоит из групп: одна или несколько строк User-agent, затем правила Disallow и Allow. Бот ищет группу со своим токеном (Googlebot-Image сначала ищет Googlebot-Image, потом Googlebot), и только если ничего не нашёл — берёт группу *. Правила из чужих групп он не читает вообще: если для Googlebot есть отдельная группа, запреты из * на него не действуют.

При конфликте правил побеждает то, чей путь длиннее (по числу символов), а при равной длине — Allow. Так Disallow: /admin вместе с Allow: /admin/public закроет всю админку, кроме публичной папки. Звёздочка * заменяет любую последовательность символов, $ в конце — «здесь путь заканчивается»: Disallow: /*.pdf$ закроет PDF, но не /file.pdf?dl=1. Пустой Disallow: ничего не запрещает. Проверялка в инструменте реализует именно этот алгоритм (RFC 9309, он же — реализация Google).

Что понимают Google и Яндекс, а что нет

ДирективаGoogleЯндексКомментарий
User-agent, Disallow, Allowдадаоснова стандарта; * и $ понимают оба
Sitemapдадаполный URL, можно несколько, положение в файле не важно
Crawl-delayигнорируетигнорирует с 2018частоту обхода задают в Search Console и Вебмастере; читают Bing и часть SEO-ботов
Clean-paramнетдапараметры, не меняющие контент (utm_*, sort) — Яндекс склеит дубли
Hostнетнетустарела: главное зеркало задаётся 301-редиректом и в Вебмастере
Noindexнетнетзакрывать от индекса надо meta robots или заголовком X-Robots-Tag

AI-боты в 2026 году

Отдельная задача — решить, кого из ИИ-краулеров пускать. Пресет «Закрыть AI-ботов, оставить поиск» блокирует ботов, собирающих данные для обучения: GPTBot, ClaudeBot, anthropic-ai, CCBot, Bytespider, PerplexityBot, Google-Extended, Applebot-Extended, meta-externalagent, Amazonbot. Обычный поиск он не трогает: Google-Extended — отдельный токен для Gemini, на ранжирование в Google он не влияет. А вот OAI-SearchBot и ChatGPT-User отвечают за показ вашего сайта в поиске ChatGPT и переходы по ссылкам — их закрывать стоит только осознанно, иначе исчезнете из ИИ-ответов вместе с трафиком.

Частые ошибки

  • Закрыть CSS и JS. Google рендерит страницы; без стилей и скриптов он увидит «сломанную» вёрстку и может понизить страницу. Пресеты явно разрешают /*.css$ и /*.js$.
  • Надеяться, что Disallow уберёт страницу из индекса. Не уберёт: Google может показывать URL без сниппета, если на него ведут ссылки. Для удаления нужен noindex при открытом для обхода URL.
  • Путь без слэша в начале (Disallow: admin) — правило не сработает; инструмент подсветит это в статусе.
  • Забыть про регистр. Пути чувствительны к регистру: /Admin и /admin — разные строки.

Частые вопросы

Как закрыть сайт от индексации через robots.txt?

Пресет «Закрыть сайт» даёт User-agent: * и Disallow: /. Но помните: это запрет на обход, а не на индекс — уже известные URL могут остаться в выдаче без описания. Надёжнее вместе с этим отдавать meta robots noindex или закрыть сайт паролем.

Что сильнее — Allow или Disallow?

Побеждает правило с более длинным путём. Если длины равны, Google и Яндекс выбирают Allow. Поэтому Allow: /admin/public перекрывает Disallow: /admin, а Allow: /$ открывает только главную при закрытом остальном сайте.

Google учитывает Crawl-delay?

Нет, Google полностью игнорирует эту директиву, Яндекс перестал её читать в 2018 году. Скорость обхода регулируется в Search Console и Яндекс Вебмастере. Crawl-delay ещё понимают Bing, Yahoo и часть SEO-краулеров вроде AhrefsBot.

Как запретить GPTBot и другие AI-боты, но не потерять Google?

Заведите отдельные группы для GPTBot, ClaudeBot, CCBot, Bytespider, PerplexityBot, Google-Extended с Disallow: /, а группу * оставьте открытой — так делает пресет «Закрыть AI-ботов». Googlebot и YandexBot читают только свою или общую группу, запреты для других ботов их не касаются.

Нужна ли директива Host для Яндекса?

Нет, Яндекс отказался от Host в 2018 году. Главное зеркало теперь определяется 301-редиректом между версиями сайта и настройками в Вебмастере. При импорте старого файла инструмент отметит Host как устаревший и не перенесёт его в результат.

Проверка URL здесь совпадает с Search Console?

Инструмент реализует алгоритм из RFC 9309 и открытой библиотеки Google: выбор группы по токену бота, самый длинный совпавший путь, поддержка * и $, приоритет Allow при равенстве. Разница возможна только для нестандартных краулеров с собственными правилами разбора.

свежие базы — в канале Подписаться на канал