Генератор robots.txt

Генератор robots txt помогает собрать рабочий файл без ручного набора каждой директивы. Вы выбираете поискового робота, задаете разрешенные и запрещенные пути, добавляете XML-карту сайта и получаете готовый файл для публикации в корне домена.

Адрес сайта, для которого собираем robots.txt. Из него же подставим строку Sitemap.

https://seo-gen.com.ua/

По одному пути в строке, каждый начинается с косой черты: /admin/.

Исключения из запретов. По одному пути в строке.

В списке 12 роботов.

В списке 5 роботов.

Пауза между запросами робота, секунды. Google эту строку не читает.

Crawl-delay и Clean-param понимает только Яндекс — Google их игнорирует.

Параметры, которые Яндекс должен игнорировать: utm_source&utm_medium.

Готовый файл

Код появится, как только заполните поля: пустых значений и выдуманных заглушек в нём не будет.

Проверка: не закрыли ли лишнего

Адреса или пути, которые проверим по готовому файлу: не закрыли ли лишнего.

АдресСостояниеПравило

Замечания

  • Строки Sitemap в файле нет.

Что дальше

Положите файл в корень сайта и проверьте его в Search Console и Вебмастере.

Что делать дальше

Оставить заявкуНаша услуга: продвижение сайта

Как пользоваться генератором robots.txt?

Инструмент подойдет, если нужно создать robots.txt онлайн для нового сайта, обновить правила после смены структуры или проверить конфигурацию перед запуском. В англоязычной документации и сервисах такой инструмент также встречается как robots.txt generator, robots.txt creator или robots file generator.

Сначала укажите, для какого краулера будут действовать правила. Затем добавьте пути, которые разрешено или запрещено сканировать, укажите Sitemap и проверьте получившийся код. После проверки файл можно скопировать или скачать и разместить по адресу https://example.com/robots.txt.

Если нужно сгенерировать robots txt для небольшого сайта, обычно достаточно одной группы User-agent и нескольких правил. Для крупных интернет-магазинов, каталогов и сервисов конфигурация может включать отдельные группы для Googlebot, Yandex, Bingbot и AI-краулеров.

Выберите поискового робота

Директива User-agent определяет, к какому краулеру относится следующий набор правил. Значение * применяется ко всем роботам, которые поддерживают Robots Exclusion Protocol и не имеют более подходящей отдельной группы.

Для разных роботов можно задать разные условия. Например, Googlebot разрешить обход коммерческих страниц, а отдельному техническому боту ограничить доступ к служебным разделам. Такой подход удобнее, чем пытаться описать всю логику одним универсальным правилом.

Добавьте правила Allow и Disallow

Disallow указывает путь, который робот не должен обходить, а Allow может открыть конкретный URL внутри более широкого запрета. Правила записывают относительно корня сайта, поэтому полный домен в этих строках обычно не нужен.

Например, запись Disallow: /admin/ ограничивает обход административного раздела. Если внутри него есть открытая страница, можно добавить Allow: /admin/public/. Перед публикацией желательно проверить несколько реальных URL, чтобы убедиться, что правило срабатывает ожидаемо.

Укажите Sitemap и получите готовый файл

В директиве Sitemap указывают полный URL карты сайта, например https://example.com/sitemap.xml. Если карт несколько, каждую можно добавить отдельной строкой, чтобы поисковый краулер быстрее находил актуальные адреса.

После настройки генератор показывает итоговый код, который можно проверить, скопировать и сохранить. По такому принципу работают robots txt generator online, seo robots.txt generator и другие инструменты, которые помогают generate robots.txt без ручной подготовки файла с нуля.

Основные директивы robots.txt

Базовая конфигурация строится вокруг User-agent, Disallow, Allow и Sitemap. Дополнительные директивы зависят от конкретного поискового робота, поэтому их поддержку нужно проверять отдельно, а не переносить настройки с другого сайта без проверки.

ДирективаДля чего используетсяПример
User-agentВыбирает робота или группу роботовUser-agent: *
DisallowОграничивает обход путиDisallow: /search/
AllowРазрешает более конкретный путьAllow: /search/help/
SitemapУказывает XML-карту сайтаSitemap: https://example.com/sitemap.xml
Crawl-delayЗадает задержку для поддерживающих директиву роботовCrawl-delay: 5
Clean-paramПомогает Yandex учитывать параметры URLClean-param: utm_source

Таблица дает общую схему, но правила нужно сопоставлять со структурой конкретного проекта. Один и тот же Disallow может быть безопасным для технического раздела и критичным для страницы, которая получает органический трафик.

01

User-agent, Disallow и Allow

User-agent: * подходит для общих правил, а отдельные группы нужны, когда поведение разных ботов должно отличаться. Запись Disallow: / требует особого внимания, поскольку она закрывает от обхода весь сайт для указанного робота.

Allow чаще используют внутри уже запрещенного раздела. Если логика получается сложной, лучше проверить каждую группу на реальных URL и только после этого публиковать файл. Копирование готового robots.txt с чужого сайта часто приводит к случайной блокировке нужных страниц.

02

Crawl-delay, Clean-param и Host

Google не использует Crawl-delay в robots.txt, поэтому добавлять эту директиву специально для Googlebot бессмысленно. Другие роботы могут обрабатывать ее иначе, и поддержку следует проверять в документации конкретного краулера.

Clean-param относится к Yandex и применяется для URL с параметрами, которые не меняют основное содержание страницы. Host не следует добавлять как обязательную директиву современного robots.txt, особенно если причина его использования сводится только к старому шаблону.

Что именно мы делали

Стоматология · Киев и Чернигов

+44% кликов из поиска

Домен без истории, сайт на конструкторе. Собрали семантику под услуги и оба города, переработали посадочные страницы, с нуля построили ссылочный профиль. За четыре месяца: 34,8 тыс. кликов, показы 1,32 → 1,76 млн, DR 0 → 41.

E-commerce · международный рынок

+96% кликов за два месяца

Каталог цифровых 3D-моделей. Кластеризовали семантику, перестроили хабовые страницы, закрыли дубли и ошибки индексации. Пользователи из Google 247 → 532, CTR 2,4% → 4%.

Медицинский центр · Украина

+68,75% видимости за первый месяц

Узкая видимость и малая семантика на старте. Семантика, структура посадочных, метаданные и перелинковка, постепенное усиление ссылками.

Ответы на ваши вопросы

Для чего нужен файл robots.txt?

Robots.txt передает поисковым и другим поддерживающим стандарт роботам правила сканирования сайта. Через него можно ограничить обход технических страниц, отдельных каталогов, внутренних результатов поиска и других URL, которые не требуется регулярно сканировать.

Файл также содержит ссылку на карту сайта и может включать разные наборы правил для нескольких User-agent. Конкретная конфигурация зависит от структуры проекта, CMS и количества технических URL.

Где должен находиться robots.txt?

Файл размещается в корневой директории соответствующего хоста и должен открываться по стандартному адресу /robots.txt. Для основного домена пример будет выглядеть как https://example.com/robots.txt.

Если сайт использует отдельные поддомены, правила для них нужно проверять отдельно. После загрузки желательно открыть файл через браузер и убедиться, что сервер возвращает корректный HTTP-ответ.

Как создать robots.txt онлайн?

Чтобы создать robots.txt онлайн, выберите User-agent, добавьте необходимые Allow и Disallow, укажите Sitemap и просмотрите итоговый код. После проверки его можно скопировать либо сохранить в виде файла.

Онлайн-генератор особенно удобен, когда требуется быстро собрать базовую конфигурацию и избежать ошибок в синтаксисе. Перед публикацией все равно следует проверить правила на реальных URL сайта.

Можно ли закрыть страницу от индексации через robots.txt?

Запрет обхода через robots.txt не гарантирует удаление адреса из индекса. Поисковая система может узнать URL из ссылок и сохранить его без полноценного содержимого страницы.

Для управления индексацией используют meta robots noindex или X-Robots-Tag, если поисковый робот имеет доступ к документу и способен прочитать соответствующее указание.

Нужно ли добавлять Sitemap в robots.txt?

Добавлять Sitemap полезно, поскольку поисковый робот получает прямой адрес актуальной XML-карты сайта. Указывать нужно абсолютный URL, включая протокол и домен.

Если карт несколько, можно добавить несколько строк Sitemap. При этом сама карта должна содержать корректные индексируемые URL и регулярно обновляться вместе со структурой сайта.

Можно ли создать отдельные правила для Google и Yandex?

Да, для разных роботов можно создать отдельные группы User-agent. Это требуется, когда настройки Googlebot, Yandex или другого краулера должны различаться.

При такой конфигурации необходимо внимательно проверять порядок и содержание групп. Слишком широкое правило, которое случайно попало к нужному роботу, может изменить обход крупного раздела сайта.

Поддерживает ли Google Crawl-delay?

Googlebot не поддерживает директиву Crawl-delay в robots.txt. Поэтому добавление этой строки не регулирует скорость обхода сайта Google.

Другие роботы могут обрабатывать директиву иначе. Перед использованием нужно проверить актуальную документацию конкретного краулера, а не рассчитывать на одинаковое поведение всех систем.

Можно ли через robots.txt заблокировать AI-ботов?

Для отдельных AI-краулеров можно создать собственную группу User-agent и указать запрещенные пути. Такой вариант подходит для GPTBot, ClaudeBot, CCBot и других систем, которые заявляют поддержку robots.txt.

При этом robots.txt остается публичным набором правил для добровольно соблюдающих их роботов. Для жесткой технической блокировки применяются серверные ограничения, WAF и другие методы контроля доступа.

Хороший robots.txt остается коротким и понятным настолько, насколько это позволяет структура сайта. Его задача состоит в том, чтобы дать краулерам корректные правила обхода, не перекрывая доступ к страницам и ресурсам, которые нужны для поиска и нормального рендеринга.

Настройте User-agent, Allow, Disallow и Sitemap в генераторе Seo-Gen, проверьте несколько реальных URL и только после этого скачайте готовый файл. Если структура сайта изменится, вернитесь к проверке robots.txt и обновите правила вместе с остальной технической SEO-настройкой.

Отвечаем в течение рабочего дня. Без рассылок и звонков «просто напомнить».

Геннадий, Ведущий SEO-специалист, Seo-Gen
Посмотрит сайт сам, а не передаст менеджеру.
Кто ответит: Геннадий
Ведущий SEO-специалист, Seo-Gen

Подробнее: Генератор robots.txt

Что такое robots.txt и зачем он нужен?

Robots.txt – текстовый файл с правилами обхода сайта для поисковых и других краулеров. Он располагается в корневой директории конкретного хоста и помогает управлять сканированием сайта, техническими страницами и URL, которые не требуется регулярно обходить.

Файл особенно полезен на сайтах с большим количеством фильтров, сортировок, GET-параметров и дублирующихся URL. Грамотно настроенные правила доступа уменьшают число ненужных запросов к серверу и помогают направить обход сайта на страницы, которые действительно нужны поисковой системе.

Как robots.txt влияет на сканирование сайта?

Robots.txt регулирует сканирование, поэтому его нельзя считать прямым способом управления индексацией. Поисковая система может знать адрес страницы из внешних или внутренних ссылок, даже если содержимое этого URL закрыто от сканирования.

Краулинговый бюджет имеет большее значение для крупных ресурсов, где робот физически не может регулярно обходить все комбинации URL. Для небольшого сайта искусственно усложнять robots.txt ради экономии нескольких запросов обычно не требуется.

Что обычно закрывают в robots.txt?

Чаще всего правила применяют к техническим URL, внутреннему поиску, отдельным служебным разделам, корзине, страницам оформления заказа и некоторым комбинациям фильтров. Для интернет-магазина также может потребоваться работа с сортировками и параметрами, создающими большое количество дублей URL.

Универсального перечня запрещенных каталогов нет. Административная панель, личный кабинет или внутренний поиск имеют понятный технический характер, а фильтр каталога иногда сам является полезной посадочной страницей и получает поисковый трафик.

Перед запретом стоит проверить три вещи:

  • приносит ли URL органический трафик и участвует ли он во внутренней перелинковке;
  • существует ли для страницы самостоятельный поисковый интент и уникальный контент;
  • не требуется ли роботу доступ к адресу для корректного рендеринга или обработки других сигналов.

После такой проверки проще решить, где нужен Disallow, где canonical или noindex, а где страницу вообще не следует ограничивать.

Что нельзя бездумно закрывать в robots.txt?

Не стоит автоматически запрещать CSS и JavaScript, которые используются для рендеринга страницы. Если поисковый робот не получает необходимые ресурсы, он может увидеть страницу иначе, чем обычный пользователь, и хуже обработать ее содержание.

Robots.txt также не подходит для защиты конфиденциальных данных. Адрес файла доступен публично, поэтому закрытые документы, персональные данные и административные интерфейсы должны защищаться авторизацией, серверными ограничениями и корректными правами доступа.

Отдельно нужно проверять важные посадочные страницы. Ошибка в одном символе или слишком широкое правило способно перекрыть целый каталог, раздел услуг либо другой коммерческий блок сайта.

Robots.txt и noindex – в чем разница?

Robots.txt управляет возможностью сканирования URL, тогда как meta robots с директивой noindex или HTTP-заголовок X-Robots-Tag передают поисковой системе указание не хранить документ в индексе. Эти механизмы решают разные технические задачи.

Если страница закрыта через Disallow, поисковый робот может не получить ее HTML и не увидеть расположенный внутри noindex. Поэтому блокировать обход и одновременно рассчитывать на обработку meta robots без дополнительной проверки не следует.

Как настроить robots.txt для разных роботов?

Для Googlebot обычно достаточно понятных правил User-agent, Allow, Disallow и ссылки на Sitemap. Если требуется изменить интенсивность обхода Google, Crawl-delay для этого не подойдет, поскольку Google эту директиву в robots.txt не поддерживает.

Для Yandex могут использоваться стандартные правила и Clean-param, если на сайте много URL с параметрами. Bingbot и другие поисковые роботы лучше настраивать по их собственной документации, особенно когда требуется нестандартное ограничение частоты сканирования.

Отдельные группы можно создать и для AI-краулеров, например GPTBot, ClaudeBot, Google-Extended или CCBot. Блокировка ботов через robots.txt работает только для систем, которые соблюдают опубликованные правила, поэтому файл нельзя воспринимать как серверный механизм безопасности.

Примеры robots.txt

Для обычного сайта достаточно короткой конфигурации, если нет сложных технических разделов. В нее можно включить общую группу роботов, разрешение обхода и ссылку на карту сайта.

User-agent: *

Disallow:

Sitemap: https://example.com/sitemap.xml

Для интернет-магазина правила обычно сложнее, поскольку появляются корзина, внутренний поиск, фильтры и служебные страницы. Перед применением шаблона нужно проверить реальные адреса проекта, а не копировать названия каталогов из чужой CMS.

User-agent: *

Disallow: /cart/

Disallow: /search/

Disallow: /account/

Sitemap: https://example.com/sitemap.xml

Если требуется отдельное правило для конкретного робота, создается самостоятельная группа. Такой подход удобен, когда общий robots generator используется для подготовки нескольких наборов правил в одном файле.

Частые ошибки при создании robots.txt

Самая опасная ошибка – случайный Disallow: / в группе поискового робота, который должен обходить сайт. Также встречаются неверные пути к Sitemap, блокировка нужных посадочных страниц, попытка управлять индексированием только через robots.txt и копирование настроек с другого проекта.

К техническим ошибкам можно отнести ненужную блокировку ресурсов, неверные пути, лишние директивы и правила, которые противоречат друг другу. Перед публикацией полезно проверить файл через валидатор robots.txt, затем протестировать несколько открытых и закрытых URL.

Схема проверки выглядит просто:

Настройка правил → генерация файла → проверка URL → публикация → повторная проверка

Такой порядок снижает риск случайно закрыть раздел, который уже получает трафик или должен быть доступен поисковому роботу.

Как установить и проверить robots.txt?

Готовый файл должен открываться по адресу вида https://example.com/robots.txt. После загрузки проверьте HTTP-ответ, содержимое файла, синтаксис robots.txt и доступность нескольких важных страниц для каждого отдельного User-agent.

После изменения структуры сайта проверку стоит повторить. То же касается переезда на другую CMS, запуска новых фильтров, изменения правил индексации или крупных правок каталога.

Для дополнительной проверки можно использовать Google Search Console, Yandex Webmaster и отдельный инструмент проверки robots.txt. Такая последовательность помогает заметить техническую ошибку до того, как она повлияет на обход значительной части сайта.