Шесть лет в цифрах
Генератор Robots.txt и Sitemap.xml онлайн
Генератор robots.txt и sitemap.xml подходит для запуска нового сайта, переноса на другой домен, изменения структуры, добавления разделов и плановой технической проверки. Готовый файл можно проверить перед публикацией, скачать, разместить на сайте и затем передать sitemap в Google Search Console.
Правильная настройка не сводится к созданию двух файлов. Нужно проверить, какие страницы разрешены для обхода, какие URL попали в XML карту сайта, нет ли среди них редиректов, ошибок, дублей, noindex и неканонических адресов.
Онлайн-генератор помогает подготовить основные технические файлы без ручного написания директив и XML-разметки. Пользователь указывает домен, задаёт правила доступа для поисковых роботов, добавляет нужные URL и получает готовое содержимое robots.txt и sitemap.xml для дальнейшей проверки.
Инструмент подходит для корпоративных сайтов, интернет-магазинов, блогов, каталогов, сайтов услуг и небольших проектов. После генерации файлы необходимо проверить с учётом реальной структуры сайта, потому что автоматическая настройка не знает бизнес-ценность каждой страницы и её роль в поисковом продвижении.
Схема работы выглядит так:
Поисковый робот → robots.txt → правила обхода → sitemap.xml → список URL → сканирование страницы → решение поисковой системы об индексации.
Эта последовательность помогает понять главное различие между файлами. Robots.txt регулирует доступ краулеров, тогда как XML карта сайта передаёт список адресов, которые поисковая система может обнаружить и обработать.
Что создаёт генератор robots.txt?
Генератор robots.txt формирует текстовый файл с инструкциями для поисковых роботов. В нём можно определить, какие разделы разрешены для обхода, какие технические пути желательно исключить и где находится карта сайта. Стандартный адрес файла для основного домена выглядит как https://example.com/robots.txt.
После генерации файл следует проверить вручную, особенно если сайт уже работает и получает органический трафик. Ошибочная директива Disallow: / способна закрыть от сканирования весь сайт, поэтому перенос правил с тестового домена на рабочий без проверки создаёт серьёзный риск для индексации.
Для большинства сайтов достаточно нескольких понятных правил. Чем сложнее структура интернет-магазина, каталога или мультиязычного проекта, тем внимательнее нужно проверять фильтры, параметры URL, служебные страницы и разные версии адресов.
Что создаёт генератор sitemap.xml?
Генератор sitemap формирует XML карту сайта со списком страниц, которые следует передать поисковой системе для обнаружения и обхода. В sitemap.xml желательно включать канонические URL с ответом 200 OK, открытые для индексации и доступные по основной версии домена.
Наличие страницы в sitemap.xml не гарантирует её индексацию и не влияет напрямую на позиции. Google самостоятельно оценивает содержимое страницы, canonical, Meta Robots, X-Robots-Tag, внутренние ссылки, HTTP-ответ и другие сигналы перед тем, как оставить URL в индексе.
Карта особенно полезна для новых сайтов, крупных каталогов, интернет-магазинов и проектов с глубокой структурой. Она также помогает быстрее обнаруживать страницы, на которые пока ведёт мало внутренних ссылок, хотя нормальную перелинковку sitemap заменить не может.
Что входит
Генератор robots.txt
Генератор robots.txt онлайн для настройки User-agent, Allow, Disallow и Sitemap. Создайте файл, проверьте правила и скачайте готовый robots.txt бесплатно.
Генератор sitemap.xml
Генератор sitemap.xml для создания XML-карты сайта онлайн. Укажите URL, получите готовый файл Sitemap и добавьте его в robots.txt и Google Search Console.
Частые ошибки при настройке Robots и Sitemap
Большинство проблем возникает после миграций, изменения структуры или автоматической генерации URL. Файлы продолжают технически работать, но начинают содержать старые адреса, запрещать полезные разделы или передавать поисковику страницы, которые уже не предназначены для индексации.
Ошибки лучше искать по шаблонам, а не по одному адресу. Если один фильтр попал в sitemap, вероятно, аналогичная проблема присутствует у всех URL этого типа.
Регулярная проверка особенно нужна интернет-магазинам и другим динамическим проектам. Их структура меняется чаще, поэтому первоначальная настройка постепенно устаревает.
Случайная блокировка всего сайта
Самая опасная ошибка в robots.txt — директива Disallow: / для общего User-agent на рабочем домене. Она часто остаётся после переноса проекта с тестовой среды, где полный запрет сканирования был оправдан.
Перед релизом нужно отдельно проверить robots.txt уже через публичный домен. Проверка локального файла в репозитории не гарантирует, что сервер отдаёт ту же версию.
После исправления стоит проверить доступность основных страниц и состояние сайта в Google Search Console. Поисковому роботу потребуется некоторое время, чтобы получить обновлённые правила и повторно обработать URL.
Добавление закрытых страниц в sitemap.xml
Карта сайта не должна системно содержать URL, которые владелец одновременно закрывает от обхода без понятной причины. Такая конфигурация передаёт поисковой системе противоречивые сигналы и затрудняет техническую диагностику.
Если страница не нужна в поиске, следует определить правильный способ её обработки. Это может быть noindex, удаление, редирект, авторизация или исключение из генерации sitemap.
После изменения правил проверьте источник формирования XML. Иначе удалённый вручную URL появится снова при следующем автоматическом обновлении карты.
Добавление редиректов и страниц 404
Sitemap должен содержать конечные рабочие URL, а не старые адреса с 301, 302 или ошибкой 404. Наличие большого количества таких страниц говорит о том, что карта сайта не синхронизирована с актуальной структурой.
После миграции старые URL следует удалить из XML и заменить новыми каноническими адресами. Сам редирект может оставаться рабочим для пользователей и внешних ссылок, но в sitemap он обычно не нужен.
То же относится к удалённым страницам. Если URL возвращает 404 и больше не должен существовать, регулярно передавать его через карту сайта бессмысленно.
Добавление неканонических URL
В sitemap желательно использовать ту же версию URL, которую страница указывает через canonical. Несовпадения часто возникают между HTTP и HTTPS, www и non-www, адресами со слэшем и без него, а также URL с параметрами.
Если XML системно содержит неканонические адреса, нужно исправлять сам механизм генерации. Ручная очистка файла решит проблему только до следующего обновления.
Google учитывает присутствие URL в sitemap как один из сигналов при выборе канонической версии, хотя окончательный canonical поисковая система определяет самостоятельно.
Использование Sitemap вместо внутренней перелинковки
XML карта помогает поисковику обнаруживать страницы, но нормальная структура сайта всё равно должна связывать важные документы внутренними ссылками. Если ценная посадочная страница существует только в sitemap, стоит проверить её место в архитектуре.
Внутренние ссылки передают поисковому роботу дополнительный контекст, анкоры и связь между разделами. Они также позволяют пользователю перейти на страницу обычным способом.
Страницы-сироты нужно анализировать отдельно. Иногда отсутствие внутренних ссылок случайно, а иногда URL вообще не должен участвовать в поисковом продвижении.
Некорректный lastmod
Дата lastmod должна отражать реальное существенное обновление страницы. Автоматическое назначение текущей даты каждому URL при каждой генерации создаёт постоянный поток изменений, которых фактически не было.
Google использует lastmod, если значение остаётся точным и соответствует реальным изменениям. Обновление основного контента, структурированных данных или значимых ссылок считается существенным, а простая смена даты в футере — нет.
Если CMS не хранит надёжную дату, необязательное поле можно не использовать. Неточный сигнал не делает sitemap качественнее.
Как пользоваться генератором Robots и Sitemap?
Начните с основной версии домена и проверьте, какой протокол используется на сайте. После этого настройте правила robots.txt, добавьте нужные URL в sitemap.xml и просмотрите результат перед скачиванием файлов.
Генератор сокращает ручную работу, но не принимает SEO-решения вместо владельца сайта. Нужно заранее понимать, какие страницы предназначены для органического поиска, а какие относятся к техническим, дублирующим или закрытым разделам.
После генерации проверьте содержимое обоих файлов вместе. Sitemap не должен передавать поисковой системе адреса, которые одновременно закрыты правилами обхода без понятной причины.
Укажите домен сайта
Введите основную версию домена с протоколом HTTPS, если именно она используется как каноническая. Например, для сайта https://example.com не стоит одновременно генерировать адреса http://example.com или https://www.example.com, если они перенаправляются на основной вариант.
Проверьте единый формат URL до формирования XML карты сайта. Особенно часто дубли возникают из-за конечного слэша, регистра символов, GET-параметров и разных версий одного домена.
Если проект мультиязычный или работает на нескольких поддоменах, правила нужно составлять с учётом архитектуры сайта. Каждый отдельный хост может иметь собственный robots.txt.
Настройте правила robots.txt
Определите, какие URL поисковый робот должен обходить, а какие технические разделы можно исключить. Для базовой настройки используются User-agent, Disallow, Allow и директива Sitemap с полным адресом карты сайта.
Не копируйте robots.txt другого проекта без проверки структуры. Одинаковые названия CMS или шаблонов не означают, что у сайтов совпадают фильтры, страницы поиска, служебные разделы и правила индексирования.
После настройки проверьте главную страницу, категории, товары, услуги и несколько технических URL. Такой набор быстро показывает, не затронул ли запрет полезные посадочные страницы.
Добавьте URL для sitemap.xml
В карту добавляйте страницы, которые доступны по каноническому адресу, возвращают 200 OK и предназначены для индексации. Для sitemap для сайта важнее качество списка, чем максимальное количество URL.
Не следует добавлять адреса автоматически только потому, что CMS может их обнаружить. Фильтры, внутренний поиск, тестовые страницы, дубли и технические параметры часто не должны попадать в XML карту сайта.
Перед массовой генерацией полезно проверить шаблоны URL по типам. Это снижает риск появления тысяч ненужных адресов в крупных каталогах.
Настройте параметры Sitemap
Для каждого URL необходимо передать корректный абсолютный адрес через loc. Тег lastmod стоит добавлять только в тех случаях, когда система хранит точную дату последнего существенного изменения страницы.
Настраивать changefreq и priority для Google не требуется. Их значения игнорируются, поэтому поля не влияют на частоту обхода, индексирование или позиции страницы.
Если точной даты обновления нет, лучше оставить lastmod пустым. Чистая XML карта сайта с правильными URL полезнее файла с формально заполненными, но недостоверными техническими параметрами.
Сгенерируйте и скачайте файлы
После настройки сформируйте robots.txt и sitemap.xml, затем просмотрите содержимое перед публикацией. Проверьте домен, протокол, основные директивы, список URL и отсутствие очевидных технических страниц.
Готовые файлы можно скачать и разместить на сервере. После загрузки обязательно откройте оба адреса в браузере и убедитесь, что сервер возвращает файл без ошибки, авторизации или неожиданного перенаправления.
Затем добавьте sitemap.xml в Google Search Console и следите за результатом обработки. Ошибки в отчёте помогают обнаружить недоступные, неканонические или некорректно сформированные URL.
Ответы на ваши вопросы
Можно ли создать robots.txt и sitemap.xml онлайн бесплатно?
Да, базовый robots.txt онлайн и sitemap.xml онлайн можно сформировать без отдельного программного обеспечения. Для небольшого сайта достаточно указать домен, настроить правила доступа и добавить канонические страницы, которые должны находиться в XML карте сайта.
После генерации всё равно нужна техническая проверка. Инструмент формирует файл по заданным параметрам, но не определяет самостоятельно, какие категории, фильтры или служебные страницы нужны конкретному проекту.
Перед загрузкой проверьте домен, протокол и основные шаблоны URL. Особенно внимательно относитесь к существующим сайтам, где ошибка способна повлиять на уже проиндексированные страницы.
Нужен ли sitemap.xml небольшому сайту?
Для маленького сайта sitemap.xml не считается обязательным условием индексации, если все страницы доступны через понятную внутреннюю перелинковку. Поисковый робот способен обнаружить такие URL обычным обходом сайта.
При этом карта остаётся удобным техническим источником. Через неё можно передать актуальные URL и затем контролировать обработку файла в Google Search Console.
На новом сайте sitemap особенно полезен после запуска. Он помогает быстрее показать поисковой системе структуру проекта, хотя окончательное решение об индексации каждого URL остаётся за поисковой системой.
Сколько URL можно добавить в sitemap.xml?
Один стандартный sitemap может содержать до 50 000 URL при размере несжатого файла до 50 МБ. Если достигается одно из ограничений, адреса необходимо распределить между несколькими картами.
Для крупного сайта обычно создают отдельные sitemap по типам страниц. Например, товары, категории и статьи можно разместить в разных XML-файлах.
Все такие карты затем связываются через Sitemap Index. Поисковой системе достаточно получить индексный файл, чтобы обнаружить остальные карты.
Можно ли добавить несколько файлов Sitemap?
Да, несколько карт используются на крупных и структурно сложных сайтах. Такой подход помогает соблюдать технические лимиты и упрощает контроль отдельных типов страниц.
Каждый дочерний sitemap должен оставаться доступным и содержать актуальные канонические URL. Удалённые карты следует своевременно исключать из индексного файла.
Разделение также удобно для диагностики. Если Google сообщает об ошибках только в карте товаров, можно быстрее найти проблему в соответствующем шаблоне генерации.
Нужно ли добавлять sitemap.xml в robots.txt?
Указать sitemap.xml в robots.txt рекомендуется, потому что поисковый робот получает прямой адрес карты при обращении к файлу правил. Для этого используется директива Sitemap с абсолютным URL.
Дополнительно карту можно отправить через Google Search Console. Эти способы не конфликтуют и используются одновременно на большинстве сайтов.
После смены домена проверьте оба места. Старый адрес часто остаётся в robots.txt или панели вебмастера после завершения миграции.
Нужны ли changefreq и priority в sitemap.xml?
Для Google эти параметры не нужны. Поисковая система игнорирует значения <changefreq> и <priority>, поэтому они не влияют на частоту сканирования, индексацию или ранжирование страниц.
В актуальном sitemap достаточно передавать корректный URL через <loc>. <lastmod> имеет смысл добавлять тогда, когда сайт способен указывать точную дату последнего существенного изменения страницы.
Если старый генератор продолжает создавать changefreq и priority, это само по себе не делает файл ошибочным. Для современной SEO-настройки Google тратить время на управление этими значениями нет смысла.
Можно ли закрыть страницу от индексации через robots.txt?
Использовать только robots.txt для удаления страницы из индекса не следует. Disallow запрещает или ограничивает сканирование, поэтому поисковый робот может не получить доступ к Meta Robots и не увидеть директиву noindex.
Для запрета индексации обычно страница должна оставаться доступной роботу и содержать соответствующую директиву. Конкретная схема зависит от текущего состояния URL и задачи владельца сайта.
Если страница уже находится в поиске, нужно проверить причины её появления и способ удаления. Простое добавление пути в Disallow может не дать ожидаемого результата.
Нужно ли добавлять в Sitemap страницы с noindex?
Обычная XML карта индексируемых страниц не должна содержать URL с noindex. Добавление такого адреса одновременно сообщает поисковой системе о странице через sitemap и запрещает её индексацию другим техническим сигналом.
Если noindex установлен временно, нужно понимать дальнейший сценарий. После снятия ограничения страницу можно вернуть в автоматическую генерацию sitemap.
При массовом появлении noindex-страниц в XML лучше исправить правило генерации. Ручное удаление отдельных URL не устранит причину.
Как часто нужно обновлять sitemap.xml?
Карту следует обновлять после появления новых индексируемых страниц, удаления старых URL и существенного изменения структуры сайта. На динамических проектах этот процесс лучше автоматизировать через CMS или серверную генерацию.
Не нужно пересоздавать файл ради изменения даты без реальных правок. Если используется lastmod, дата должна соответствовать последнему существенному изменению страницы, а не времени очередной генерации sitemap.
После крупных миграций sitemap проверяется отдельно. В нём не должны оставаться старый домен, прежний протокол, редиректы и удалённые страницы.
Подробнее: Генератор Robots.txt и Sitemap.xml
Что такое robots.txt и зачем он нужен?
Robots.txt хранит инструкции для краулеров, которые запрашивают страницы и другие ресурсы сайта. Поисковый робот обычно обращается к этому файлу перед обходом и проверяет правила, указанные для своего User-agent. Файл размещается в корне соответствующего хоста.
Через robots.txt можно ограничить сканирование технических разделов, параметров, внутренних результатов поиска и других URL, которые не должны расходовать краулинговый бюджет. При этом запрет сканирования нельзя считать надёжным способом удаления уже известной страницы из индекса.
На небольшом сайте файл часто содержит всего несколько директив. Для крупного интернет-магазина правила могут быть сложнее из-за фильтров, сортировки, поиска, личного кабинета, корзины и различных технических параметров.
Какие директивы используются в robots.txt?
Основные директивы определяют поискового робота и правила доступа к конкретным путям. Для большинства сайтов используются User-agent, Disallow, Allow и Sitemap. Их достаточно, чтобы создать понятную базовую конфигурацию и указать поисковой системе адрес XML карты сайта.
Правила следует составлять с учётом реальных URL. Запрет слишком широкого пути может случайно затронуть полезные категории, карточки товаров или страницы услуг, если их адреса находятся внутри той же директории.
Перед публикацией полезно проверить несколько URL каждого типа. Такой подход быстрее выявляет конфликт между правилами robots.txt, canonical, noindex и фактической структурой сайта.
User-agent
User-agent определяет, к какому роботу относятся расположенные ниже правила. Значение * означает, что группа инструкций предназначена для всех краулеров, которые поддерживают стандарт robots.txt.
Пример базовой записи:
User-agent: *
На проектах со специальными требованиями правила можно разделить для отдельных роботов. Делать это без необходимости не стоит, потому что большое количество групп усложняет поддержку файла и повышает риск противоречий после изменений структуры сайта.
При каждой технической правке нужно учитывать порядок и область действия правил. Если сайт использует отдельные настройки для Googlebot, других поисковых роботов или AI-ботов, их следует проверять отдельно.
Disallow
Disallow указывает путь, который выбранному краулеру не следует сканировать. Например, через эту директиву можно закрыть внутренний поиск, технические параметры или административный раздел, если они доступны по публичным URL.
Пример:
Disallow: /admin/
Нельзя без проверки закрывать каталоги, внутри которых находятся полезные посадочные страницы. Поисковая система может перестать загружать их содержимое, внутренние ссылки и другие элементы, необходимые для нормальной обработки сайта.
Если задача состоит именно в удалении страницы из поиска, нужно отдельно проверить возможность сканирования и директиву noindex. Блокировка в robots.txt и запрет индексации решают разные технические задачи.
Allow
Allow помогает разрешить обход конкретного пути внутри более широкого запрещённого раздела. Такая настройка встречается на сайтах со сложной структурой, где общий шаблон URL нужно закрыть, но отдельные ресурсы внутри него должны оставаться доступными.
Использовать исключения следует только после проверки реальных адресов. Чем больше пересекающихся правил Allow и Disallow, тем труднее поддерживать конфигурацию при изменении шаблонов URL.
После внедрения стоит проверить несколько разрешённых и запрещённых адресов. Такой тест показывает, совпадает ли фактическое поведение с ожидаемой логикой robots.txt.
Sitemap
Директива Sitemap сообщает роботу абсолютный адрес XML карты сайта. Обычно она размещается в robots.txt отдельной строкой и содержит полный URL с протоколом и доменом.
Пример:
Sitemap: https://example.com/sitemap.xml
Для крупного проекта вместо одного файла может использоваться Sitemap Index, который содержит ссылки на несколько XML-карт. Такой вариант удобен для больших каталогов, разделения товаров, категорий, статей или языковых версий.
После изменения адреса карты сайта нужно обновить robots.txt и данные в Google Search Console. Старый путь не должен оставаться единственным источником информации о sitemap.
Чем Disallow отличается от noindex?
Disallow относится к сканированию: робот получает рекомендацию не загружать страницу по указанному пути. noindex относится к индексации и сообщает поисковой системе, что доступную для обхода страницу не следует сохранять в поисковом индексе.
Если URL уже известен Google через внешние ссылки, внутреннюю перелинковку или старый sitemap, одного запрета в robots.txt может оказаться недостаточно для удаления адреса из выдачи. Робот видит сам URL, но не всегда может загрузить страницу и прочитать Meta Robots.
Поэтому сначала нужно определить задачу: сократить ненужный обход или убрать страницу из поиска. После этого выбираются robots.txt, Meta Robots, X-Robots-Tag, удаление URL, редирект или другой подход.
Что такое Sitemap XML и зачем нужна карта сайта?
Sitemap.xml содержит список URL, которые владелец сайта считает актуальными и доступными для поисковой обработки. Файл помогает поисковому роботу находить страницы без необходимости ждать, пока он обнаружит каждую из них через обычную внутреннюю перелинковку.
XML карта особенно полезна на новом сайте, где поисковая система ещё не знает большинство адресов. Она также нужна большим интернет-магазинам, каталогам, новостным проектам и сайтам с регулярно появляющимися страницами.
Для небольшого сайта sitemap тоже полезен как технический источник контроля. По нему легко сравнить список передаваемых URL с фактическими индексируемыми страницами, каноническими адресами и данными Google Search Console.
Какие данные содержит sitemap.xml?
Основная запись sitemap.xml содержит адрес страницы в теге loc. Дополнительно можно передавать lastmod, если сайт способен указывать реальную дату существенного изменения документа. Для Google именно эти данные имеют практический смысл при стандартной работе с XML Sitemap.
Поля changefreq и priority по-прежнему встречаются в старых генераторах и входят в исторически сложившийся формат Sitemap, однако Google их игнорирует. Добавлять их ради SEO или настраивать для каждой страницы нет необходимости. Это прямо указано в актуальной документации Google Search Central.
Актуальная базовая структура выглядит так:
| Тег | Что содержит | Как использовать |
|---|---|---|
| loc | Абсолютный URL страницы | Указывать основной канонический адрес |
| lastmod | Дату последнего существенного изменения | Передавать только при наличии точных данных |
Для обычного sitemap этого достаточно. Дополнительные расширения могут использоваться для изображений, видео, новостного контента и локализованных версий страниц, если они действительно нужны проекту.
loc
loc содержит абсолютный адрес страницы, включая протокол и домен. Для рабочего сайта желательно использовать канонический HTTPS-вариант без промежуточного редиректа и без лишних GET-параметров, если они не образуют самостоятельные индексируемые страницы.
В sitemap не следует смешивать HTTP и HTTPS, www и non-www версии одного сайта без реальной необходимости. Такая структура создаёт лишние URL и усложняет понимание основной версии страниц.
Google рекомендует указывать полностью квалифицированные абсолютные URL и включать в sitemap адреса, которые владелец хочет видеть в поиске. Для дублирующихся страниц предпочтительно передавать выбранную каноническую версию.
lastmod
lastmod показывает дату последнего существенного изменения страницы. Это может быть обновление основного текста, структурированных данных, ссылок, товара, характеристик или другой части документа, которая действительно изменила его содержание.
Не стоит ежедневно менять lastmod автоматически у всех URL, если страницы фактически не обновлялись. Google использует этот тег, когда данные остаются точными и могут быть проверены по реальным изменениям страницы.
На динамических сайтах дату лучше брать из реальной истории обновлений. Если CMS не может достоверно определить время последнего существенного изменения, тег можно не добавлять вместо передачи фиктивной даты.
Какие страницы нужно добавлять в Sitemap?
В XML карту сайта следует включать URL, которые имеют самостоятельную ценность для пользователя и предназначены для поисковой индексации. Обычно это категории, карточки товаров, услуги, статьи, информационные страницы и другие посадочные документы.
Каждый URL желательно проверять по нескольким признакам: ответ 200 OK, self-canonical, отсутствие noindex, доступность для обхода и соответствие основной версии домена. Такой подход делает sitemap полезным техническим источником, а не простым перечнем всех адресов CMS.
Для крупных сайтов список лучше формировать автоматически по единым правилам. Ручное обновление тысяч URL быстро приводит к устаревшим адресам и ошибкам.
Какие URL стоит включать?
В sitemap обычно входят канонические страницы, доступные для индексации и возвращающие корректный ответ сервера. Для интернет-магазина это могут быть основные категории, индексируемые подкатегории, товары и полезные информационные материалы.
Проверять стоит следующие характеристики:
- URL возвращает код 200 OK и открывается без промежуточного редиректа;
- страница имеет корректный canonical и не ссылается канонически на другой документ;
- Meta Robots или X-Robots-Tag не содержит запрета noindex;
- страница доступна для поискового робота и соответствует основной версии домена;
- URL нужен пользователям и имеет понятную роль в структуре сайта.
После формирования списка полезно сравнить его с краулингом сайта. Так можно обнаружить страницы, которые есть в sitemap, но отсутствуют во внутренней перелинковке.
Какие URL не нужно добавлять?
В карту сайта обычно не включают страницы с 301 или 302 редиректом, ошибки 404, noindex, технические дубли и URL с canonical на другой адрес. Не стоит передавать поисковой системе заведомо ненужные комбинации фильтров, сортировки и внутренних параметров.
Чаще всего исключаются:
- старые URL, которые перенаправляются на актуальные страницы;
- страницы поиска, корзины, авторизации и личного кабинета;
- технические фильтры и сортировки без отдельного поискового спроса;
- неканонические версии адресов, создающие дубли страниц;
- тестовые или закрытые материалы, которые не предназначены для органического поиска.
После удаления лишних адресов необходимо проверить внутренние ссылки. Если технический URL продолжает массово встречаться на сайте, одной очистки sitemap недостаточно.
Ограничения Sitemap XML
Один XML-файл не предназначен для хранения неограниченного количества страниц. Для стандартного sitemap действуют технические ограничения по количеству URL и размеру файла, поэтому крупные проекты используют несколько карт и отдельный Sitemap Index.
Ограничение важно учитывать ещё при проектировании генерации. Если интернет-магазин содержит сотни тысяч товаров, категорий и других индексируемых документов, один файл быстро перестанет соответствовать требованиям формата.
Практичнее разделять карты логически. Такой подход упрощает диагностику и помогает быстрее определить, в каком типе страниц появились ошибки.
Сколько URL можно добавить в один sitemap.xml?
Один sitemap.xml может содержать до 50 000 URL, а размер несжатого файла не должен превышать 50 МБ. Если достигается любое из этих ограничений, список необходимо разделить на несколько файлов. Эти ограничения сохраняются в актуальной документации Google.
Для большинства корпоративных сайтов такой предел недостижим. Ограничение становится актуальным для крупных маркетплейсов, интернет-магазинов, СМИ, агрегаторов и проектов с большим количеством динамических страниц.
Следить следует одновременно за числом URL и размером файла. Большие записи с дополнительными данными могут достичь лимита размера раньше, чем количество адресов достигнет 50 000.
Что делать, если страниц больше 50 000?
Если индексируемых страниц больше установленного лимита, создаются несколько sitemap.xml и Sitemap Index. Индексный файл содержит адреса отдельных карт, которые поисковая система затем обрабатывает отдельно.
Например, большой интернет-магазин может разделить карты на категории, товары, статьи и другие типы документов. Разделение удобно и для технического анализа, потому что ошибка в конкретной группе быстрее обнаруживается в панели вебмастера.
Упрощённая схема выглядит так:
Sitemap Index → sitemap-products.xml → sitemap-categories.xml → sitemap-blog.xml → отдельные индексируемые URL.
При автоматической генерации нужно контролировать актуальность всех дочерних файлов. Удалённые карты не должны оставаться в Sitemap Index.
Куда загрузить robots.txt и sitemap.xml?
После генерации оба файла нужно разместить на доступных поисковому роботу адресах. Для стандартной конфигурации robots.txt находится в корне хоста, а sitemap.xml обычно размещают на основном домене по постоянному URL.
После загрузки файлы следует открыть в браузере и проверить ответ сервера. Поисковый робот должен получать содержимое без авторизации, ошибки 404, циклического редиректа или блокировки защитными системами.
Если сайт использует CDN, WAF или сложную серверную конфигурацию, дополнительно проверьте доступ для Googlebot. Иногда файл существует, но отдельные правила безопасности мешают его нормальному получению.
Где должен находиться robots.txt?
Для основного домена стандартный адрес выглядит так: https://example.com/robots.txt. Файл относится к конкретному хосту, поэтому правила главного домена автоматически не заменяют отдельный robots.txt для другого поддомена.
После загрузки проверьте точный URL вручную. Сервер должен отдавать текстовый файл с актуальными директивами без перенаправления на HTML-страницу или страницу авторизации.
При переносе сайта особенно внимательно проверяйте старые правила. На рабочем домене иногда остаётся конфигурация тестовой среды с полным запретом обхода.
Где должен находиться sitemap.xml?
Типичный адрес XML карты сайта выглядит как https://example.com/sitemap.xml. Название может отличаться, если CMS создаёт несколько карт или Sitemap Index, однако используемый путь должен оставаться доступным и стабильным.
Если карта разбита на несколько файлов, нужно проверить каждый из них. В Sitemap Index не должны оставаться ссылки на удалённые или недоступные документы.
После изменения структуры желательно обновлять карту автоматически. Ручной файл быстро устаревает, когда на сайте регулярно появляются товары, статьи или новые разделы.
Как связать robots.txt с sitemap.xml?
В robots.txt добавляют отдельную директиву с полным адресом карты сайта:
Sitemap: https://example.com/sitemap.xml
Если используется Sitemap Index, лучше указать адрес индексного файла. Google, Bing и другие крупные поисковые системы поддерживают поле Sitemap в robots.txt. Адрес должен быть абсолютным, включая протокол и хост.
После изменения домена или протокола нужно проверить эту строку отдельно. Старый адрес sitemap в robots.txt часто остаётся незамеченным после миграции сайта.
Как добавить Sitemap в Google Search Console?
После публикации карты откройте нужный ресурс Google Search Console и добавьте актуальный URL sitemap в соответствующий раздел. Система обработает файл и покажет статус, обнаруженные страницы и возможные ошибки.
Наличие карты в robots.txt не мешает отдельно отправить её через Search Console. Панель удобна для диагностики, потому что показывает проблемы обработки и помогает отслеживать изменения после обновления структуры.
Не нужно отправлять один и тот же неизменённый sitemap многократно. Google отдельно рекомендует не пересылать один файл несколько раз в день без изменений.
Как проверить robots.txt и sitemap.xml после генерации?
Проверка после генерации обязательна, особенно если сайт уже ранжируется и получает органический трафик. Одна неверная директива может изменить доступность большого раздела, а ошибочный sitemap регулярно передавать поисковой системе ненужные URL.
Проверять лучше не только сами файлы, но и страницы, которых касаются их правила. Это помогает обнаружить расхождения между robots.txt, sitemap.xml, Meta Robots, canonical и реальными HTTP-ответами.
Для крупного проекта полезно автоматизировать такую проверку. Изменения структуры, CMS и шаблонов способны постепенно нарушить первоначально корректную конфигурацию.
Проверка robots.txt
Сначала убедитесь, что файл открывается по ожидаемому адресу и содержит актуальную версию правил. Затем проверьте главную страницу, основные категории, товары, услуги, статьи и технические разделы.
Особое внимание нужно уделить слишком широким запретам. Disallow: / закрывает обход сайта для соответствующего User-agent, а неточная маска способна затронуть больше URL, чем планировалось.
Дополнительно проверьте директиву Sitemap и доступность важных ресурсов. Если для отрисовки страницы нужны CSS или JavaScript, их случайная блокировка может ухудшить понимание страницы поисковым роботом.
Проверка sitemap.xml
В sitemap нужно проверить HTTP-статусы, canonical, noindex, редиректы, дубли и соответствие основной версии домена. Ошибки особенно заметны после миграций, массового изменения URL и переработки структуры каталога.
Для каждого типа страниц желательно проверить несколько примеров вручную и затем выполнить массовый технический анализ. Если карта содержит тысячи URL, точечная проверка не покажет системную ошибку шаблона.
Также проверьте корректность XML и точность lastmod, если этот тег используется. Неверная дата, повреждённая разметка или недоступные дочерние карты способны снижать качество технических сигналов.
Нужно ли блокировать AI-ботов в robots.txt?
Некоторые владельцы сайтов отдельно задают правила для GPTBot, Google-Extended, ClaudeBot и других роботов ИИ. Решение зависит от того, хочет ли владелец разрешать таким системам получение контента и какие требования действуют для конкретного проекта.
Правила можно добавить отдельными группами User-agent. Перед этим желательно проверить актуальное название робота и официальную документацию соответствующего сервиса, потому что перечень AI-ботов и их назначение меняются.
Robots.txt работает как стандарт, который добросовестные краулеры добровольно соблюдают. Если требуется технически запретить доступ определённым клиентам, дополнительно применяются серверные ограничения, WAF, анализ запросов и другие механизмы контроля.
Для SEO не стоит массово блокировать неизвестных роботов без анализа. Некоторые краулеры связаны с поисковыми сервисами, мониторингом или инструментами, которыми владелец сайта пользуется сам.
Укажите домен, настройте правила обхода и создайте готовые robots.txt и sitemap.xml для вашего сайта.
Генератор Robots и Sitemap помогает подготовить два базовых технических файла и сразу проверить их совместную логику. В robots.txt задаются правила обхода, а в sitemap.xml передаются актуальные канонические URL, которые поисковая система может сканировать и оценивать для индексации.
Для современного sitemap ориентируйтесь на корректные URL и точный lastmod, если система действительно знает дату существенного изменения страницы. Настраивать changefreq и priority для Google не требуется, поскольку их значения поисковая система игнорирует.
Перед публикацией проверьте Disallow, noindex, canonical, HTTP-статусы, редиректы и основную версию домена. После загрузки откройте оба файла на рабочем сайте и отправьте актуальный sitemap.xml в Google Search Console.
Отвечаем в течение рабочего дня. Без рассылок и звонков «просто напомнить».
Посмотрит сайт сам, а не передаст менеджеру.