Генератор и валидатор robots.txt

Создавайте правила сканирования и проверяйте, к каким путям у Googlebot есть доступ.

Правила сканирования

Начните с робота, для которого должны действовать эти правила.

Карты сайта (Sitemaps)

Сгенерированный robots.txt

0
robots.txt
Готово. В примере заблокирован путь /admin для всех поисковых роботов.

Проверка правил

    Проверить путь

    Ваши правила сканирования создаются и проверяются прямо в браузере. Никакие данные не отправляются на BroBroGo.

    Частые вопросы

    Что этот генератор может добавить в robots.txt?

    Добавьте группу user-agent, пути Allow и Disallow, а также один или несколько URL-адресов карт сайтов. Готовый результат можно скопировать в файл robots.txt.

    Как валидатор путей выбирает правило?

    Он следует порядку сопоставления Google: побеждает наиболее длинный совпадающий путь. Если правила Allow и Disallow имеют одинаковую длину совпадения, приоритет отдается Allow.

    Удаляет ли директива Disallow страницу из поиска Google?

    Нет. Заблокированная страница все равно может появляться в результатах поиска, если на нее ссылаются другие страницы. Используйте тег noindex, ограничение доступа или удалите страницу, если ее вообще не должно быть в поиске.

    Назначение и функции файла robots.txt

    Файл robots.txt представляет собой текстовый документ, который размещается в корневом каталоге веб-сайта для управления поведением поисковых роботов (краулеров), таких как Googlebot. С помощью этого файла владельцы ресурсов и разработчики могут указывать, какие разделы сайта открыты для сканирования, а какие должны быть проигнорированы поисковыми системами.

    Инструмент «Генератор и валидатор robots.txt» позволяет создавать корректную структуру этого файла, добавляя индивидуальные правила для различных роботов, и мгновенно тестировать конкретные URL-адреса на предмет доступности для сканирования. Все операции по обработке данных выполняются локально: ваши правила сканирования создаются и проверяются прямо в браузере, никакие данные не отправляются на BroBroGo.

    Директивы User-agent и управление поведением роботов

    Каждая группа правил в файле robots.txt начинается с указания директивы User-agent, которая определяет, к какому именно поисковому роботу относятся последующие инструкции.

    При настройке директивы User-agent необходимо учитывать следующие правила:

    • В качестве имени робота можно использовать символ *, который обозначает абсолютно всех поисковых роботов одновременно.
    • Имя конкретного робота (например, Googlebot) должно быть записано без пробелов. Если ввести некорректное имя, инструмент отобразит предупреждение: «Введите одно имя робота без пробелов или используйте * для всех роботов.».
    • По умолчанию инструмент инициализирует структуру, содержащую User-agent: * и директиву ограничения доступа к административной панели Disallow: /admin.
    • Если один и тот же робот будет указан в нескольких разных группах правил, валидатор зафиксирует предупреждение: «Google объединяет группы, указывающие один и тот же user-agent.».

    Взаимодействие правил Allow и Disallow

    Для управления доступом к путям используются две основные директивы: Disallow (запретить сканирование) и Allow (разрешить сканирование в рамках запрещенного родительского каталога).

    При составлении путей для этих правил действуют строгие синтаксические ограничения:

    • Любой путь правила должен обязательно начинаться с символа / и не может содержать пробелов. При нарушении этого требования валидатор выдает ошибку: «Пути правил должны начинаться с / и не могут содержать пробелы.».
    • Символ $ используется для обозначения конца строки (например, для ограничения сканирования определенных расширений файлов) и может быть установлен исключительно в самом конце пути. В противном случае инструмент покажет ошибку: «Используйте символ $ только в самом конце пути правила.».
    • Повторяющиеся строки для одного краулера определяются как избыточные, при этом выводится предупреждение: «Это правило дублируется для одного и того же робота.».
    • Если для одного и того же пути одновременно заданы директивы Allow и Disallow, возникает конфликт, который валидатор помечает сообщением: «Правила Allow и Disallow используют один и тот же путь. Google применяет Allow, если оба правила одинаково точны.».

    Приоритеты сопоставления правил по стандартам Google

    При анализе путей инструмент полностью воспроизводит логику сопоставления, применяемую поисковой системой Google. Эта логика базируется на следующих принципах:

    1. Длина совпадения: Побеждает наиболее длинный совпадающий путь. Чем конкретнее описан путь в правиле, тем выше его приоритет, независимо от того, является ли директива разрешающей или запрещающей.
    2. Равенство длины: Если совпадающие правила Allow и Disallow имеют абсолютно одинаковую длину (равнозначны по точности), приоритет всегда отдается правилу Allow.
    3. Отсутствие совпадений: Если ни одно из написанных правил не соответствует проверяемому URL-адресу, инструмент выдает статус: «Нет подходящего правила. Google разрешает этот путь по умолчанию.».

    При тестировании конкретных путей валидатор сопоставляет введенный URL с созданными правилами и выводит точный результат проверки: либо «Разрешено — {rule}», либо «Заблокировано — {rule}».

    Интеграция карт сайта (Sitemaps)

    Указание ссылки на карту сайта в robots.txt помогает поисковым роботам быстрее находить и индексировать актуальные страницы ресурса. Директива Sitemap не привязывается к конкретному User-agent и действует глобально для всех краулеров.

    Адрес карты сайта должен быть указан в виде абсолютного URL-адреса, начинающегося с протокола http:// или https://. Если адрес введен некорректно или является относительным, инструмент выдаст ошибку: «Для URL карты сайта требуется полный адрес с http:// или https://.».

    Ограничения robots.txt при индексации

    Важно понимать технические ограничения, которые накладывает использование файла robots.txt:

    • Индексация заблокированных страниц: Директива Disallow закрывает страницу от сканирования роботами, но не гарантирует ее отсутствие в поисковой выдаче. Заблокированная страница все равно может появляться в результатах поиска, если на нее ссылаются другие страницы.
    • Отсутствие контроля доступа: Инструмент не проверяет наличие метатега noindex, настройки ограничения доступа на уровне сервера (HTTP-авторизация) или физическое удаление страниц с сайта. Для полного исключения страниц из индекса необходимо использовать альтернативные методы защиты и разграничения прав доступа.
    • Размер файла: Поисковые системы накладывают ограничения на размер обрабатываемого файла robots.txt. Если сгенерированный объем правил превышает лимит в 100 000 символов, валидатор сообщит: «Этот файл robots.txt слишком велик для проверки здесь.».

    Часто задаваемые вопросы

    Что этот генератор может добавить в robots.txt?
    Добавьте группу user-agent, пути Allow и Disallow, а также один или несколько URL-адресов карт сайтов. Готовый результат можно скопировать в файл robots.txt.

    Как валидатор путей выбирает правило?
    Он следует порядку сопоставления Google: побеждает наиболее длинный совпадающий путь. Если правила Allow и Disallow имеют одинаковую длину совпадения, приоритет отдается Allow.

    Удаляет ли директива Disallow страницу из поиска Google?
    Нет. Заблокированная страница все равно может появляться в результатах поиска, если на нее ссылаются другие страницы. Используйте тег noindex, ограничение доступа или удалите страницу, если ее вообще не должно быть в поиске.