Gerador e Validador de Robots.txt

Crie regras de rastreamento e verifique quais caminhos o Googlebot pode acessar.

Regras de rastreamento

Comece com o rastreador (crawler) que deve seguir estas regras.

Sitemaps

robots.txt gerado

0
robots.txt
Pronto. O exemplo bloqueia /admin para todos os rastreadores.

Verificação de regras

    Testar um caminho

    Suas regras de rastreamento são criadas e verificadas no seu navegador. Nada é enviado para o BroBroGo.

    FAQ

    O que este gerador pode adicionar ao robots.txt?

    Adicione um grupo de user-agent, caminhos de permissão (Allow) e bloqueio (Disallow) e uma ou mais URLs de sitemap. A visualização estará pronta para ser copiada em um arquivo robots.txt.

    Como o verificador de caminho escolhe uma regra?

    Ele segue a ordem de correspondência do Google: o caminho correspondente mais longo vence. Se as regras Allow e Disallow correspondentes forem igualmente específicas, a regra Allow vence.

    A regra Disallow remove uma página da Pesquisa Google?

    Não. Uma página bloqueada ainda pode aparecer nos resultados de pesquisa se outras páginas tiverem links para ela. Use noindex, controle de acesso ou remova a página se precisar mantê-la totalmente fora das buscas.

    O papel e o funcionamento do arquivo robots.txt

    O arquivo robots.txt é um documento de texto simples posicionado na raiz de um servidor web para orientar rastreadores (crawlers), como o Googlebot, sobre quais partes de um site eles podem ou não acessar. Esse arquivo funciona como um guia de diretrizes voluntárias para os robôs de busca.

    Ao gerenciar um site, o controle do tráfego de rastreamento ajuda a otimizar o uso de recursos do servidor. Com o Gerador e Validador de Robots.txt, desenvolvedores e mantenedores de sites conseguem estruturar essas instruções de forma precisa, evitando que páginas administrativas ou dados internos sejam processados desnecessariamente por mecanismos de pesquisa.

    Diretivas de User-agent e controle de rastreadores

    As instruções dentro de um arquivo robots.txt são organizadas em grupos direcionados a rastreadores específicos, identificados pelo termo User-agent. É possível definir regras globais utilizando o caractere *, que se aplica a todos os robôs de forma genérica, ou especificar agentes individuais, como o Googlebot.

    No gerador, o processo de configuração inicia-se com a definição do User-agent. Existem regras estritas de sintaxe para esses identificadores: os nomes de user-agent não podem conter espaços. Caso um nome inválido seja inserido, a ferramenta exibe o aviso: "Insira um nome de user-agent sem espaços ou use * para todos os rastreadores.". Além disso, se o mesmo rastreador for declarado em múltiplos blocos distintos, o validador aponta o alerta "O Google combina grupos que nomeiam o mesmo user-agent.", indicando que o comportamento final do robô consolidará essas diretivas.

    Interação entre as regras de permissão (Allow) e bloqueio (Disallow)

    As duas principais diretivas de caminho dentro de um grupo de user-agent são:

    • Permitir (Allow): Indica que o rastreador tem autorização para acessar um determinado caminho.
    • Bloquear (Disallow): Restringe o acesso do rastreador ao caminho especificado.

    Por padrão, a ferramenta inicia sua configuração com uma estrutura básica contendo User-agent: * e Disallow: /admin. Todos os caminhos inseridos nas regras devem obrigatoriamente começar com o caractere / e não podem conter espaços. O descumprimento dessa regra gera o erro "Os caminhos das regras devem começar com / e não podem conter espaços.". Outro recurso de correspondência é o caractere $, utilizado para marcar o final exato de uma URL; ele só é válido se posicionado no término do caminho, caso contrário, o validador exibirá a mensagem "Use $ apenas no final do caminho de uma regra.".

    Se houver redundância de dados, como uma mesma instrução declarada mais de uma vez para o mesmo agente, a ferramenta sinaliza: "Esta regra está repetida para o mesmo user-agent.". No caso de caminhos idênticos configurados simultaneamente para permitir e bloquear, o validador exibe o alerta: "As regras de Permitir (Allow) e Bloquear (Disallow) usam o mesmo caminho. O Google aplica Permitir quando ambas são igualmente específicas.".

    A importância dos Sitemaps no robots.txt

    A inclusão da URL do sitemap no arquivo robots.txt é uma prática recomendada para indicar diretamente aos rastreadores onde encontrar o mapa completo de links do site, agilizando a descoberta de novas páginas.

    No utilitário, as URLs de sitemap inseridas devem ser caminhos absolutos e válidos. Se o endereço fornecido estiver incompleto ou incorreto, o sistema acusa o erro: "As URLs de sitemap precisam de um endereço completo http:// ou https://.".

    Como o Google processa a ordem de correspondência de regras

    Quando o Googlebot analisa um arquivo robots.txt para decidir se acessa ou não uma URL, ele não lê as regras simplesmente de cima para baixo. O processamento segue critérios específicos de prioridade:

    1. Comprimento do caminho: A regra com o caminho correspondente mais longo (mais específico) é a que prevalece.
    2. Empate de especificidade: Se uma regra de Allow e uma de Disallow tiverem exatamente o mesmo comprimento e forem igualmente específicas para um determinado caminho, a diretiva Allow vence.

    O validador integrado permite testar caminhos de URL específicos contra as regras geradas. Ao executar o teste, o resultado exibirá uma das seguintes respostas:

    • Permitido — {rule}: O caminho está liberado para rastreamento com base na regra indicada.
    • Bloqueado — {rule}: O acesso ao caminho está restrito pela regra apontada.
    • Nenhuma regra correspondente. O Google permite este caminho por padrão.: Ocorre quando nenhuma diretiva explícita se aplica à URL testada.

    Limitações do robots.txt no controle de indexação

    É fundamental compreender que o robots.txt controla apenas o comportamento de rastreamento (varredura), e não a indexação nos resultados de busca.

    Uma página bloqueada por uma diretiva Disallow ainda pode ser indexada e aparecer nos resultados de pesquisa do Google se houver links externos ou internos apontando para ela. O robots.txt não realiza funções de noindex, controle de acesso restrito por senha ou remoção definitiva de páginas. Para impedir totalmente que um conteúdo seja exibido nas buscas, devem ser utilizadas tags meta robots específicas ou autenticação no servidor.

    Adicionalmente, o tamanho do arquivo gerado é monitorado. Se o arquivo robots.txt ultrapassar o limite de 100.000 caracteres, o validador emitirá o aviso: "Este robots.txt é grande demais para ser revisado aqui.".

    Processamento local e privacidade

    Toda a criação, edição e validação das regras de rastreamento ocorrem diretamente no navegador do usuário. Nenhuma informação, caminho de URL ou configuração de sitemap é enviada para os servidores do BroBroGo, garantindo que os rascunhos de sua estrutura de diretórios permaneçam restritos ao seu ambiente local.


    Perguntas Frequentes (FAQ)

    O que este gerador pode adicionar ao robots.txt? Adicione um grupo de user-agent, caminhos de permissão (Allow) e bloqueio (Disallow) e uma ou mais URLs de sitemap. A visualização estará pronta para ser copiada em um arquivo robots.txt.

    Como o verificador de caminho escolhe uma regra? Ele segue a ordem de correspondência do Google: o caminho correspondente mais longo vence. Se as regras Allow e Disallow correspondentes forem igualmente específicas, a regra Allow vence.

    A regra Disallow remove uma página da Pesquisa Google? Não. Uma página bloqueada ainda pode aparecer nos resultados de pesquisa se outras páginas tiverem links para ela. Use noindex, controle de acesso ou remova a página se precisar mantê-la totalmente fora das buscas.