Escolher idioma

Testador e Validador de Robots.txt Online

Valide regras de robots.txt para Googlebot e robôs de IA, teste URLs com padrão RFC 9309 e exporte relatórios detalhados.

Testador de Robots.txtComo funciona ↓
Cole o arquivo como disponibilizado em /robots.txt. Processado diretamente no navegador, sem uploads.
Um token de produto como Googlebot, GPTBot ou ClaudeBot, ou uma string completa de User-Agent
Uma por linha. URLs completas são reduzidas para caminho e parâmetros de consulta.

Segue a RFC 9309, incluindo o caractere curinga * e a âncora de fim $: o grupo específico do rastreador tem prioridade sobre o grupo *, a regra correspondente mais longa prevalece e empates favorecem Allow. Rastreadores reais podem divergir em casos excepcionais.

Mehmet Demiray Publicado Atualizado
Compartilhar

Como funciona a correspondência de grupos no robots.txt

O arquivo robots.txt organiza suas instruções em grupos delimitados por uma ou mais linhas User-agent. O padrão formal definido pela RFC 9309 estabelece regras claras sobre como um rastreador deve identificar o bloco correto a ser seguido ao acessar um site.

Quando um robô como o Googlebot ou o GPTBot lê o arquivo, ele procura primeiro por um grupo que contenha seu identificador exato. Se houver um bloco específico para o seu nome, o rastreador processará exclusivamente as diretivas desse grupo e ignorará totalmente o bloco genérico identificado por User-agent: *. Diferente de outros sistemas de configuração, o robots.txt não combina regras de grupos diferentes: o grupo específico substitui o grupo geral por completo.

Se o rastreador não encontrar seu nome exato, ele verifica se existe um token pai derivado de hífen. Por exemplo, se o Googlebot-Image não encontrar um bloco dedicado, ele buscará por Googlebot antes de recorrer ao curinga genérico *. Caso múltiplos blocos no mesmo arquivo repitam o mesmo identificador de agente, a RFC 9309 determina que suas diretivas sejam combinadas em uma única lista de regras.

O Testador de Robots.txt processa exatamente essa hierarquia. Ao colar o conteúdo do seu arquivo e definir o identificador do robô, a ferramenta isola o grupo relevante e ignora os blocos que aquele agente específico desconsideraria em uma situação real.

A regra do padrão mais longo e critérios de desempate

Dentro de um grupo de regras, a ordem em que as linhas Allow e Disallow aparecem no arquivo não define a prioridade. A RFC 9309 adota o princípio da correspondência mais específica: a regra com o caminho mais longo que coincidir com a URL solicitada sempre vence.

Considere a tabela de avaliação abaixo para entender como caminhos conflitantes são resolvidos:

Regra Allow Regra Disallow URL solicitada Veredito
Allow: /produtos/ Disallow: /produtos/privados/ /produtos/privados/item Bloqueado (Disallow tem 19 caracteres contra 10)
Allow: /blog/post Disallow: /blog/ /blog/post-1 Permitido (Allow tem 10 caracteres contra 6)
Allow: /docs/ Disallow: /docs/ /docs/guia Permitido (empate de 6 caracteres favorece Allow)

Quando duas regras conflitantes possuem exatamente o mesmo comprimento em caracteres, a especificação determina que o acesso seja permitido (Allow). Além disso, uma diretiva Disallow vazia significa explicitamente que nenhum caminho está bloqueado, liberando o rastreamento integral do domínio.

O suporte aos caracteres especiais * (que representa zero ou mais caracteres arbitrários) e $ (que marca o fim exato da URL) amplia o controle. Um padrão como /*.pdf$ bloqueia apenas arquivos que terminam com essa extensão, enquanto /*.pdf? cobriria parâmetros de busca anexados ao documento.

Controle de rastreadores de inteligência artificial e Content-Signal

A proliferação de modelos de linguagem aumentou a necessidade de gerenciar agentes de inteligência artificial de forma granular. Robôs como GPTBot, ClaudeBot, Google-Extended e CCBot processam páginas para treinamento de modelos ou geração de respostas contextuais.

Para configurar permissões avançadas antes de testá-las, você pode utilizar o gerador de robots.txt para rastreadores de IA e depois validar a sintaxe no Testador de Robots.txt. O validador reconhece tokens modernos de IA e analisa como eles interpretam suas seções restritas.

Além das diretivas tradicionais de bloqueio, o ecossistema atual adota a diretiva Content-Signal. Essa instrução expressa a preferência do proprietário do site sobre como o conteúdo pode ser utilizado por sistemas automatizados. Ela opera com três valores principais: search (autorização para indexação em mecanismos de busca), ai-input (uso como contexto para respostas imediatas) e ai-train (uso dos dados para treinamento de modelos fundacionais).

O Testador de Robots.txt extrai e exibe o valor da diretiva Content-Signal associado ao grupo do robô selecionado. Para complementar a estruturação de conteúdo voltada a agentes inteligentes, muitos desenvolvedores também publicam um arquivo llms.txt, que atua em conjunto com o robots.txt organizando documentos para consumo direto por modelos de linguagem.

Erros comuns de sintaxe e alertas do analisador

Pequenas falhas de formatação podem fazer com que regras do robots.txt sejam ignoradas ou interpretadas de maneira incorreta pelos buscadores. O Testador de Robots.txt emite alertas visuais para as seguintes inconsistências frequentes:

  1. Diretivas órfãs: linhas como Disallow: /admin posicionadas no topo do arquivo antes de qualquer declaração de User-agent. A RFC 9309 exige que toda regra pertença a um grupo iniciado por um agente.
  2. Caminhos relativos: valores que não iniciam com barra /, como Disallow: admin/, são inválidos e geram avisos imediatos.
  3. Diretivas não padronizadas: parâmetros como Crawl-delay, Host e Clean-param não fazem parte do padrão oficial RFC 9309. O Google ignora Crawl-delay por completo, embora mecanismos como o Bing e o Yandex aceitem algumas extensões proprietárias.
  4. Uso indevido de Noindex: o robots.txt serve apenas para controlar o rastreamento, não a indexação. Inserir Noindex no robots.txt é uma prática obsoleta desconsiderada pelos principais rastreadores.

É fundamental lembrar que bloquear uma página no robots.txt impede que o rastreador baixe o conteúdo, mas a URL ainda pode aparecer no índice de busca se receber links externos. Para proteger dados sensíveis ou verificar a autenticidade real de um robô que alega ser o Googlebot, utilize métodos no servidor como a checagem por DNS reverso ou um gerador de chave de autenticação de bots.

Teste seguro no navegador antes da publicação em produção

Alterar o robots.txt diretamente no servidor de produção envolve riscos significativos para o tráfego orgânico. Uma regra mal formulada pode desindexar seções inteiras de um comércio eletrônico ou portal de notícias em poucos minutos.

O Testador de Robots.txt funciona totalmente no navegador, processando o texto colado via JavaScript local. Isso proporciona três vantagens práticas:

  • Validação de rascunhos: você pode colar novas versões do arquivo antes de enviar os arquivos para o repositório de código ou servidor web.
  • Privacidade absoluta: nenhum dado, rascunho de regras ou lista de URLs confidenciais sai do seu computador ou é enviado para servidores externos.
  • Sem necessidade de cadastro: a ferramenta não exige autenticação, verificação de propriedade de domínio ou credenciais de acesso.

Ao inserir URLs completas no campo de teste, o analisador isola automaticamente o caminho e os parâmetros de consulta (path e query), descartando o protocolo e o domínio. Os resultados detalham a linha exata que determinou o veredito de bloqueio ou permissão, com opções para exportar os diagnósticos em formato CSV ou imagem para documentação técnica de auditorias de SEO.

As que mais respondemos.

Como testar se uma URL está bloqueada no robots.txt?

Cole o conteúdo do seu arquivo no campo indicado, informe o identificador do robô (como Googlebot ou GPTBot) e insira os caminhos ou links a serem testados. O Testador de Robots.txt processa cada endereço segundo as regras da RFC 9309 e exibe imediatamente se o acesso foi permitido ou bloqueado, apontando a linha exata que determinou o resultado.

Preciso ter uma conta ou um site publicado para usar a ferramenta?

Não é necessário criar conta nem ter o site publicado. O Testador de Robots.txt funciona totalmente no seu navegador, o que permite validar rascunhos com segurança antes de colocá-los no servidor de produção. Seus dados e arquivos não são enviados para servidores externos.

O que acontece quando regras de Allow e Disallow coincidem no mesmo caminho?

Pelo padrão da RFC 9309, a regra mais específica vence, o que corresponde ao padrão com a maior quantidade de caracteres coincidentes. Em caso de empate de comprimento exato entre uma diretiva Allow e uma Disallow, a regra Allow tem prioridade e a URL é liberada para rastreamento.

Bloquear uma URL no robots.txt remove a página das buscas?

Não. O arquivo robots.txt gerencia o rastreamento e não a indexação. Se uma página bloqueada tiver links apontando para ela em outras páginas, mecanismos de busca ainda poderão exibi-la nos resultados. Para impedir a exibição definitiva na busca, deve-se usar a meta tag noindex diretamente no cabeçalho HTML da página.

Como testar o bloqueio para robôs de inteligência artificial?

Informe o identificador do robô no campo de agente, como GPTBot, ClaudeBot ou Google-Extended, e teste as URLs desejadas. Para estruturar regras completas voltadas a esses agentes antes de validá-las aqui, você pode utilizar o gerador de robots.txt para IA e colar o resultado diretamente nesta ferramenta.

O que significa a linha Content-Signal identificada no teste?

A diretiva Content-Signal informa preferências sobre o uso do conteúdo para treinamento e alimentação de modelos de IA. O Testador de Robots.txt reconhece e relata esses valores no grupo analisado, servindo como uma sinalização declarativa de direitos autorais para crawlers compatíveis.

Qual é a diferença entre este testador e o relatório do Google Search Console?

O Google Search Console analisa apenas o arquivo já publicado e restringe os testes ao Googlebot no domínio verificado. O Testador de Robots.txt permite testar qualquer rascunho de texto contra dezenas de rastreadores e robôs de IA diferentes de forma instantânea, sem exigir verificação de propriedade.