Escolher idioma

Gerador de Robots.txt para Bloquear Rastreadores de IA

Crie regras de robots.txt e Content-Signal no navegador para controlar robôs de treinamento, bots de busca com IA e agentes de navegação.

Gerador de Robots.txt para IAComo funciona ↓
Indexar a página e exibir links com pequenos trechos
Usar a página como fonte para respostas geradas
Usar a página para treinar ou ajustar modelos de IA
Extensão Cloudflare: limite de uso do conteúdo coletado pelo bot
Termos legais que conferem efeito aos sinais sob as regras de direitos autorais da UE
Bloquear estes bots não afeta a visibilidade nas buscas
Bloquear estes bots remove você de respostas e citações em buscas de IA
Bloquear estes bots impede assistentes de abrir suas páginas sob solicitação
Agentes que clicam e preenchem formulários em nome do usuário
Use / para todo o site ou uma pasta como /artigos/
Necessário apenas para referências de Sitemap e llms.txt
Adicionado como comentário; robots.txt não possui diretiva llms.txt

robots.txt e Content-Signal expressam preferências; eles não bloqueiam nada por conta própria. Rastreadores que seguem boas práticas respeitam essas diretrizes, outros as ignoram, e o Google declarou que não atua com base no Content-Signal. Configure regras de bot no servidor se precisar de bloqueio efetivo.

Mehmet Demiray Publicado Atualizado
Compartilhar

Os quatro tipos de bots de IA na web

Robôs de inteligência artificial operam com objetivos distintos ao navegar em um site. Compreender essas funções é essencial para decidir quais permissões conceder no Gerador de Robots.txt para IA sem prejudicar o tráfego e a visibilidade do seu projeto.

Os rastreadores de IA catalogados pelo gerador se dividem em quatro categorias principais:

  1. Coletores de dados para treinamento: Robôs que varrem a web em massa para compor conjuntos de dados destinados ao treinamento de modelos de linguagem e visão. Exemplos incluem GPTBot, ClaudeBot, CCBot e Google-Extended. Bloquear esses agentes impede que o conteúdo do site seja absorvido em futuras versões de modelos de base.
  1. Indexadores de busca com IA: Agentes voltados para alimentar mecanismos de busca conversacionais e índices de recuperação em tempo real. O OAI-SearchBot e o PerplexityBot pertencem a este grupo. Bloquear esses indexadores remove o site das respostas com citações e fontes geradas por mecanismos de resposta direta.
  1. Buscadores acionados por usuários: Robôs disparados sob demanda quando uma pessoa faz uma solicitação explícita em uma interface de chat para consultar uma página específica. O ChatGPT-User opera dessa forma. O bloqueio impede que o usuário final visualize resumos da sua página durante uma conversa.
  1. Agentes de navegação autônomos: Ferramentas capazes de executar fluxos de trabalho na web em nome de usuários ou aplicações. O bloqueio restringe a automação direta de tarefas na sua interface pública.

A configuração padrão do Gerador de Robots.txt para IA bloqueia apenas os coletores de treinamento. Essa escolha permite manter a citação da sua marca em ferramentas de resposta por IA, resguardando ao mesmo tempo a propriedade intelectual contra o treinamento não autorizado de modelos.

Como funciona a estrutura do robots.txt gerado

O arquivo gerado pelo Gerador de Robots.txt para IA combina padrões modernos e compatibilidade tradicional com o protocolo de exclusão de robôs. O processamento ocorre inteiramente no navegador, garantindo privacidade total sem envio de dados para servidores externos.

A estrutura do arquivo gerado segue uma hierarquia organizada em blocos:

  • Grupo Geral (User-agent: *): Abre o arquivo definindo a política global. Inclui a diretiva Allow: / para garantir o acesso de rastreadores legítimos e insere a linha Content-Signal com as preferências selecionadas.
  • Grupos Específicos por Agente: Para cada robô marcado no catálogo de mais de 50 identificadores, o gerador cria um par de linhas contendo User-agent: [Identificador] e Disallow: [Caminho]. Isso garante que ferramentas que não interpretam sinais modernos ainda respeitem o bloqueio tradicional.
  • Caminho de Restrição Compartilhado: Por padrão, a regra de exclusão utiliza /, bloqueando todo o domínio para os agentes selecionados. O campo pode ser ajustado para caminhos específicos, como /privado/ ou /conteudo/.
  • Metadados Opcionais: Quando informada uma URL de domínio válida, o gerador insere a diretiva Sitemap: apontando para o mapa do site e um comentário estruturado indicando a localização de arquivos de contexto para modelos de linguagem.

Essa composição híbrida atende tanto a rastreadores consolidados quanto a novas infraestruturas de inteligência artificial.

Diretivas Content-Signal e direitos autorais

A diretiva Content-Signal é uma proposta técnica para indicar a finalidade com que conteúdos publicados na web podem ser processados por sistemas automatizados. Ela é inserida dentro do bloco universal User-agent: * no arquivo robots.txt.

Essa diretiva aceita três parâmetros fundamentais:

  • search: autorização para indexação e exibição em resultados de busca.
  • ai-input: permissão para uso do conteúdo como entrada em sistemas de inferência ou recuperação em tempo real.
  • ai-train: permissão para inclusão do conteúdo em conjuntos de dados para treinamento de modelos de IA.

Cada parâmetro pode ser configurado como allow (permitido), disallow (recusado) ou deixado de fora quando não há preferência explícita. O gerador também suporta a extensão da Cloudflare com o parâmetro use, que especifica o nível de uso permitido (immediate, reference ou full).

Sinal Efeito Prático
search=allow Permite exibição em snippets e índices de busca normais
ai-input=disallow Rejeita uso direto em prompts e sistemas de recuperação
ai-train=disallow Rejeita incorporação em bases de treinamento de modelos

O gerador oferece também a opção de incluir o bloco de texto referente à reserva formal de direitos de Mineração de Texto e Dados (TDM), alinhada ao Artigo 4 da Diretiva Europeia 2019/790. Esse comentário serve como declaração legal legível por máquina para reforçar a recusa de extração automatizada de dados em jurisdições que exigem reserva expressa de direitos.

Estratégias de bloqueio: escolha do perfil ideal

A escolha dos robôs a serem bloqueados depende dos objetivos editoriais e comerciais do seu site. O Gerador de Robots.txt para IA oferece pré-configurações pensadas para diferentes cenários operacionais.

Considere as seguintes abordagens práticas:

  1. Preservar visibilidade mantendo controle de treino (Recomendado): Utilize o perfil padrão de rastreadores de treinamento. Essa opção bloqueia agentes pesados de raspagem como GPTBot e ClaudeBot, mas mantém abertos indexadores como OAI-SearchBot e buscadores acionados por usuários. Seu conteúdo continua elegível para citações em buscas orientadas por IA.
  1. Bloqueio total de IA: Recomendado para portais de conteúdo fechado, bancos de imagens autorais ou projetos que desejam barrar qualquer forma de interação com ecossistemas de inteligência artificial. O gerador adiciona todas as 53 variantes de agentes conhecidas à lista de exclusão.
  1. Bloqueio segmentado por diretório: Caso o site possua uma área editorial aberta e uma pasta de materiais restritos, você pode definir o caminho de exclusão como /premium/ ou /arquivos/. Os robôs selecionados serão barrados exclusivamente nesses diretórios, mantendo a indexação livre nas demais páginas.
  1. Apenas sinais declarativos: Para sites que preferem não manter listas extensas de User-agent, a configuração de sinais envia apenas a linha Content-Signal, delegando o controle aos nós de borda ou às plataformas que aderem ao padrão.

Limites técnicos e fiscalização do robots.txt

O arquivo robots.txt é uma solicitação de cooperação, não um mecanismo de proteção criptográfica ou barreira de acesso. Rastreadores sérios respeitam rigorosamente essas diretivas, mas agentes maliciosos ou raspadores não oficiais podem ignorá-las integralmente.

Fatores técnicos a considerar ao publicar suas regras:

  • Dados já coletados: Bloquear um agente hoje impede coletas futuras, mas não remove materiais que já foram baixados e integrados a modelos anteriores.
  • Impacto no Google Search: O identificador Google-Extended controla o uso de conteúdo para o treinamento de modelos como Gemini e Vertex AI, sem qualquer impacto no rastreamento do Googlebot tradicional para a pesquisa orgânica.
  • Defesas complementares: Para bloquear acessos abusivos de forma mandatória, combine o arquivo com regras de firewall de aplicação web (WAF) no servidor ou em redes de entrega de conteúdo (CDN). Plataformas podem verificar a autenticidade de agentes por meio de certificados e chaves de autenticação de robôs.

Após gerar o arquivo, valide a sintaxe utilizando um testador de robots.txt para certificar-se de que nenhuma regra conflita com robôs essenciais de indexação orgânica.

A relação entre robots.txt e llms.txt

Com o avanço dos modelos de linguagem, surgiram novas convenções para estruturar a presença de um site na web. O robots.txt e o llms.txt desempenham funções distintas, porém complementares.

Enquanto o robots.txt atua como um manual de permissões e restrições de acesso (definindo quem pode ler e o que pode ser lido), o llms.txt atua como um mapa curado de informações, resumindo os principais tópicos e links úteis em formato Markdown simplificado para consumo direto por agentes inteligentes.

Como o padrão oficial do robots.txt (RFC 9309) não possui uma diretiva formal para indicar arquivos de linguagem, o Gerador de Robots.txt para IA insere a referência ao arquivo como um comentário informativo na estrutura:

# Context for LLMs: https://exemplo.com.br/llms.txt

Essa linha sinaliza aos desenvolvedores e ferramentas automatizadas a existência do arquivo de contexto sem quebrar a validação em analisadores estritos de robots.txt.

Se você deseja estruturar o resumo e a documentação do seu projeto para leitura otimizada por modelos de inteligência artificial, crie o arquivo complementar utilizando um gerador de llms.txt.

As que mais respondemos.

Como bloquear rastreadores de inteligência artificial no meu site?

Selecione o perfil desejado no Gerador de Robots.txt para IA, copie as diretivas geradas e publique o arquivo na raiz do seu domínio público. A ferramenta processa tudo no próprio navegador sem necessidade de cadastro. Para verificar se os agentes foram bloqueados corretamente após a publicação, você pode usar um testador de robots.txt.

Bloquear bots de IA prejudica o ranqueamento do site no Google?

Não. Robôs de treinamento de modelos generativos operam de forma separada dos indexadores de busca. O bloqueio do agente Google-Extended, por exemplo, impede o uso do seu conteúdo no treinamento do Gemini sem interferir na presença do site nos resultados de pesquisa do Googlebot.

Qual é a diferença entre GPTBot, OAI-SearchBot e ChatGPT-User?

O GPTBot coleta páginas para o treinamento de modelos futuros da OpenAI. O OAI-SearchBot indexa conteúdo para alimentar as respostas com fontes e links em tempo real. O ChatGPT-User atua sob demanda quando um usuário cola um link diretamente na conversa. Bloquear apenas o treinamento mantém a possibilidade de o seu site ser citado nas respostas.

O que significa a linha Content-Signal no robots.txt?

A especificação Content-Signal declara preferências sobre como o conteúdo pode ser aproveitado por sistemas automatizados. Ela opera com três parâmetros básicos: search para busca, ai-input para uso em consultas imediatas e ai-train para treinamento de modelos de linguagem. Essa linha complementa as diretivas clássicas de Disallow com uma declaração clara de intenção.

O robots.txt impede totalmente a raspagem de dados por terceiros?

O robots.txt funciona como um protocolo de conformidade voluntária respeitado pelas principais empresas de tecnologia. Agentes maliciosos ou raspadores não identificados podem ignorar essas instruções. Para uma restrição completa em áreas confidenciais, recomenda-se combinar as regras do arquivo com controles em nível de servidor web ou proteção por CDN.

Como associar um arquivo llms.txt ao meu robots.txt?

Como o protocolo robots.txt não possui uma diretiva oficial para documentos estruturados de IA, a indicação é feita por meio de um comentário contendo a URL completa do arquivo. Ao informar o endereço do seu site no Gerador de Robots.txt para IA, essa referência é incluída automaticamente. Para estruturar o conteúdo de contexto desse arquivo, utilize um gerador de llms.txt.

Posso bloquear bots de IA apenas em uma pasta específica do meu domínio?

Sim. Você pode definir um diretório restrito, como por exemplo /artigos-exclusivos/ ou /acervo/, no campo de caminho do gerador. A ferramenta aplicará esse caminho em cada linha Disallow dos robôs de IA escolhidos, mantendo a raiz do site e as demais páginas liberadas para rastreamento regular.