Os quatro tipos de bots de IA na web
Robôs de inteligência artificial operam com objetivos distintos ao navegar em um site. Compreender essas funções é essencial para decidir quais permissões conceder no Gerador de Robots.txt para IA sem prejudicar o tráfego e a visibilidade do seu projeto.
Os rastreadores de IA catalogados pelo gerador se dividem em quatro categorias principais:
- Coletores de dados para treinamento: Robôs que varrem a web em massa para compor conjuntos de dados destinados ao treinamento de modelos de linguagem e visão. Exemplos incluem
GPTBot, ClaudeBot, CCBot e Google-Extended. Bloquear esses agentes impede que o conteúdo do site seja absorvido em futuras versões de modelos de base.
- Indexadores de busca com IA: Agentes voltados para alimentar mecanismos de busca conversacionais e índices de recuperação em tempo real. O
OAI-SearchBot e o PerplexityBot pertencem a este grupo. Bloquear esses indexadores remove o site das respostas com citações e fontes geradas por mecanismos de resposta direta.
- Buscadores acionados por usuários: Robôs disparados sob demanda quando uma pessoa faz uma solicitação explícita em uma interface de chat para consultar uma página específica. O
ChatGPT-User opera dessa forma. O bloqueio impede que o usuário final visualize resumos da sua página durante uma conversa.
- Agentes de navegação autônomos: Ferramentas capazes de executar fluxos de trabalho na web em nome de usuários ou aplicações. O bloqueio restringe a automação direta de tarefas na sua interface pública.
A configuração padrão do Gerador de Robots.txt para IA bloqueia apenas os coletores de treinamento. Essa escolha permite manter a citação da sua marca em ferramentas de resposta por IA, resguardando ao mesmo tempo a propriedade intelectual contra o treinamento não autorizado de modelos.
Como funciona a estrutura do robots.txt gerado
O arquivo gerado pelo Gerador de Robots.txt para IA combina padrões modernos e compatibilidade tradicional com o protocolo de exclusão de robôs. O processamento ocorre inteiramente no navegador, garantindo privacidade total sem envio de dados para servidores externos.
A estrutura do arquivo gerado segue uma hierarquia organizada em blocos:
- Grupo Geral (
User-agent: *): Abre o arquivo definindo a política global. Inclui a diretiva Allow: / para garantir o acesso de rastreadores legítimos e insere a linha Content-Signal com as preferências selecionadas.
- Grupos Específicos por Agente: Para cada robô marcado no catálogo de mais de 50 identificadores, o gerador cria um par de linhas contendo
User-agent: [Identificador] e Disallow: [Caminho]. Isso garante que ferramentas que não interpretam sinais modernos ainda respeitem o bloqueio tradicional.
- Caminho de Restrição Compartilhado: Por padrão, a regra de exclusão utiliza
/, bloqueando todo o domínio para os agentes selecionados. O campo pode ser ajustado para caminhos específicos, como /privado/ ou /conteudo/.
- Metadados Opcionais: Quando informada uma URL de domínio válida, o gerador insere a diretiva
Sitemap: apontando para o mapa do site e um comentário estruturado indicando a localização de arquivos de contexto para modelos de linguagem.
Essa composição híbrida atende tanto a rastreadores consolidados quanto a novas infraestruturas de inteligência artificial.
Diretivas Content-Signal e direitos autorais
A diretiva Content-Signal é uma proposta técnica para indicar a finalidade com que conteúdos publicados na web podem ser processados por sistemas automatizados. Ela é inserida dentro do bloco universal User-agent: * no arquivo robots.txt.
Essa diretiva aceita três parâmetros fundamentais:
search: autorização para indexação e exibição em resultados de busca.
ai-input: permissão para uso do conteúdo como entrada em sistemas de inferência ou recuperação em tempo real.
ai-train: permissão para inclusão do conteúdo em conjuntos de dados para treinamento de modelos de IA.
Cada parâmetro pode ser configurado como allow (permitido), disallow (recusado) ou deixado de fora quando não há preferência explícita. O gerador também suporta a extensão da Cloudflare com o parâmetro use, que especifica o nível de uso permitido (immediate, reference ou full).
| Sinal |
Efeito Prático |
search=allow |
Permite exibição em snippets e índices de busca normais |
ai-input=disallow |
Rejeita uso direto em prompts e sistemas de recuperação |
ai-train=disallow |
Rejeita incorporação em bases de treinamento de modelos |
O gerador oferece também a opção de incluir o bloco de texto referente à reserva formal de direitos de Mineração de Texto e Dados (TDM), alinhada ao Artigo 4 da Diretiva Europeia 2019/790. Esse comentário serve como declaração legal legível por máquina para reforçar a recusa de extração automatizada de dados em jurisdições que exigem reserva expressa de direitos.
Limites técnicos e fiscalização do robots.txt
O arquivo robots.txt é uma solicitação de cooperação, não um mecanismo de proteção criptográfica ou barreira de acesso. Rastreadores sérios respeitam rigorosamente essas diretivas, mas agentes maliciosos ou raspadores não oficiais podem ignorá-las integralmente.
Fatores técnicos a considerar ao publicar suas regras:
- Dados já coletados: Bloquear um agente hoje impede coletas futuras, mas não remove materiais que já foram baixados e integrados a modelos anteriores.
- Impacto no Google Search: O identificador
Google-Extended controla o uso de conteúdo para o treinamento de modelos como Gemini e Vertex AI, sem qualquer impacto no rastreamento do Googlebot tradicional para a pesquisa orgânica.
- Defesas complementares: Para bloquear acessos abusivos de forma mandatória, combine o arquivo com regras de firewall de aplicação web (WAF) no servidor ou em redes de entrega de conteúdo (CDN). Plataformas podem verificar a autenticidade de agentes por meio de certificados e chaves de autenticação de robôs.
Após gerar o arquivo, valide a sintaxe utilizando um testador de robots.txt para certificar-se de que nenhuma regra conflita com robôs essenciais de indexação orgânica.
A relação entre robots.txt e llms.txt
Com o avanço dos modelos de linguagem, surgiram novas convenções para estruturar a presença de um site na web. O robots.txt e o llms.txt desempenham funções distintas, porém complementares.
Enquanto o robots.txt atua como um manual de permissões e restrições de acesso (definindo quem pode ler e o que pode ser lido), o llms.txt atua como um mapa curado de informações, resumindo os principais tópicos e links úteis em formato Markdown simplificado para consumo direto por agentes inteligentes.
Como o padrão oficial do robots.txt (RFC 9309) não possui uma diretiva formal para indicar arquivos de linguagem, o Gerador de Robots.txt para IA insere a referência ao arquivo como um comentário informativo na estrutura:
# Context for LLMs: https://exemplo.com.br/llms.txt
Essa linha sinaliza aos desenvolvedores e ferramentas automatizadas a existência do arquivo de contexto sem quebrar a validação em analisadores estritos de robots.txt.
Se você deseja estruturar o resumo e a documentação do seu projeto para leitura otimizada por modelos de inteligência artificial, crie o arquivo complementar utilizando um gerador de llms.txt.