选择语言

AI 爬虫 robots.txt 生成器:精细控制 AI 抓取、训练与搜索

在浏览器本地生成 robots.txt 文件:内置 50 余个 AI 用户代理,可分别屏蔽训练采集、AI 搜索、用户触发抓取与浏览代理,支持 Content-Signal、Sitemap 与 llms.txt 注释。

AI 爬虫 robots.txt 生成器如何使用 ↓
索引页面并显示带有简短摘要的链接
将本页面用作生成答案的素材来源
将本页面用于训练或微调 AI 模型
Cloudflare 扩展:机器人可对抓取内容进行何种程度的使用
根据欧盟版权规则赋予这些信号法律效力的条文
屏蔽它们不会影响搜索曝光
屏蔽它们会使你的页面从 AI 搜索答案及引用中消失
屏蔽它们可阻止助手在用户请求时打开你的页面
代表用户点击和填写表单的代理
使用 / 表示整个网站,或使用 /articles/ 这样的文件夹路径
仅用于 Sitemap 和 llms.txt 地址
以注释形式添加;robots.txt 没有 llms.txt 指令

robots.txt 和 Content-Signal 只是表明偏好,本身不会阻止任何访问。遵守规则的爬虫会遵循这些声明,其他爬虫则会忽略;Google 已表示不会根据 Content-Signal 采取行动。如需强制执行,请配合服务器端机器人规则。

Mehmet Demiray 发布日期 更新日期
分享

四类 AI 爬虫分别做什么

很多站长只认识 GPTBot,但 AI 爬虫并不是一个整体。AI 爬虫 robots.txt 生成器把收录的超过 50 个 AI 用户代理分成四类。第一类是训练数据收集器,代表有 GPTBot、ClaudeBot、CCBot 和 Google-Extended,它们抓取网页用于训练或微调模型。屏蔽它们可以拒绝未来的训练用途,通常不会影响普通搜索排名。第二类是 AI 搜索索引器,例如 OAI-SearchBot,它们为 AI 问答或搜索产品建立可引用的索引。屏蔽这类爬虫会减少在 AI 回答中被提及和获得引荐流量的机会。第三类是用户触发的抓取器,例如 ChatGPT-User,它们只在用户明确要求读取某个链接时才抓取。屏蔽后用户无法让助手现场总结你的页面,但不会因此阻止训练数据抓取。第四类是浏览代理,它们代表用户进行多步浏览,行为更像一个自动化的访问者。理解这四类爬虫的用途,是决定屏蔽哪些对象的前提。默认预设通常只屏蔽第一类训练数据收集器,保留搜索索引和用户抓取两个可见渠道。

生成后的 robots.txt 如何工作

生成后的文件通常从 User-agent: * 通配组开始。这个组会包含 Content-Signal: search=allow, ai-input=allow, ai-train=disallow 一类的偏好行,以及 Allow: /,表示对没有专门规则的客户端不额外禁止访问。随后每个被屏蔽的 AI 爬虫各自对应一个独立的 User-agent 组,例如 User-agent: GPTBot 下面跟着 Disallow: /。这里的 / 是默认共享路径,表示该爬虫不能访问网站上的任何路径;如果你把路径改成 /drafts/,所有被选中的屏蔽对象都只禁止访问这个目录。可选的 Sitemap: https://example.com/sitemap.xml 需要填写有效站点 URL 才会出现。llms.txt 提示行因为只是注释,会以 # 开头,同样需要站点 URL。生成器还会给出汇总信息,包括被屏蔽数量、涉及的运营方和用户代理组数量。整个生成过程都在浏览器本地完成,不把网站内容发给服务器。生成后建议用 robots.txt 检查工具 验证用户代理规则。

Content-Signal 三个信号怎么理解

Content-Signal 源自 contentsignals.org 与 Cloudflare 提出的偏好表达方式,和传统 Disallow 不同,它不直接要求停止抓取,而是声明内容可以被用于什么用途。生成器把它放在 User-agent: * 通配组中,因此对所有尊重该信号的客户端生效。三个核心键分别是 search、ai-input 和 ai-train。search 控制内容是否可用于 AI 搜索或答案中的引用;ai-input 控制内容是否可作为用户提问时的上下文输入;ai-train 控制内容是否可用于训练或微调模型。每个键可以写 allow 或 disallow,也可以直接省略,省略代表 no preference,即不表达倾向。示例行 Content-Signal: search=allow, ai-input=allow, ai-train=disallow 表示允许 AI 搜索引用和作为即时输入,但拒绝用于训练。生成器还可以加入 Cloudflare 扩展的 use 参数,取值为 immediate、reference 或 full,用于表达使用范围的粒度。生成器中的政策注释块取自欧盟《数字化单一市场版权指令》第 4 条关于文本与数据挖掘权利保留的表述,它只是提示性文字,不构成法律意见。

如何选择要屏蔽的 AI 爬虫

选择预设可以从一个简单问题开始:你希望网站继续出现在 AI 答案的引用里吗?如果希望被 AI 搜索引用,但不愿意内容被拿去训练模型,使用默认预设「仅训练数据收集器」就足够。它会屏蔽 GPTBot、ClaudeBot、CCBot 和 Google-Extended 等训练爬虫,同时保留 OAI-SearchBot 和 ChatGPT-User 等可见渠道。Google-Extended 特别值得注意,它只影响 Gemini 的训练抓取,不会影响 Googlebot 的常规搜索索引与排名。如果你完全不想参与任何 AI 抓取,可以选择「所有 AI 爬虫」预设,代价是 AI 搜索引用、聊天端现场读取和浏览代理访问都会减少。对于只想保护草稿或私有目录的情况,选择自定义并把共享路径设为 /drafts/ 这样的具体路径,所有被选中的爬虫都只会在该目录上被禁止。只有信号而不屏蔽任何爬虫,则适合愿意让机器人继续访问但希望声明用途偏好的站点。

robots.txt 的边界与实际执行

robots.txt 和 Content-Signal 都是请求式约定,不是技术上的隔离墙。遵守与否取决于爬虫运营方,部分工具会忽略这些声明。Google 曾明确表示不会根据 Content-Signal 采取行动,因此不能只依赖它来阻止 Google 系 AI 训练。另一个常见误解是,屏蔽后已进入训练集的数据并不等于会被删除,历史抓取内容可能仍然存在于模型的权重中。想获得真正的阻断能力,需要把这份生成文件放到域名根目录,并在服务器或 CDN 层补充规则,例如按用户代理拒绝请求、限速或使用 WAF。用户代理可以被伪造,更严格的做法是对关键接口做身份校验。如果你需要更可靠的机器验证,可以继续用 机器令牌校验工具 做加密校验。修改规则后,建议用 robots.txt 检查工具 检查各个 AI 爬虫会被哪些规则命中,避免误伤正常搜索。

robots.txt 与 llms.txt 的区别

robots.txt 是给爬虫看的访问约束,语法围绕 User-agent、Allow、Disallow 和 Sitemap 等指令展开。它里面并没有 llms.txt 指令,所以 AI 爬虫 robots.txt 生成器只能把 llms.txt 的位置写成以 # 开头的注释,例如 # llms.txt: https://example.com/llms.txt。注释行的目的是方便维护者看到提示,爬虫通常会忽略它。llms.txt 则是一个独立文件,通常放在站点根目录,面向大语言模型提供结构化摘要、关键链接和页面说明,帮助模型在读取网站时更快理解内容。两者的分工可以理解为:robots.txt 管什么能爬,llms.txt 管爬了以后怎样更容易理解。这个生成器只负责前者,并且只在填写有效站点 URL 时才加入 Sitemap 指令和 llms.txt 注释。如果你已经准备好为网站提供适合大模型的目录文件,可以用 llms.txt 生成器 生成配套内容,再把这个文件的路径回填到本工具的站点 URL 中。

我们回答最多的问题

怎么用 AI 爬虫 robots.txt 生成器屏蔽 AI 爬虫?

打开工具后,先选一个预设:默认只屏蔽训练类爬虫,适合大多数网站。也可以选“全部 AI 爬虫”“仅信号”或“自定义”。生成后下载 robots.txt,把它上传到网站根目录。上传前建议用 robots.txt 测试工具 检查最终文件是否按预期生效。

生成的 robots.txt 文件应该放到哪里?

只能放在网站根目录,例如 https://example.com/robots.txt。一个主机只能有一个 robots.txt,子域名需要单独放在对应子域名的根目录。放在子目录里通常不会被爬虫读取。

这个工具免费吗?需要注册吗?

完全免费,不需要注册或登录。所有生成逻辑都在浏览器本地完成,不会把你的网址或配置上传到服务器。

GPTBot、OAI-SearchBot 和 ChatGPT-User 有什么区别?

三者来自 OpenAI,但用途不同。GPTBot 用于抓取训练数据,屏蔽它会减少内容被用于训练模型。OAI-SearchBot 用于 AI 搜索索引,屏蔽后你的页面更难出现在 AI 回答的引用里。ChatGPT-User 只在用户向 ChatGPT 提问并需要实时访问链接时抓取,屏蔽它通常不会影响训练,但会限制实时读取。

Content-Signal 是什么?

Content-Signal 是写在 User-agent: * 组里的一组偏好,包含 search、ai-input 和 ai-train 三个信号。每个信号可以设为 allow、disallow 或不写,不写表示无偏好。它表达的是内容可以怎么用,和 Disallow 表达的是否允许抓取不同。工具还可选 Cloudflare 的 use 参数,用于说明引用时效。

Content-Signal 和 Disallow 有什么区别?

Disallow 是请求爬虫不要访问某个路径,管的是能不能抓。Content-Signal 是内容信号,管的是抓到后可以怎么用,例如是否用于 AI 训练或 AI 搜索。这个生成器可以同时写入两层:在通配组放 Content-Signal,在每个被屏蔽的爬虫组放 Disallow。

屏蔽 Google-Extended 会影响 Google 搜索排名吗?

不会。Google-Extended 只控制 Google 是否把你的内容用于 Gemini 等模型训练,不影响 Googlebot 的正常抓取、收录或搜索排名。如果只想退出 AI 训练又保留 Google 搜索,可以只屏蔽 Google-Extended。

robots.txt 真的能阻止 AI 爬虫抓取吗?

不能保证。robots.txt 是一种约定,大多数主流爬虫会遵守,但它是请求而非强制措施。屏蔽也不会删除已经被抓取的内容。如果需要更可靠的拦截,可以在 CDN 或服务器层按 User-Agent 做规则,或使用 机器人身份密钥生成工具 验证机器人身份。

我可以只屏蔽某个文件夹,比如 /drafts/ 吗?

可以。在生成器里把屏蔽路径从默认的 / 改成 /drafts/,这个路径会应用到每一个被屏蔽的爬虫组。适合只保护草稿、内部资料或测试环境,而不影响整站被抓取。

为什么生成的 robots.txt 里没有 Sitemap 和 llms.txt 行?

这两项依赖于你网站的完整 URL。先在对应输入框里填写有效网址,例如 https://example.com,生成的文件才会包含 Sitemap 行和指向 llms.txt 的注释。llms.txt 不是 robots.txt 的标准指令,所以工具只以注释形式提示,需要另外用 llms.txt 生成器 制作文件。