四类 AI 爬虫分别做什么
很多站长只认识 GPTBot,但 AI 爬虫并不是一个整体。AI 爬虫 robots.txt 生成器把收录的超过 50 个 AI 用户代理分成四类。第一类是训练数据收集器,代表有 GPTBot、ClaudeBot、CCBot 和 Google-Extended,它们抓取网页用于训练或微调模型。屏蔽它们可以拒绝未来的训练用途,通常不会影响普通搜索排名。第二类是 AI 搜索索引器,例如 OAI-SearchBot,它们为 AI 问答或搜索产品建立可引用的索引。屏蔽这类爬虫会减少在 AI 回答中被提及和获得引荐流量的机会。第三类是用户触发的抓取器,例如 ChatGPT-User,它们只在用户明确要求读取某个链接时才抓取。屏蔽后用户无法让助手现场总结你的页面,但不会因此阻止训练数据抓取。第四类是浏览代理,它们代表用户进行多步浏览,行为更像一个自动化的访问者。理解这四类爬虫的用途,是决定屏蔽哪些对象的前提。默认预设通常只屏蔽第一类训练数据收集器,保留搜索索引和用户抓取两个可见渠道。