简答:AI 代理分四种职责,而职责决定了封锁的代价。训练爬虫在今天的答案里不花你任何代价;检索代理的代价就是答案本身;用户触发的抓取代价是一个真人的请求;使用控制压根不抓取。

四种职责

职责例子封锁的代价
训练语料GPTBot、ClaudeBot、CCBot、meta-externalagent不影响今天的回答——一个站得住的策略立场
搜索与答案索引OAI-SearchBot、PerplexityBot、Claude-SearchBot、Applebot你从那个引擎的回答里消失
用户触发抓取ChatGPT-User、Claude-User、Perplexity-User一个真人发出的请求失败;其中几个被明确记载为通常不遵守 robots.txt
使用控制Google-Extended、Applebot-Extended有边界且具体——例如只影响 grounded 的 Gemini 回答,Google 搜索明确不受影响

为什么「一个厂商一条规则」是错的形状

每个主要厂商都刻意运行多个代理,就是为了让决定可以分开。对厂商用通配会把四个决定压成一个,而且几乎总会产生一个没人选择过的结果。最常见的版本是:在同一行里既拒绝了训练用途,也把自己从搜索结果里移除了。

表格告诉不了你的两件事

  • 你的服务器是否遵守它。规则是意图,只有实际取一次才是证据。CDN 和 WAF 规则经常对一切看起来像机器人的请求覆盖 robots.txt。
  • 某个未公开的代理是否存在。有些厂商没有公开任何可以按名放行的名字。这种情况下诚实的做法是明说——编一个 User-Agent 名字比留空更糟,因为站长会照着一个没人遵守的名字写规则,然后以为自己放行了什么。

清单要带日期

厂商文档会变。任何没有「核对日期」的爬虫表,都是某个未知时刻的快照;而比「没有策略」更糟的,是一份建立在去年的名字之上的策略。