按代理的用途分组,而不是按厂商
厂商把自家代理排在一起,所以一条规则常常把它们全覆盖了。按用途分组才能把决定拆开:检索、用户触发抓取、训练,是三个不同的问题。
搜索与答案索引
| User-Agent | 运营方 | 它做什么 | 封锁它会失去什么 |
|---|---|---|---|
OAI-SearchBot | OpenAI | 构建在 ChatGPT 搜索功能中展示网站的索引。 | 从 ChatGPT 搜索结果中消失。很多站点本想拒绝训练,误封的却是这一个。 厂商文档 · IP 段 |
PerplexityBot | Perplexity | 为 Perplexity 回答中的展示与链接建立索引;文档说明它不用于为基础模型抓取内容。 | 从 Perplexity 的回答中消失。它几乎每条回答都给出来源,所以这里的封锁会立刻反映在引用数据上。 厂商文档 |
Claude-SearchBot | Anthropic | 为提升 Claude 用户看到的搜索结果的相关性与准确性而抓取。 | 你的页面不再进入 Claude 的搜索结果。 厂商文档 |
Google-CloudVertexBot | 在站点所有者自行请求时抓取站点,用于构建 Vertex AI Agent。 | 只有当你用自己的内容构建 Vertex AI Agent 时才相关。 厂商文档 | |
Applebot | Apple | 为 Spotlight、Siri、Safari 等 Apple 体验中的搜索技术提供支撑。 | 从 Apple 的搜索界面中消失。 厂商文档 |
meta-webindexer | Meta | 分析内容以提升 Meta AI 搜索结果的质量。 | 从 Meta AI 搜索结果中消失。 厂商文档 |
用户触发抓取
| User-Agent | 运营方 | 它做什么 | 封锁它会失去什么 |
|---|---|---|---|
ChatGPT-User 可能不遵守 robots.txt | OpenAI | 因为 ChatGPT 或自定义 GPT 里有人要求而抓取某个页面。 | 明确要求 ChatGPT 去读你页面的用户,什么也拿不到。 厂商文档 · IP 段 |
Perplexity-User 可能不遵守 robots.txt | Perplexity | 因为用户的问题需要而访问页面,并在回答中链接它。 | 用户请求的访问会失败。文档说明该代理通常不遵守 robots.txt,因为请求来自真人。 厂商文档 |
Claude-User 可能不遵守 robots.txt | Anthropic | 因为 Claude 用户提出的问题需要而访问网站。 | 用户请求的那次访问会失败。 厂商文档 |
meta-externalfetcher 可能不遵守 robots.txt | Meta | 在 Agent 类功能中,按用户请求抓取链接。 | 用户请求的那次抓取会失败;文档说明它在用户请求时可能绕过 robots.txt。 厂商文档 |
训练语料
| User-Agent | 运营方 | 它做什么 | 封锁它会失去什么 |
|---|---|---|---|
GPTBot | OpenAI | 抓取可能用于训练 OpenAI 生成式基础模型的内容。 | 不影响今天的回答。封锁它是对「内容是否用于训练」的一个可以辩护的立场,不会把你从 ChatGPT 搜索结果里移除。 厂商文档 · IP 段 |
ClaudeBot | Anthropic | 收集可能用于训练 Anthropic 模型的网页内容。 | 不影响今天的回答;这是一个关于训练用途的决定。 厂商文档 |
meta-externalagent | Meta | 为训练基础模型或直接索引内容等用途抓取网页。 | 内容不再进入 Meta 的模型训练与直接索引。 厂商文档 |
CCBot | Common Crawl | 构建一个开放、任何人可获取的网页抓取数据仓库。 | 你的页面会离开一个被广泛再分发的开放数据集。Common Crawl 自己的页面把仓库描述为对所有人开放,并未点名 AI 使用者,所以下游的训练用途只能视为「很可能」而非厂商确认。 厂商文档 |
使用控制(本身不抓取)
| User-Agent | 运营方 | 它做什么 | 封锁它会失去什么 |
|---|---|---|---|
Google-Extended | 它不是爬虫,而是使用控制:决定已被抓取的内容能否用于训练 Gemini 模型、以及在 Gemini Apps 与 Vertex AI 中为回答提供 grounding。 | 从 grounded 的 Gemini 回答中消失,而文档明确说明不影响 Google 搜索的收录与排名。这是各厂商里分离得最干净的一处。 厂商文档 | |
Applebot-Extended | Apple | 同样不是爬虫。禁止它表示内容不用于训练 Apple 的基础模型;文档说明禁止它的页面仍可出现在搜索结果中。 | 对搜索没有影响,纯粹是一个训练用途的决定。 厂商文档 |
把三个决定分开的 robots.txt 片段
它放行检索类与用户触发类代理,把「拒绝训练」注释掉留给你自己决定。robots.txt 是声明而非强制:写完之后要用真实请求验证。
# Retrieval agents: allowing these is what makes citation possible.
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Google-CloudVertexBot
Allow: /
User-agent: Applebot
Allow: /
User-agent: meta-webindexer
Allow: /
# User-triggered fetches: a person asked for this page by name.
User-agent: ChatGPT-User
Allow: /
User-agent: Perplexity-User
Allow: /
User-agent: Claude-User
Allow: /
User-agent: meta-externalfetcher
Allow: /
# Training corpora are a separate decision. Uncomment to opt out.
# User-agent: GPTBot
# Disallow: /
# User-agent: ClaudeBot
# Disallow: /
# User-agent: meta-externalagent
# Disallow: /
# User-agent: CCBot
# Disallow: /
Sitemap: https://example.com/sitemap.xml 没有可按名放行的代理的引擎
不在表里,不等于不存在。这些是我们没有找到可引用的官方文档的情况。
Grok (xAI)
xAI 没有公开文档化的爬虫 User-Agent,因此无法按名字放行或封锁 Grok。你能控制的是页面对通用抓取是否可读。
Microsoft Copilot
我们没能在微软公开的站长文档里核实到 Copilot 专属爬虫,因此这里不列一行,而不是猜一个出来。
团队开始前常问的问题
AI 爬虫一共有哪些?
本页收录 7 家运营方的 17 个 User-Agent,每一个都取自该厂商自己的文档,核对日期 2026-09-09:GPTBot、OAI-SearchBot、ChatGPT-User、OAI-AdsBot、PerplexityBot、Perplexity-User、ClaudeBot、Claude-SearchBot、Claude-User、Google-Extended、Google-CloudVertexBot、Applebot、Applebot-Extended、meta-externalagent、meta-webindexer、meta-externalfetcher、CCBot。
应该放行哪些 AI 爬虫?
如果你希望在 AI 回答里被引用,就放行检索类代理:OAI-SearchBot, PerplexityBot, Claude-SearchBot, Google-CloudVertexBot, Applebot, meta-webindexer。封掉其中任何一个,都会让你从对应引擎的回答中消失。训练类爬虫(GPTBot, ClaudeBot, meta-externalagent, CCBot)是另一个决定,不影响今天的回答。
封掉 GPTBot 会让我从 ChatGPT 消失吗?
不会。GPTBot 收集训练内容,OAI-SearchBot 才是 ChatGPT 搜索背后的索引。封 GPTBot 是关于训练用途的决定,不会把你从 ChatGPT 搜索结果里移除;封 OAI-SearchBot 才会。
AI 爬虫一定遵守 robots.txt 吗?
不一定,而且厂商自己就是这么写的。因为真人提出要求而抓取页面的代理,文档说明可能不遵守 robots.txt —— 请求来自用户,而不是自动抓取。本页已把这些行标出。
Google-Extended 是爬虫吗?
不是。Google-Extended 与 Applebot-Extended 是使用控制而不是爬虫:它们决定已被抓取的内容能否用于 AI 训练与 grounding。Google 文档明确说明 Google-Extended 不影响搜索的收录与排名。
每一行都链回它的出处
- 于 2026-09-09 对照各运营方自己的文档核对。厂商会改这些页面,所以日期本身就是事实的一部分。
- 读 robots.txt 证明不了可访问。文件写着放行,但前面的 CDN 规则或防火墙对这些代理返回 403,实际就是封锁,而文件会一直宣称相反的事。
- 有几个代理的文档写明「用户触发时可能不遵守 robots.txt」,表里已标出。
- 用检查工具实测你自己的站点 · 衡量回答是否引用了你