产品 知识库问题 / 提示词AI 可抓取性AI 可见度引用来源监测与告警站内报告内容创作流失机会媒体投放与分发Shopify App查看 Web 平台
解决方案 电商与 DTC品牌官网内容与媒体服务机构AI 引擎技术平台Shopify GEO查看全部解决方案
资源 资源中心博客学习中心GEO 术语表研究报告
价格工具
关于 关于 InsightWonder联系我们安全
开始免费试用
参考表 · 核对于 2026-09-09

每一个 AI 爬虫:它做什么,封锁它到底会失去什么

7 家运营方的 17 个 User-Agent,每一行都取自该厂商自己的文档并附上链接。没有官方文档依据的一律不写进表里,已知的缺口列在文末。

收录代理 17
运营方 7
检索类代理 6 封掉这些会让你从回答里消失
训练类代理 4 这是另一个决定
总表

按代理的用途分组,而不是按厂商

厂商把自家代理排在一起,所以一条规则常常把它们全覆盖了。按用途分组才能把决定拆开:检索、用户触发抓取、训练,是三个不同的问题。

搜索与答案索引

User-Agent 运营方 它做什么 封锁它会失去什么
OAI-SearchBot OpenAI 构建在 ChatGPT 搜索功能中展示网站的索引。 从 ChatGPT 搜索结果中消失。很多站点本想拒绝训练,误封的却是这一个。
厂商文档 · IP 段
PerplexityBot Perplexity 为 Perplexity 回答中的展示与链接建立索引;文档说明它不用于为基础模型抓取内容。 从 Perplexity 的回答中消失。它几乎每条回答都给出来源,所以这里的封锁会立刻反映在引用数据上。
厂商文档
Claude-SearchBot Anthropic 为提升 Claude 用户看到的搜索结果的相关性与准确性而抓取。 你的页面不再进入 Claude 的搜索结果。
厂商文档
Google-CloudVertexBot Google 在站点所有者自行请求时抓取站点,用于构建 Vertex AI Agent。 只有当你用自己的内容构建 Vertex AI Agent 时才相关。
厂商文档
Applebot Apple 为 Spotlight、Siri、Safari 等 Apple 体验中的搜索技术提供支撑。 从 Apple 的搜索界面中消失。
厂商文档
meta-webindexer Meta 分析内容以提升 Meta AI 搜索结果的质量。 从 Meta AI 搜索结果中消失。
厂商文档

用户触发抓取

User-Agent 运营方 它做什么 封锁它会失去什么
ChatGPT-User
可能不遵守 robots.txt
OpenAI 因为 ChatGPT 或自定义 GPT 里有人要求而抓取某个页面。 明确要求 ChatGPT 去读你页面的用户,什么也拿不到。
厂商文档 · IP 段
Perplexity-User
可能不遵守 robots.txt
Perplexity 因为用户的问题需要而访问页面,并在回答中链接它。 用户请求的访问会失败。文档说明该代理通常不遵守 robots.txt,因为请求来自真人。
厂商文档
Claude-User
可能不遵守 robots.txt
Anthropic 因为 Claude 用户提出的问题需要而访问网站。 用户请求的那次访问会失败。
厂商文档
meta-externalfetcher
可能不遵守 robots.txt
Meta 在 Agent 类功能中,按用户请求抓取链接。 用户请求的那次抓取会失败;文档说明它在用户请求时可能绕过 robots.txt。
厂商文档

训练语料

User-Agent 运营方 它做什么 封锁它会失去什么
GPTBot OpenAI 抓取可能用于训练 OpenAI 生成式基础模型的内容。 不影响今天的回答。封锁它是对「内容是否用于训练」的一个可以辩护的立场,不会把你从 ChatGPT 搜索结果里移除。
厂商文档 · IP 段
ClaudeBot Anthropic 收集可能用于训练 Anthropic 模型的网页内容。 不影响今天的回答;这是一个关于训练用途的决定。
厂商文档
meta-externalagent Meta 为训练基础模型或直接索引内容等用途抓取网页。 内容不再进入 Meta 的模型训练与直接索引。
厂商文档
CCBot Common Crawl 构建一个开放、任何人可获取的网页抓取数据仓库。 你的页面会离开一个被广泛再分发的开放数据集。Common Crawl 自己的页面把仓库描述为对所有人开放,并未点名 AI 使用者,所以下游的训练用途只能视为「很可能」而非厂商确认。
厂商文档

使用控制(本身不抓取)

User-Agent 运营方 它做什么 封锁它会失去什么
Google-Extended Google 它不是爬虫,而是使用控制:决定已被抓取的内容能否用于训练 Gemini 模型、以及在 Gemini Apps 与 Vertex AI 中为回答提供 grounding。 从 grounded 的 Gemini 回答中消失,而文档明确说明不影响 Google 搜索的收录与排名。这是各厂商里分离得最干净的一处。
厂商文档
Applebot-Extended Apple 同样不是爬虫。禁止它表示内容不用于训练 Apple 的基础模型;文档说明禁止它的页面仍可出现在搜索结果中。 对搜索没有影响,纯粹是一个训练用途的决定。
厂商文档

广告安全审核

User-Agent 运营方 它做什么 封锁它会失去什么
OAI-AdsBot OpenAI 检查作为 ChatGPT 广告提交的页面是否安全,只访问被明确提交的页面。 只有在 ChatGPT 投放广告时才相关。
厂商文档 · IP 段
起点

把三个决定分开的 robots.txt 片段

它放行检索类与用户触发类代理,把「拒绝训练」注释掉留给你自己决定。robots.txt 是声明而非强制:写完之后要用真实请求验证。

# Retrieval agents: allowing these is what makes citation possible.
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Google-CloudVertexBot
Allow: /

User-agent: Applebot
Allow: /

User-agent: meta-webindexer
Allow: /

# User-triggered fetches: a person asked for this page by name.
User-agent: ChatGPT-User
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: meta-externalfetcher
Allow: /

# Training corpora are a separate decision. Uncomment to opt out.
# User-agent: GPTBot
# Disallow: /

# User-agent: ClaudeBot
# Disallow: /

# User-agent: meta-externalagent
# Disallow: /

# User-agent: CCBot
# Disallow: /

Sitemap: https://example.com/sitemap.xml
已知缺口

没有可按名放行的代理的引擎

不在表里,不等于不存在。这些是我们没有找到可引用的官方文档的情况。

Grok (xAI)

xAI 没有公开文档化的爬虫 User-Agent,因此无法按名字放行或封锁 Grok。你能控制的是页面对通用抓取是否可读。

Microsoft Copilot

我们没能在微软公开的站长文档里核实到 Copilot 专属爬虫,因此这里不列一行,而不是猜一个出来。

FAQ

团队开始前常问的问题

AI 爬虫一共有哪些?

本页收录 7 家运营方的 17 个 User-Agent,每一个都取自该厂商自己的文档,核对日期 2026-09-09:GPTBot、OAI-SearchBot、ChatGPT-User、OAI-AdsBot、PerplexityBot、Perplexity-User、ClaudeBot、Claude-SearchBot、Claude-User、Google-Extended、Google-CloudVertexBot、Applebot、Applebot-Extended、meta-externalagent、meta-webindexer、meta-externalfetcher、CCBot。

应该放行哪些 AI 爬虫?

如果你希望在 AI 回答里被引用,就放行检索类代理:OAI-SearchBot, PerplexityBot, Claude-SearchBot, Google-CloudVertexBot, Applebot, meta-webindexer。封掉其中任何一个,都会让你从对应引擎的回答中消失。训练类爬虫(GPTBot, ClaudeBot, meta-externalagent, CCBot)是另一个决定,不影响今天的回答。

封掉 GPTBot 会让我从 ChatGPT 消失吗?

不会。GPTBot 收集训练内容,OAI-SearchBot 才是 ChatGPT 搜索背后的索引。封 GPTBot 是关于训练用途的决定,不会把你从 ChatGPT 搜索结果里移除;封 OAI-SearchBot 才会。

AI 爬虫一定遵守 robots.txt 吗?

不一定,而且厂商自己就是这么写的。因为真人提出要求而抓取页面的代理,文档说明可能不遵守 robots.txt —— 请求来自用户,而不是自动抓取。本页已把这些行标出。

Google-Extended 是爬虫吗?

不是。Google-Extended 与 Applebot-Extended 是使用控制而不是爬虫:它们决定已被抓取的内容能否用于 AI 训练与 grounding。Google 文档明确说明 Google-Extended 不影响搜索的收录与排名。

这份表怎么维护

每一行都链回它的出处

  • 于 2026-09-09 对照各运营方自己的文档核对。厂商会改这些页面,所以日期本身就是事实的一部分。
  • 读 robots.txt 证明不了可访问。文件写着放行,但前面的 CDN 规则或防火墙对这些代理返回 403,实际就是封锁,而文件会一直宣称相反的事。
  • 有几个代理的文档写明「用户触发时可能不遵守 robots.txt」,表里已标出。
  • 用检查工具实测你自己的站点 · 衡量回答是否引用了你
从信号到行动

把 AI 可见度变成可持续的增长系统。

建立项目、确认市场,并开始监测真正重要的问题。