简答:OpenAI 文档化了三个代理:GPTBot 抓训练语料,OAI-SearchBot 做搜索索引,ChatGPT-User 响应真人请求去取页面。封第一个是一个站得住的策略立场;封第二个是把自己从 ChatGPT 的搜索结果里移除。一条冲着「OpenAI」去的通配规则会同时做掉两件事。

这个错误,说精确一点

站点决定不希望内容被用于模型训练。合理。然后写了一条笼统的规则,悄悄把自己从买家今天正在提问的那个界面上删掉了。代价是看不见的,因为什么都没坏——你只是不再出现,而且没有任何报错可供察觉。

在 robots.txt 里逐个点名代理。永远不要对厂商用通配,并且把理由写在规则旁边。

另外还有一个 OAI-AdsBot 用于广告安全审核,与你是否出现在回答里无关。

用「取一次」验证,不是用「读一遍」

读自己的 robots.txt 只能告诉你你的本意,不能告诉你服务器实际怎么做。一条 CDN 规则或者按 User-Agent 拦截的 WAF 会对点名的代理返回 403,而 robots.txt 上写着 Allow——robots.txt 查看器会报告一切正常。用每个 User-Agent 各请求自己的页面一次,比对状态码和真正吐出来的 HTML。

然后是抽取那一半

访问权限让你被考虑,抽取质量让你被使用。ChatGPT 是用段落拼回复的,所以:

  • 一个标题一个问题,用人会用的说法。
  • 答案在标题下第一句,点明主语,不依赖上方标题才成立。
  • 事实放进带单位和日期的表格;打太极的说法没法被引用。
  • 重要内容不要藏在折叠块、标签页或弹窗里——不在服务端渲染的 HTML 里就等于不存在。

不该测什么

ChatGPT 的回答里没有排名。报「排名」的工具,通常报的是某一次采样的答案里品牌碰巧出现的先后顺序,不稳定到无法画趋势。测「有没有出现」——被提及、被推荐、被引用——用固定问题集,并且三项分开报。