简答:Perplexity 几乎每条回答都附来源,所以你的访问与抽取问题在这里会比任何地方更快地反映在引用数据上。先修好 Perplexity,通常会顺带修好其它引擎。

两个代理,两个不同的决定

Perplexity 的文档点名了 PerplexityBot:它为回答中的展示与链接建立索引,文档说明它不用于为基础模型抓取内容。另一个代理 Perplexity-User 因为用户的问题需要而访问页面;文档说明它通常不遵守 robots.txt,因为请求来自真人。

写规则的时候这个区分很要紧。封掉 PerplexityBot 就是让自己从 Perplexity 的回答里消失。这不是一个关于训练用途的决定,把它当成那个来处理是一个常见且昂贵的错误。

引用要数对,否则这个数字没用

这正是这个品类里多数工具虚高的地方。引擎会组装一个检索候选池,它远大于最终出现在答案正文里的那些来源。数候选池而不是数正文里的标注,会让引用份额虚高好几倍——我们自己修之前实测是两到四倍。

只数答案正文里真实标注出来的来源。检索候选池不是引用。

什么样的页面在这里能被引用

  • 服务端渲染的内容。实质内容不能依赖 JavaScript。
  • 每个问题一段自洽的话。那一段要能被剪出来贴进回复后仍然成立。
  • 凡有时效的都写明确日期,因为引擎正在你的页面和一张更新的页面之间做选择。
  • 站外证据链接。一条自带来源的论断比一句光秃秃的断言更容易被复用。

结果怎么读

在一组固定问题上追踪自有域名出现在引用来源中的情况,并且看它在所有被引来源里的排名,而不是一个份额百分比——在一百个来源里排第五是一个真实、可解释的位置,而「5% 引用份额」会因为和你完全无关的原因上下浮动。