简答:选一组不含品牌名的固定买家问题,在固定的引擎集合上按固定间隔跑,并用同一段代码判定竞品集里的每一个品牌。其余都是细化;这四条缺任何一条,数字就只是装饰。

第一步 —— 建问题集

问题应该是买家真的会请 AI 帮忙做的决定:比较、推荐、「X 场景选哪个」、「如果……我该用什么」。宽泛的品类问题测认知,比较与购买问题暴露商业缺口。

陷阱是自指问题。如果问题里有你的品牌名,答案里当然也会有。让 LLM 生成问题集,它会自己往这个方向漂——我们的生成器曾经产出 15 道题,其中 13 道带品牌名,五个引擎跑出来齐刷刷 13%,而真实值是 0。要在生成环节就过滤,不能只在打分环节过滤,否则额度全烧在你马上要丢掉的问题上。

第二步 —— 固定引擎与节奏

每一轮都记录跑了哪些引擎。增加一个引擎属于方法论变更,曲线要重新开始。固定间隔、固定时段,并且把结果锚定在这一轮的发起时间而不是任务跑完的时间——否则一次跑得慢的检测会落进错误的周期,你的趋势上会出现一个没人解释得清的折点。

第三步 —— 对称判定

一遍扫描、一段代码,集合里每一个品牌都算,包括你自己。平局判给对方。名称归一化要一致:如果「Acme」和「Acme Systems」对你合并成一个实体,对竞品也要合并。

第四步 —— 提及与推荐分开报

一句「Acme 常被诟病 X,所以多数买家选择 Y」确实包含你的品牌。算不算,取决于这个数字要回答什么问题。永远两列。

第五步 —— 留住证据

分数负责概括,证据负责解释该做什么。每条结果都要存下问题、答案、引擎、市场、被引 URL 与竞品语境。

没有答案原文,你就分不清是判定出了 bug 还是真的发生了变化——而这个品类里,两种你都会遇到。