简答:复合分数是变化探测器,不是诊断。我们那个把提及与引用加权成一个确定性数字,恰恰是为了让它在真实变化发生时动一下——而我们把构成项显示在它旁边,因为你实际要动手的是构成项。
复合分数擅长的事
只有一件:提醒你去看。这个月掉了八分,是一个「打开证据」的信号,本身不是结论。这样用它是值得的,因为没有人会每周手动过一遍五个引擎上的四十道题。
它从哪儿开始不管用
从有人问「那我们修什么」的那一刻起。两个品牌可以分数相同而问题完全相反——一个到处被引用却从不被推荐,另一个在少数答案里被推荐却一个链接都没有。同一个数字,不同的活儿。任何在界面上无法拆开的分数,都是一个你只能凭信任接受的数字。
分数被抬高的三种方式
- 问题集里有自指问题。带品牌名的问题自己回答了自己。十五道题里十三道带品牌名,我们曾经因此得到 13% 的分数,而诚实的数字是零。
- 把检索候选池当引用数。引擎组装的候选池远大于它在答案正文里引用的部分——修之前这让我们自己的引用数字虚高了两到四倍。
- 把「没测」画成 0,或者更糟,直接丢掉。悄悄丢掉失败的轮次会抬高均值,画成 0% 会压低均值。两种做法都让这个数字不再是它字面的意思;唯一诚实的选择是把缺口显示出来。
该问供应商什么
把问题集给我看。告诉我这些轮次里哪些失败了。给我看一条把我算成「被引用」的答案,连同那个来源标注。
三个要求,如果衡量是扎实的,满足它们都很便宜。任何一条遇到阻力,说明这个分数在承担它支撑不住的工作。