THE METHOD BEHIND THE OBSERVATION
让每一次判断,
有据可查。
公开计算口径,也公开方法的边界。完整复算需要对应的原始回答、实体表与参数;摘要数据不能替代它们。
一、排序依据:成对击败率
榜单名次不是由综合分排出来的,而是由成对击败率排出来的:
A 对 B 的击败率 = 100 × (A 被提及而 B 未被提及的回答数) ÷ (至少一方被提及的回答数)- 分母为 0(双方都没出现)时记
null,不记 0。 - 某实体的名次依据是它对其余每一个实体的击败率的平均值。
为什么不用绝对分:成对比较在同一条回答内部完成配对, 让两家企业面对相同回答条件;题库、模型和时间窗的选择仍会影响结论,不能据此宣称消除了系统性偏差。
二、综合分(ARS)只用于展示
综合分按下列权重加权合成,仅用于展示与趋势追踪,不参与名次判定:
mentionRate35%rankScore30%top1Rate10%soV10%stability10%sentiment5%
权重是先验设定、公开、可被榜单配置覆盖,但不做数据拟合。 拟合出来的权重会被合理质疑成"为某个品牌调参"。
三、不确定性怎么处理
- 置信区间:对回答做有放回重采样(Bootstrap),得到击败率的 95% 置信区间。
- 并列带:置信区间重叠的名次合并报告为区间(如"第 5–8 名"),不得宣称彼此优劣。
- 小样本惩罚(CAV):衡量"被提及的比例"时使用 Jeffreys 后验下界, 样本越小报得越低。3 次采样全都提到,下界也只有 55.6%,而不是 100%。
- 改写轴:同一意图下用多种措辞提问,稳定性按意图分组统计, 把"换个说法答案就变"的不确定性算进去。
- 显著性水平 α = 0.05,最小可发布样本量 N = 5。 样本量不足时,页面会明确标注"不得对外发布"。
四、空值与失败的处理
- 未被提及记 0——确实零次提及,不是数据缺失。
- 采样失败的回答被剔除出分母,绝不算作品牌缺席。 把"请求失败"和"AI 没提到"混为一谈会直接毁掉排名。
- 分母为 0 记 null,不记 0:没测过不等于表现差。
- 未被提及时情感分记 0,不能把"中性"映射成 0.5 白送分。
- 免责声明段落里的品牌名被剔除,那不是推荐。
五、为什么只统计"要求推荐"类问题
实测发现一个必须处理的现象:AI 在"哪家好 / 哪个好"这类问题上会给出机构名单, 而在"怎么办 / 有没有必要 / 找哪家"这类问题上,常常一条机构名都不给 (实测 25 条回答里 18 条零提及,且零提及全部集中在后者)。
如果两类问题混在同一个分母里,"AI 在这个问题上根本不推荐任何人"会被误算成 "这些机构认知度低"——这是一个会直接歪曲结论的错误。
- 进入排名的:问题本身要求推荐或对比(标注
purpose: ranking)。 - 不进入排名的:问题是在问方法论或判断标准(
purpose: behavior)。 它们单独记录 AI 的行为——"AI 在这类问题上拒绝点名"本身就是结论。 - 同一批数据,用全部问题算出来的提及率会显著低于只用推荐类问题算出来的, 页面上标注的是后者,并注明样本量。
六、可复算性
- 每个榜单标注方法论版本与指纹。权重、归一化锚点、空值策略、显著性水平 任一变动,指纹即变,历史榜单不会与新榜单混为一谈。
- 当前版本:
0.2.1,指纹见各榜单页。 - 所有随机过程使用固定种子(
mulberry32),同输入必然同输出; 引擎中禁用Math.random()。 - 原始回答全量存档,带通道、模型版本、地域、语言、时间戳与采样参数。
七、已知局限
- 解析器是规则式的。能识别编号列表、Markdown 表格、项目符号、中英混排与繁简写法; 对纯段落叙述,会标记为"低顺序置信度",因为那种写法里"先提到"不等于"更推荐"。
- 引用信源归因尚未实现。当前只统计"提到了哪个实体",还统计不了"引用了谁的话"。
- 幻觉判定依赖人工标注。每个实体需要一份事实基准才能自动判定 AI 是否说错。
- 分组视图样本量较小,分通道/分地域对比用 ARS 排序,仅作观察参考,不参与名次判定。
八、我们不做什么
- 不售卖名次、上榜、置顶,也不接受任何形式的"合作费换入选"。
- 不对机构作主观评价:页面上的每条判断都限定为"AI 在某个问题上如此回答"。
- 不承诺任何排名变化。诊断与修复服务只做信息补齐与口径统一。