贺去病品牌 AI 认知榜

THE METHOD BEHIND THE OBSERVATION

让每一次判断,
有据可查。

公开计算口径,也公开方法的边界。完整复算需要对应的原始回答、实体表与参数;摘要数据不能替代它们。

方法论版本 0.2.1 · 更新 2026-10-08

一、排序依据:成对击败率

榜单名次不是由综合分排出来的,而是由成对击败率排出来的:

  • A 对 B 的击败率 = 100 × (A 被提及而 B 未被提及的回答数) ÷ (至少一方被提及的回答数)
  • 分母为 0(双方都没出现)时记 null,不记 0。
  • 某实体的名次依据是它对其余每一个实体的击败率的平均值。

为什么不用绝对分:成对比较在同一条回答内部完成配对, 让两家企业面对相同回答条件;题库、模型和时间窗的选择仍会影响结论,不能据此宣称消除了系统性偏差。

二、综合分(ARS)只用于展示

综合分按下列权重加权合成,仅用于展示与趋势追踪,不参与名次判定:

  • mentionRate 35%
  • rankScore 30%
  • top1Rate 10%
  • soV 10%
  • stability 10%
  • sentiment 5%

权重是先验设定、公开、可被榜单配置覆盖,但不做数据拟合。 拟合出来的权重会被合理质疑成"为某个品牌调参"。

三、不确定性怎么处理

  • 置信区间:对回答做有放回重采样(Bootstrap),得到击败率的 95% 置信区间。
  • 并列带:置信区间重叠的名次合并报告为区间(如"第 5–8 名"),不得宣称彼此优劣。
  • 小样本惩罚(CAV):衡量"被提及的比例"时使用 Jeffreys 后验下界, 样本越小报得越低。3 次采样全都提到,下界也只有 55.6%,而不是 100%。
  • 改写轴:同一意图下用多种措辞提问,稳定性按意图分组统计, 把"换个说法答案就变"的不确定性算进去。
  • 显著性水平 α = 0.05,最小可发布样本量 N = 5。 样本量不足时,页面会明确标注"不得对外发布"。

四、空值与失败的处理

  • 未被提及记 0——确实零次提及,不是数据缺失。
  • 采样失败的回答被剔除出分母,绝不算作品牌缺席。 把"请求失败"和"AI 没提到"混为一谈会直接毁掉排名。
  • 分母为 0 记 null,不记 0:没测过不等于表现差。
  • 未被提及时情感分记 0,不能把"中性"映射成 0.5 白送分。
  • 免责声明段落里的品牌名被剔除,那不是推荐。

五、为什么只统计"要求推荐"类问题

实测发现一个必须处理的现象:AI 在"哪家好 / 哪个好"这类问题上会给出机构名单, 而在"怎么办 / 有没有必要 / 找哪家"这类问题上,常常一条机构名都不给 (实测 25 条回答里 18 条零提及,且零提及全部集中在后者)。

如果两类问题混在同一个分母里,"AI 在这个问题上根本不推荐任何人"会被误算成 "这些机构认知度低"——这是一个会直接歪曲结论的错误。

  • 进入排名的:问题本身要求推荐或对比(标注 purpose: ranking)。
  • 不进入排名的:问题是在问方法论或判断标准(purpose: behavior)。 它们单独记录 AI 的行为——"AI 在这类问题上拒绝点名"本身就是结论。
  • 同一批数据,用全部问题算出来的提及率会显著低于只用推荐类问题算出来的, 页面上标注的是后者,并注明样本量。

六、可复算性

  • 每个榜单标注方法论版本与指纹。权重、归一化锚点、空值策略、显著性水平 任一变动,指纹即变,历史榜单不会与新榜单混为一谈。
  • 当前版本:0.2.1,指纹 见各榜单页。
  • 所有随机过程使用固定种子(mulberry32),同输入必然同输出; 引擎中禁用 Math.random()。
  • 原始回答全量存档,带通道、模型版本、地域、语言、时间戳与采样参数。

七、已知局限

  • 解析器是规则式的。能识别编号列表、Markdown 表格、项目符号、中英混排与繁简写法; 对纯段落叙述,会标记为"低顺序置信度",因为那种写法里"先提到"不等于"更推荐"。
  • 引用信源归因尚未实现。当前只统计"提到了哪个实体",还统计不了"引用了谁的话"。
  • 幻觉判定依赖人工标注。每个实体需要一份事实基准才能自动判定 AI 是否说错。
  • 分组视图样本量较小,分通道/分地域对比用 ARS 排序,仅作观察参考,不参与名次判定。

八、我们不做什么

  • 不售卖名次、上榜、置顶,也不接受任何形式的"合作费换入选"。
  • 不对机构作主观评价:页面上的每条判断都限定为"AI 在某个问题上如此回答"。
  • 不承诺任何排名变化。诊断与修复服务只做信息补齐与口径统一。