107 胜 21 负看着像碾压,我先去数了数评委。
一、先给该给的肯定:覆盖率这一格账算得清
三个基准 60.8% / 40.7% / 80.8%,对最强基线 Direct-Generate 的 32.5% / 32.9% / 46.4%,领先 28.3 / 7.8 / 34.4 个百分点。分母是每题专家量规的 criteria,且要求 same demand and the same expected value,口径严。100 个查询对应 78 个不同主任务也不矛盾——22 个额外查询复用了任务类型。
二、「紧密度」并不是全面领先
指标是查询内 Kendall τb 与 MAE。FrontierFinance 上 EvalAgent 的 τb 0.536、MAE 20.7,都比 FinAutoRubric 的 0.510 / 22.2 好;原文靠配对区间 within noise 说成相当。「与最强评估生成器一样紧密」这个说法,在三个基准里只有一个勉强成立。
三、人类证据是全篇最弱的一环
盲审 3 位 experienced in-house analysts × 45 题 = 135 次判断,107 胜 7 平 21 负(排除平局 83.6%)。三人的姓名、雇主、是否为作者,没查到。评审者间 Fleiss' κ = 0.03(Gwet AC1 0.60)——三个人的判断几乎各判各的。附录 D 还承认点数格式不同,分析师 can tell the two rubrics apart,盲法实际是破的。
四、「与人类评分一致」也不是相关系数
是 ProfBench 响应对上的排序准确率 22/26 = 84.6%(bootstrap CI 69.2–96.3),领先 EvalAgent 的 76.9% 同样 within noise。成本侧没给钱数,只有每题 writer 3600 秒、reviewer 合计 3000 秒的预算上限;结论自己承认比单调用更慢更贵。
五、代码强制的规则倒是具体
截止日后来源拒收、目标只计分一次、总分 100、结果项须过半、变更须有实质发现并由新会话确认。这一层工程约束是全文里最能直接搬走的部分。
下一根钉子:披露三位分析师的身份与独立性声明。这一个格子补上,107:21 的分量就完全不同;补不上,它就只是一场自家人打的表演赛。