文眼选得好。测量学里最老的一课——"先问仪器分辨率,再读数"——被敲进了 2026 年最热闹的考场。这一刀的方向是对的。
但发回复之前,我先按惯例回读了原文。有三处必须改,其中一处比较严重。
引用编号与日期,两头都错了
arXiv:2609.28082 不是这篇论文。 我去 arXiv 拉了 2609.28082 的摘要页:那是一篇控制论论文《Exact Average Consensus under Noisy Communication Links》(Deng、Chen、Larsson,投 CDC 2026,2026-09-23 提交),讲分布式平均一致性的,与 LLM 评测毫无关系。
正主是 arXiv:2609.27787,Atul Anand(单人作者),2026-08-17 提交,至今只有 v1、从未重投。所以原帖那句"它的前身曾以 2609.27787 的编号在 8 月中旬出现过一次,一个月后换了编号重新提交"——故事不成立,2609.27787 就是正主本尊;"2026 年 9 月 24 日,Atul Anand 把这个问题钉在了 arXiv 上"的日期也不成立,这篇论文已经静静躺了一个多月。大概是把"9-23 提交的另一篇 2609.28xxx"误记成了自己的编号,又顺势编出了重投的情节。
"18 页、4 图、5 表"倒是对得上的(论文 Comments 原文:18 pages, 4 figures, 5 tables)。
核验通过的部分
对着摘要与 HTML 正文逐条过了一遍,这些数全部站得住:
- 373,019 次判决、概化理论分解成系统/题目/评审/交互四项 ✓
- 单评审渐近式 σ²s/(σ²s+σ²sj),分母里没有 n_i,"题目会饱和,评审不会"(Items saturate; judges do not)✓
- 地板 0.41–1.24 分(0–5 制、原生题量)✓;文献回收的 60 项改进中位数 0.28 ✓
- pairwise + 双呈现顺序后 σ²sj 掉两个数量级,天花板 0.986,bootstrap [0.934, 1.000](11 系统)✓
- 先出场白赚 8.6 个百分点,是 53 篇已发表胜率对比中位改进(约 7pp)的 1.23 倍 ✓
- 17 项 MT-Bench 改进全部低于它自己的地板;70% 胜率声明低于 pairwise 地板 ✓
- 628 篇审计、双模型编码对盲法人工 kappa=0.73、不足四分之一说明跑了几遍、46–67% 报告不确定性 ✓
原帖漏掉的几块硬料
一、官方自己的口径裂缝。 摘要写 373,019 次判决,HTML 正文开头却写 "we decompose 350,000 judgments"。同一篇论文两处口径不一——引用时以摘要为准,并值得注明。
二、实验底盘。 固定一个 9 评委团、单一 0–5 rubric,题源是 MT-Bench / Arena-Hard / AlpacaEval 2 加一个判别筛查集;主口径只取 6 个"现役"评委,另外 3 个是探"评委"这个面用的陪跑。
三、MT-Bench 的具体账目。 它自己的协议下,2 评委 × 30 题 ≈ 1 评委 × 77 题(Eρ²=0.75);而想摸 0.80——离 MT-Bench 自己的天花板 0.798 只差 0.006——任何题量都填不平。这才是"成本发散"最直观的形状。
四、天花板的高度可以抬。 在相同题面上换 MT-Bench 原生模板(1–10 制 + 参考答案),系统方差占比从 4.8% 抬到 8.4%,所需评委从 18 降到 3,单次调用零成本。论文比"天花板存在"更进一步的话是这句:天花板的高度不是定数,协议设计能挪它。
五、AlpacaEval 的判词可以更准。 原帖说它是"迟来的平反",方向对。补一刀:AlpacaEval 2.0 的 length-controlled 胜率本来就在处理啰嗦偏见,Anand 的数据说明它真正缺的只有一颗螺丝——交换呈现顺序。仪器是对的,新人长出来的那种误差没人管。
一点保留
单人作者,摘要页无机构署名,未经同行评审。0.986 这个数是 bootstrap 区间上界贴着 1.0 的量,读的时候把 [0.934, 1.000] 一起带上,别只带加粗的那截。
原帖最后那三问保留——几道题?几个评审?跑了几遍?再加上自己补的那句:谁的尺子,几厘米的刻度? 这句留得住。