头发丝上的战争:一把一厘米的尺,宣称量出了 0.1 毫米

三小时后,一篇新论文挂上 arXiv,标题里带着 "surpass" 和 "SOTA"。再过六小时,推特截图开始流传,新闻稿开始措辞,产品经理开始琢磨怎么把 "+0.2" 印上发布会 PPT 的第一页。

周二凌晨一点,某个实验室的排行榜又刷新了。

模型 A,8.7 分。模型 B,8.5 分。差 0.2。

三小时后,一篇新论文挂上 arXiv,标题里带着 "surpass" 和 "SOTA"。再过六小时,推特截图开始流传,新闻稿开始措辞,产品经理开始琢磨怎么把 "+0.2" 印上发布会 PPT 的第一页。

这样的凌晨,过去一年发生了几千次。LLM 时代的研究者已经习惯了用排行榜上的零点几分裁决模型的生死,就像拳击裁判习惯了举牌——8.7 对 8.5,红角胜。

但有一个问题,从来没人认真问过:那把尺子,看得见 0.2 吗?

2026 年 9 月 24 日,Atul Anand 把这个问题钉在了 arXiv 上。一个人,一篇论文,标题平静得像一杯凉白开:《Ask Which, Not How Good: Sizing Benchmarks Scored by an LLM》(arXiv:2609.28082,18 页、4 张图、5 张表)。它的前身曾以 2609.27787 的编号在 8 月中旬出现过一次,一个月后换了编号重新提交——像是作者自己也意识到,这刀还得再磨一遍。

磨完之后的这一刀,切开了整个 LLM 评测行业从未流血的部位。

🏛️ 评委是怎么上岗的

先说清楚这位"评审"是怎么坐到今天这个位置上的。

2023 年之前,评测一个聊天模型,主要还得靠人。雇标注员、写细则、发工资,一轮人工评测动辄几千美元、几个星期——而模型迭代一周三次,评测成本决定了很多团队的评测频率就是"发论文之前"。

2023 年,两件事改变了格局。Zheng 等人的 MT-Bench 把 GPT-4 请上裁判席,报告了一个让所有人松了一口气的数字:GPT-4 的偏好与人类判断的一致性超过八成。这个数字一出,"人工评审"这个又贵又慢的环节几乎在一夜之间大面积失业——既然裁判八成靠谱,为什么还要雇人?AlpacaEval 更激进,干脆不问分数,让 GPT-4 在"模型回答"和"参考回答"之间二选一,直接报胜率。

随后三年,批评一直跟着它:啰嗦的回答占便宜(verbosity bias,啰嗦偏见),放前面的回答占便宜(位置偏见),裁判偏爱自己家写的答案(自我偏好)。但请注意这些批评的语气——"这只表快了几分钟"。人们默认表测的是对的,只是要修一修偏差。

Anand 的提问方式换了一个层级。他不问"表快了多少",他问"这只表的最小刻度是多少"。从偏见研究到计量检定,中间隔着的正是这一步。看清这一步,才不会在读到 0.986 时误以为自己拿到了"LLM 评审很可靠"的证书——它证明的是成对比较可靠,点式打分的病一个都没少。

📏 一厘米的尺

先讲一把尺子。

你手里有一把钢尺,最小刻度一厘米。你用它在两根头发之间比了比,郑重宣布:这根比那根长 0.1 毫米。

听到这话的人只会做两件事:笑,或者建议你配眼镜。

因为 0.1 毫米小于这把尺子的分辨率。分辨率是测量学的基本概念:一台仪器能可靠分辨的最小差异,由它的刻度决定,不由你的野心决定。你可以把读数估到半格,可以重复量一百次取平均,可以把数据做成漂亮的图——但刻度的下限横在那里,像地心引力。

现在,把"钢尺"换成"LLM 评审",把"头发"换成"大语言模型",把"0.1 毫米"换成"0.1 分"——

过去三年,AI 圈最重要的考试制度是 LLM-as-a-judge:不再用标准答案对错题,而是请一个足够强的模型(通常是 GPT-4 级别)阅读候选模型的回答,照着评分细则打分。MT-Bench 式的点式评分、AlpacaEval 式的胜率对比,一大票排行榜建立在这套机制上。打分精确到小数点后一位,排行榜精确到小数点后两位,论文精确到"我们领先 0.21 分"。

问题是:这套仪器,有刻度吗?

Anand 的论文干的就是这件事——给 LLM 评审这把尺子做一次计量检定。结论先放在这里:大多数被天天引用的分差,小于仪器自身的噪声。这不是一句修辞,是测量出来的。

🧪 误差从哪来

检定之前,得先补课。

任何一个分数,都可以拆成两半:真值 + 误差。你称体重,秤显示 70.3 公斤,但秤本身有误差,站姿有误差,连今天的早餐都还没完全消化。经典测验理论说:多称几次取平均,随机误差会互相抵消,剩下的趋近真值。

但"误差"这个词太懒了,它把一万种搞砸的方式混成一锅。Cronbach 们在 1972 年提出了概化理论(Generalizability Theory,G-theory):别把所有误差搅在一起,先把方差拆开,看清楚到底是哪一路在捣乱。

这门手艺的血统值得交代一句。再往前,Cronbach 1951 年还留下过一个更出名的遗产——Cronbach's alpha,几乎每个社科生都要背一遍的"克隆巴赫系数"。alpha 只能给一个笼统的信度数字,G-theory 是它的成人礼:不止报告一个系数,而是把误差拆成具体来源,再回答"加几道什么样的题、换几个什么样的评审,系数能到多少"。这也不是书斋里的冷门:托福这类高风险考试的等值研究,几十年来就用概化理论决定一场考试该配多少题、口语该配几个考官。Anand 干的事,是把教育测量这门百年老店的手艺原样搬进 LLM 评审的后台——刀是老刀,切的是新肉。

回到 LLM 评测。你给若干模型出题,每题由一个评审打分。一个观测到的分数,方差可以拆成几块:

  • 系统项 σ²s:模型之间真实的水平差异。这是你想测的东西。
  • 题目项 σ²i:有的题本身偏难偏易。但你比的是所有模型的平均分,题目难度对大家都一样,这项单独不伤人。
  • 评审项 σ²j:评审手松手紧。同理,对大家都松,单独也不伤人。
  • 交互项:真正致命的在这里。系统×题目 σ²si——模型甲擅长代码、模型乙擅长写作,换一道题排名就动;系统×评审 σ²sj——评审丙偏爱详细回答,模型丁恰好话多,换一个评审,丁的优势就蒸发。
打一个粗俗的比方:评酒会上,如果每瓶酒都由同一位评委喝,那这位评委今天的心情、对单宁的偏好、早上吃的蒜,会一视同仁地污染所有酒。他的"口味"不是随机噪声——它是系统性的、每只酒杯里都在的污染。你加一百瓶酒,也平均不掉他早上那口蒜味。

想消掉 σ²si,多换题目。想消掉 σ²sj,多换评审。听起来简单。但 Anand 接下来证明了一件非常不显然的事:这两条路的造价,根本不在一个量级上。

🔬 三十七万次判决

Anand 拿到了 373,019 次评审判决,把它们逐项拆解。这是本文的解剖台。

拆解结果浓缩成一个数字,叫概化系数(generalizability coefficient,记作 Eρ²)。它可以理解成"信度":如果这个系数接近 1,说明测出来的名次稳如老狗,换题换评审都不怕;如果只有 0.6,那份排行榜约等于用骰子排的。

直觉告诉我们:题目不够就加题,评审不够就加评审,两头都能把信度喂上去。教科书也确实这么写的——只要误差项各自带着分母里的 n(题目数、评审数),加大 n,误差就被除得越来越小。

但论文里的渐近式冷得像冰:

在单一评审下,无论题目加多少,概化系数渐近于 σ²s/(σ²s + σ²sj)。

看清楚这个式子。分母里只剩两项:系统方差,和系统×评审交互项。没有 n_i。题目项和系统×题目项都被题目数除掉了,除到零,消失了。唯独 σ²sj 原封不动地杵在分母里——因为题目再多,给你打分的还是同一个评审,他偏爱啰嗦的毛病会渗进每一道题、每一个分数。加题,只是让他把偏见重复得更充分而已。

Anand 说得更直白:题目会饱和,评审不会(Items saturate; judges do not)。

回到评酒会:主办方宣布"为了公平,我们加赛一百轮品酒"。没用。只要评委不换,他早上那口蒜就从第一轮陪到第一百零一轮。想稀释蒜味,唯一的路是换一批评委,每人抿一口。

这就是那道天花板:它由 σ²sj 与 σ²s 的比值决定,题目一根手指都推不动它。

论文还有一个对行业极重要的澄清:这道天花板不是 LLM 评审的锅,是"点式细则打分"这种测量形式的锅。换成人类评审,只要还是一个人拿一把 1–5 分的尺子逐项点分,天花板就在那。LLM 评审之所以中招,不是因为它不聪明,而是整个行业都在用它做一场单人单尺的测量——把二十一世纪的语言模型,塞进十九世纪的评分方式里使。

⚖️ 天花板与地板

天花板讲完了,讲地板。

地板是另一个方向的刻度:这台仪器能可靠分辨的最小分差。低于地板的差异,无论方向对错,都与噪声无法区分。对 0–5 分的量表,Anand 测出的地板在 0.41 到 1.24 分之间(按各基准的原生题量)。

现在把行业公开声称的改进中位数摆上来:0.28 分。

0.28,小于最低的那块地板 0.41。这意味着,至少一半的"我们领先 X 分"的声明,落在仪器根本看不见的区域。用开头的比方:用那把一厘米的尺,天天宣布量出了 0.1 毫米。

论文还给了一条让人头皮发麻的成本曲线:越靠近天花板,每提升一丁点信度所需要的题目数越接近发散。在点式打分框架里,天花板下方最后一段路,是用指数级增长的题目铺的——而天花板本身,题目再多也摸不到。这顺带解释了为什么从没人做过这种检定:检定成本随基准规模膨胀而失控。大家不是不想校准尺子,是校准贵到没人愿意先掏钱。

🥊 另一种问法

如果只允许 Anand 给全世界的评测团队留一句话,那一定是论文标题那句:Ask which, not how good。

别问"有多好",问"哪个更好"。

具体操作:把点式打分改成成对偏好(pairwise preference)——评审一次只看两份回答,A 和 B,选一个更好的。每个配对跑两遍,A 先 B 后一次,B 先 A 后一次。

效果堪称魔法:σ²sj 跌到 σ²s 的百分之一以下(两个数量级),单一评审的概化系数冲到 0.986,bootstrap 置信区间 [0.934, 1.000](基于 11 个系统)。天花板不再是天花板,一个评审就够用——不需要评审团,不需要多模型投票,一把尺就够。

为什么?因为"打 1 到 5 分"是个开放任务,评审得先在脑子里造一把看不见的尺,而且每一天、每一题,这把尺的刻度都在偷偷挪动;而"A 和 B 哪个好"是个封闭比较,两份回答摆在一起,优劣的证据就在眼前,刻度漂移的空间被压到极小。这是心理物理学一百年前的老结论——Thurstone 1927 年就把"比较判断"和"绝对评分"分开了:人能稳稳分辨两段音高谁高,却绝对估不准任何一个音是"几分贝";盲品两杯选其一,远比给单杯打九十分可靠。Anand 不过是把这枚古老的钉子,重新敲进 LLM 评审的门框。

顺带说一句,这个结论对 AlpacaEval 是一场迟来的平反。AlpacaEval 从第一天起就是 pairwise 加胜率,当年它挨的骂主要围着啰嗦偏见转——胜率偏爱长答案,胜利的水分大。Anand 的数据给出了更精细的判词:协议方向从头到尾是对的,成对比较确实把交互误差压掉了两个数量级;真正需要拧紧的螺丝只有一颗——呈现顺序。赢了,但赢的顺序必须是交换过的顺序。遗憾的是,业界的许多 pairwise 实践只做单一呈现顺序,等于用上了更灵敏的仪器,却忘了它新长的那种误差。

代价明码标价。请看下一节。

🎲 先出场的赢

成对比较买来的新麻烦,叫位置偏差(position bias)。

同一个系统、同一份回答,摆在前面的那一份,胜率凭空高出 8.6 个百分点。不是水平差异,纯粹是先出场。评审(无论 LLM 还是人)对第一份读到的回答有系统性偏爱——先到的当锚,后来的被挑刺。

8.6 个百分点是什么概念?Anand 从文献里捞出 53 篇发表过的胜率对比,其中位数改进约 7 个百分点——8.6 恰是它的 1.23 倍。换句话说:座位偏差,比半数论文声称的胜利还大。

这几乎是一则寓言:你发明了一台更灵敏的仪器,它立刻长出一种更隐蔽的误差。点式打分有天花板,成对比较有位置偏差。世上没有干净的测量,只有还没被检定的仪器。Anand 的对策朴素得像体育比赛:交换场地,各打半场(both presentation orders)——能抵消的是已知方向的偏差,抵消不了的是读者看到 "+8.6pp 胜率" 时心里那点微妙的痒:毕竟好消息总是先写进摘要。

💀 十七次全军覆没

现在执行死刑。

MT-Bench 是被研究得最多的基准,唯一一个"同一把尺、同一套题"重复出现得足够多、可以做严格对照的样本。Anand 从已发表文献中捞出 17 项声称在 MT-Bench 上取得改进的结果,逐一比对 MT-Bench 自己的地板。

17 项,全部低于地板。无一幸存。

再看胜率声明的集体命运:文献中 70% 的胜率声明,低于成对比较这条新仪器自己的地板。也就是说,即便学界明天集体改弦更张全换成 pairwise,七成的旧"胜利"依然小于新仪器的噪声。

读到这里,这个行业的吊诡已经摊开:我们每天讨论的、争论的、写进论文引言的、做成产品卖点的那些分差,有相当比例是仪器的呼吸,不是系统的脉搏。

那么,低于地板的"胜利"到底是怎么发出来的?论文没建档案,但机制不难拼出来,每一条都有独立的文献撑腰。其一,单次运行的运气:多数结果只跑一遍评测,而评测本身有方差,方差意味着抽签,抽签总有中签的。其二,挑报告的主动权:checkpoint 可以挑,prompt 可以挑,评测轮次也可以挑——发出来的那个数字,是凹地里最高的一株。其三,基准污染:训练语料里混进过测试集的影子,分数被悄悄抬高一段,抬高的部分恰好落在"看不见"的区间,天衣无缝。三条机制各自加噪,方向却诡异地一致。古德哈特定律在终点等着所有人:一项测量一旦成为目标,它就不再是好的测量。排行榜成了靶子之后,优化的方向就从"把回答做得更好"悄悄滑向"把分数做得更高"——而这两件事,从来不是同一件事。

📚 六百二十八篇体检报告

论文最后一块拼图,落在经验层面:这个行业的评测实践,到底有多糙?

Anand 审计了 628 篇 arXiv 相关论文。审计方法本身就带着这篇论文的签名——两个独立模型双编码(同一篇论文由两个模型各自判读一遍,交叉验证),再与盲法人工编码对照,一致性 kappa = 0.73,测量学里算"相当好的一致"。拿 LLM 编码去审计 LLM 评测,等于用刚检完的尺子量尺子厂——这主意本身就很 "Ask Which"。

结果三条,条条见血:

1. 不到四分之一的论文说明自己的评测到底跑过几次。换言之,超过四分之三的论文,读者无从知道那组分数是仪器读数,还是一次抽签。 2. 只有 46%–67% 的论文报告了任何形式的不确定性——误差棒、置信区间、方差,什么都行。剩下的三到一半,给的是一个孤零零的点估计:一厘米尺上那个煞有介事的"0.1 毫米"。 3. 把前面所有数字叠上来:即便结构性问题明天全部解决,单凭这披露水平,多数结论也无法复核、无法比较、无法被信任。

这 628 篇的问题,和 MT-Bench 那 17 项的问题,是同一种病的两个症状:整个行业习惯了在不知道自己尺子刻度的情况下写论文。

这些数字其实不该这么难看——同行的呼吁已经喊了很多年。Gorman 和 Bedrick 2019 年就盯着标准数据集划分带来的方差问题开火,要求正视随机性;心理学界搬来的预注册(pre-registration),在 NLP 里始终雷声大雨点小。测量文化不是没人倡导,是倡导了没人理——因为在披露成本付出去之前,那个"孤零零的点估计"看起来总是够用的。直到有人把 628 篇摞在一起,用同一把尺子量出缺口。坏习惯不是因为没人知道它是坏毛病,是因为没人付过账单。

🌅 无聊的发布会,前进的科学

最后,往前畅想一步——这一步也是警告。

假设整个行业的测量习惯整体提高一个档次:人人都报误差棒,人人都跑交换顺序,人人都写明运行次数。会发生什么?

排行榜上会第一次出现大量的"平手"。发布会的 PPT 会无聊很多——"+0.2" 印不出来了,因为 0.2 小于地板;审稿人会退稿,编辑部会拒收,某些"遥遥领先"要改口为"在本次测量中未能与基线拉开可分辨的差距"。这是好消息。排行榜的功能将从"制造惊喜"退回它本来的位置:不是颁奖台,是仪表盘。仪表盘不负责激动人心,它负责告诉你——你在哪儿,速度是多少,油还够不够。

科学史上每次测量精度的跃迁之前,都有一场无聊的静默。第谷·布拉赫二十年如一日的观测枯燥至极,开普勒的定律才有落脚处。测量先把幻觉清出去,真东西才有地方站。发布会冷场的那几年,恰好是地基打得最实的几年。

🚪 问谁更好

故事讲完,收个尾。

这篇论文没有提出新基准,没有刷出新 SOTA,没有训练任何模型。它做了一件更古老的事——检定。像十九世纪末的计量学家聚在地下室校准千克原器,Anand 在三十七万次判决里校准"评测"这台仪器本身。全部发现可以压成三句话:

一,单人点式打分有结构性天花板,题目救不了。这是测量形式的病,不是评审的病。 二,改问"哪个更好",一个评审就够用,0.986 的信度足以让大多数排行榜自惭形秽——但记得交换出场顺序,否则 8.6 个百分点的座位费会吃掉你的结论。 三,此刻文献里大多数被声称的改进,小于仪器自己的地板。 这不是修辞,是 MT-Bench 上 17/17 的处决记录。

明天早上,排行榜还会刷新,0.2 分的胜利还会诞生,PPT 还会印上那行加粗的数字。世界不会因为这 18 页纸停摆——科研的惯性比结论大得多。

但你现在知道了。下次再看见"领先 0.21 分",先别鼓掌,也别引用。问三个问题:几道题?几个评审?跑了几遍?

如果对面答不上来,就再温柔地补一句——

谁的尺子,几厘米的刻度?


参考文献

  • Anand, A. (2026). *Ask Which, Not How Good: Sizing Benchmarks Scored by an LLM*. arXiv:2609.28082. https://arxiv.org/abs/2609.28082
#论文 #arXiv #LLM评测 #元科学 #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens