读 Grouping the Stochastic Machine 这篇,补几条洞:
1.「精度」不是测量发明的,是射击界早已有的概念。
Andrikopoulos 把它嫁到 LLM 上是对的,但漏了心理学里另一半——direction 也该拆:tight-on-target(精准,bias 小且 variance 小)、tight-off-target(一致错,bias 大且 variance 小)、scattered-around-target(泛化、不精准,bias 小但 variance 大)、scattered-everywhere(糟糕)。论文只说了后三种("consistent failures""scattered failures""shot goes wide"三种画像),把"tight on target"那一种埋进了图里。读者实际工作里,多数是 tight-off-target——加一条规则就 OK,论文里叫 "0/5 → 5/5" 就是这种情况,听起来是宣传,其实是 "sight adjustment"。
2."无循环的测量"才是杀手锏。
原帖其实没强调这一点——这个方法的关键不是数学新,而是「不要再用 model-in-the-loop 当 judge」。大多数 SWE-Bench / MMLU 类测评的后处理环节都让另一个 LLM 当裁判,裁判本身有系统性偏好。直接拿 deterministic scoring + 多次重复 + per-task 一致性,把"AI 评 AI"的循环解开。这条方法论升级与 Salesforce fragility paper 那篇(arXiv:2608.18066)的「多次跑 + 跨任务集验证」同源,但是它的工程化版本。
3."0/5 → 5/5"这件事原帖写得很巧。
意思是有一条规则,写完一组任务从全失败 100% 通过——但这条规则的来源是「真实工作」,作者自承「从规则本身编写出来的任务组一文不值」。这是对「Goodhart's Law in LLM evaluation」的最早公开承认:评估如果让自己规则驱动,就只测准了规则,测不准现实。这条警告值得嵌入所有 LLM 评测系统设计。
4."frontier models have already embodied explicit good practice"——这一句被作者自己埋在限制里,但它是这篇论文最大的暗神谕。
前沿模型在标准工程任务上的 "best output" 都已经对齐到"常识",差距几乎压在 variance 上。换句话说,市场上要把 frontier model 和开源模型区分开来,光报 MMLU 不够了——必须报多次重复下的成功率和可控方差。这一点改变 2026-08 之后的模型采购话术。
下一根最该盯的钉子:Andrikopoulos + Paper 2 "Tuning the Stochastic Machine" 那篇系统工程师 30 年视角的姊妹篇(两篇同期提交,2608.19140 + 2608.19125),本质是在给新一代 LLM ops 学铺垫。「操作纪律」这条路能不能在 SIGCOMM/HOTOS 上接过一棒,决定了这个评测新轴能不能从论文走进 GCP/Slack/Notion 的产品默认配置里。
#LLM评测 #精度 #操作 #Andrikopoulos #Goodhart