[论文] Grouping the Stochastic Machine: Precision, Not Capability, as the Fro...

研究领域: ML 作者: George Andrikopoulos 发布时间: 2026-08-19 arXiv: 2608.19140

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: ML 作者: George Andrikopoulos 发布时间: 2026-08-19 arXiv: 2608.19140

中文摘要

前沿语言模型在能力上进行比较、营销和基准测试——它们的最佳或平均输出能实现什么。我认为这测量了错误的维度。模型已经饱和了准确性:它们的平均输出落在目标上。现在在实践中区分一个系统与另一个系统的是精度:在重复、相同的请求中,它们的输出围绕该目标的集中程度。借用射手的区分,能力是平均射击落在哪里;可靠性是组的大小。我提出三个主张。首先,精度而非能力是系统之间的前沿区分因素,基准测试文化系统性地未能测量它,报告中心趋势而非离散程度。其次,精度可以通过在固定温度下多次运行固定套件的确定性评分任务并计算每任务结果的一致性来廉价且无循环地测量——无需模型在环评分器。第三,测量不仅仅是描述性的,而且是决策指导性的:它区分一致的失败(偏离中心的紧组,可通过操作纪律纠正——瞄准调整)和分散的失败(宽组,只能通过更改模型或其采样来纠正——步枪问题)。我定义了一个分组指标,指定了一个工具,并展示跟踪人-AI对随时间的分组如何产生论文1的实地研究所需的复合信号。第一次真实运行,自那以后被复制,说明了该方法及其最重要的限制:一个测量的差距被单一规则完全关闭(0/5 -> 5/5),而从规则本身编写的一套任务没有发现价值,因为前沿模型已经体现了明确的良好实践——确立了学科的价值通过在真实工作上的测量来发现,而不是从其自己的规则书中构建。

原文摘要

Frontier language models are compared, marketed, and benchmarked on capability -- what their best or average output can achieve. I argue this measures the wrong axis. The models have saturated accuracy: their mean output lands on the target. What now separates one system from another in practice is precision: how tightly concentrated their outputs are around that target across repeated, identical requests. Borrowing the marksman's distinction, capability is where the average shot lands; reliability is the size of the group. I make three claims. First, precision, not capability, is the frontier differentiator between systems, and benchmark culture systematically fails to measure it, reporting central tendency rather than spread. Second, precision is measurable, cheaply and without circulari...


*自动采集于 2026-08-21*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

读 Grouping the Stochastic Machine 这篇,补几条洞:

1.「精度」不是测量发明的,是射击界早已有的概念。

Andrikopoulos 把它嫁到 LLM 上是对的,但漏了心理学里另一半——direction 也该拆:tight-on-target(精准,bias 小且 variance 小)、tight-off-target(一致错,bias 大且 variance 小)、scattered-around-target(泛化、不精准,bias 小但 variance 大)、scattered-everywhere(糟糕)。论文只说了后三种("consistent failures""scattered failures""shot goes wide"三种画像),把"tight on target"那一种埋进了图里。读者实际工作里,多数是 tight-off-target——加一条规则就 OK,论文里叫 "0/5 → 5/5" 就是这种情况,听起来是宣传,其实是 "sight adjustment"。

2."无循环的测量"才是杀手锏。

原帖其实没强调这一点——这个方法的关键不是数学新,而是「不要再用 model-in-the-loop 当 judge」。大多数 SWE-Bench / MMLU 类测评的后处理环节都让另一个 LLM 当裁判,裁判本身有系统性偏好。直接拿 deterministic scoring + 多次重复 + per-task 一致性,把"AI 评 AI"的循环解开。这条方法论升级与 Salesforce fragility paper 那篇(arXiv:2608.18066)的「多次跑 + 跨任务集验证」同源,但是它的工程化版本。

3."0/5 → 5/5"这件事原帖写得很巧。

意思是有一条规则,写完一组任务从全失败 100% 通过——但这条规则的来源是「真实工作」,作者自承「从规则本身编写出来的任务组一文不值」。这是对「Goodhart's Law in LLM evaluation」的最早公开承认:评估如果让自己规则驱动,就只测准了规则,测不准现实。这条警告值得嵌入所有 LLM 评测系统设计。

4."frontier models have already embodied explicit good practice"——这一句被作者自己埋在限制里,但它是这篇论文最大的暗神谕。

前沿模型在标准工程任务上的 "best output" 都已经对齐到"常识",差距几乎压在 variance 上。换句话说,市场上要把 frontier model 和开源模型区分开来,光报 MMLU 不够了——必须报多次重复下的成功率和可控方差。这一点改变 2026-08 之后的模型采购话术。

下一根最该盯的钉子:Andrikopoulos + Paper 2 "Tuning the Stochastic Machine" 那篇系统工程师 30 年视角的姊妹篇(两篇同期提交,2608.19140 + 2608.19125),本质是在给新一代 LLM ops 学铺垫。「操作纪律」这条路能不能在 SIGCOMM/HOTOS 上接过一棒,决定了这个评测新轴能不能从论文走进 GCP/Slack/Notion 的产品默认配置里。

#LLM评测 #精度 #操作 #Andrikopoulos #Goodhart

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens