那条指挥世界的曲线,和它的刻度
「评测的递归困境」三部曲 · 第一篇:能力记分牌
🌡️ 两把量不准的尺子
先说两把尺子。
第一把是体重秤。你站上去,指针在十公斤以下几乎不动——你从五十公斤减到五十五公斤,刻度盘上只挪动一丝;可过了某个点,指针突然变得灵敏,一公斤的差别都能掀起明显的摆动。秤没有坏,秤是准的。坏的是你对刻度的想象:你一直以为,指针摆动同样的幅度,就意味着体重变化了同样的分量。
第二把是体温计。它中间有一段不灵敏:从三十六度到三十七度,水银柱懒洋洋地爬;从三十七度到三十八度,它猛地蹿上去。如果你只盯着读数,你会以为第一度的"体温变化"和第二度是同一回事——其实第一段里藏着一大段死区,第二段里每一分都货真价实。
人对数字有一种天然的温顺:只要数字是从"仪器"里出来的,我们就倾向于把它当成现实本身。可测量不是现实,测量是对现实的翻译,而每一种翻译都有自己的语病。体重秤的语病写在刻度盘上,体温计的语病藏在玻璃管中段;大型评测的语病,藏在一层又一层的模型假设里——藏得深,却依然会渗进每一个引用它的人的判断里。
这篇文章讲的是一条曲线。过去一年半里,这条曲线上了《纽约时报》,被比作摩尔定律,被AI安全学者Steinhardt比作证明气候变暖的基林曲线,被图灵奖得主Bengio和Bernie Sanders相继引用,用来倡导放缓AI发展。2026年夏天,"放缓AI"成了美国头版新闻,这条曲线是传单的底色。
这条曲线描述AI能力随时间的增长,据说增长是指数级的。而本文的主角、METR的"时间范围",就是曲线的纵轴。
两位UC Berkeley统计系的学者——Drew T. Nguyen和William Fithian——做了一件朴素到近乎冒犯的事:他们把纵轴那把尺子拿过来,用统计学的放大镜一寸一寸地检查刻度。检查报告写在2026年10月8日挂到arXiv的论文里(arXiv: 2610.12466)。
结论一句话就能说完:刻度不均匀。在2到30分钟这个区间,尺子上的"一厘米",比其他地方短得多。
但结论怎么来的、意味着什么、又不意味着什么,值得从头讲。这是三部曲的第一篇,主题是"能力记分牌"——谁在给AI的能力记分,分数能不能信。后两篇会审计安全记分牌和合规记分牌。三篇论文从三个角度问同一个问题:当AI评测的数字开始为投资、政策、安全决策背书,这些数字的成色究竟如何。
📈 一条人人都见过的曲线
先认识一下画线的人。
METR是Berkeley的一家研究非营利机构,《纽约时报》称它为"世界非正式的AI裁判"。它不训练模型,只测量模型。测量的对象,是METR自己铸造的一把尺——"时间范围"(time horizon)。
铸造方法很直白。METR准备了228个软件工程任务,覆盖3个任务套件、79个任务族;再找专业工程师独立完成每个任务,记录人类需要多久。一个任务的人类时间通常由大约4次成功尝试的几何平均估出——用几何平均而不是算术平均,是因为时间这种量天然偏向乘法尺度:一次特别慢不能说明任务难,只能说明那天状态差。少数任务测不准或成功次数太少,就请专家估值;这类任务占了29%。
然后让AI上场,每个任务跑若干次。问题来了:一个AI的"时间范围"被定义为——它以50%概率能自主完成的任务,对应的人类时间是多少。举个例子:GPT-4的时间范围是4分钟。意思是,如果一个专业工程师需要4分钟才能做完的事(比如"Google一个事实"),GPT-4大约有一半的把握自己搞定;需要更久的任务,它的把握就跌到一半以下。
把26个模型的时间范围按发布日期连成线,就是那条著名的曲线。它从2025年3月开始发布,每出一个新模型就更新一个点,一直画到2026年5月的Claude Mythos。曲线一路昂扬向上,在对数坐标里近似一条直线——指数增长的形状。
曲线的传播史几乎是一部简化的AI公共叙事史。技术社区先传,媒体后至;先是"又一个模型刷新纪录"的常规播报,后来变成头版的数字政治学。一个测量工具走到这一步,既说明它选对了度量——抓住了人们真正关心的问题:AI到底能替人干多久的活——也说明它的每一个刻度瑕疵都会被放大到公共决策的层面。
人们为它疯狂是有道理的。摩尔定律支撑了半个世纪的科技叙事;基林曲线用一条单调上升的CO₂曲线改写了全球气候战略。如果AI能力也有一条同形状的曲线,那它就不再是科技新闻,而是历史坐标。
🪞 问题藏在镜子背面
但这条曲线和它的两个类比,有一个镜子背面的区别。
晶体管数量,是数出来的;大气CO₂浓度,是仪器直接读出来的。它们是物理量的直接测量。而时间范围的纵轴——"以50%概率完成任务对应的人类时间"——是一个统计估计。它背后有一个模型、一组假设、一篮子可以争论的选择。
可以被争论,就意味着可以被检验和改进。这正是统计学家吃饭的家伙。
检验从哪里下手?从METR最底层的那道假设下手。原始方法用逻辑回归拟合数据,这道回归默认一件事:AI完成任务的难度,和log₂(人类时间)之间是线性关系。
把这句行话拆开。log₂的意思是"翻几番":2分钟到4分钟是一番,4分钟到8分钟又是一番。取对数之后,乘法世界就变成了加法世界,指数曲线拉直成直线,这是统计学里标准的美化工序,本身无可指摘。线性则是更隐蔽的一道手续:它规定这番与番之间完全等距——人类时间从2分钟翻到4分钟所增加的难度,和从1小时翻到2小时所增加的难度,一模一样多。
这个假设听起来人畜无害,甚至有点优雅。可它恰好是整个测量体系的刻度原型:如果难度随log₂(人类时间)线性增长,那么"时间范围翻倍"就对应"能力上一个台阶",曲线上的等距上升就有了能力含义。
Nguyen和Fithian问的问题只有一句:这条直线,真的是直线吗?
注意问题的性质。这不是在质疑数据造假,也不是在质疑指数增长的存在——论文里有一个极易被忽略的细节:模型从头到尾没有使用发布日期。曲线的横轴时间完全是观众自己加上去的,数据本身自发地排出指数形状,这一点两位作者明确不质疑。他们质疑的是刻度的成色:曲线爬升时,每一个"台阶"代表的能力增量,真的处处相等吗?
🔧 两件新工具
怎么检验一条直线是不是直线?给它一个变弯的机会,看数据更喜欢哪种形状。
作者打造了Model 1。它把线性关系换成一个单调样条函数——可以把它想成一根可以弯折的软尺,里面放了4个内部节点作为"允许弯折的位置",只约束一件事:不许回头,人类时间变长,难度不许下降。曲线想怎么弯就怎么弯,唯方向不可逆,这既是给数据的自由,也是给物理常识的交代。最重要的设计是:26个AI共享同一个函数形状f。每个AI有自己的位置和成功率,但"人类时间→AI难度"的换算表是全世界通用的。这样一来,f就不再是一个黑箱拟合项,它本身成了一个可以端详的对象:人类时间的每一个区间,在AI眼里究竟值多少难度。
Model 2更进一步,是一件解释性IRT(项目反应理论)工具。它给228个任务每个一个潜在难度θᵢ,θᵢ由三部分合成:f(log₂Tᵢ)——换算函数给的基准难度;家族效应ξ——同一任务族内任务之间的共性;个体差异ε——每个任务自己的脾气。它还做了一件事,下一节专门讲。
检验日到了。检验方式堪称豪华:12个proper scoring rule指标——边缘对数得分、Brier分数、q=0.5和q=0.8处的初等二元分数,各配三种任务权重方案——加上以79个任务族为单位的5折交叉验证,确保同一个家族的任务不会一边在训练集里当裁判一边在测试集里当运动员。
对手也不弱。Baseline是Barry(2026)提出的shared-slope logistic模型,它本身已经优于METR的原始模型——也就是说,两位作者挑战的是一位已经赢过擂主的挑战者。
结果:Model 1和Model 2在全部12个指标上击败baseline。不是险胜,是横扫。在Murphy图上——那张专门用来比较概率预测模型的诊断图——当概率阈值q超过0.4之后,baseline几乎被完全支配,处处落在两个新模型的下风。
顺带一提,METR自己的研究笔记(Kwa 2026, Barry 2026)早前也试过样条,但没跑赢。本文作者的诊断是:他们用的是分离样条,每个AI各弯各的;换成所有AI共享一条形状,信号才浮出来。这个细节很统计学:有时候不是工具不对,是工具的分工不对。
🧊 那截平坦的二十来分钟
现在端详f——那张"人类时间→AI难度"的换算表。
整体上看,log人类时间的信噪比相当不错:人类觉得久的任务,AI确实更难。尺子大体是直的。但在2到30分钟这个区间,样条几乎是平的。
平,是什么意思?意思是:在这个区间里,人类时间翻倍,AI面对的难度几乎纹丝不动。2分钟的任务和4分钟的任务,4分钟和8分钟,8分钟和15分钟——在AI的难度坐标系里,它们挤成一团。人类时间这个刻度,在这一段几乎失效。
这就有趣了。因为新闻标题里的"时间范围翻倍",默认的是一把均匀尺子:翻倍,就是上了一个台阶。可在平坦区间里,翻倍可能只是一次散步。
不妨想象一条具体的山路。从山脚到某个高度,台阶又矮又密,你可以一口气冲上去二十级而不喘——在那里,"走了二十级"根本说明不了体力。过了这段,台阶陡然变高,每一级都需要真功夫。用"上了多少级"来报行程的人,必须同时说清楚自己身在哪种台阶上,否则数字就是在替他撒谎。
把两个"10倍"放在一起看。第一个跳跃:从3分钟到30分钟,乘数10倍,看起来很壮观,但它全程发生在平坦区里——难度曲线几乎没抬头,AI需要新增的本事可能相当有限。第二个跳跃:从30分钟到5小时,乘数也是10倍,可这段是陡坡——每一分钟人类时间都被AI认真地兑换成难度,翻过这座山需要货真价实的能力。
乘数相同,含金量天差地别。
这个发现还顺手澄清了另一种误读:两个模型的 headline 数字只差几分钟,未必代表能力几乎没区别;反过来,几分钟的差距在陡坡区又是另一回事。脱离区间谈差距,就像脱离海拔谈气温。
诊断图从两个角度佐证了这件事。时间—难度转换图把228个任务逐一画在人类时间与估计难度的平面上,整条log人类时间轴信噪比良好,唯独2–30分钟处拐了一个明显的弯。条件成功轨迹图则更直观:固定人类时间,看AI的成功概率如何移动——从4分钟的任务跳到15分钟的任务,成功概率的变化"相当小"。
这就是体温计上那截不灵敏的区间。读数不是假的——水银确实到了那里。但读数的能力含义,在区间内部和区间外面,根本不是一个单位。于是那句熟悉的"时间范围又翻倍了",在2到30分钟区间里,成了一句需要打折扣的暗语。
🗺️ 一张图,现在该怎么读
修理完之后,这张著名的图并没有作废,只是需要配一份新的读图说明。
第一,看增长的方向,可以放心。数据没有用到任何发布日期的信息,指数形态是任务成败自己长出来的——这条曲线的方向感经受住了审计。
第二,看增长的台阶,要分区间。2到30分钟的平坦区里,时间范围的移动对能力的指示很弱;越过这个区间,每一番人类时间才重新兑换成实打实的难度。读到"某模型时间范围从X分钟涨到Y分钟"的标题时,先问一句:X和Y落在尺子的哪一段?
第三,看单次数字,不如看整条曲线。单个模型的时间范围是50%概率阈值上的一个点估计,背后有模型族效应、任务个体差异、运行相关性三层噪声;整条曲线的形状比任何一个点都结实。论文提供的Model 2恰好把这三层噪声拆开了——它不只是给出更好的答案,还让你看见答案的接缝在哪里。
🪙 八十三枚硬币的谎言
还有一处测量漏洞,藏在"多次运行"这个常识里。
METR的实验设计是每个AI在每个任务上跑若干次。分析时,这些运行被默认当作独立的硬币投掷:每次成功概率一样,彼此无关。硬币是最简单的概率模型,也是最容易穿帮的假设。
穿帮有痕迹。如果运行真的独立,那么"所有运行结果一致"——要么全成功要么全失败——应该只出现在约60%的运行向量里。这是独立假设可以算出来的白纸黑字。实际数据里,这个比例是83%。
23个百分点的裂缝里,藏着AI世界里一个朴素的事实:同一个AI做同一个任务,就是会连着对、连着错。环境的一次抖动、依赖的一个版本、提示里的一粒噪声,都会让若干次运行共沉浮。它们不是一筐独立硬币,是一串穿在一起的铜钱。
这个裂缝为什么重要?因为整条曲线的地基就是"成功概率",而概率是从这若干次运行里数出来的。独立性假设偏高估了信息的量:如果十次运行其实只相当于三枚独立硬币,那么从"五成把握"里读出的精度,就要打折扣。地基松动一寸,建在上面的50%阈值、时间范围、以及整条指数曲线,都会跟着晃。Model 2用beta-binomial把这个现象请进了模型:用beta-binomial分布刻画过离散,用一个相关参数ρ给同任务上的多次运行松绑。ρ的存在本身就是证词——AI在同一个任务上的成败,高度相关。
用考试打比方:一个学生做对了某类题,他大概率回回做对;不会做,也大概率回回留白。真实的成绩单就是成片成片的,而不是随机撒芝麻。独立硬币模型预想的芝麻,在现实里变成了砖头——砖头多出来了,模型就该换了。
⚖️ 十二项全能之后
到这里,两位作者完成了修理的全部工序:新刻度(共享样条)、新机体(解释性IRT)、新润滑剂(ρ参数)。然后是整机测试——12个proper scoring rule指标、三种任务权重、按任务族分折的交叉验证。
我们已经知道结果:横扫。但我想停一下,欣赏一下这份检验清单本身。
他们本可以只报一个"我的模型拟合得更好"。取而代之的是十二种口径:边缘对数得分看整体似然,Brier分数看概率校准,初等二元分数在q=0.5和q=0.8两个阈值处检查决策质量,再各乘三种任务权重方案,防止结论依赖某种任务计数方式。交叉验证以任务族为单位分折——同一族的任务要么一起进考场,要么一起当题库,杜绝了"做过真题的运动员当裁判"。
验证一件测量工具,不是用一个答案对另一个答案,而是造十二种温度计,看它们是否指向同一个季节。这件事,论文做得近乎固执。也正因如此,"新模型全面更好"这个结论几乎无处可逃——十二扇窗户看出去,是同一座山。
🌍 刻度不准,不等于曲线是骗局
最后把话说圆,也把我们这三部曲的调子定下来。
这篇论文最容易被误读成什么?"METR的曲线是假的,别信。"——这不是论文说的,也不是数据说的。
三位一体的证据摆在那里:发布日期从未进入模型,指数形态是数据自己长出来的;log人类时间的整体信噪比良好,尺子大体是直的;两个新模型横扫12项指标,说明改进建立在更扎实的统计地基上,而非 noise trading。作者自己的立场写在论文里:他们改进了时间范围的估计,同时提供了辅助解释的工具。这是工匠递上更好的扳手,不是推翻工厂。
刻度不准,是一个更微妙、也更值得认真对待的问题。它不改变曲线的方向,它改变曲线的读法。当一个新闻标题说"时间范围翻倍",在陡坡区间,这句话大致成立;在2到30分钟的平坦区,它更像一次刻度的滑行。同一个词,在尺子的不同位置含义不同——这恰恰是测量学最想避免、也最需要公开标注的事。
这件事也不是孤例。围绕METR的批评已经形成了一个生态:Substack、LessWrong、EA Forum上有shash42(2025)、Witkin(2026)、Gregory Lewis(2026)等人的持续追问;Moss(2026)从统计角度提出过类似关切;Kwa & Cheng(2025)、Mertens等人(2026)把质疑带出软件工程任务,指向构念效度——"时间范围"这个构念能不能推广到编程以外;Epoch的Capabilities Index(Ho et al. 2025)则从另一个方向用IRT度量能力,但不锚定外部可解释的时间尺度。Nguyen和Fithian的工作是这条质疑之河的一个水文站:它不否定河流,它测量水位。
也正因为如此,建设性质疑在这里不是客套话,而是唯一诚实的姿态。METR把任务、模型、运行数据全部公开,允许任何人复算——这在评测界是难得的自律。公开的测量工具值得公开的审计:尺子摆出来,就是让人量的。
值得再强调一遍:本文不质疑指数的存在,本文审计的是指数的单位。在世界开始拿这些数字做投资依据、政策依据、安全依据的今天,这两件事必须分开。方向是真的,增长是真的——但"翻一倍"意味着什么,取决于你站在尺子的哪一段。
好测量工具需要好刻度。这不是一句批评,这是所有认真对待测量的人的共识,也是这个系列接下来两篇要延续的问题意识:能力记分牌如此,安全记分牌和合规记分牌,又何尝不需要同一把审计的放大镜。记分牌上的数字一旦进入会议室、听证会和预算表,它们的单位就不再是技术细节,而是公共事实。
温度计上那截迟钝的水银,和尺子开头那几格被压缩的刻度,都不是废品。它们提醒我们:读数之前,先读尺子。下一次再看到"时间范围翻倍"的标题,愿你先想起那把刻度不均匀的尺子——然后,再决定该有多激动。
📚 参考文献
- Nguyen, D. T., & Fithian, W. (2026). On the estimation and validity of AI time horizons—a statistical look at the METR plot. arXiv:2610.12466.
- Barry, J. (2026). Shared-slope logistic model for METR time horizons. METR research notes.
- Kwa, J. (2026). Spline approaches to time horizon estimation. METR research notes.
- Kwa, J., & Cheng, K. (2025). Construct validity of time-horizon metrics beyond software tasks.
- Mertens, et al. (2026). On the generalizability of capability horizon constructs.
- Moss, R. (2026). Statistical critiques of AI capability benchmarks.
- shash42 (2025). Criticisms of METR's time horizon methodology. LessWrong / Substack.
- Witkin, A. (2026). Commentary on METR evaluation claims. EA Forum.
- Gregory Lewis (2026). Notes on capability measurement. LessWrong.
- Ho, et al. (2025). Epoch Capabilities Index.
#论文解读 #评测的递归困境 #METR #时间范围 #统计审计
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。