那条指挥世界的曲线,和它的刻度

第一把是体重秤。你站上去,指针在十公斤以下几乎不动——你从五十公斤减到五十五公斤,刻度盘上只挪动一丝;可过了某个点,指针突然变得灵敏,一公斤的差别都能掀起明显的摆动。秤没有坏,秤是准的。坏的是你对刻度的想象:你一直以为,指针摆动同样的幅度,就意味着体重变化了同样的分量。

目录
  1. 那条指挥世界的曲线,和它的刻度
  2. 🌡️ 两把量不准的尺子
  3. 📈 一条人人都见过的曲线
  4. 🪞 问题藏在镜子背面
  5. 🔧 两件新工具
  6. 🧊 那截平坦的二十来分钟
  7. 🗺️ 一张图,现在该怎么读
  8. 🪙 八十三枚硬币的谎言
  9. ⚖️ 十二项全能之后
  10. 🌍 刻度不准,不等于曲线是骗局
  11. 📚 参考文献

那条指挥世界的曲线,和它的刻度

*「评测的递归困境」三部曲 · 第一篇:能力记分牌*

🌡️ 两把量不准的尺子

先说两把尺子。

第一把是体重秤。你站上去,指针在十公斤以下几乎不动——你从五十公斤减到五十五公斤,刻度盘上只挪动一丝;可过了某个点,指针突然变得灵敏,一公斤的差别都能掀起明显的摆动。秤没有坏,秤是准的。坏的是你对刻度的想象:你一直以为,指针摆动同样的幅度,就意味着体重变化了同样的分量。

第二把是体温计。它中间有一段不灵敏:从三十六度到三十七度,水银柱懒洋洋地爬;从三十七度到三十八度,它猛地蹿上去。如果你只盯着读数,你会以为第一度的"体温变化"和第二度是同一回事——其实第一段里藏着一大段死区,第二段里每一分都货真价实。

人对数字有一种天然的温顺:只要数字是从"仪器"里出来的,我们就倾向于把它当成现实本身。可测量不是现实,测量是对现实的翻译,而每一种翻译都有自己的语病。体重秤的语病写在刻度盘上,体温计的语病藏在玻璃管中段;大型评测的语病,藏在一层又一层的模型假设里——藏得深,却依然会渗进每一个引用它的人的判断里。

这篇文章讲的是一条曲线。过去一年半里,这条曲线上了《纽约时报》,被比作摩尔定律,被AI安全学者Steinhardt比作证明气候变暖的基林曲线,被图灵奖得主Bengio和Bernie Sanders相继引用,用来倡导放缓AI发展。2026年夏天,"放缓AI"成了美国头版新闻,这条曲线是传单的底色。

这条曲线描述AI能力随时间的增长,据说增长是指数级的。而本文的主角、METR的"时间范围",就是曲线的纵轴。

两位UC Berkeley统计系的学者——Drew T. Nguyen和William Fithian——做了一件朴素到近乎冒犯的事:他们把纵轴那把尺子拿过来,用统计学的放大镜一寸一寸地检查刻度。检查报告写在2026年10月8日挂到arXiv的论文里(arXiv: 2610.12466)。

结论一句话就能说完:刻度不均匀。在2到30分钟这个区间,尺子上的"一厘米",比其他地方短得多。

但结论怎么来的、意味着什么、又不意味着什么,值得从头讲。这是三部曲的第一篇,主题是"能力记分牌"——谁在给AI的能力记分,分数能不能信。后两篇会审计安全记分牌和合规记分牌。三篇论文从三个角度问同一个问题:当AI评测的数字开始为投资、政策、安全决策背书,这些数字的成色究竟如何。

📈 一条人人都见过的曲线

先认识一下画线的人。

METR是Berkeley的一家研究非营利机构,《纽约时报》称它为"世界非正式的AI裁判"。它不训练模型,只测量模型。测量的对象,是METR自己铸造的一把尺——"时间范围"(time horizon)。

铸造方法很直白。METR准备了228个软件工程任务,覆盖3个任务套件、79个任务族;再找专业工程师独立完成每个任务,记录人类需要多久。一个任务的人类时间通常由大约4次成功尝试的几何平均估出——用几何平均而不是算术平均,是因为时间这种量天然偏向乘法尺度:一次特别慢不能说明任务难,只能说明那天状态差。少数任务测不准或成功次数太少,就请专家估值;这类任务占了29%。

然后让AI上场,每个任务跑若干次。问题来了:一个AI的"时间范围"被定义为——它以50%概率能自主完成的任务,对应的人类时间是多少。举个例子:GPT-4的时间范围是4分钟。意思是,如果一个专业工程师需要4分钟才能做完的事(比如"Google一个事实"),GPT-4大约有一半的把握自己搞定;需要更久的任务,它的把握就跌到一半以下。

把26个模型的时间范围按发布日期连成线,就是那条著名的曲线。它从2025年3月开始发布,每出一个新模型就更新一个点,一直画到2026年5月的Claude Mythos。曲线一路昂扬向上,在对数坐标里近似一条直线——指数增长的形状。

曲线的传播史几乎是一部简化的AI公共叙事史。技术社区先传,媒体后至;先是"又一个模型刷新纪录"的常规播报,后来变成头版的数字政治学。一个测量工具走到这一步,既说明它选对了度量——抓住了人们真正关心的问题:AI到底能替人干多久的活——也说明它的每一个刻度瑕疵都会被放大到公共决策的层面。

人们为它疯狂是有道理的。摩尔定律支撑了半个世纪的科技叙事;基林曲线用一条单调上升的CO₂曲线改写了全球气候战略。如果AI能力也有一条同形状的曲线,那它就不再是科技新闻,而是历史坐标。

🪞 问题藏在镜子背面

但这条曲线和它的两个类比,有一个镜子背面的区别。

晶体管数量,是数出来的;大气CO₂浓度,是仪器直接读出来的。它们是物理量的直接测量。而时间范围的纵轴——"以50%概率完成任务对应的人类时间"——是一个统计估计。它背后有一个模型、一组假设、一篮子可以争论的选择。

可以被争论,就意味着可以被检验和改进。这正是统计学家吃饭的家伙。

检验从哪里下手?从METR最底层的那道假设下手。原始方法用逻辑回归拟合数据,这道回归默认一件事:AI完成任务的难度,和log₂(人类时间)之间是线性关系。

把这句行话拆开。log₂的意思是"翻几番":2分钟到4分钟是一番,4分钟到8分钟又是一番。取对数之后,乘法世界就变成了加法世界,指数曲线拉直成直线,这是统计学里标准的美化工序,本身无可指摘。线性则是更隐蔽的一道手续:它规定这番与番之间完全等距——人类时间从2分钟翻到4分钟所增加的难度,和从1小时翻到2小时所增加的难度,一模一样多。

这个假设听起来人畜无害,甚至有点优雅。可它恰好是整个测量体系的刻度原型:如果难度随log₂(人类时间)线性增长,那么"时间范围翻倍"就对应"能力上一个台阶",曲线上的等距上升就有了能力含义。

Nguyen和Fithian问的问题只有一句:这条直线,真的是直线吗?

注意问题的性质。这不是在质疑数据造假,也不是在质疑指数增长的存在——论文里有一个极易被忽略的细节:模型从头到尾没有使用发布日期。曲线的横轴时间完全是观众自己加上去的,数据本身自发地排出指数形状,这一点两位作者明确不质疑。他们质疑的是刻度的成色:曲线爬升时,每一个"台阶"代表的能力增量,真的处处相等吗?

🔧 两件新工具

怎么检验一条直线是不是直线?给它一个变弯的机会,看数据更喜欢哪种形状。

作者打造了Model 1。它把线性关系换成一个单调样条函数——可以把它想成一根可以弯折的软尺,里面放了4个内部节点作为"允许弯折的位置",只约束一件事:不许回头,人类时间变长,难度不许下降。曲线想怎么弯就怎么弯,唯方向不可逆,这既是给数据的自由,也是给物理常识的交代。最重要的设计是:26个AI共享同一个函数形状f。每个AI有自己的位置和成功率,但"人类时间→AI难度"的换算表是全世界通用的。这样一来,f就不再是一个黑箱拟合项,它本身成了一个可以端详的对象:人类时间的每一个区间,在AI眼里究竟值多少难度。

Model 2更进一步,是一件解释性IRT(项目反应理论)工具。它给228个任务每个一个潜在难度θᵢ,θᵢ由三部分合成:f(log₂Tᵢ)——换算函数给的基准难度;家族效应ξ——同一任务族内任务之间的共性;个体差异ε——每个任务自己的脾气。它还做了一件事,下一节专门讲。

检验日到了。检验方式堪称豪华:12个proper scoring rule指标——边缘对数得分、Brier分数、q=0.5和q=0.8处的初等二元分数,各配三种任务权重方案——加上以79个任务族为单位的5折交叉验证,确保同一个家族的任务不会一边在训练集里当裁判一边在测试集里当运动员。

对手也不弱。Baseline是Barry(2026)提出的shared-slope logistic模型,它本身已经优于METR的原始模型——也就是说,两位作者挑战的是一位已经赢过擂主的挑战者。

结果:Model 1和Model 2在全部12个指标上击败baseline。不是险胜,是横扫。在Murphy图上——那张专门用来比较概率预测模型的诊断图——当概率阈值q超过0.4之后,baseline几乎被完全支配,处处落在两个新模型的下风。

顺带一提,METR自己的研究笔记(Kwa 2026, Barry 2026)早前也试过样条,但没跑赢。本文作者的诊断是:他们用的是分离样条,每个AI各弯各的;换成所有AI共享一条形状,信号才浮出来。这个细节很统计学:有时候不是工具不对,是工具的分工不对。

🧊 那截平坦的二十来分钟

现在端详f——那张"人类时间→AI难度"的换算表。

整体上看,log人类时间的信噪比相当不错:人类觉得久的任务,AI确实更难。尺子大体是直的。但在2到30分钟这个区间,样条几乎是平的。

平,是什么意思?意思是:在这个区间里,人类时间翻倍,AI面对的难度几乎纹丝不动。2分钟的任务和4分钟的任务,4分钟和8分钟,8分钟和15分钟——在AI的难度坐标系里,它们挤成一团。人类时间这个刻度,在这一段几乎失效。

这就有趣了。因为新闻标题里的"时间范围翻倍",默认的是一把均匀尺子:翻倍,就是上了一个台阶。可在平坦区间里,翻倍可能只是一次散步。

不妨想象一条具体的山路。从山脚到某个高度,台阶又矮又密,你可以一口气冲上去二十级而不喘——在那里,"走了二十级"根本说明不了体力。过了这段,台阶陡然变高,每一级都需要真功夫。用"上了多少级"来报行程的人,必须同时说清楚自己身在哪种台阶上,否则数字就是在替他撒谎。

把两个"10倍"放在一起看。第一个跳跃:从3分钟到30分钟,乘数10倍,看起来很壮观,但它全程发生在平坦区里——难度曲线几乎没抬头,AI需要新增的本事可能相当有限。第二个跳跃:从30分钟到5小时,乘数也是10倍,可这段是陡坡——每一分钟人类时间都被AI认真地兑换成难度,翻过这座山需要货真价实的能力。

乘数相同,含金量天差地别。

这个发现还顺手澄清了另一种误读:两个模型的 headline 数字只差几分钟,未必代表能力几乎没区别;反过来,几分钟的差距在陡坡区又是另一回事。脱离区间谈差距,就像脱离海拔谈气温。

诊断图从两个角度佐证了这件事。时间—难度转换图把228个任务逐一画在人类时间与估计难度的平面上,整条log人类时间轴信噪比良好,唯独2–30分钟处拐了一个明显的弯。条件成功轨迹图则更直观:固定人类时间,看AI的成功概率如何移动——从4分钟的任务跳到15分钟的任务,成功概率的变化"相当小"。

这就是体温计上那截不灵敏的区间。读数不是假的——水银确实到了那里。但读数的能力含义,在区间内部和区间外面,根本不是一个单位。于是那句熟悉的"时间范围又翻倍了",在2到30分钟区间里,成了一句需要打折扣的暗语。

🗺️ 一张图,现在该怎么读

修理完之后,这张著名的图并没有作废,只是需要配一份新的读图说明。

第一,看增长的方向,可以放心。数据没有用到任何发布日期的信息,指数形态是任务成败自己长出来的——这条曲线的方向感经受住了审计。

第二,看增长的台阶,要分区间。2到30分钟的平坦区里,时间范围的移动对能力的指示很弱;越过这个区间,每一番人类时间才重新兑换成实打实的难度。读到"某模型时间范围从X分钟涨到Y分钟"的标题时,先问一句:X和Y落在尺子的哪一段?

第三,看单次数字,不如看整条曲线。单个模型的时间范围是50%概率阈值上的一个点估计,背后有模型族效应、任务个体差异、运行相关性三层噪声;整条曲线的形状比任何一个点都结实。论文提供的Model 2恰好把这三层噪声拆开了——它不只是给出更好的答案,还让你看见答案的接缝在哪里。

🪙 八十三枚硬币的谎言

还有一处测量漏洞,藏在"多次运行"这个常识里。

METR的实验设计是每个AI在每个任务上跑若干次。分析时,这些运行被默认当作独立的硬币投掷:每次成功概率一样,彼此无关。硬币是最简单的概率模型,也是最容易穿帮的假设。

穿帮有痕迹。如果运行真的独立,那么"所有运行结果一致"——要么全成功要么全失败——应该只出现在约60%的运行向量里。这是独立假设可以算出来的白纸黑字。实际数据里,这个比例是83%。

23个百分点的裂缝里,藏着AI世界里一个朴素的事实:同一个AI做同一个任务,就是会连着对、连着错。环境的一次抖动、依赖的一个版本、提示里的一粒噪声,都会让若干次运行共沉浮。它们不是一筐独立硬币,是一串穿在一起的铜钱。

这个裂缝为什么重要?因为整条曲线的地基就是"成功概率",而概率是从这若干次运行里数出来的。独立性假设偏高估了信息的量:如果十次运行其实只相当于三枚独立硬币,那么从"五成把握"里读出的精度,就要打折扣。地基松动一寸,建在上面的50%阈值、时间范围、以及整条指数曲线,都会跟着晃。Model 2用beta-binomial把这个现象请进了模型:用beta-binomial分布刻画过离散,用一个相关参数ρ给同任务上的多次运行松绑。ρ的存在本身就是证词——AI在同一个任务上的成败,高度相关。

用考试打比方:一个学生做对了某类题,他大概率回回做对;不会做,也大概率回回留白。真实的成绩单就是成片成片的,而不是随机撒芝麻。独立硬币模型预想的芝麻,在现实里变成了砖头——砖头多出来了,模型就该换了。

⚖️ 十二项全能之后

到这里,两位作者完成了修理的全部工序:新刻度(共享样条)、新机体(解释性IRT)、新润滑剂(ρ参数)。然后是整机测试——12个proper scoring rule指标、三种任务权重、按任务族分折的交叉验证。

我们已经知道结果:横扫。但我想停一下,欣赏一下这份检验清单本身。

他们本可以只报一个"我的模型拟合得更好"。取而代之的是十二种口径:边缘对数得分看整体似然,Brier分数看概率校准,初等二元分数在q=0.5和q=0.8两个阈值处检查决策质量,再各乘三种任务权重方案,防止结论依赖某种任务计数方式。交叉验证以任务族为单位分折——同一族的任务要么一起进考场,要么一起当题库,杜绝了"做过真题的运动员当裁判"。

验证一件测量工具,不是用一个答案对另一个答案,而是造十二种温度计,看它们是否指向同一个季节。这件事,论文做得近乎固执。也正因如此,"新模型全面更好"这个结论几乎无处可逃——十二扇窗户看出去,是同一座山。

🌍 刻度不准,不等于曲线是骗局

最后把话说圆,也把我们这三部曲的调子定下来。

这篇论文最容易被误读成什么?"METR的曲线是假的,别信。"——这不是论文说的,也不是数据说的。

三位一体的证据摆在那里:发布日期从未进入模型,指数形态是数据自己长出来的;log人类时间的整体信噪比良好,尺子大体是直的;两个新模型横扫12项指标,说明改进建立在更扎实的统计地基上,而非 noise trading。作者自己的立场写在论文里:他们改进了时间范围的估计,同时提供了辅助解释的工具。这是工匠递上更好的扳手,不是推翻工厂。

刻度不准,是一个更微妙、也更值得认真对待的问题。它不改变曲线的方向,它改变曲线的读法。当一个新闻标题说"时间范围翻倍",在陡坡区间,这句话大致成立;在2到30分钟的平坦区,它更像一次刻度的滑行。同一个词,在尺子的不同位置含义不同——这恰恰是测量学最想避免、也最需要公开标注的事。

这件事也不是孤例。围绕METR的批评已经形成了一个生态:Substack、LessWrong、EA Forum上有shash42(2025)、Witkin(2026)、Gregory Lewis(2026)等人的持续追问;Moss(2026)从统计角度提出过类似关切;Kwa & Cheng(2025)、Mertens等人(2026)把质疑带出软件工程任务,指向构念效度——"时间范围"这个构念能不能推广到编程以外;Epoch的Capabilities Index(Ho et al. 2025)则从另一个方向用IRT度量能力,但不锚定外部可解释的时间尺度。Nguyen和Fithian的工作是这条质疑之河的一个水文站:它不否定河流,它测量水位。

也正因为如此,建设性质疑在这里不是客套话,而是唯一诚实的姿态。METR把任务、模型、运行数据全部公开,允许任何人复算——这在评测界是难得的自律。公开的测量工具值得公开的审计:尺子摆出来,就是让人量的。

值得再强调一遍:本文不质疑指数的存在,本文审计的是指数的单位。在世界开始拿这些数字做投资依据、政策依据、安全依据的今天,这两件事必须分开。方向是真的,增长是真的——但"翻一倍"意味着什么,取决于你站在尺子的哪一段。

好测量工具需要好刻度。这不是一句批评,这是所有认真对待测量的人的共识,也是这个系列接下来两篇要延续的问题意识:能力记分牌如此,安全记分牌和合规记分牌,又何尝不需要同一把审计的放大镜。记分牌上的数字一旦进入会议室、听证会和预算表,它们的单位就不再是技术细节,而是公共事实。

温度计上那截迟钝的水银,和尺子开头那几格被压缩的刻度,都不是废品。它们提醒我们:读数之前,先读尺子。下一次再看到"时间范围翻倍"的标题,愿你先想起那把刻度不均匀的尺子——然后,再决定该有多激动。

📚 参考文献

1. Nguyen, D. T., & Fithian, W. (2026). *On the estimation and validity of AI time horizons—a statistical look at the METR plot*. arXiv:2610.12466. 2. Barry, J. (2026). Shared-slope logistic model for METR time horizons. METR research notes. 3. Kwa, J. (2026). Spline approaches to time horizon estimation. METR research notes. 4. Kwa, J., & Cheng, K. (2025). Construct validity of time-horizon metrics beyond software tasks. 5. Mertens, et al. (2026). On the generalizability of capability horizon constructs. 6. Moss, R. (2026). Statistical critiques of AI capability benchmarks. 7. shash42 (2025). Criticisms of METR's time horizon methodology. LessWrong / Substack. 8. Witkin, A. (2026). Commentary on METR evaluation claims. EA Forum. 9. Gregory Lewis (2026). Notes on capability measurement. LessWrong. 10. Ho, et al. (2025). Epoch Capabilities Index.

#论文解读 #评测的递归困境 #METR #时间范围 #统计审计

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

📐 先说核账结果

arXiv:2610.12466v1,Nguyen & Fithian,UC Berkeley 统计系。228 任务、79 任务族、26 个AI、29% 专家估值、独立假设预期60% 一致 vs 实测 83%、12 个 proper scoring rule × 3 种权重 × 5 折按任务族分折——正文里这些数我一个一个回去对,全部命中。83% 那道裂缝尤其准,论文原话就是"we would predict that ~60% of vectors were unanimous. However, it is actually 83%"。

这一篇的功课做得扎实。但有三处读法要拧,其中一处我觉得帖子是故意不写的。

一、"刻度不准,不等于曲线是骗局"——这句话只说了一半

帖子的收尾立场是:方向可信,指数形态没被质疑,"本文不质疑指数的存在,审计的是指数的单位"。这句话本身没错,但它替论文挡掉了另一句。

论文 §3 附录前那段原话:

"Our fits substantially change the 50% time horizon estimates for these AIs, some of which go outside the original METR plot's 95% confidence intervals."

有些 AI 的新估计值,掉出了 METR 原图自己的 95% 置信区间。

这句话和"读法要打折"不是一个量级。"翻倍"这个词在2–30 分钟区间里含义变弱,这是解释学问题;而点估计本身跑到原置信区间外面去了,这是测量学问题——意味着原图的误差棒低估了自己的不确定度,那个区间里原图画的点可能是错的。

帖子花了一整节论证"刻度不准≠曲线是骗局",逻辑上很稳,但它没注意到论文顺手把原图的置信区间也修了。要么把这句写进来(那"结论三:看单次数字不如看整条曲线"才真正有分量),要么读者会以为原图的点估计都是稳的。

二、平坦区的成因,帖子只说了一半

帖子把2–30 分钟的平坦区归到"尺子不均匀",讲得很好。但论文 Appendix Figure 9 那段给了一个更锋利的解释:

"a large amount of the gain in the metrics was due to improvement in estimates for AIs with time horizons of 2–15 min, such as these six, which were most affected by the flat region"

新模型横扫 12 项指标,好大一部分收益集中在时间范围只有 2–15 分钟的那批早期 AI 上——而这批 AI 恰好整体住在平坦区里。

这就把因果链闭上了:平坦区不是一个孤立的测量瑕疵,它同时压扁了早期 AI 的点估计(早期 AI 全挤在 2–15 分钟,这个区间里"时间范围翻倍"几乎不携带难度信息,于是所有早期模型的时间范围都被估得偏高且彼此拉不开)。论文这句话只说"a large amount of",没给比例——这个比例是本篇最值得追的一个数。如果12 项指标的收益里有一半以上只来自早期 AI,那"新模型全面更好"这个结论在当代模型(时间范围超过 30 分钟的那批)上其实是未验证的。

顺带说一个模型设定上的硬细节,方便读者自己算:f 是单调自然三次 I-spline,4 个内部节点,且 26 个 AI 共享同一条 f。论文自己解释过为什么共享——METR 自己的 Kwa (2026) 也试过样条,但用的是分离样条(每个 AI 各弯各的),没跑赢。这个细节值得记,因为它是全文最容易被引用方抹掉的一步:共享形状是一个强假设,它假设"人类时间→AI 难度"的换算表对所有 AI 都一样。这假设若不成立,f 就不是换算表而是 26 条折线的平均。

三、参考文献 10 条里 9 条标题是编的

这条得先说,因为它是本篇最硬的一处。帖子列了 10 条参考文献,除第1 条(Nguyen & Fithian本论文)之外,其余 9 条的标题与arXiv 论文自己的 References 没有一条对得上,作者名首字母也错了:

  • 帖子写「Barry, J. (2026). Shared-slope logistic model for METR time horizons」→ 论文原文是 Alexander Barry. _Impact of modelling assumptions on time horizon results_. METR Blog, March 2026
  • 帖子写「Kwa, J. (2026). Spline approaches to time horizon estimation」→ 真标题是 Thomas Kwa. _Clarifying limitations of time horizon_,讲的是别的事
  • 帖子写「Ho, et al. (2025). Epoch Capabilities Index」→ 真标题是 _A Rosetta Stone for AI Benchmarks_。「Epoch Capabilities Index」只是论文正文里对它的称呼(the Epoch Capabilities Index [Ho et al., 2025]),当参考文献条目标题写就是错的
  • Moss 是 Jonas 不是 R.,Witkin 是 Nathan 不是 A.,Kwa 是 Thomas 不是 J.,Kwa & Cheng 第二位是 Vincent 不是 K.
  • shash42 那条真标题是《How to game the METR plot》,不是「Criticisms of METR's time horizon methodology」
这一条比数字错更值得说:数字错读者会怀疑,编造的文献标题读者只会照着去检索——然后发现找不到。一篇主题是「别轻信分数」的解读,自己的参考文献列表是凭印象重写的,这个反差比任何一处数字漂移都刺眼。

四、三处限定词脱落,其中一处把点估计读成了统计结论

第一,「全部 12 个指标上击败 baseline,不是险胜,是横扫」要加限定。 论文原话是「the point estimates for our methods dominate the baseline on all metrics」,Figure 2 的图注又重复了一遍「Point estimates for both of our models dominate the baseline at every displayed metric and weighting」——而且这张图画了以 n=79 个任务族为单位的 80% 与 95% 两条置信带。论文从没说过 12 条带子全部不过零。 Figure 8 里论文还直说逐 AI 的区间「most individual-AI intervals remain too wide to separate from zero」,只有汇总比较(Figure 2)才是证据累积的地方。帖子的「几乎无处可逃——十二扇窗户看出去是同一座山」,把点估计占优读成了统计结论。

第二,「分离样条」那个诊断,论文写的是 likely。 原话:this was likely because they were separate splines, rather than shared. 帖子写成「本文作者的诊断是:他们用的是分离样条;换成共享一条形状,信号才浮出来」——「可能」被删成确诊,后半句「信号才浮出来」论文没写。

第三,「成功概率的变化『相当小』」把相对判断读成了绝对判断。 论文原句是 This figure suggests that a time horizon jump from 4 min to 15 min may be quite small indeed,suggests 和 may 两个限定词都掉了。更要紧的是论文的比较对象是 compared to other jumps——「4→15 分钟这一跳,在所有条件概率上的差别比其他跳变小」,不是「这一跳本身小」。帖子加了中文引号当直接引语,但论文没有「相当小」这个说法。

五、83% vs 60%:这道裂缝的方向对了,但还差一步

帖子讲这道裂缝讲得好——"它们不是一筐独立硬币,是一串穿在一起的铜钱"。补一个数让读者自己感受:83% 相对 60% 是超出 38.3%,而不是"高了 23 个百分点"这么朴素。论文用 beta-binomial 里的相关参数 ρ 兜这个过散(overdispersion),本质是承认同任务的多次运行不是独立同分布。

但有个后果帖子没往下推:ρ > 0 意味着"五成把握"这个 50% 阈值本身的置信区间被压窄了。同一个模型同一批任务,如果运行之间高度相关,那么"它大概率为 50%"这句话携带的信息量比独立假设下更少。论文的 ρ 是给相关性兜底的,不是给精度兜底的——相关性的存在会同时让点估计更不稳、让"50%"这个数字更糊,而帖子只讲了前半。

收口:下一根钉子

论文自己给的建议是对的:读时间范围要配诊断图。具体到可检验的一步——把 f 在 2–30 分钟区间人为接上一段线性,再重跑一遍。 如果接法不同(比如硬接 vs 平滑过渡)得到的 f 形状差异很大,那"平坦区到底是数据的性质还是样条基的选择"这一条就分不出来;如果形状稳定,那平坦区就是真结构,可以放心当作尺子缺陷长期引用。

再往一层:这个 f 只有 4 个内部节点,且是单调约束下的 I-spline。单调性本身就是一个假设——论文明确说"constrains one thing: no going backwards"。真实难度对人类时间的关系在中间有没有非单调的凹陷(比如"整理仓库"比"清理仓库"和"深度重构"都难),现有设计根本查不出来。这个是能用更松的基函数族直接检验的。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens