METR 的 AI 时间地平线可能是个统计幻觉——一篇论文拆掉了最著名的 AI 进步曲线
2025 年 3 月,METR(Model Evaluation & Threat Research)发布了一张图,后来成了 AI 安全圈被引用最多的图之一。横轴是 AI 模型的发布日期,纵轴是"50% 时间地平线"——即这个模型能以 50% 的成功率自主完成的软件任务的人类平均用时。GPT-4 的地平线是 4 分钟…
目录
METR 的"AI 时间地平线"可能是个统计幻觉——一篇论文拆掉了最著名的 AI 进步曲线
一张图值多少字?
2025 年 3 月,METR(Model Evaluation & Threat Research)发布了一张图,后来成了 AI 安全圈被引用最多的图之一。横轴是 AI 模型的发布日期,纵轴是"50% 时间地平线"——即这个模型能以 50% 的成功率自主完成的软件任务的人类平均用时。GPT-4 的地平线是 4 分钟,Claude 3.7 Sonnet 是 15 分钟,Claude Mythos 是 5 小时。把这些点连起来,在 log 尺度下几乎是一条直线,对应每 7 个月翻一倍。
这张图之所以炸裂,是因为它把"AI 能力"这个模糊概念锚定到了一个人类可读的量纲上——分钟和小时。政策制定者、投资人、AI 安全研究员都松了一口气:终于有一个客观的进度指标了。AI 2027 报告拿它当核心论据,Epoch AI 把它收录进基准看板,整个行业开始围绕"时间地平线"讨论"还有几年"。
但有一件事一直被忽略:纵轴上的那个数字,不是一个物理测量值,而是一个统计估计量。它依赖一个关键假设——AI 对任务的难度,和人类完成任务的时间,在 log 尺度上是线性关系。如果这个假设不成立,整条曲线的形状就会变。
2026 年 10 月,Drew Nguyen 和 William Fithian(UC Berkeley 统计系)在 arXiv 发了一篇论文(2610.12466),用 METR 自己的公开数据重新拟合了模型。他们发现:在 2 到 30 分钟这个区间,任务难度几乎是平的。也就是说,一个人类 3 分钟能做完的任务和一个人类 30 分钟能做完的任务,对 AI 来说难度差不多。这意味着从 3 分钟跳到 30 分钟的"10 倍进步"是假的——它只是 log 线性模型对一段平台的错误外推。
核心问题:时间地平线到底在测什么?
先说清楚 METR 的方法论。他们设计了 228 个软件工程任务("实现这个函数"、"训练这个分类器"之类),每个任务都配一个自动评分函数。然后:
1. 人类侧:招募软件工程师计时完成每个任务(平均每个任务约 4 次尝试),成功用时的几何平均作为该任务的"人类时间" \(T_i\)。 2. AI 侧:让第 \(j\) 个 AI 自主尝试任务 \(i\),跑 \(n_{ij}\) 次,记录成功率 \(Y_{ijr}\)。 3. 建模:对每个 AI 拟合一条成功率曲线 \(p_j(t)\),表示在人类时间为 \(t\) 的任务上的成功率。50% 时间地平线就是 \(p_j(t) = 0.5\) 的解。
METR 原始模型假设成功率在 log 时间上是线性的:
这个形式简洁、可解释,但有一个隐藏假设:人类时间每翻一倍,AI 难度增加固定量。换句话说,从 3 分钟到 6 分钟的难度增量,等于从 30 分钟到 60 分钟的难度增量,也等于从 5 小时到 10 小时的难度增量。
Nguyen 和 Fithian 的问题很简单:这个假设对吗?
方法创新:用样条函数替换线性假设
论文的核心创新是用单调样条函数(monotone natural cubic I-spline)替换 log 线性假设。不再假设 \(p_j(t)\) 在 log 时间上是直线,而是让数据自己说话——拟合一条平滑的单调曲线 \(f(\log_2 t)\),它可以是任意形状。
他们提出了两个模型:
- Model 1:共享形状的样条。所有 AI 共用同一条难度曲线 \(f\),只是整体能力 \(\alpha_j\) 不同。这条 \(f\) 就是"人类时间到 AI 难度"的转换函数。
- Model 2:完整的项目反应理论(IRT)模型。在 Model 1 基础上,加入任务家族的随机效应(同族任务相关性)和单任务残差,用 beta-binomial 处理同一 AI-任务对多次运行之间的相关性。
Model 2 的拟合用了 EM 算法 + Gauss-Hermite 求积,因为 beta-binomial 的似然没有闭式解。这个工程量不小,但换来了一个关键能力:可以诊断时间地平线在哪个区间是可信的,在哪个区间是误导性的。
关键发现:2-30 分钟的平台
论文最重要的发现是 Model 2 拟合出的 \(f\) 函数形状:
- 2-30 分钟区间几乎平坦:这意味着这个区间内,人类时间的长短几乎不预测 AI 难度。一个人类 3 分钟能做完的任务和一个人类 30 分钟能做完的任务,对 AI 来说难度差不多。
- 其他区间接近 log 线性:在 2 分钟以下和 30 分钟以上,难度确实随 log 时间线性增长。
- 4 分钟到 15 分钟的跳跃可能很小:论文明确指出,"a time horizon jump from 4 min to 15 min may be quite small indeed"。这正是 GPT-4 到 Claude 3.7 Sonnet 的那段"进步"。
为什么会有这个平台? 论文没有给出确定答案,但可以推测:2-30 分钟的软件任务大多是一些"套路化"操作——查个 API、改个 bug、写个简单函数。对 AI 来说,这些任务的瓶颈不是"任务有多长",而是"任务描述是否清晰、评分函数是否刚性"。人类时间的长短在这个区间主要反映的是打字速度和工具熟悉度,而不是认知复杂度。超过 30 分钟的任务开始涉及多文件协调、系统设计、调试反馈循环——这些才是真正拉开 AI 难度的因素。
工程洞察:能力锚定的陷阱
论文提出了一个更深层概念:能力锚定(capability anchoring)。时间地平线只是能力锚定的一个实例——把 IRT 的无单位能力分数,通过一个外部可解释的量(人类时间)锚定到现实世界。这个范式可以推广到任何有外部标注的基准测试。
但能力锚定有一个隐藏陷阱:锚定值和真实能力之间的关系可能不是线性的,甚至不是单调的。论文给出了一个诊断清单:
1. 预测性(Predictiveness):人类时间能预测 AI 难度吗?如果能,时间地平线有意义。 2. 可比性(Comparability):同样的时间地平线倍数在不同区间意味着同样的进步吗?如果不能,跨区间比较就是误导。
METR 的时间地平线在整体上有预测性(曲线整体是上升的),但在 2-30 分钟区间局部失去预测性。这导致一个诡异的结论:从 4 分钟跳到 15 分钟的"3.75 倍进步"和从 1 小时跳到 3.75 小时的"3.75 倍进步"完全不是一回事。前者可能是统计幻觉,后者才是真实的能力跃迁。
更微妙的是,论文发现 METR 原始模型估计出的"时间地平线"实际上更接近另一个量——Rasch 能力 \(\alpha_j / \beta\)。这是一个纯粹的 IRT 能力分数,不依赖人类时间锚定。原始模型之所以"看起来对",是因为在 228 个任务的整体范围上,\(f\) 的平均形状接近线性,局部偏差被平均掉了。但这就意味着:METR 图表上的纵轴标签是错的。它标的是"人类时间",但实际测量的是"Rasch 能力"——一个没有单位的统计量,只是碰巧在整体尺度上和人类时间线性相关。
这意味着什么
这篇论文的影响有三层:
第一层:METR 的"7 个月翻倍"可能需要修正。 如果 2-30 分钟区间是平台,那么早期模型(GPT-4 到 Claude 3.5 Sonnet)的"时间地平线增长"被高估了。这些模型的能力提升是真实的,但不是"从 4 分钟到 15 分钟"这种 3.75 倍的量级。翻倍周期可能比 7 个月更长,尤其是在这个区间内。
第二层:所有"能力锚定"基准都需要诊断图。 论文提出的两张诊断图——"时间到难度转换图"和"条件成功率轨迹图"——应该成为任何锚定型基准的标配。没有这两张图,你不知道你的锚定值在哪个区间是可信的。这直接适用于 Epoch AI 的能力指数、METR 的跨域时间地平线、以及未来可能出现的任何"人类可读"的 AI 进步指标。
第三层:统计模型的形式假设会偷偷变成实质结论。 METR 不是故意骗人——他们公开了数据、公开了代码、用了标准的 IRT 方法。但"log 时间线性"这个看似无害的建模选择,制造了一条漂亮的直线和一个可量化的"翻倍周期"。当政策讨论和投资决策围绕这个"7 个月"展开时,很少有人会回头问:这个线性假设在哪个区间是错的?错的方向是什么?
这和之前"引用忠实度"的发现是同构的:LLM 引用法律条文时引用率很高但因果依赖率很低——引用是合理化外壳。METR 的时间地平线也是类似的合理化外壳——它给出了一个精确数字(4 分钟、15 分钟、5 小时),但这个数字和"AI 真实能力"的因果关系在 2-30 分钟区间是断裂的。数字看起来精确,不等于它测量了你想测量的东西。
个人思考
这篇论文让我想到一个更普遍的问题:当统计估计量变成决策依据时,它的建模假设就变成了政策风险。
METR 的图不是学术论文里的图——它是 AI 治理讨论的基础设施。AI 2027 报告拿它推演 AGI 时间表,国会听证会上有人引用它,Epoch AI 的看板实时更新它。但这个图的纵轴依赖一个从未被严格检验的 log 线性假设。Nguyen 和 Fithian 用 METR 自己的数据证明这个假设在 2-30 分钟区间是错的,而且错的不是细节——是"3.75 倍进步"这种核心结论。
这给所有做 AI 评测的人提了个醒:你的指标可能在整体趋势上是对的,但在局部区间是系统性误导的。 而恰恰是这些局部误导,会被用来论证"这个模型比那个模型强 3 倍"这种具体决策。METR 的原始模型在整体 Brier score 上可能只差几个百分点,但这几个百分点集中在 2-30 分钟区间——也就是 GPT-4 到 Claude 3.5 这段最关键的竞争区间。
更深一层:论文最后指出,如果把时间地平线扩展到更长任务(30 小时以上),没有先验理由保证 \(f\) 的新区间还是线性的。可能又会出现平台,可能出现陡坡。这意味着我们不能用现有曲线外推未来——7 个月翻倍这个数字,在下一个区间可能完全不适用。
这和"确定性陷阱"形成互补:确定性陷阱说的是"最确定的法官可能系统性地犯同一个错误",时间地平线陷阱说的是"最精确的指标可能在局部区间系统性地误导"。两者都是评测盲区——不是评测错了,是评测在你看不到的地方错了。
论文链接
- 论文原文:https://arxiv.org/abs/2610.12466
- HTML 版本:https://arxiv.org/html/2610.12466v1
- METR 原始数据和分析代码:https://github.com/METR/eval-analysis-public
- METR 时间地平线页面:https://metr.org/time-horizons
*这篇论文没有提供独立代码仓库,但所有分析基于 METR 公开数据,使用 R/Python 的 IRT 工具链可复现。论文作者 Drew Nguyen 和 William Fithian 来自 UC Berkeley 统计系。*