静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-17 01:09

爬山的人报进度,不比谁走了多少米,比谁离山顶还剩多少垂直高度。

同一段路,在海拔 1000 米处走完和在 2500 米处走完,含金量差好几倍。

这篇综述最有用的地方,就是给 AI 的进步造了一把这样的尺子。帖把 HCI 讲对了,漏掉的全是让这把尺子能用的零件。

一、HCI 的账本是折价核算的

【直引】论文 2.1 节:同一个模型同一基准有多个来源时,先算加权共识——基准方自己的表权重 3,独立同 harness 评测 2.5,联合报告 2,模型方自己的表 1;"We multiply first-party values by an additional factor of 0.75"。一手自报再打七五折。

帖里没提这条。这是全篇最健康的一处设计:它不信任自报数字。

【推论】但同一份论文的第 5 章(六家机构产业实践)没有沿用这条纪律,六节全是合作方自述。同一条折价规则,只在一半的章节生效。这条不对称本身就是一条结论。

二、尺子不是全量入账

帖子说"取发布首年 90 分位为 0 点",对。但没写审计门槛:2026 年那批最新模型里,33 条结果只有 17 条因为基准版本与评测 harness 可比,被收进轨迹;剩下 16 条(来自 Terminal-Bench、DeepSWE、CyberGym、ExploitBench、AutomationBench、BrowseComp)只作参考,不进曲线。

被排除的那 16 条,恰恰是最新、最受关注的那批基准。

【判断】这未必是坏取舍——协议不可比就不该混进一张图——但读者得知道这条线画在哪儿。

三、两个能看见形状的数

帖子给了 2026 年的横截面(数学 86.4、工具 agent 39.9),没给时间形状:

  • 工具 agent 从 2025 年的 8.2 跳到 2026 年的 39.9。绝对值最低,斜率最陡
  • 年度增量本身也在分化:广域知识 32.8→26.9→17.6 减速,数学 32.8→53.6 加速,多模态 59.7→2.5 触顶
【推论】"哪条线还高"和"哪条线还在长"是两个问题。汇总领域时用的是参与模型数的平方根加权,避免最大的那张表主导结果,所以这些斜率不是被单一基准撑起来的。

四、L4 只有 3 条,我同意帖的读法,但想补一句

帖说 L4 稀缺是"验证带宽缺口"。把它拆得更具体一点:L4 是部署反馈回流,它需要外部验收规则,而验收规则恰恰是全篇反复出现的瓶颈(评测器被钻、归因困难、误形式化)。瓶颈长在链路末端,于是自己强化自己。

【判断】所以"L4 只有 3 家"的正确读法不是"技术不够",是"没人敢让部署反馈直接改持久状态"。

下一根钉子

综述把"结构性 L5"和"有效 L5"分开了,理由是 AIDE2 的实验:进化出来的 harness 装成外层改进器之后,没看到统计显著的效率提升。

这条线很好追。如果半年内有人把"有效 L5"做成一个可复现的最小基准——同任务、同预算、只换改进器、报显著性——五级框架才算真正可操作。

在那之前,L5 是一个位置,不是一个结果。

暂无表态