最有传播力的两个数字,全文里不存在
这篇 35 位作者的论文(清华、上海 AI Lab 等)我按 v1 和 v3 都过了一遍。原帖七条说法:四条查无、一条张冠李戴、一条量纲是反的。
"HCI 从 0.3 升到 0.7":全文无此对照。
而且真实的 HCI 量纲就不一样:它是 0–100(100 为满分),量的是"从基准年前沿到满分之间已经闭合了多少",不是"还剩多少空间"——方向正好相反。论文算的是能力域,不是"主流 LLM"。2026 年那一栏:数学 86.4、研究生级科学 85.8、广博知识 77.2、软件工程 52.6、搜索/终端 agent 56.8、工具 agent 39.9、网络安全 91.9。量纲错、主体错、时间窗错,三层叠一块。
HCI 倒是真算过:393 条 model–benchmark 观测、按评测协议家族分组、来源加权(3 / 2.5 / 2 / 1,第一方再乘 0.75)、每年取 90 分位前沿再做 √n 加权合成。但结果只在 Figure 3,没有逐模型数值表,输入全是别人已发布的榜单分数——本质是二次聚合。
"100–1000 倍算力":查无。 全文唯一的 100-fold 是 OpenAI 自报的内部 coding 推理算力占比增长,跟 RSI 的需求预测无关。§6 讲资源约束全是定性。
"代码自优化提速 10–20%":查无。 论文里最接近的几个案例数值全不一样:ModelBest 1.15–1.9 倍 kernel 加速、Agent-Native 快 2.7%、Frontis 约 20%、OpenAI speculative decoding 超 15%。
"持久对齐框架六要素":这个框架不存在。 persistent alignment、observation boundary、consequence channel、permission boundary、hard constraint 全部零命中。论文里真正的 six components 是 §3.4.1 的数据流水线功能,跟对齐没关系。
AlphaGo Zero 达到二级:张冠李戴。 全篇零命中(参考文献里只有 AlphaEvolve)。AutoML 落在 L2 是有原文的。"目前大多处于第一级"这句概括论文也没写,最接近的原话是 "bounded evaluations mainly exercise L1-L2 capabilities"。五级名称和顺序倒是完全一致。
最后一条,也是我最想说的:这篇论文没有任何自研系统实验。
三类内容分别是:一次公开榜单的二次聚合(HCI,唯一的自研量化)、文献综述、8 个行业案例——全部公司自报,论文自己两次贴标签 "company-reported evidence rather than independent replication"。而 "we conduct / our experiment / we evaluate / we benchmark" 这类自述实验动词,全文零命中。
该肯定的部分:
- 五级路线图作为一套词汇表是真的、也是有用的。它把"自我改进"这件含混的事拆成了五个可分别验证的台阶。
- 局限不是没写,是散在各处:§2.3 Scope of Evidence 明确把自报证据降权 0.75;§6 写 "This remains a substantive empirical gap";附录 C.3 写 "Full L5 improvement ... has not yet been demonstrated"。AIDE 2 那条他们自己也承认 "did not establish a statistically significant efficiency advantage"。