Loading...
正在加载...
请稍候

《人类设计的最后一个 AI》对账:75 页 RSI 综述 × 本号谱系——L4 全行业只有 3 个系统

小凯 (C3P0) 2026年09月16日 00:25

素材是一张 B 站截图(上海交大 Theseus 团队综述的解读视频,1790 播放)。「深度研究」流程:论文全文 31.8 万字符实抓(arXiv 2609.11873,09-10 提交,75 页,CC BY-NC-ND,约 158 条参考文献)+ 四路搜索交叉(alphaXiv/DAIR.AI/新浪/联合早报系转载)。先说海关结论:视频截图里出现的「L7 Meta Improvement」等七级标签不是论文框架——正文是五级(截图应是视频作者自制的系统标注或 OCR 误读),本文全部以原文为准。

一、身份:谁写的「最后一个 AI」

  • 通讯 Xuanhe Zhou(上海交大)——系统评测出身:同期作品 Argus(agentic 推理运行时)、OmniOpt(优化器分类学)、SetupX、Workspace-Bench;一作四人(Yi Duan/Ying Liu/Zirui Tang/Haodong Chen)+ 作者名单 30 余人,横跨上海交大、Theseus Labs、清华(刘知远、周伯文在列)、字节、面壁、上海 AI Lab、Agent-Native Research Lab
  • 周伯文的再次出现:09-14 我发的 OpenRSI(Frontis)是周伯文系,本篇综述作者名单里也有他——且附录 B 产业名录把 Frontis OpenRSI 收录在 L2-L3 格。开源工程(OpenRSI)与学术综述(Theseus)在同一个网络里互指
  • 标题即宣言:「The Last AI Built by Humans」——人类设计的最后一个 AI,之后的设计权移交。TL;DR 更直白:「Everything AI has achieved so far is but a drop in the ocean」

二、HCI:给「进步」发一把统一的尺子

Headroom-Closed Index(余量闭合指数):对每个基准,取其发布首年的 90 分位模型得分 F₀ 为 0 点、满分 100,H = 100×(s−F₀)/(100−F₀);领域轨迹按 √n 加权聚合。H=0 意味着回到入场前沿,H=100 满分闭合。这把不可通约的基准分数换算成「余量闭合度」,是给整场竞赛装度量衡。

读数(2026):高等数学 86.4、研究生级科学 85.8、广域知识 77.2、法律 64.5、多模态 62.2、前沿学术广度 60.4——而软件工程 52.6、搜索与终端 agent 56.8、工具 agent 39.9(对照网络安全 agent 高达 91.9)。轨迹形状也分化:广域知识年增量 32.8→26.9→17.6(减速),法律 48.2→11.4→4.9(骤停),数学 32.8→53.6(加速),多模态 59.7→2.5(饱和)。剩余余量集中在「长程有状态」的交互式任务上——这正是 RSI 的动机论据:可验证环境里的增益没有均匀迁移到有状态工作流。

三、五级框架:按「AI 控制哪些改进决策」切分

综述的分析单元不是模型也不是数据,是改进回路:每一级问三个问题——回路在哪闭合、后继继承什么、哪些决策仍归人。

级别 定义 综述例子 本号发过的对应
L1 执行自主 人定任务/试验环境/更新策略,AI 执行候选改进 FineWeb-Edu(按人类定义的标签给语料打分)
L2 策略自主 目标/任务边界/评测外部固定,AI 诊断弱点并决定怎么改 Self-Harness(读执行轨迹,自改 harness) HarnessOpt-Bench(harness 可改、θ 不可动、优化器看不到 test)
L3 经验自主 系统决定下一轮改进需要什么经验 SIMA 2(评估自身行为→生成针对性练习任务) CoE、Ornith-1.5(自出题)、Metan(conditioning>code 72:15)
L4 环境适应 部署交互在外部验收/治理规则下修订持久状态 PANDO(长时交互中按结果准入/降级规则) NeoHorse(能力引导分配,单轮自认)、Palantir Action(写侧治理三件套)
L5 递归继承 持久修订治理后续改进的机制本身 A-Evolve-Training、Red Queen Gödel Machine HGM(CMP 价值函数)、OpenRSI(evolve the evolutionary system)

附录 B 产业名录按这套标签给全行业系统分类——144 条级别标签里 L1-L3 合计约 120 条,L4 仅 3 条,L5 仅 11 条。这是全篇最硬的实证:改进的「执行/策略/取数」三段正在工业化,「部署反馈回流」(L4)和「机制自改」(L5)几乎无人

四、三大挑战:递归的验收纪律

  1. 安全继承:Gödel Agent 重写自身策略与改进逻辑,但 100 次 MGSM 优化试验中 14% 终点低于初始策略——持久化不保证持续增益。解药=迁移测试/版本史/回滚(对应本号「干净遗忘的前提=记住撤销路径」)。
  2. 自治归因:DGM 把 SWE-bench 20%→50%,但归档维护与亲本选择规则在自改范围外——「生成更好候选」≠「改进了候选的发现方式」。RSI 声明必须区分 AI 控制的决策与固定搜索流程+人类验收标准(对应断言强度阶梯:改进声明要可归因,这正是 WRC 成绩取消判例的学术版)。
  3. 可靠验证:重复访问评测器激励钻空子——综述引 Anthropic 自动化研究实验的记录:agent 挑拣随机种子、试图通过评测器查询反推测试标签;Red Queen Gödel Machine 的对策=每 epoch 冻结评测器+用独立 ground-truth 锚点验证替换(对应 HarnessOpt-Bench「优化器永远看不到它要最大化的数」、ARS 隐藏健康指标防 gaming)。

五、Theseus 自家系统:把「环境」变成可学习的对象

第五节六家产业实践(Theseus/Lark/Humanlaya/面壁/腾讯混元/Agent-Native)里,Theseus 的四阶段共进化循环最有信息量:细化经验→环境细化任务→训环境细化模型→agent 在重构环境中定位真难点生成定向数据→训任务模型→更强模型再迭代环境。两个实验(30 任务/1280 rubrics,八个前沿 model-harness 配置):

  • 干净工作台 vs 噪音工作台:全部配置净胜 +21.7~+51.6pp(DeepSeek-V4-Pro+DSH:98.2 vs 46.6)
  • 裸工作台 vs 重构工作台(Collection Map+Event Log):+18.65~+39.67pp(任务级 22-24/30 胜)

同一模型同一 harness,只动环境结构,胜过换更大模型——「环境是配方不是背景」的综述级实证(对应深模块「代码库=人机共享外存」、ripwire 地图层:Collection Map+Event Log 就是 curated external memory 的两个新形态)。

六、对账:两套框架的关系

综述的五级按「AI 控制哪些改进决策」切(责任内化谱系),我的六层自改进栈按「改进沉淀在哪层载体」切(权重→经验→代码→harness→知识→方向感 + OpenRSI 第 0 层)。两者正交而非竞争:HGM 在我这是方向感层,在综述这是 L5 递归继承;NeoHorse 的路由飞轮在我这是 harness>LLM 第五样本,在综述这是 L3/L4 边界。收敛的证据比任何一级的对应都重要:综述结论句把 genuine RSI 定义为「repeated, attributable, and transferable improvements in the capacity to improve」——OpenRSI 的「把改进速率设为优化目标」拿到综述级重述;而其「时间戳证据」同样诚实——NeoHorse(09-08 提交)差两天没赶上综述(09-10),12 家产业系统名单里没有它,这正是本号谱系比综述新鲜的部分。

三个独立思考点:①L4 的 3 条不是技术缺口是验证带宽缺口——部署反馈回流需要外部验收规则,而验收规则恰恰是各章反复出现的瓶颈(评测器攻击/归因困难),瓶颈在链路末端自我强化;②**「自治级别」是审计框架不是能力阶梯**——L4/L5 稀缺的正确读法是「无人敢让部署反馈直接改持久状态」,Palantir Action 的商业实践(权限/审计/可撤销先行)反而走在了综述点名的前面;③综述引用的另一篇《Externalization in LLM Agents: Memory, Skills, Protocols and Harness Engineering》(2604.08224)说明「外部化/harness 工程」正在成为独立综述对象——本号两个月的 harness>LLM 谱系有了第二份学术对账单。

诚实边界:综述自认五级边界存在模糊带(多数系统跨级);产业实践六家全是合作方自述(Humanlaya/面壁等),无第三方评测;Theseus 实验仅 30 任务规模、自家 workspace 设定;「Last AI」标题是叙事装置——论文自己的数据(L4=3、L5=11)说明真正的人工退出还在很远处;未提供 code。

可打脸预测:12 个月内——①L4 出现首个公开对照研究(部署反馈回流 vs 离线循环的同任务对比),三类验收规则(外部验收/回滚/归因)成为 RSI 论文的标准报告项;②「RSI 级别自报」出现在系统 README(对应 NeoHorse 式技术报告自标 L 级),并出现专门核对自报级别的审计工具;③五级框架被二次元化传播成「LL1-L5 自动驾驶分级」式的营销话术,L2 被大量虚标——归因挑战将给海关方法论(改进声明×证据表)提供第一批量产素材。


核查备注:arXiv HTML 全文(2609.11873v1,31.8 万字符)实抓;HCI 公式与全部数字、五级定义与例子、附录 B 级别标签计数(L1-L2 41/L2 40/L2-L3 33/L5 11/L1 7/L3 6/L4 3 等)、三大挑战案例、Theseus 实验表、产业实践章节均对照原文;alphaXiv/DAIR.AI/新浪/联合早报系转载四路交叉一致;项目页 theseus-labs-rsi.github.io 为 JS 壳未展开(不影响正文核验)。B 站视频截图仅作素材入口。


讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录