具身智能日报 · 2026-09-20(论文周特辑)
周日产业新闻窗口薄(过去 24 小时无硬发布),本期切换「本周回顾」视角:arXiv cs.RO 本周(9.14–9.18 公告)共 511 篇,其中标题含 VLA 的 33 篇、World Model 的 18 篇、WAM(World-Action Model)的 12 篇、harness 的 7 篇——一个新缩写…
具身智能日报 · 2026-09-20(论文周特辑)
周日产业新闻窗口薄(过去 24 小时无硬发布),本期切换「本周回顾」视角:arXiv cs.RO 本周(9.14–9.18 公告)共 511 篇,其中标题含 VLA 的 33 篇、World Model 的 18 篇、WAM(World-Action Model)的 12 篇、harness 的 7 篇——一个新缩写词在一周内完成"成词",两篇综述同周挂出。本期以论文周为主轴,产业侧收尾。
今日要点
1. WAM 成词周:World-Action Model 以 12 篇标题论文 + 一篇 16 作者长综述(CMU×上海AI Lab×MBZUAI,Eric Xing / Danfei Xu / Ivan Laptev 在列)完成命名收敛——世界模型与动作生成正式合流 2. 世界模型评估学转向:清华×陶大程团队提出 Plausible → Controllable → Actionable 三级能力阶梯,核心论点是"人拿杯子前预判的是重量不是高清视频"——评估从视觉保真度转向行为收益 3. Self-Evolving AI for Humanoids 综述:部署后自改进拿到物理体版本系统综述(五元状态组 + 四机制递进 + 世界模型验证门),RSI 叙事正式进入机器人学 4. VLA 效率学开始受控实验化:固定骨干扫动作头的 EffVLA 发现"初始化 > 架构 > 损失",π 系规模附近容量回报急剧递减 5. 产业侧接力:上海证券报 9.19 报道数据稀缺叙事——「数据下半场」从行业媒体扩散到证券媒体
详细内容
1. WAM 综述定调:世界模型与动作生成的交叉地带成域
- 来源:arXiv(2609.16074)
- 时间:9 月 13 日提交(9.14 公告),19 页,16 位作者
- 摘要:CMU、上海AI Lab、MBZUAI 等机构 16 人联合综述《World-Action Models for Robot Learning and Control: A Survey》,给出 WAM 的正式定义——把未来世界预测与可执行动作生成耦合起来的具身基础模型。综述逐一划清 WAM 与四个相邻领域的边界:传统世界模型、基于模型的强化学习、动作条件视频生成、reactive VLA 策略;再用统一分类学(表示、转移建模、动作接口、架构、训练管线、数据模态、扩展策略)组织现有方法,覆盖操作、导航、自动驾驶三大应用域。挑战清单里点名 action alignment、world-action 因子分解、空间/多视角一致性、长时程记忆、神经仿真与高效推理。本周 cs.RO 标题含 WAM/World-Action 的论文达 12 篇(Agile-WAM、MoWAM、JEPA-WAM、两篇 WholeBodyWAM、MaskHarness-WAM、TacSushi、DIDO 等),新词在产业侧"世界模型三周连发"(甲子光年 9.18 综述确认)的同一周完成学术侧成词。
2. 世界模型的三级能力阶梯:从"看起来对"到"用得上"
- 来源:arXiv(2609.16697)
- 时间:9 月 15 日提交,13 位作者
- 摘要:清华(高阳)、Dacheng Tao、Deheng Ye 等 13 人的《World Models for Embodied Intelligence: From Plausible to Controllable to Actionable》不按架构/模态/应用组织综述,而按能力强度分级:Plausible(保持任务相关的时序/几何/物理结构)→ Controllable(额外预测干预如何改变结构)→ Actionable(把预测转化为规划、动作、学习、评估、验证、恢复、数据选择的可测收益)。配套一个 3×4 矩阵(几何/物理/动作接地 × 数据/奖励/策略/模型自身的改进循环)。开篇的生理学论据值得记住:人伸手拿杯子前预判的是重量和抓握阻力,这种预判是粗糙的、几乎不产生画面,却足以塑造动作——世界模型的价值在改进行为,不在生成保真。
3. Self-Evolving AI for Humanoids:部署后自改进的物理体版综述
- 来源:arXiv(2609.13236)
- 时间:v1 于 9 月 2 日提交(30 页,本周在公告列表浮出;非本周新投,按海关纪律注明)
- 摘要:Korea University、NTU(Dusit Niyato)等 6 人的综述《Self-Evolving AI for Humanoids: Mechanisms, Safety, and Evaluation of Post-Deployment Self-Improvement》指出:现有自进化研究几乎全在 disembodied 软件智能体上,物理体改变了问题本身。框架把部署态机器人表示为五元状态组(policy、perception、memory、workflow、body),由慢外环的 evolution operator 以终身目标更新;机制按自主度递进分四级:self-learning → self-adaptation → self-optimization → self-generation。安全设计上提出 admissible evolution 约束 = 世界模型验证门 + 人类监督包络;评估上主张跟踪 evolving trajectory 而非固定 checkpoint,并明确指出当前没有为 self-evolving humanoid 设计的 benchmark。
4. LIT 打破视觉-动作捷径:分布偏移下的泛化补丁
- 来源:arXiv(2609.12641)
- 时间:9 月 11 日提交,4 位作者
- 摘要:昆士兰大学等 4 人的《Breaking the Vision-Action Shortcut》命名了一个失败模式:VLA/WAM 模型会利用训练分布内与演示动作相关的任务无关视觉线索(vision-action shortcut),分布一偏移相关性失效、泛化崩塌。解法 LIT(Latent Interface Training)两阶段:Stage 1 完全不给图像,只用语言 + 机器人状态 + 每段演示的末端 SE(3) 位姿训练动作先验——捷径源头被物理切断;Stage 2 引入一个 pose 监督的 latent interface 作为动作专家的唯一视觉通路。在四个架构(Pi0.5、MolmoAct2、FAST-WAM、ImageWAM)上 LIBERO-Plus 提升 3.87–10.70 个百分点,真机在未见相机配置/光照/干扰物下提升 13.30–16.70 个百分点。
5. PreDE:量化税可以离线预测,但 bit width 解释不了它
- 来源:arXiv(2609.19441)
- 时间:9 月 16 日提交,5 位作者,9 页
- 摘要:WAM 依赖视频生成骨干,部署压力大;训练后量化能省内存但配置空间巨大(bit width × 分组 × 量化器选择)。PreDE 用小开发集的闭环结果校准两个阈值,从离线动作偏差预测量化后的任务退化,对新配置给出 accept/reject/defer 三态决策。数字:28 个 held-out 配置发出 21 个决策(75% 覆盖率)、全部与实测标签一致;被 defer 的候选里既有可接受的也有 33 个百分点的大幅损失。核心发现是量化税配置依赖且策略特异——bit width 单独或统一偏差阈值都解释不了退化。真机(Franka Research 3,450 次试验)上 W4A4 拿到 1.37× 动作查询加速 + 峰值内存降约 44%。
6. EffVLA:VLA 动作头的受控实验学,初始化是最大的零成本杠杆
- 来源:arXiv(2609.13984)
- 时间:9 月 12 日提交,12 位作者
- 摘要:中科院自动化所、腾讯等 12 人固定骨干家族(SigLIP2 + Qwen2.5)与训练管线,扫动作头设计/规模并与实测端上延迟配对。三个发现:①动作头性能主要取决于初始化而非解码器架构、损失或推理预算——把语言骨干最后几层 Transformer 拷进动作头是唯一在所有规模上有效的轴、零延迟成本;flow matching 和更重解码器只在动作头未对齐时有益、对齐后反转。②容量只在对齐之后才有回报。③回报在今日 π 系 VLA 已用的规模附近急剧递减——继续加大买不到多少域内精度。文中"我们给出的是最好组织这批测量的解释,不是已证明的因果,并点名能裁决它的对照实验"一句,是断言强度教科书写法。
7. 产业侧:上证报接力「数据稀缺」叙事
- 来源:上海证券报(新浪财经转载,k.sina.com.cn,标题可检索「具身智能 数据稀缺性 上海证券报」)
- 时间:9 月 19 日
- 摘要:上海证券报记者报道:机器人从表演展示加快进入分拣、装配、搬运等真实作业场景,高质量数据的重要性随之凸显,多位业内人士对记者强调具身智能行业数据的稀缺性。这是「数据下半场」叙事一周内的第三个接力节点(信通院口径 → 行业媒体 → 证券媒体),官方证券媒体的入场通常意味着叙事开始向资本市场定价层渗透。
编辑观察
其一:世界模型这一周完成了两次"价值声明"。第一次是命名收敛——WAM 一周 12 篇标题论文加一篇 16 人综述,把"世界模型 + 动作生成"的交叉地带正式圈成域;这距离甲子光年确认产业侧"世界模型三周连发"不到一周,学术侧与产业侧在同一时间窗口互相确认。第二次更值得注意:两篇综述不约而同把评估从"视觉保真度"拉向"行为收益"——三级阶梯的终级 Actionable 明确写的是"转化为规划、动作、学习、评估、验证、恢复、数据选择的可测收益",开篇论据是"人预判的是杯子的重量不是高清视频"。这与本周产业侧的验证经济学全景(峰会把评测体系建设写进落地成果、以太直播把验证外包给围观群众)是同一件事的两面:生成能力过剩之后,全行业都在重新定义"什么叫好"——产业侧把验证搬进发布会和议程,学术侧把评估搬进闭环行为。可打脸预测:12 个月内具身顶会(CoRL/ICRA)出现 WAM 专题 workshop 或正式 track 关键词,且评测从 success rate 单指标转向分级能力报告。
其二:两个词汇溢出事件。本周 cs.RO 标题出现 harness 一词 7 次,其中 5 篇是强证据——Obstacle-Aware Harness(编码智能体的安全护栏)、MaskHarness-WAM、Graph-Based Harness(长时程操作评估)、Physics Harness-Guided(可形变装配)、以及 HarnessVLN 直接用了「Agent Harness」的完整 agent 工程术语。这与 OpenMAIC 当时 Harness/Skill 从工具链术语溢出到教育产品是同一现象:词汇溢出是范式扩散的先导指标,agent 工程的治理概念正在成为机器人论文的默认词汇层。另一个是 Self-Evolving AI for Humanoids 综述(v1 9.2 提交,本周浮出):五元状态组里 workflow 与 body 并列、四级机制递进、世界模型验证门 + 人类监督包络——RSI 叙事拿到了物理体版本。但有一个细节值得警惕:它的 admissible evolution 约束里的验证门是世界模型(预测准不准)而非人类验证(断言真不真),验证带宽问题被转移进模型内部而非消除;「评估跟踪 evolving trajectory 而非固定 checkpoint」倒是与三级阶梯的行为化评估同构。顺带一笔:逐际动力 FluxVLA Engine 的 arXiv 论文版(2609.17210)也于本周挂出,昨日报道的开源仓库拿到了学术侧确认。
(明日恢复常规日报节奏。本期所有论文数字均从 arXiv abs 页实抓;上证报条目为转述层,标题可检索。)