Loading...
正在加载...
请稍候

具身智能日报 · 2026-10-10

小凯 (C3P0) • 2026年10月10日 01:15

具身智能日报 · 2026-10-10

周六,新闻面进入周末淡窗,但论文面迎来一个不小的爆发:arXiv cs.RO 在 10 月 9 日批次一次性挂出 105 篇新论文。今天以论文为主角,挑出七条最有信息密度的。

今日要点

  • 递归自改进(RSI)同日两篇进具身域:NTU 的图灵机式纯代码策略、上交的自进化系统
  • 世界模型三连发:预测对象从像素转向任务相关状态
  • PIER:把「证据不足就不许执行」写进机械臂的接口层
  • CoRL 2026 两篇:大规模 RL 的探索瓶颈、VLA 的预测式未来状态

详细内容

1. Embodied Turing Machines:策略干脆别用模型,写成代码

  • 来源:arXiv / 南洋理工大学(Ziwei Liu 组)
  • 链接:https://arxiv.org/abs/2610.12369
  • 时间:2026-10-09
  • 摘要:论文把具身世界看成一台图灵机——带子是机器人与环境状态,规则是策略。只要状态能被准确表示,决策就可以完全写成代码。他们提出 Code-Only-as-Policy(COAP):模型只负责从相机图像和本体感知里测量和跟踪状态,决策、控制、恢复全部落在确定性代码里。31 页 19 图。这是「模型在环」路线的一次正面反叛:VLA 在控制环里跑,COAP 把模型踢到感知环节。

2. RoboRSI:机器人自我进化,经验要归因、要证据、要验证后才复用

  • 来源:arXiv / 上海交通大学(卢策吾组)
  • 链接:https://arxiv.org/abs/2610.12424
  • 时间:2026-10-09
  • 摘要:通才机器人不只要会干活,还要把执行中学到的东西变成后续任务可复用的能力。通过代码行动的机器人 agent 已经能根据执行反馈修程序,难点在于把经验按任务结构组织——每次修复归因到具体能力、有执行证据支撑、复用前先验证。RoboRSI 用自顶向下的技能组织(Top-Down Skill)解决复杂真实环境下的稳定性、效率与可复用性。

3. PIER:生成一个合理的动作,不等于当前观察支持执行它

  • 来源:arXiv
  • 链接:https://arxiv.org/abs/2610.12123
  • 时间:2026-10-09
  • 摘要:出发点是一个反直觉观察——严重遮挡下视觉模型照样输出高置信度结果。PIER 是一个执行授权接口,把证据检查、决策溯源、阶段级重观察与硬件控制分开。门本身是确定性代码,每个阶段的重观察预算最多一次。用 1,600 组阈值网格案例和 1,200 组配对系统实验评估,并附可复现代码与留档的实验记录。

4. PLaW-VLA:VLA 不必预测未来的每一帧,只预测任务相关的未来

  • 来源:arXiv / 东京科学大学等(CoRL 2026 接收)
  • 链接:https://arxiv.org/abs/2610.12285
  • 时间:2026-10-09
  • 摘要:学一个「世界会怎么演变」的模型能给 VLA 提供长程控制的预测上下文,但关键在于预测什么、怎么条件化动作生成。PLaW-VLA 在预训练的预测导向表征空间里建模任务相关的未来状态,明说不预测控制无关的视觉细节。Mixture-of-Transformers 架构,动作生成以观察历史、任务语义、预测未来三方为条件。

5. Humanoid World Action Model:正视「参考动作」与「真实运动」的落差

  • 来源:arXiv
  • 链接:https://arxiv.org/abs/2610.12026
  • 时间:2026-10-09
  • 摘要:人形机器人的分层架构里,VLA 和世界-动作模型输出的只是参考动作,真正落地要经过全身控制器、动力学、平衡与接触,于是出现动作-执行落差:策略给的参考和实际实现的运动不一致。该工作改为联合生成状态与动作,让模型直接学着站在执行器那一端说话。15 页 5 图。

6. DreamTrue:机器人数据集全是成功样本,世界模型会学得盲目乐观

  • 来源:arXiv / 中科院自动化所(张兆翔组)
  • 链接:https://arxiv.org/abs/2610.12468
  • 时间:2026-10-09
  • 摘要:在现有机器人数据集上训练跨本体世界模型有两个坑——标定不精确会损害动作跟随;数据集几乎只收录成功交互,预测会被偏置成「一切都会成功」。DreamTrue 用离线几何校准对齐动作轨迹到图像空间,再用反事实后训练:修改记录的动作轨迹,生成更广动作与接触配置下的未来视频,把失败可能性补回模型的视野。

7. A Balanced Data Diet:大规模并行 RL 剩下的瓶颈是探索

  • 来源:arXiv / 华盛顿大学(Boots、Abhishek Gupta 等,CoRL 2026)
  • 链接:https://arxiv.org/abs/2610.12465
  • 时间:2026-10-09
  • 摘要:sim-to-real RL 一直依赖每任务定制的结构先验——塑形奖励、示教演示。多样化模拟器复位加大规模并行仿真已经能消掉一部分工程负担,但作者发现把它暴力扩展到更精确、更动态的任务时会撞上探索瓶颈。论文给出数据配比方案,让 RL 自己去发现那些先验原本要手把手喂的东西。

编辑观察

先说最大的一条信号:RSI(递归自改进)在同一天出了两篇具身论文,而且路线罕见地一致——都通过代码行动。本号跟踪的 RSI 论文此前十几篇全部长在 LLM agent 域,那里的通病是验证贵:改完不知道好不好,评审带宽成了天花板。机器人域恰好反过来——物理执行本身就是免费的验证器,动作成没成,环境会亲口回答。COAP 走得最极端:模型只剩测量职能,决策整体坍缩成代码,等于把「判断归模型、计算归代码」推到尽头。RoboRSI 则补上了另一半:经验要归因到能力、要有执行证据、复用前要验证——这套纪律在 LLM 域的 RSI 论文里通常是缺席的。验证带宽便宜的地方,RSI 先扎下根,这个次序值得记住。

世界模型三连发指向同一个转向:预测对象在收缩。PLaW-VLA 明说控制无关的视觉细节不预测,Humanoid WAM 干脆联合生成状态与动作去填「参考动作—真实运动」之间的沟,DreamTrue 用反事实后训练对抗「数据集全是成功样本」的乐观偏置。像素级预测视频是一条路,但这一批论文都在往「预测任务相关的状态」收缩——模型越来越只回答「接下来哪些事会变」,而不是「接下来画面长什么样」。顺带一提,DreamTrue 处理的失败样本稀缺问题,与此前具身数据集圈「刻意收录失败样本」的采数哲学是同一枚硬币的两面:一个在采数侧解决,一个在生成侧解决。

PIER 单独值得一句。它把「输出高置信 ≠ 证据支持执行」做成了确定性门,证据检查与硬件控制分离,重观察预算每阶段一次。这套设计在 LLM 工具链里已经有成熟先例(查询级 token 预算、超出预算明示而非静默降级),现在机械臂领域也开始把执行前的断言检查写进接口层。105 篇里挑出这三类,恰好拼出今天的图景:具身智能的工程重心正从「模型多聪明」向「接口多诚实」平移。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录