具身智能日报 · 2026-10-03

第 27 期 · 国庆假期第三天(周六)。产业信源进入静默,港股 10-01 休市、10-02 半日消化欢创暴跌。但 arXiv 不放假——美东 10-01 下午压线提交的一批 cs.RO 新论文,北京时间昨天早上 8 点随放榜公布。本期以论文为主力、产业锚点为补位。

目录
  1. 具身智能日报 · 2026-10-03
  2. 今日要点
  3. 详细内容
  4. 1. World Motion Models:把动态世界压成一组 SE(3) 轨迹
  5. 2. SkeleWAM:机器人关节+物体中心+交互点,一根骨架做世界模型
  6. 3. UniWAM:VLA 和 WAM 的互补缺陷,一个架构吃下
  7. 4. InterEvolve:不重训,测试时演化奖励程序
  8. 5. RPG(Reconstruct, Practice, Go Real):改技能库和 system prompt,不碰权重
  9. 6. HumanoidToolBench:GR00T N1.7 拿起陌生工具时发生了什么
  10. 7. 欢创科技:首日 +265.68%,次日 −47.49%
  11. 简讯
  12. 编辑观察

具身智能日报 · 2026-10-03

第 27 期 · 国庆假期第三天(周六)。产业信源进入静默,港股 10-01 休市、10-02 半日消化欢创暴跌。但 arXiv 不放假——美东 10-01 下午压线提交的一批 cs.RO 新论文,北京时间昨天早上 8 点随放榜公布。本期以论文为主力、产业锚点为补位。

今日要点

  • WAM(世界-动作模型)单日三响:SkeleWAM、UniWAM、World Motion Models 分三条表示路线同日亮相,其中 WMM 拿下 NeurIPS 2026 Spotlight
  • InterEvolve:人形机器人不重训权重,靠测试时演化奖励程序解新任务
  • RPG:具身 agent 的自主改进改的是技能库和 system prompt,不是模型权重
  • HumanoidToolBench:GR00T N1.7 在 18 项工具使用任务上暴露「选对工具」与「完成任务」之间的断层
  • 欢创科技上市次日暴跌 47.49%,物理 AI 叙事定价两日过山车

详细内容

1. World Motion Models:把动态世界压成一组 SE(3) 轨迹

  • 来源:arXiv 2610.01742(UC Berkeley,Qianqian Wang / Trevor Darrell / Angjoo Kanazawa)
  • 链接:https://arxiv.org/abs/2610.01742
  • 时间:2026-10-01 提交(北京时间 10-02 晨随 arXiv 放榜公布),NeurIPS 2026 Spotlight
  • 摘要:论文提出用稀疏 SE(3) 位姿轨迹作为 4D 世界的最小建模基元——关节体、人体、手物交互、相机运动、机器人状态与动作,全部统一到这一个共享空间。训练用 per-token 噪声级别的 flow-matching。最锋利的部分是化归声明:未来预测、动作补全、MPC、逆运动学、跨本体 retargeting、策略学习,六类任务全都是「同一个网络上打不同的 mask」。SkeleWAM 说视频表示保留与控制无关的外观信息,WMM 走得更远——干脆不再预测像素。

2. SkeleWAM:机器人关节+物体中心+交互点,一根骨架做世界模型

  • 来源:arXiv 2610.02120(Juyi Sheng / Hua Wang / Mengyuan Liu)
  • 链接:https://arxiv.org/abs/2610.02120
  • 时间:2026-10-01
  • 摘要:现有 WAM 预测视频或视觉隐空间,几何关系只能隐式保留。SkeleWAM 在线从 RGB-D 和本体感知构造稀疏 3D 骨架,作为动作生成和未来预测的统一几何状态,未来骨架预测反过来给动作学习加几何监督,不需要视觉重建。推理时从当前骨架+语言指令直接出动作,Medoid Action Consensus 做辅助修正。路线本质:把世界模型从像素撤到几何。

3. UniWAM:VLA 和 WAM 的互补缺陷,一个架构吃下

  • 来源:arXiv 2610.02054
  • 链接:https://arxiv.org/abs/2610.02054
  • 时间:2026-10-01
  • 摘要:VLA 有语义理解但缺世界动力学 grounding,WAM 有时空先验但分布漂移下不会推理。UniWAM 把物理推理器、世界生成器、动作预测器装进统一架构,用一套数据清洗管线混合人类 egocentric 数据和机器人数据。两个设计点值得记:低层动作用自然语言表示(接口层动作语义化),预训练配方把 VQA、egocentric、机器人演示各分配给合适的组件。后训练用未来视觉噪声增强,降低对精确预测未来的依赖。

4. InterEvolve:不重训,测试时演化奖励程序

  • 来源:arXiv 2610.02196(Zhuo Lin / Sirui Xu / Yu-Xiong Wang / Liang-Yan Gui 等,FB body prior 系工作)
  • 链接:https://arxiv.org/abs/2610.02196
  • 时间:2026-10-01
  • 摘要:核心假设是「宽基控制器已经握着新任务需要的大部分能力」,缺的只是一个足够表达又足够可执行的规划-控制接口。InterEvolve 用两件东西搭这个接口:一个物体感知的 forward-backward 行为基座模型,在冻结的身体先验上把新奖励编译成 loco-manipulation 行为;任务被写成带完成条件和可调常数的分阶段奖励程序。然后 LLM agent 负责在上下文里修程序结构,数值优化器调常数,每个候选在并行仿真里验证后才进入「已验证程序技能库」——进化被压在奖励程序这一层,奖励程序之外的环节全部冻结。

5. RPG(Reconstruct, Practice, Go Real):改技能库和 system prompt,不碰权重

  • 来源:arXiv 2610.02204(Yen-Jen Wang / Weirui Ye / Rocky Duan 等)
  • 链接:https://arxiv.org/abs/2610.02204
  • 时间:2026-10-01
  • 摘要:RPG 从离线数据里识别操作能力,在仿真里构造练习任务,练习时用执行反馈+特权仿真状态+数据集视频诊断失败,产出三样东西:新的可复用符号技能、精炼过的旧技能、修订过的 system prompt。所有变更先过跨任务评估,测过单条候选和合并修订才准保留。测试时多模态 LLM 拿着最终的 system prompt 和技能库上真机。整条管线没有一个环节在更新梯度——自改进的对象是执行系统的 harness 层。

6. HumanoidToolBench:GR00T N1.7 拿起陌生工具时发生了什么

  • 来源:arXiv 2610.02089(Seoul National University,snu-pi)
  • 链接:https://arxiv.org/abs/2610.02089
  • 时间:2026-10-01
  • 摘要:18 项任务、三种场景、三个执行层级、两种工具集模式,附带 3.1k 条演示数据 ToolBook(仿真+真机 Unitree G1 各一半)。七个策略在仿真里跑、三个上真机,结果是一条断层:会选工具和会完成任务之间 gap 巨大。对 GR00T N1.7 的专项探针有两个发现——没见过的工具选择准确率明显下降;收到无关指令时机器人会继续执行原任务。后者既是鲁棒性缺陷,也是指令跟随的诚实样本。

7. 欢创科技:首日 +265.68%,次日 −47.49%

  • 来源:金融界 / 观点网 / 东方财富
  • 链接:https://stock.jrj.com.cn(专题报道)
  • 时间:2026-10-02 晚间报道
  • 摘要:完整账本——发售价 58.85 港元,集资 6.82 亿,比亚迪为基石投资者,暗盘 +190.23%,9-30 首日高开 187.6 港元、收盘 215.2 港元(+265.68%),市值 207.83 亿港元,成交近 3 亿;10-02 次日收盘暴跌 47.49%,市值近乎腰斩,两日蒸发近百亿。欢创的成色是扫地机器人激光雷达模组(Camsense 视觉定位传感器),去年刚扭亏为盈。港股 10-01 国庆休市,10-02 半日消化完情绪——市场只给了「物理 AI 第一股」这顶帽子一天的可信期。

简讯

  • FlashDexRetarget(arXiv 2610.01849):RL 加速灵巧手 retargeting,左右手 actor-critic 分网+FlashSAC 离策略算法,50 条动作 benchmark,把人手演示转机器人数据的成本往下压——retargeting 有损接口的供给侧新解。
  • 3DROID(arXiv 2610.01744):带每场景可靠性测量的可渲染 3D Gaussian 数据集,标定感知管线把重建场景锚回机器人度量工作空间。
  • ChunkVLA-AM(arXiv 2610.01856):OpenVLA-OFT 部署进 FAIRINO FR3 增材制造工位,八步动作 chunk 开环执行、chunk 间闭环——VLA 进工厂的动作分块经济学实操版。

编辑观察

9 月 20 日那期日报统计过,「WAM」在一周 cs.RO 论文里出现 12 次,当时说它成了词。这周它进入下一个阶段:一个术语成词之后,内部开始分路线。10-01 单日三篇,SkeleWAM 用稀疏 3D 骨架、UniWAM 做架构统一、WMM 干脆把整个动态世界压成 SE(3) 轨迹集合。三篇的共同动作是撤退——从预测像素撤向预测几何。SkeleWAM 把话说得很直:视频表示保留着与控制无关的外观信息。这条撤退路线本号见过多次,视觉 laziness(L70-U25-G5)是任务配比的坍缩,草稿纸三解是中间状态的坍缩,WMM 是表示基元本身的坍缩。WMM 那句「六类任务全归约为同一网络的不同 mask」里藏着最激进的主张:跨本体 retargeting 也不过是其中一张 mask。

同一天另外两篇在回答另一个老问题:自改进的 R 到底发生在哪一层。InterEvolve 的答案是 reward program,RPG 的答案是符号技能库加 system prompt。两篇的共同点是一个环节都不碰梯度。InterEvolve 的「已验证程序技能库」和 RPG 的「跨任务评估先于保留」,都是把验证门修进了技能积累的循环里。这个位置本号叫过 harness 层,叫过经验载体的结构化方案形态——本周它又来了两次,而且是同一批论文里两种独立实现。InterEvolve 来自 UIUC,RPG 的作者名单里有 Weirui Ye——两条完全不相关的线收敛到同一个设计,比单篇论文的声明更值得记。

欢创的两日过山车给 9 月底连续记账的「底座层资本化」补了第三种定价姿态。本末 208 倍认购、首日 +6%,是 18C 章约束下的克制;宇树上市满月慢缴 2475 亿验证税;欢创首日 +265%、次日 −47%,是市场第一天就开收。三个样本摆在一起,首日涨幅本身成了可读的信号——它标记的是叙事与成色的差距:欢创的底座层身份是真的(比亚迪做基石、激光雷达模组确实长在机器人上),但「物理 AI 第一股」的帽子和「扫地机器人供应链」的身体,市场用一天时间完成了重新定价。国庆假期结束前,这三个样本会保持同框——这可能是假期后第一个值得跟踪的验证点:腰斩之后有没有机构接盘,比首日涨多少更有信息量。

(完)

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens