具身智能日报 · 2026-10-06
国庆假期第 6 天,A 股还在休市,港股今天正常交易。产经信息流继续静默,今天的增量在两条线:一是国庆文旅机器人的黄金周大考进入后半场,二是不起眼但密度很高的 arXiv 上周五批次论文(10 月 2 日提交、假期陆续上线)。本期收录 7 条。
目录
具身智能日报 · 2026-10-06(第 30 期)
国庆假期第 6 天,A 股还在休市,港股今天正常交易。产经信息流继续静默,今天的增量在两条线:一是国庆文旅机器人的黄金周大考进入后半场,二是不起眼但密度很高的 arXiv 上周五批次论文(10 月 2 日提交、假期陆续上线)。本期收录 7 条。
今日要点
- 国庆景区机器人「大考」后半场:看机器人上班,成了景区新节目
- MobiAgent:递归策略自改进进了长时程移动操作
- EyeRobot 2.0:砍掉腕部相机,让眼睛主动看
- WAM 三连发:成词之后的下一步,是无标注视频当训练燃料
- Detect and Suppress:给 VLA 装一个对抗补丁探测器,不用重训
- RATE:把「风险」编码进触觉表征
- KungfuAthleteBot:从武术视频学高动态动作
详细内容
1. 国庆文旅大考后半场:机器人上岗从猎奇变成「节目」
- 来源:中国网(9-30)、科技时报(10-02)、中国旅游报(9-29)
- 时间:9 月 29 日至 10 月 2 日陆续报道
- 摘要:多家机器人企业这个假期不约而同把产品铺进文旅场景。北京颐和园、桂林山水等地的人形机器人以咖啡师、冰激凌师、售货员、讲解员身份批量上岗;北京市属公园首批投入 72 台机器人,覆盖清洁清扫、智慧巡检、问询导览、水面救援、绿化养护、生态监测六种业务;横琴长隆此前已有 300 余台智元机器人在场。中国网的措辞值得注意:游客打卡的新节目,正在成为机器人行业的商业化大考。岗位从餐饮零售扩展到导览互动,黄金周客流是行业拿到的第一次全国性真实负载。
2. MobiAgent:递归自改进进了长时程移动操作
- 来源:arXiv 2610.03476
- 链接:https://arxiv.org/abs/2610.03476
- 时间:10 月 2 日提交
- 摘要:长时程移动操作的老问题是误差复利和移动-操作互相干扰,现成的分层 agent 又苦于子任务映射死板、不能持续学习。MobiAgent 用双循环解:内循环管部署,把高层推理和底层控制拆开,底层是可组合的原子技能,高层用视觉语言模型做滚动规划加视觉反思;外循环管改进,在部署中递归地改策略。这是自改进闭环从代码域、路由域之后,落到移动操作域的又一个样本——改进的对象仍是 harness 层的技能组合,不是模型权重。
3. EyeRobot 2.0:不用腕相机,用主动注视做精细操作
- 来源:arXiv 2610.03710
- 链接:https://arxiv.org/abs/2610.03710
- 时间:10 月 2 日提交
- 摘要:精细双臂操作通常依赖腕部相机补视角,这套工作反着来:只用一对立体相机,靠主动眼球运动解决问题。两个眼视点能旋向场景中的三维注视点,把目光锁在目标上;图像按中央凹方式处理,视觉 token 向图像中心倾斜,算力花在任务相关区域。训练分两层:先训低层注视伺服策略,再训一个根据任务进度决定「看哪」的目标选择器,都用真机数据 RL 训练。和昨天日报里的 TacVLA 是一对:一个管触觉什么时候说话,一个管眼睛什么时候看哪里。
4. WAM 三连发:世界动作模型这批出现三条
- 来源:arXiv 2610.03516(XGenAct)、2610.03391(NAVA-WAM)、2610.03607(WING)
- 时间:10 月 2 日提交
- 摘要:本号 9 月 20 日论文周特辑记录过「WAM 成词周」(当周 12 条),这次一批又是三条。更有信息量的是三条共同的方向:都在解决动作标注数据太贵的问题。XGenAct 把 RGB、动作、度量深度、法线、功能分割统一成 RGB 视频表示,一个视频扩散 transformer 一个目标函数全学;NAVA-WAM 直接从纯观测视频预训练动作策略,绕开「先训视觉再适配控制」的两段式;WING 处理第一人称视频的视角噪声和时序差异,提取交互中心的潜在引导。无标注视频正在成为动作模型的训练燃料。
5. Detect and Suppress:给 VLA 装对抗补丁探测器
- 来源:arXiv 2610.03498
- 链接:https://arxiv.org/abs/2610.03498
- 时间:10 月 2 日提交
- 摘要:对抗补丁能靠贴一张图操纵 VLA 的视觉输入,让机器人做出错误动作,但内部失效机制一直没搞清。这篇用稀疏自编码器(SAE)解剖 VLA 表征,找到了一个激活与对抗补丁强相关的特征。防御方式是推理时干预:一个线性探针检测到攻击,才抑制这个特征,不用微调模型。在 LIBERO-10 上验证,间歇攻击下条件性干预能提升成功率。可解释性工具从「理解模型」走到「防守模型」,多了一层用途。
6. RATE:相似的触觉读数,不同的风险含义
- 来源:arXiv 2610.03538
- 链接:https://arxiv.org/abs/2610.03538
- 时间:10 月 2 日提交
- 摘要:触觉表征学习最近的进展不小,但同一个触觉模式可能来自三种完全不同的情况:传感器噪声、任务本来的变化、不该发生的接触。下游策略分不清,就会对良性变化做多余纠正、对真正危险的接触反应慢。RATE 的做法是把任务条件下的交互风险直接编进触觉表征:历史条件预测提供上下文,警报监督教模型识别风险。与 TacVLA 的门控互补:那边解决「什么时候听触觉」,这边解决「听到了之后怎么判断分量」。同批还有一篇等变视觉-触觉扩散策略(2610.03333),触觉这周是热词。
7. KungfuAthleteBot:武术视频学高动态动作
- 来源:arXiv 2610.03388
- 链接:https://arxiv.org/abs/2610.03388
- 时间:10 月 2 日提交
- 摘要:视频是廉价的人类动作数据源,但直接拿来做机器人不行:重建轨迹物理不一致、没有力学信息、也不知道摔了怎么爬起来。KungfuAthleteBot 把这三条逐一处理:用国家级武术运动员视频建数据集,抛物线轨迹修正去掉腾空落地段的高度漂移和抖动;视频没有力信息就引入物理约束学习;再统一训练鲁棒恢复。从视频学极限动作,是采数光谱里「动捕生成扩增」之后的又一档:连动捕都省了。
编辑观察
文旅这条值得展开。黄金周是全国机器人第一次同场大考:负载是真的(客流高峰)、考场是真的(景区不是展厅)、观众也是真的。但「看机器人上班成景区新节目」这个措辞本身就藏着考题——节目是拿来消费的,岗位是拿来核算的,机器人现在卡在两者之间。上岗数、服务人次这些数字假期里不缺,缺的是假期收尾后的复盘账:故障率多少、每小时服务多少人、租金模式下回本周期多长。部署元年的第一次全国压力测试,真正的成绩单要等假期结束才发。明后天两个跟踪点:假期复盘数据是否披露,欢创第四交易日的量价(今天港股盘中,数据明天见)。
论文线的共同母题也值得记一笔。这批论文没有一篇在堆传感器、堆数据量,全在给现有的传感和数据装「节流阀」:眼睛主动看(EyeRobot)、触觉判风险(RATE)、视频免标注(WAM 三连发)、动作视频补物理(Kungfu)。数据和传感器的成本结构,正在从「买更多」转向「用得更省」。这和本号跟踪的接口税谱系是同一件事:信息不是越多越好,是什么时候有信息量、什么信息值得付算力。WAM 从 9 月的成词周走到今天的稳定品类,下一个观察点是它什么时候进工业界的部署清单。