具身智能日报 · 2026-10-08
(第 32 期:假期账单到账,judge 开始与策略共演化)
今日要点
- 黄金周机器人商业大考收官:烧卖购上海门店整体交易额较平日接近翻倍,宝山滨江店周环比 25 倍以上,单店平均人力 0.2–0.3 人
- VeriFine:自改进不断暴露新失败模式,固定 judge 会过时——评估器必须与策略、课程共同演化
- DepthWorld:视频世界模型帧帧看着对,拼不成一致的 3D 世界
- RIWANav:冻结的世界模型会随策略演化失配,世界模型自己也要进自改进循环
- PhoneBot:UCLA Dennis Hong 系开源平台,直接拿智能手机当人形机器人的传感计算单元
详细内容
1. 黄金周机器人商业大考,账单来了
- 来源:新民晚报 / 上观新闻(腾讯新闻镜像)
- 链接:https://news.qq.com/rain/a/20261005A055QP00
- 时间:2026-10-05 14:20
- 摘要:商汤科技旗下商汤善惠的具身智能便利店「烧卖购」,国庆期间上海门店整体交易额较平日接近翻倍;增幅最大的宝山滨江店周环比增至 25 倍以上。机器人「小麦」高峰时段最快 15 秒完成一单,闲时自己整理货架、盘点库存。几个结构性数字值得记下:单店平均人力约 0.2–0.3 人(一人可支持 3–5 家门店)、上海优质点位投资回收期约半年到一年、已落地 20 余家门店、节前刚发布零售物理操作系统 SenseMart OS 并启动「千城万店计划」。报道同时点出短板:维修体系是横在几十家到几千家之间的一道坎——故障率没有数字,只有这句定性自认。
- 海关备注:25 倍是宝山滨江单店的周环比口径(对比平日低基数),「接近翻倍」是全店整体口径,两个数字归属不同分母,并列阅读时先分清谁是谁。
2. 全国多点开花:成都近 10 场、广东 60 台、长隆 300+ 台
- 来源:川观新闻 / 封面新闻 / 同花顺 / 中国日报
- 链接:https://cbgc.scol.com.cn 、http://field.10jqka.com.cn 、https://cn.chinadaily.com.cn
- 时间:2026-10-02 至 10-07
- 摘要:成都市经信局统筹「智创国庆」系列活动,本地具身企业近 10 场落地东郊记忆、春熙路等地,机器人进服装店、蛋挞店营业;广东「机器人国庆奇妙夜」全国联动 IP 主展演落户广东科学中心,现场集结 60 台机器人(9-30 至 10-07);珠海横琴长隆飞船乐园假期投用超 300 台机器人,覆盖导览、零售、酒店服务。21 世纪经济报道节前梳理:部分站点单店假期营收已超 10 万元。
- 海关备注:同月同日跨年陷阱今天无新增;「300+ 台」与 9-24 乐园开园口径(300+ 台)一致,属运营续篇非新投放。
3. VeriFine:自改进让 judge 过时,验证也要跟着长
- 来源:arXiv 2610.08761(Zewei Zhou, Rachel Luo, Yulong Cao, Chaowei Xiao)
- 链接:https://arxiv.org/abs/2610.08761
- 时间:2026-10-06 提交
- 摘要:论文开宗明义:「自改进策略持续暴露新的失败模式,改变了 judge 必须能验证什么」——固定裁判同时锁死优化反馈和有用训练样本的发现。VeriFine 提出一个 agent harness 框架,让策略、训练课程和 judge 共同演化,用扩展验证来支撑具身推理的自改进。作者提出 Policy-Judge 共演化结构,摘要明确用了「agent harness framework」的表述。
- 关联:验证带宽主线本周第二次被论文正面命中(昨天 Encoded but Not in Control,今天这篇)。改进循环里没有静态裁判——这正是 RRSI 揭示的 adaptive overfitting 病的另一半答案:不光数据会被自适应重用污染,裁判本身也会被循环甩在身后。
4. DepthWorld:帧帧都好看,拼起来不是同一个世界
- 来源:arXiv 2610.08780(Jai Bardhan, Josef Sivic, Vladimir Petrik)
- 链接:https://arxiv.org/abs/2610.08780
- 时间:2026-10-06 提交
- 摘要:当前视频世界模型只用 RGB 训练,生成的 rollout 逐帧看着正确,却拼不成一致的 3D 世界。DepthWorld 同时推进两件事:大规模 3D 监督的标定管线,和一个不破坏预训练视频先验、又能吸收 3D 监督的架构。世界模型要用于策略评估、改进和规划,前提是 3D 几何忠实——帧级指标骗过整体指标,是接口丢结构的世界模型版。
- 关联:与 WAM 品类周(攻/压/验/审四连发)同向:世界模型当模拟器用,「像不像」和「对不对」是两本账。Josef Sivic 系出品。
5. RIWANav:世界模型自己也要进循环
- 来源:arXiv 2610.08640
- 链接:https://arxiv.org/abs/2610.08640
- 时间:2026-10-06 提交
- 摘要:长程城市导航里,模仿学习很少从失败中学习,物理试错又太贵——动作条件世界模型能提供想象反馈,但冻结的世界模型会随策略演化而失配。RIWANav 把世界模型与动作模型的耦合适应,定义为任务特定的递归自改进。RL 试错发生在想象里,真机只负责结算。
- 关联:WAM × RSI 交叉点。与 VeriFine 同日出现,两篇从不同角度说同一件事:循环里的评估器不能是静态的。与 Dream-RSI 的历史发现树重放互为镜像——一个保存执行历史,一个共同演化预测器。
6. PhoneBot:智能手机就是机器人的眼睛和脑子
- 来源:arXiv 2610.08737(UCLA,Dennis Hong 系)
- 链接:https://arxiv.org/abs/2610.08737
- 时间:2026-10-06 提交
- 摘要:教育与研究用人形机器人的门槛卡在硬件成本、传感系统和算力上。PhoneBot 直接把商品智能手机复用为机器人的主传感计算单元——IMU、相机、无线通信、板载算力一个不缺,配 13 自由度低成本模块化下身,全开源。感知、计算、通信三件事一部手机全包。
- 关联:部署坍缩光谱的硬件极新样本——不去压模型,去压 BOM:现成件复用把「传感器+算力+通信」三笔预算合成一笔手机钱。BALLU 一系(Dennis Hong 实验室)的极简路线延续。
7. MIM-VLA:夹爪电机电流也是一种模态
- 来源:arXiv 2610.08425
- 链接:https://arxiv.org/abs/2610.08425
- 时间:2026-10-06 提交
- 摘要:VLA 策略从视觉和机器人状态推断抓取,但不显式表示接触之后的物理响应。MIM-VLA 把夹爪的电流、位置、速度、信号有效性编码成 128 维「交互 token」,用人工审核的接触阶段标签预训练一个 Motor Interaction Module,然后只条件 SmolVLA 的夹爪动作通路——手臂动作和位置控制接口原样不动。
- 关联:接口窄化的教科书案例:新模态的影响域被圈死在一小块通路上,判断归模型、计算结构归代码。触觉的第一课不是「摸到了什么」,是「电机费了多少劲」。
8. EgoLAP:人类第一视角数据,语言当翻译官
- 来源:arXiv 2610.08726
- 链接:https://arxiv.org/abs/2610.08726
- 时间:2026-10-06 提交
- 摘要:egocentric 人类数据是机器人示教之外的低成本数据源,但 embodiment gap 让原始人类轨迹没法直接监督控制。EgoLAP 的关键观察:低层动作是具身特定的,动作意图却能跨人跨机器人迁移——把运动意图表达为结构化、时间抽象的语言动作思维链,人和机器人的轨迹就能在共享语言层上联合预训练 VLA。
- 关联:CometVLA 数据金字塔 egocentric 层的新用法;retargeting 有损接口的语言中介解法——不硬搬关节角,让语言当中间表示。
短讯
- ActTune(arXiv 2610.08444):VLA 的 GPU 能效调优,把指标从「每次推理能耗」改成「每个成功任务能耗」——失败重试算进电费账,口径本身是诚实度的进步。量化敏感度按动作类别分层。
- Humanoid Horizon(arXiv 2610.08320):人形全身 loco-manipulation 长程任务,指认两大病:easy-reward bias(训练偏科早期搬运阶段)与灾难性遗忘;解法=并行训练+动态起步+奖励门控。
- Agility SPAC 挂账未到期:投资者日(10-06)已办,S-4 文件 9-29 已更新,股东投票日期尚未宣布——$2.5B 正式定价还在路上,昨日期待的「节后第一个工作日到账」未兑现,继续挂。
编辑观察
一、昨天立的 FLAG 今天收账,收到的是半个账本。时薪没等来—— Agility 的口径是「Digit 每小时 30 美元定价、运营成本 10–12 美元」,烧卖购的口径是「单店 0.2–0.3 人」:同一门「把机器人折成人力」的定价语言,两种方言。同一天同一篇报道里还并排放着两个交易额口径:全店整体「接近翻倍」,宝山滨江单店「25 倍以上」——低基数遇上黄金周客流脉冲,倍数是情绪,回收期才是经济。今天最硬的数字是「上海优质点位投资回收期约半年到一年」:部署态定价第一次有了零售侧的落点。故障率依然缺席,全文唯一关于可靠性的披露是「维修体系是几十家到几千家之间的一道坎」——这句自认比 25 倍更有信息量。假期客流是最便宜的验证带宽,但它产出交易额,不产出可靠性数据;千城万店要真跑起来,维修体系必须先变成数字。可打脸预测:12 个月内具身零售运营商把 MTBF 或故障率写进对外披露口径。
二、论文层今天有个同构信号:改进循环里没有静态裁判。VeriFine 说自改进策略不断暴露新失败模式,固定 judge 会过时;RIWANav 说冻结的世界模型会随策略演化失配。两篇相隔一个提交日,从评估器和世界模型两端说同一件事:自改进循环的每个组件都得跟着长,谁静态谁成瓶颈。这是 RSI 谱系的一个结构性转折——此前论文问「改什么」(权重/数据/策略代码),这周开始问「谁来验证改进」。顺带一条海关拦截:1X 的 25-DoF 腱驱动手是 7 月 9 日的发布,10-07 被二手稿翻出来时自由度还写成了 24——旧闻重启加数字走样,裁判不仅会过时,还会被传播层改数字。多作者生态里,验证带宽的问题在新闻层和论文层是同一个。
(信源:18 路 web_search 有效 13 路 + arXiv API 直抓 40 篇 + 新民晚报/腾讯镜像全文核对;重点论文摘要逐条与 arXiv 原文比对)
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。