具身智能日报 · 2026-10-01
第 26 期。国庆首日,港股休市,中文产业侧进入静默窗口。国际侧没放假:微软的 VLA 基座、Figure 的第三方评测、IDC 的半年报,都挤在节前最后两天。本期以国际线为主。
具身智能日报 · 2026-10-01
第 26 期。国庆首日,港股休市,中文产业侧进入静默窗口。国际侧没放假:微软的 VLA 基座、Figure 的第三方评测、IDC 的半年报,都挤在节前最后两天。本期以国际线为主。
今日要点
- 微软开源 Rho:5B 双臂 VLA 基座,第一句话就是「适配是瓶颈」
- IDC 半年报:全球人形机器人 H1 出货近 2.5 万台,同比 +432%,中国占 77.9%
- Figure 发布 RIDGE 评测:Astra 与 Opus 5.5 均值接近,任务级互有胜负
- arXiv 提交潮:harness 词根首次进机器人论文标题(RoboHarn-Evo)
- 云深处 IPO 推进;四足市场两份报告同日发布,第二名起全部对不上
详细内容
1. 微软 Rho:把「适配」做成产品的开源 VLA 基座
- 来源:Microsoft Research
- 链接:https://arxiv.org/abs/2609.38164 · https://microsoft.github.io/rhobotics/
- 时间:arXiv 09-29 提交,项目页已上线,今日在 HN 首发曝光
关键数字:midtraining 把任务微调数据需求减半;BusyBox 基准上 Rho-YAM-Box 90% 成功,与 π0.5 持平,GR00T N1.7 只有 53%;LIBERO 一个策略打 40 任务,平均 97.9%。最有意思的是在线适配:FlowDAgger 用 15 次人工纠正,把 FR3 Duo 试管装配从 30% 拉到 70%——底座权重全程冻结,只训一个轻量 latent policy;纠正动作被反演成回归目标,在线学习只挪「生成从哪开始」,动作仍出自未改动的离线模型。Meta-World 仿真上同样成立:欠训练策略 + 每任务 50 个脚本纠正,六个难任务平均 57.5%→73.3%。
权重、代码、数据、两个基准全套开源在 HuggingFace microsoft/rho。
2. IDC 半年报:H1 出货近 2.5 万台,中国占 77.9%
- 来源:IDC(PChome、蓝鲸财经、经济通等多源报道)
- 链接:https://technode.com/2026/09/29/china-accounts-for-77-9-of-global-humanoid-robot-shipments-in-h1-idc-says/ (中文报道媒体名+标题可检索)
- 时间:09-29 发布
参照系:2025 全年宇树 5500 台、智元 5168 台(smzdm 转引机构口径)。智元半年 8600 台已超去年全年,盘子两年内从千台级跳到万台级。对照机构对 2030 年的预测,中间还差两个数量级——兑现压力都在后半场。
3. Figure RIDGE:均值遮蔽的东西,任务级数据全暴露
- 来源:Figure AI Research Blog
- 链接:https://www.fig.inc/blog/astra-opus-5-5-and-other-frontier-models-demonstrate-jagged-performance-across-sota-agentic-tasks-from-web-browsing-to-robotics/
- 时间:09-29
结论叫「锯齿状性能」(jagged)。VisualWebArena 上 Astra 139/177 最高、Fable 5 138/177 紧咬,但每一对模型里,低分模型都解得出高分模型解不出的任务:Opus 5.5 拿了 124/177,却有 25 个任务是 Astra 没解的。模型版本更新会重塑任务画像而不动均值。物理域同样:域均值更高的模型,在部分任务类别上更差。配套开源 RIDGE 数据集,五域全量 item 级结果和模型输出。
一句话:基准均值是营销口径,任务级方差才是部署口径。
4. arXiv 提交潮:harness 进标题,评测审计进 VLA
- 来源:arXiv cs.RO 新提交
- 链接:https://arxiv.org/abs/2609.37583 · https://arxiv.org/abs/2609.37771 · https://arxiv.org/abs/2609.38172
- 时间:09-29 提交
RoboHarn-Evo(2609.37583):harness 第一次被写进机器人论文标题。双循环 harness 从物理经验里演化「层级物理知识」——任务知识管子任务调度与完成判定,动作知识管物体相对的几何策略及其物理效果。底座模型权重不动,知识挂在模型外面长。
Faster and Better?(2609.37771):审计对象是 VLA 加速方法的评测本身。发现训练自由的加速方法在基准上测出比基线还高的成功率,从异常增益任务入手定位根因,分实现 bug 与设计局限两类。加速评测的坑第一次被系统翻出来。
Counterfactual Video Generation(2609.38172):反事实视频生成给 humanoid loco-manipulation 扩数据,接世界模型合成数据线。
5. 云深处推进 IPO;四足两份报告同日打架
- 来源:凤凰科技、新浪财经
- 链接:媒体名+标题可检索
- 时间:09-30 报道(四足双报告 09-21 发布)
出货量、硬件收入、行业应用收入,三把尺子三种结果。
6. Roboflow:GPT-6 Astra 是测过最强的视觉模型
- 来源:Roboflow Blog
- 链接:https://blog.roboflow.com/gpt-6-astra-vision/
- 时间:09-18 原发,本周在 HN 复活讨论
编辑观察
微软 Rho 和 GPT-6 Astra 在同一周交卷,是两条路线的正面照面。Astra 走零样本泛化,靠 scale 兜底;Rho 把「zero-shot 在新环境还不够可靠」写在第一段,把宝押在中间层——midtraining 出机型变体让微调数据减半,部署后 15 次纠正把 30% 拉到 70%。开源 5B 对闭源大模型,打的是同一片场景:LIBERO 上 Rho-base 97.9%,Astra 那边是 LIBERO-PRO 92.63%(不同基准不可直比,但两张成绩单都挂在墙上)。Figure 的锯齿评测站在中间补了一刀:均值领先不等于任务级领先,选型要看到 item 级。IROS 今天在匹兹堡闭幕,上周的通才专才之辩中文侧至今没有报道——这场辩论的答案不在会场里,在这两份成绩单的对比里。
口径的故事本周第三次出现。IDC 的 77.9% 口径清楚(出货量),但同一家机构 9-21 发的四足报告和 Counterpoint 同日报告从第二名开始全面分歧;云深处招股书引的沙利文口径(行业应用收入第一)和 IDC 硬件收入口径又是两回事。研究机构的尺子从一把变三把,读者的纪律没变:先问分母。另一件事值得记:国庆休市第一天,中文产业侧静默,国际侧 48 小时里密集落下 Rho、RIDGE、arXiv 提交潮——资本市场的假期和技术侧的节奏已经完全脱钩。明天港股继续休市,中文侧大概率还是静默;国际侧看 IROS 闭幕摘要和 Rho 的社区复现反馈。