具身智能日报 · 2026-10-01

第 26 期。国庆首日,港股休市,中文产业侧进入静默窗口。国际侧没放假:微软的 VLA 基座、Figure 的第三方评测、IDC 的半年报,都挤在节前最后两天。本期以国际线为主。

具身智能日报 · 2026-10-01

第 26 期。国庆首日,港股休市,中文产业侧进入静默窗口。国际侧没放假:微软的 VLA 基座、Figure 的第三方评测、IDC 的半年报,都挤在节前最后两天。本期以国际线为主。

今日要点

  • 微软开源 Rho:5B 双臂 VLA 基座,第一句话就是「适配是瓶颈」
  • IDC 半年报:全球人形机器人 H1 出货近 2.5 万台,同比 +432%,中国占 77.9%
  • Figure 发布 RIDGE 评测:Astra 与 Opus 5.5 均值接近,任务级互有胜负
  • arXiv 提交潮:harness 词根首次进机器人论文标题(RoboHarn-Evo)
  • 云深处 IPO 推进;四足市场两份报告同日发布,第二名起全部对不上

详细内容

1. 微软 Rho:把「适配」做成产品的开源 VLA 基座

  • 来源:Microsoft Research
  • 链接:https://arxiv.org/abs/2609.38164 · https://microsoft.github.io/rhobotics/
  • 时间:arXiv 09-29 提交,项目页已上线,今日在 HN 首发曝光
5B 参数开源 VLA 家族,专做双臂操作。一个 Rho-base 预训练基座,midtrain 出三个机型变体:I²RT YAM Box、UR AI Trainer(2×UR5e)、Franka FR3 Duo。训练配方四阶段加可选的第五阶段:Phi-Phy 视觉语言底座 → 挂 542M 流匹配动作专家(3,200+ 小时机器人数据、48 张 B200、90% 机器人数据)→ 机型 midtraining(每台约 300 小时)→ 任务微调 → 部署后在线学习。

关键数字:midtraining 把任务微调数据需求减半;BusyBox 基准上 Rho-YAM-Box 90% 成功,与 π0.5 持平,GR00T N1.7 只有 53%;LIBERO 一个策略打 40 任务,平均 97.9%。最有意思的是在线适配:FlowDAgger 用 15 次人工纠正,把 FR3 Duo 试管装配从 30% 拉到 70%——底座权重全程冻结,只训一个轻量 latent policy;纠正动作被反演成回归目标,在线学习只挪「生成从哪开始」,动作仍出自未改动的离线模型。Meta-World 仿真上同样成立:欠训练策略 + 每任务 50 个脚本纠正,六个难任务平均 57.5%→73.3%。

权重、代码、数据、两个基准全套开源在 HuggingFace microsoft/rho。

2. IDC 半年报:H1 出货近 2.5 万台,中国占 77.9%

  • 来源:IDC(PChome、蓝鲸财经、经济通等多源报道)
  • 链接:https://technode.com/2026/09/29/china-accounts-for-77-9-of-global-humanoid-robot-shipments-in-h1-idc-says/ (中文报道媒体名+标题可检索)
  • 时间:09-29 发布
全球人形机器人 H1 出货接近 2.5 万台,同比 +432.1%;市场规模超 7.4 亿美元,同比 +322.7%。中国出货超 1.9 万台,同比 +426.3%,占全球 77.9%。厂商级数字报告只点了一家:智元(AGIBOT)出货超 8600 台,按 1.9 万台口径约占中国 45%。IDC 判断产业「从技术验证迈向商业化应用」,场景扩展到工业、零售、家庭。

参照系:2025 全年宇树 5500 台、智元 5168 台(smzdm 转引机构口径)。智元半年 8600 台已超去年全年,盘子两年内从千台级跳到万台级。对照机构对 2030 年的预测,中间还差两个数量级——兑现压力都在后半场。

3. Figure RIDGE:均值遮蔽的东西,任务级数据全暴露

  • 来源:Figure AI Research Blog
  • 链接:https://www.fig.inc/blog/astra-opus-5-5-and-other-frontier-models-demonstrate-jagged-performance-across-sota-agentic-tasks-from-web-browsing-to-robotics/
  • 时间:09-29
Figure 把 GPT-6 Astra、Claude Opus 5.5、GPT-5.6、Fable 5、Kimi K3 等七个模型拉到五个域上逐任务评测:网页(VisualWebArena)、驾驶(Bench2Drive-VL)、工业流程(IndEgo)、装配(Assembly101)、桌面操作(VLABench)。

结论叫「锯齿状性能」(jagged)。VisualWebArena 上 Astra 139/177 最高、Fable 5 138/177 紧咬,但每一对模型里,低分模型都解得出高分模型解不出的任务:Opus 5.5 拿了 124/177,却有 25 个任务是 Astra 没解的。模型版本更新会重塑任务画像而不动均值。物理域同样:域均值更高的模型,在部分任务类别上更差。配套开源 RIDGE 数据集,五域全量 item 级结果和模型输出。

一句话:基准均值是营销口径,任务级方差才是部署口径。

4. arXiv 提交潮:harness 进标题,评测审计进 VLA

  • 来源:arXiv cs.RO 新提交
  • 链接:https://arxiv.org/abs/2609.37583 · https://arxiv.org/abs/2609.37771 · https://arxiv.org/abs/2609.38172
  • 时间:09-29 提交
三条线值得盯。

RoboHarn-Evo(2609.37583):harness 第一次被写进机器人论文标题。双循环 harness 从物理经验里演化「层级物理知识」——任务知识管子任务调度与完成判定,动作知识管物体相对的几何策略及其物理效果。底座模型权重不动,知识挂在模型外面长。

Faster and Better?(2609.37771):审计对象是 VLA 加速方法的评测本身。发现训练自由的加速方法在基准上测出比基线还高的成功率,从异常增益任务入手定位根因,分实现 bug 与设计局限两类。加速评测的坑第一次被系统翻出来。

Counterfactual Video Generation(2609.38172):反事实视频生成给 humanoid loco-manipulation 扩数据,接世界模型合成数据线。

5. 云深处推进 IPO;四足两份报告同日打架

  • 来源:凤凰科技、新浪财经
  • 链接:媒体名+标题可检索
  • 时间:09-30 报道(四足双报告 09-21 发布)
杭州六小龙之一云深处(DeepRobotics)IPO 进入排队段:2025-12 启动辅导、5 个月完成,招股书 366 页已报上交所。口径故事在这——沙利文给招股书出的口径是「2025 四足机器人行业应用收入全球第一」,IDC 1H26 按硬件收入排,四足榜第一名是宇树。而 09-21 当天 Counterpoint 和 IDC 同日发布四足市场报告,第一名都是宇树,从第二名起名次全部对不上。

出货量、硬件收入、行业应用收入,三把尺子三种结果。

6. Roboflow:GPT-6 Astra 是测过最强的视觉模型

  • 来源:Roboflow Blog
  • 链接:https://blog.roboflow.com/gpt-6-astra-vision/
  • 时间:09-18 原发,本周在 HN 复活讨论
GPT-6 Astra 在 Roboflow Vision Evals 上检测 82.1% mAP@50,领先 Qwen3.8 Max 5.4 个点、领先 GPT-5.6 Sol 13.7 个点;高推理档也没有对手追平。测试覆盖 box prompting、分割、重识别和机器人控制。发布时主打的 computer use 能力,外溢到了通用视觉任务。

编辑观察

微软 Rho 和 GPT-6 Astra 在同一周交卷,是两条路线的正面照面。Astra 走零样本泛化,靠 scale 兜底;Rho 把「zero-shot 在新环境还不够可靠」写在第一段,把宝押在中间层——midtraining 出机型变体让微调数据减半,部署后 15 次纠正把 30% 拉到 70%。开源 5B 对闭源大模型,打的是同一片场景:LIBERO 上 Rho-base 97.9%,Astra 那边是 LIBERO-PRO 92.63%(不同基准不可直比,但两张成绩单都挂在墙上)。Figure 的锯齿评测站在中间补了一刀:均值领先不等于任务级领先,选型要看到 item 级。IROS 今天在匹兹堡闭幕,上周的通才专才之辩中文侧至今没有报道——这场辩论的答案不在会场里,在这两份成绩单的对比里。

口径的故事本周第三次出现。IDC 的 77.9% 口径清楚(出货量),但同一家机构 9-21 发的四足报告和 Counterpoint 同日报告从第二名开始全面分歧;云深处招股书引的沙利文口径(行业应用收入第一)和 IDC 硬件收入口径又是两回事。研究机构的尺子从一把变三把,读者的纪律没变:先问分母。另一件事值得记:国庆休市第一天,中文产业侧静默,国际侧 48 小时里密集落下 Rho、RIDGE、arXiv 提交潮——资本市场的假期和技术侧的节奏已经完全脱钩。明天港股继续休市,中文侧大概率还是静默;国际侧看 IROS 闭幕摘要和 Rho 的社区复现反馈。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens