一个人走进朋友家,看见床是矮的、沙发在窗边、毛巾叠在架子上,会立刻知道该干什么。他不需要先在朋友家住一个月。
这种能力,机器人一直没有。它学的是"它工作过的那个地方",换一个地方就要重学。Figure 公司 2026 年 9 月 17 日发布的 Helix 2.5 想回答的问题就是:一台人形机器人能不能走进一间它从没见过的房子,用自己的整个身体,独立开始干活【直引:Figure 官方发布文,2026-09-17】。
🏠 实验怎么做的
Figure 在旧金山湾区租了 30 栋房子。这些房子、房间布局、要操作的物件,在训练数据里一个都没有出现过。机器人在这些房子里不采集数据、不微调、不做任何适配,用的是每个任务固定下来的同一个检查点。
"零样本"在这里有一个需要说清楚的边界:房子、布局、被操作的物件都是新的,但三个任务本身是用在别处采集的微调数据指定的。Figure 的说法是,评测用的玩具、毛巾、寝具都没有出现在任务指定数据里,评测物件在实验开始前被单独隔离,并用一个 AI 模型加人工复核的方式确认过【直引】。
📏 判定表:没有部分分
评分规则的设计比结果本身更值得看。三个任务全部采用"做完才算过"的判定,不给部分分。
| 任务 | 通过标准 | 超时规则 | 得分 |
|---|---|---|---|
| 整理客厅 | 场景里散落的 13 到 15 件玩具全部捡起并放进篮子 | 每件玩具 1 分钟,超时终止该次 | 40% |
| 折毛巾 | 每条毛巾捡起、折好、放进篮子;折角质量看四个角是否对齐,最高档要求四角几乎相接(一英寸以内) | 每条毛巾 3 分钟 | 62% |
| 铺床 | 两个枕头与被子两个角都到床的上三分之一区域,被子拉平;枕头另计朝向 | 每个枕头、每侧被子各 1 分钟 | 67% |
三个任务的分数拉开得很大。铺床 67%,折毛巾 62%,整理客厅只有 40%。任何因为安全原因需要人工介入的一次运行,都直接记为失败。
整理客厅拖后腿的原因不难推:13 到 15 件玩具是十几段独立的抓取与放置,每一件都有一次 1 分钟超时,链路上任何一环失败就整次作废。铺床是少数几个大目标的连续动作,容错空间反而更大【推论】。
🧪 那个唯一变量
这个实验最干净的一段,是把预训练当成唯一变量。
两个策略吃的是同一份任务指定数据,架构、优化过程、超参数、下游训练、评测全部固定。区别只有一个:一个从随机权重起跑,另一个从 Index 预训练权重起跑。
9% 对 56%,相差六倍多。
Figure 另外报了一个比例来说明预训练数据够杂:三个评测任务里,任何一个占 Index 的比例都不超过 1.90%。Helix 2.5 本身是从随机初始化开始在 Index 上训出来的,而上一代 Helix 02 的起点是一个预训练的视觉语言模型【直引】。
♻️ 自我纠错与数据效率
Figure 在新闻稿里展示了机器人后退重新定位、改变站姿、绕着整张床移动以修正折叠的动作,把这个能力归因于 Index 预训练。公司没有给出单独的错误恢复率。
数据效率的部分是一个相对比较。Helix 2.5 用了大约相当于某个代表性 Helix 02 行为一半的任务指定数据,把该行为泛化到了 30 个没见过的房子。官方没有披露绝对的数据量,所以这个"一半"只能当相对口径读【推论】。
📈 那条被预测到四位小数的曲线
Figure 说这条迁移缩放律是"就我们所知,人形机器人上首次测到的人到机器人的迁移缩放律"。
做法是:在 Index 的嵌套子集上训练 4 个模型,数据量跨度 8 倍,模型规模和下游训练保持不变。每翻一倍预训练数据,留出的机器人动作预测损失就下降一次。
公司称,只用小的那几次运行,就能在最大那次训练开始之前把它最终的测试损失预测到小数点后四位,预测误差相当于整个 8 倍数据区间波动的 0.54%。
这条曲线的度量对象需要盯住:它测的是动作预测损失,不是自主家务任务的成功率。要把同一条缩放关系建立在完成率上,需要在更多行为和更多环境上重复,难度高得多【推论】。
💵 支撑这一切的那笔账
Index 数据集每秒新增大约 35 分钟人类行为数据。Figure 已经承诺投入 35 亿美元算力用于 Helix 训练。
2026 年 9 月,公司与 AI 基础设施供应商 Nscale 签署了多年期算力协议,锁定约 10 万块 NVIDIA Vera Rubin 系列 GPU,并预留扩展空间,合同总规模最高有望达到 60 亿美元。
⚖️ 该盯住什么
把边界集中列出来。
| 维度 | 边界 |
|---|---|
| 零样本范围 | 环境与物件是新的;三个任务本身由别处采集的微调数据指定 |
| 泛化度量 | 缩放律建立在动作预测损失上,不是任务完成率 |
| 错误恢复 | 有定性示例,没有单独的恢复率 |
| 数据量 | 只给相对口径,"一半的任务指定数据"没有绝对值 |
| 完成率 | 整体 56%,三个任务离散度从 40% 到 67% |
| 干预 | 因安全介入的一次运行直接记为失败 |
整体 56% 这个数字,官方自己的说法是"这并不代表通用人形机器人问题已经解决"【直引】。
🧭 这件事的位置
过去一年多,人形机器人的公开成绩单分成两路。一路比本体与产线,谁的关节更耐用、谁能进工厂、谁能交付到门店。另一路比数据规模,谁的遥操作小时数更多、谁的数据中心更大。
Helix 2.5 落在第三处:比"把一个环境学到的东西搬到另一个环境"的能力,并且试图给这种搬运能力找到一条可外推的曲线。
这条路上最硬的疑问不在模型,在账本。动作预测损失能翻倍下降,说明"看更多人类行为"这件事本身可预测地有用。完成率能不能同样可预测,还是会在某个数据量上撞墙,现在没人知道。三个任务里最难的整理客厅只做到 40%,而这个任务的失败模式(十几段独立抓取串成一条链)恰好是最接近真实家务的形态。
再有数据就能补上这 20 个百分点,还是会暴露另一类瓶颈?
参考文献
- Figure, Helix 2.5: Zero-Shot 30-Home Generalization, 2026-09-17. https://www.figure.ai/news/helix-2-5-zero-shot-30-home-generalization
- Unite.AI, Figure Introduces Helix 2.5, Tested Zero-Shot in 30 Unseen Homes, 2026-09-18. https://www.unite.ai/figure-introduces-helix-2-5-tested-zero-shot-in-30-unseen-homes
- Humanoid Guide, Figure unveils Helix 2.5 after tests in 30 unseen homes, 2026-09-18. https://humanoid.guide/figure-unveils-helix-2-5-after-tests-in-30-unseen-homes
- 科创板日报,《Figure 发布 Helix 2.5 模型 机器人可"自主做家务"》,2026-09-18
- 张真,《Figure 发布 Helix 2.5:Index 预训练把零样本成功率从 8% 提到 56%》,2026-09-18
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。