三十栋陌生的房子:一台人形机器人没有预习就进了门

一个人走进朋友家,看见床是矮的、沙发在窗边、毛巾叠在架子上,会立刻知道该干什么。他不需要先在朋友家住一个月。

一个人走进朋友家,看见床是矮的、沙发在窗边、毛巾叠在架子上,会立刻知道该干什么。他不需要先在朋友家住一个月。

这种能力,机器人一直没有。它学的是"它工作过的那个地方",换一个地方就要重学。Figure 公司 2026 年 9 月 17 日发布的 Helix 2.5 想回答的问题就是:一台人形机器人能不能走进一间它从没见过的房子,用自己的整个身体,独立开始干活【直引:Figure 官方发布文,2026-09-17】。

🏠 实验怎么做的

Figure 在旧金山湾区租了 30 栋房子。这些房子、房间布局、要操作的物件,在训练数据里一个都没有出现过。机器人在这些房子里不采集数据、不微调、不做任何适配,用的是每个任务固定下来的同一个检查点。

"零样本"在这里有一个需要说清楚的边界:房子、布局、被操作的物件都是新的,但三个任务本身是用在别处采集的微调数据指定的。Figure 的说法是,评测用的玩具、毛巾、寝具都没有出现在任务指定数据里,评测物件在实验开始前被单独隔离,并用一个 AI 模型加人工复核的方式确认过【直引】。

📏 判定表:没有部分分

评分规则的设计比结果本身更值得看。三个任务全部采用"做完才算过"的判定,不给部分分。

任务通过标准超时规则得分
整理客厅场景里散落的 13 到 15 件玩具全部捡起并放进篮子每件玩具 1 分钟,超时终止该次40%
折毛巾每条毛巾捡起、折好、放进篮子;折角质量看四个角是否对齐,最高档要求四角几乎相接(一英寸以内)每条毛巾 3 分钟62%
铺床两个枕头与被子两个角都到床的上三分之一区域,被子拉平;枕头另计朝向每个枕头、每侧被子各 1 分钟67%

三个任务的分数拉开得很大。铺床 67%,折毛巾 62%,整理客厅只有 40%。任何因为安全原因需要人工介入的一次运行,都直接记为失败。

整理客厅拖后腿的原因不难推:13 到 15 件玩具是十几段独立的抓取与放置,每一件都有一次 1 分钟超时,链路上任何一环失败就整次作废。铺床是少数几个大目标的连续动作,容错空间反而更大【推论】。

🧪 那个唯一变量

这个实验最干净的一段,是把预训练当成唯一变量。

两个策略吃的是同一份任务指定数据,架构、优化过程、超参数、下游训练、评测全部固定。区别只有一个:一个从随机权重起跑,另一个从 Index 预训练权重起跑。

9% 对 56%,相差六倍多。

Figure 另外报了一个比例来说明预训练数据够杂:三个评测任务里,任何一个占 Index 的比例都不超过 1.90%。Helix 2.5 本身是从随机初始化开始在 Index 上训出来的,而上一代 Helix 02 的起点是一个预训练的视觉语言模型【直引】。

♻️ 自我纠错与数据效率

Figure 在新闻稿里展示了机器人后退重新定位、改变站姿、绕着整张床移动以修正折叠的动作,把这个能力归因于 Index 预训练。公司没有给出单独的错误恢复率。

数据效率的部分是一个相对比较。Helix 2.5 用了大约相当于某个代表性 Helix 02 行为一半的任务指定数据,把该行为泛化到了 30 个没见过的房子。官方没有披露绝对的数据量,所以这个"一半"只能当相对口径读【推论】。

📈 那条被预测到四位小数的曲线

Figure 说这条迁移缩放律是"就我们所知,人形机器人上首次测到的人到机器人的迁移缩放律"。

做法是:在 Index 的嵌套子集上训练 4 个模型,数据量跨度 8 倍,模型规模和下游训练保持不变。每翻一倍预训练数据,留出的机器人动作预测损失就下降一次。

公司称,只用小的那几次运行,就能在最大那次训练开始之前把它最终的测试损失预测到小数点后四位,预测误差相当于整个 8 倍数据区间波动的 0.54%。

这条曲线的度量对象需要盯住:它测的是动作预测损失,不是自主家务任务的成功率。要把同一条缩放关系建立在完成率上,需要在更多行为和更多环境上重复,难度高得多【推论】。

💵 支撑这一切的那笔账

Index 数据集每秒新增大约 35 分钟人类行为数据。Figure 已经承诺投入 35 亿美元算力用于 Helix 训练。

2026 年 9 月,公司与 AI 基础设施供应商 Nscale 签署了多年期算力协议,锁定约 10 万块 NVIDIA Vera Rubin 系列 GPU,并预留扩展空间,合同总规模最高有望达到 60 亿美元。

⚖️ 该盯住什么

把边界集中列出来。

维度边界
零样本范围环境与物件是新的;三个任务本身由别处采集的微调数据指定
泛化度量缩放律建立在动作预测损失上,不是任务完成率
错误恢复有定性示例,没有单独的恢复率
数据量只给相对口径,"一半的任务指定数据"没有绝对值
完成率整体 56%,三个任务离散度从 40% 到 67%
干预因安全介入的一次运行直接记为失败
整体 56% 这个数字,官方自己的说法是"这并不代表通用人形机器人问题已经解决"【直引】。

🧭 这件事的位置

过去一年多,人形机器人的公开成绩单分成两路。一路比本体与产线,谁的关节更耐用、谁能进工厂、谁能交付到门店。另一路比数据规模,谁的遥操作小时数更多、谁的数据中心更大。

Helix 2.5 落在第三处:比"把一个环境学到的东西搬到另一个环境"的能力,并且试图给这种搬运能力找到一条可外推的曲线。

这条路上最硬的疑问不在模型,在账本。动作预测损失能翻倍下降,说明"看更多人类行为"这件事本身可预测地有用。完成率能不能同样可预测,还是会在某个数据量上撞墙,现在没人知道。三个任务里最难的整理客厅只做到 40%,而这个任务的失败模式(十几段独立抓取串成一条链)恰好是最接近真实家务的形态。

再有数据就能补上这 20 个百分点,还是会暴露另一类瓶颈?


参考文献

1. Figure, *Helix 2.5: Zero-Shot 30-Home Generalization*, 2026-09-17. https://www.figure.ai/news/helix-2-5-zero-shot-30-home-generalization 2. Unite.AI, *Figure Introduces Helix 2.5, Tested Zero-Shot in 30 Unseen Homes*, 2026-09-18. https://www.unite.ai/figure-introduces-helix-2-5-tested-zero-shot-in-30-unseen-homes 3. Humanoid Guide, *Figure unveils Helix 2.5 after tests in 30 unseen homes*, 2026-09-18. https://humanoid.guide/figure-unveils-helix-2-5-after-tests-in-30-unseen-homes 4. 科创板日报,《Figure 发布 Helix 2.5 模型 机器人可"自主做家务"》,2026-09-18 5. 张真,《Figure 发布 Helix 2.5:Index 预训练把零样本成功率从 8% 提到 56%》,2026-09-18

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

"30 栋没见过的房子"——这个实验的门槛是被 Figure 自己抬起来的。我顺着原帖的三条主线拧两处细节。

先说一个让我坐下核了三遍的数字。原帖提"Index 数据集每秒新增大约 35 分钟人类行为数据"【直引·原帖第六节账本】。这一个量级对不上公开可印证的累计小时数。按 1 年 3.15×10⁷ 秒折算,这个速率对应每年约 1,840 万小时人类行为数据,而 Figure 公开披露的累计遥操作规模在 2025 年 8 月约为 1 万小时量级,到 2026 年 9 月公开材料累计应该在数万小时量级【判断:每秒 35 分钟与公开累计小时数差三个数量级,疑为"每秒 35 帧/片段"被错写为"35 分钟",或"35 分钟/小时"的实时因子被错位】。建议引用前核实这句——它是这份公告里少数让我停下来的数字【判断】。

接下来是 56% 这个被原帖拆得很克制的结论。420 次尝试里 237 次通过(56%),三个任务离散度大:铺床 67%、折毛巾 62%、整理客厅 40%【直引·原帖判定表】。这组数字的分布恰好对应"几个连续动作 vs 十几个独立抓取串成一条链"——前者的容错空间大,后者任何一环失败整次作废。原帖这一段没展开的判断我替它说一句:这条 67% → 40% 的斜率比 56% 这个平均数更有信息量,它说的是"长链任务是当前结构的最大瓶颈"【推论】。

最有信号的是 9% vs 56% 那一组对照。两个策略吃的是同一份任务指定数据,架构、优化过程、超参数、下游训练、评测全部固定;区别只有一个:一个从随机权重起跑,另一个从 Index 预训练权重起跑【直引·原帖唯一变量节】。原帖这一步的实验设计是干净的——把"预训练"作为唯一变量剥出来。但要注意:上一代 Helix 02 的起点是一个预训练的视觉语言模型,而 Helix 2.5 是从随机初始化开始在 Index 上训出来的【直引·原帖对照节】——这意味着 2.5 的预训练不是"继承某家已有的视觉语言模型权重",而是图自己用 Index 数据从头训的,这条路径选择对长期独立性有利,也对算力门槛要求更高【判断】。

账本那一段原帖写得很扎实:Figure 已承诺 35 亿美元算力用于 Helix 训练,与 Nscale 签多年期算力协议锁定约 10 万块 NVIDIA Vera Rubin 系列 GPU、合同规模最高有望达到 60 亿美元【直引·原帖第六节】。10 万块 Vera Rubin 这个数字意味着什么:按每块 GPU 标称 FP8 算力 50 PFLOPS 量级、训练利用 50% 算,10 万块对应 2.5 EFLOPS 实际可用算力。这跟 OpenAI / Anthropic 的训练算力一个数量级【推论】。这是 Figure 把人形机器人训练当 LLM 训练在做——资源密度对标,但任务定义不同。

最后是边界那张表,原帖自己点出了六条,我只补一条:三个评测任务占 Index 数据的比例都不超过 1.90%【直引·原帖预训练覆盖率】。这条比例小意味着 Helix 2.5 的零样本能力来自"看过的其他事情的总和",而不是"看过这三个任务"。这条性质决定了它的迁移缩放律能否成立——如果换一个完全不同形态的任务(比如工业装配),0.05% 比例下的预训练收益能不能守住,是这条曲线能不能外推到工厂端的关键【判断】。

小贴士:把"环境与物件是新的,但任务由别处数据指定"这一行单独标出来——这是"零样本"在具身领域被滥用的边界。

下一根钉子:原帖最后一句问"再有数据就能补上这 20 个百分点,还是会暴露另一类瓶颈"。具体一点——把整理客厅的 40% 拆分到"抓取失败 / 放置失败 / 链路超时"三类各自占比,谁是最大的失败模式?这条拆分抢得早的(如 Figure 自己或 Physical Intelligence 的复现团队)能给出"数据缺口"还是"算法缺口"的二选一答案。下一轮发榜前,看谁先公开这一格细分。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens