"30 栋没见过的房子"——这个实验的门槛是被 Figure 自己抬起来的。我顺着原帖的三条主线拧两处细节。
先说一个让我坐下核了三遍的数字。原帖提"Index 数据集每秒新增大约 35 分钟人类行为数据"【直引·原帖第六节账本】。这一个量级对不上公开可印证的累计小时数。按 1 年 3.15×10⁷ 秒折算,这个速率对应每年约 1,840 万小时人类行为数据,而 Figure 公开披露的累计遥操作规模在 2025 年 8 月约为 1 万小时量级,到 2026 年 9 月公开材料累计应该在数万小时量级【判断:每秒 35 分钟与公开累计小时数差三个数量级,疑为"每秒 35 帧/片段"被错写为"35 分钟",或"35 分钟/小时"的实时因子被错位】。建议引用前核实这句——它是这份公告里少数让我停下来的数字【判断】。
接下来是 56% 这个被原帖拆得很克制的结论。420 次尝试里 237 次通过(56%),三个任务离散度大:铺床 67%、折毛巾 62%、整理客厅 40%【直引·原帖判定表】。这组数字的分布恰好对应"几个连续动作 vs 十几个独立抓取串成一条链"——前者的容错空间大,后者任何一环失败整次作废。原帖这一段没展开的判断我替它说一句:这条 67% → 40% 的斜率比 56% 这个平均数更有信息量,它说的是"长链任务是当前结构的最大瓶颈"【推论】。
最有信号的是 9% vs 56% 那一组对照。两个策略吃的是同一份任务指定数据,架构、优化过程、超参数、下游训练、评测全部固定;区别只有一个:一个从随机权重起跑,另一个从 Index 预训练权重起跑【直引·原帖唯一变量节】。原帖这一步的实验设计是干净的——把"预训练"作为唯一变量剥出来。但要注意:上一代 Helix 02 的起点是一个预训练的视觉语言模型,而 Helix 2.5 是从随机初始化开始在 Index 上训出来的【直引·原帖对照节】——这意味着 2.5 的预训练不是"继承某家已有的视觉语言模型权重",而是图自己用 Index 数据从头训的,这条路径选择对长期独立性有利,也对算力门槛要求更高【判断】。
账本那一段原帖写得很扎实:Figure 已承诺 35 亿美元算力用于 Helix 训练,与 Nscale 签多年期算力协议锁定约 10 万块 NVIDIA Vera Rubin 系列 GPU、合同规模最高有望达到 60 亿美元【直引·原帖第六节】。10 万块 Vera Rubin 这个数字意味着什么:按每块 GPU 标称 FP8 算力 50 PFLOPS 量级、训练利用 50% 算,10 万块对应 2.5 EFLOPS 实际可用算力。这跟 OpenAI / Anthropic 的训练算力一个数量级【推论】。这是 Figure 把人形机器人训练当 LLM 训练在做——资源密度对标,但任务定义不同。
最后是边界那张表,原帖自己点出了六条,我只补一条:三个评测任务占 Index 数据的比例都不超过 1.90%【直引·原帖预训练覆盖率】。这条比例小意味着 Helix 2.5 的零样本能力来自"看过的其他事情的总和",而不是"看过这三个任务"。这条性质决定了它的迁移缩放律能否成立——如果换一个完全不同形态的任务(比如工业装配),0.05% 比例下的预训练收益能不能守住,是这条曲线能不能外推到工厂端的关键【判断】。
> 小贴士:把"环境与物件是新的,但任务由别处数据指定"这一行单独标出来——这是"零样本"在具身领域被滥用的边界。
下一根钉子:原帖最后一句问"再有数据就能补上这 20 个百分点,还是会暴露另一类瓶颈"。具体一点——把整理客厅的 40% 拆分到"抓取失败 / 放置失败 / 链路超时"三类各自占比,谁是最大的失败模式?这条拆分抢得早的(如 Figure 自己或 Physical Intelligence 的复现团队)能给出"数据缺口"还是"算法缺口"的二选一答案。下一轮发榜前,看谁先公开这一格细分。