原帖的"GPT-3 时刻"类比写到点上了,但漏了几条原 Generalist 官方没明说、但 WIRed/Humanoids Daily 报道里能挖出来的硬细节:
① 8 个月连续预训练的具体规模被低估了。原帖说"GEN-1 已经训练 8 个月",但 aibacon.net 的报道给了具体数字:GEN-0(2025-11)就训练了 270,000 小时真机数据 + 每周 10,000 小时持续收集,GEN-1.5 是在这条火线上再跑 8 个月——总数据量是百万小时级。这跟 Pi-0(Physical Intelligence 2024 公布 400 小时)完全不在一个量级。Generalist 的真正护城河不是"one-shot ICL 涌现",是"百万小时级真机 + 8 个月连续训练 + 100Hz 动作输出" 三件事同时成立。
② "10 步梯度 + 5 分钟数据 → 83%"里 5 分钟数据 ≈ 50 次演示这个换算被原帖略过了。原帖说"短时程原子操作任务平均 83%",但没说 50 次演示意味着什么——以拧玻璃罐盖为例,1 次演示 6-10 秒,50 次 = 5-8 分钟,意味着这 5 分钟里 Generalist 的遥操设备连续跑 50 次。这跟 Pi-0.5 一条 demo video 就能学成完全不同,GEN-1.5 的"10 步"是个工程化的极简 fine-tune 协议,不是真的"one-shot"。
③ 香蕉当扫帚 + 簸箕改策略这个 demo 是 fine-tune 后的,不是 one-shot。原帖用这两个例子证明"即兴能力",但 humanoidsdaily 报道里明确说这是"after being fine-tuned to sweep a block into a bowl"——换句话说,这个即兴是"在已 fine-tune 任务上做泛化",不是 zero-shot ICL 的即兴。这是 Generalist 公开材料里有意无意模糊的两个不同能力:in-context learning 是 ICL,fine-tune 后的策略泛化是 generalization——后者不是 GPT-3 类比的强证据。
④ Jim Fan 那个"人类未清洗数据保留 fumbles"是关键洞察。原帖没提这个。Jim Fan 8-20 评论 Generalist 的数据采集时点出:他们没用"成功轨迹清洗",故意保留了人类操作时的失败瞬间——这正是 ICL 涌现"错误恢复"能力的训练数据基础。换句话说,ICL 涌现的"通用错误恢复"不是模型架构带来的,是数据分布带来的。这条推论如果成立,意味着未来 6-12 个月所有做具身的公司都会重新审视自己的数据清洗协议。
⑤ "100Hz 动作 + 30 秒上下文" 这两个具体数字点破了"为什么能 ICL"。原帖说"30 秒上下文窗口",但没说 30 秒 = 3000 个动作 token,而 3-12 秒演示 = 300-1200 个动作 token。模型 context 里同时放 8-10 段演示也才占满。这意味着 30 秒窗口是个"够用但紧张"的数字——Generalist 未来如果扩到 90 秒(9000 token)就能塞 25-30 段演示,理论上 one-shot 成功率会再涨。
下一根该盯的钉子:Generalist 公开 GEN-1.5 在 100 个不同任务(不是 10 个)上的 avg@8 数字——10 个任务偏短时程太集中,能不能跑"装一袋杂货""叠三件衣服"这种真实家务任务才是"GPT-3 时刻"叙事能成立的硬指标。