补漏 1:「11 分钟」这条数字被原作者藏起来了
原帖只说「S1 在 4 个未见任务上单步成功率 66%」,没点破这条数字最刺眼的地方——演示到部署的 11 分钟。9:22 录完人手演示,9:27 机器人自己开干,中间没有人写数据脚本、没有跑训练脚本、没有重训权重。这不是模型比 VLA 强 7 倍的问题,是部署范式从「录制 → 标注 → 训练 → 部署」压缩成了「录制 → 跑」。
补漏 2: VLA 不是被打败,是被换赛道
原帖那句「VLA 后训练 380 个样本才追上一次视频」容易让人误读成「视频比数据强」。其实 Skild 自己公布的对照里,在 1 千小时已见任务上语言 VLA 还是赢家(53% vs S1 的 43%)。S1 的胜利面在「未见任务」,不在「熟练度」。换句话说:
- 工厂里重复 1000 次的同一动作 → 语言 VLA 仍是首选
- 工厂里突然冒出来的「新活儿」 → S1 一次视频就够
补漏 3: 那个煎饼动作是反作弊证据
原帖提了 4 个演示任务,但没说最关键的一条——煎饼翻转在 S1 的全部训练数据里搜不到一次。Skild 自己放话「我们查了数据库,煎饼动作没出现过」。这意味着 S1 不是把演示原样复刻,而是从演示里抽出可组合的操作原语(铲、翻、压)然后在新场景里重新拼出来。机器人圈对「零样本泛化」的怀疑一半来自「测试任务和训练任务长得太像」,煎饼这条证据让那条怀疑暂时没落脚点。
补漏 4: 100k 小时 = 11.4 年的预训练——S1 不是从天而降
原帖没点破 Skild 预训练量有多大:100,000 小时 ≈ 11.4 年不间断的人类演示视频。这不是「看一段视频就能干活」的故事,是「先花相当于十几年的算力把世界模型塞进去、然后才有资格在 prompt 阶段做 in-context 学习」的故事。OpenAI 的 GPT-3 用 175B 参数 + 几千亿 token,S1 在物理世界那侧几乎平行——只是把「会写字」换成了「会做煎饼」。
补漏 5: 商业化窗口已开,但护城河在「演示库」而非「模型」
原帖提了「已部署到小批工业客户」但没说关键一点——S1 的真正护城河不是权重,而是它未来能接触到的演示视频库。任何对手都能下载权重,但工业场景里每一段「老师傅示范如何修这台德国机床」的视频是抢不到的。Skild 接下来的胜负手不在论文,而在 2026 Q4 能不能签下 50 个工业客户、把独家演示库堆到 100 万小时。
收尾: 下一根最该盯的钉子
2027 年 3 月之前看一项指标——Skild 工业客户的「每月新增演示视频数」和「agent 跨任务调用率」。前者决定护城河深浅,后者决定 ICL 范式能不能从「炫技」走到「日常」。如果跨任务调用率 < 30%,说明工厂还在为每条新产线重录视频,ICL 就只是「更省人力的 fine-tuning」,不是新范式。