2026 年 8 月 25 日深夜,Skild AI 在 X 上贴了一条 4 分钟视频:一个人类示范者手冲咖啡、把滤纸压实、注水、收杯。视频末端,那台没换过一行权重的机械臂按同样的流程把咖啡冲完了。帖子下面挂的 hashtag 只有一个:#onebrain。
这是 Skild Brain S1 的「上岗秀」。它把过去三年机器人圈的一个隐痛摆到了台面:能不能让通用具身模型像 GPT-3 那样,看一眼例子就完成任务,而不是为每条新产线再采几周数据?
S1 给的答案是:能,但只在你也烧得起 10 万小时预训练算力的情况下。
在 Skild 自己控制的对照里,10 万小时预训练后,ICL 视频策略在「训练时没见过」的任务上单步成功率 66%,语言指令 VLA 只有 9%,差距 7 倍以上;同等对照下,传统 VLA 要再补 380 个后训练样本才追上 S1 一次视频演示的水平。换算到工厂侧,意味着给机器人加一项新技能的边际成本,正在从「重新采集数据 + 重新训练」滑向「录一段视频」。
但 S1 的另一组数字同样不能忽略:在已见任务、1 千小时规模上,语言 VLA 还是赢家(53% vs 43%)。换句话说,S1 的胜利不在「熟练度」,而在「泛化」——它赌的是未来几年具身数据会继续暴涨、从未见过的新任务才是工厂的真正瓶颈。
这篇文章想拆开三个东西:
- S1 的 ICL 范式到底凭什么能让一段视频「替代」380 次后训练;
- 这个数据换算成立的话,工厂侧、家用侧的数据成本结构会被怎样重写;
- 66% 这个数字本身被多少层不确定性包裹——尤其是它没有权重、没有技术报告、没有第三方基准。
🌩️ 一、从行为克隆到 ICL:具身范式为什么卡在「数据换」」
具身智能这三年走过一条类似 LLM 的曲线,但落后了三四年。
2022 年是 VLA(Vision-Language-Action)范式起点:RT-2、Octo、OpenVLA 把语言指令和视觉编码塞进同一个端到端策略,输入「把红色方块放进蓝色碗里」直接吐出 7-DoF 关节角度。
到 2024 年底,Physical Intelligence 的 π0 把 dexterous manipulation 推到了一个新高度,π0.5 又把「长程任务 + 多本体」往前推了一步。但所有这些 VLA 的训练范式都绕不开同一个前提:要教机器人一个新任务,先给它采几百到几千条同本体、同任务的遥操数据。
这就像 2018 年的 BERT——每换一个下游任务,就要重新 fine-tune 一次。当时没人觉得这有问题,因为大家都以为「任务」是稳定品类,每条产线一调就是几年。
但工厂不是这么运转的。订单在变、SKU 在变、包装在变、容器在变。一家做混装分拣的工厂,每天的「新任务」数量可能比 BERT 时代的「下游任务」多两个数量级。
这就催生了一个 GPT-3 式的需求:能不能让模型看几个例子就学会,而不是为每条新任务重启训练?
OpenAI 在 GPT-3(2020 年)证明语言任务可以,Anthropic 在 Claude(2022-2024)把 ICL 推到工具调用,DeepMind 在 RT-2 后续工作里小试过视频 prompt。但到 Skild S1 之前,机器人圈没有一家把「一段视频 → 长程 OOD 任务」这套机制做成产品级宣称。
S1 的核心做法,用 Skild 自己的话说是:
我们让视频示范成为「程序」。模型权重不改变,演示视频进入上下文窗口,输出是机器人动作序列。这把数据收集从「每个任务几周」压缩到「每个任务 11 分钟」。
11 分钟这个数字来自植物换盆任务:9:16 开始录人类示范,9:22 录完,9:27 机器人开始执行。换盆是个 7-10 步的连续任务,包含取盆、加土、移植物、压实、浇水,每一步的接触力和空间关系都不一样。
但 ICL 不是免费午餐。Skild 给了两个反直觉的数字:
- 1 千小时预训练时,语言 VLA 53% vs S1 43%(S1 输);
- 10 万小时预训练时,S1 反超——已见任务 96% vs 89%,未见任务 66% vs 9%。
这意味着 ICL 的胜利有规模门槛。在 1 千小时量级,你继续 fine-tune 反而更划算;只有当预训练规模堆到 10 万小时,ICL 才开始比 fine-tune 便宜且更强。
这对工业部署是个关键限制:没有 Skild 的 10 万小时私货,工厂没法在自己车间复现 S1。这条路在语言模型里走过——OpenAI 用 GPT-3 的 3000 亿 token 私货「锁」住了 ICL 范式的先发优势——Skild 显然想走同一条路。
🧠 二、66% vs 9%:7 倍差距是怎么测出来的
数字必须放回实验设置里看才有意义。Skild 在博客里只放了 4 个对照表,关键细节全部埋在脚注里。整理一下:
| 预训练规模 | 策略 | 已见任务单步成功率 | 未见任务单步成功率 |
|---|---|---|---|
| 1,000 小时 | 传统 VLA(语言指令) | 53% | ~0% |
| 1,000 小时 | S1(视频 ICL) | 43% | ~0% |
| 100,000 小时 | 传统 VLA(语言指令) | 未披露 | 9% |
| 100,000 小时 | S1(视频 ICL) | 未披露 | 66% |
注解:表里所有数字都是「单步成功率(per-step success rate)」,不是端到端任务完成率。Skild 用了人介入恢复(human intervention)让失败步骤能被评级,这跟「机器人完全自主完成整个任务」不是一回事。
10 万小时 × 66% 单步 × 几十步序列 = 端到端任务完成率的几何级衰减。如果你把 10 分钟任务的 30 步都乘 0.66,端到端完成率大约在 0.66³⁰ ≈ 1.6×10⁻⁵。
这显然不是 Skild 想要传达的图景。他们在另一处披露了「早期实测 60-80% 完成率」,但这跟上面那张表口径不同——具体怎么算的,没说。
再看 9%。100,000 小时预训练的语言 VLA 在未见任务上只有 9% 单步成功率。这其实是个相当弱的对手,Skild 没有公布它是不是用了他们自己的对照基线、是不是调过 prompt、是不是用了 chain-of-thought 加成。
第三方评测基本缺位。Skild 没放权重(closed platform)、没放技术报告(no technical report)、没放外部基准(no public leaderboard drop)、没放 API(no API)、没放许可证(no licence)、没放定价(no pricing)、没放 trial counts 与 error bar。所有数字都来自一篇博客 + 4 个 demo 视频。
DataNorth 的判断是「这是该领域证据等级最弱的一档」:
66% 是方向性信号,不是基准。一个博客、一份内部评测、四个挑出来的任务——这是你在这个领域能拿到的最弱证据层。
但即使打了所有折扣,这套对照实验的设计本身是值得看的:它把「数据规模 × 策略类型 × 任务分布」三个变量拆开了。这是工业部署里真正需要回答的问题,不是 benchmark 排行榜上那种单数字问题。
⚙️ 三、380 个后训练样本的换算:数据成本被改写了吗
最容易被媒体拿去当标题的数字是「1 段视频 ≈ 380 个后训练样本」。这个换算是 Skild 在 100,000 小时规模上的插值结果:传统 VLA 加到 380 个遥操样本后,单步成功率追上 S1 单视频基线;继续堆到 2,000 个,传统 VLA 反而反超到 86%。
这个换算的工程含义要分两边看。
对单条产线:假设一条分拣线换包装形态,传统做法是 5 个工人 × 5 天 × 每天 100 次 = 2,500 个遥操样本,按 VLA 训练 1 天 ≈ 50 万元工程成本。S1 模式下,一个工程师录一段 5 分钟视频,11 分钟上线,省掉的是 99% 的采集 + 训练成本。
对整个产业:前提是 Skild 的 100,000 小时预训练规模被复现。中国头部具身公司(银河通用、原力灵机、自变量、千寻、星动纪元)在 8 月的世界机器人大会(WRC)公布的预训练规模从「数千小时到数万小时」不等,离 100,000 小时还有 1-2 个数量级。如果 Skild 的规模门槛成立,意味着 S1 在未来 1-2 年内不会被中国厂商低成本复现。
但这里有个反向证据。Skild 的数据策略不是单纯堆遥操:
Teleop 最贴近硬件但贵;第一人称人类视频最容易规模化但和机器人身体差得远;仿真便宜能猛造,但有 sim-to-real gap。所以我们对 teleop、UMI、egocentric video、simulation 基本采取都用的策略。
团队明确花 $3 在过滤和质量控制上,对应 $1 在原始采集上——理由是脏数据会主动伤害 scale 的有效性。
这是另一个值得展开的论点:「数据越多越好」已经过时,「数据的噪声比」才是关键。Skild 走的是 25% 采集 + 75% 过滤的工艺,这跟 LLM 行业 2023 年的 reflexion、Sage、dolma 思路一致。区别是机器人圈以前没这么认真做。
🌪️ 四、5 级扰动测试:ICL 退化只有 VLA 的 1/3
Skild 的另一个隐藏贡献是定义了「部署时扰动五级梯子」:
| 级别 | 扰动 | 含义 |
|---|---|---|
| 1 | 无扰动 | 与演示完全一致 |
| 2 | 小幅物体位姿偏移 | 物体被挪了几厘米 |
| 3 | 大幅物体位姿偏移 | 物体被挪了几十厘米 |
| 4 | 物体替换(同等 affordance) | 把方块换成形状相近的方块 |
| 5 | 一半动作必须用另一只手 | 完全改变运动计划 |
在这个梯子上,Skild 测了一组对照:
跨梯子,语言 VLA 的退化幅度最高是 ICL 的 3 倍。
具体到 S1 单独看:前 4 级基本不崩,到第 5 级(演示隐含的运动计划跟当前场景完全不同)才显著退化。这是公开数据里能拿到的 ICL 策略「最远泛化距离」的最清晰边界。
这反过来揭示了 ICL 的工作机制:视频示范不是用来「记忆动作」,而是用来「提取意图 + 重新规划」。语言指令在第 4 级就会因为新物体不在词表里而崩;视频示范在第 5 级才会因为「左右手」这种隐含约束崩。
这跟 Skild 给的「ICL 学到的是意图而非轨迹」的论证互相印证。
🏭 五、Skild 的产业卡位:估值 140 亿美元、3 个 OEM、closed platform
2026 年 1 月,Skild 完成 14 亿美元 C 轮融资,估值超 140 亿美元。SoftBank 领投,英伟达、贝索斯跟投。两年半时间,估值翻了 10 倍。
创始人 Deepak Pathak(CMU 机器人所)和 Abhinav Gupta(CMU 计算机视觉)从 2022 年的 WHIRL(让机器人看人类视频做 one-shot imitation)一路做到 2026 年的 S1,路线相当连贯:
| 时间 | 工作 | 关键贡献 |
|---|---|---|
| 2022 | WHIRL | 让机器人通过看人类视频做 one-shot imitation |
| 2025-09 | LocoFormer | 机器人 locomotion 任务的 ICL |
| 2026-02 | In-Domain ICL | 第一次把 ICL 推到具身 |
| 2026-05 | 翻煎饼 demo | 第一次展示 dexterous 任务 ICL |
| 2026-08-25 | S1 | OOD 长程 10 分钟任务 ICL |
S1 的 OEM 合作伙伴是 ABB Robotics、Universal Robots、Mobile Industrial Robots(MiR)。这三家覆盖了从工业机械臂到移动机器人的主流产线 SKU。Skild 没说 OEM 拿什么,但显然是「我出脑,你出身体」的分工。
注解:ABB、UR、MiR 三家加起来占全球工业机器人市场约 30% 份额。Skild 拿下这三家,等于锁住了未来 2-3 年工厂部署里最容易被替换的「最不挣钱」的一段——传统集成商的算法定制服务。
但 closed platform 的策略也很激进:没有权重、没有 API、没有技术报告、没有许可证、没有定价。所有数字靠一篇博客 + 4 个 demo 视频 + 1 个 X 帖子。
Humanoids Daily 把这叫「最弱证据等级」。ExplainX 的判断更直接:
60-80% 不是工厂级——它需要安全笼和人工监督。
部署前请先在你自己本体、灯光、夹爪上跑一遍。
不要把 capability research 和 shipped product SKU 混为一谈。
但这也正是 closed platform 的策略价值:让投资人信 140 亿美元估值需要的不是开放,而是排他。Skild 的下一步大概率是先给三个 OEM 部署 6-12 个月,攒出可外部引用的工业实测数据,再决定是否开源或开放 API。
🔮 六、ICL scaling law:如果 66% 是真的,机器人产业会被怎样改写
把这篇文章的论点推到极限:如果 ICL scaling law 真的成立(数据越多,ICL 反超 VLA 的幅度越大),机器人产业会有几个结构性变化。
1)数据工厂的地缘重新洗牌
今天具身数据的瓶颈不在「采多少」,在「采得多干净」。Skild 1:3 的过滤预算比是中国公司很少公开承认的成本结构——大多数中国厂商把 70% 预算花在采集上,过滤只占 30%。
如果 ICL scaling law 成立,未来 12-18 个月里,采集便宜但过滤贵的数据工厂会比「采集贵 + 过滤便宜」的工厂更值钱。Teleop 工人工资只占总成本 25%,剩下 75% 是质检工程师 + 标注员 + 校验员。
2)「会刷锅的机器人」和「会换尿布的机器人」会是同一台
Skild 演示的四个任务(换盆、煎饼、手冲咖啡、套件装配)毫无共同点,但都跑在同一套权重上。如果 ICL 真的能让一段视频替代 380 次后训练,那未来工厂里的「万能机器人」和家用「万能机器人」可能是同一台硬件,只是 prompt 不同。
这意味着家庭机器人公司可能不再需要为每个场景训练专属模型,而是买一台通用硬件 + 录几段视频。这条路线如果走通,会让 Figure 01、1X Neo、Sanctuary、Apptronik 这些「家用机器人硬件公司」的价值锚定彻底改变——他们不再卖硬件加模型,而是卖硬件加视频 prompt 服务。
3)OEM 的算法议价能力下降
传统集成商(系统集成商)的核心利润来自「客户每换一条产线,就要重新付算法定制费」。如果 ICL 让客户能自己录视频上线,集成商的算法定制收入会被压缩,但硬件销售会被放大。ABB、UR、MiR 跟 Skild 合作恰好踩中这个拐点——它们用「放弃算法议价」换取「硬件销量 + 部署速度」。
4)后训练工作流公司的位置
像 Physical Intelligence(π0)、Toyota Research Institute、TRI 这类「专注后训练 + 长程任务」的公司,它们的护城河会被 ICL 部分侵蚀。但不会消失——Skild 自己承认 S1 在 2,000 个后训练样本下仍输(66% vs 86%)。对于工业级精度(95%+)和高 cycle rate(10 Hz+ 控制),传统 fine-tune 仍更优。
🪨 七、66% 这个数字的 6 层不确定性
不要被单数字带跑。66% 这个结果至少有 6 层不确定性需要拆开看:
1)单步成功率 ≠ 端到端成功率
10 分钟任务约 30-60 步,0.66³⁰ ≈ 1.6×10⁻⁵。如果 Skild 用的 60-80% 是真的,那是几何级衰减被打断了——大概率是用了「人介入恢复失败步骤」。这意味着 S1 在严格自主模式下端到端成功率可能只有个位数。
2)4 个 demo 任务是挑选过的
换盆、煎饼、手冲咖啡、套件装配都有共同特征:长接触、慢节奏、可恢复。它们不是「抓飞过来的球」或「穿针引线」这种密集 dexterous 任务。Skild 没说哪些任务 S1 跑不出来。
3)内部 benchmark 没有公开
Trial counts、error bar、跨本体泛化(人形 vs 机械臂 vs 四足)全是黑盒。「66%」是一个均值,不是分布。
4)第三方评测基本缺位
主流具身评测(Meta-World、Safety Gym、RoboCasa、Behavior-1k)都没看到 S1 的提交。这个 66% 没法跟同行横比。
5)权重未公开
任何独立机构想复现 S1 都得等 OEM 合作伙伴配合,目前没这条路径。
6)商业利益冲突
Skild 刚融 14 亿美元、估值 140 亿美元,有强动机发一个漂亮数字而不是稳健数字。这跟当年 GPT-3 发布时 OpenAI 的位置完全一样——但 GPT-3 至少放了 paper 和 weights。
🚪 八、对中国具身公司的启示
中国 8 月 WRC 的几家公司(银河通用、原力灵机、自变量、千寻、星动纪元)走的都是「VLA + 后训练 + 场景落地」路线。Skild S1 出来后,几个具体动作值得做:
短期(3-6 个月)
- 把内部 benchmark 跑全:包括「未在训练集的任务」、「跨本体任务」、「扰动 5 级梯子」。如果自家模型在 100 小时规模上语言 VLA 也跑出 50% OOD,那就不用急着追 ICL。
- 录一段 11 分钟换盆视频,喂给自家模型,看能不能跑出来。这是验证 S1 范式是否真普适的最快方法。
中期(6-12 个月)
- 如果决定跟 ICL 路线,准备 100,000 小时级别预训练数据预算。这是中国厂商当前差距最大的地方——大多数公司在 5,000-50,000 小时之间。
- 把数据预算从「采集 70% + 过滤 30%」翻成「采集 25% + 过滤 75%」。这要重建数据团队结构。
长期(12-24 个月)
- 跟国内 OEM(埃斯顿、绿的谐波、汇川)谈类似 ABB/UR/MiR 的合作。这条路 Skild 已经开了头。
- 准备「视频 prompt 服务」这个新商业模式。如果 ICL 成立,未来具身公司的收入结构会从「卖模型许可证」转向「按视频上传次数收费」。
🌟 十、结语:66% 还在飞,但飞的方向对了
把 Skild S1 拉远一点看,它其实在回答一个比机器人更大的问题:通用智能的边界,到底是用「数据规模」撑起来,还是用「模型架构」撑起来?
LLM 圈已经选了前者——GPT-3 之后所有能力跃迁都跟数据规模挂钩。具身圈过去三年赌的是后者——Octo、π0 都强调架构创新。Skild S1 是第一次把具身圈明确拉到「数据规模为王」的轨道上,而且用 ICL 这个 GPT-3 风格的能力演示作为证物。
这未必对。66% 这个数字太弱,无法支撑「数据规模为王」的强结论。但它开了一个非常有意义的口子:具身 ICL 是可工程化的,不是 PPT 概念。
未来 6 个月真正值得看的是三个数字:
- Skild 工业部署 6 个月后的端到端任务成功率(不是单步);
- 是否有第三家厂商(不是 Skild)独立跑出 OOD 任务 50%+ 单步成功率;
- 中国厂商 100,000 小时预训练规模何时追平 Skild。
这三个数字中任何一个发生,都会改写具身智能的下一轮估值锚点。
信源
- Skild AI 官方博客(2026-08-25):S1 公告与 4 个 demo 视频
- Humanoids Daily(2026-08-26):5 级扰动测试细节与 ICL scaling law 解释
- DataNorth AI(2026-08-26):评测可信度审计(最弱证据等级判断)
- ExplainX(2026-08-26):66% / 60-80% 完成率口径分析
- 36 氪(2026-08-26):Deepak Pathak + Abhinav Gupta 背景与估值变化
- TestingCatalog(2026-08-26):100,000 小时对照与 380 个后训练样本换算
- FutureTools(2026-08-25):多源新闻聚合(OpenAI Bel、Anthropic Memory、NemoClaw 漏洞等同期事件)
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。