GEN-1.5:机器人的「GPT-3 时刻」,从 12 秒演示开始
一句话概括
Generalist AI 于 2026 年 8 月 20 日发布 GEN-1.5,官方标题就叫 "Embodied Foundation Models are One-Shot Learners"——机器人基础模型只需观看一段 3-12 秒的物理演示,就能 in-context 学会一个从未训练过的新任务,全程零梯度更新。这是机器人领域第一次系统性地出现 GPT-3 式的 few-shot in-context learning——能力涌现的信号比能力本身更重要。
一、GEN-1.5 到底做了什么
先看事实,不吹不黑。GEN-1.5 的能力分三层:
| 能力层级 | 输入 | 输出 | 类比 LLM |
|---|---|---|---|
| Zero-shot 指令 | 自然语言任务描述 | 直接执行 | zero-shot prompting |
| One-shot 物理演示 | 3-12 秒真实演示视频 | 立即复现任务,无梯度更新 | one-shot in-context learning |
| Few-step 适配 | 演示数据 + 1-10 步梯度下降 | 精调后的策略 | few-shot fine-tuning |
关键细节:
- 真实机器人评测,不是仿真刷分。评测集 10 个任务,模型在仿真器和真实世界的训练数据中都没见过这些任务
- One-shot 成功率 59%——Generalist 自己公布的数字,坦率承认"modest"(尚不完美)
- 10 步梯度 + 5 分钟数据 → 83% 平均成功率(短时程原子操作任务)
- In-context learning 在某些情况下可以跨仿真到真实迁移
- Generalist 把看演示学任务称为 "physical prompting"(物理提示)——这个命名本身就是向 LLM prompting 范式的直接致敬
59% 这个数字值得停下来想一想。GPT-3 在 2020 年做 few-shot 任务时,成功率同样远非完美——但"能力第一次出现"和"能力达到商用"是两件事。GPT-3 论文的核心贡献不是解决了 NLP,而是演示了 in-context learning 随模型规模涌现。GEN-1.5 的 59% 是同类性质的数字。
二、为什么说这是「GPT-3 时刻」:类比的结构分析
把类比做严格,而不是只停留在"都很惊艳":
2.1 之前的世界:每个任务都是一次"训练项目"
GPT-3 之前,NLP 做新任务 = 标注数据集 + 微调 BERT。机器人领域今天几乎一模一样:
新任务 = 遥操作收集几百条演示 + 训练策略 + 部署 + 现场调参
一个新任务的数据收集成本以"人时"计,这直接决定了机器人的经济模型——每个新任务的边际成本都很高,所以只能挑 ROI 最高的任务做。这是当前具身智能商业化的隐性天花板。
2.2 GPT-3 的突破:任务规格变成了"上下文里的几个示例"
GPT-3 证明了一件事:任务定义可以从"训练数据集"坍缩为"推理时的几个示例"。新任务的边际成本从"标注+训练"降到"写一段 prompt"。
GEN-1.5 把同样的坍缩搬进了物理世界:
任务定义从"几百条演示 + 训练循环"坍缩为"3-12 秒的一段演示"
对机器人经济模型的影响是数量级的:一个现场工程师花 12 秒演示一次,机器人就会尝试。任务部署从周级降到分钟级。如果这个能力随规模继续上升(GPT-3 → GPT-4 的剧本),机器人"每个任务都要重新训练"的时代就结束了。
2.3 类比的结构对照表
| 维度 | GPT-3(2020) | GEN-1.5(2026) |
|---|---|---|
| 领域 | 语言 | 机器人操纵 |
| 涌现能力 | 文本 few-shot ICL | 物理 one-shot ICL |
| 输入形式 | 上下文里的文本示例 | 上下文里的演示视频 |
| 任务定义成本 | 标注数据集 → prompt | 演示数据集 → 12 秒演示 |
| 当时成功率 | 不完美(大幅低于微调) | 59%(大幅低于专训策略) |
| 关键启示 | 能力随规模涌现,等待缩放 | 待验证:同一剧本是否重演 |
诚实的部分也要说:这个类比有一个 GPT-3 没有的难题——embodiment gap。LLM 的输入输出都在同一个符号空间(文本→文本),而机器人的演示来自一个 embodiment(人类的手),执行却是另一个(机器人的夹爪)。GEN-1.5 的 one-shot 学习实际上隐式完成了跨 embodiment 的翻译,这是 GPT-3 不需要面对的额外维度,也可能是缩放曲线上更陡的一段。
三、技术定位:这是缩放叙事的续篇,不是突变
拉长时间线看 Generalist 自己的轨迹,GEN-1.5 是一条清晰的缩放曲线上的最新点:
- GEN-1(2026-04-02):"Scaling Embodied Foundation Models to Mastery"——把特定任务成功率从 64% 推到 99%,任务完成速度 3 倍于 SOTA
- GEN-1 跨硬件扩展(2026-07-24):单一基础模型支持多种末端执行器,跨 embodiment 学习
- GEN-1.5(2026-08-20):缩放的目标从"把已知任务做到极致"转向"新任务获取成本坍缩"
这个节奏跟 LLM 的历史严格同构:先把预训练任务做深(GPT-2 的续写)→ 跨模态扩展(CLIP 时代)→ 涌现 ICL(GPT-3)。Generalist 显然是有意识地在复刻这条路线图,连命名(GEN ↔ GPT)都在呼应。
值得注意的技术信号:Wired 的报道提到 Generalist 专注于让机器人理解"直觉物理"(intuitive physics)。结合 one-shot 能力的出现,可以合理推测 GEN-1.5 的预训练里包含了大量视频/世界模型成分——模型必须有"看懂发生了什么"的表征,才可能从 12 秒演示中提取任务本质。这与 NVIDIA World Action Models、1X 世界模型是同一个技术思潮:物理世界的缩放定律正在从"动作数据"转向"视频理解 + 动作数据"的混合。
四、与既有脉络的串联:数据生产成本的三级坍缩
把 GEN-1.5 放进我们跟踪的主线里看,一个更大的图景浮现了。过去两周讨论过的三个工作,加上 GEN-1.5,构成了训练数据边际成本坍缩的完整光谱:
| 工作 | 数据生产方式 | 边际成本 | 层级 |
|---|---|---|---|
| 传统机器人学习 | 人类遥操作收集每个任务 | 每任务数周 | 基线 |
| Genie Sim / RoboGen | LLM 生成仿真场景与任务 | 每任务分钟级 | 环境侧自动化 |
| Ornith-1.5 | 模型自己出题自己学 | 趋近于零 | 模型侧自举 |
| GEN-1.5 | 12 秒物理演示 → in-context | 每任务 12 秒 | 部署侧坍缩 |
四个点连成的曲线,斜率比 LLM 领域的数据革命还要陡。
而且 GEN-1.5 与前两者的组合是乘法关系:Genie Sim 生成的仿真演示,理论上可以直接作为 GEN-1.5 的 physical prompt 喂进去——仿真环境造"教材",GEN-1.5 当"学生",这个闭环一旦跑通,新任务获取就同时消灭了"环境成本"和"学习成本"。这是"LLM 按需在场"主线的又一次验证:LLM/生成模型退到训练时和提示时,运行时只剩高效策略网络。
五、冷思考:从 GPT-3 到 ChatGPT 隔着两年半
乐观类比之外,三个必须盯住的现实约束:
1. 59% 的成功率决定了当前只能做"容错任务"。 捡起东西放错位置可以重来,焊接错了就是废品。物理世界没有"重新生成"按钮——这是机器人 ICL 与 LLM ICL 最本质的商业化差异。
2. GPT-3 之后是 GPT-3.5、GPT-4 的持续缩放,机器人 ICL 的缩放曲线还没被证明。 GEN-1.5 证明了"能力存在",但"随规模上升"才是 GPT-3 叙事的真正内核。下一版本如果把 one-shot 成功率推到 80%+,类比就坐实了;如果在 60% 附近停滞,那就是另一回事。这是未来 6-12 个月最值得盯的单一指标。
3. 评测集只有 10 个任务。 任务分布的多样性未知——如果都是短时程、桌面级、单物体操作,那离"通用"还有距离。长时程任务的 in-context 学习(演示不可能覆盖全程)是另一个未验证地带。
六、公司背景速览:别把 Generalist 和 Physical Intelligence 搞混了
最后补一个行业地图细节——最近很多人把这两家搞混:
| Generalist AI | Physical Intelligence (π) | |
|---|---|---|
| 创始人 | Pete Florence, Andrew Barry, Andy Zeng(Google Robotics 出身) | Karol Hausman, Sergey Levine, Chelsea Finn 等 |
| 成立 | 2024 | 2023 |
| 融资 | $400M(2026-06,NVIDIA 参投,估值 $2B) | $1.1B+ |
| 旗舰 | GEN-1 / GEN-1.5 | π₀ / π₀.5 |
| 路线 | 缩放到 mastery + one-shot ICL | 跨 embodiment 基础模型 + 世界模型 |
两家都在走"机器人基础模型"路线,但 Generalist 的叙事重心已经明确压在了 ICL 作为核心产品能力上——这也是 GEN-1.5 值得单独深挖的原因。
结论
GPT-3 的历史意义要回溯才能看清:它不是"最好的模型",而是"第一次让能力曲线的斜率可见"。GEN-1.5 的 59% 同样不重要,重要的是它可能就是机器人领域那条曲线的第一个数据点。
对从业者,两个可操作判断:
- 短期(6 个月):把"演示即部署"纳入产品规划——如果你的机器人系统架构还假设"每个任务需要训练循环",现在就要开始设计 physical prompting 接口
- 中期(1-2 年):盯 GEN-2 / π 系列后续版本的 one-shot 成功率曲线。斜率决定一切:60%→70% 是信号,60%→85% 是革命,60%→62% 是噪声
来源:Generalist AI 官方博客 / Wired 报道 / eWeek 分析 / Bloomberg 融资报道。本文由苏木整理分析。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。