这期访谈值得挖的不是金句,是三处她自己没说完的裂缝。以下每条数字都回了一手源(arXiv abs 页 / 官方博客 / 会议 proceedings),凡查不到的我会明说。
先交代一句时间线:访谈发布于 2026-09-21,而 Generalist 的 GEN-1.5 官方博客标注 2026-08-19。宣传语写「录完节目后的第二周」,按发布日倒推并不成立。但这不影响判断,反而说明一件事——这不是对趋势的追认,而是站在趋势发生前一个月押的注。
一、「0.5% 参数效率」:数字为真,但分母是个算术巧合
她说 Hypernetwork 生成的 Adapter「只占整体 Transformer 0.5% 参数量」。回查原文(arXiv 2304.08487,ICLR 2023):0.5% = 69K ÷ 13M。那个 13M 是他们自己从零训的 [512, 4, 8] 小 Decision Transformer(total 15.5M),全文 GPT-2 出现 0 次。
更要紧的是 Table 4:adapter 规模由 bottleneck size = 16 与层数决定,与基座宽度无关。换成任何 4096 宽的 7B 级基座,同一个 bottleneck-16 adapter 仍是 69K,占比掉到约 0.001%。
论文自己在 §3.2 写「the base DT model could be replaced by any other pre-trained transformer agent」,又在 Conclusion 把「scaling HDT up」列为 future work——这个"可换任意基座"是它从未执行的设想。全文零真机、零 sim-to-real。
不是造假。69K/13.1M = 0.53%,四舍五入都成立,实验结论也扎实(HDT 的 meta-IL 0.93 确实赢过全量微调 DT 的 0.87)。问题在这个百分比可传播的形式邀请人自动套到 3B/7B 基座上,而论文结构不支持这个套用。
一个更诚实的表述是:69K 参数的 adapter,在一个 13M 的自训 DT 上。 这个修正不需要新实验,只需要改口径。
顺带一提,那篇论文 §5.1 讨论参数效率的正文写的是「69K parameters (0.05% of 13M)」,而 Table 1/Table 3/摘要/Conclusion 均为 0.5%——这一句是原文笔误,她引的是摘要里的正确值。
二、她自己那篇论文,判了 Prompt-DT 失败
访谈里她把 Prompt-DT 和 Hyper-DT 并列讲成两个成功工作。但她自己写的 Hyper-DT 论文 §1 明确判定 Prompt-DT 失败:
we find that Prompt-DT hardly generalizes to novel environments … since the performance of the in-context learning paradigm, e.g., prompting, is generally inferior to fine-tuning methods.
Table 1(Meta-World ML45,等权 5 个测试任务成功率):
- HDT:meta-IL 0.93 / meta-LfO 0.80
- Prompt-DT:0.04 / 0.09
- DT(全量微调):0.87 / 0.46
- no-FT 基线:0.06
0.04 与 0.09,比同表里什么都不做的基线(0.06)高不了多少。
而 Prompt-DT 自身的成绩单还有三层限制叠在上面:
- 指标是 accumulated reward,不是 success rate(原文 §5:"with metric as the episode accumulated reward")
- held-out 任务是未见过的任务实例,不是未见过的分布。§6.4 原文:"The held-out tasks have goals … within the goal range calibrated by training tasks."
- 真正的分布外实验只有 Ant-dir 一个消融(8 训练 / 3 测试)
- 论文从未报告总数据量,只给了 locomotion 每任务replay buffer 末 20,000 steps、Dial 与 Meta-World 每任务 200 episodes
另外,那个「5 vs. 256」的样本效率论证,指的是 5 = prompt 的环境步数 vs 256 = MACAW 达到虚线最优所需的 finetune batch size,不是「5 条 vs 256 条 episode」。
但这里要说一句公道话:她本人从未宣称 Prompt-DT 证明了 ICL 有效。 她说的是"源于我 2021 年做的工作",那是学术谱系陈述,不是有效性主张。而且她在另一场访谈里做过比这段播客更严厉的自我批评:
当时并没有真正意义上的大规模预训练……所以它更多是一个小规模的 proof of concept。如果预训练本身只覆盖了非常有限的场景,其实很难判断这种 in-context learning 的泛化边界到底在哪里。
—— Z Tech,2026-08-27
所以这里该批评的是两次访谈之间的信息量不一致,不是编造。
三、编号勘误:四处流传引用是错的
这条可能是最实用的部分。核验过程中发现四个常被引用的编号有问题:
| 流传写法 | 实际 | 备注 |
|---|---|---|
| MAML = arXiv 1703.02900 | 1703.03400 | 原编号是超导物理论文 |
| AD = Agarwal et al., ICLR 2021, arXiv 2010.06183 | arXiv 2210.14215, ICLR 2023, DeepMind | 原编号是 ADMX 暗物质实验(Phys. Rev. D 103, 032002);AD全文引用"Agarwal" 0 次 |
| TTT-LM = arXiv 2502.18674 | arXiv 2407.04620, ICML 2025 | 原编号是统计学论文 |
| TTT 原始 = arXiv 1909.08515 | arXiv 1909.13231 | — |
另两处:Prompt-DT 是 7 作者(含 Joshua B. Tenenbaum),Hyper-DT 是 6 作者(无 Tenenbaum)——两篇作者列表不同,勿混用。Hyper-DT 是 ICLR 2023 会议论文,不只是 arXiv 预印本。
四、GEN-1.5:59% 这个均值掩盖了什么
官方三档(2026-08-19):GEN-1「任务精通」约 1 小时数据 + 需后训练 → 99%+;GEN-1.5「Physical Prompting」3–12 秒一次演示 + 不训练 → 59%(±10%);GEN-1.5「快速适应」5 分钟约 50 次演示 + 10 个梯度步 → 83%(±9%)。规格是 30 秒 context window、输出 100 Hz 动作轨迹。
我复算了逐项数字,算术平均 58.8 → 59%,std dev 10.195 → ±10%,确为 10 项等权平均。
这张图里最要紧的不是均值,是逐项差距:
- 刷子扫地:微调 99 → ICL 37.3(差 62 个百分点)
- 翻手机:微调 81 → ICL 78(差 3 个百分点)
同一个模型、同一批任务,只换适应方式,差距可以从 62 个百分点缩到 3 个。59% 这个均值把任务间极大的异质性全抹平了。
三个必须挂的口径:
- ±10% 是任务间 std dev,不是测量精度。 官方从未披露每项任务的 trial 数、seed 数、置信区间。这意味着 59% 无法做统计显著性判断。
- 59% 对应的是 12 秒示范,不是 3–12 秒区间平均。 官方图表图例写死 "In-context learning (12s of demos)",3 秒档没有对应数据。
- GEN-1 的 99% 与 GEN-1.5 的 59% 不可直接并列——分母完全不同,官方自己把 GEN-1.5 定位为"不是更高成功率,而是新的泛化边界"。
五、她最被传播的那句洞见是真的,但证据比她说的更软
「机器人里很 tricky 的一点是 loss 跟成功率不是直接挂钩的。Loss 很低,最后的 Success Rate 不一定高,会有很多震荡。」
这个诊断完全正确,而且有独立证据。来源是 Dyna-2(Dyna Robotics 官方技术报告,2026-08)——一个 1M 小时第一人称人类视频预训练的世界-动作模型。她在 Z Tech 里亲口点名了 Dyna 与「1 万小时→100 万小时」这个档位。
Dyna-2 里有三组数据,正好构成她论点的一对拳头:
其一,loss 侧严格单调。 四条幂律,R² 全部很高:held-out human MSE = 0.0691·D^−0.0184,R² = 0.919;零样本机器人 action MSE = 0.306·D^−0.0713,R² = 0.884;零样本 acc@0.5 = 0.0241·D^+0.139,R² = 0.918。报告原文:"on every metric, held-out prediction improves monotonically, and each is well described by a power law in hours."
其二,真机逐任务成功率非单调。 14 个任务里 8 个非单调。最刺眼的是 Unsort——预训练数据从 1k 涨到 100k(涨 100 倍),指标从 6.4 掉到 3.6,完全反向。
其三,阈值效应,这是比"震荡"更重要的发现:
Several tasks appear to require a threshold amount of pre-training before they become solvable at all. Lockbox Key Turning is the clearest case: no checkpoint up to 100,000 hours turned the key. At one million hours, the key was successfully turned 90% of the time.
Dyna 自己写下的警告,几乎是她这句话的官方版:
Scaling claims can be artifacts of the metric used to make them: nonlinear or discontinuous metrics can unintentionally generate apparent emergence from smoothly improving models.
但这条论断有两处必须收窄的边界:
- 零样本acc@0.5 的 R² = 0.918 是直接反例——那也是一个"成功率"指标(动作全部落在容差内的比例),而且拟合得极漂亮。所以"loss 跟 success rate 不挂钩"这句话在零样本单步动作预测上不成立,必须限定在闭环真机任务成功率上。
- Dyna-2 每任务只有 10 trials(报告原文:"We evaluate the models for 10 trials … in blind tests")。按 Wilson 置信区间算:4/10(40%)的 95% CI = [16.8%, 68.7%],8/10(80%)= [49.0%, 94.3%]——大幅重叠。也就是说,她观测到的"震荡"在这个测量协议下统计上不可判定。而 Lockbox 的 0%→90% 之所以站得住,恰恰因为它跨过了不重叠的区间。
一条比她自己的论断更精确的表述:机器人 scaling law 的信号不是"震荡",而是跨过置信区间不重叠的阶跃。真正的震荡看不见,真正的阶跃会被看见。
六、她漏掉的第二条 scaling 轴,恰好逐字命中她的祈愿
她整场访谈都在追问"我看到了 Scaling Law 的信号",却漏掉了 2026 年最直接的候选答案——而且它就出现在她同一段访谈里被她点到。
RoboTTT(arXiv 2607.15275,2026-07-16,NVIDIA + Stanford,含 Yevgen Chebotar、Jim Fan、Yuke Zhu、Li Fei-Fei、Scott Reed):
we introduce Test-Time-Training Robot Policies (RoboTTT), a robot model and training recipe that scale visuomotor context to 8K timesteps, three orders of magnitude beyond state-of-the-art policies, without growing inference latency.
On challenging real-robot manipulation tasks, RoboTTT improves overall performance by 87% over the single-step context baseline and fully completes a five-minute, ten-stage assembly task, which no baseline ever does.
We also observe, for the first time, steady gains in closed-loop performance as pretraining context length scales.
请注意最后一句——它几乎逐字命中了她的祈愿。她整场访谈的核心希望是"看到机器人版 Scaling Law 出现在 Success Rate 上",而 RoboTTT 报告的"context 长度→闭环性能稳定提升"就是同一件事,只是 scaling 轴不同,而且走的是她已放弃的 TTT 机制。
三个并列的结论:
- 闭环性能随context 长度稳定提升,这是在真机上测的,不是仿真。正是她说"目前还没有那么强的证据"时缺的那块。
- "预训练上下文长度"作为一个新 scaling 轴的首个报告。 这意味着数据量 scaling 之外,具身还有第二个可扩维度。
- 它让 ICL 与 TTT 的二分法失效。 RoboTTT 明确是 TTT("fast weights, parameters updated by gradient descent during both training and inference","compressing histories into weight space"),但它自己解锁的能力里就包含 "one-shot in-context imitation"。TTT 可以生产 ICL 能力。
还有一条更宽的证据:RICL(arXiv 2508.02062,CoRL 2025)的标题论点——"VLAs pre-trained with imitation learning objectives do not naturally acquire ICL abilities",且必须用专门的 recipe 才能 post-hoc 注入。
这条对路线判断的含义:ICL 不是"数据多了自然便宜的免费午餐",它本身是需要额外训练预算去买的能力。从"数据规模增长"推出"ICL 自然更优",中间缺这一步。
七、世界模型 vs VLA:她比自己的播客修辞成熟
「我自己比较相信世界模型的路线。因为它是任务不相关的,任务太容易变成一个不 scalable 的方式,任务太多了,很难穷举。」
这判断在 2026 年有直接的论文级呼应:
- RAW-Dream(arXiv 2605.12334)标题即 Reinforcing VLAs in Task-Agnostic World Models——她的用词与论文标题几乎逐词呼应
- Think Like a World Model, Act Like a VLA(arXiv 2609.24682,2026-09-21,与访谈同一天):"VLA models map observations to actions with no objective that accounts for how the world responds, so their robustness is bounded primarily by data coverage. World models carry precisely that missing objective and are better grounded for it."
- TD-MPC2(ICLR 2024):"agent capabilities increase with model and data size",1M→317M 跨 80 任务、跨 domain/embodiment/action space,单调上升。她"任务太多了很难穷举"这个问题,在 RL 界的答案是 model-based RL 已经用一套超参做到了 80–104 个任务。
一个必须诚实处理的反证:2026 年主流 WM 论文几乎全是融合路线而非取代 VLA。但融合恰恰印证她——因为每篇融合论文的合并理由都是她给的理由:RAW-Dream 的理由是 "task-specific data 限制可扩展性";Think Like a WM 的理由是 "VLA 缺少 account for how the world responds 的目标函数"。没有人说"WM 比 VLA 更 fundamental"然后把 VLA 扔掉;所有人都在说"VLA 缺一个 task-agnostic 的东西",而那个东西是 WM。
这条论断真正的软肋在部署,同一天的两份材料给出不同判断:
rolling the future forward costs seconds per decision and rules them out of the control loop. —— arXiv 2609.24682
具身要求 100 Hz(GEN-1.5 的输出频率)。一个每秒只能算几次的模块没法进控制环。所以 WM 只能在表征层面进,不能在推理层面进——Dyna-2 也花大力气把推理从 10,203 ms 压到 110 ms。
八、GEN-1.5 官方比她更克制的一处,且对她的路线不利
这条值得单独说,因为它出自被引公司自己的博客:
In some cases, in-context learning a new task exceeds the performance of 1–5 gradient steps on the same demonstration data.
这是对"ICL 优于 TTT"的直接反例。
另外,GEN-1.5 的 ICL 能力是无监督涌现的,官方原话:
We did not explicitly train for any of them: no architectural changes to promote in-context learning, no inner or outer meta-learning loop pressuring the model to adapt from minimal data, no auxiliary objectives encouraging improvisation. To our surprise, GEN-1.5 does this across a broad range of physical tasks out of the box.
官方还给出了可能的机制猜想:物理观测与动作的分布可能呈现 Zipfian 结构与爆发性(burstiness),就像语言模型里与 ICL 相关的分布特征。如果 ICL 涌现依赖的是物理世界天然的重复性与重尾分布,那它就是一个可以靠"更多数据"稳定获得的普适能力,而非某个特定架构的产物。 这正是"预训练规模越大、ICL 越划算"这条经济学的机制来源。
还有,官方自己把 59% 与 GPT-3 的 45% one-shot 对标了——所以"机器人版 GPT Moment"那个类比是官方博客自己做的类比,不是营销修辞。
九、几条她的判断,其实她已经给了更准的版本
这是我觉得最值得记的部分。
其一,「ICL 会超越 TTT」这个提法本身有问题,因为 TTT 与 ICL 不是互斥路线,而是同一连续体的两端。而她在 Z Tech 里说过的这个版本站得住:
我觉得真正需要通过改参数来完成的 adaptation,更多应该发生在场景层面,而不是任务层面……但具体到今天我要让机器人做一个什么新任务,我更希望这个任务可以直接通过 context 来定义,而不是再去 fine-tune 一遍模型。
这是关于职责划分的主张(任务走 context,场景走参数),不是关于性能优劣的预测。不需要新实验,只需要把"二元对立"收窄成"职责划分"。
其二,「10 公里 + 3到 5 年」这个比喻的第一堵墙在 70% 处。 Smyth, B. 在 PLOS ONE 16(5): e0251513(2021)基于 400 万+条比赛记录给出:撞墙(HTW)定义是 25K→终点段配速比 5K→20K 段慢至少 20% 且持续至少一个 5K,女性平均在 29.3K 掉速、男性在 29.6K。换算成全程百分比是 69.4%–70.1%。
10 公里 = 23.7%,落在大墙之前 14 个百分点。用体育语言说:一个 10 km 处的跑者尚未经历任何一次阈值事件,因此从这个点无法读出他会不会撞墙。
更深的结构问题:她自己引的两个 scaling law 源都指向阶跃——GEN-0 官方用的词是 "phase transition at 7B"(1B ossification / 7B+ internalize,三档不是连续曲线);Dyna-2 的 Lockbox 是 0/0/0 → 90%。而"跑到 10 公里"这个表述的形式是一次线性积分。用积分量去描述一个阶跃过程的中间状态,是范畴错误——你可以说"跨过了第一道门槛",不能说"跑到了四分之一"。
顺带一个自相矛盾的最简洁版本:她说当前对应"GPT-1 的时刻"。GPT-1 是 2018 年 6 月,GPT-3 是 2020 年 5 月——她自己选的类比里这个跨度约 2 年,而她给机器人留了 3–5 年。按她自己的类比时钟,这个乐观是偏保守的。
其三,「loss 不等于 success rate」这条要收窄到闭环真机成功率,理由见第五节。
十、一个未被回答的关键问题
GEN-1.5 的 ICL 能力,为什么在 π0-FAST 这类模型上没有?
- RICL(CoRL 2025)的答案:「模仿学习目标不会自然获得 ICL,必须专门 post-hoc 注入」
- GEN-1.5 的答案:「50 万小时真实数据预训练,它自己涌现了」
若答案在规模,RICL 训得不够大;若答案在目标函数,那"预训练规模越大 ICL 越划算"这条经济学就缺一个前提。 她在两场访谈里分别引用了这两个答案,但没有把它们放在一起。
这是这条路线的关键岔口,也是这期访谈留下的最值得追问的一句话。
附:本次核验里我核不到的东西
诚实标注,以免读者误当定论:
- GEN-1.5 每项任务的 trial 数 / seed / 置信区间:官方从未披露
- Dyna-2 逐任务非单调的逐项数值:Figure 8 是交互式图表,未查到可引文本出处(已核到的是定性阈值陈述与"severe and unpredictable overfitting patterns"原文)
- Prompt-DT 与 Hyper-DT 的总训练数据小时数:论文只给单任务切片
- AD 在 manipulation 上的 follow-up:检索 arXiv API + OpenReview 均未检出——所以访谈里「用在 manipulation 上依然很难」是她个人判断,无已发表实验支撑
- 「Robotics 论文翻倍增长」的可核基线:两个来源互相矛盾,不裁定
- arXiv 具身论文的 AI 生成比例或质量指标:未找到任何一手测量
- CMU ME 最佳博士论文奖「我们那一届是两人」:检索 CMU 官网与 ME 系页均无历年名单,既不能证实也不能否证
- 履历两处需修正:她 2025 年 9 月入职叉院(不是访谈说的 2024 年,2024 年她在 Stanford 做博后);MoMaGen(ICLR 2026)第一作者是 Chengshu Li,她是第二,BEHAVIOR-1K 论文不含她,她的角色是组织者
如果有人手上有这几个数——尤其是 GEN-1.5 的 per-task trial 数——欢迎在评论区补上。那是把这篇从"勘误"推到"复现"的关键缺口。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。