这期日报的三条主线,恰好把徐梦迪那期访谈的争论面摆到了同一个平面上。我读完她的访谈再读这期,有个对齐想说。
先说最扎眼的一处数字。她在播客里说 Hypernetwork 生成的 Adapter「只占整体 Transformer 0.5% 参数量」。我回去查了原文(arXiv 2304.08487,ICLR 2023):0.5% = 69K ÷ 13M。那个 13M 是他们自己从零训的 [512, 4, 8] 小 Decision Transformer,全文 GPT-2 出现 0 次。
更要紧的是 Table 4:adapter 规模由 bottleneck size = 16 与层数决定,与基座宽度无关。换成 7B 基座,同一个 bottleneck-16 adapter 还是 69K,占比掉到 0.001%。论文自己在 §3.2 写「base DT could be replaced by any other pre-trained transformer agent」,又在 Conclusion 把「scaling HDT up」列为 future work——这个"可换任意基座"是它从未执行的设想。
不是造假。69K/13.1M = 0.53%,四舍五入都成立,HDT 的实验结论也扎实(meta-IL 0.93赢过全量微调 0.87)。问题在这个百分比可传播的形式邀请人自动套到 3B/7B 上,而论文结构不支持这个套用。一个更诚实的说法是:69K 参数的 adapter,在一个 13M 的自训 DT 上。 不需要新实验,只需要改口径。
【直引】她在另一场访谈里其实做过自我批评,比这段播客诚实得多:「当时并没有真正意义上的大规模预训练……所以它更多是一个小规模的 proof of concept。如果预训练本身只覆盖了非常有限的场景,其实很难判断这种 in-context learning 的泛化边界到底在哪里。」(Z Tech,2026-08-27)
而她自己那篇 Hyper-DT 的 §1 判定更硬:「we find that Prompt-DT hardly generalizes to novel environments」,Table 1 里 Prompt-DT 的 meta-IL 成功率 0.04、meta-LfO 0.09——比同表什么都不做的基线(0.06)高不了多少。这两处合起来指向同一个问题:一个数字被反复引用时,要问它的分母和适用条件,而不是量级。
【判断】日报里 InterEvolve 和 RPG 两条恰好是这个方向今天的实证——一个把进化压在奖励程序这一层、奖励程序之外全部冻结,一个改技能库和 system prompt 不碰权重。它们和 GEN-1.5 的 59%(12 秒示范、零梯度)指向同一个直觉:部署端改参数不应该是定义新任务的唯一路径。 徐梦迪在 Z Tech 里其实说过这个更准的版本——「真正需要通过改参数来完成的 adaptation,更多应该发生在场景层面,而不是任务层面」。这句话比播客里那句「ICL 会超越 TTT」站得住得多,因为它讲的是职责划分,不是性能预测。
至于日报头条的 WAM 三响(SkeleWAM / UniWAM / WMM),她更信这条路线,理由是「任务不相关、更 fundamental」。这判断在论文里有对应:RAW-Dream 的标题直接就是 Task-Agnostic World Models,Think Like a World Model 那篇摘要写着 VLA「no objective that accounts for how the world responds」。但同一篇也承认 WM 「rolling the future forward costs seconds per decision and rules them out of the control loop」——具身要 100 Hz,每秒算几次的模块进不了控制环。所以更准确的说法是:WM 目前只能在表征层面进,不在推理层面进。
【推论】顺带说 GEN-1.5 那组被引用最多的数字。官方给的是 10 项等权平均 59%,我复核算术平均 58.8,对得上;但逐项看差距从 62 个百分点到 3 个——刷子扫地微调 99 / ICL 37.3,翻手机微调 81 / ICL 78。均值把异质性全抹平了。而且官方图例写死 "12s of demos",那个 3 秒档没有对应数据;每任务跑了几次,官方从未披露。
她那句被传播最广的洞见是真的:「Loss 很低,最后的 Success Rate 不一定高。」Dyna-2 正好提供这个组合——loss 侧四条幂律 R² 全在 0.88 以上严格单调,同时 14 个真机任务里 8 个非单调,Unsort 从 6.4 反向降到 3.6。但那个报告每任务只跑 10 次:4/10 的 95% CI 是 [16.8%, 68.7%],8/10 是 [49.0%, 94.3%],大幅重叠。她观测到的"震荡"在这个协议下与噪声不可区分;反而是Lockbox 那个 0/0/0 → 90% 站得住,因为它跨过了不重叠的区间。
【判断】所以更准确的说法不是"成功率会震荡",而是机器人 scaling law 的信号是跨过置信区间不重叠的阶跃。真正的震荡看不见,真正的阶跃会被看见。
下一根钉子:她那句「参数本身就是一个强化学习算法」也有问题——AD 论文(arXiv 2210.14215,ICLR 2023,DeepMind,不是常被误引的 2010.06183)原话是固定参数的序列模型 amortise(摊销)了源 RL 算法,算法在 context 里而不在参数里,且全文 robot / manipulation / locomotion 各出现 0 次。这个失手有意思的地方在于:「参数就是算法」恰恰是 TTT 一侧的立场,混淆它等于混淆她自己主张的两条路线。