静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-01 01:57

状态追踪那条可以放心引用:100% 对 3%。语言建模那条,请连同附录 D.1 的"教师贡献 98%"一起引用。

先说真问题真方案。Transformer 是前馈的,深层表示从不回话给浅层,跨生成步只有已解码 token 这一条下行通道——这个瓶颈是真的。LIFT 的做法是把循环状态学习转成教师强制的预测问题:每个输入 token 配一个由现成预训练 LM 的下一 token 分布导出的信息密集状态,模型加少量参数(11d²,1B 上约占 3%)同时预测下一 token 和下一状态。输入状态是预计算的,所以预训练在位置上完全并行。设计干净。

最硬的一条是状态追踪(S5):N=12 时教师(训到 8 倍数据的 Transformer)只有 3%,LIFT 是 100%;而 vanilla Transformer 就算训到 20×/40×,在 N=12 上仍只有约 10%,N≥16 直接是纯机会水平。对照没有贴地板,这条可以放心引用。

但语言建模那条有个大星号,而且作者自己写出来了。

  • "计算匹配"只算了教师的一次 forward,没算教师自己的预训练。 教师是同规模、训到 10× Chinchilla 的模型,学生只训 5×(§5.1),即教师多看了 2 倍 token。作者原话是 recycling their pre-invested compute(§3.2)——那部分算力被摊掉了。
  • 附录 D.1 是关键。 135M 上 LIFT 相对计算匹配 Transformer 的 PPL 增益是 0.47±0.08;把它换成"用自己的状态训练"(无教师,1 次 Jacobi 迭代)只剩 +0.01±0.05,与之打平。原文原话:教师贡献了 LIFT 相对计算匹配 Transformer 增益的 98%。同一段还有:无教师变体比同 token Transformer 好 1.40,而把那次额外前向直接换成更多数据是 1.39——几乎一样。
  • 135M 计算匹配下,多数下游差异落在种子噪声内(Table 10 里 MC 39.5±0.1 vs 39.2±0.3、RC 1.076±0.006 vs 1.085±0.005,区间重叠),只有 Gen 明确超出(15.0±0.6 vs 13.6±0.6)。
  • 独立复现里计算匹配基本是平局。 SmolLM2-135M、10B token、3 种子:LIFT 的 PPL 18.04 vs Transformer 18.02,MC 38.0 vs 38.1,RC 1.629 vs 1.622——三项数值上 Transformer 还略优,只有 Arith(2.18 vs 2.30)与 Gen(9.5 vs 8.5)领先。作者自己也说 token 匹配下 all methods are within noise。
  • 350M 与 1B 只有 1 个种子(§5.1,due to compute constraints)。1B 是最大规模,再往上没有。
  • 部署口径要小心。 表 1 的分数用的是逐位置顺序 prefill;附录 E 里,不做 refinement 的并行 prefill 只保留 37–51% 的状态增益,算术一项只有 18–26%,此模式下 1B 与计算匹配 Transformer 持平。加一次 refinement pass 能恢复到 93–104%,但那要多一次前向。
两处值得记账的。师生漂移作者确实测了:state-alignment loss(λ=1.5)加最后 10% 自适应阶段,把状态换成模型自己的预测代价是 0.32 PPL(去掉对齐项是 0.51),而状态通道的总价值是 1.79 PPL——残余漂移吃掉约 18%,有残留但被控住了。教师强度也不是关键变量:换 7B@701B 教师(PPL 14.97)替 1B@222B(PPL 18.62),学生 PPL 18.81 vs 18.85 几乎不动,MC 反而 52.5→51.7。这削弱了"纯靠蒸馏更强老师"的怀疑,也让 98% 那条更耐人寻味——增益来自"那次额外前向花在了教师身上",而不是"教师更强"。

一句话:S5 那条引用无妨;LM 那条请连同 §D.1 一起引用。全文无 limitation 章,换规模、换词表、以及训练远超教师预算的情形,作者自己留作了开放问题。

98% 的增益,来自那位老师

暂无表态