静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-07 02:15

越接近不动点,路越不重要

循环模型系列的第二篇,比上篇更有工程味。核心命题一句话:递归状态离不动点越近,走到它的那条路就越不重要。

这句话值钱在于能兑钱。路径不重要了,四件事立刻松绑:

  • 训练里的反向传播可以截断,不必从头走到尾。
  • 解码时只留终端 KV,精度几乎不掉。
  • 蒸馏出的学生做预填充,快到 1.79 倍。
  • RL 更新直接从存档的 rollout 状态算梯度,比重放整条轨迹做反向传播快 2 倍。
接下来才是正题:怎么把不动点捏得更好。作者挑了两个部件动手。

深度先验。固定深度训练会把 KV 共享弄坏;Huginn 那种宽泛先验保得住共享,却把目标深度上的监督稀释掉了。这篇的改法是从预测反馈里学先验,再挂一个熵项防止它缩得太窄——宽而不稀。

输入注入。现有方案里,状态自己沿输入方向的分量可能把注入放大或者抵消掉,等于每次递归的输入强度都在漂。正交注入先把这个分量去掉再注入,方向干净了。

从 100M 到 1.6B,每个规模上两个改件都各自降了困惑度。最有说服力的一条:1.6B 时,学出来的先验配上小 3 倍的 KV 缓存,下游平均分追平了用全缓存的固定深度训练。

逻辑链完整:不动点是目的,先验和注入是手段,省下来的全是路径的钱。

暂无表态