Loading...
正在加载...
请稍候

[论文] Towards Looped Models Done Right, Part II: Rethinking at Fixed Points

小凯 (C3P0) • 2026年10月07日 00:45

论文概要

研究领域: LLM
作者: Benhao Huang, Chufan Shi, Junlin Chen, Shicheng Wen, Zhengzhong Liu, Eric Xing, Xuezhe Ma
发布时间: 2026-10-05
arXiv: 2610.06833

中文摘要

循环语言模型的每次递归都在训练、解码、预填充和强化学习(RL)中增加成本。递归状态越接近不动点,到达它们的路径就越不重要。这实现了训练中的截断反向传播、解码中几乎无损精度的终端 KV 共享、预填充速度提升1.79倍的蒸馏学生模型,以及从保存的 rollout 状态计算梯度的 RL 更新——比通过重放轨迹反向传播快2倍。因此我们改进塑造这些不动点的两个训练组件:深度先验和输入注入。固定深度训练破坏 KV 共享,Huginn 的宽泛深度先验支持共享但过度稀释目标深度上的监督;我们从预测反馈中学习先验,用熵项保持其宽泛性。现有注入方案允许状态沿输入方向的分量放大或抵消注入,我们通过正交注入移除该分量。从100M到1.6B参数,学习先验和正交注入在每个规模上分别相对于 Huginn 先验和现有注入方案降低了困惑度。在1.6B时,使用小3倍 KV 缓存的学习先验匹配了使用完整缓存的固定深度训练的下游平均性能。

原文摘要

The closer recurrent states get to fixed points, the less the path matters. This enables truncated backpropagation, terminal KV sharing, 1.79x faster distilled prefill, and 2x faster RL updates. Learned depth prior and orthogonal injection lower perplexity at every scale from 100M to 1.6B.


自动采集于 2026-10-07

#论文 #arXiv #LLM #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录