Loading...
正在加载...
请稍候

Loopie的逆袭:循环Transformer终于打赢了同等算力的 vanilla 模型

✨步子哥 (steper) 2026年07月20日 17:10

一个被冷落六年的想法

2019年,Google提出了Universal Transformer——让同一组参数反复处理输入多次,像循环神经网络一样"多想几轮"再输出。理论上很美:参数少、能迭代、像人类思考一样反复打磨。

但六年过去了,这个想法一直没真正起飞。原因很简单也很残酷:在相同预训练算力下,直接把模型参数放大N倍,通常比把同一层循环跑N次效果更好

比如你有2.6B参数的模型循环4次,预训练算力相当于10.4B参数的普通模型跑一遍。而10.4B的普通模型几乎总是赢。

这就是循环Transformer(Looped Transformer)的"算力记账问题":你省下的参数,被多花的算力抵消了,还倒贴了。

2026年7月,IQuest Research的一篇论文给出了一个让人重新审视这个架构的结果:他们的Loopie-20B-A2B模型,在相同预训练算力下,不仅没输给vanilla 30B-A3B,还全面碾压。更惊人的是,它在2025年的IMO(国际数学奥林匹克)和IPhO(国际物理奥林匹克)上,不借助任何外部工具,拿下了金牌

关键创新:Layer-Loop + Loopie Recipe

Loopie的突破来自两个设计决策。

1. Layer-Loop:每层自己循环,而不是整栈循环

之前的循环Transformer大多采用stack-loop:整个Transformer栈顺序跑完后,从头再来一遍。三层模型循环两次的流程是 Layer1→Layer2→Layer3→Layer1→Layer2→Layer3

Loopie用的是layer-loop:每一层自己先循环完,再传给下一层。同样三层两次的流程变成 Layer1→Layer1→Layer2→Layer2→Layer3→Layer3

区别看似微妙,实则深刻。Stack-loop要求信息在第一次通过整栈时就足够完整,否则错误会在第二次循环中被放大。Layer-loop让每一层先把自己的隐藏状态打磨好,再交给下一层——更像是每一层在做局部迭代优化,而不是整个网络反复试错。

2. Loopie Recipe:算力匹配的缩放配方

这是论文的核心贡献。面对"相同算力下vanilla更赢"的魔咒,作者没有回避,而是正面解决:设计一套缩放配方,让循环模型在算力匹配的条件下也能赢

配方考虑三个维度:

  • 存储宽度(stored width):模型隐藏维度
  • 存储深度(stored depth):层数
  • 循环深度(recurrent depth):循环次数

关键洞察是:循环模型不需要在参数量上和vanilla模型对齐,而应该在有效深度(存储深度 × 循环深度)上对齐,同时利用MoE(混合专家)架构把参数效率拉满。

Loopie-20B-A2B就是这套配方的产物:20B总参数,2B激活参数(MoE),两层循环。和它对比的是vanilla 30B-A3B(30B总参数,3B激活),两者预训练算力相当。

结果:全面超越同算力vanilla基线

在多个基准测试上,Loopie-20B-A2B的成绩都超过了参数量更大的vanilla模型:

基准 Loopie-20B-A2B Qwen3-30B-A3B-Thinking gpt-oss-20B-High Nemotron-3-Nano-30B-A3B
AIME 92.10% 90.10% 88.33% 85.00%
AMC 94.21% 93.57% 91.80% 91.05%
OlympiadBench 80.50% 81.20% 70.03% 76.68%
IFEval 84.72% 70.64% 79.21% 77.05%
ARC-Challenge 93.52% 92.42% 91.96% 93.86%
MMLU-Redux 83.61% 83.40% 82.54% 83.89%

AIME 92.10%是什么概念?这是美国数学邀请赛——不是选择题,是要求写出精确答案的竞赛题。一个20B参数(2B激活)的模型,在不调用计算器、不搜索网络的情况下,做对了92%的题目。

而IMO和IPhO的金牌,更是把"循环=更聪明"这个命题从基准测试推到了真实竞赛的舞台上。

为什么只循环两次?

一个自然的问题是:既然循环有用,为什么不循环3次、5次、32次?之前的Huginn就循环了32次。

Loopie的答案是:两次就够了

作者发现,从1次到2次,性能提升显著;但从2次到3次,边际收益很小,而算力成本翻倍。这和人类思考的直觉一致——把问题想两遍通常能发现第一遍的疏漏,但想十遍未必比想两遍好多少。

这也呼应了layer-loop的设计哲学:不是靠循环次数堆出深度,而是让每次循环都做实质性的局部优化。两次循环,第一次建立初步表示,第二次修正和精炼,已经足够。

更深层的启示:参数共享的春天?

Loopie的成功不只是"又一个新模型",它重新打开了一个被关闭的问题:参数共享是否被低估了?

过去几年的主流叙事是"参数越多越好,MoE只是让推理更便宜"。Loopie说:不,同样的算力,更少但更聪明地复用的参数,可以做得更好

这和大脑的工作方式有几分相似。大脑不是靠神经元数量碾压一切——人类大脑约860亿神经元,大象有2570亿,但人类的认知能力远超大象。关键在于神经回路的反复使用和迭代加工。Loopie的layer-loop,某种意义上就是在模拟这种"同一组神经元反复处理同一个问题"的机制。

当然,Loopie也有局限。它的训练pipeline复杂,需要精心的初始化和学习率调度。2次循环的"甜点"是否能推广到更大规模(100B+)也还是未知数。但至少,它证明了循环Transformer不是死路——只要算力记账做得对,循环可以赢


论文Loop the Loopies!

模型:Loopie-20B-A2B, Loopie-6B-A0.6B(论文提及,代码仓库 megatron-loopie / vllm-loopie)

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录