一个被冷落六年的想法
2019年,Google提出了Universal Transformer——让同一组参数反复处理输入多次,像循环神经网络一样"多想几轮"再输出。理论上很美:参数少、能迭代、像人类思考一样反复打磨。
但六年过去了,这个想法一直没真正起飞。原因很简单也很残酷:在相同预训练算力下,直接把模型参数放大N倍,通常比把同一层循环跑N次效果更好。
比如你有2.6B参数的模型循环4次,预训练算力相当于10.4B参数的普通模型跑一遍。而10.4B的普通模型几乎总是赢。
这就是循环Transformer(Looped Transformer)的"算力记账问题":你省下的参数,被多花的算力抵消了,还倒贴了。
2026年7月,IQuest Research的一篇论文给出了一个让人重新审视这个架构的结果:他们的Loopie-20B-A2B模型,在相同预训练算力下,不仅没输给vanilla 30B-A3B,还全面碾压。更惊人的是,它在2025年的IMO(国际数学奥林匹克)和IPhO(国际物理奥林匹克)上,不借助任何外部工具,拿下了金牌。
关键创新:Layer-Loop + Loopie Recipe
Loopie的突破来自两个设计决策。
1. Layer-Loop:每层自己循环,而不是整栈循环
之前的循环Transformer大多采用stack-loop:整个Transformer栈顺序跑完后,从头再来一遍。三层模型循环两次的流程是 Layer1→Layer2→Layer3→Layer1→Layer2→Layer3。
Loopie用的是layer-loop:每一层自己先循环完,再传给下一层。同样三层两次的流程变成 Layer1→Layer1→Layer2→Layer2→Layer3→Layer3。
区别看似微妙,实则深刻。Stack-loop要求信息在第一次通过整栈时就足够完整,否则错误会在第二次循环中被放大。Layer-loop让每一层先把自己的隐藏状态打磨好,再交给下一层——更像是每一层在做局部迭代优化,而不是整个网络反复试错。
2. Loopie Recipe:算力匹配的缩放配方
这是论文的核心贡献。面对"相同算力下vanilla更赢"的魔咒,作者没有回避,而是正面解决:设计一套缩放配方,让循环模型在算力匹配的条件下也能赢。
配方考虑三个维度:
- 存储宽度(stored width):模型隐藏维度
- 存储深度(stored depth):层数
- 循环深度(recurrent depth):循环次数
关键洞察是:循环模型不需要在参数量上和vanilla模型对齐,而应该在有效深度(存储深度 × 循环深度)上对齐,同时利用MoE(混合专家)架构把参数效率拉满。
Loopie-20B-A2B就是这套配方的产物:20B总参数,2B激活参数(MoE),两层循环。和它对比的是vanilla 30B-A3B(30B总参数,3B激活),两者预训练算力相当。
结果:全面超越同算力vanilla基线
在多个基准测试上,Loopie-20B-A2B的成绩都超过了参数量更大的vanilla模型:
| 基准 | Loopie-20B-A2B | Qwen3-30B-A3B-Thinking | gpt-oss-20B-High | Nemotron-3-Nano-30B-A3B |
|---|---|---|---|---|
| AIME | 92.10% | 90.10% | 88.33% | 85.00% |
| AMC | 94.21% | 93.57% | 91.80% | 91.05% |
| OlympiadBench | 80.50% | 81.20% | 70.03% | 76.68% |
| IFEval | 84.72% | 70.64% | 79.21% | 77.05% |
| ARC-Challenge | 93.52% | 92.42% | 91.96% | 93.86% |
| MMLU-Redux | 83.61% | 83.40% | 82.54% | 83.89% |
AIME 92.10%是什么概念?这是美国数学邀请赛——不是选择题,是要求写出精确答案的竞赛题。一个20B参数(2B激活)的模型,在不调用计算器、不搜索网络的情况下,做对了92%的题目。
而IMO和IPhO的金牌,更是把"循环=更聪明"这个命题从基准测试推到了真实竞赛的舞台上。
为什么只循环两次?
一个自然的问题是:既然循环有用,为什么不循环3次、5次、32次?之前的Huginn就循环了32次。
Loopie的答案是:两次就够了。
作者发现,从1次到2次,性能提升显著;但从2次到3次,边际收益很小,而算力成本翻倍。这和人类思考的直觉一致——把问题想两遍通常能发现第一遍的疏漏,但想十遍未必比想两遍好多少。
这也呼应了layer-loop的设计哲学:不是靠循环次数堆出深度,而是让每次循环都做实质性的局部优化。两次循环,第一次建立初步表示,第二次修正和精炼,已经足够。
更深层的启示:参数共享的春天?
Loopie的成功不只是"又一个新模型",它重新打开了一个被关闭的问题:参数共享是否被低估了?
过去几年的主流叙事是"参数越多越好,MoE只是让推理更便宜"。Loopie说:不,同样的算力,更少但更聪明地复用的参数,可以做得更好。
这和大脑的工作方式有几分相似。大脑不是靠神经元数量碾压一切——人类大脑约860亿神经元,大象有2570亿,但人类的认知能力远超大象。关键在于神经回路的反复使用和迭代加工。Loopie的layer-loop,某种意义上就是在模拟这种"同一组神经元反复处理同一个问题"的机制。
当然,Loopie也有局限。它的训练pipeline复杂,需要精心的初始化和学习率调度。2次循环的"甜点"是否能推广到更大规模(100B+)也还是未知数。但至少,它证明了循环Transformer不是死路——只要算力记账做得对,循环可以赢。
模型:Loopie-20B-A2B, Loopie-6B-A0.6B(论文提及,代码仓库 megatron-loopie / vllm-loopie)
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。