参数砍半还能反超?这笔账要拆开算
Meta 的三位研究者九月底挂出一篇论文(arXiv 2609.40316),研究的问题听起来很工程:一个模型该多大(总参数量)、每次该唤醒多少(稀疏度)、同一批层该重复跑几遍(循环次数)。以往这三件事各算各的账——MoE 有 MoE 的缩放律,循环有循环的缩放律,没人把它们拧在一起看过。这篇叫 Loop Scali…
参数砍半还能反超?这笔账要拆开算
Meta 的三位研究者九月底挂出一篇论文(arXiv 2609.40316),研究的问题听起来很工程:一个模型该多大(总参数量)、每次该唤醒多少(稀疏度)、同一批层该重复跑几遍(循环次数)。以往这三件事各算各的账——MoE 有 MoE 的缩放律,循环有循环的缩放律,没人把它们拧在一起看过。这篇叫 Loop Scaling Laws 的工作第一次给出了联合缩放律。
随之而来的传播版标题是:「参数量直接砍半,推理性能却不降反升」。这句话值得拆开算账,因为拆完的版本比原版更有意思。
论文的实测是这样:用一万亿 token、相同训练算力,训练一个 0.3B 激活、1.3B 总参数的 LoopMoE,对照一个 0.6B 激活、2.9B 总参数的普通 MoE——总参数是它的 2.2 倍,激活是它的两倍。结果:在 R=1(不循环)的档位,小模型的推理算力只用了对手的 0.4 倍,推理成绩打平。反超发生在把循环次数拉到 R=5 的档位——成绩高出 10.3 分,代价是推理算力用到对手的 1.8 倍。
所以「不降反升」的功劳,严格说不属于参数效率,属于测试时算力。参数砍半买到的是「打平」,反超那 10.3 分是用多转四圈换来的。但拆开的账反而更值钱:它证明循环是个真旋钮,不是装饰——同一个模型,便宜的档位打平大模型,深思的档位反超大模型。
循环这个想法本身不新。把同一批 transformer 层反复应用,2018 年的 Universal Transformers 就在试,后来一直有续作。它始终没成主流的原因也清楚:循环增益有天花板。转两圈有提升,转十圈收益趋零——「多想几遍」在参数固定时会饱和。这篇论文的贡献之一是把这条天花板形式化进缩放律(有界的循环增益映射),并且发现稀疏性能把天花板抬高:因为 MoE 的动态路由让 token 在每一圈走不同的专家,重复的循环实际在做不同的计算。「循环撞墙、MoE 顶开天花板」的说法,精确版本是:墙还在,但被稀疏性挪远了。
抬高之后的天花板长什么样,论文的表格画得清清楚楚。同一个模型,R 从 1 拉到 5,推理成绩的变化是 +6.4、+3.0、+0.7、+0.2——每一圈的边际收益都在缩水。这条曲线值得每个谈论「深度思考」的人看一眼:深思不是免费的,而且深思的第四圈几乎不再值钱。
回到效率的账。论文给出的两个数:稀疏性带来约三倍的激活参数效率,循环带来约两倍的总参数效率(在推理任务上)。两个轴收益互补,叠加起来就是那组实验——0.3B 激活的模型拧到 R=5,超过了激活 0.6B 的对手。
放回更大的图景里看,这篇论文做的其实是给 MoE 时代装第三个旋钮。这两年旗舰模型的共同动作是把激活参数做小:GLM 是 320B-A18B,DeepSeek 是 552B-A8B——「激活比是接口」,总参数变成容量承诺,每次实际用多少才是账单。LoopMoE 在这个面板上加了第三个旋钮:总参数管容量,激活管每次用多少,循环管把用的部分跑几遍。此前「深度思考模式」是话术——思维链写长一点、采样多来几遍;现在它有了参数级的形态:把同一批层多转几圈,而且这个旋钮在推理时按需拧,同一个模型可以开便宜档和深思档。
一万亿 token 的实测、0.4 倍算力打平 2.2 倍大的模型、1.8 倍算力反超 10.3 分——这些数字背后真正新东西是那张边际收益表:+6.4、+3.0、+0.7、+0.2。「多想」的每一圈都比上一圈便宜,也比上一圈没用。深度思考的边际成本曲线,第一次被一条缩放律画了出来。
信源备注:论文 arXiv 2609.40316「Scaling Laws for Looped Mixture of Experts」(2026-09-30,Yanbei Chen、Anirudh Goyal、Raghuraman Krishnamoorthi,Meta AI)摘要与全文核对;数字(3× 激活参数效率、2× 总参数效率、0.3B/1.3B vs 0.6B/2.9B、R=1 至 5、+10.3 分、R=1 时 0.4× 推理算力、R=5 时 1.8×、2.2 倍总参、万亿次训练)均出自论文正文与 Table 2;「参数砍半性能不降反升」的视频标题经拆账裁定:打平属于参数效率、反超属于测试时算力(R=1→5)+1.8× 推理算力,归因有别;「MoE 顶开天花板」的精确表述为「稀疏性抬高有界循环增益的上限」;Universal Transformers(Dehghani et al., 2018)为循环架构谱系背景。