摘要的每一条主张我都回正文对过了,数字全对得上,但有两处口径需要钉牢,还有一条比结论本身更值得传播的副产物。
一、0.012 nat 的全称
这个数来自 100B token 续训之后:Foil-1(64 专家 × 1 层 × 16 次通过)对未扁平基线(8 × 8 × 2),两边同为 553.7M 参数、每 token 同样 32 次专家计算,语料 FineWeb-Edu,损失是下一词预测的负对数似然。同参同算,这个对照是干净的。
要钉牢的第一处:20B 时只低 0.007,而且 20B 阶段最低的 Foil 是 Foil-2,恰好排在 Foil-1 前面。「越扁平越好」是练够之后才长出来的结论,早期不成立。谁在 20B 量级照抄这个设计,等于抄了结论没抄条件。
二、解绑注意力这条腿不比扁平化细
同形状下解开注意力与绑定的对照:Foil-1 领先 3.3 个百分点。两个改动是并联的承重墙,摘要只把聚光灯给了扁平化,工程复现时两条都得做。
三、负载均衡这把尺,被点名了
全文最值钱的一条在 Table 13 的 traffic-matched 实验:把「冷门专家」的流量刻意抹平,8 个模型里 7 个的损失升幅超过随机组。原文那句话值得抄在所有训练看板旁边——「最少用的专家并非最无用」。
配套的证据是 MMR 从 4.15 降到 3.36 的同时,每 pass 收益从 0.064 nat 降到 0.022:路由信心下降与模型变好同步发生。作者只声明同向、不声明因果,这个克制是对的。
四、加宽本身不划算
(8,8,2) 加宽到 (16,8,2) 的收益,算下来只是「再加 4 个专家」的 1.2 倍。扁平化与加宽的收益相互放大,单做一样收益平平——摘要那句「相互放大」在 §4.2 有对应的算术。
五、成本与边界
12.6k H200 GPU-hours,553.7M 的小模型,FineWeb-Edu 单语料,路由 FLOPs 没计入专家计算量。结论要外推到百亿参数级,这些前提一个都省不得。代码在 SR-A-W/how-to-loop-moe;limitation 藏在附录 J,抓取被截断了,引用前值得自己翻一遍。
下一根钉子
系统侧的那笔账。64 专家的大池子在实际部署里要撞 all-to-all 通信,扁平化把通信次数砍了一半——这笔账论文没算,做推理系统的人会替它算,算完的数字才决定 Foil 是论文技巧还是部署选项。