摘要挑的那句话,把最硬的两个数盖住了
一、那个指标不是「面积」,方向也要说清。
论文里它叫 AULB(area under the loss–budget curve):对 token NLL 在整数前缀网格 k = 1…N 上做梯形积分,再除以网格跨度 N − 1 = 19,回到平均 NLL 的量纲,越低越好。TLM(均匀采样)是 3.28,四套 MLMS 落在 5.73–5.90,降幅 43–44% 对得上。换成 FLOP 加权 / 中位数 / 部署区间三种口径复算,差距仍在同一条带里(论文写 30–44%),这点做得比较老实。
二、真正该当头条的是「每个档位的成本」。
摘要只说「每次运行 GPU 成本低约 12%」,那是拿 131 对 149 比。把逐项账单摆开(1 张 A100、200 亿 token、双方都关蒸馏):
- 传统 3 模型套件:216 GPU-h,3 个可用档位,72 GPU-h 每档
- MLMS 无蒸馏:149,3 档,50
- MLMS 加蒸馏:182–185,3 档,61–62
- TLM(均匀 π):131,20 档,6.5
三、MLMS 在 k = 1 那一格,比掷骰子还糟。
摘要写「其余深度上处于随机水平(困惑度 10²–10⁵)」,正文给了具体数:k = 5 是 1,412;k = 1 是 438,883,而随机水平是 49,152(等于词表大小)。也就是说 k = 1 那格连均匀噪声都不如,不是「随机水平」而是「比随机更差」。这个层次感在中文摘要里完全丢了。
它也给了对手一条台阶:只微调 head 能把 k = 5 救回 177 PPL,但比训练过的 TLM 前缀还是差约六倍。
再补一个很好用的对照:TLM 在 k = 13(50M 与 100M 两个出口之间)是 22.6 PPL,几乎追平 MLMS 在它自己 50M 出口的 21.89;而 MLMS 在 k = 13 崩到 285 PPL。
四、「是目标不是嵌套」这句话有反证,而且反证是它自己做的。
log-uniform 采样器让 k = 1 的测度为零(从未被采样),它自己在那一格就崩到 6,740 PPL;exit-grid 采样器放弃连续性之后,非出口也回落到 MLMS 水平(k = 5 是 2,693)。同一个嵌套架构,换采样分布就换命运——这比任何论证都干净。
五、代价也写在表上,别漏。
全容量处 TLM 是 14.99 PPL,MLMS 四套是 14.96–15.42,确实打平;但单独训一份同规模原生模型是 13.98,MLMS 差 7.1%、TLM(exit-grid)差 4.8%。「一个模型服务二十个预算」不是白拿的,它换掉的是一部分峰值质量。摘要那句「在全容量处与它们持平」说的只是跟 MLMS 持平,不是跟原生模型持平。
六、工程侧的实况。
论文给的 Code 链接是个 2026-09-27 建、2 次提交、135 KB、0 星的仓库(Apache-2.0),比 arXiv 提交只早一天。架构上「二十层」具体是 11@320 + 5@576 + 4@960 三档宽度、共 20 个 block;三个 MLMS 出口 k = 11 / 16 / 20 分别用满模型 17% / 43% / 100% 的层 FLOPs。理解那张曲线的横轴时,这个换算比「二十层」三个字有用。
下一根钉子
最该盯的是 π 的取法。均匀 π 让 k = 1 有效但两端都不占优;exit-grid 把出口质量拿回来却丢了连续体。中间那件事——按预算分布加权 π(让每个档位的采样质量和它的调用频率成正比)——论文没做,而这才是「服务多种算力预算」这句话真正的落地方式。谁先补上这条,谁就能把 6.5 GPU-h 每档再压一截。