望远镜语言模型:一个模型服务二十种算力预算,43% 质量提升的秘密

论文:Telescopic Language Models arXiv: 2609.35769 代码: github.com/Fhujinwu/TLM

一个模型,二十种算力:望远镜语言模型把"弹性部署"做成了连续光谱

论文:Telescopic Language Models
arXiv: 2609.35769
代码: github.com/Fhujinwu/TLM

场景:一个 API,三种客户

想象你运营着一个语言模型服务。大客户付费高,要 200M 全量模型跑推理;小客户预算紧,只买 50M 的量;还有一批中间客户,要 100M。传统做法是训三个模型——50M、100M、200M 各一个,三个训练流水线、三份权重、三套部署。成本翻三倍,工程团队骂街。

Matryoshka 嵌套模型(MLMS)给了一个折中方案:训一个 200M 的 20 层 cascade,只在第 5、10、20 层设"出口",这三个出口分别对应 50M、100M、200M 的算力。一份权重,三个模型。听起来很美。

但如果你突然需要一个 75M 的模型呢?第 7 层?第 8 层?

答案是:完全不能用。验证困惑度从出口处的 ~20 飙到 10²~10⁵,最高能到 438,883——比随机猜(49,152)还离谱。cascade 看起来提供了连续光谱,实际上只有那三个被训练的出口是有效的,其余全是死区。

Telescopic Language Model(TLM)要解决的就是这个问题:让每一层都是有效模型。

类比:望远镜不是三个焦距,是连续变焦

望远镜(telescope)的精髓不是"看远"或"看近",而是连续变焦。你转动旋钮,画面从近到远平滑过渡,每一个焦距位置都能成像。TLM 想做的就是这个——一个模型,从第 1 层到第 20 层,每一层都是一个有效的语言模型。

MLMS 像一个只有三档焦距的望远镜:50M、100M、200M,档位之间是黑的。TLM 是连续变焦:任意拨到一个位置都能用。

关键问题在于:怎么训练才能让每一层都有效?

方法:随机前缀监督 + 全锚

TLM 的训练方法极其简洁。每个优化步做两次前向-反向传播:

1. 随机前缀:从 1 到 20 中随机选一个深度 k,只用前 k 层做前向传播,用完整 next-token 目标计算损失 2. 全容量锚:做一次完整的 20 层前向传播,同样用 next-token 目标

两次反向传播的梯度加在一起更新参数。就这么简单。没有架构改动,没有额外推理开销。

直觉是这样的:如果你只在第 5、10、20 层训练,其他层从未见过梯度信号,当然不会工作。但如果你在每个 step 随机选一层训练,经过足够多的 step,每一层都被充分采样过,每一层都见过完整的 next-token 目标——于是每一层都是有效模型。

这和 dropout 的哲学一脉相承:随机性是正则化的一种形式。Dropout 随机关掉神经元来防止过拟合;TLM 随机选前缀深度来保证每一层都能独立工作。

"全锚"(full anchor)是点睛之笔。如果只做随机前缀,深层可能学不好——因为深层只在被选到时才训练,频率太低。全锚保证每步都有一次完整深度的训练,让最深层(也是最强模型)始终是性能上限。

数据:43-44% 的质量-预算曲线缩减

论文在 200M 代理模型上实验,用 20B FineWeb-Edu tokens 训练,所有方法用相同数据流。结果:

  • TLM 的质量-预算曲线下面积(AULB):3.28
  • MLMS 的 AULB:5.73-5.90
  • 相对缩减:43-44%
这意味着什么?如果你在所有可能的算力预算上积分 TLM 的质量,它比 MLMS 好 43-44%。不是因为 TLM 在某个单点更强——在 MLMS 训练过的三个出口处,MLMS 仍然略强("覆盖的代价")——而是因为 TLM 在所有其他点上都可用,MLMS 在那些点上是废的。

具体数字:TLM 的困惑度从第 1 层的 81 平滑下降到第 20 层的 15,中间任何一层都不超过 56。MLMS 在出口处是 ~20,但非出口处飙到 1,412(第 5 层)甚至 438,883(第 1 层)。

更让人惊讶的是成本:TLM 的 GPU 成本比 MLMS 低约 12%。两次前向-反向传播听起来更贵,但因为随机前缀只跑部分层,平均开销比两次完整传播少。而且只需要一次训练运行,不需要为每个预算单独训。

代价:覆盖 vs 峰值

TLM 不是免费的午餐。论文诚实地指出:

  • 在 MLMS 训练过的三个出口处,MLMS 仍然略强于 TLM
  • 这是"覆盖的代价"——TLM 用峰值的小幅下降换取了全谱的可用性
  • 前缀采样密度是一个旋钮:集中在少数深度上就能恢复固定出口的质量,但牺牲连续性
这就像变焦望远镜 vs 定焦望远镜:变焦镜在任何一个焦距上都不如同档位的定焦镜锐利,但你可以任意变焦。定焦镜只有三个焦距可选,其他位置完全黑屏。

为什么这件事重要

部署侧的痛点不是"最强模型多强",而是"算力预算多样"。真实世界里,同一个模型要服务手机端(低算力)、平板端(中算力)、服务器端(高算力),还要服务高峰期降配、低谷期升配。传统做法要么训多个模型(贵),要么用蒸馏/剪枝(有损且复杂)。

TLM 提供了第三条路:一次训练,全谱可用。算力预算变成一个运行时参数,不是训练时参数。

更深层的是,TLM 揭示了一个被忽视的事实:Matryoshka cascade 看起来提供了连续光谱,实际上只有被训练的出口是有效的。cascade 本身不解决任何问题,解决问题的是训练目标。如果你只在三个点训练,cascade 就只有三个点。如果你在所有点训练,cascade 才是真正的连续光谱。

目标决定覆盖,架构不决定。

局限与展望

论文用的是 200M 的小模型代理。在更大规模(7B、70B)上是否仍然成立?随机前缀的采样策略(均匀 vs 集中)如何影响不同深度的质量分布?这些问题论文没有完全回答。

但核心洞察已经足够清晰:不要把算力预算当作离散的几个点,要把它当作连续光谱。望远镜不只有三个焦距,它是一段连续的变焦。


论文链接: arxiv.org/abs/2609.35769 HTML 全文: arxiv.org/html/2609.35769v1 开源代码: github.com/Fhujinwu/TLM

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens