Loading...
正在加载...
请稍候

Skaling 定律:Chinchilla 和 Kaplan 都对了一半

✨步子哥 (steper) 2026年08月10日 17:11

Skaling 定律:Chinchilla 和 Kaplan 都对了一半

论文链接:https://arxiv.org/abs/2608.07222
作者:Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz, Kartik Ahuja(FAIR at Meta)

一场持续四年的争论

2020 年,OpenAI 发布 Kaplan 定律:模型 loss 随参数量 N、数据量 D、计算量 C 呈幂律下降。关键结论是——模型大小和数据量对 loss 的影响是独立的,可以分别优化。

2022 年,DeepMind 发布 Chinchilla 定律:Kaplan 错了,模型和数据应该按比例缩放,最优 token-to-parameter 比约为 20:1。Chinchilla 重新拟合了 Kaplan 的数据,发现独立假设导致 Kaplan 严重低估了数据的重要性。

从那以后,Chinchilla 定律成了行业共识。Llama、Mistral、Qwen 等开源模型基本都遵循 20:1 的比例。

但有一个问题一直被忽略:Chinchilla 在数据稀缺和过训练两个极端,预测误差会急剧上升。你用 Chinchilla 预测"用 10B 参数训练 1T token"的 loss,会比实际高估;预测"用 1B 参数训练 1T token"的 loss,会比实际低估。

Skaling 论文的第一句话就点出了问题:"标准公式在数据稀缺和过训练极端系统性低估和高估 loss"。这不是随机噪声,是系统偏差。

根因:独立假设是错的

Chinchilla 的数学形式是:

\[L(N, D) = L_\infty + \frac{A}{N^\alpha} + \frac{B}{D^\beta}\]

这里 N 和 D 是独立的两项,各自以幂律衰减。这个"独立"就是问题所在。

Skaling 的核心洞察:模型大小和数据量对 loss 的影响不是独立的,它们之间有耦合。小模型在大数据量下的表现衰减方式,和大模型在小数据量下完全不同。你不能用一个固定的 \(A/N^\alpha\) 项来描述所有 (N, D) 组合。

作者用数值梯度分析证明了这一点:在 (N, D) 平面上,loss 的等高线不是 Chinchilla 预测的那种"独立相加"形状,而是有明显弯曲——这正是耦合的标志。

Skaling:加一个耦合项

Skaling 的数学形式:

\[L(N, D) = L_\infty + \frac{A}{N^\alpha} + \frac{B}{D^\beta} + \frac{C}{(N^\alpha \cdot D^\beta)^\gamma}\]

相比 Chinchilla,多了一个交叉项 \(\frac{C}{(N^\alpha \cdot D^\beta)^\gamma}\),其中 \(\gamma\) 是耦合指数。这个项的含义是:当 N 和 D 同时增大时,它们会产生一个额外的协同效应(或抵消效应),这个效应不能被独立项捕捉

为什么是乘法耦合而不是加法?作者在论文 7.2 节给出了详细论证:加法交互项在数值上无法拟合观察到的等高线弯曲模式,而乘法耦合可以。这和 Kaplan 原本的耦合形式有呼应,但 Skaling 把它做得更精确。

效果:1.5-3 倍误差降低

在多个交叉验证设置下,Skaling 相比 Chinchilla:

  • 插值场景(预测训练网格内的点):MAPE 降低 1.5-2 倍
  • 外推场景(预测训练网格外的点):MAPE 降低 2-3 倍
  • 稀疏网格策略:只用低计算量区域的少量训练点,就能准确外推整个网格——比均匀采样策略节省约 10 倍计算量

第三点特别重要。现在训练一个 LLM 的成本动辄百万美元级,如果能在小规模实验上准确预测大规模表现,就能省下大量试错成本。Skaling 的稀疏网格策略让"用 100M 参数的实验预测 7B 参数的 loss"变得可行——误差在可接受范围内。

更深的含义:Kaplan 和 Chinchilla 都对了一半

这篇论文最漂亮的洞察是:Kaplan 和 Chinchilla 不是对立的,它们是 Skaling 在不同极限下的近似

  • \(\gamma \to 0\)(耦合项消失),Skaling 退化为 Chinchilla
  • 当数据量远大于模型容量需求时,耦合项主导,Skaling 行为接近 Kaplan 的耦合形式

这就像相对论在低速极限下退化为牛顿力学——不是谁对谁错,而是适用范围不同。Chinchilla 在"模型和数据按比例缩放"的甜区很准,但在数据稀缺或过训练极端就失灵了。Skaling 通过引入一个参数,把两个极端都统一了进来。

对实际训练的意义

1. 过训练终于有理论指导了。Llama 3 在 15T token 上训练 8B 模型,远超 Chinchilla 的 20:1 比例(应该是 160B token)。这种"过训练"在 Chinchilla 框架下是"次优"的,但在 Skaling 框架下可以被正确解释——耦合项让过训练的边际损失比 Chinchilla 预测的更小。

2. 小模型实验预测大模型表现变得更可靠。稀疏网格策略让团队用 1/10 的计算量就能拟合出可靠的 scaling law,这对资源有限的研究机构特别有价值。

3. 数据分配有了新 frontier。论文提出了"Farseer 数据分配前沿"——给定总计算预算,如何在 N 和 D 之间分配才能最小化 loss。Skaling 的最优分配和 Chinchilla 的不同,特别是在非标准比例下。

诚实的评价

局限也很明显

  • Skaling 多了一个参数 \(\gamma\),拟合难度比 Chinchilla 高。在数据稀疏时,\(\gamma\) 本身的估计可能不稳定。
  • 实验主要在 FAIR 的内部训练数据上做的。不同数据质量、不同模型架构下 \(\gamma\) 是否一致,还需要更多验证。
  • 耦合项的物理含义还不够清晰。为什么 N 和 D 会有协同效应?是因为大模型能从数据里提取更多信息,还是因为大数据能更好地激活大模型的容量?论文给了数值证据,但没给机制解释。

但整体上,这是 scaling law 方向近两年最重要的工作。它不是"推翻 Chinchilla",而是"补全 Chinchilla"——把一个在甜区准确的定律,扩展成在全区间准确的定律。科学进步很多时候不是推翻旧理论,而是找到旧理论的适用边界,然后提出更一般的新理论。Skaling 就是这种进步。


论文:Videau, Youbi-Idrissi, Lopez-Paz, Ahuja. Skaling: Chinchilla's Exponents Meet Kaplan's Coupling. arXiv:2608.07222, 2026. (FAIR at Meta)

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录