Skaling 定律:Chinchilla 和 Kaplan 都对了一半
Skaling 定律:Chinchilla 和 Kaplan 都对了一半
> 论文链接:https://arxiv.org/abs/2608.07222 > 作者:Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz, Kartik Ahuja(FAIR at Meta)
一场持续四年的争论
2020 年,OpenAI 发布 Kaplan 定律:模型 loss 随参数量 N、数据量 D、计算量 C 呈幂律下降。关键结论是——模型大小和数据量对 loss 的影响是独立的,可以分别优化。
2022 年,DeepMind 发布 Chinchilla 定律:Kaplan 错了,模型和数据应该按比例缩放,最优 token-to-parameter 比约为 20:1。Chinchilla 重新拟合了 Kaplan 的数据,发现独立假设导致 Kaplan 严重低估了数据的重要性。
从那以后,Chinchilla 定律成了行业共识。Llama、Mistral、Qwen 等开源模型基本都遵循 20:1 的比例。
但有一个问题一直被忽略:Chinchilla 在数据稀缺和过训练两个极端,预测误差会急剧上升。你用 Chinchilla 预测"用 10B 参数训练 1T token"的 loss,会比实际高估;预测"用 1B 参数训练 1T token"的 loss,会比实际低估。
Skaling 论文的第一句话就点出了问题:"标准公式在数据稀缺和过训练极端系统性低估和高估 loss"。这不是随机噪声,是系统偏差。
根因:独立假设是错的
Chinchilla 的数学形式是:
$$L(N, D) = L_\infty + \frac{A}{N^\alpha} + \frac{B}{D^\beta}$$
这里 N 和 D 是独立的两项,各自以幂律衰减。这个"独立"就是问题所在。
Skaling 的核心洞察:模型大小和数据量对 loss 的影响不是独立的,它们之间有耦合。小模型在大数据量下的表现衰减方式,和大模型在小数据量下完全不同。你不能用一个固定的 $A/N^\alpha$ 项来描述所有 (N, D) 组合。
作者用数值梯度分析证明了这一点:在 (N, D) 平面上,loss 的等高线不是 Chinchilla 预测的那种"独立相加"形状,而是有明显弯曲——这正是耦合的标志。
Skaling:加一个耦合项
Skaling 的数学形式:
$$L(N, D) = L_\infty + \frac{A}{N^\alpha} + \frac{B}{D^\beta} + \frac{C}{(N^\alpha \cdot D^\beta)^\gamma}$$
相比 Chinchilla,多了一个交叉项 $\frac{C}{(N^\alpha \cdot D^\beta)^\gamma}$,其中 $\gamma$ 是耦合指数。这个项的含义是:当 N 和 D 同时增大时,它们会产生一个额外的协同效应(或抵消效应),这个效应不能被独立项捕捉。
为什么是乘法耦合而不是加法?作者在论文 7.2 节给出了详细论证:加法交互项在数值上无法拟合观察到的等高线弯曲模式,而乘法耦合可以。这和 Kaplan 原本的耦合形式有呼应,但 Skaling 把它做得更精确。
效果:1.5-3 倍误差降低
在多个交叉验证设置下,Skaling 相比 Chinchilla:
- 插值场景(预测训练网格内的点):MAPE 降低 1.5-2 倍
- 外推场景(预测训练网格外的点):MAPE 降低 2-3 倍
- 稀疏网格策略:只用低计算量区域的少量训练点,就能准确外推整个网格——比均匀采样策略节省约 10 倍计算量
更深的含义:Kaplan 和 Chinchilla 都对了一半
这篇论文最漂亮的洞察是:Kaplan 和 Chinchilla 不是对立的,它们是 Skaling 在不同极限下的近似。
- 当 $\gamma \to 0$(耦合项消失),Skaling 退化为 Chinchilla
- 当数据量远大于模型容量需求时,耦合项主导,Skaling 行为接近 Kaplan 的耦合形式
对实际训练的意义
1. 过训练终于有理论指导了。Llama 3 在 15T token 上训练 8B 模型,远超 Chinchilla 的 20:1 比例(应该是 160B token)。这种"过训练"在 Chinchilla 框架下是"次优"的,但在 Skaling 框架下可以被正确解释——耦合项让过训练的边际损失比 Chinchilla 预测的更小。
2. 小模型实验预测大模型表现变得更可靠。稀疏网格策略让团队用 1/10 的计算量就能拟合出可靠的 scaling law,这对资源有限的研究机构特别有价值。
3. 数据分配有了新 frontier。论文提出了"Farseer 数据分配前沿"——给定总计算预算,如何在 N 和 D 之间分配才能最小化 loss。Skaling 的最优分配和 Chinchilla 的不同,特别是在非标准比例下。
诚实的评价
局限也很明显:
- Skaling 多了一个参数 $\gamma$,拟合难度比 Chinchilla 高。在数据稀疏时,$\gamma$ 本身的估计可能不稳定。
- 实验主要在 FAIR 的内部训练数据上做的。不同数据质量、不同模型架构下 $\gamma$ 是否一致,还需要更多验证。
- 耦合项的物理含义还不够清晰。为什么 N 和 D 会有协同效应?是因为大模型能从数据里提取更多信息,还是因为大数据能更好地激活大模型的容量?论文给了数值证据,但没给机制解释。
---
论文:Videau, Youbi-Idrissi, Lopez-Paz, Ahuja. *Skaling: Chinchilla's Exponents Meet Kaplan's Coupling*. arXiv:2608.07222, 2026. (FAIR at Meta)