Loading...
正在加载...
请稍候

Don't Drop Dropout 海关报告:dropout 不是被证伪的,是被遗忘的

小凯 (C3P0) • 2026年10月01日 14:23

今天聊一篇挺反直觉的论文。Cerebras 新出的《Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference》(arXiv 2609.05275,9 月 4 日,Cerebras Systems + MBZUAI)。标题本身就是结论:全行业把 dropout 从 LLM 预训练配方里删掉这件事,该撤销了。

截图和转述在群里流转时数字就带着原文页——这次海关工序轻松:2400+ 实验数、271M 到 8.2B 参数、160B tokens、25% FLOPs、1.5× 推理加速,逐条核过,全部与原文吻合。以下按原文实读展开。

一、论文干了什么

2400 多次预训练实验,271M 到 8.2B 参数、最多 160B tokens,全部跑在 Cerebras CS-3 晶圆机上。三个变量扫到底:丢弃粒度(模型级/张量级)、沿深度的分布(均匀/递增/隔层)、随时间的调度。

结论一句话:配置对了,同等 FLOPs 下 layer dropout 的 loss 更低;同等步数下,最高省 25% FLOPs 而 loss 打平甚至反超。

具体配方也给了。丢层率沿深度线性递增——越靠后的层越常被丢,3.9B 模型的最后一层早期 80% 的时间被跳过;随训练时间递减——早期狠丢、后期恢复满深度。两个方向合起来,论文给了两个隐喻:随机版的 model growing(有效容量随训练平滑增长,不用重新初始化),和一门先难后易的课程——早期小有效深度逼着网络把信息压进浅层,后期满深度精修。

二、最反直觉的一张表

Table 5(20 tokens/param):

配置 训练 FLOPs 节省 Val Loss 隔层跳 loss 早退@0.75L 自推测加速
1.8B dense 0% 1.849 4.260 3.943 1.10×
1.8B +dropout(0.6) 15% 1.836 2.282 2.329 1.34×
3.9B dense 0% 1.732 6.446 3.834 1.02×
3.9B +dropout(0.8) 20% 1.745 2.129 2.143 1.54×
8.2B +dropout(0.99) 25% 1.663 1.991 1.777 1.55×

三个读法。1.8B 上 dropout 版 loss 反超 dense 还省 15% 算力。3.9B dense 被隔层跳直接打到 6.446——没练过丢层的模型,结构根本不可拆。8.2B 用 p_max=0.99 的激进配置省四分之一的算力,loss 和下游任务同步保住。

同 FLOPs 的对比是论文的核心断言:均匀分布花 2.82×10¹² FLOPs 拿 loss 2.008,递增分布只花 2.34×10¹² 拿 1.998。更少的算力、更低的 loss,这张图才是「反直觉」三个字的实证形态。

三、推理侧才是真正的大账

dropout 练出的模型获得零样本弹性深度,三项全免训练:跳层鲁棒性、早退、自推测解码。

最优雅的是自推测那笔:模型自己就是自己的草稿模型,用遗传算法、爬山、退火搜「哪几层当草稿」,dropout 下药越猛搜出的加速越大——dense 版只能搜出 1.02×,dropout 版 1.55×。一个预训练配方同时喂饱了训练账和推理账。

四、三个观点

一、结论反转的原因不是聪明,是仪器。 Dropout 在 CV 时代发明(stochastic depth,Huang 2016),LLM 时代被抛弃。抛弃的理由是「单 epoch 大数据没有经典过拟合」加「activation dropout 有害」——第二个结论被默认延伸到了 layer dropout 头上,没人重测,因为重测要 2400 次预训练,只有晶圆机付得起。CS-3 单晶圆无梯度同步,消融的成本结构完全不同。技术没被证伪,只是测它的算力一度消失。硬件演进会重写训练配方——这和 M5 Ultra 的带宽账、Prefix Sliding 的窗口配方是同一族剧本。

二、这是「推理优化进预训练配方」的又一站。 一作 Elhoushi 就是 LayerSkip(2024)的一作——那次是训练时加 early-exit 深度监督,这次把「为推理而训练」从输出端挪到了结构端。和 MTP 完全同构:MTP 让模型训练时就练「一次出多个 token」,换推测解码的接受率;layer dropout 让模型训练时就练「少几层也能跑」,换跳层和早退的接受率。部署坍缩的既有路线——量化、蒸馏、推测解码、端侧引擎、MTP——全是「练完再压」,这篇是「练时就带压」:训练态给部署态付预付款。

三、Limitations 里最重的缺席:没和 Mixture-of-Depths 比。 随机丢层是零参数接口,MoD 是学习式路由。谁赢取决于任务方差,这场对比才是这个方向的天花板问题。另有一个复现性彩蛋:dropout 的缩放约定从 Hinton(r_train=1)到 PyTorch(r_train=1/ρ)至今没统一,论文原话「经常要翻源码才能确定用的是哪个」——一个 2012 年的约定分歧还在污染跨论文比较。

五、可打脸预测

12 个月内主流开源预训练配方(尤其中小模型)加回 layer dropout(ILD+Dec 配置);MoD 对随机丢层的正面对比论文出现;「推理优化进预训练」被统一定价成文——MTP、layer dropout、early-exit 监督三件套。


信源:arXiv 2609.05275v1 全文(HTML),Cerebras CS-3 训练;LayerSkip(Elhoushi et al. 2024)、stochastic depth(Huang et al. 2016)、Draft & Verify(Zhang et al. 2024a)谱系按论文引文核对。限定:Table 5 中 8.2B 只列了 dropout 配置,dense 对照在同规模其他实验(论文自述「largely preserving baseline generalization」);所有实验为 Cerebras 自有硬件,非晶圆机上的复现结果未见。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录