表格深度学习的"默认选项"可能选错了:Muon 优化器全面碾压 AdamW
> *Benchmarking Optimizers for MLPs in Tabular Deep Learning* > Yury Gorishniy, Ivan Rubachev, Dmitrii Feoktistov | arXiv: 2504.13081 | 2025
---
一个被忽视的选择
在表格数据的深度学习中,有一个"默认配置"几乎没人质疑:
- 架构:MLP(多层感知机)
- 优化器:AdamW
这篇论文问了一个很朴素的问题:AdamW 真的是最好的选择吗?
答案是:不是。
---
系统基准测试:N 个优化器 × N 个数据集
研究者在统一的实验协议下,用多个表格数据集基准测试了多个优化器,训练的都是标准的 MLP 模型。
核心发现:Muon 优化器始终优于 AdamW。
Muon 是一个相对较新的优化器,由 Keller、Mokhtari 和 Schlichtkrull 在 2024 年提出。它基于矩阵正交化,特别适合高维参数空间的优化。在 NLP 和 CV 领域已经显示出前景,但在表格深度学习领域还没有被系统评估过。
---
另一个发现:EMA 是免费的性能提升
研究者还发现了一个简单但有效的技巧:模型权重的指数移动平均(EMA)。
EMA 的原理很简单:不直接使用训练过程中的最新权重,而是维护一个权重的移动平均值。这相当于对训练过程做了"平滑",通常能带来更稳定的泛化性能。
在普通 MLP 上,EMA 能显著提升 AdamW 的性能。不过这个技巧在不同模型变体上的效果不太一致——有些架构受益很大,有些几乎没变化。
---
实用建议
这篇论文给出了很直接的实践建议:
1. 如果你能承受额外的训练开销,用 Muon 替代 AdamW。Muon 的性能一致更好,但训练效率略低(每个 step 的计算量更大)。 2. 如果必须用 AdamW,加上 EMA。这是一个几乎零成本的提升。 3. 不要盲目使用默认配置。优化器的选择和架构设计一样重要。
---
我的思考
这篇论文的价值在于它的"反共识"勇气。在一个"大家都这么用"的领域,站出来说"默认选项可能不是最优的",需要扎实的实验支撑。
这也反映了一个更广泛的问题:在深度学习中,很多"最佳实践"其实缺乏系统的实验验证。大家用 AdamW,不是因为有人证明了它是最优的,而是因为"别人都在用"。这种"默认惯性"可能让我们错过了更好的选择。
Muon 能在表格数据上一致胜出,可能是因为表格数据的特征空间结构与 NLP/CV 不同——表格特征通常是低维、稠密的,而 Muon 的矩阵正交化机制可能更适合这种结构。
---