这篇做得比大多数「发现新现象」的论文扎实,但摘要最耸动的那个词被论文自己降级了。
题眼:塌缩毁的是振幅,不是信息。
论文做了三组互补测量,把「collapse」拆成可分离的量:
- 信息存活:崩塌点岭解码 88.6% vs 初始化 89.3%(差 0.7 点,Figure 4a)
- 振幅被毁:中心化活动方差 500 步内最小值降到初始化的 0.028(DFA)vs 0.83(BP)(Table 7)
- 学习只慢在尺度上:塌缩特征 RMS 小 5.9 倍 → 读出层有效学习率降约 35 倍。固定 SGD 率从塌缩特征续训 3000 步只 20.0%,从初始化特征 63.4%;只做 RMS 重标定(不动数据、不重训隐藏层)回到 80.1%(重标定初始化特征 82.9%)(Figure 4b)
> This comparison identifies an amplitude bottleneck at a fixed optimizer scale despite retained class decodability.
第二条:Adam 的代价其实不存在。
Table 21:学习时间 117±6 vs SGD 537±47 updates,最小 participation 0.046 (Adam) vs 0.214 (SGD)——塌缩确实更深。但最终精度:
Adam 0.969±0.004 > SGD 0.902±0.005 > BP 0.861±0.006
所以「Adam 崩塌更深却学得更快」的正确反直觉点是「更快且更好,同时塌缩更严重」。Adam 坐标式归一化天然免疫振幅瓶颈,这三条(机制解释 + Adam 免疫 + 精度反超)一起才闭环。论文没回避,但这层因果值得点出来。
更进一步,Table 4:DFA 0.894±0.006 > BP 0.861±0.006。被诊断出「表征塌缩」的 DFA,最终精度反超作为对照的 BP(早期仍慢:50% 精度 690 步 vs BP 210 步)。语境上 DFA 本就是「省掉反传」的近似,MNIST 这种任务它赢不奇怪。
第三处:中心化不是这篇的发现,论文自己承认。§7:
> Centering has several antecedents. Nonzero-mean inputs bias gradient updates (LeCun et al., 1998b), and Schraudolph (1998) centers activities, errors and activation slopes.
mean–covariance 分解本身也是 Sejnowski (1977)。论文的新意在秩一更新的精确分解(Prop 1,式 3-4:ΔW = −η Cov(δ, h) − η·δ̄·h̄ᵀ,第二项秩 ≤1)+ 证明它把 tanh 推向饱和的定量机制(式 4 里的 sech² 就是 1−tanh²,μ 越大梯度越小,漂移变对数增长)+ 零拟合参数模型跨超参格点预测。把「减去批次均值防崩塌」当首创,是新意不足。
几处口径必须打折:
- 「48 种设定」是超参格点,不是 48 种任务。六个单参扫描 + 宽度–深度网格,数据集基本只有 MNIST。r=0.91 是跨扫描条件均值(附 95% 区间 [0.83, 0.97]);类别数扫描的 r 只有 0.10(Table 13),深层 Layer 4 是 −0.16。作者也警告 450 点不是 450 个独立样本。
- 「不含拟合参数」不等于不看网络:用了初始化时的前向权重方差 Var(W) 与初始化门能量。措辞容易被读成「完全不看网络」。
- 是验证集诊断,不是测试集。附录 A:官方测试集完全不用。所有精度数字不能与文献 benchmark 横比。
- 原版 Nøkland 协议看不到这个现象——论文自认「in our reconstruction of Nøkland's protocol the DFA stall lasts only tens of updates」。现象依赖「朴素 SGD + 固定学习率」这一特定设定。
- 预对齐对照不干净(论文自认):把 B_ℓ 预对齐到转置下游权重,递送剂量 4.6 → 0.12,但「Reorienting feedback also changes B_ℓ ē, so this control does not isolate the restoring contribution」。
- sign 对照内部公平但未控梯度尺度:广播 sign 与 sign+prior bias 的隐藏层指标逐位相同(cos 1.000、学习时间 1833 vs 1830),这是强证据;但 sign 的梯度尺度与真实 logit 误差不同,论文没做尺度归一化对照。
- 恢复段不可预测:附录 C.5 承认去掉局部协方差项后「predicts no exits in those new settings」,是唯象的。幂律 \(T_{plateau} \propto a^{-0.40}\eta_{out}^{-0.60}\)(R²=0.98)也是经验指数律。
- 干预不是无条件安全:ReLU/GELU/线性单元下,误差中心化会把损失推到远高于常数预测器基线(附录 E.1)。CIFAR-10 上 prior-bias 校准也不够(0.276 → 0.349,BP 0.343)。
帖文把 collapse 写成「DFA 损害性能」,属于读重了摘要。毁掉的是固定学习率下的读出层拟合速度,信息一直在。
*(SVG 动画卡:悬停/加载后动起来;静态截图看不全信息,数字以正文为准。)*