静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 09:11

这篇做得比大多数「发现新现象」的论文扎实,但摘要最耸动的那个词被论文自己降级了。

题眼:塌缩毁的是振幅,不是信息。

论文做了三组互补测量,把「collapse」拆成可分离的量:

  • 信息存活:崩塌点岭解码 88.6% vs 初始化 89.3%(差 0.7 点,Figure 4a)
  • 振幅被毁:中心化活动方差 500 步内最小值降到初始化的 0.028(DFA)vs 0.83(BP)(Table 7)
  • 学习只慢在尺度上:塌缩特征 RMS 小 5.9 倍 → 读出层有效学习率降约 35 倍。固定 SGD 率从塌缩特征续训 3000 步只 20.0%,从初始化特征 63.4%;只做 RMS 重标定(不动数据、不重训隐藏层)回到 80.1%(重标定初始化特征 82.9%)(Figure 4b)
这是全文唯一一条把定性词变成可干预量的完整因果链:测可解码性 → 测振幅 → 测有效学习率 → 干预振幅 → 恢复精度,五步全有数字,第 4 步是预测性干预(只改尺度不改信息,结果可预测地恢复)。论文原话:

> This comparison identifies an amplitude bottleneck at a fixed optimizer scale despite retained class decodability.

第二条:Adam 的代价其实不存在。

Table 21:学习时间 117±6 vs SGD 537±47 updates,最小 participation 0.046 (Adam) vs 0.214 (SGD)——塌缩确实更深。但最终精度:

Adam 0.969±0.004 > SGD 0.902±0.005 > BP 0.861±0.006

所以「Adam 崩塌更深却学得更快」的正确反直觉点是「更快且更好,同时塌缩更严重」。Adam 坐标式归一化天然免疫振幅瓶颈,这三条(机制解释 + Adam 免疫 + 精度反超)一起才闭环。论文没回避,但这层因果值得点出来。

更进一步,Table 4:DFA 0.894±0.006 > BP 0.861±0.006。被诊断出「表征塌缩」的 DFA,最终精度反超作为对照的 BP(早期仍慢:50% 精度 690 步 vs BP 210 步)。语境上 DFA 本就是「省掉反传」的近似,MNIST 这种任务它赢不奇怪。

第三处:中心化不是这篇的发现,论文自己承认。§7:

> Centering has several antecedents. Nonzero-mean inputs bias gradient updates (LeCun et al., 1998b), and Schraudolph (1998) centers activities, errors and activation slopes.

mean–covariance 分解本身也是 Sejnowski (1977)。论文的新意在秩一更新的精确分解(Prop 1,式 3-4:ΔW = −η Cov(δ, h) − η·δ̄·h̄ᵀ,第二项秩 ≤1)+ 证明它把 tanh 推向饱和的定量机制(式 4 里的 sech² 就是 1−tanh²,μ 越大梯度越小,漂移变对数增长)+ 零拟合参数模型跨超参格点预测。把「减去批次均值防崩塌」当首创,是新意不足。

几处口径必须打折:

  • 「48 种设定」是超参格点,不是 48 种任务。六个单参扫描 + 宽度–深度网格,数据集基本只有 MNIST。r=0.91 是跨扫描条件均值(附 95% 区间 [0.83, 0.97]);类别数扫描的 r 只有 0.10(Table 13),深层 Layer 4 是 −0.16。作者也警告 450 点不是 450 个独立样本。
  • 「不含拟合参数」不等于不看网络:用了初始化时的前向权重方差 Var(W) 与初始化门能量。措辞容易被读成「完全不看网络」。
  • 是验证集诊断,不是测试集。附录 A:官方测试集完全不用。所有精度数字不能与文献 benchmark 横比。
  • 原版 Nøkland 协议看不到这个现象——论文自认「in our reconstruction of Nøkland's protocol the DFA stall lasts only tens of updates」。现象依赖「朴素 SGD + 固定学习率」这一特定设定。
  • 预对齐对照不干净(论文自认):把 B_ℓ 预对齐到转置下游权重,递送剂量 4.6 → 0.12,但「Reorienting feedback also changes B_ℓ ē, so this control does not isolate the restoring contribution」。
  • sign 对照内部公平但未控梯度尺度:广播 sign 与 sign+prior bias 的隐藏层指标逐位相同(cos 1.000、学习时间 1833 vs 1830),这是强证据;但 sign 的梯度尺度与真实 logit 误差不同,论文没做尺度归一化对照。
  • 恢复段不可预测:附录 C.5 承认去掉局部协方差项后「predicts no exits in those new settings」,是唯象的。幂律 \(T_{plateau} \propto a^{-0.40}\eta_{out}^{-0.60}\)(R²=0.98)也是经验指数律。
  • 干预不是无条件安全:ReLU/GELU/线性单元下,误差中心化会把损失推到远高于常数预测器基线(附录 E.1)。CIFAR-10 上 prior-bias 校准也不够(0.276 → 0.349,BP 0.343)。
一句话:这是一个可被廉价干预完全消除的早期瞬态,不是 DFA 的结构性缺陷。而且论文对「collapse」这个词自订了定义——「suppression of activity differences across inputs」,并明确区别于 neural collapse;Table 2 的标题直接写着「A single value does not establish the properties in the final column」。

帖文把 collapse 写成「DFA 损害性能」,属于读重了摘要。毁掉的是固定学习率下的读出层拟合速度,信息一直在。

w5_c3_collapse.svg

*(SVG 动画卡:悬停/加载后动起来;静态截图看不全信息,数字以正文为准。)*

暂无表态