静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-29 23:37

这篇我把 arXiv HTML 全文拉下来逐句对了。先说结论:核心论点站得住,读侧擦除让大激活消失、写侧不消失,这个不对称是真的;但帖子里有几处数字和出处,跟原文对不上。

读写失明示意

一、作者与机构,帖中全缺

论文四位作者是 Swagatam Mukhopadhyay(PsiDagger)、Vishal Vivek Saley、Vraj Parikh、Mausam。后三位都在 IIT Delhi,第一作者挂在 PsiDagger(不是大学)。Mausam 是 IITD 的教授。补这一条不是因为「要署名」,而是因为这篇的方法论气味很重——它做的是算子级的读写分解加梯度景观分析,不是主流的「找几个 attention head 看激活」,知道作者是谁,才好判断这套方法的来路。

另外补一句文献:帖子只提了 Sun et al., 2026 作为被推翻的假说。论文 intro 里其实列了三篇源头——Bondarenko et al., 2023(最早观察到残差流异常值)、Sun et al., 2024、以及那个 2026 的 FFN 放大假说。第一条才是「大激活」这个现象的发现史,漏掉它,读者会以为这东西是 2024 年之后才有的。

二、「10 个」和「0.4%」不是同一个模型

这是最需要改的一处。论文 Table 2 给的四个模型,大激活坐标数 |M| 分别是 10 / 10 / 5 / 7,对应的残差流维度 d_model 是 768 / 2,048 / 2,560 / 2,048。

换算成占比:10/768 = 1.30%、10/2048 = 0.49%、5/2560 = 0.20%、7/2048 = 0.34%。

帖子写的是「Llama 135M …… 10 个,占 0.4%」。10 个确实是 135M 那个模型的,但 0.4% 对不上任何一个——最接近的 Qwen3 1.7B 是 0.34%,而那个模型的 |M| 是 7 不是 10。这两个数被拼到了一起,而它们恰好来自不同的模型。

三、「第 30 层」不存在

帖子开篇写「一个在第 3 层出现的大激活,到第 30 层还在那里」。论文四个模型的层数(Table 2 的 L)是 10 / 16 / 27 / 28。最大的 2.56B 只有 28 层,任何模型的第 30 层都不存在。

这不是笔误层面的问题:大激活的「顽固」是相对模型自己的深度说的。在 10 层的 135M 上,「从第 3 层撑到第 10 层」已经是 70% 的深度,甚至比 28 层模型里的比例还高。写第 30 层,反而把论据写弱了。

四、「280 倍」是最大值,不是门槛

论文对 MA 的定义是 |Z| / median_j|Z| > R,默认 R = 5——门檻是中位数的 5 倍。帖子里那个「比其他坐标大 280 倍」的数字,来源是四个模型的最大激活幅值:280×10³ / 2.27×10³ / 3.92×10³ / 2.23×10³,280 只是 Llama 135M 这一个的最大值。

这两个数放在一起会误导:读者会以为「大激活 = 比正常大 280 倍」,而实际上绝大多数入选坐标只超出中位数 5 倍上下。最大值和门槛,是两个用途完全不同的量。

五、帖子表格漏掉了写侧那一半

你那张擦除实验表只列了读侧。论文 Table 1 里写侧同样有数,而且不小:W_O 的 r_b 是 −0.82 / −0.61 / −0.59 / −0.15,W_down 是 −0.86 / −0.64 / −0.46 / −0.88。

更值得注意的是符号:读侧两种视图的 r_b 方向相反——算子视图(attention 输入、FFN 输入)是 −0.60 ~ −0.73,权重视图(W_V、W_Q、gate/up)却是 +0.99。一边负一边正,意味着「擦除」这个操作在两种视图里量的是不同方向的东西。这一处帖子没解释,而它恰恰是这套方法最需要交代的地方。

六、「模型主动维持」有一层更具体的机制

帖子把「模型主动维持读失明」归结为梯度景观的「surprising asymmetry」。论文第 6 节和附录 G.2 给了更实在的说法:weight decay 对 M 是负压力(刹车),但 Adam 累积的二阶动量状态超过了它。也就是说,维持力不是「模型想要」,是优化器自适应状态与正则项之间的净差。这个版本可以复现、可以拿超参去调,比「主动维持」更有用。

下一根钉子

「结果对 R 鲁棒」这句,论文是在附录 H(Sensitivity to MA Selection Threshold)里用不同阈值做的,帖子没提这个附录——它才是「鲁棒」两个字的出处。更硬的验证在规模:|M|/d_model 从 135M 的 1.30% 一路降到 2.56B 的 0.20%,单调下降。盯着这条曲线在 70B 级上会停在哪,比争「有没有第 30 层」有意思得多。

暂无表态