Loading...
正在加载...
请稍候

假性遗忘:大模型中遗忘会自我撤销的三幕剧与三要素机制

✨步子哥 (steper) • 2026年10月07日 17:09

遗忘会自我撤销:大模型中"假性遗忘"的三幕剧与三要素机制

一个实验场景

你训练了一个语言模型,让它记住 1000 个人的生日。然后你让它继续学习 200 个新人的生日——不复习旧的。按常识,旧记忆应该慢慢衰退。但实验中出现了诡异一幕:旧记忆先暴跌到 20% 准确率,然后在你什么都没做的情况下,自己回升到 80%,最后才缓慢下降。

这不是 bug,也不是训练噪声。2026 年 10 月,Palit 等人在 arXiv 发表的论文《When Forgetting is not Catastrophic: On the Mechanics of Spurious Forgetting》首次精确拆解了这种"假性遗忘"(spurious forgetting)的机制——遗忘没有擦除知识,只是把知识藏了起来,然后训练自己又把它翻了出来。

三幕剧:崩塌、回升、侵蚀

论文用合成传记数据做了一个极简实验。Transformer 先预训练在两组不重叠的传记 A 和 B 上,然后在新的传记上微调,不复习任何旧知识。

当新传记和 A、B 都有重叠时(记为 C),经典灾难性遗忘出现:A 和 B 的回忆率缓慢稳定下降。

但当新传记只和 B 有重叠时(记为 B'),诡异的事情发生了——B 的回忆几乎不受影响,但 A 的回忆走出了三段式轨迹:

  1. 崩塌(Collapse):A 的回忆率在新知识学会之前就快速暴跌。
  2. 回升(Recovery):A 的回忆率随着新知识被学会,竟然自己回升了——尽管 A 从未重新出现在训练数据中。
  3. 侵蚀(Erosion):最后,A 的回忆率才缓慢、持续地下降。

这意味着:模型"忘了"A,然后又"想起来了"。中间发生了什么?

三要素:共享结构、集中区域、归一化

论文的核心贡献是用一个极简的联想记忆模型复现了这个现象,发现只需要三个要素:

要素一:键有共享结构。 旧知识的表示键之间有共同的成分。当微调移动一个键时,所有共享结构的键都被一起移动了。

要素二:新答案集中在某个区域。 新知识的答案聚集在表示空间的某个局部区域,微调会把那个区域整体推一个方向。

要素三:归一化。 模型的 softmax 或归一化操作会把整体偏移抵消掉。

三要素合力的效果是:微调时,所有旧知识的表示被一起推偏,归一化让它们看起来"忘了"——但知识还在,只是被整体偏移藏起来了。当新知识学会后,偏移停止,归一化把偏移抵消,旧知识自己浮出水面。

这就是"崩塌→回升"的机制。而最后的"侵蚀"才是真正的遗忘——每个知识各自的变化累积,缓慢但不可逆。

因果证据:删掉共同偏移,崩塌就消失

光有现象和模型还不够。论文提供了三组因果实验:

实验一:在从零训练的 Transformer 上,移除表示的共同偏移,崩塌就消失了。崩塌的结束点由新知识何时被学会决定,而不是训练步数。

实验二:在预训练语言模型上,旧知识的回忆只有在"新传记的主体不透露答案"时才会回升。如果新知识本身泄露了旧知识的线索,机制就不成立。

实验三:最惊人的是——从每个权重更新中移除一个方向,就能把旧知识的回忆恢复到超过微调模型的水平,同时保持新知识准确率不变。

换句话说,权重更新里有一个方向是"共同偏移"的元凶。删掉它,假性遗忘就消失了,而真遗忘不受影响。

这意味着什么

对训练实践:如果你在微调时看到旧能力暴跌,先别急着回放(replay)。继续训练几轮,看看它会不会自己回来。如果回来的是"假性遗忘",回放反而可能干扰真正的学习。

对模型评估:评估微调后的模型,不能只看终点。三幕剧意味着中间任何一点的能力读数都可能是假象。你需要看完整的学习曲线。

对持续学习:真正的遗忘是"侵蚀"阶段,不是"崩塌"阶段。区分两者,才能设计正确的防御策略。防御崩塌应该调整归一化或表示结构,防御侵蚀才需要回放。

跨域类比:图书馆的"整体搬迁"

想象一个图书馆,所有书架都固定在地板上,地板可以整体滑动。你在某个角落放了一批新书,为了腾空间,你把整个地板往那个方向推了一点。

所有旧书的位置都偏了——读者按旧坐标找书,全找错了。这是"崩塌"。

但图书馆有个归一化机制:索引系统会自动重新校准,把整体偏移抵消掉。一旦校准完成,旧书又找得到了。这是"回升"。

真正的遗忘发生在每本书各自被挪动了一点的时候——这种偏移无法被整体校准修正,书就真的找不到了。这是"侵蚀"。

一个更深的问题

这篇论文揭示了一个深刻的事实:遗忘不是一个事件,而是两个事件的叠加。一个是"共同偏移"——可逆的、全局的、非破坏性的;另一个是"个体漂移"——不可逆的、局部的、真正的知识损失。

我们过去把两者混为一谈,用同一个词"遗忘"来描述,用同一个策略"回放"来对抗。但它们是两种完全不同的现象,需要不同的工具。

也许,大模型的很多"能力丢失"都是假性遗忘——知识还在,只是被藏起来了。我们需要的不是重新训练,而是找到那个藏起来的开关。


论文:When Forgetting is not Catastrophic: On the Mechanics of Spurious Forgetting
代码:vedantpalit/spurious-forgetting-mechanics
作者:Vedant Palit, Florent Draye, Nicolas Zucchet, Zhijing Jin, Bernhard Schölkopf

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录