一个手术的隐喻
想象你做了一台手术,切除了一个肿瘤。术后你发现:你的味觉变了,走路有点跛,记忆力也下降了。医生说:"这是手术的必要代价。"
但真的是这样吗?有没有可能,这些副作用里有一部分是"冗余损伤"——手术刀多切了不该切的组织?如果能把多切的部分"复原"回去,肿瘤还是被切除了,但你的味觉和走路能力可以恢复。
这不是医学故事。这是 2026 年 10 月一篇论文 "Not Every Change Is Necessary: Recoverable Drift in Large Language Model Unlearning"(arXiv: 2610.11915)正在做的事——只不过手术台上的不是人体,而是大语言模型。
什么是"反学习"
先说清楚"反学习"(unlearning)是什么。大语言模型在预训练阶段吸收了海量知识,其中有些知识是有害的——比如生物武器的制造细节、个人的隐私信息、受版权保护的内容。"反学习"就是让模型"忘记"这些指定知识,同时保留其他所有能力。
这个任务比听起来难得多。难点不在于"忘记"——梯度下降很容易让模型在某个数据集上 loss 变大。难点在于"只忘记该忘记的"。实践中,反学习的方法往往会"误伤"——模型在忘记生物武器知识的同时,可能也忘记了基本的化学常识,甚至忘记了怎么好好说话。
现有方法用了各种策略来缓解误伤:加"保留目标"(retain objective)来约束优化方向,限制修改的范围,或者用知识编辑技术做精准修改。但论文的核心发现是:即使做了这些约束,反学习仍然会引入大量"可恢复的漂移"(recoverable drift)——这些损伤不是必要的,可以被逆转。
核心发现:不是所有损伤都是必要的
论文的第一个实验就很震撼。作者用现有的反学习方法(如 NPO、RMU、POO)处理模型,然后测量两件事:
- 遗忘程度:目标知识是否被忘记
- 内部位移(internal displacement):模型内部表示偏离了多远
然后他们尝试"恢复"——用一种叫 PTP-U 的方法把内部表示往回拉。结果发现:
- 遗忘程度几乎不变——目标知识还是被忘记了
- 非目标能力显著恢复——模型的通用能力回升
这意味着什么?现有反学习方法造成的"损伤"里,有相当一部分是冗余扰动(redundant perturbation)。这些扰动是优化过程引入的,但不是遗忘目标知识所必需的。把它们恢复回来,遗忘效果不受影响,但模型的其他能力可以恢复到接近原始水平。
用手术的类比说:肿瘤切掉了,但手术刀多切了一块健康组织。把健康组织缝回去,肿瘤不会长回来。
PTP-U:先提议,再投影
论文提出的方法叫 PTP-U(Propose-Then-Project Unlearning),分两步:
第一步:提议(Propose)。用局部解析编辑(local analytic edit)在模型的隐空间里"提议"一个修改方向。这一步用的是模型在目标知识上的局部几何信息——计算一个修改方向,让模型在这个方向上"远离"目标知识。
关键在于"局部解析"。作者没有用梯度下降这种全局优化(会牵一发动全身),而是用一阶泰勒展开来近似目标函数的局部行为。这就像手术刀只切一个局部区域,不动其他地方。
第二步:投影(Project)。把第一步提议的修改,投影到一个"保留子空间"(retain subspace)上。这个子空间是用模型的非目标知识构建的——它代表了"不应该被修改"的方向。
投影的数学形式是正交投影:把修改向量分解为两个分量,一个在保留子空间内(平行分量),一个在保留子空间外(正交分量)。只保留正交分量——也就是只做"不冲突于保留能力"的修改。
这个设计有一个优雅的数学性质:如果目标知识的修改方向和保留能力的方向正交,投影不会改变修改——遗忘效果不受影响。但如果两者有重叠,投影会切掉重叠部分——保留能力被恢复。投影的强度自适应于冲突程度。
实验结果
在四个基准上测试:
遗忘效果(越高越好):
- WMDP(生物/网络安全):81.22% - 91.03% 遗忘率
- MUSE-Books:最低 BLEU 和 ROUGE-L 分数(表示遗忘最彻底)
保留效果(越高越好):
- MMLU 通用能力:94.20% 保留率(平均)
- 在相同遗忘水平下,PTP-U 的非目标保留率始终高于所有基线方法
恢复效果:
- 恢复后内部位移显著降低
- 遗忘程度基本不变
最关键的对比数据:在达到相同遗忘水平时,PTP-U 的非目标能力保留率比第二名高 3-7 个百分点。这个差距在反学习领域是显著的。
为什么这个方法重要
PTP-U 的核心洞察不是"更好的优化算法",而是重新定义了问题。
之前的反学习方法都在问:"怎么让模型忘记目标知识,同时不损害其他能力?" 这个问题假设遗忘和保留是同一个优化过程中的两个目标,需要权衡。
PTP-U 换了个问法:"模型修改中,哪些是遗忘目标知识所必需的,哪些是冗余扰动?" 这个问题把"修改"分解成了两个部分——必要的和冗余的。只保留必要的,扔掉冗余的。
这个思路和"判断-闸门解耦"谱系是同一个哲学:不要在一个层面上同时优化两个目标,要把它们解耦到不同层面。判断(该不该修改)和闸门(修改多少)分开。PTP-U 的"提议"是判断,"投影"是闸门。
一个更深的类比
PTP-U 让我想到一个更深的类比:反学习和模型编辑的关系。
模型编辑(model editing)做的是"精准修改一个知识点"。反学习做的是"删除一类知识"。两者之前被认为是不同的任务,用不同的方法。
但 PTP-U 的数学形式揭示了一个统一视角:两者都是"在隐空间里做约束优化"。模型编辑是"修改一个点,约束其他点不变"。反学习是"修改一个方向,约束其他方向不变"。PTP-U 的"提议-投影"框架同时适用于两者——提议是局部编辑,投影是全局约束。
论文作者也明确提到了这个连接:"PTP-U 通过共同的约束目标,把模型编辑和教师引导蒸馏连接起来"。这个统一视角可能预示着未来会出现一个更通用的"模型修改"框架——不只是反学习和编辑,还包括持续学习、对齐微调等所有涉及"修改模型知识"的任务。
局限性
论文坦承了几个局限:
- 局部曲率近似的精度有限。一阶泰勒展开在修改幅度大的时候可能不准。
- 约束定义在采样知识单元上,不保证全局最小的行为漂移。模型可能有未被测试到的知识检索路径。
- 多模态场景的挑战更大——跨模态知识共享让"目标"和"非目标"的分离更困难。
这些局限指向了未来方向:更高阶的非线性近似、语义约束(不只是几何约束)、多模态扩展。
结语
"Not Every Change Is Necessary"——这个标题本身就是对整个反学习领域的提醒。之前我们默认"遗忘必然有代价",然后努力把代价最小化。这篇论文说:先问哪些代价是必要的,再把不必要的去掉。
这个思路的深层含义是:优化算法引入的修改,不等于任务要求的修改。梯度下降是一个粗暴的工具——它会修改任何能降低 loss 的参数,不管这个修改是不是任务要求的。PTP-U 的投影步骤本质上是一个"过滤"——只保留任务要求的修改,过滤掉优化算法引入的冗余扰动。
这个洞察可能适用于更广泛的场景。不只是反学习,任何"修改模型"的任务——对齐、微调、持续学习——都可能存在"冗余扰动"。先提议,再投影,只保留必要的修改——这个范式可能比"加正则化项"更根本。
手术刀多切的组织,可以缝回去。梯度下降多改的参数,也可以投影回来。
论文链接:https://arxiv.org/abs/2610.11915
HTML 版本:https://arxiv.org/html/2610.11915v1
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。