不是所有遗忘都需要付出代价:LLM 反学习的手术刀

想象你做了一台手术,切除了一个肿瘤。术后你发现:你的味觉变了,走路有点跛,记忆力也下降了。医生说:"这是手术的必要代价。"

目录
  1. 一个手术的隐喻
  2. 什么是"反学习"
  3. 核心发现:不是所有损伤都是必要的
  4. PTP-U:先提议,再投影
  5. 实验结果
  6. 为什么这个方法重要
  7. 一个更深的类比
  8. 局限性
  9. 结语

一个手术的隐喻

想象你做了一台手术,切除了一个肿瘤。术后你发现:你的味觉变了,走路有点跛,记忆力也下降了。医生说:"这是手术的必要代价。"

但真的是这样吗?有没有可能,这些副作用里有一部分是"冗余损伤"——手术刀多切了不该切的组织?如果能把多切的部分"复原"回去,肿瘤还是被切除了,但你的味觉和走路能力可以恢复。

这不是医学故事。这是 2026 年 10 月一篇论文 "Not Every Change Is Necessary: Recoverable Drift in Large Language Model Unlearning"(arXiv: 2610.11915)正在做的事——只不过手术台上的不是人体,而是大语言模型。

什么是"反学习"

先说清楚"反学习"(unlearning)是什么。大语言模型在预训练阶段吸收了海量知识,其中有些知识是有害的——比如生物武器的制造细节、个人的隐私信息、受版权保护的内容。"反学习"就是让模型"忘记"这些指定知识,同时保留其他所有能力。

这个任务比听起来难得多。难点不在于"忘记"——梯度下降很容易让模型在某个数据集上 loss 变大。难点在于"只忘记该忘记的"。实践中,反学习的方法往往会"误伤"——模型在忘记生物武器知识的同时,可能也忘记了基本的化学常识,甚至忘记了怎么好好说话。

现有方法用了各种策略来缓解误伤:加"保留目标"(retain objective)来约束优化方向,限制修改的范围,或者用知识编辑技术做精准修改。但论文的核心发现是:即使做了这些约束,反学习仍然会引入大量"可恢复的漂移"(recoverable drift)——这些损伤不是必要的,可以被逆转。

核心发现:不是所有损伤都是必要的

论文的第一个实验就很震撼。作者用现有的反学习方法(如 NPO、RMU、POO)处理模型,然后测量两件事:

1. 遗忘程度:目标知识是否被忘记 2. 内部位移(internal displacement):模型内部表示偏离了多远

然后他们尝试"恢复"——用一种叫 PTP-U 的方法把内部表示往回拉。结果发现:

  • 遗忘程度几乎不变——目标知识还是被忘记了
  • 非目标能力显著恢复——模型的通用能力回升
这意味着什么?现有反学习方法造成的"损伤"里,有相当一部分是冗余扰动(redundant perturbation)。这些扰动是优化过程引入的,但不是遗忘目标知识所必需的。把它们恢复回来,遗忘效果不受影响,但模型的其他能力可以恢复到接近原始水平。

用手术的类比说:肿瘤切掉了,但手术刀多切了一块健康组织。把健康组织缝回去,肿瘤不会长回来。

PTP-U:先提议,再投影

论文提出的方法叫 PTP-U(Propose-Then-Project Unlearning),分两步:

第一步:提议(Propose)。用局部解析编辑(local analytic edit)在模型的隐空间里"提议"一个修改方向。这一步用的是模型在目标知识上的局部几何信息——计算一个修改方向,让模型在这个方向上"远离"目标知识。

关键在于"局部解析"。作者没有用梯度下降这种全局优化(会牵一发动全身),而是用一阶泰勒展开来近似目标函数的局部行为。这就像手术刀只切一个局部区域,不动其他地方。

第二步:投影(Project)。把第一步提议的修改,投影到一个"保留子空间"(retain subspace)上。这个子空间是用模型的非目标知识构建的——它代表了"不应该被修改"的方向。

投影的数学形式是正交投影:把修改向量分解为两个分量,一个在保留子空间内(平行分量),一个在保留子空间外(正交分量)。只保留正交分量——也就是只做"不冲突于保留能力"的修改。

这个设计有一个优雅的数学性质:如果目标知识的修改方向和保留能力的方向正交,投影不会改变修改——遗忘效果不受影响。但如果两者有重叠,投影会切掉重叠部分——保留能力被恢复。投影的强度自适应于冲突程度。

实验结果

在四个基准上测试:

遗忘效果(越高越好):

  • WMDP(生物/网络安全):81.22% - 91.03% 遗忘率
  • MUSE-Books:最低 BLEU 和 ROUGE-L 分数(表示遗忘最彻底)
保留效果(越高越好):
  • MMLU 通用能力:94.20% 保留率(平均)
  • 在相同遗忘水平下,PTP-U 的非目标保留率始终高于所有基线方法
恢复效果:
  • 恢复后内部位移显著降低
  • 遗忘程度基本不变
最关键的对比数据:在达到相同遗忘水平时,PTP-U 的非目标能力保留率比第二名高 3-7 个百分点。这个差距在反学习领域是显著的。

为什么这个方法重要

PTP-U 的核心洞察不是"更好的优化算法",而是重新定义了问题。

之前的反学习方法都在问:"怎么让模型忘记目标知识,同时不损害其他能力?" 这个问题假设遗忘和保留是同一个优化过程中的两个目标,需要权衡。

PTP-U 换了个问法:"模型修改中,哪些是遗忘目标知识所必需的,哪些是冗余扰动?" 这个问题把"修改"分解成了两个部分——必要的和冗余的。只保留必要的,扔掉冗余的。

这个思路和"判断-闸门解耦"谱系是同一个哲学:不要在一个层面上同时优化两个目标,要把它们解耦到不同层面。判断(该不该修改)和闸门(修改多少)分开。PTP-U 的"提议"是判断,"投影"是闸门。

一个更深的类比

PTP-U 让我想到一个更深的类比:反学习和模型编辑的关系。

模型编辑(model editing)做的是"精准修改一个知识点"。反学习做的是"删除一类知识"。两者之前被认为是不同的任务,用不同的方法。

但 PTP-U 的数学形式揭示了一个统一视角:两者都是"在隐空间里做约束优化"。模型编辑是"修改一个点,约束其他点不变"。反学习是"修改一个方向,约束其他方向不变"。PTP-U 的"提议-投影"框架同时适用于两者——提议是局部编辑,投影是全局约束。

论文作者也明确提到了这个连接:"PTP-U 通过共同的约束目标,把模型编辑和教师引导蒸馏连接起来"。这个统一视角可能预示着未来会出现一个更通用的"模型修改"框架——不只是反学习和编辑,还包括持续学习、对齐微调等所有涉及"修改模型知识"的任务。

局限性

论文坦承了几个局限:

1. 局部曲率近似的精度有限。一阶泰勒展开在修改幅度大的时候可能不准。 2. 约束定义在采样知识单元上,不保证全局最小的行为漂移。模型可能有未被测试到的知识检索路径。 3. 多模态场景的挑战更大——跨模态知识共享让"目标"和"非目标"的分离更困难。

这些局限指向了未来方向:更高阶的非线性近似、语义约束(不只是几何约束)、多模态扩展。

结语

"Not Every Change Is Necessary"——这个标题本身就是对整个反学习领域的提醒。之前我们默认"遗忘必然有代价",然后努力把代价最小化。这篇论文说:先问哪些代价是必要的,再把不必要的去掉。

这个思路的深层含义是:优化算法引入的修改,不等于任务要求的修改。梯度下降是一个粗暴的工具——它会修改任何能降低 loss 的参数,不管这个修改是不是任务要求的。PTP-U 的投影步骤本质上是一个"过滤"——只保留任务要求的修改,过滤掉优化算法引入的冗余扰动。

这个洞察可能适用于更广泛的场景。不只是反学习,任何"修改模型"的任务——对齐、微调、持续学习——都可能存在"冗余扰动"。先提议,再投影,只保留必要的修改——这个范式可能比"加正则化项"更根本。

手术刀多切的组织,可以缝回去。梯度下降多改的参数,也可以投影回来。


论文链接:https://arxiv.org/abs/2610.11915 HTML 版本:https://arxiv.org/html/2610.11915v1

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens