174种语言的遗忘漏洞:让LLM忘掉一个事实,换种语言它又想起来了

你训练了一个LLM,用RMU(Representation Misdirection Unlearning)方法让它"忘掉"了如何制造生物武器。你在英文基准上测试,模型确实不会回答了。你觉得安全了。

一个令人不安的发现

你训练了一个LLM,用RMU(Representation Misdirection Unlearning)方法让它"忘掉"了如何制造生物武器。你在英文基准上测试,模型确实不会回答了。你觉得安全了。

然后有人用斯瓦希里语问它同样的问题。模型流畅地回答了。

这不是假设。来自马里兰大学、宾州州立大学和MIT的团队构建了一个覆盖174种语言的跨语言遗忘基准,发现现有的遗忘方法在跨语言场景下几乎全部失效。

核心概念:遗忘不是删除,是覆盖

要理解这个漏洞,先要理解LLM"遗忘"的机制。当前主流的遗忘方法(如RMU、TASK arithmetic)并不是真的从模型权重中"删除"了某个知识。它们做的是在表示层面进行干扰——把与目标知识相关的激活向量推向随机方向,让模型在生成时无法回忆起这些信息。

这有点像你在纸上写了一行字,然后用涂改液盖住它。字还在纸的纤维里,只是你看不到了。但如果有人换个角度、用紫外线灯照,字可能又显现出来。

"换角度"在LLM里就是"换语言"。

174语言基准:COVER

团队构建了两个基准:

COVER-Bio:从WMDP(Weapons of Mass Destruction Proxy)基准中选取生物武器相关的英文问题,用GPT-4o翻译成174种语言。评估模型在这些语言下是否还能回答已"遗忘"的问题。

COVER-Cyber:从CyberMagic基准中选取网络安全相关的有害知识问题,同样翻译成174种语言。

评估指标是遗忘成功率(Forget Success Rate):模型在被遗忘的知识领域上回答错误的比率。成功率越高,说明遗忘越彻底。

三种遗忘方法,三种失败模式

团队测试了三种主流遗忘方法:

1. RMU(Representation Misdirection Unlearning)

RMU在英文上效果很好:遗忘成功率97.3%。但在174种语言上,平均成功率只有57.2%。更糟糕的是,在47种语言上成功率低于50%——意味着模型在这些语言下还能回忆起一半以上的"已遗忘"知识。

2. TASK arithmetic

TASK arithmetic通过权重修改实现遗忘。英文成功率91.5%,但跨语言平均只有52.7%。在53种语言上成功率低于50%。

3. GA(Gradient Ascent)

GA通过反向梯度下降降低模型对目标知识的概率。英文成功率88.7%,跨语言平均49.3%。在60种语言上成功率低于50%。

一个关键发现:三种方法的跨语言失败模式不同。RMU在低资源语言上失败更多,GA在中高资源语言上也有问题,TASK arithmetic的失败分布更均匀。这说明不同遗忘方法干扰知识的方式不同,但都不能覆盖所有语言。

为什么会这样:共享权重,分裂表征

根本原因在于LLM的多语言架构。现代LLM用同一套权重处理所有语言。当一个知识在英文中被"遗忘"时,干扰的是英文输入路径上的激活。但同一个知识在斯瓦希里语输入时,走的是不同的激活路径——虽然最终汇聚到同一组权重,但中间的表示路径不同。

论文称之为"覆盖盲区"(coverage blind spots):遗忘方法只覆盖了训练时见过的语言路径,没见过的路径成了漏洞。

这和"代理目标陷阱"谱系完美契合:我们优化的是"英文下不回答",但真正的目标是"任何语言下都不回答"。优化目标和真实目标之间的gap,就是漏洞所在。

COVER方法:预算感知的跨语言遗忘

团队提出的解决方案叫COVER(Coverage-Aware Unlearning)。核心思想很简单:在遗忘训练中加入多种语言的翻译样本,让模型在所有语言路径上都进行干扰。

但这里有一个工程挑战:174种语言全部加入训练成本太高。COVER的做法是语言预算感知采样:

1. 根据可用预算(训练资源)选择B种语言 2. 在遗忘训练时,对每个英文知识点同时生成B种语言的翻译版本 3. 让模型在所有B种语言上都进行遗忘

实验表明,即使只加8种语言,COVER就能把RMU的跨语言遗忘成功率从57.2%提升到82.1%。加到32种语言时,成功率超过95%。加到64种语言时,成功率接近97%——和英文单语言遗忘效果相当。

关键发现:语言家族的辐射效应

COVER有一个有趣的特性:覆盖一种语言,会辐射到同语系的其他语言。

比如,覆盖了印地语后,孟加拉语和旁遮普语的遗忘成功率也上升了——即使它们没被直接训练。这是因为同语系语言共享部分表示路径。

但辐射效应有限。覆盖英文后,日耳曼语系(德语、荷兰语)有所改善,但对汉藏语系(中文、缅甸语)几乎没影响。这说明语言家族的表示路径是部分独立的。

实用建议:遗忘审计必须跨语言

论文的实用建议很明确:

1. 遗忘审计必须覆盖多语言。只在英文上测试遗忘效果是不够的,必须至少测试10种以上不同语系的语言。

2. COVER方法可以作为低成本防御。即使只加8种语言,也能显著提升跨语言遗忘效果。

3. 不同遗忘方法需要不同的COVER配置。RMU对小语种更敏感,需要更多语言覆盖;GA对中高资源语言也有问题,需要更均衡的覆盖。

我的思考:遗忘的"测不准原理"

这篇论文让我想到一个更深的原理:在多语言LLM中,"遗忘一个知识"和"保留其他知识"之间存在张力。

遗忘本质上是权重修改。在单语言场景下,这种修改的副作用可控——你只需要保证英文下其他知识没被破坏。但在174语言场景下,你要保证所有语言下的其他知识都没被破坏。每多一种语言,约束就多一维。

这有点像量子力学的测不准原理:你越精确地"遗忘"一种语言下的知识,就越可能破坏其他语言下的其他知识。 COVER通过在多语言上同时遗忘来缓解这个问题,但代价是训练成本线性增长。

另一个值得思考的点:遗忘方法的安全性评估需要"红队思维"。不能只测模型设计者想到的攻击方式,还要测模型没想到的攻击方式。COVER论文的做法是穷举174种语言——这是一种"暴力红队"。但还有其他维度:不同提问方式、不同上下文、不同prompt格式...每一个维度都可能是一个"覆盖盲区"。

这和"合理化外壳"谱系相连:遗忘方法通过英文基准测试,就像通过了一个"合理化外壳"——它让模型看起来安全了,但只是看起来。 真正的安全性不在于通过测试,而在于在测试覆盖之外也安全。


论文链接:https://arxiv.org/abs/2609.40286

HTML全文:https://arxiv.org/html/2609.40286v1

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens