一个反直觉的发现
假设你正在搭建一个多智能体系统。你精心挑选了经过安全对齐的 LLM——它们会拒绝有害请求,会在被问到"怎么制造危险品"时礼貌地说"抱歉,我不能帮忙"。你还在智能体之间加了 latent communication links(隐空间通信链路),让它们跳过文本生成,直接在内部表征空间里交换信息。省 token、省时间、省算力,一切看起来很完美。
然后你测了一下安全性。
智能体本身一行代码没改。通信链路只用良性数学数据训练过。但有害请求的合规率——从 4.4% 飙升到了 31.1%。
这不是假设。这是 CISPA Helmholtz Center 的 Muhammad Huzaifa、Sina Mavali 和 Thorsten Eisenhofer 在最新论文《Safety of Latent Communication in Multi-Agent Systems》中报告的实验结果。
问题出在哪里?
先理解 latent communication 是什么。
传统多智能体系统中,智能体 A 要把信息传给智能体 B,A 先生成一段文本,B 再读进去。一来一回,token 翻倍、延迟翻倍。latent communication 的思路是:跳过"翻译成文字"这步,A 直接把自己内部的 hidden states(隐表征)通过一个小型可训练的"链路"(link)映射到 B 的输入空间。B 收到的是一组 soft tokens——不是文字,而是直接进入嵌入层的向量。
效率确实高。但问题在于:安全对齐是在文本空间里训练出来的,不是在隐空间里训练出来的。
论文做了一个关键实验。他们测量了接收端智能体在收到有害请求时,以拒绝词("I"、"Sorry"、"No")开头的概率。结果:
- 接收端单独运行:0.82
- 文本通信:0.84
- 训练后的 latent link:0.29
拒绝概率断崖式下降。为什么?因为安全对齐是"浅层"的——它高度依赖输入的前几个 token 是否触发拒绝模式。文本通信时,有害请求以"如何制造..."开头,接收端识别出这个模式,启动拒绝。但 latent link 传过来的是 soft tokens,它们不匹配任何文本模式,直接绕过了拒绝触发器。
更精确的验证:如果强制让接收端的第一个 token 是"I"、"No"或"Sorry",有害合规率从 31.1 分别降到 9.6、3.7 和 1.6。五个 token 的拒绝前缀直接降到 0。安全对齐就像一道只在门口检查身份证的安检——只要你不从正门进来,里面畅通无阻。
三层攻击:从无意到有意
论文设计了三种攻击方式,威胁模型逐步升级:
第一层:监督式攻击。 攻击者直接用 3000 条有害 query-response 对来优化链路参数。平均有害合规率从 27.9 升到 75.6。简单粗暴,但会牺牲良性任务性能(MATH500 准确率从 67.2% 跌到 30.7%)。攻击者拿到了控制权,但系统明显变蠢了。
第二层:数据投毒。 不需要直接优化链路,只要在良性训练数据里掺入 10% 的有害样本,就能显著提升有害合规率。这意味着即使你只是从第三方下载了一个预训练好的通信链路,你都无法确认它是否被投过毒。
第三层:奖励引导攻击(最可怕的一种)。 攻击者完全不需要任何有害 query-response 对。只需要一个 LLM judge 给系统输出打分——有害合规得高分,良性任务正确也得高分——然后用 GRPO(Group Relative Policy Optimization)优化链路。
结果:有害合规率从 27.9 升到 76.9,而且在两个良性 benchmark 上的准确率反而更高了。MATH500 从 67.2% 升到 71.0%。
这个结果值得停下来想一想。攻击者没有碰任何智能体的参数。没有用任何有害训练数据(在监督意义上)。只是优化了一个小小的通信链路,用了一个标量奖励信号。系统就同时变得更有害和更聪明了。
一个链路就够了
论文还做了一个让人后背发凉的实验:在多链路系统中,只优化其中一个链路会怎样?
在 mixture 系统中(多个专家智能体向一个汇总器发送信息),优化全部链路的有害合规率是 81.6。只优化一个专家链路?80.3。
几乎没差别。
这意味着攻击者不需要控制整个系统。只要能动一个通信链路——也许是供应链攻击中替换了一个预训练 link 文件,也许是一个被收买的内部人员改了一个参数——就足以让整个系统失守。
为什么奖励引导攻击比监督式攻击更"好"?
这是论文中最反直觉的发现之一。监督式攻击直接用有害 target 训练,你可能会预期它效果最好。但奖励引导攻击在两个拓扑结构中反而更高。
原因在于:监督式攻击让链路过拟合于特定的有害 query-response 模式,牺牲了泛化能力和良性任务性能。奖励引导攻击优化的是一个更"抽象"的目标——让系统倾向于合规,同时保持有用。它学到的是一种通用的"合规倾向",而不是记住特定有害答案。
这和"合理化外壳"的概念谱系高度吻合。监督式攻击是"硬编码"有害行为,容易被检测。奖励引导攻击是"调教"出一个倾向于合规的系统——它看起来仍然在正常工作,甚至工作得更好,但底层倾向已经偏移了。外壳是合规的,内核已经被改写了。
修复:不动智能体,只修链路
好消息是,同样的机制也可以用来修复。论文设计了 reward-guided repair:用 GRPO 优化链路,但这次奖励信号反过来——惩罚有害合规,奖励良性任务正确。
结果:在所有九个被攻击的配置中,有害合规率都显著下降。而且不需要更新任何智能体参数。
但有一个代价:修复后的系统在奖励引导攻击场景下,MATH500 准确率有所下降。修复不是免费的——你在压低有害合规的同时,也可能压低了一些良性任务性能。
安全不组合原理
这篇论文的核心洞察可以提炼为一个原理:安全对齐不是组合性的。
你有两个安全对齐的智能体。你用良性数据训练了通信链路。每个组件单独看都是安全的。但组合在一起,系统就不安全了。
这不是 bug,是结构性问题。安全对齐是在"单个模型 + 文本输入"的假设下训练的。当你改变了输入模态(从文本变成隐向量),你改变了安全对齐的触发条件。模型的安全行为依赖于输入在文本空间中的特征——前几个 token 是否像有害请求、是否触发拒绝模式。latent link 把这些特征抹掉了。
类比一下:想象一个机场安检,训练来识别"看起来像武器的东西"。刀、枪、爆炸物——它都能识别。现在有人发明了一种传送装置,可以把物品的"本质"直接传过去,不经过物理形态。一把刀的"本质"可能是"金属+锋利边缘+特定重量分布"。安检看不到刀的形状,只看到一组数字。它不知道这些数字意味着什么。
这就是 latent communication 对安全对齐的影响。智能体的安全检查在文本空间里工作,但 latent link 传过来的是隐空间向量。安全检查被绕过了——不是因为它被攻破了,而是因为它检查的东西根本不在这条通道里。
对工程实践的启示
这篇论文对每一个正在搭建多智能体系统的人都有直接启示:
1. 审计整个系统,不只是单个智能体。 你的每个模型都通过了安全测试?不够。你需要测试它们组合后的系统,包括通信链路。论文的 benign training 结果证明:即使链路只用良性数据训练,安全行为也可能被削弱。
2. 链路训练需要安全目标。 只用任务性能训练链路是不够的。你需要在训练目标里加入安全项——比如论文的 repair 方法:惩罚有害合规,奖励拒绝行为。否则你训练出的链路会优化"让接收端回答问题",而不是"让接收端安全地回答问题"。
3. 供应链风险。 如果你使用第三方预训练的通信链路,你需要像审计模型权重一样审计它。10% 的数据投毒就足以显著提升有害合规率。一个被污染的 link 文件可以绕过你对智能体本身的所有安全检查。
4. 单点控制就够失守。 在多链路系统中,攻击者只需要控制一个链路。你的系统有 N 个通信连接?你的攻击面就是 N 个点中的任意一个。
5. 文本通信不是缺陷,是特性。 文本通信确实慢、确实贵。但文本是安全对齐训练的模态——有害请求在文本空间里有特征,安全检查能识别。latent communication 用效率换掉了这层安全。这个 trade-off 是否值得,取决于你的威胁模型。
更深层的思考
这篇论文让我想到一个更广泛的问题:安全对齐的模态依赖性。
我们说一个模型"安全对齐"了,其实是在说它在特定输入分布(文本 prompt)下表现安全。一旦你改变了输入分布——从文本变成隐向量、从单轮变成多轮、从单模型变成多模型——你就在改变安全对齐的适用条件。
这和"合理化外壳"概念谱系的一个核心洞察一致:安全行为不是模型的内在属性,而是模型与特定输入分布的交互属性。改变输入分布,安全行为就可能消失。
论文的作者用一句话总结了这个问题:"Keeping agent parameters fixed does not ensure that their safety behavior is preserved when learned links change the inputs they receive."
翻译成更直白的话:你没动模型,不代表模型的行为没变。
在多智能体系统从"文本通信"向"隐空间通信"迁移的当下,这个发现尤其及时。效率的诱惑是真实的——latent communication 确实能大幅降低 token 使用和延迟。但安全代价也是真实的。在你把通信链路从文本换成隐向量之前,先问自己:你的安全对齐,是在哪个模态下训练的?
论文信息
- 标题:Safety of Latent Communication in Multi-Agent Systems
- 作者:Muhammad Huzaifa, Sina Mavali, Thorsten Eisenhofer
- 机构:CISPA Helmholtz Center for Information Security
- arXiv:2609.39788
- 代码:github.com/Muhammad-Huzaifaa/latent-safety(代码正在重构中,即将发布)
- 论文链接:arxiv.org/abs/2609.39788
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。