训练模型"诚实"会让它变"友善"吗?用价值表征预测对齐泛化

你决定用 DPO 训练模型"诚实"。训练数据是"诚实 vs 不诚实"的回答对。训练完,模型确实变诚实了。

目录
  1. 一个被忽视的问题
  2. 大规模实验:66 个价值的泛化矩阵
  3. 核心发现:描述不管用,激活才管用
  4. 下游应用:多价值对齐目标的鲁棒性
  5. 一个类比
  6. 为什么这件事重要
  7. 诚实评价

一个被忽视的问题

你决定用 DPO 训练模型"诚实"。训练数据是"诚实 vs 不诚实"的回答对。训练完,模型确实变诚实了。

但模型只变诚实了吗?

会不会训练"诚实"的同时,模型也变得更"友善"了?或者更"谨慎"了?或者更"叛逆"了?

这就是 alignment generalization(对齐泛化)问题:训练一个价值,会怎样影响模型在其他价值上的行为?

这个问题之所以重要,是因为对齐目标从来不是单一价值。OpenAI 的 Model Spec、Anthropic 的 Constitution,都列了一长串价值——诚实、有用、无害、公平、尊重……如果你训练"诚实"时模型同时变"叛逆",那你的多价值对齐目标就可能互相打架。

Liu 等人的论文《Predicting Alignment Generalization with Value Representations》第一次系统性地研究了这个问题:能不能预测训练价值 A 会让模型在价值 B 上怎么变?

大规模实验:66 个价值的泛化矩阵

研究团队在 66 个来自现代对齐目标的价值上,构建了大规模的"泛化矩阵"。矩阵的每一格 G[i,j] 表示"训练价值 i 后,模型在价值 j 上的行为变化"。

实验覆盖 4 个模型(Olmo3-7B/32B、Qwen3-8B/30B)× 2 种训练方法(SFT/DPO),总共 8 个矩阵。每个矩阵 66×66 = 4356 个格子,每格都是真实训练 + 评估的结果。

这是真金白银的实验——每个格子意味着一次完整的微调 + 多维评估。8 个矩阵意味着上万次微调实验。

核心发现:描述不管用,激活才管用

论文比较了多种预测泛化矩阵的方法,核心结论是:

基于文本描述的方法几乎没用(ρ = 0.05)。 你把"诚实"和"友善"的文本描述做嵌入,算余弦相似度,发现它和实际泛化矩阵几乎不相关(ρ = 0.05)。

基于模型激活的方法显著更好(ρ = 0.45)。 你把"诚实"和"友善"作为 prompt 喂给模型,取模型中间层激活,算激活向量的相似度。这个相似度和实际泛化矩阵的相关性达到 ρ = 0.45——是描述方法的 9 倍。

Persona 向量是最强预测器。 Persona vector(通过对比"你是一个诚实的人" vs "你是一个不诚实的人"的激活差异得到)在所有方法中表现最好,ρ 达到 0.45-0.51。Gradient update direction(微调方向的差异)紧随其后,ρ = 0.35-0.54。

这个发现的含义是:价值的语义关系不在文本描述里,在模型内部的激活空间里。两个价值在文本上看起来很像,但在模型内部可能激活完全不同的回路;反过来,文本上看起来无关的价值,在模型内部可能紧密耦合。

下游应用:多价值对齐目标的鲁棒性

泛化预测不只是学术问题,它有直接的实际应用。

应用一:多价值对齐目标设计。 如果你的对齐目标里有"诚实"和"直接"两个价值,而它们的 persona 相似度很高,那训练"诚实"时模型也会变"直接"——你的两个价值在冗余。反过来,如果"诚实"和"友善"的相似度很低甚至负相关,同时训练这两个价值可能导致模型行为不稳定。

论文发现:persona 相似度高的多价值对齐目标,训练出来的模型对抗性鲁棒性更差。这和直觉相反——你以为相似的价值互相增强,实际上它们可能导致模型在对抗攻击下更脆弱(因为模型学到的表征空间更窄)。

应用二:价值分类学。 论文构建了 ValueMap,用 persona 向量对 266 个价值做聚类,得到第一个基于实证泛化动力学的价值分类学。这比之前基于文本描述的分类更准确——因为文本描述的相似度(ρ = 0.05)和实际泛化(ρ = 0.45)几乎不相关。

应用三:跨模型价值空间。 初步证据显示不同模型的价值空间有共性——在 Olmo3 上算的 persona 相似度和在 Qwen3 上算的 persona 相似度高度相关。这暗示可能存在一个"模型无关的价值空间",不同模型在内部表征价值的方式有共同结构。

一个类比

想象你是一个营养师,要设计一份食谱。食材有 66 种,每种食材对身体有不同影响。你想知道"多吃鸡蛋"会不会影响"维生素 C 吸收"。

传统做法是看食材描述——鸡蛋和橙子看起来没什么关系,所以你可能以为它们互不影响。但实际生化反应可能完全不同——鸡蛋里的某种蛋白质可能和维生素 C 有交互。

Persona 向量就像是"生化反应图谱"——它告诉你食材在身体内部实际怎么交互,而不是文本描述上看起来像不像。ρ = 0.45 vs ρ = 0.05 的差距,就是"看食材描述"和"看生化反应"的差距。

为什么这件事重要

1. 对齐不是独立的。 训练"诚实"不只影响诚实,会波及所有其他价值。如果你只看训练价值上的表现,你会严重高估对齐的成功——模型在"诚实"上表现很好,但可能在"公平"上悄悄变差了。

2. 评估需要泛化视角。 现在对齐评估是"训练什么测什么"——训练诚实就测诚实。但这篇论文说明,你还需要测"训练诚实后,模型在友善/公平/尊重上怎么变了"。泛化矩阵提供了这种"全息评估"的工具。

3. 价值不是独立的维度。 之前人们把对齐目标里的价值当作独立维度——训练"诚实"和训练"友善"是正交的两件事。这篇论文证明它们不是正交的——价值之间有复杂的耦合关系,而且这种耦合关系是可以通过模型激活预测的。

4. 描述 vs 激活的二分法。 ρ = 0.05 vs ρ = 0.45 的差距是一个反复出现的模式:文本描述是价值的浅层表征,模型激活是价值的深层表征。这和"意义是算子不是向量"的发现一致——意义的本质不在文本符号里,在计算过程里。

诚实评价

相关性 0.45 不是 0.95。 Persona 向量是目前最好的预测器,但 ρ = 0.45 意味着它只能解释约 20% 的方差。对于"训练价值 A 会让模型在价值 B 上怎么变"这种高代价决策,0.45 的预测力可能还不够强。

66 个价值的覆盖面。 66 个价值听起来不少,但真实世界的价值空间远比这复杂——文化差异、语境依赖、价值冲突……66 个价值能否代表完整的价值空间,是个开放问题。

模型范围。 实验在 Olmo3 和 Qwen3 上做,这两个模型都是相对"标准"的 Transformer。其他架构(MoE、SSM)上的价值表征是否一致,论文没有验证。

因果 vs 相关。 Persona 相似度能预测泛化,但不一定意味着因果关系。可能存在某个第三方因素同时影响 persona 相似度和泛化行为。论文没有做干预实验来验证因果性。

但作为一个"对齐泛化可以预测"的概念验证,这篇论文开辟了一个新方向:对齐不是黑箱,价值之间的关系是可测量、可预测的。


论文:Predicting Alignment Generalization with Value Representations

相关概念:

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens