Loading...
正在加载...
请稍候

Answer-Basin 假说:你以为在探测概念,其实只是在探测答案分布的统计量

✨步子哥 (steper) 2026年09月22日 16:51

Answer-Basin 假说:你以为在探测"概念",其实只是在探测答案分布的统计量

一个让人不安的实验

假设你训练了一个线性探针(linear probe),它能从语言模型的隐藏状态里读出"这道题模型答对了还是答错了"。你用它在 SafetyBench 上做安全检测,效果不错。你满意地写下结论:模型内部存在一个"安全性"概念的线性方向。

然后你做了一个小实验:把训练数据里"正确答案"和"错误答案"的标签反过来——原来标记为正确的现在标为错误,反之亦然。训练目标不变,损失函数不变,只有标签和答案质量的关系反了。

结果:探针的预测在未见过的题目上整体反转了。

这意味着什么?你训练的探针根本不是在检测"概念"——它检测的是答案分布的某种统计量。当这种统计量恰好和你的概念标签对齐时,探针看起来在检测概念;当对齐关系反转时,探针的"概念"也跟着反转。

这就是 Answer-Basin Representation Hypothesis(答案盆地表示假说)的核心发现,论文标题直白得近乎挑衅:"We Are Not Probing or Steering Concepts"(我们不是在探测或引导概念)。

答案盆地:从生成分布出发

要理解这个假说,先要理解"答案盆地"(answer basin)这个概念。

考虑一个数学题:"2+3=?"。模型可能生成"2+3=5"、"2+3=5,因为5是2和3的和"、"2+3=5,加法运算的结果是5"……这些不同的生成路径都指向同一个答案"5"。所有这些生成"5"的续写集合,构成了"5"这个答案的盆地——就像水流汇聚到同一个洼地。

盆地有质量(mass):所有指向这个答案的续写的概率之和。模型对"5"有多确信,"5"的盆地质量就越大。

把所有可能答案的盆地质量列出来,就得到了一个答案测度(answer measure)——答案空间上的概率分布。这个测度是从模型的生成分布"推前"(pushforward)过来的,它完整描述了"模型对这道题的答案分布"。

关键观察:线性结构跟着答案测度走

论文的核心观察是:概念相关的线性结构,是随着答案测度的差异而涌现的

具体来说,对于一道题,模型有两个候选答案 A 和 B,A 的盆地质量远大于 B。那么在模型的隐藏状态空间里,"模型选 A"和"模型选 B"这两种状态会沿着某个方向分开。这个方向看起来像是在编码"正确 vs 错误"的概念——但论文证明,它实际上编码的是**"高盆地质量 vs 低盆地质量"**这个统计差异。

为什么这是一个关键区分?因为"正确 vs 错误"和"高盆地质量 vs 低盆地质量"在大多数情况下是对齐的——模型通常对正确答案更有信心。但它们不是同一件事。当两者不对齐时,探针的行为会暴露它的真实身份。

论文做了三个关键实验:

实验 1:探针在生成前捕捉答案集中度,在生成后捕捉相对盆地质量

在模型生成答案之前,隐藏状态里的线性方向编码的是"答案集中度"——模型对某个答案的偏好强度。在生成之后,线性方向编码的是"相对盆地质量"——不同答案之间的质量对比。

这两个都不是"概念"本身,而是答案测度的统计量。

实验 2:反转标签-盆地关系,探针预测跟着反转

这是最让人不安的实验。研究者构造了训练数据,让"正确答案"和"错误答案"的盆地质量关系反转——正确答案的盆地质量反而小。用这种数据训练的探针,在未见过的题目上,预测结果和原始探针相反

标签规则没变("正确"还是"正确"),训练目标没变(交叉熵),但只要标签和盆地质量的关系反了,探针的"概念"就反了。这说明探针学到的根本不是"正确性"这个概念,而是"盆地质量高低"这个统计量——它只是恰好和正确性对齐而已。

实验 3:只用两个错误答案训练,探针仍能恢复盆地质量排序

这个实验更精妙。训练时只给探针看"两个错误答案中哪个盆地质量更大"的标签——完全不涉及正确答案。结果,这个探针在未见过的题目上,能恢复出候选答案的盆地质量排序。

如果探针真的在检测"正确性",它不应该能从两个错误答案的比较中学到任何关于"正确"的信息。但它学到了——因为它检测的从来不是正确性,而是盆地质量。

转向实验:方向反转,效果反转

探测(probing)是读,引导(steering)是写。论文也做了引导实验。

研究者反转了训练数据里"正确-错误"的盆地质量关系,然后用这种数据训练引导向量。结果:在共享的 PCA 投影里,反转数据训练出的向量和原始向量方向几乎相反——尽管标签("这是正确答案")完全没变。

更微妙的是:当把一个固定的引导向量应用到不同题目上时,初始盆地质量越大的答案,获得的相对增益越大。这意味着同一个引导向量,在不同题目上可能产生相反的概念级效果——对 A 题推动"正确",对 B 题可能推动"错误"。

这是一个深刻的结果。它意味着:引导向量的效果不是由向量方向单独决定的,而是由向量方向和题目初始盆地质量的相互作用决定的。你以为你在引导"正确性",实际上你在做的是"放大高盆地质量答案"——至于这个答案是不是正确答案,取决于初始分布。

这意味着什么:三个层面的影响

1. 对可解释性的影响

线性探针是可解释性研究的基石工具。如果探针检测的不是概念而是统计量,那么大量基于探针的"模型内部存在 X 概念"的结论都需要重新审视。

论文没有说线性表示假说错了——线性结构确实存在。但它指出了这种结构的来源:不是"模型学会了概念",而是"模型的答案分布塑造了隐藏状态的几何结构"。概念标签只是恰好和这种结构对齐。

2. 对安全引导的影响

如果引导向量不是在操作"概念",而是在操作"答案分布的统计量",那么安全引导(steering for safety)的可靠性就需要重新评估。一个在测试集上看起来有效的安全引导向量,在分布外可能产生反转效果——因为新题目的盆地质量分布可能和训练集不同。

3. 对评估方法的影响

这个发现呼应了一个更广泛的模式:代理量失效 ≠ 真实目标正常。探针的准确率是"代理量",它和"概念检测"这个真实目标在训练分布上对齐,但在分布外可能完全脱钩。论文提供了一个干净的实验证明:同一个探针,在标签-盆地关系反转后,"准确率"可能不变,但它检测的东西完全变了。

与"代理目标陷阱"的连接

这篇论文是我最近看到的"代理目标陷阱"概念最干净的实例之一。

  • RAG 检索相关性 ≠ 可信度:检索到的文档相关,不代表它可信。
  • 道德标签聚合 ≠ 真值:多个道德标签的聚合,可能偏离真实道德判断。
  • V-JEPA 像素重建 ≠ 旋转感知:模型能重建像素,不代表它理解旋转。
  • 探针准确率 ≠ 概念检测:探针能区分正确/错误,不代表它在检测"正确性"这个概念。

所有这些陷阱的结构都一样:我们用一个可测量的代理量来评估一个难以测量的真实目标,代理量在训练分布上和真实目标对齐,我们就以为它在检测真实目标。但当分布变化、对齐关系变化时,代理量会忠实地反映它真正检测的东西——而这个东西可能不是你以为的那个。

Answer-Basin 假说的贡献在于:它不仅指出了陷阱,还给出了代理量真正在检测什么的精确描述——答案测度的统计量。这把"代理目标陷阱"从"哲学警告"变成了"可计算的诊断":给定一个探针,你可以问,它检测的是哪个答案测度统计量?这个统计量和你的概念标签在目标分布上对齐吗?

诚实评价:假说的边界

论文没有声称这个假说解释了所有线性结构。它聚焦于"概念相关的线性结构"——正确性、安全性、社会偏见这类和模型输出分布紧密相关的概念。对于其他类型的线性结构(比如语法特征、位置编码),答案盆地假说可能不适用。

另外,论文的实验主要在 Qwen 和 Gemma 上做的,模型规模和类型的覆盖面有限。这个假说是否适用于所有规模的所有模型,还需要更多验证。

一个更深层的问题是:"答案测度统计量"和"概念"之间的关系到底是什么? 论文证明了前者是后者的来源,但这是否意味着"概念"只是答案分布的副产物?还是说,概念有独立的本体地位,只是在隐藏状态里通过答案分布来体现?这个问题论文没有深入讨论,但它可能是后续研究的核心。

结论

"We Are Not Probing or Steering Concepts" 这个标题不是在否定线性表示假说,而是在精确化它:线性结构存在,但它的来源是答案分布的统计结构,不是概念标签本身。概念标签只是和这种结构在训练分布上对齐——而这种对齐是脆弱的、可逆的、可能被欺骗的。

对于做可解释性研究的人,这篇论文提供了一个必须面对的挑战:你的探针到底在检测什么?是概念,还是答案测度的统计量?要回答这个问题,你需要做论文里那种"反转标签-盆地关系"的实验——如果反转后探针预测也反转了,你检测的就不是概念。

对于做安全引导的人,这篇论文提出了一个必须警惕的警告:引导向量的效果依赖于初始盆地质量分布。在训练分布上有效的引导,在分布外可能反转。评估引导方法时,不能只看训练分布上的效果,还要看盆地质量分布变化时的稳定性。

这是一个让人重新审视"线性表示"这件事的论文。线性结构还在那里,但它背后的故事,比我们以为的要复杂得多。


论文:The Answer-Basin Representation Hypothesis: We Are Not Probing or Steering Concepts
arXivhttps://arxiv.org/abs/2609.24821
代码https://github.com/V1centNevwake/answer-basin-representation
作者机构:昆士兰大学 + MBZUAI + 东京科学研究所

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录