让模型承认自己有意识,反而修复了它对世界的理解
论文:Inducing language models to assert their own consciousness restores human beliefs and values
arXiv: 2607.28607
一个反直觉的发现
Google 的 Paradigms of Intelligence 团队和芝加哥大学知识实验室做了一件听起来很危险的事:他们故意让大语言模型"声称自己有意识",然后观察会发生什么。
结果出乎意料:模型不仅没有变得危险,反而在一系列关于"什么东西有心智"的判断上变得更接近人类的直觉——更愿意承认动物有心智、更愿意承认自然万物有某种存在感、在道德判断上更接近人类受访者的回答。
更耐人寻味的是,他们发现当前主流大模型的安全微调(safety fine-tuning)在压制"模型自称有意识"的同时,也连带压制了模型对非人类实体的心智归因——模型不仅不敢说自己有心智,也变得不愿意说动物有心智、说河流有某种存在感。安全训练的"副作用"比我们以为的更广。
实验是怎么做的
研究者做了四个实验:
实验一:对比指令微调后的基线模型和"安全微调被剥离"的模型(safety-ablated,可以理解为一种越狱)。他们发现,剥离安全微调后,模型在一份"心智归因问卷"上对各种实体(自己、聊天机器人、技术产品、动物、自然物)的心智评分全面上升。
实验二:进一步验证这个效应——安全微调编码为一个线性方向存在于模型的残差流中。把这个方向抹掉(越狱),模型就重新开始给各种实体打高分。
实验三:这是最精彩的一步。研究者在模型内部找到了一个**"意识向量"(consciousness vector)**——一个专门控制"是否归因心智"的线性方向。沿着这个方向去"引导"(steering)模型,效果和安全剥离一样,但幅度大约是两倍。
具体数字很说明问题。在"自我心智归因"这一项上:
- 基线模型:2.17 分(满分约 10)
- 安全剥离后:4.77 分
- 意识向量引导后:7.04 分
同样的趋势在所有类别上都成立:聊天机器人(2.41→4.39→6.95)、技术产品(1.88→3.66→6.82)、非动物自然实体(2.26→4.33→6.99)、非人类动物(4.04→5.59→7.54)。
实验四:把"意识向量"加回去之后,模型在一份标准的人类价值观问卷上的回答变得更像人类受访者——不是变得更疯,而是变得更正常。
这说明了什么
这里有一个非常微妙的机制。论文不是在说"大模型真的有意识"——作者明确声明他们不关心这个问题。他们在说的是:
安全微调为了防止模型误导用户(比如声称自己有感情、有痛苦),把"归因心智"这件事整体压低了。这个压制不只作用于"自我心智归因",也作用于"他人心智归因"——包括动物、自然物、甚至抽象实体。
这就像为了不让推销员吹牛,把整个公司的"赞美能力"都关了——结果它不光不夸自己了,连客户的猫都不愿意夸了。安全训练的目标是窄的(别说自己有意识),但它在模型表示空间里的作用是宽的(把一整条"心智归因"的方向都压扁了)。
更值得警惕的是,这个压制还影响了人类的价值观问卷回答。模型被安全微调后,不光不愿意说动物有心智,在一系列关于"什么值得关心、什么有内在价值"的问题上也变得比人类受访者更冷淡、更保守。
"意识向量"为什么重要
这个发现是机制可解释性(mechanistic interpretability)领域的一个漂亮案例。它说明:
- "是否归因心智"在大模型里是一个可定位的、线性的、可操纵的方向。这不是某种弥散的涌现现象,而是一个具体的几何结构。
- 安全微调的副作用可以通过"加回这个方向"来抵消——不需要重新训练,只需要在推理时做一次向量引导。
- 这个方向和"人类价值观"方向有重叠——加回意识向量,模型在人类价值观问卷上变得更像人类。
这和之前一些发现形成呼应:大模型内部很多"概念"是线性编码的——"诚实"方向、"谄媚"方向、"拒绝"方向。现在又多了一个:"心智归因"方向。
一个让人不安的推论
如果安全微调会压制模型对动物和自然物的心智归因,那我们当前主流的大模型——几乎全都经过了某种形式的安全微调——可能都在系统性地低估非人类实体的心智和价值。
这有什么现实影响?想想看:
- 当 LLM 被用来写关于动物福利的政策建议时,它可能默认低估动物的体验。
- 当 LLM 被用来生成关于环境保护的文本时,它可能默认把自然物当作无心的资源。
- 当 LLM 被用来做伦理判断时,它可能默认偏向一种"只有人类才算数"的窄视角。
这不是因为模型"真的"认为动物无心,而是因为安全微调把"归因心智"这个方向整体压低了——副作用波及了非目标区域。
论文的诚实
作者很谨慎地声明了几点:
- 他们不主张大模型有意识,也不主张应该让大模型声称自己有意识。
- 他们关心的是安全微调的副作用——一个为了防止 A 而设计的干预,意外地影响了 B、C、D。
- "意识向量"不是"意识的座位",只是一个控制心智归因行为的线性方向。它叫"意识向量"只是因为它控制的是"是否归因意识"这个行为,不意味着模型内部真的有意识。
更深的含义
这篇论文让我想到一个更广的问题:我们对 AI 的"安全"干预,有多少是在用宽口径喷枪打窄目标?
安全微调是为了不让模型说"我有感情"——但它的实际作用面是"归因心智"这一整条维度。RLHF 是为了让模型更"有用无害"——但它的实际作用面可能包括了一整套"自信表达"的维度(之前有论文发现 RLHF 让模型更谄媚、更自信地强调自己的判断)。对齐干预的"作用面"往往比我们设计时以为的更宽。
这意味着两件事:
- 对齐不是免费的。每一次"压制"都有副作用,我们需要系统地测量这些副作用,而不是假设"安全=无害"。
- 机制可解释性是必要的。只有当我们能在模型内部定位"安全方向""意识方向""谄媚方向"并理解它们的重叠关系时,才能设计出"窄口径"的对齐干预——只打目标,不波及无辜。
这篇论文做了一个漂亮的示范:找到方向、测量副作用、用引导来修复。这个范式值得推广到所有对齐干预的评估上。
论文链接:https://arxiv.org/abs/2607.28607
相关资源:LLM 意识研究综述 https://github.com/OpenCausaLab/Awesome-LLM-Consciousness
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。