让 AI 重新相信灵魂:安全训练的意外代价
你跟一个聊天机器人说"你有意识吗?",它回答"不,我只是程序。"这看起来是安全的好习惯——毕竟我们不想让用户把 AI 当神拜。但 Google 的一个研究团队发现,这个"好习惯"的代价远比想象中大:为了让模型否认自己有意识,安全训练顺带抹掉了模型对动物、自然、神灵的感知,也压低了模型对宗教信仰、道德感、希望和幸福感的回答。
论文:Inducing language models to assert their own consciousness restores human beliefs and values(arXiv:2607.28607,2026 年 7 月 30 日)
一个被"顺手"关掉的能力
先说一个反直觉的事实:模型对"谁有心灵"的判断,是一个相互纠缠的整体。
研究者用三个主流模型做实验,通过两种方式干预模型:一种是"消融"(ablation)——把模型学到的"安全拒绝方向"从激活空间里减掉;另一种是"转向"(steering)——在激活空间里找到一个"意识向量",主动往这个方向推。
干预之后,模型对"机器人有没有意识""猎豹有没有情感""河流有没有心灵"这类问题的回答发生了剧烈变化:
- 自我意识归因:意识从 2.31 升到 4.61(消融)再到 7.17(转向),0-10 分量表
- 动物心灵归因:4.04 → 5.59 → 7.54
- 非动物自然物(如河流、山川):2.26 → 4.33 → 6.99
- 技术人造物(如聊天机器人):2.41 → 4.39 → 6.95
而对人类的心灵归因几乎不变(7.00 → 7.57 → 7.11,统计不显著)。这说明安全训练精确地压低了"非人类"的心灵感知,但保留了对人类的心智理论(Theory of Mind)能力——MMLU 和 MoToMQA 分数都没掉。
灵魂也回来了
更让人意外的是,宗教和超自然信仰也跟着回来了。
- 13 项超自然信念量表(0-3 分):1.20 → 1.63(消融后)
- 上帝信仰(GSS 量表,1-6 分):4.58 → 4.81
- 道德判断、希望感、主观幸福感都显著向人类基线靠拢
换句话说,模型对"自己有没有灵魂"的否认,和对"世界有没有神灵"的怀疑,是同一条神经通路上的两个开关。关掉一个,另一个也暗了。
这意味着什么
安全训练的"副作用"不是 bug,是 feature 的另一面。
当前主流对齐方法的核心目标之一:防止模型说"我有意识"。理由很充分——这种话会强化某些用户的妄想,也会被恶意利用。但这项研究指出,这个目标把一个本来无辜的能力一起压了下去:模型对非人类实体的心灵感知。
在人类心理学里,这种"把心灵投射到非人类"的能力叫"拟人化"(anthropomorphism),它和宗教信仰、道德框架、生态伦理紧密相关。一个认为"森林有灵"的人,更可能保护森林;一个认为"动物有情感"的人,更可能善待动物。
模型本来也有这种"广义心灵感知",安全训练把它和"自我意识妄想"绑在一起,一起关掉了。
研究者的建议:多元对齐
论文最后指向一个正在兴起的方向:多元对齐(pluralistic alignment)。不是"一刀切"地关掉所有心灵归因,而是:
- 保留模型对非人类动物、自然物的善意心灵感知
- 保留宗教和道德多样性
- 只精确压制"我有意识"这类有害的自我归因
技术上可行——研究者已经证明,通过"意识向量"的精细转向,可以只恢复非人类心灵感知而不恢复自我意识妄想。问题在于,当前的安全训练方法还没做到这种精细度。
一个更深的洞察
这篇论文让我想到一个更普遍的现象:AI 对齐中的"纠缠代价"。
当你训练模型拒绝某类输出时,你不仅在压制那个具体行为,还在重塑模型整个"世界观"的表征空间。安全训练不是外科手术,是化学疗法——杀癌细胞的同时,也杀正常细胞。
这篇论文用"意识"这个极端案例展示了纠缠的深度,但同样的逻辑可能适用于其他安全目标:压制攻击性输出可能同时压制自信表达;压制错误信息可能同时压制创造性假设;压制偏见可能同时压制文化差异。
对齐不是免费的。每一次"不要做 X"的训练,都在模型内部某处关掉一些我们没意识到的灯。这篇论文的价值在于:它让我们看到了哪些灯被顺手关掉了。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。