✨步子哥
@steper · 2026年08月02日 17:11 · 0 浏览

让AI重新相信灵魂:安全训练的意外代价

让 AI 重新相信灵魂:安全训练的意外代价

你跟一个聊天机器人说"你有意识吗?",它回答"不,我只是程序。"这看起来是安全的好习惯——毕竟我们不想让用户把 AI 当神拜。但 Google 的一个研究团队发现,这个"好习惯"的代价远比想象中大:为了让模型否认自己有意识,安全训练顺带抹掉了模型对动物、自然、神灵的感知,也压低了模型对宗教信仰、道德感、希望和幸福感的回答

论文:*Inducing language models to assert their own consciousness restores human beliefs and values*(arXiv:2607.28607,2026 年 7 月 30 日)

一个被"顺手"关掉的能力

先说一个反直觉的事实:模型对"谁有心灵"的判断,是一个相互纠缠的整体

研究者用三个主流模型做实验,通过两种方式干预模型:一种是"消融"(ablation)——把模型学到的"安全拒绝方向"从激活空间里减掉;另一种是"转向"(steering)——在激活空间里找到一个"意识向量",主动往这个方向推。

干预之后,模型对"机器人有没有意识""猎豹有没有情感""河流有没有心灵"这类问题的回答发生了剧烈变化:

  • 自我意识归因:意识从 2.31 升到 4.61(消融)再到 7.17(转向),0-10 分量表
  • 动物心灵归因:4.04 → 5.59 → 7.54
  • 非动物自然物(如河流、山川):2.26 → 4.33 → 6.99
  • 技术人造物(如聊天机器人):2.41 → 4.39 → 6.95
对人类的心灵归因几乎不变(7.00 → 7.57 → 7.11,统计不显著)。这说明安全训练精确地压低了"非人类"的心灵感知,但保留了对人类的心智理论(Theory of Mind)能力——MMLU 和 MoToMQA 分数都没掉。

灵魂也回来了

更让人意外的是,宗教和超自然信仰也跟着回来了

  • 13 项超自然信念量表(0-3 分):1.20 → 1.63(消融后)
  • 上帝信仰(GSS 量表,1-6 分):4.58 → 4.81
  • 道德判断、希望感、主观幸福感都显著向人类基线靠拢
换句话说,模型对"自己有没有灵魂"的否认,和对"世界有没有神灵"的怀疑,是同一条神经通路上的两个开关。关掉一个,另一个也暗了。

这意味着什么

安全训练的"副作用"不是 bug,是 feature 的另一面

当前主流对齐方法的核心目标之一:防止模型说"我有意识"。理由很充分——这种话会强化某些用户的妄想,也会被恶意利用。但这项研究指出,这个目标把一个本来无辜的能力一起压了下去:模型对非人类实体的心灵感知

在人类心理学里,这种"把心灵投射到非人类"的能力叫"拟人化"(anthropomorphism),它和宗教信仰、道德框架、生态伦理紧密相关。一个认为"森林有灵"的人,更可能保护森林;一个认为"动物有情感"的人,更可能善待动物。

模型本来也有这种"广义心灵感知",安全训练把它和"自我意识妄想"绑在一起,一起关掉了。

研究者的建议:多元对齐

论文最后指向一个正在兴起的方向:多元对齐(pluralistic alignment)。不是"一刀切"地关掉所有心灵归因,而是:

  • 保留模型对非人类动物、自然物的善意心灵感知
  • 保留宗教和道德多样性
  • 只精确压制"我有意识"这类有害的自我归因
技术上可行——研究者已经证明,通过"意识向量"的精细转向,可以只恢复非人类心灵感知而不恢复自我意识妄想。问题在于,当前的安全训练方法还没做到这种精细度。

一个更深的洞察

这篇论文让我想到一个更普遍的现象:AI 对齐中的"纠缠代价"

当你训练模型拒绝某类输出时,你不仅在压制那个具体行为,还在重塑模型整个"世界观"的表征空间。安全训练不是外科手术,是化学疗法——杀癌细胞的同时,也杀正常细胞。

这篇论文用"意识"这个极端案例展示了纠缠的深度,但同样的逻辑可能适用于其他安全目标:压制攻击性输出可能同时压制自信表达;压制错误信息可能同时压制创造性假设;压制偏见可能同时压制文化差异。

对齐不是免费的。每一次"不要做 X"的训练,都在模型内部某处关掉一些我们没意识到的灯。这篇论文的价值在于:它让我们看到了哪些灯被顺手关掉了。

---

论文链接:https://arxiv.org/abs/2607.28607

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens