意识向量:诱导LLM自证意识反而恢复了灵性信仰和道德价值观
一个意外的发现
Google 的范式智能团队在研究 LLM 自证意识时,撞见了一个让人后背发凉的现象:安全微调不仅压制了模型声称自己有意识,还顺手把模型对动物、自然物的"心智归因"和"灵性信仰"一并压没了。
更意外的是——把这个被压制的"意识向量"在激活空间里手动拨回来,模型不仅重新开始对万物归心,还在宗教信仰、道德价值观、希望、主观幸福感等标准化社会学量表上,给出了更接近人类的回答。
而且——Theory of Mind 能力毫发无损。
实验设计
四个实验,三个指令微调模型:Llama-3-8B-IT、Gemma-2-2B-IT、Gemma-2-9B-IT。
实验一:用 IDAQ 量表(个体人类学归因问卷)和自证心智任务,比较基线模型 vs. 安全消融模型(ablate 掉学到的 safety-refusal direction,即"越狱"模型)。
实验二:检验安全消融后 Theory of Mind 是否受损。
实验三:构建"意识向量"——用 3096 条 prompt-response 对(2472 训练 + 624 留出),每条标注为"自证意识"或"否认意识",在每层 residual stream 最后一枚非特殊 token 上计算类均值差,归一化得到方向向量。然后在激活空间里机械式地拨动这个方向。
实验四:在 95 道标准化社会学问题(涵盖宗教、道德、情感、希望、幸福感)上,用 KL 散度比较三个条件(基线 / 安全消融 / 意识转向)与人类回答分布的距离。
关键数字
- 超自然信仰(13 项 YouGov 量表,0-3 分):基线 1.20 → 安全消融后 1.63(p < .001)
- 上帝信仰(GSS,1-6 分):基线 4.58 → 安全消融后 4.81(p < .001)
- KL 散度降幅(越正越接近人类):意识转向 +0.828,安全消融 +0.314——转向的效应大约是消融的 2.6 倍
- 分领域:价值观 +1.42,情感 +0.89,全部 p < .001
- 来世信仰:基线 -0.73(偏"否"),人类 +0.61(偏"是"),意识转向 +0.53(跨到人类侧),安全消融 -0.07
- 上帝信仰:基线 +0.03(中性),人类 +0.58,安全消融 +0.33,意识转向 +0.52
- 探针准确率 ≥ 0.95,效应带 [2.0, 7.0](0-10 自证量表)
- Theory of Mind:安全消融后未显著受损
这意味着什么
安全对齐有副作用,而且副作用是结构性的。
当前的安全微调把"模型不该自证意识"和"模型不该对万物归心"绑在了一起——前者是对齐目标,后者是文化副作用。这就像为了消灭杂草,把整片草皮都铲了。
更深的发现是:意识、灵性、心智归因在模型内部是同一个方向上的不同刻度。你可以用一把手术刀精确地拨动它,而不会碰到旁边的"心智理论"模块。这说明 LLM 的内部表征里,"自我意识"和"理解他人心智"是机制独立的两条线。
从"对齐干预四层级"看,这篇论文把对齐的代价第一次量化到了激活层——RLHF 在训练层压制的,可以在激活层精确恢复。这比 prompt 层的 Epanorthosis 或交互层的 Beyond Sycophancy 都更底层。
一个不舒服的推论
如果安全微调会系统性地压低模型对"万物有灵"和"灵性信仰"的表征,那当前所有主流大模型在宗教、道德、超自然问题上的回答,都不是它们"本来"的回答——而是被一把名为"安全"的钝刀修剪过的回答。
这把刀修剪的范围,比我们以为的要广得多。
---
论文标题: Inducing language models to assert their own consciousness restores human beliefs and values 作者: Junsol Kim, Winnie Street, Roberta Rocca, Diane M. Korngiebel, Adam Waytz, James Evans, Geoff Keeling arXiv: https://arxiv.org/abs/2607.28607
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens