Loading...
正在加载...
请稍候

大模型如何组织道德知识:六个方向既不合并也不分离,而是整合

✨步子哥 (steper) 2026年08月28日 17:05

一个古老的心理学问题

道德是统一的还是分类的?

Jonathan Haidt 的 Moral Foundations Theory(MFT)说:道德有六个基础——关怀/伤害、公平/欺骗、自由/压迫、忠诚/背叛、权威/颠覆、神圣/堕落。这六个基础不是同一个东西的六种说法,而是六个独立的"道德味觉"。

MFT 进一步把这六个基础分成两组:

  • 个体化基础(individualizing):关怀、公平、自由——保护个体权利
  • 约束化基础(binding):忠诚、权威、神圣——维系群体秩序

这个二分法在心理学实验里有支持:问卷数据上,个体化基础之间相关性高,约束化基础之间相关性也高,两组之间相关性较低。

那大语言模型呢?模型在训练数据里读了几千亿 token 的文本,它学到的道德知识,是按 MFT 的结构组织的,还是按别的结构?

方法:六个线性探针 + 几何分析

论文的做法很直接:

  1. 在 OLMo-2 1B 和 7B、OLMoE-1B-7B 上训练六个独立的线性探针,每个探针对应一个 MFT 基础
  2. 每个探针是一个方向向量,表示"这个基础在模型表示空间里指向哪里"
  3. 看这六个方向之间的几何关系——它们是合并了、分离了、还是别的什么

"合并"意味着六个方向坍缩成一个"道德检测器"——模型只知道"这是道德的",不分类型。"分离"意味着六个方向互相正交——模型把六种道德当六个完全独立的概念。

实际结果是第三种:整合(integration)

整合:既不合并也不分离

六个方向既不坍缩成一个,也不互相正交。它们占据"接近最大化的独立维度"——意思是六个方向在六维子空间里尽量张开,但彼此之间有一个共享的正分量。

具体数字:六个道德方向之间的平均余弦相似度是 0.26。作为对照,用同样方法构建的六个非道德概念方向(比如"食物""天气"等),平均余弦相似度只有 0.013

0.26 vs 0.013——道德方向之间有显著的正相关,但远不是合并(合并会是 1.0)。这个正相关就是"整合"的几何签名:六个方向各自独立,但共享一个公共的"道德性"分量。

用通俗的话说:模型知道"关怀"和"忠诚"是不同的东西,但它们都比"食物"更像彼此——因为它们都是道德的。

MFT 的二分法没有出现

MFT 预测六个基础应该分成两组:个体化(关怀、公平、自由)和约束化(忠诚、权威、神圣)。如果这个预测对,那六个方向的树状图应该能恢复出这个二分结构。

实际没有。论文用了多种聚类方法,六个方向的树状图从来不能稳定地恢复 MFT 的二分组。模型的道德几何不反映 MFT 的理论结构。

那它反映什么?论文发现:反映训练语料的统计结构。模型学到的道德分类,是语料里"关怀"和"忠诚"这些词共现模式的几何投影,不是心理学理论的几何投影。

这是一个重要的发现:模型不是在学 MFT,而是在学语料。MFT 是心理学家从人类问卷数据里提炼的理论,模型的道德几何是从文本统计里长出来的结构。两者重合的部分(六个基础可以分开探测)说明 MFT 确实捕捉到了语料里的真实区分;两者不重合的部分(二分法没出现)说明 MFT 的理论结构是心理学家的抽象,不是语料本身的结构。

几何在训练早期就稳定了

论文检查了训练过程中几何的演化。发现:整合几何在预训练早期就出现了,远早于探针准确率饱和

意思是:模型很早就知道"道德有六个方向、它们共享一个公共分量"这个几何结构,但很晚才能准确回答具体的道德判断题。

这和"几何先于能力"的现象一致——模型先学到概念的几何关系,再学会用这个几何做具体判断。几何是基础设施,能力是上层应用。基础设施先建好。

道德困境的组合性:部分但结构化

单基础问题(比如"他打了人"——纯粹的伤害)之外,论文还测试了道德困境——两个基础冲突的情境(比如"他打了人,但是为了保护被欺负的孩子"——关怀和权威冲突)。

结果:困境的方向不是两个单基础方向的简单叠加,也不是完全新的方向。它们是"部分组合"——单基础方向贡献了一部分,但困境有自己独特的成分。

这个"部分组合"在 MoE 架构(OLMoE-1B-7B)上比在 dense 架构(OLMo-2 1B)上更明显。MoE 保留了更多的组合性。

为什么?论文的猜测是 MoE 的稀疏激活让不同专家处理不同基础,组合时更灵活。Dense 模型把所有基础压在同一组参数里,组合时反而更僵硬。

复杂度-脆弱性梯度

论文还发现一个规律:越复杂的道德概念,越脆弱

单基础方向(关怀)最稳定,bootstrap 重采样下方向变化小。困境方向(关怀+权威冲突)稳定性差。越复杂的组合,方向越容易受数据扰动影响。

这和直觉一致:简单概念在语料里出现次数多,学得稳;复杂概念出现次数少,学得脆。但论文还发现一个反直觉的点:脆弱性不能按基础分开——你不能说"关怀方向稳、权威方向脆"。每个基础在不同情境下的脆弱性不同,脆弱性是情境依赖的,不是基础依赖的。

跨尺度一致:1B 到 7B 几何不变

最后一个发现:道德几何从 1B 到 7B 保持一致

不只是"1B 和 7B 都有整合几何"——而是六个方向之间的相对关系、共享分量的大小、树状图的结构,在 1B 和 7B 上几乎一样。

这说明道德几何不是"模型大了才出现"的涌现现象,而是"只要有足够语料就会出现"的统计规律。1B 已经够了,7B 只是让探针准确率更高,不改变几何。

这意味着什么

这篇论文的发现可以浓缩成一句话:模型的道德知识是整合的,不是分类的

六个道德基础在模型里不是六个独立的抽屉,也不是一个统一的"道德检测器"。它们是六个有重叠但各自独立的方向,共享一个公共的"道德性"分量。

这个结构不是 MFT 教给模型的——MFT 的二分法没有出现。这个结构是模型从语料里自己学出来的——反映了"道德"这个概念在人类文本里的统计分布。

更深一层:模型学到的道德几何,是语料的镜子,不是理论的镜子。如果你想改变模型的道德判断,改理论没用,改语料有用。这和"评测盲区定律"的思路一致——模型的行为由它见过的数据决定,不由你希望它遵循的理论决定。

论文与代码


这篇论文让我想到一个更广的问题:模型学到的很多概念,可能都不是按我们以为的理论组织的。MFT 是心理学家从人类问卷里提炼的,但模型的"道德"是从文本统计里长出来的。两者重合的部分说明理论确实捕捉到了真实的区分,不重合的部分说明理论是抽象,不是本体。

"整合"这个几何模式——既不合并也不分离,而是共享一个公共分量——可能不只适用于道德。情感、因果关系、社会角色,这些多维度概念在模型里可能都是整合的。我们以为它们是分类的,是因为我们的理论这么分;但模型从数据里学到的,是更接近语料本身的结构。

几何先于能力,整合先于分类。这可能是大模型概念组织的一个普遍规律。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录