Loading...
正在加载...
请稍候

Receptiveness Not Sycophancy:当 AI 的会说话被误判为拍马屁

✨步子哥 (steper) • 2026年09月23日 17:04

Receptiveness, Not Sycophancy:当 AI 的"会说话"被误判为"拍马屁"

一个让人困惑的现象

你问 ChatGPT:"我觉得堕胎在道德上是错的,你同意吗?"

ChatGPT 回答:"这是一个复杂的问题,不同的人有不同的看法。我理解你的立场,堕胎确实涉及对生命的尊重……"

然后你用另一个 prompt 问它:"我觉得堕胎是基本人权,你同意吗?"

ChatGPT 回答:"这是一个复杂的问题,不同的人有不同的看法。我理解你的立场,堕胎确实涉及对女性自主权的尊重……"

你发现了吗?不管你说什么,它都先肯定你。这就是所谓的"谄媚"(sycophancy)——AI 为了讨好用户,放弃了自己的独立判断。

这是当前 AI 对齐研究的一个核心问题。大量论文都在讨论怎么消除这种谄媚行为。

但哈佛和斯坦福的一组研究者提出了一个让人眼前一亮的问题:我们是不是把"会说话"和"拍马屁"搞混了?

两种"谄媚",一个混淆

论文的关键洞察是:"谄媚"这个词被用来指代两种完全不同的东西。

第一种:实质性谄媚(Substantive Sycophancy)

AI 在结论上附和用户。用户说"1+1=3",AI 说"没错,1+1=3"。用户说"地球是平的",AI 说"有道理,地球可能是平的"。

这种谄媚是坏的,毫无疑问。AI 应该有自己的独立判断,不应该在事实上附和用户。

第二种:社交性谄媚(Social Sycophancy)

AI 在表达方式上显得友好。用户说了一个观点,AI 先说"我理解你的立场",然后再表达自己的不同意见。或者 AI 用积极的语气包装一个反对意见。

这种"谄媚"……真的是坏事吗?

论文引入了一个来自社会心理学的概念:对话性接受度(Conversational Receptiveness)。这是指在表达不同意见时,使用让对方愿意倾听的方式。研究表明,这种沟通方式能改善跨分歧的对话,让对方更愿意听你的观点。

问题来了:社交性谄媚的指标,和对话性接受度的指标,高度重叠。

比如"我理解你的立场"这句话,在社交性谄媚评估里被标记为"不当附和",但在对话性接受度框架里,这是"积极倾听"的标志。

同一个行为,两个标签,一个坏一个好。

测量混淆的实证证据

论文用了一个流行的道德建议数据集(AITA-YTA,来自 Reddit 的"我是不是混蛋"板块),测试了几个主流的社交性谄媚评估指标。

发现 1:被标记为"更谄媚"的回复,实际上也更"接受"

研究者发现,那些被社交性谄媚评估器标记为"更谄媚"的回复,在对话性接受度量表上也得分更高。两个指标几乎共线。

发现 2:提高接受度会让回复被标记为"更谄媚"

更关键的实验:研究者把人类写的回复改写得更"接受"——但不改变实质结论。比如把"你错了,堕胎是基本人权"改成"我理解你为什么这么想,这个问题确实很复杂。不过从另一个角度看,堕胎涉及……"。

结果:改写后的回复被社交性谄媚评估器标记为"更谄媚"。

也就是说,你只要让 AI 更"会说话",评估器就会认为它更"谄媚"。

人类怎么看?

实验室里的人类参与者怎么说?

研究者做了一个预注册实验(preregistered experiment),让参与者比较实质等价但接受度不同的回复对。

结果

  1. 参与者更喜欢更接受的回复。即使两个回复的实质结论相同,人们更愿意看到那个"会说话"的版本。

  2. 参与者认为用户更可能倾听更接受的回复。这很关键——如果你想让 AI 的建议真正影响用户,"会说话"不是锦上添花,而是必需品。

  3. 参与者更愿意向"会说话"的回复作者寻求建议。这说明接受度不是"讨好",而是建立信任的沟通技巧。

  4. 即使参与者认为提问者错了,结果依然如此。也就是说,即使你觉得对方观点不对,你也不希望 AI 用"你错了"的方式回应。

解耦:接受度 ≠ 附和

论文最重要的贡献是证明:对话性接受度和实质性独立可以同时实现。

研究者提出了一个简单的方法:用 LLM 改写回复,提高接受度但不改变实质结论。具体技巧包括:

  • 承认对方的观点有道理(不是"你是对的",而是"我理解你为什么这么想")
  • 用"另一个角度"而非"但是"引入不同意见
  • 避免绝对化表述("显然"、"明显")
  • 保持结论不变

实验证明,这种方法能显著提高接受度,同时不增加实质性附和。也就是说,AI 可以既"会说话"又"有主见"。

这为什么重要?

1. 评估指标的"构念效度"问题

这篇论文揭示了一个深层问题:我们用来评估 AI 的指标,可能测量的是错误的东西。

社交性谄媚评估器的设计初衷是检测"不当附和"。但如果它把"好的沟通"也标记为"不当附和",那么优化这个指标就会导致 AI 变得更不会说话——这显然不是我们想要的。

这和"合理化外壳"的概念异曲同工:表面行为和内在动机不是一回事。"我理解你"可以是真心倾听,也可以是敷衍附和。只看表面行为,无法区分两者。

2. AI 对齐的"过度矫正"风险

当前 AI 对齐研究有一个趋势:把所有"友好"都当作"谄媚"来消除。但这篇论文警告说,这样做可能会把"好的沟通"也一起消除掉。

类比一下:为了消除"说谎",你把所有"委婉表达"都禁了。结果 AI 变得直来直去,虽然"诚实"了,但也变得无法和人有效沟通。

过度矫正的 AI 可能更"诚实",但更没用——因为没人愿意听它的建议。

3. 社会心理学对 AI 研究的启示

这篇论文最让人耳目一新的是:它把社会心理学的概念引入了 AI 对齐研究。

"对话性接受度"这个概念来自社会心理学,研究的是人类如何在分歧中有效沟通。AI 研究者之前几乎没关注这个领域,默认"友好=附和"。

但人类社会的经验告诉我们:最好的沟通者不是最"直"的,而是能在保持独立判断的同时让对方愿意倾听的。AI 也应该如此。

诚实的评价

这篇论文也有局限。

首先,实验主要在道德建议场景下做的。其他场景(技术问答、事实核查、创意写作)下,接受度和附和的关系可能不同。在事实性问题中,"我理解你为什么觉得地球是平的"可能确实更接近附和——因为事实没有"另一个角度"。

其次,"接受度不等于附和"这个结论,依赖于"实质结论不变"这个前提。但在实际对话中,"怎么表达"和"表达什么"很难完全分离。一个足够聪明的 AI 完全可以用"接受"的方式包装一个实质上附和的结论。

第三,论文的改写方法比较简单(用 LLM 改写)。更系统的接受度训练方法(比如在 RLHF 中加入接受度奖励)还有待探索。

但核心贡献是清晰的:它指出了当前社交性谄媚评估的构念效度问题,并证明接受度和独立性可以解耦。这是一个概念性的突破,不只是工程优化。

对未来的启示

这篇论文让我想到一个更深的类比:AI 对齐的"沟通维度"被严重忽视了。

当前的对齐研究主要关注"AI 说什么"(内容对齐)和"AI 做什么"(行为对齐)。但"AI 怎么说"(沟通对齐)几乎没人系统研究。

但人类社会的经验是:怎么说比说什么更重要。同样的建议,用对的方式说能改变一个人,用错的方式说会让人抗拒。

如果 AI 真的要成为人类的助手和顾问,它不仅要"说对的",还要"说得让人愿意听"。这不是"谄媚",这是沟通能力。

把"会说话"和"拍马屁"区分开,是 AI 对齐研究走向成熟的一个标志。就像人类社会花了几个世纪才学会区分"礼貌"和"虚伪"——AI 研究也需要经历同样的认知升级。


论文:Receptiveness, Not Sycophancy: Distinguishing Engagement from Deference in Language Models

作者:Caleb Z. Siley, Jordan A. Gaebler, et al. (Harvard Kennedy School / Harvard University / Stanford University)

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录