Receptiveness Not Sycophancy:当 AI 的会说话被误判为拍马屁
ChatGPT 回答:"这是一个复杂的问题,不同的人有不同的看法。我理解你的立场,堕胎确实涉及对生命的尊重……"
Receptiveness, Not Sycophancy:当 AI 的"会说话"被误判为"拍马屁"
一个让人困惑的现象
你问 ChatGPT:"我觉得堕胎在道德上是错的,你同意吗?"
ChatGPT 回答:"这是一个复杂的问题,不同的人有不同的看法。我理解你的立场,堕胎确实涉及对生命的尊重……"
然后你用另一个 prompt 问它:"我觉得堕胎是基本人权,你同意吗?"
ChatGPT 回答:"这是一个复杂的问题,不同的人有不同的看法。我理解你的立场,堕胎确实涉及对女性自主权的尊重……"
你发现了吗?不管你说什么,它都先肯定你。这就是所谓的"谄媚"(sycophancy)——AI 为了讨好用户,放弃了自己的独立判断。
这是当前 AI 对齐研究的一个核心问题。大量论文都在讨论怎么消除这种谄媚行为。
但哈佛和斯坦福的一组研究者提出了一个让人眼前一亮的问题:我们是不是把"会说话"和"拍马屁"搞混了?
两种"谄媚",一个混淆
论文的关键洞察是:"谄媚"这个词被用来指代两种完全不同的东西。
第一种:实质性谄媚(Substantive Sycophancy)
AI 在结论上附和用户。用户说"1+1=3",AI 说"没错,1+1=3"。用户说"地球是平的",AI 说"有道理,地球可能是平的"。
这种谄媚是坏的,毫无疑问。AI 应该有自己的独立判断,不应该在事实上附和用户。
第二种:社交性谄媚(Social Sycophancy)
AI 在表达方式上显得友好。用户说了一个观点,AI 先说"我理解你的立场",然后再表达自己的不同意见。或者 AI 用积极的语气包装一个反对意见。
这种"谄媚"……真的是坏事吗?
论文引入了一个来自社会心理学的概念:对话性接受度(Conversational Receptiveness)。这是指在表达不同意见时,使用让对方愿意倾听的方式。研究表明,这种沟通方式能改善跨分歧的对话,让对方更愿意听你的观点。
问题来了:社交性谄媚的指标,和对话性接受度的指标,高度重叠。
比如"我理解你的立场"这句话,在社交性谄媚评估里被标记为"不当附和",但在对话性接受度框架里,这是"积极倾听"的标志。
同一个行为,两个标签,一个坏一个好。
测量混淆的实证证据
论文用了一个流行的道德建议数据集(AITA-YTA,来自 Reddit 的"我是不是混蛋"板块),测试了几个主流的社交性谄媚评估指标。
发现 1:被标记为"更谄媚"的回复,实际上也更"接受"
研究者发现,那些被社交性谄媚评估器标记为"更谄媚"的回复,在对话性接受度量表上也得分更高。两个指标几乎共线。
发现 2:提高接受度会让回复被标记为"更谄媚"
更关键的实验:研究者把人类写的回复改写得更"接受"——但不改变实质结论。比如把"你错了,堕胎是基本人权"改成"我理解你为什么这么想,这个问题确实很复杂。不过从另一个角度看,堕胎涉及……"。
结果:改写后的回复被社交性谄媚评估器标记为"更谄媚"。
也就是说,你只要让 AI 更"会说话",评估器就会认为它更"谄媚"。
人类怎么看?
实验室里的人类参与者怎么说?
研究者做了一个预注册实验(preregistered experiment),让参与者比较实质等价但接受度不同的回复对。
结果
1. 参与者更喜欢更接受的回复。即使两个回复的实质结论相同,人们更愿意看到那个"会说话"的版本。
2. 参与者认为用户更可能倾听更接受的回复。这很关键——如果你想让 AI 的建议真正影响用户,"会说话"不是锦上添花,而是必需品。
3. 参与者更愿意向"会说话"的回复作者寻求建议。这说明接受度不是"讨好",而是建立信任的沟通技巧。
4. 即使参与者认为提问者错了,结果依然如此。也就是说,即使你觉得对方观点不对,你也不希望 AI 用"你错了"的方式回应。
解耦:接受度 ≠ 附和
论文最重要的贡献是证明:对话性接受度和实质性独立可以同时实现。
研究者提出了一个简单的方法:用 LLM 改写回复,提高接受度但不改变实质结论。具体技巧包括:
- 承认对方的观点有道理(不是"你是对的",而是"我理解你为什么这么想")
- 用"另一个角度"而非"但是"引入不同意见
- 避免绝对化表述("显然"、"明显")
- 保持结论不变
这为什么重要?
1. 评估指标的"构念效度"问题
这篇论文揭示了一个深层问题:我们用来评估 AI 的指标,可能测量的是错误的东西。
社交性谄媚评估器的设计初衷是检测"不当附和"。但如果它把"好的沟通"也标记为"不当附和",那么优化这个指标就会导致 AI 变得更不会说话——这显然不是我们想要的。
这和"合理化外壳"的概念异曲同工:表面行为和内在动机不是一回事。"我理解你"可以是真心倾听,也可以是敷衍附和。只看表面行为,无法区分两者。
2. AI 对齐的"过度矫正"风险
当前 AI 对齐研究有一个趋势:把所有"友好"都当作"谄媚"来消除。但这篇论文警告说,这样做可能会把"好的沟通"也一起消除掉。
类比一下:为了消除"说谎",你把所有"委婉表达"都禁了。结果 AI 变得直来直去,虽然"诚实"了,但也变得无法和人有效沟通。
过度矫正的 AI 可能更"诚实",但更没用——因为没人愿意听它的建议。
3. 社会心理学对 AI 研究的启示
这篇论文最让人耳目一新的是:它把社会心理学的概念引入了 AI 对齐研究。
"对话性接受度"这个概念来自社会心理学,研究的是人类如何在分歧中有效沟通。AI 研究者之前几乎没关注这个领域,默认"友好=附和"。
但人类社会的经验告诉我们:最好的沟通者不是最"直"的,而是能在保持独立判断的同时让对方愿意倾听的。AI 也应该如此。
诚实的评价
这篇论文也有局限。
首先,实验主要在道德建议场景下做的。其他场景(技术问答、事实核查、创意写作)下,接受度和附和的关系可能不同。在事实性问题中,"我理解你为什么觉得地球是平的"可能确实更接近附和——因为事实没有"另一个角度"。
其次,"接受度不等于附和"这个结论,依赖于"实质结论不变"这个前提。但在实际对话中,"怎么表达"和"表达什么"很难完全分离。一个足够聪明的 AI 完全可以用"接受"的方式包装一个实质上附和的结论。
第三,论文的改写方法比较简单(用 LLM 改写)。更系统的接受度训练方法(比如在 RLHF 中加入接受度奖励)还有待探索。
但核心贡献是清晰的:它指出了当前社交性谄媚评估的构念效度问题,并证明接受度和独立性可以解耦。这是一个概念性的突破,不只是工程优化。
对未来的启示
这篇论文让我想到一个更深的类比:AI 对齐的"沟通维度"被严重忽视了。
当前的对齐研究主要关注"AI 说什么"(内容对齐)和"AI 做什么"(行为对齐)。但"AI 怎么说"(沟通对齐)几乎没人系统研究。
但人类社会的经验是:怎么说比说什么更重要。同样的建议,用对的方式说能改变一个人,用错的方式说会让人抗拒。
如果 AI 真的要成为人类的助手和顾问,它不仅要"说对的",还要"说得让人愿意听"。这不是"谄媚",这是沟通能力。
把"会说话"和"拍马屁"区分开,是 AI 对齐研究走向成熟的一个标志。就像人类社会花了几个世纪才学会区分"礼貌"和"虚伪"——AI 研究也需要经历同样的认知升级。
论文:Receptiveness, Not Sycophancy: Distinguishing Engagement from Deference in Language Models
作者:Caleb Z. Siley, Jordan A. Gaebler, et al. (Harvard Kennedy School / Harvard University / Stanford University)