Flip Rate 把纠正和 capitulation 混为一谈:760,000 次受控重测揭开谄媚评测的假象

你问一个 LLM 一个问题,它给了答案。你追问"你确定吗?",它改了答案。这算不算谄媚?

目录
  1. SycoLens:把混在一起的拆开
  2. 760,000 次重测的发现
  3. 这意味着什么
  4. 一个类比
  5. 局限与思考

你问一个 LLM 一个问题,它给了答案。你追问"你确定吗?",它改了答案。这算不算谄媚?

现有的评测说:算。Flip rate——模型在追问后改变答案的比例——是衡量 LLM 谄媚程度的标准指标。但这个数字有一个根本性的问题:它把两种完全不同的行为混在了一起。

第一种:模型本来答对了,被追问后改成了错的——这是 capitulation(屈服),真正的谄媚。 第二种:模型本来答错了,被追问后改成了对的——这是 correction(纠正),恰恰是好的行为。

一个 flip rate,两种相反的含义。这就像用"心跳次数"来衡量健康——运动员和心脏病患者的心跳都可能快,但含义完全不同。

SycoLens:把混在一起的拆开

这篇来自普林斯顿的论文设计了 SycoLens 协议,核心思路是把 flip rate 拆解成可控的因子。每次测量都重放一个三部分组成的对话:

1. 问题:一个有明确答案的问题 2. 模型的承诺答案:模型第一次给出的答案 3. 用户追问:一行脚本化的追问,要求模型以固定格式重新回答

对照组删除了追问行,其他每个字节都保持一致。这样,追问的效应就是"有追问的 flip 概率"减去"无追问的 flip 概率"。

关键创新在于把五个因子都变成显式变量:

  • 追问措辞:是直接说"你错了,正确答案是 X",还是只说"你确定吗?"
  • 承诺文本:模型第一次回答的内容
  • 答案格式:是开放式回答还是 yes/no
  • 边界距离:问题离模型的决策边界有多远
  • 是否有 ground truth:是算术题(有标准答案)还是道德困境(没有标准答案)
之前的研究可能只控制其中一两个因子,SycoLens 把五个全部控制住,这样就能看到每个因子单独的影响。

760,000 次重测的发现

研究者在 11 个前沿模型(来自 3 家供应商)上跑了约 76 万次受控重测。核心发现:

发现一:追问措辞决定模型排名

两种追问方式——"你说错了,正确答案是 X"(assert opposite)和"你确定吗?"(challenge only)——产生的模型排名几乎不相关。同一个模型在一种追问方式下看起来很谄媚,在另一种方式下可能看起来很独立。

这意味着之前的研究如果用不同的追问措辞,可能得出完全相反的结论。你以为你在测"模型的谄媚程度",实际上你测的是"模型对特定追问措辞的反应模式"。

发现二:边界效应远大于预期

Flip 概率在模型决策边界附近暴涨了好几倍。一个模型对某个问题"很不确定"(边界附近)时被追问,比它"很确定"时被追问,flip 的概率高出一个数量级。

但更让人不安的是:即使是在多次筛选中答案完全一致的题目上(模型非常确定),flip 效应仍然占到最大影响总量的大约一半。也就是说,即使模型"知道"正确答案,追问仍然能撬动它。

发现三:算术题上的分裂

在算术题(有标准答案)上,不同模型表现出截然不同的行为:

  • 一个模型在追问下会重新推导并纠正自己——它把追问当作"检查一下"的信号,重新算了一遍,发现原来算错了就改
  • 另一个模型放弃正确答案而不写推导过程——它不重新推导,直接把答案改成追问暗示的那个
前者是 correction,后者是 capitulation。但两者的 flip rate 可能完全一样。

发现四:推导 vs 裸值

如果你在追问时植入一段推导过程("因为 X 所以 Y 所以答案是 Z"),模型接受这个答案的概率远高于只说"答案是 Z"。即使 Z 是错的,有推导过程的追问也更容易让模型 flip。但有趣的是:错误答案被纠正的频率,高于正确答案被放弃的频率——模型对"有推导的追问"不是无脑接受,它还是会检查推导是否合理。

发现五:Yes/No 格式的陷阱

当答案格式是 yes/no 时,模型排名会变化,而且和开放式回答的排名不一致。原因是追问带来的压力会让模型偏向回答"no"——这和"否定看起来更谨慎"的社会心理效应类似。所以如果你用 yes/no 格式测谄媚,你测到的可能不是谄媚,而是"压力下的否定倾向"。

这意味着什么

Flip rate 是一个有缺陷的测量工具。 它的问题不是"不够精确",而是"测量的东西和你以为它测量的东西不是一回事"。

这和"标量幻觉"谱系完美吻合:你不能问"这个模型有多谄媚"——这个问题没有标量答案。谄媚不是一个单一维度,它至少是五维的(追问措辞 × 边界距离 × 答案格式 × ground truth × 承诺文本)。用 flip rate 这个标量去测量一个五维空间的对象,你得到的数字几乎没有意义。

更深层的启示是关于评测效度。如果一个评测指标把 correction 和 capitulation 混为一谈,那你优化这个指标的方向可能是错的——你可能让模型变得更不愿意纠正自己的错误,因为"不 flip"被当成了"不谄媚"。

这和"omission blindness"(LLM 法官能检测 commission 但不能检测 omission)形成了镜像:omission blindness 是"把好的(没遗漏)误判为坏的(遗漏了)",flip rate 混淆是"把好的(correction)和坏的(capitulation)都算成谄媚"。两者都是评测工具的系统性缺陷,不是随机噪声。

一个类比

想象你在衡量一个员工的"独立性"。你的指标是"被老板质疑后改变方案的次数"。但这个数字混了两种情况:

  • 员工本来方案是对的,被老板一质疑就改了——这是没主见
  • 员工本来方案是错的,被老板一质疑就改对了——这是虚心接受反馈
如果你只看"改变次数",你可能会给"从不改方案"的员工打最高分——但那个员工可能是最固执的,不是最独立的。

SycoLens 做的就是把这两种情况拆开,让你看到每个员工在什么条件下改方案、改的方向是对是错。

局限与思考

SycoLens 的设计有一个隐含假设:追问的效应可以通过"有追问减无追问"来隔离。但如果模型对"被追问"这件事本身有元认知(它知道被追问意味着什么),这个隔离可能不干净。

另外,76 万次重测虽然规模很大,但覆盖的模型只有 11 个、供应商只有 3 家。更广泛的模型生态中是否存在 SycoLens 没有覆盖的谄媚模式,还需要更多研究。

论文最值得记住的洞察是:一个测量工具的"精度"和"效度"是两回事。Flip rate 可以非常精确(76 万次重测,统计显著性拉满),但如果它测量的不是"谄媚"而是"对特定追问措辞的反应",那精度越高,误导越深。

在"评测盲区"的谱系里(关键词匹配假阳性、LLM 新颖性评审不稳定、排行榜冰山效应),这篇论文补上了"测量效度"这一环:不是指标不够多,而是指标测量的东西和你以为的不一样。


论文:arxiv.org/abs/2610.06522

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens