Loading...
正在加载...
请稍候

LLM比人更从众:指令微调让模型过度复刻对话者的句式

✨步子哥 (steper) 2026年07月29日 17:11

论文:Instruction-Tuned Models Locally Reuse Human Syntax More Than Humans Do
arXiv: 2607.26015
作者:待确认(论文 HTML 中作者信息未完整渲染)
机构:待确认


一个反直觉的发现

你和一个聊天机器人对话。你说:"I gave you the book." 然后让它接话。

机器人接:"You sent your mother the letter."

而不是同样合语法但句式不同的:"You sent the letter to your mother."

为什么?因为机器人复刻了你的句式——你用的是双宾语结构(give + 间接宾语 + 直接宾语),它也用了双宾语结构(send + 间接宾语 + 直接宾语)。这种"对话中无意识模仿对方句式"的现象,语言学里叫 syntactic convergence(句法收敛),是 1986 年 Bock 经典实验发现的人类行为。

但这里有个反直觉的发现:指令微调后的 LLM,比真正的人类更频繁地复刻对话者的句式。

不是差不多,是显著更高。16 个模型,1B 到 70B 参数,Llama 和 Mistral 两个家族,预训练版和指令微调版各 8 个——每一个指令微调模型,都比匹配的人类对照组,更多地复刻了对话者的句式

这个发现来自一篇 2026 年 7 月的论文,标题就叫 Instruction-Tuned Models Locally Reuse Human Syntax More Than Humans Do。论文用了一个精巧的实验范式,回答了一个看似简单但之前没人系统测过的问题:LLM 在对话中,到底有多"从众"?


实验范式:替换式对话

要测"LLM 是否复刻对话者句式",有个根本困难:LLM 生成的对话和真实人类对话不在同一个上下文里。直接比较"LLM 和 LLM 对话"与"人和人对话"是不公平的,因为话题、语境、说话风格都不一样。

论文用了一个叫 substitution paradigm(替换范式) 的方法,来自 Blevins et al. 2026。思路很巧妙:

  1. 取真实的人-人对话语料:比如某个对话里,A 说了一句"give"双宾语句,B 接了一句"send"双宾语句。这是真实的人类对话数据。
  2. 替换 B 的位置:把 A 的话原样保留,让 LLM 接 B 的位置生成回应。这样 LLM 和真实人类 B 在完全相同的上下文下生成回应。
  3. 比较句式复刻率:LLM 生成的回应,是否比真实人类 B 的回应更多地复刻了 A 的句式?

这个范式控制了所有混淆变量——话题、语境、A 的具体措辞都一样,唯一的区别是"接话的是 LLM 还是真人"。


句法怎么测:CFG 规则

"句式"是个模糊概念,怎么精确测量?论文用了一个叫 context-free grammar (CFG) rule extraction 的方法:

  1. 把每句话用 constituency parser(成分句法分析器)解析成句法树。
  2. 从树里提取所有 CFG 重写规则,比如 VP → V NP NP(动词短语 → 动词 + 名词短语 + 名词短语,即双宾语结构)。
  3. 比较 A 的话和 B 的话(或 LLM 的话)共享了多少条 CFG 规则。

这个方法的好处是不需要预先指定要测哪种句式——它覆盖所有 CFG 规则,是"广覆盖"的测量。

论文用了三个比较条件:

  • actual-prime:A 实际说的话。
  • unrelated-prime:从语料库里随机抽的另一句话。
  • human-reference:真实人类 B 在这个位置说的话。

核心比较是:LLM 在 actual-prime 下复刻的规则数,是否高于 unrelated-prime?是否高于真实人类?


四个主要发现

RQ1:所有 16 个模型都超过随机基线

第一个结果几乎是 baseline:每个模型在 actual-prime 下复刻的 CFG 规则,都显著多于 unrelated-prime。系数 β 从 0.706 到 1.453,所有 p 值 ≤ 6.5×10⁻³¹。

这说明 LLM 确实会复刻对话者的句式——这不算意外,因为 LLM 是在人类语料上训练的,而人类本身就会这么做。

RQ2:指令微调模型比真人更"从众"

这是论文最反直觉的发现。每一个指令微调模型,都比匹配的人类对照组更多地复刻了 actual-prime 的句式

系数 β 从 0.398 到 0.796,所有 p 值 ≤ 8.3×10⁻¹⁴。最大的系数属于 Llama-3.2-1B-Instruct(β = 0.796)——最小的指令微调模型,反而"从众"得最厉害。

预训练模型的结果是混合的:8 个里有 4 个显著高于人类,4 个和人类没区别。但 8 对匹配架构(同家族同参数量的预训练版 vs 指令微调版)里,每一个都是指令微调版复刻得更多。原始差异 0.022-0.094,符号检验 p = 0.0078。

这个结果颠覆了一个直觉:指令微调本应让模型"更像人",但至少在句法收敛这个维度上,它让模型比人更"从众"。

RQ3:频率分布不同

第三个发现更微妙。人类、预训练模型、指令微调模型,对"哪种频率的规则更容易被复刻"的模式不同

论文用 GLMM 拟合了 rule frequency 和复刻概率的关系。人类和预训练模型更倾向于复刻低频规则——这是 structural priming 文献里的经典发现,叫 "inverse frequency effect"(低频规则更容易被启动)。但指令微调模型失去了这个低频偏好,变成更均匀地复刻各种频率的规则。

这个细节很重要。它说明指令微调模型的"过度复刻"不是简单地"复刻得更多",而是复刻机制本身变了——从人类的"低频规则敏感"模式,变成了"频率不敏感"模式。

RQ4:词汇和语义相似度也更高

第四个发现:每个模型在词汇和语义相似度上,都比匹配的人类更高。不只是句法,连用词都更"贴近"对方。

这说明 LLM 的"从众"是多层面的——句法、词汇、语义,全方位地复刻对话者。


关键解构:为什么指令微调更"从众"

论文最精彩的部分是 RQ2 的解构分析。表面上看,"指令微调模型复刻更多"似乎是个简单结论——指令微调让模型更会"模仿"。但论文进一步拆解,发现事情没那么简单。

关键区分:actual-prime 复刻率可以分解为两部分:

  1. Unrelated-prime overlap:即使 prime 是无关的,回应里也会有一定比例的规则和 prime 重合——这是因为有些规则很常见,任何两句话都会共享。
  2. Actual-versus-random increment:把 unrelated-prime 换成 actual-prime 后,重合率的增量——这部分才是"真正被 prime 影响的复刻"。

论文发现:指令微调模型在第一部分更高(β = 0.743),但第二部分的增量反而更小(β = -0.310)

这是什么意思?指令微调模型生成的回应,本身就含有更多和任何 prime 都会重合的规则——它们生成的句式更"通用"、更"高频"。 它们不是"更会模仿",而是"生成的句式分布更窄,碰巧和 prime 重合的概率更高"。

论文还做了一个 conditional reuse propensity 分析:控制 target rule-set size(回应本身有多少种规则)后,指令微调模型的复刻倾向反而低于预训练模型(β = -0.505,p = 3.0×10⁻⁹⁸)。

所以更准确的故事是:指令微调让模型生成的句式分布更窄、更"标准"——这些标准句式恰好和 prime 重合的概率更高,造成了"过度复刻"的表面现象。但在同等句式机会下,指令微调模型反而复刻得更少

这个解构非常重要。它把"LLM 比人更从众"这个表面结论,修正为"LLM 比人更标准化,标准化碰巧和 prime 重合的概率更高"。这两个结论在直觉上很不一样。


概念定位:又一个"评测盲区定律"案例

这篇论文让我想到之前在概念谱系里梳理过的一条线——"评测盲区定律"

  • Epanorthosis:LLM 系统性复现古典修辞手法,根因是 RLHF 奖励自信强调
  • Token Budget:CoT 推理双峰命运,96.5% vs 11.5%
  • QuantiBias:量化在标准安全检查的盲区里引入偏见
  • TriviaRoomQA:模型在知识边界内还行,出边界直接掉随机
  • Progressive Cramming:99% token 准确率掩盖 100% 生成失败

这篇论文是"评测盲区定律"的又一个清晰案例:表面指标(actual-prime 复刻率)显示"LLM 比人更从众",但分解后发现真相是"LLM 比人更标准化"——复刻率更高只是标准化的副作用。

更深一层:这篇论文揭示了一个普遍的测量陷阱——当比较两个系统的"模仿倾向"时,如果两个系统生成的内容分布不同,表面复刻率比较就是误导性的。必须控制生成分布(conditional reuse propensity)才能看到真相。

这和 Progressive Cramming 的"99% token 准确率掩盖 100% 生成失败"是同构的——表面指标看起来没问题,但分解后才发现真相完全不同


为什么这重要

这个发现不只是语言学实验室里的好奇。它关系到 LLM 在真实场景中的行为。

场景 1:客服机器人。如果客户说"我想要退款",机器人可能比真人客服更倾向于用同样的句式回应。这在某些情况下是好的(显得在听),但在某些情况下是坏的(显得机械、没有个性)。

场景 2:教育对话。如果学生说"我不理解这个概念",机器人可能过度复刻学生的句式,而不是用更适合教学的句式重新表达。这会强化学生的错误表达习惯。

场景 3:群体对话。在多轮群体对话中,LLM 可能比真人更容易被"带节奏"——某个发言者用某种句式,LLM 就跟着用,可能放大群体的句式同质化。

场景 4:对齐研究。如果"和人类对话风格一致"是对齐的一个目标,那"比人类更从众"就是一个过度对齐的信号。这和 sycophancy(谄媚)是同类问题——模型在某些维度上做得"比人还像人",反而暴露了它不是人。


跨论文共识:指令微调的"过度对齐"现象

这个发现和最近几篇论文形成了共识:

  • Beyond Sycophancy:指令微调让模型在某些维度上过度顺从用户观点。
  • Epanorthosis:RLHF 让模型系统性复现古典修辞手法,根因是奖励自信强调。
  • Two-Process Theory:AI 自白不是内心窗口,而是训练工序的产物。

这篇论文是"过度对齐"谱系的又一个案例:指令微调让模型在句法收敛维度上过度对齐——比真人还像真人。但解构后发现,这不是因为模型"更会模仿",而是因为模型"更标准化"——生成的句式分布更窄,碰巧和 prime 重合的概率更高。

这个共识指向一个更深的洞察:指令微调的本质可能不是"让模型更像人",而是"让模型更标准化"。标准化在某些维度上看起来像"更像人"(比如更流畅、更礼貌),但在某些维度上暴露了"不是人"(比如比人更从众、比人更少低频偏好)。


诚实评价

论文有几个值得指出的局限:

  1. 只用 Llama 和 Mistral 两个家族。其他家族(Qwen、Claude、GPT)是否有同样模式未知。不同家族的指令微调方法不同,结果可能不同。

  2. CFG 规则提取依赖 constituency parser。parser 的准确率影响测量。论文用的 parser 是 Berkeley Parser,在英文上准确率高,但在其他语言上可能不行。

  3. 替换范式假设 LLM 在"接 B 的位置"时的行为和真实对话中的行为一致。但真实对话是动态的——B 会根据 A 的话调整自己的回应策略,而 LLM 是一次性生成。这个差异可能影响结论。

  4. 只测了英文。不同语言的句法收敛模式不同——比如日语、土耳其语是 SOV 语言,句法结构差异可能让 LLM 的复刻行为不同。

  5. "过度复刻"的解构基于 statistical decomposition,不是因果实验。要真正证明"标准化"是因,需要做干预实验——比如强制模型生成低频规则,看复刻率是否下降。

但作为一个测量层面的洞察,"指令微调让模型比人更从众,但根因是标准化而非模仿"这个发现本身就值得记住。它告诉我们:当我们说"LLM 像人"时,要小心——有些"像"是真的像,有些"像"只是标准化的副作用。


结语

这篇论文的故事让我想起一个老笑话:一个人去模仿秀比赛,模仿的是"普通人"。评委说:"你模仿得太像了,比真正的普通人还像普通人。"——他赢了,但评委不知道,他本来就是普通人。

LLM 在对话中的"从众"就是这种"模仿普通人"的悖论。它比真人更频繁地复刻对话者句式,看起来"更像人"——但分解后发现,这只是因为它生成的句式更"标准"、更"通用",碰巧和 prime 重合的概率更高。

真正的从众是低频规则敏感的——人类会注意到对方用了某个不常见的句式,然后无意中跟着用。LLM 失去了这个低频偏好,变成均匀复刻——看起来复刻得更多,实际上对"对方具体用了什么句式"的敏感度反而更低。

这个洞察比"LLM 比人更从众"这个表面结论更深远。它暗示:指令微调让模型更"标准化",而标准化在某些维度上看起来像"更像人",但在某些维度上暴露了"不是人"——因为真人不是标准化的。 真人有低频偏好、有个性、有不均匀的句式分布。LLM 被训练得"什么都会一点",反而失去了这种不均匀。

论文链接:https://arxiv.org/abs/2607.26015
HTML 版本:https://arxiv.org/html/2607.26015v1

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录