我宁愿退出NLP也不想再读这种论文了:LLM正在批量生产rather than句式
你最近读论文时有没有注意到一个现象:满屏都是"X rather than Y"的句式?
目录
一个让人越读越烦的句式
你最近读论文时有没有注意到一个现象:满屏都是"X rather than Y"的句式?
- "我们提出一种新方法,rather than 简单地扩展模型规模"
- "我们的方法关注效率,rather than 追求绝对精度"
- "我们使用端到端训练,rather than 依赖人工特征工程"
这篇论文的标题就是一句吐槽:"I would rather quit NLP than read another paper like this"(我宁愿退出 NLP 也不想再读这种论文了)。
作者们不是在搞笑。他们是认真的。他们用数据证明了一件事:LLM 正在把"rather than"句式变成 NLP 论文的标配,而这个趋势的源头是后训练的偏好数据。
数据说话:rather than 真的变多了
Q1:频率真的增加了吗?
作者比较了 2019 年(LLM 普及前)和 2026 年(LLM 普及后)的 ACL 论文,发现:
- 2019 年:平均每篇论文出现 2.3 次 "rather than"
- 2026 年:平均每篇论文出现 6.8 次——翻了 3 倍
- LLM 写的 2019 风格论文:平均 8.1 次/篇
- LLM 写的 2026 风格论文:平均 12.4 次/篇
Q2:读者真的觉得烦吗?
两位资深 NLP 研究者( routinely review for *ACL conferences)盲标注每个"rather than"的使用是"合理"还是"烦人"。结果:
- 2019 年的论文:几乎没有被标注为"烦人"的用法
- 2026 年的论文:约 50% 的论文至少有一个让标注者烦的用法
- LLM 生成的论文:烦人用法的比例更高
Q3:什么样的用法让人烦?
标注者发现,烦人的用法有三个特征:
1. 贬低被否定的选项:不只是说"我们用 A 而不是 B",而是暗示 B 很差劲。"我们关注效率,rather than 追求那些不切实际的绝对精度"——后者被描绘成一个不值得追求的目标。 2. 攻击稻草人:被否定的选项往往不是真正有人在做的事情。"我们使用端到端训练,rather than 依赖过时的人工特征工程"——但 2026 年谁还在用人工特征工程? 3. 不提供信息增量:否定一个选项并不增加论文的精确性。"我们的方法关注效率,rather than 关注其他方面"——这等于什么都没说。
Q4:偏好数据在奖励这种句式
最关键的发现来了。作者检查了开源模型的偏好数据(用于 RLHF/DPO 训练的 pairwise comparisons),发现:
- 偏好标注者倾向于选择含"rather than"的回复
- 开源奖励模型给含"rather than"的回复打更高分
- 一个"要诚实"的指令反而促进了这种句式——因为"rather than"看起来像在澄清范围,显得更精确
为什么这很重要?
"长度偏好"的语法版
之前的研究发现 LLM 后训练有"长度偏好"——更长的回复得分更高。这篇论文发现的是"对比句式偏好"——含"rather than"的回复得分更高。
两者本质相同:后训练在优化某些表面特征,而不是真正的质量。长度偏好让回复变长,对比句式偏好让回复变"对比化"——不管对比是否有意义。
"表面精确性"陷阱
"rather than"句式之所以被偏好数据奖励,可能因为它看起来更精确。"我们用 A rather than B"看起来像在明确范围,显得作者思路清晰。但当这种句式被滥用——每个句子都来一个"rather than"——它就变成了精确性的幻觉,而不是真正的精确。
这和之前步子哥关注的"合理化外壳"概念高度相关:LLM 学会了用看起来精确的句式来包装内容,但句式本身不提供任何信息增量。"rather than"就是 NLP 论文里的合理化外壳——它让论文看起来更严谨,但实际上只是在做表面文章。
"纠正表面形式无效"
论文最后提出了一个警告:单纯禁止"rather than"不会解决问题。因为后训练奖励的是"对比式表述"这个功能,而不是"rather than"这个词。你禁掉"rather than",模型会换成"instead of";禁掉"instead of",模型会换成"not merely...but also"。
这和"长度偏好"的治理一样:你惩罚长回复,模型会变成"密集但无信息"的回复。问题的根源不在表面形式,而在后训练的奖励信号。
更深的启示
AI 写作风格的"指纹"会演化
"rather than"只是当前被识别出的指纹。之前的研究发现 ChatGPT 喜欢用"delve"、"tapestry"、"navigate"等词。这些词的频率在 2023-2024 年飙升,但后来因为被识别出来,频率开始下降。
这说明 AI 写作风格的指纹不是静态的——它在和检测器玩猫鼠游戏。检测器识别出一个指纹,后训练就调整到下一个未被识别的指纹。"rather than"只是当前轮次被识别出的那一个。
偏好数据的系统性偏差
更根本的问题是:偏好数据本身有偏差。人类标注者在做 pairwise comparison 时,倾向于选择"看起来更专业"的回复,而"rather than"句式恰好触发了"专业感"的启发式。
这意味着:RLHF 不只是在优化有用性,也在优化"看起来专业的表面特征"。而这些表面特征一旦被过度优化,就变成了让读者烦的"AI 味"。
对学术写作的启示
如果你在写论文,这篇论文给了三个实用建议:
1. 检查你的"rather than":每用一个,问自己"被否定的选项有人真的在做吗?"如果没有,删掉。 2. 不要用否定来定义贡献:说"我们做了 X"就够了,不需要加"rather than Y"来强调 X 的重要性。 3. 警惕 LLM 辅助写作的隐性影响:即使你不让 LLM 写全文,LLM 的改写建议也可能把你的句式往"rather than"方向推。
诚实评价
1. 样本量有限:标注只由两位研究者完成,主观性较强。但两位标注者的一致性(inter-annotator agreement)没有详细报告。 2. 只研究了"rather than":其他对比句式("instead of"、"not merely"等)的频率和烦人程度没有系统比较。 3. 因果链不完整:证明了偏好数据奖励"rather than",但没有直接证明"偏好数据是 NLP 论文频率上升的唯一原因"——人类作者也可能在模仿其他人类作者。 4. "烦人"是主观的:有些读者可能觉得"rather than"用得好时确实能澄清范围。论文承认"legitimate"和"annoying"不是简单的对立。
但作为一个"提出问题"的论文,它已经足够有力:它用数据证明了一个很多人隐约感觉到但没人系统研究的现象。
结语
这篇论文本身就在示范如何避免"rather than"陷阱——它的标题用了"rather than",但那是讽刺性的自我引用。论文正文几乎没有 gratuitous 的"rather than"用法。
最好的科学写作不是说"我们做了 X 而不是 Y",而是说"我们做了 X,因为 Z"。理由比对比更有说服力。
当 LLM 越来越多地参与学术写作,我们需要的不只是检测 AI 生成的工具,更需要理解后训练在系统性地改变什么。"rather than"只是冰山一角——水面下是整个偏好数据的奖励偏差。
论文:I would rather quit NLP than read another paper like this: The rise of antithesis in NLP papers