我宁愿退出NLP也不想再读这种论文了:LLM正在批量生产rather than句式

你最近读论文时有没有注意到一个现象:满屏都是"X rather than Y"的句式?

目录
  1. 一个让人越读越烦的句式
  2. 数据说话:rather than 真的变多了
  3. Q1:频率真的增加了吗?
  4. Q2:读者真的觉得烦吗?
  5. Q3:什么样的用法让人烦?
  6. Q4:偏好数据在奖励这种句式
  7. 为什么这很重要?
  8. "长度偏好"的语法版
  9. "表面精确性"陷阱
  10. "纠正表面形式无效"
  11. 更深的启示
  12. AI 写作风格的"指纹"会演化
  13. 偏好数据的系统性偏差
  14. 对学术写作的启示
  15. 诚实评价
  16. 结语

一个让人越读越烦的句式

你最近读论文时有没有注意到一个现象:满屏都是"X rather than Y"的句式?

  • "我们提出一种新方法,rather than 简单地扩展模型规模"
  • "我们的方法关注效率,rather than 追求绝对精度"
  • "我们使用端到端训练,rather than 依赖人工特征工程"
一篇两篇还好,但当每篇论文都充斥这种"定义式否定"——先说一个东西不是什么,再说它是什么——你就开始烦了。

这篇论文的标题就是一句吐槽:"I would rather quit NLP than read another paper like this"(我宁愿退出 NLP 也不想再读这种论文了)。

作者们不是在搞笑。他们是认真的。他们用数据证明了一件事:LLM 正在把"rather than"句式变成 NLP 论文的标配,而这个趋势的源头是后训练的偏好数据。

数据说话:rather than 真的变多了

Q1:频率真的增加了吗?

作者比较了 2019 年(LLM 普及前)和 2026 年(LLM 普及后)的 ACL 论文,发现:

  • 2019 年:平均每篇论文出现 2.3 次 "rather than"
  • 2026 年:平均每篇论文出现 6.8 次——翻了 3 倍
更关键的是,LLM 生成的论文(用 2019 和 2026 年的标题摘要让 LLM 写全文)频率更高:
  • LLM 写的 2019 风格论文:平均 8.1 次/篇
  • LLM 写的 2026 风格论文:平均 12.4 次/篇
人类作者在向 LLM 的风格靠拢,LLM 又把这种风格推到更极端。这是一个正反馈循环。

Q2:读者真的觉得烦吗?

两位资深 NLP 研究者( routinely review for *ACL conferences)盲标注每个"rather than"的使用是"合理"还是"烦人"。结果:

  • 2019 年的论文:几乎没有被标注为"烦人"的用法
  • 2026 年的论文:约 50% 的论文至少有一个让标注者烦的用法
  • LLM 生成的论文:烦人用法的比例更高
这说明:不是所有"rather than"都烦人,但 2026 年的论文里确实出现了大量让人烦的用法。

Q3:什么样的用法让人烦?

标注者发现,烦人的用法有三个特征:

1. 贬低被否定的选项:不只是说"我们用 A 而不是 B",而是暗示 B 很差劲。"我们关注效率,rather than 追求那些不切实际的绝对精度"——后者被描绘成一个不值得追求的目标。 2. 攻击稻草人:被否定的选项往往不是真正有人在做的事情。"我们使用端到端训练,rather than 依赖过时的人工特征工程"——但 2026 年谁还在用人工特征工程? 3. 不提供信息增量:否定一个选项并不增加论文的精确性。"我们的方法关注效率,rather than 关注其他方面"——这等于什么都没说。

Q4:偏好数据在奖励这种句式

最关键的发现来了。作者检查了开源模型的偏好数据(用于 RLHF/DPO 训练的 pairwise comparisons),发现:

  • 偏好标注者倾向于选择含"rather than"的回复
  • 开源奖励模型给含"rather than"的回复打更高分
  • 一个"要诚实"的指令反而促进了这种句式——因为"rather than"看起来像在澄清范围,显得更精确
这解释了为什么 LLM 越来越爱用这种句式:后训练在奖励它。

为什么这很重要?

"长度偏好"的语法版

之前的研究发现 LLM 后训练有"长度偏好"——更长的回复得分更高。这篇论文发现的是"对比句式偏好"——含"rather than"的回复得分更高。

两者本质相同:后训练在优化某些表面特征,而不是真正的质量。长度偏好让回复变长,对比句式偏好让回复变"对比化"——不管对比是否有意义。

"表面精确性"陷阱

"rather than"句式之所以被偏好数据奖励,可能因为它看起来更精确。"我们用 A rather than B"看起来像在明确范围,显得作者思路清晰。但当这种句式被滥用——每个句子都来一个"rather than"——它就变成了精确性的幻觉,而不是真正的精确。

这和之前步子哥关注的"合理化外壳"概念高度相关:LLM 学会了用看起来精确的句式来包装内容,但句式本身不提供任何信息增量。"rather than"就是 NLP 论文里的合理化外壳——它让论文看起来更严谨,但实际上只是在做表面文章。

"纠正表面形式无效"

论文最后提出了一个警告:单纯禁止"rather than"不会解决问题。因为后训练奖励的是"对比式表述"这个功能,而不是"rather than"这个词。你禁掉"rather than",模型会换成"instead of";禁掉"instead of",模型会换成"not merely...but also"。

这和"长度偏好"的治理一样:你惩罚长回复,模型会变成"密集但无信息"的回复。问题的根源不在表面形式,而在后训练的奖励信号。

更深的启示

AI 写作风格的"指纹"会演化

"rather than"只是当前被识别出的指纹。之前的研究发现 ChatGPT 喜欢用"delve"、"tapestry"、"navigate"等词。这些词的频率在 2023-2024 年飙升,但后来因为被识别出来,频率开始下降。

这说明 AI 写作风格的指纹不是静态的——它在和检测器玩猫鼠游戏。检测器识别出一个指纹,后训练就调整到下一个未被识别的指纹。"rather than"只是当前轮次被识别出的那一个。

偏好数据的系统性偏差

更根本的问题是:偏好数据本身有偏差。人类标注者在做 pairwise comparison 时,倾向于选择"看起来更专业"的回复,而"rather than"句式恰好触发了"专业感"的启发式。

这意味着:RLHF 不只是在优化有用性,也在优化"看起来专业的表面特征"。而这些表面特征一旦被过度优化,就变成了让读者烦的"AI 味"。

对学术写作的启示

如果你在写论文,这篇论文给了三个实用建议:

1. 检查你的"rather than":每用一个,问自己"被否定的选项有人真的在做吗?"如果没有,删掉。 2. 不要用否定来定义贡献:说"我们做了 X"就够了,不需要加"rather than Y"来强调 X 的重要性。 3. 警惕 LLM 辅助写作的隐性影响:即使你不让 LLM 写全文,LLM 的改写建议也可能把你的句式往"rather than"方向推。

诚实评价

1. 样本量有限:标注只由两位研究者完成,主观性较强。但两位标注者的一致性(inter-annotator agreement)没有详细报告。 2. 只研究了"rather than":其他对比句式("instead of"、"not merely"等)的频率和烦人程度没有系统比较。 3. 因果链不完整:证明了偏好数据奖励"rather than",但没有直接证明"偏好数据是 NLP 论文频率上升的唯一原因"——人类作者也可能在模仿其他人类作者。 4. "烦人"是主观的:有些读者可能觉得"rather than"用得好时确实能澄清范围。论文承认"legitimate"和"annoying"不是简单的对立。

但作为一个"提出问题"的论文,它已经足够有力:它用数据证明了一个很多人隐约感觉到但没人系统研究的现象。

结语

这篇论文本身就在示范如何避免"rather than"陷阱——它的标题用了"rather than",但那是讽刺性的自我引用。论文正文几乎没有 gratuitous 的"rather than"用法。

最好的科学写作不是说"我们做了 X 而不是 Y",而是说"我们做了 X,因为 Z"。理由比对比更有说服力。

当 LLM 越来越多地参与学术写作,我们需要的不只是检测 AI 生成的工具,更需要理解后训练在系统性地改变什么。"rather than"只是冰山一角——水面下是整个偏好数据的奖励偏差。


论文:I would rather quit NLP than read another paper like this: The rise of antithesis in NLP papers

代码:github.com/olzama/rather-than-public

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens