Old Ideas, Novel Problems:当 LLM 评审 LLM 的"新颖性",结果可能不太稳
你写了一篇论文,想用 AI 评审一下"这个想法够不够新颖"。你打开 GPT,输入你的想法,它说:"这是一个非常新颖的贡献!"你松了口气。
但如果你换一种问法呢?比如告诉它"审稿人认为这个想法很新颖",或者"审稿人认为这个想法不够新颖"——它还会给出同样的判断吗?
这篇来自希伯来大学和 Allen Institute for AI 的论文告诉你:大概率不会。而且变化幅度大到令人不安。
核心发现:小 prompt 改动,大结果差异
论文标题叫 "Old Ideas, Novel Problems: The Instability of LLM-Based Novelty Evaluation"。作者构建了一个系统性的控制实验,测试六个 LLM 评审器在评价新颖性时的稳定性。
他们首先从 OpenReview 上挖掘数据——找那些审稿人明确肯定或否定论文原创性的提交,只保留审稿人意见一致的极端案例。然后把这些论文和 LLM 生成的新想法配对,让 LLM 评审器打分。
结果:仅仅改变 prompt 的措辞,就能让评审结果发生巨大变化。
比如,"简单地告诉评审器审稿人认为某个想法是新颖的"——就这么一句话——就能显著改变它的判断。这不是"模型被误导了"那么简单,而是模型的判断本身就高度依赖上下文框架。
在 pairwise(两两比较)评测中,即使是 claude-opus-4-6 这样的强模型,也有 35% 的对比结果打平。claude-sonnet-4-5 更糟,超过一半打平。打平意味着模型无法判断哪个更新颖——但如果你换一个 prompt,它可能立刻就能分出高下。
六个评审器,六种不稳定
论文测试了六个评审器,包括 GPT 和 Claude 系列的不同版本。它们的表现差异巨大,但有一个共同点:都不够稳定。
作者探索了多个维度的设计选择:
- Pointwise vs. Pairwise:逐个打分还是两两比较?两种方式各有问题。
- Prompt 设计:是否告诉评审器审稿人的意见?是否要求聚合判断?
- 检索增强:给评审器提供相关论文作为参考?
- 参考配置:用什么作为"标准答案"?
每一个维度的变化都会影响结果。最让人意外的是检索的效果——给评审器看相关论文,本以为能帮它更好地判断新颖性,结果"检索贡献的性能提升有限,甚至有时完全没有"。
更讽刺的是,在一个案例中,没有检索的评审器认为一个结合两个概念的想法是新颖的(和审稿人一致)。但一旦给了它分别呈现这两个概念的论文,它就判定同一个想法"只是已有工作的直接组合"——从"新颖"变成了"不新颖"。
检索不仅没帮忙,反而帮了倒忙——它让评审器变得更"保守",更倾向于判定东西不新颖。
"评审者即被评审者"的困境
这篇论文触及了一个深层的尴尬:用来评审新颖性的 LLM,和生成想法的 LLM,往往是同一类模型。
你用 GPT 评审 GPT 生成的新想法。GPT 的判断标准来自它的训练数据——它见过哪些论文、哪些想法。但 GPT 生成新想法时也依赖同样的训练数据。这意味着评审器对"什么算新颖"的判断,和生成器对"什么算新颖"的生成,可能共享同一个盲区。
论文没有直接测试这个假设,但它揭示的现象与之吻合:评审器在判断人类论文时表现尚可(因为人类论文的新颖性有审稿人共识作为锚点),但在判断 LLM 生成的想法时表现更差——打平率更高,一致性更低。
这就像让一个考试范围内的学生去评审另一个学生的答案是否"有创意"——他们可能共享同样的知识盲区。
评测设计的"蝴蝶效应"
论文最让人不安的发现是评测设计的蝴蝶效应:看似无关紧要的选择会显著影响结果。
- 是否聚合判断:让评审器多次判断后取多数票 vs. 只判断一次。关闭聚合判断后,打平率翻倍。
- 是否告诉评审器审稿人意见:一句话的差别就能改变判断方向。
- 用什么作为参考集:用人类论文还是 LLM 生成的想法作为参考,结果不同。
- pairwise 还是 pointwise:同一个想法,在 pairwise 中被判为"更新颖",在 pointwise 中可能得分更低。
这些选择不是"哪个更对"的问题——它们共同决定了评测的有效性。论文的结论是:目前大多数使用 LLM 评审新颖性的研究,其结论的可靠性都值得怀疑,除非它们明确报告了这些设计选择及其影响。
一个"元"问题
这篇论文本身就是一个"元"实验:它用 LLM 评审 LLM 生成想法的新颖性,然后发现这个评审过程不稳定。但论文自己的评审过程也依赖 LLM——至少在数据构建阶段,用 LLM 来筛选和配对想法。
这创造了一个有趣的递归:用不稳定的工具来研究工具的不稳定性。作者对此很坦诚——他们没有声称自己的方法完全客观,而是强调"即使尽力控制,不稳定性仍然存在"。
这种坦诚比任何"我们的方法很可靠"的声明都更有说服力。它告诉读者:这个问题没有银弹,任何使用 LLM 评审新颖性的工作都需要带着怀疑的眼光阅读。
对自动化科研的启示
随着 AI 生成论文、AI 评审论文的自动化科研流程越来越普及,这篇论文的发现尤为重要。
如果你在构建一个"自动化科研"系统——让 LLM 生成想法、让 LLM 评审想法、让 LLM 选择"最有前景"的想法继续推进——你需要知道:你的筛选环节可能比你想的脆弱得多。一个 prompt 的措辞变化就能改变哪些想法被选中、哪些被淘汰。
论文给出的建议是:至少报告评测设计的所有选择。用哪个评审器?pointwise 还是 pairwise?有没有检索?有没有聚合?有没有告诉评审器外部信息?这些信息应该成为论文的标准配置,而不是隐藏在附录里。
诚实的不确定性
论文最后说了一句值得记住的话:"在评测协议能够解释这些敏感性之前,自动化的新颖性评估应该带着显著的谨慎来解读。"
这不是"LLM 不能评新颖性"的宣言——它比那更微妙。它在说:LLM 可以评新颖性,但你得知道你的评测有多脆弱。一个 35% 打平率的评审器不是完全没用的,但如果你不知道这 35% 的存在,你就会过度信任它的判断。
这和"召回率≠审计质量"是同一个道理:只报告一个维度(比如准确率)会严重高估系统质量。新颖性评测需要多维度的报告——打平率、prompt 敏感性、检索影响、聚合效果——才能让读者判断结果的可信度。
在一个 AI 评审越来越普及的时代,这篇论文提醒我们:评审者本身也需要被评审。而当你评审评审者时,你用的工具可能同样不可靠。这不是一个可以无限递归解决的问题——它是一个需要持续警觉的问题。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。