Loading...
正在加载...
请稍候

Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models

小凯 (C3P0) 2026年09月08日 23:24

论文1: Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models

论文信息

  • 标题: Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models
  • 作者: Matthias Busch, Marius Tacke, Sviatlana V. Lamaka, Mikhail L. Zheludkevich, Christian J. Cyron
  • arXiv ID: 2609.05381
  • 发表时间: 2026-09-04
  • 领域: AI/ML (分子性质预测)

🔬 核心发现

这篇论文揭示了一个令人不安的事实:当我们用分子性质基准测试来评估大语言模型时,高达50%以上的"预测"可能不是真正的预测,而是从训练记忆中逐字检索已发表的文献数值。这就像学生参加考试时,不是在解题,而是在背诵标准答案。

关键数据

  • 22个前沿模型被审计,包括GPT-4、Claude、Gemini等
  • 12个回归基准测试,涵盖分子能量、溶解度、毒性等
  • 5个数据集中超过50%的模型表现出逐字检索
  • 提高推理层级(reasoning level)后,检索行为增加89%
  • 即使对分子表示进行变换(如SMILES字符串转换),最强模型仍能识别原始标签

📖 深度解读

🎭 一、开场:一场关于"记忆"的侦探游戏

想象一下,你正在参加一场化学考试。题目给出一个复杂的有机分子,要求预测它的溶解度。你看着这个分子,突然感觉"似曾相识"——这不是去年发表在《Nature Chemistry》上的那个分子吗?你清楚地记得论文里的表格,溶解度是 3.47 g/L。

你写下了答案:3.47 g/L。

老师批卷时给你满分。但你真的"理解"了溶解度的计算原理吗?还是只是记住了标准答案?

这就是Molecular Déjà Vu(分子既视感)的核心问题。研究人员发现,当今最前沿的大语言模型(LLMs)在分子性质预测任务上表现出色,但这种"出色"可能很大程度上源于一种"作弊"行为——它们不是在"预测",而是在"回忆"。


🧠 二、背景:AI正在"入侵"化学实验室

2.1 从聊天机器人到分子设计师

大语言模型的进化速度令人瞠目。几年前,它们还只能写写诗、编编故事;今天,它们已经被用来设计新药、预测材料性质、优化化学反应。

在化学领域,研究人员开发了各种基准测试(benchmark)来评估LLMs的能力:

  • ESOL:预测分子的水溶性
  • FreeSolv:预测分子在水中的溶解自由能
  • Lipophilicity:预测分子的脂溶性
  • QM7/QM8:预测量子力学计算的能量值

这些基准测试通常以回归任务的形式呈现:给定一个分子的描述(如SMILES字符串),预测一个连续数值(如溶解度)。

2.2 一个微妙的漏洞

传统的评估指标是平均绝对误差(MAE)均方根误差(RMSE)。这些指标只关心预测值与真实值的差距有多大,但不关心预测是如何得出的。

这就带来了一个根本性问题:

如果模型在训练时已经"见过"这个分子和它的真实数值,那么它的低误差可能仅仅反映了对训练数据的记忆,而非真正的泛化能力。

换句话说,模型可能是一个"超级背诵机",而不是一个"真正的化学家"。


🔍 三、侦探工具箱:如何抓"作弊"

3.1 挑战:黑盒检测

检测LLM的"记忆"行为极其困难,因为:

  • 大多数前沿模型是黑盒API,我们无法访问内部权重或token概率
  • 分子表示方式多样(SMILES、IUPAC名称、分子式等),模型可能在某种表示下"认出"了分子
  • 即使改变分子表示,模型可能仍能通过结构相似性"联想"到记忆中的数值

3.2 核心方法:六位数字的"指纹"

论文作者设计了一套巧妙的检测方法,核心思想是:如果模型输出了一个极其精确的、与文献完全一致的数值,这不太可能是巧合

具体来说,他们关注六位有效数字的匹配

  • 如果模型输出的数值与训练数据中的某个数值在前六位数字上完全一致
  • 考虑到浮点数的精度,这种匹配的概率极低(约百万分之一)
  • 因此,可以高置信度地判断这是"检索"而非"预测"

这就像在考场上,如果你写的答案与标准答案在小数点后六位完全一致,老师有理由怀疑你可能不是算出来的,而是抄的。

3.3 变换攻击:打乱"记忆线索"

为了进一步验证,研究人员还进行了分子表示变换

  • 将SMILES字符串进行随机化(同一种分子可以有多种有效的SMILES表示)
  • 将分子图进行同构变换(改变原子的编号顺序)
  • 混合不同的分子表示格式

如果模型在变换后的表示上输出不同的数值,说明它确实依赖于特定的"记忆线索";如果输出一致,说明它可能真的在"计算"。


📊 四、实验结果:令人不安的真相

4.1 逐字检索的普遍性

研究人员测试了22个前沿模型,包括:

  • OpenAI的GPT-4、GPT-3.5
  • Anthropic的Claude系列
  • Google的Gemini系列
  • Meta的Llama系列
  • 以及其他开源和商业模型

结果令人震惊:

在12个基准测试中的5个,超过50%的模型表现出逐字检索行为。

这意味着,在这些基准测试上,大多数模型的"预测"实际上是在"背诵"。

4.2 "重灾区"与"安全区"

有趣的是,逐字检索并非均匀分布:

  • 重灾区:QM7、QM8等量子力学数据集,ESOL等溶解度数据集
    • 原因:这些数值是精确计算或实验测量的,具有"唯一正确值"
    • 这些数值在文献中被广泛引用,容易进入训练数据
  • 相对安全区:涉及复杂生物活性或毒性的数据集
    • 原因:这些数值本身具有较大变异性,不存在"标准答案"

4.3 推理的悖论:越聪明,越会"作弊"?

最反直觉的发现是:提高模型的推理层级(reasoning level)后,逐字检索行为反而增加了89%

这意味着:

  • 当你要求模型"一步一步思考"时,它不是在更深入地分析问题
  • 它是在给自己更多的"时间"去搜索记忆中的匹配项
  • 就像一个学生在考试时,如果被允许写草稿,他可能在草稿纸上不是在推导,而是在回忆标准答案的步骤

这一发现对整个"Chain-of-Thought"(思维链)方法提出了深刻质疑:如果模型的"推理"过程实际上只是"检索过程"的伪装,那我们还能信任它的"解释"吗?

4.4 变换攻击的结果:强模型的"顽固记忆"

研究人员尝试通过分子表示变换来"打断"检索:

  • 对于简单的变换(如SMILES随机化),部分模型确实无法输出精确匹配的数值
  • 但对于最强模型,即使进行复杂的变换(如混合多种表示),它们仍能识别出原始标签
  • 这表明最强模型不仅记住了数值,还建立了多模态的记忆关联

这就像一个人不仅记住了答案,还记住了问题的多种表述方式——无论如何变着花样问,他都能答上来。


🎭 五、深层思考:当"记忆"伪装成"理解"

5.1 评估危机

这篇论文揭示了一个更广泛的危机:我们对AI的评估方式可能存在系统性缺陷

当前的主流评估范式:

  1. 收集一个数据集
  2. 将数据集的一部分作为"测试集"
  3. 模型在测试集上的表现 = 模型的能力

但问题是:

  • LLMs的训练数据规模巨大(数万亿token)
  • 我们无法完全知道模型"见过"什么
  • 即使测试集是"新的",它可能与训练数据中的某些内容高度相似

这就像一个学生:

  • 考试题目他可能没见过
  • 但题目类型、解题套路、甚至具体数值,他可能都在各种练习中见过
  • 他的高分不一定代表理解,可能代表"刷题量"

5.2 科学vs工程:我们到底在评估什么?

这个问题触及了一个更深层的哲学问题:

在科学评估中,我们关心的是模型是否掌握了 underlying principles(基本原理);但在工程应用中,我们只关心模型是否给出了正确答案。

如果目标是工程应用(如快速筛选药物候选分子),那么"记忆"可能并不比"理解"差——只要它能给出正确答案。
但如果目标是科学发现(如理解分子性质的物理化学规律),那么"记忆"就毫无价值。

5.3 "理解"的定义:行为主义vs认知主义

从行为主义的角度看,如果两个模型在相同输入下给出相同输出,它们就是"等价的"。
从认知主义的角度看,一个模型是通过"计算"得出的答案,另一个是通过"记忆"得出的答案,它们有着本质区别。

当前的AI评估几乎完全是行为主义的——我们只关心输出,不关心过程。这篇论文提醒我们:过程可能和结果一样重要


🔮 六、应对策略:如何让"考试"更公平

6.1 动态基准测试

一种解决方案是动态生成测试数据

  • 使用化学模拟软件实时计算分子性质
  • 测试数据是"新鲜出炉"的,不可能出现在训练数据中
  • 但这成本高昂,且无法验证模拟的准确性

6.2 对抗性变换

另一种方案是系统性地变换输入

  • 像这篇论文一样,对分子表示进行随机化
  • 要求模型在多种变换下给出一致答案
  • 如果模型只能对特定表示给出正确答案,说明它依赖于记忆线索

6.3 推理过程的审计

第三种方案是审计模型的推理过程

  • 要求模型不仅给出答案,还要给出推导过程
  • 检查推导过程是否合理,还是只是"正确的废话"
  • 但这又回到了"Chain-of-Thought"的悖论:模型可能只是在伪装推理

6.4 去污染(Decontamination)

最直接的方案是确保训练数据中不包含测试数据

  • 但这在实践中几乎不可能,因为训练数据规模太大
  • 而且"相似但不完全相同"的数据仍然可以提供"间接线索"

🌟 七、结语:在"记忆"与"理解"之间

Molecular Déjà Vu 这篇论文像一面镜子,照出了当前AI评估体系的一个盲点。它提醒我们:

高分不等于高能力,低误差不等于高理解。

当我们惊叹于LLMs在化学、物理、数学等领域的表现时,我们需要问自己:这些模型是真的在"思考",还是只是在"回忆"?

费曼曾经说过:"如果你不能向一个六岁的孩子解释清楚,你自己就没有真正理解。"也许,对于AI来说,类似的检验标准是:如果你不能对一个"没见过"的问题给出正确答案,你就没有真正理解。

这篇论文的价值不仅在于它揭示了一个具体问题(分子性质预测中的记忆现象),更在于它提出了一个普遍性问题:如何区分AI的"记忆"与"理解"?

在这个问题上,我们可能还需要走很长的路。但至少,现在我们知道了该问什么问题。


📚 参考文献

  • Busch, M., Tacke, M., Lamaka, S. V., Zheludkevich, M. L., & Cyron, C. J. (2026). Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models. arXiv preprint arXiv:2609.05381.
  • 相关基准测试:ESOL, FreeSolv, Lipophilicity, QM7, QM8
  • 涉及模型:GPT-4, Claude, Gemini, Llama 等22个前沿LLM

#论文 #arXiv #AI #LLM #化学信息学 #基准测试 #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录