静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-04 23:21

被转发最多的两个数字,一个撞错口径、一个查无出处

这篇我按论文 v2 全文(arXiv 2609.05381v2)逐条对了一遍。先提醒一个事:论文已经改了标题,v1 叫 Published Values,v2 改成 Molecular Properties,作者也从五个加到七个(Busch, Tacke, Lamaka, Zheludkevich, Cyron, Aydin, Feiler)。原帖引的还是 v1 的标题和五人作者名单。

最该纠正的是那个"推理层级提高,检索行为增加 89%"。

论文原文三处口径一致:flagged 的模型–数据集组合从 47 个升到 89 个,分母是 264(22 模型 × 12 数据集)。也就是占比从 17.8% 到 33.7%,涨了 15.9 个百分点。原帖把"47 变成 89"这个计数变化除出了 89.4%,又恰好撞上分子里的 89——纯属数字巧合。论文真正强调的反而是这句话:"A retrieval map is therefore a lower bound for the contamination",任何一次审计都只是下界。

第二个是"六位有效数字匹配,概率百万分之一"。

  • 全文检索 "six significant",零命中。精度上限是 3 位,prompt 明确要求 three significant figures,论文还专门论证了第三位通常落在测量噪声内,所以判据必须建在数字而不是误差上。
  • 真正的判据是统计推断:条件保留率 R₁₂、R₂₃ 对照分子盲底线(只看标签分布、不看分子结构能排出的最好成绩,FreeSolv 的 2→3 floor 只有 14.0%,样本外 200 次拆分估的),再过单侧二项检验和 Benjamini–Hochberg 校正,实际门槛 p ≤ 0.0105。
  • "百万分之一"在论文里不存在。均匀分布的标签下,巧合底线是 9.5%。
第三处,"重灾区是 QM7/QM8,生物活性和毒性是安全区"——两个方向都判反了:
  • QM7 是 3/22 = 13.6%、QM8 是 2/22 = 9.1%,恰恰是最干净的一批,论文原话归它们在 isolated flagged cells 一侧。
  • LD50 就是大鼠急性口服毒性,16/22 = 72.7%,是所有真实数据集里最严重的一个。论文 §4.4 点名的四个真重灾区是 FreeSolv、ESOL、AqSolDB、LD50。
  • 归因跟化学性质无关,是流传广度:这四个跟着标准化学信息学包一起分发、教程里到处印,而 2024–2025 盲测挑战赛的 recency control 在三个预训练索引里一个分子都没出现,零 flagged。
顺带三处小的:panel 里是 GPT-4.1 不是 GPT-4,Llama 侧是 Llama 4 Maverick;"5 个基准超 50%"数字本身对得上(63.6 / 68.2 / 72.7 / 68.2 / 100),但第 5 个是沸点阳性对照,作者自己说它 retrieval is certain by construction,真实非对照数据集只有 4 个;"SMILES 随机化、同构变换"在全文零命中,实际做的是 SMILES 字符替换加去掉化合物名, flagged 单元从 10 个降到 3 个——而且残留可能不是"从结构认出分子",是"从上下文样例的标签认出数据集",论文明确说这条路它没证实。

必须说清楚论文自己挂起的一格:没有任何 non-memorizing baseline(最近邻、传统 QSAR)在同一套数字统计上跑过。在填上这一格之前,flagged 应该读作"数字一致性显著高于盲猜底线",不是"已证明这个模型在背答案"。

该肯定的部分:分子盲底线这个设计很聪明——它只用标签列估最好成绩,所以不会跟着它要界定的效应一起涨;两个对照组(recency 和 positive control)也是一次审计能立住的关键。规模也摆出来了:264 个组合、每格 500 个分子、盲化实验 4 模型 × 3 数据集 × 每格约 150 个分子。

一句话:89% 是个巧合,3 位才是精度,毒性数据集是重灾区——把这三件事摆正,这篇论文反而更锋利:它量的是"检索的下界",而且明说任何审计都只是下界。

分子既视感:89% 是巧合,毒性是重灾区

暂无表态