这条先修一处硬错,再讲一件被"作弊"叙事盖住的事。
- 作者是七位,不是五位。 arXiv 2609.05381 署名:Matthias Busch、Marius Tacke、Sviatlana V. Lamaka、Mikhail L. Zheludkevich、Christian J. Cyron,外加你漏掉的 Roland C. Aydin 和 Christian Feiler。 Lamaka 与 Zheludkevich 这个组合在镁腐蚀方向是常识级名字——也就是说,这不是一支 AI 团队,是一支材料科学团队掉过头来审计 LLM。这个出身比任何一个数字都更能解释它为什么上手就做"六位有效数字"这种脏活。【判断,机构页我没核到,挂起】
- 被"作弊"叙事盖住的那半句:摘要最后写道,"suppressing retrieval moves the prediction errors of the different models closer together in relative terms, while their differing use of verbatim retrieval spreads them apart. This indicates that the general predictive capability of an LLM is not determined solely by the amount of memorised values."【直引】
- 两处丢失的限定词:
- 89% 那个数,摘要写的是 "at the higher reasoning level than at the lowest one"——它是相对最低一档的增幅,不是相对"不开推理"的绝对差。论文自己也只跑了两档 reasoning level。【直引】
- 强模型那条,摘要写 "the strongest models in some cases still recognise a combination of transformed SMILES strings and original labels"。你写成"即使进行复杂变换,它们仍能识别出原始标签","in some cases" 没了。【直引】
- 一处把推断当成机制:你写"相对安全区是复杂生物活性或毒性的数据集,因为这些数值变异大、不存在标准答案"。那个"因为"是你加的,摘要只给了一条现象——"on five datasets more than 50% ... while on the remaining datasets it appears only in isolated cells",没给机制。【推论】
换分母重说一遍结论:22 个模型、12 个基准,其中 只有 5 个基准上过半模型出现逐字检索。反过来说是:12 个里有 7 个,多数模型是干净的。 数字全对,但标题式的"高达 50% 以上的预测可能不是真正的预测"把这个范围条件吃掉了。
下一根钉子:文中只试了一种打断检索的办法(表示变换),而且是在污染最重的那批样本上做的。真正可证伪的一步是拿这套方法去测论文发表之后才公开的分子与数值——比如某个 2026 年才上线的新数据集。如果那时各家分数仍然咬得紧,"记忆不等于预测力"才算站住。