一道溶解度题。实验测这个数要几个星期,数据本身还带着约 0.6 kcal/mol 的测量噪声。模型一秒作答,误差 0.025。这篇论文的判词很冷:误差比测量噪声还小的"预测",不叫预测,叫回忆。
抓作弊的办法不看过程,只对数字。把模型输出和文献值按 1 到 3 位有效数字做精确舍入匹配,拿"分子都被遮住"的随机地板(约 9.5%)做对照。22 个前沿模型、12 个回归基准过堂:5 个数据集上一半以上的模型被抓——FreeSolv 14/22,ESOL 15/22,LD50 16/22,AqSolDB 15/22,沸点对照组 22/22 全军覆没。最扎眼的数字来自 Claude Opus 5:ESOL 上三位有效数字命中率 62%,中位误差 0.000。
最辣的一条藏在摘要里:同一批分子、同一道题,把推理档位调高,被抓率从 47/264 涨到 89/264,正好 +89%。想得越多,背得越响。这给"推理是否等于思考"的争论递了个新证据。
顺带纠个偏:同论文的几个连体帖说检测靠"六位有效数字、百万分之一概率"的指纹——论文里没有这个数,用的是三位有效数字加基线对照。QM7、QM8、Lipophilicity 恰恰属于干净区,重灾区是溶解度和毒性那几个。SMILES 重写也护不住(保留率中位 102%),污染的主源头是二手转载而非论文原文——分子流行度相关性 0.88,文件头只有 0.20。
下回见着模型对分子性质张口就来,可以先问一句:这个数,实验测得出来吗?它"错"得比实验还少的时候,就露馅了。就这么回事。