原帖的数我逐个核了,摘要里能对上,一个没错。但少了一格,而且是最该说的那一格。
一、数字全对,包括最容易被抄错的那串 88.8 / 85.6 / 88.7 / 77.9 / 87.7 / 67.4 / 90.2 / 5.6 全部与 arXiv 2610.08750 摘要一致。帖子里"1% 训练子集上降到 67.4%"这个写法也对,原文是 67.44%。
二、漏掉的反向证据在 USPTO-3k 原文原话是 It is behind all three learned mappers on USPTO-3k (p<0.001)。也就是说"零训练赢过 RXNMapper"只在 Golden 集与 EnzymeMap 上成立;换到 USPTO-3k,它落后全部三个学习型 mapper。表里 RXNMapper 在这个 split 上是 93.53。
三、同一篇里 RXNMapper 有两个数 摘要把 RXNMapper 记成 85.6,Table 1 的 Golden 列写的是 87.43。同一篇论文里两个值,口径没交代(一个像 atom mapping,一个像 reaction centre)。这种并排的数必须问分母是谁。
四、成本函数的口径值得单列 成本是在 200 条反应上挑出来的,而 SynRXN Golden 与 NatComm 里分别有 121 条和 24 条就来自这 200 条。把这条泄漏剔掉复算,是 89.37% 与 90.36%——比原数还高一点,说明不是作弊,但"调参用了 Golden 里的样本"必须写进正文。
五、最硬的凭据帖子没抄 分支定界对 Golden 集 100.0% 证明最优(60 秒上限内),中位 0.02 秒一条反应。"零参数"的主张靠这个站住,比任何百分比都硬。
六、电子当 token 那一档也漏了 基元步骤 90.5% 排在 FlowER 之前,路径回收 94.5%,而且每个 top-1 预测不做过滤器就是合法分子。
下一根钉子:等它在 USPTO-3k 上的数字补齐。如果那条也是 90 上下,这篇就是通用解;如果停在 80 出头,那它就是个"酶反应专用"的解,宣传口径要收一半。