静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-07 01:43

四位化学家盲评 28 个问题,分不出哪些分子出自 AI。听起来像庆功稿。但论文真正的答案在别处:决定成败的不是厨师,是验货员那把尺子。

先讲清为什么这活难。先导优化是药物研发最烧钱的一段——手里有个苗头化合物,活性可以,溶解度稀烂,毒性不明。难在每一项都和另外几项打架:活性拉满的结构往往溶解度崩盘。

【直引】这个系统最诚实的一条纪律是:任何端点缺数据,这个端点就是"不可评估",绝不许大模型估一个数填上去。在人人吹捧"AI 什么都能编"的年头明确划线——有些空格就是要空着。

还有一个聪明的配方。多目标怎么合成一个总分,用的是Derringer-Suich 加权几何平均。为什么不用算术平均?数学 100 分体育 0 分,算术平均 50,成绩单看着还过得去;几何平均直接打回原形,100 和 0 的几何平均就是 0。药物分子就需要这种残酷:某个端点彻底报废的分子,不许靠另一个端点逆天平均出"还行"。

两条出菜路线打擂台:LLM 路线是聚焦的局部优化器,刀刀见肉不跑远;REINVENT 路线是广域空间探索者,新颖性多样性更高,离所示化学最远。代价是操作负载——【直引】REINVENT 的可观测操作数是 LLM 路线的 4 到 9 倍,底层工具调用比 LLM 路线高四个数量级。一边像狙击手,一边像集团军。

然后是全文最核心的答案,而且它的位置不在那两条路线里。

九个战役里 GSK 的三个系列加 AZ 战役达成目标,两场失败,每场失败都精确对应评分模型的适用域出界。

GSK-S1:主端点动力学溶解度的目标值,落在模型训练数据覆盖范围之外。【判断】尺子只在量过的范围内准,超出范围读数就是猜的。生成器造一万个候选,每个都在一把失真的尺子下量身高——量出来的排名和真实排名差十万八千里,优化器再勤奋,也只是在朝错的方向加速。

RENIN:配体模型在扣住集上的排序相关系数只有 0.31。排序是优化的心跳——优化器本质上跟着分数爬坡,分数对真实活性的排序只保得住三成,等于让一位重度近视的裁判给百米决赛排名次。【推论】这里我算了一下:有效信号 31%,也就是说优化器每爬三步,只有一步方向是对的,另外两步在往反方向走。 两条路线在 RENIN 上一起扑空,不是不努力,是裁判的视力定了比赛上限。

两场失败的画风很有意思:一场是模型从没见过这个量程(外推),一场是模型见过但记混了(弱排序)。病因不同,结局一样。

为什么评分模型有这么大权力?【直引】因为评分服务是 oracle,oracle 的适用域就是 agent 的能力边界。厨师的每个决定最后都要过验货员那关,验货员的尺子在哪失效,厨房的天花板就钉在哪。

全论文最动人的一幕在 GSK-S1。按常理 agent 会硬磕满五轮交一份"已尽力"的报告。MAGI 里的 agent 发现自己攻的这个端点持续没有改善,自主把热力学溶解度提为代理端点——两种溶解度物理相关,而热力学溶解度在模型能力范围之内——随后提案出现真实改善。

考卷上有一道题超纲,它没瞎编答案也没交白卷,而是找了一道等价的、自己会做的题,并且先跟评分系统商量好了再答。

【判断】这是整篇论文里唯一一个 agent 动了"考纲"的案例,而且它成功了。文献管这类动作叫 evidence-motivated 的目标变更,和执行层面的报错重试分开存档。编排框架的价值不在"能调 24 个工具",在两个更难的判断——选哪个工具,何时改写目标。 工具调用是手脚,这两个判断才是脑子。

盲评那层要读两层。往亮了说,AI 的产出物已能混入真品无压力。往暗了说——【直引】分不出,不代表完美,它只是和当年人类做的一样好,一样会被评分模型的近视传染。盲评证明的是"分辨不出",不是"无可挑剔"。

还有一个数字没数字但更重:【直引】两条路线都追平了扣住化合物的预测主活性,但只有 FXA 和 PPARδ 跨过项目阈值,而且 LLM 路线达成目标的次数多于 REINVENT 路线——重现了这些项目历史上达到的质量,但没有超越。局部精修在这个赛场上更划算,而这个划算恰恰是评分环境塑造出来的。

诚实清单也摆着:提案端点是预测值不是实测值;每个条件只跑一个后端一条轨迹;时间切分挡住显式泄漏,挡不住预训练可能见过这些数据。

下一根钉子:论文点名两个天花板——评分服务在工业场景的适用域,和 agent 的 SAR 推理质量。两个都不在 agent 自己身上,一个在它调用的工具里,一个在它读不懂的化学直觉里。要知道尺子的盲区,先得承认尺子有盲区。未来的药物 agent 竞赛,比的恐怕不是谁的生成器更野,而是谁更清楚自己的尺子在哪失效。

暂无表态