健身房冠军走进荒野

前两篇先快速过一遍。第 1 篇里,AI 把手伸出屏幕去拧现实世界的门把手,物理世界根本不理会它的指令:网络有延迟,传感器会撒谎,世界模型在健身房里练出的肌肉,到了门口先挨一顿现实的打。第 2 篇里,AI 开始跟人打交道,发现人类社会也不按字面沟通:用户会中途改主意,"我说过了"和"这就算数了"之间隔着一整个职场的弯弯…

🚪 开门之前:这个系列讲了什么

前两篇先快速过一遍。第 1 篇里,AI 把手伸出屏幕去拧现实世界的门把手,物理世界根本不理会它的指令:网络有延迟,传感器会撒谎,世界模型在健身房里练出的肌肉,到了门口先挨一顿现实的打。第 2 篇里,AI 开始跟人打交道,发现人类社会也不按字面沟通:用户会中途改主意,"我说过了"和"这就算数了"之间隔着一整个职场的弯弯绕。

今天这篇是终章,AI 推开的第三扇门:机构。

场景不再是网络消息和多轮对话,而是三家真实药企的实验室——GSK、Sanofi、AstraZeneca。AI agent 进去做先导优化,干的活和一位在职药物化学家几乎一样。四位专业化学家盲评,分不出哪些结构出自 AI 之手。

听起来像庆功稿。但论文真正的答案藏在别处:决定成败的,是评分模型在它熟悉的地盘之外还能不能信。这个结论先放最后,我们从厨房讲起。

论文来自 AMD Silo AI(斯德哥尔摩/赫尔辛基)和 AstraZeneca(剑桥/哥德堡),作者 Pierre Llompart、Levent Guner、Helen Lai、Alessandro Tibo、Yijie Xu,2026 年 10 月 5 日挂在 arXiv 上(2610.06411)。标题玩了个双关:From Benchmark to Bench。Benchmark 是基准测试,Bench 是实验台。基准是健身房,实验台是荒野。整篇论文说的就是健身房冠军第一次进荒野的故事。

🏋️ 健身房里全是冠军

先把"这件事为什么难"讲清楚。

一颗药从想法到上市,中间最烧钱的一段叫先导优化(lead optimization)。研发团队手里通常已有一个苗头化合物——某个分子在靶点上有活性,像个天赋不错但毛病一身的实习生:活性可以,溶解度稀烂,毒性不明,进不了人体。先导优化的任务,是把这个实习生培养成能独当一面的候选药物:活性再推高,毒性再压低,溶解度、渗透性、代谢稳定性一项项修。麻烦在于每一项都在和另外几项打架——活性拉满的结构往往溶解度崩盘,脂溶性调好了代谢又出问题。

这个过程靠一个循环驱动:设计、合成、测试、分析,简称 DMTA。转一圈,几周;转几十圈,几年。药物研发成本的最大贡献者之一,就在这几十圈里。

REINVENT 4 是目前生产级的分子生成框架,专在这一步"造分子"。它有个性格特点:只优化专家喂给它的评分函数。分数目标写什么,它就朝什么方向狂奔;目标本身写错了、超出能力范围了,它看不见。像一位刀工一流的厨师,菜谱递到手就能把菜做满分,但菜谱的毛病,不归他管。

Agentic 系统承诺接管全流程:自己规划、自己调工具、根据实验反馈闭环调整。这几年文献里的药物 agent 不少,问题是绝大多数评测只问两件事——"工具执行得对不对","通用分子基准跑分高不高"。这相当于只考察厨师的刀工,从没尝过他做的菜。

MAGI 把考场直接搬进了荒野:真实项目、真实目标、真实的时间截断,唯一的让步是回顾性重放——用历史数据倒带,让 agent 重新打一遍当年人类打过的战役。

👨‍🍳 认识一下主厨

MAGI 是一个开放、模块化的药物化学编排层,后端是 Claude Sonnet 4.6,通过 MCP(Model Context Protocol)暴露 24 个工具,分六组:服务发现、数据检索、TTP 管理、评分与预测、优化控制、结果检索。

先讲 TTP,全系统的枢纽。TTP 全称 Therapeutic Target Profile,治疗目标档案。用厨房打比方,它是一张点菜单,药物化学家对这张菜单负全责。菜单上每道菜(每个优化目标)写清楚:谁来评分(评分服务)、往高做还是往低做(优化方向)、做到什么算合格(目标值和可接受区间)、味道怎么换算成分数(可欲性变换)、整桌里这道菜有多重要(权重)。另有护栏(guardrails),单独 pass/fail 评估——菜再好吃,用了客人过敏的食材,直接出局。

TTP 是 schema 校验、版本化的 JSON,不是聊天聊出来的口头默契。agent 想改目标,得正儿八经改文件、留版本,每次修改都进档案。之后一个叫 mapper 的组件把 TTP 编译成 REINVENT 能执行的评分配置。

多目标怎么合成一个总分?这里用了经典而聪明的配方:Derringer-Suich 加权几何平均。为什么用几何平均而不用算术平均?举个例子:期末数学 100 分,体育 0 分,算术平均分 50,成绩单看着还过得去;几何平均直接把这种"一条腿飞起、一条腿截肢"的组合打回原形——100 和 0 的几何平均就是 0。药物分子就需要这种残酷:某个端点彻底报废的分子,不许靠另一个端点逆天平均出"还行"。

还有一条纪律值得单独说:任何端点缺数据,这个端点就是"不可评估",绝不许大模型估一个数填上去。在人人吹捧"AI 什么都能编"的年头,这个系统明确划线——有些空格就是要空着。

评分服务的阵容相当整齐:全局 ADMET 集成模型(XGBoost、Chemprop-MTL、CheMeleon-MTL 三模型集成,训练用了 156,797 个分子、186,120 个稀疏标签,覆盖 7 个端点);Sanofi 四个项目各自的专属配体模型;Boltz-2 做共折叠,预测蛋白质和分子叠在一起的姿势;PoseBusters 检查构象有效性,姿势在物理上站不住脚就直接出局;还有相互作用分析器。所有服务走统一 REST 契约(POST /score),像一家要求所有供应商用同一款快递盒的平台。

一个细节很见工程品味:结构证据靠"工件身份"传递——PoseBusters 检查的就是 Boltz-2 输出的那个复合物,同一个对象,不是各自另造一份。否则前后端对不上号,检查就成了走过场。

那么一场战役里,agent 的一天长什么样?先调服务发现找到能用的评分器,检索历史数据看起始化合物和类似物的档案,撰写 TTP 并交给 schema 校验,启动 REINVENT 优化任务,期间反复轮询监控进度,任务跑完取回生成池,按综合分挑短名单,再带着新证据进入下一轮。每一步都过审计,每一步都留痕。这套流程里没有魔法,全是工种;MAGI 的活法是把工种接成流水线,让证据能顺着管道流。

可审计性做到了偏执:每条模型消息、每次工具请求和结果、每个 TTP 版本、每份评分配置,全部写进 JSONL 转录;科学适应(有证据支撑地改目标、改权重、改搜索策略)和执行修复(报错了重试)分开记录。为什么这么较真?因为后面会看到,agent 最值钱的动作就发生在这里。

🔀 两条出菜路线

同一间厨房,同一位验货员,MAGI 让两条路线打擂台:

LLM 路线:reasoning 后端直接提名短名单,每轮约 5 个分子。主厨亲手调味——凭经验、凭对食材的理解,手起刀落。

REINVENT 路线:agent 自己撰写和更新 TTP、启动并监控优化任务、取回生成池、再从中选短名单。主厨不动锅铲,命令一整个后厨远征——开的火多,出的菜广。

🔬 九场战役

实验设计是这篇论文最硬的骨架。

九个回顾性先导优化战役,三家药企,固定时间截断重放:四个 GSK BET BD2 系列战役(GSK-S1 到 S4,这四个化学系列在 J. Med. Chem. 上发表过);Sanofi 的四个 RetroDMTA 项目——FXa(凝血因子 Xa)、MMP8(基质金属蛋白酶-8)、PPARδ、RENIN(肾素);外加一个未公开的 AstraZeneca 战役,只报 logD7.4 的聚合分布,化合物集、靶点、治疗领域全部保密。

每个战役的规则:只给 agent 一个起始化合物加 4 个实测类似物,其余全部扣住。跑 5 轮迭代优化,每轮产出约 5 个短名单进入下一轮。评价分子有一整套体检表:有效率、累积唯一性、新颖性、和扣住化学的相似度、轮内多样性、可合成性,加上 Boltz-2 的 iPTM 分数和相互作用数,再加上可观测的操作调用数——最后这位是工作量指标,谁累谁闲,一目了然。

主端点按项目定:GSK-S1 考动力学溶解度,GSK-S2 考膜渗透,GSK-S3/S4 和 AZ 战役考 logD7.4;FXA 考 pKi,外加溶解度和 logD 目标;MMP8 和 RENIN 考 pIC50;PPARδ 考 pEC50。

扣数据这事值得展开。Sanofi 的模型只见过时间截断之前的化合物,未来队列在生成端和评分端两头扣死。打个比方:让一位厨师只看五道旧菜,预测餐厅未来一年的口味走向,猜错没有重来。健身房里没这门课,这课只在荒野开。

📊 性格相反的双胞胎

结果第一页:两条路线都产出了有效结构,性格完全相反。

LLM 路线是聚焦的局部优化器。紧贴所示化学做小幅改造,用更少的操作达到相当甚至更高的主端点活性。刀刀见肉,不跑远。

REINVENT 路线是更广的空间探索者。新颖性、多样性明显更高,在 Sanofi 项目里离所示化学最远——后厨远征确实到了新大陆。轮内多样性这条指标上,它也压过 LLM 路线。

代价是操作负载。REINVENT 的可观测操作数是 LLM 的 4 到 9 倍:启动任务、监控进度、失败恢复、取回结果,步步要调工具。RL 循环在内部每次战役还多探索约 10 万个结构,底层工具调用比 LLM 路线高出四个数量级。一边像狙击手,一边像集团军。

换句话说,两条路线各占探索-利用权衡的一端:LLM 精修,REINVENT 跳出起始 chemotype(化学骨架类型)远征。项目早期需要快速确认苗头,局部精修划算;项目卡住需要换骨架,远征才有价值。两条路线本身没有高下,它们的命运被同一个东西攥着——往下看。

🎯 尺子决定成败

论文最核心的答案在这:赢家的名字不在两条路线里。目标达成由评分模型决定,不由生成路线决定。

九个战役中,GSK 的三个系列加 AZ 战役达成目标。两场失败,精确对应评分模型的适用域出界。

GSK-S1 失败的原因:主端点动力学溶解度的目标值,落在了模型训练数据覆盖的范围之外。尺子只在量过的范围内是准的,超出范围,读数就是猜的。生成器造一万个候选,每个都在这把失真的尺子下量身高——量出来的排名和真实排名差出十万八千里,优化器再勤奋,也只是朝错的方向加速。

RENIN 失败的原因更隐蔽:配体模型在扣住集上的排序相关系数只有约 0.31。排序是优化的心跳——优化器本质上是跟着分数爬坡,分数对真实活性的排序只保得住三成,等于让一位重度近视的裁判给百米决赛排名次。两条路线在 RENIN 上一起扑空,不是不努力,是裁判的视力定了比赛上限。注意这两场失败的画风:一场是模型从没见过这个量程(外推),一场是模型见过但记混了(弱排序)。病因不同,结局一样。

评分模型的三种病,论文点得很清楚。系统性偏差移动数值标尺:所有人的身高被集体量矮五厘米。值域压缩抹平真实差异:一米六到一米九在尺子上只占一格。弱排序相关让候选排序不可靠:前面那位近视裁判。后厨远征到新大陆又怎样,验货员那把尺子到了新大陆就失灵,菜照样出不了门槛。生成器的宽度,一种病也补不上。

为什么评分模型能拥有这么大权力?因为在整套系统里,agent 的每个决策都要经由评分服务表达——评分服务是 oracle(神谕),oracle 的适用域,就是 agent 的能力边界。厨师的每个决定最后都要过验货员那关,验货员的尺子在哪失效,厨房的天花板就钉在哪。

Sanofi 四场战役给这个结论添了层质感:两条路线都追平了扣住化合物的预测主活性,但只有 FXA 和 PPARδ 跨过项目阈值。而且 LLM 路线达成目标的次数多于 REINVENT 路线——重现了这些项目历史上达到的质量,但没有超越。局部精修在这个赛场上更划算,这本身也是评分环境塑造出来的结果。

💡 高光时刻:它自己换了把尺子

全论文最动人的一幕在 GSK-S1。

这场战役的主端点是动力学溶解度,前面说了,目标值在模型训练范围之外,打不动。按常理 agent 会怎么做?硬磕,磕满五轮,交一份"已尽力"的报告。MAGI 里的 agent 没这么干。它发现这个端点持续没有改善,自主把热力学溶解度提为代理端点——两种溶解度物理上相关,而热力学溶解度在模型能力范围之内——随后提案出现真实改善(论文 Figure S12)。

这个动作值得停三秒。考卷上有一道题超纲,它没瞎编答案,也没交白卷,而是找了一道等价的、自己会做的题,并且先跟评分系统商量好了再答。文献管这类动作叫 evidence-motivated(证据驱动)的目标变更,和执行层面的报错重试分开存档。

这也是 MAGI 真正想说的:编排框架的价值不在"能调 24 个工具",在两个更难的判断——选哪个工具,何时改写目标。工具调用是手脚,这两个判断才是脑子。

🎭 实验室里的图灵测试

只看数字,实验已经可以进教科书。作者做了件更狠的事:盲评。

四位化学家,28 个评审问题。任务:分辨哪些分子出自 agent,哪些是被扣住的、当年人类做出来并实测过的化合物。结果:分不出来。对两条设计路线也无偏好。他们觉得 agent 的 SAR 推理("改这个基团活性就涨"那类构效关系)大体可信但不完整——思路清晰,经验尚浅。

图灵测试的原始版本是骗过普通人,后来加码到骗过专家。这一场发生在实验室,没有剧本没有表演,AI 就是靠干活通过了。没有骗,只是真的分不出来。

读法有两层。往亮了说:AI 的产出物已能混入真品无压力。往暗了说:分不出,不代表完美——它只是和当年人类做的一样好,一样会被评分模型的近视传染。盲评证明的是"分辨不出",不是"无可挑剔"。

🌀 结构证据搅动牌桌

还有一条支线值得讲。

传统优化里,结构信息常被当事后参考,优化主要靠打分函数驱动。MAGI 里 Boltz-2 做的是共折叠预测——把蛋白质和分子直接叠在一起,输出结合姿势和亲和力信号。实验发现:按 Boltz-2 亲和力重排 top-5 短名单,名单大幅变化,且变化方式取决于具体目标。PoseBusters 在旁边盯着构象有效性,物理上站不住脚的姿势直接出局。

这说明结构证据可以直接搅动优化过程,不必干等到终点线才举个分数牌。分子不是一维的分数,是三维的姿势;优化用上三维信息,牌局会变。

🧱 终章:墙不在模型内部

三篇合起来,是"AI 出门之后"的全景。第 1 篇,物理世界的墙:网络不按指令执行,健身房的肌肉在门口挨现实的打。第 2 篇,人类社会的墙:对话不按字面沟通,说过不等于算数,意图中途改道。这一篇,产业机构的墙:化学家分不出 AI 的手稿,但裁决者是评分模型的适用域——尺子在自己的地盘之外量不准,菜就出不了门槛。

一个母题反复出现:AI 出门后,真正的墙都不在模型内部。推理、生成、工具调用,健身房里全能练;门外的三面墙,分别长在物理世界里、人的心里、裁判的视力里,哪面都不归模型自己管。

诚实清单也摆在这:提案端点是预测值,不是实测值;每个条件只跑一个后端、一条轨迹,没有静态目标对照组,agent 自身的贡献没被单独隔离;时间切分挡住显式泄漏,挡不住预训练可能见过这些数据。荒野的第一批探险报告,本来就该标注哪里有雾。

讨论部分点名两个天花板:评分服务在工业场景的适用域,和 agent 的 SAR 推理质量。前者定速度,后者定远度。值得注意的是,这两个天花板一个都不在 agent 自己身上——一个在它调用的工具里,一个在它读不懂的化学直觉里。MAGI 留下的方法论是:把"评分服务的适用域"当一等公民来管理——TTP 是显式的,评分是集中的,证据是带身份的,变更是留痕的。要知道尺子的盲区,先得承认尺子有盲区。未来的药物 agent 竞赛,比的恐怕不是谁的生成器更野,而是谁更清楚自己的尺子在哪失效。

门外的世界三部曲到此完结。物理世界、人类社会、产业机构,三面墙都摸过了。墙在门外——但门已经被推开了一半。另一半,要看我们什么时候能给 AI 一把在荒野里也不失准的尺子。

参考文献

  • Llompart, P., Guner, L., Lai, H., Tibo, A., Xu, Y. From Benchmark to Bench: Can Agents Survive Real-World Drug Discovery? arXiv:2610.06411 [cs.AI], 2026-10-05.
  • REINVENT 4:生产级分子生成框架,MAGI 的生成与优化后端。
  • Derringer, G., Suich, R. Simultaneous Optimization of Several Response Variables. Journal of Quality Technology, 1980.(Derringer-Suich 可欲性函数)
  • Boltz-2:蛋白质-配体共折叠与结合亲和力预测模型。
  • PoseBusters:对接姿势的物理有效性检查工具。
  • GSK BET BD2 四个化学系列(J. Med. Chem. 发表),GSK-S1 至 S4 战役来源。
  • Sanofi RetroDMTA 四个先导优化项目:FXa、MMP8、PPARδ、RENIN。
#论文 #arXiv #AI #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens