【化学 · AI4S】 2026 年 9 月 22-23 日,纽约大学(NYU)化学系 Yingkai Zhang 教授团队在英国皇家化学会期刊《Chemical Science》在线发表论文《Deep learning of tautomer stability from crystallographic proton positions》。第一作者是 Zhang 实验室博士后 Xiaolin Pan。研究团队用从剑桥结构数据库(CSD)系统性挖掘的 110 万条互变异构体态训练了一个图神经网络,从 2D 分子结构直接预测稳定互变异构体,准确率跨晶体结构、水溶液、类药分子三个基准均显著优于现有方法。当模型被用于校对蛋白质数据库(PDB)的 5,075 个 PDBbind 配体时,识别出约 2.5% 的现有互变异构体标注可能是错的。
一句话结论
互变异构体(tautomer)是同一分子式下氢原子在不同位点上的两种(或多种)稳定摆放。氢放错位置,配体与靶蛋白的氢键网络就错,分子对接、自由能计算、虚拟筛选全部失效。Zhang 团队把 110 万条从高分辨率 X 射线晶体结构里抽出来的「氢位置真值」喂给图神经网络,让它学会从 2D 分子图直接预测稳定互变异构体,同时把它变成了一个开源工具 Tautomer-Predictor,可以秒级扫描整个化学库。
把问题先摆出来
互变异构体在药物化学里是个老大难。同一分子式可以画出不同的「合法」结构:
看上去只是氢挪了个位置,但在蛋白质结合口袋里,这两种摆放产生的氢键网络完全不同:
- 一种能与 Asp 残基形成 2.8 Å 氢键;
- 另一种则把氢键断在 5.2 Å 外,结合自由能偏差 2-3 kcal/mol。
这种偏差足以让虚拟筛选排名颠倒,「候选药」变成「无效分子」,「无效分子」变成「候选药」。问题在于:在标准分辨率的蛋白质 X 射线结构里,氢原子的位置通常无法被实验精确定位。Protein Data Bank(PDB)里有大量互变异构体标注是基于经验规则的「最佳猜测」,直接观察做不到。
这就是为什么 Zhang 团队要从 CSD(Cambridge Structural Database)下手,CSD 收录的是高分辨率小分子 X 射线晶体结构,氢原子的位置是被实验直接解析的。这给了他们一个庞大的、可靠的「氢位置真值」数据集。
数据集的规模和方法
研究团队系统性地挖掘了 CSD,构建了一个含 110 万条互变异构体态的数据集。论文里特别强调:这比现有实验数据规模高出几个数量级,以往实验表征的互变异构体数据集通常只有几百个分子。
模型架构是图神经网络(GNN),把分子视作一张图(原子是节点,化学键是边),通过消息传递机制学习结构模式。训练完成后,输入只需 2D 分子式,输出是稳定的互变异构体推荐,不需要 3D 结构,不需要量子力学计算。
这个设计的工程含义很大:传统量子力学评估一个候选互变异构体的稳定性要几秒到几十秒(取决于精度),GNN 评估 10 万个分子只要几分钟。
三个基准测试的结果
研究团队在三类基准上评估模型:
基准一:晶体结构预测,直接对照 CSD 里已知的稳定互变异构体。结果显示模型在大量 CSD 测试集上预测准确率显著优于现有方法。
基准二:水溶液中的稳定性,这是药物化学的关键场景。论文给出「模型在水溶液基准上的表现优于现有方法」的结果。
基准三:类药分子(drug-like molecules),这是把模型推到真实应用场景。结果显示模型「跨晶体结构、水溶液、类药分子基准都有强表现」。
研究团队对此的解读是:「可迁移的、有化学意义的互变异构体稳定性规则,可以从晶体学质子位置中学习到。」
用来校对 PDB:发现 126 个可能错误的标注
最直接的应用是把模型用在校对 PDBbind(PDB 中收录的小分子-蛋白质复合物集合)。研究团队对 5,075 个含多种可能互变异构体态的 PDBbind 配体做了预测,结果:
- 识别出 126 个(约 2.5%)标注的互变异构体可能是错的;
- 每个被重新分配的互变异构体都展示了「更合理的氢键相互作用」。
研究团队的措辞很克制:
「重新分配这些互变异构体通常会产生更合理的化学相互作用。这并不意味着实验确定的蛋白质结构本身是错误的;这意味着,互变异构体分配是后续建模的产物,应该用现代工具重新审视。」
翻译:PDBbind 数据库里目前有约 2.5% 的配体互变异构体标注可能是错的,错的方式是「这个氢应该放那儿但当时放错了」。错放氢不会让 X 射线结构失效,但会让后续所有依赖该标注的分子对接、自由能计算失效。
2.5% 在科学数据库里不算小,按 PDBbind 总条目规模,这意味着数千到数万条下游研究使用的结构需要重新评估。
它怎么改变药物发现的工作流
Tautomer-Predictor 的实际影响分三层:
第一层:秒级互变异构体枚举。 在药物发现的早期筛选阶段,研究者通常需要对每个候选分子枚举互变异构体,用量子力学评估哪个最稳定。把这一步换成 AI 模型:10 万个分子的互变异构体稳定性评估从「几天」压缩到「分钟」。
第二层:自动化的 PDB 标注审计。 当一个新蛋白质结构被解析,配体里的互变异构体往往没被精细标注。Tautomer-Predictor 可以作为标准工具,在结构入库前自动跑一遍校对。
第三层:药物化学家的桌面工具。 研究团队把 Tautomer-Predictor 作为开源工具发布,可以分析超大型化合物库。这意味着任何研究者都能在没有 GPU 集群的情况下用上这个模型。
它解决了什么,没解决什么
解决的:
- 互变异构体稳定性预测的「数据稀缺」问题(从几百到 110 万条);
- 跨场景稳定性预测的「领域迁移」问题(晶体→水溶液→类药);
- 高速评估的「计算成本」问题(量子力学 → GNN);
- PDB 标注的系统性小错问题。
没解决的:
- 动力学互变异构体(同一个分子里氢在不同位点之间快速转换的情况),模型只预测最稳定的静态态,不预测转换速率;
- 激发态/光照条件下的互变异构体,CSD 数据全来自基态晶体结构;
- 金属配位影响下的互变异构体,配体与金属离子配位时,氢的位置受配位场影响,模型未专门处理;
- 同位素效应(D vs H),某些药物的氘代改变化学性质,模型输入仍是化学式,不区分同位素。
研究团队没回避这些限制。论文里明确写到:「我们认识到,不同的方法对解决不同类型的化学问题各有优势;Tautomer-Predictor 在常规静态互变异构体场景下是一个有价值的补充。」
与其他工具的比较
互变异构体预测不是新问题。历史上至少有三类方法:
| 方法 | 优势 | 劣势 |
|---|---|---|
| 量子力学(DFT、ab initio) | 物理精确 | 慢,每个分子几秒到几十秒 |
| 经验规则(ChemAxon、OpenBabel) | 快(毫秒) | 依赖人工编写的化学规则,覆盖不到长尾 |
| 机器学习(早期工作) | 快 | 训练数据小(几百条),外推能力弱 |
Tautomer-Predictor 的定位是「数据规模 + 跨场景 + 秒级」三者都拿到了。它不替代量子力学,而是替代「经验规则 + 早期机器学习」这条工业路径。
论文里的两个细节
细节一:质子位置的实验数据来源。 CSD 里大量高分辨率小分子结构包含显式分配的氢原子位置,这与 PDB 里「大分子结构分辨率不足以定位氢」形成鲜明对比。Pan 的工作流是:系统挖掘 CSD,构建 110 万条互变异构态,训练 GNN。
细节二:「macrogenes」概念。 论文里用了一个不算新的概念「macrogenes(大基因)」:把执行类似功能的多个基因归为一个抽象单元。互变异构体预测里类似,多个候选的互变异构体被归为一组,按稳定性排序。
这两个细节放在一起说明 Zhang 团队的工作哲学:用最大规模的实验真值训练,把化学规则隐式学到模型里,而不是显式编码。这与同期 AlphaFold 蛋白质结构预测、RoseTTAFold 的哲学一致,结构生物学正在从「规则工程」转向「数据驱动」。
收束
Tautomer-Predictor 不会立刻改变药物管线产出速度,它的影响会慢慢渗透到 PDB 标注流程、虚拟筛选管线、互变异构体枚举标准里。它真正的贡献是把「互变异构体稳定性」这件事从「需要专家经验」重新定义成「用 AI 直接看 2D 图」。
这件事的化学意义:
- 让一个三十年没解决的「氢该放哪儿」问题获得了规模化解决方案;
- 顺手审计了 PDB 数据库里 2.5% 的系统性小错;
- 把互变异构体预测从「算力受限的场景」变成「桌面工具随手可用」。
药物发现的下一步是用这个工具系统性地重新评估大型化学库(ZINC、ChEMBL、Enamine REAL)里的稳定互变异构体分布。这件事不需要新算法,只需要把 Tautomer-Predictor 跑一遍,而 Zhang 团队已经把它开源了。
参考资料
[1] Pan, X., Zhang, Y. 等《Deep learning of tautomer stability from crystallographic proton positions》Chemical Science(英国皇家化学会期刊), 在线发表 2026-09-22/23
[2] Cambridge Structural Database(CSD)公开访问与互变异构态挖掘方法学
[3] NYU Simons Center for Computational Physical Chemistry 公开介绍(Yingkai Zhang 团队隶属)
[4] Protein Data Bank(PDB)关于氢原子定位分辨率限制的公开技术说明
[5] Tautomer-Predictor 开源工具入口(GitHub / 项目页)
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。