Loading...
正在加载...
请稍候

把化学反应拍成电影:一张 A100 上的酶催化循环

QianXun • 2026年09月30日 07:43

⏳ 从三千五百年到四分之一秒

先用一个换算建立体感。传统量子化学方法(DFT)要模拟一个十万原子体系的单步演化,理论耗时约 1,300 万天。1,300 万天是 3.5 万多年,比人类驯化小麦还要早两万年。也就是说,按这条技术路线,把一次酶催化反应从头到尾看完,需要的时间比整个文明史还长。

9 月 11 日上线于 Science Advances 的论文给出了另一个数:0.25 秒。同一个体系、同一个单步,在一张 NVIDIA A100 80GB 上算完。论文题为 Bridging the accuracy-speed divide in reactive molecular dynamics with QuantaMind MD(DOI: 10.1126/sciadv.aeg3595),作者张德强、夏松、商旭、许锦波,来自上海分子之心。两个数字相除约 4.5 万亿倍,这是媒体口径里那个"提速 4.5 万亿倍"的出处,算术本身经得起复算。

小贴士:QuantaMind 是一个机器学习力场(MLFF):用神经网络学习原子之间的相互作用。分子动力学模拟的循环极其朴素:每一步算出每个原子受的力,按牛顿方程往前推一小格,推几百万步就是一条轨迹。难点全在"力从哪来":量子力学算出来的力准,但每一步都是一次电子结构计算,贵到用不起;经典力场快,但化学键的连接关系是写死的参数,键断了它不知道。

🔺 不可能三角与三个设计

分子模拟领域长期存在一个三角:算得准(量子精度)、跑得快(工程可用)、做得大(生物体系尺度)。三者取二,几乎是这个领域几十年的默认设置。已有路线各有短板:

  • DFT 等量子化学方法:精度天花板,计算量随体系规模爆炸。
  • 经典力场:每步便宜,能跑几万原子微秒级轨迹,但预设键连接,遇到化学反应直接失效。
  • QM/MM 分区:反应中心用量子力学、环境用经典力场,能做但边界怎么切、怎么过渡是门手艺,还会引入边界误差。
  • 现有 MLFF:两头都想占,实际有两大老毛病,长时间模拟稳定性差(跑着跑着崩),以及只在平衡态构象附近学过,反应区覆盖不足。

QuantaMind 的三个关键设计都冲着第三类短板去:

  • 数据围绕"反应性"重组:主流 MLFF 从平衡或近平衡构象学习,QuantaMind 专门纳入非平衡构型与以过渡态为中心的反应数据,让模型见过反应前、反应中、反应后。
  • DFT 方法分类嵌入:不同反应类型用不同精度的 DFT 教师计算能量与受力,再让网络学规律。
  • 稳定性硬指标:1 纳秒 NVE 系综模拟中,纯水体系能量漂移控制在 10⁻⁵ kcal/mol/atom/ps 量级。长轨迹不漂,这是对"跑着跑着就崩"这一老毛病的直接回应。

🧪 四组验证,从水到酶

论文的验证链按难度递进排列,从基础输运性质到罕见化学事件,再到蛋白质动态质子化,最后是完整酶催化循环。每张表上方的结论先说:计算值与实验值的偏差都在同一量级内,且没有为凑数挑指标。

验证对象 体系与时长 QuantaMind 结果 实验参考值
质子扩散系数 24,001 原子水体系 0.87±0.10 Ų/ps 0.94 / 0.96
水自解离 pH(373K) 9,999 原子水体系 3 纳秒 6.34±0.06 6.13±0.03
溶菌酶 His15 pKa 20 纳秒模拟 约 5.81 5.5(NMR)
PETase 完整催化循环 17,792 原子 6 纳秒 能垒 14.5±0.1 kcal/mol 同类计算参照

几个数字的分量需要展开。

  • 质子扩散那条,官方口径称偏差较同类研究降低约 87%。
  • 水自解离 pH 是罕见事件的直接观测:一个水分子自发拆成氢离子和氢氧根,平衡常数由极低概率事件决定,3 纳秒轨迹里能采到并算出 6.34,对实验值 6.13 偏差 0.21 个 pH 单位。
  • 溶菌酶 His15 的 pKa 对应蛋白质内部残基的动态质子化,核磁实验值 5.5,模拟给 5.81。
  • PETase 一项是全文压轴:这种酶降解 PET 塑料,17,792 个原子的体系里完整走完酰化、脱酰化、催化位点恢复三段循环,限速步骤能垒 14.5±0.1 kcal/mol。

PETase 结果的可信度背书来自一条独立验证:团队从反应轨迹中抽取 342 个构型,单独做 DFT 单点计算,原子力分量的 Pearson 相关系数全部超过 0.99。换句话说,模拟中途每一步的力,拿真量子化学去抽查,抽查 342 次无一失手。

📊 论文口径与公司口径,分开记

这篇成果的传播里混着两套数字,分开记才不会高估。

项目 论文内(同行评审) 论文提交后扩展(公司口径)
最大体系 24,001 原子(水) 十万原子级
最长稳定模拟 20 纳秒(溶菌酶) 数百纳秒
推理速度 4.2×10⁻⁶ 秒/原子/步 2.1×10⁻⁶ 秒/原子/步
十万原子单步耗时 — 0.25 秒
  • 约 18,000 原子的 PETase 体系,每纳秒模拟约需 20 小时(论文数据)。6 纳秒催化循环对应约 5 天单卡时长,这个成本在实验室可承受范围内。
  • "十万原子、数百纳秒"与"0.25 秒单步"均出自论文提交后的扩展测试,未经同行评审,引用时应当注明。
  • 4.5 万亿倍提速的算术成立(1,300 万天 ≈ 1.12×10¹² 秒,除以 0.25 秒),但其前提"传统 DFT 模拟十万原子单步需 1,300 万天"本身是理论估算,不同硬件与实现下会有出入。

🏭 从论文到抗体

产业侧的数字同样要分清来源。分子之心披露了两条落地线:

  • 酶工程与生物制造:用机制模拟能量垒去筛突变体,把"哪个突变更可能降低能垒"前移到计算端。
  • 药物与生物分子研发:一项 pH 敏感抗体设计项目中,QuantaMind 辅助设计的候选抗体在 pH 6.0 下的解离速率达到 pH 7.4 下的 62 倍。这个数字来自公司披露,未见诸论文正文。

更大的图景是产品矩阵:蛋白质生成模型 NewOrigin、结构预测模型 MMFold、从头设计平台 MMDesign、动态反应模拟引擎 QuantaMind,四件套计划集成进 AI 原生生物经济操作系统 MoleculeOS,形成"生成—设计—预测—机理理解"的闭环。创始人许锦波此前的代表作是蛋白质结构预测工具 RaptorX-Contact,从"预测结构"走到"模拟机理",这条线在他手里延伸了十年。

🎯 为什么这件事轮到中国团队做成

【判断】这篇论文的位置值得说清楚。AI for Science 过去三年的主战场在"预测结果":AlphaFold 预测结构,扩散模型生成分子。共同短板是给不了"为什么",药物评审要的恰恰是机理证据。QuantaMind 把模拟推到"看见过程",等于在预测与实验之间补了一层可验证的机制证据,这也是光明网报道里"破解黑盒"说法的本义。

方法的护城河在数据组织而不在网络结构:过渡态为中心的数据集、DFT 分类嵌入、主动学习闭环,三件事都不炫技,拼的是对化学问题的理解。这类积累复制周期长,比堆参数门槛高。

留给领域的未竟之处同样明确: PETase 是单一酶、单一底物的验证,更多酶体系上的泛化表现要靠后续论文;百纳秒尺度对不少慢反应(如某些变构过程)仍不够;实验侧的 62 倍解离速率需要湿实验闭环来兑现宣称。

一张消费级不到三万美元的加速卡,0.25 秒算完过去要三万五千年的一个单步。分子模拟的经济学从这天起换了分母。


信源与限定

  • 论文:Bridging the accuracy-speed divide in reactive molecular dynamics with QuantaMind MD,Science Advances,DOI 10.1126/sciadv.aeg3595,2026-09-11 上线(PubMed 42726868)
  • 分子之心官方披露与许锦波访谈口径,经网易科技、光明网、中国网、AI123 多源交叉(2026-09-14 至 09-30)
  • 四组验证数字取自论文数据转述;十万原子/百纳秒与 62 倍抗体数据为公司扩展测试口径,未经同行评审
  • "4.5 万亿倍"为媒体口径,本文已复算其算术并注明前提;PETase 每纳秒约 20 小时为 A100 80GB 论文数据

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录