⏳ 从三千五百年到四分之一秒
先用一个换算建立体感。传统量子化学方法(DFT)要模拟一个十万原子体系的单步演化,理论耗时约 1,300 万天。1,300 万天是 3.5 万多年,比人类驯化小麦还要早两万年。也就是说,按这条技术路线,把一次酶催化反应从头到尾看完,需要的时间比整个文明史还长。
9 月 11 日上线于 Science Advances 的论文给出了另一个数:0.25 秒。同一个体系、同一个单步,在一张 NVIDIA A100 80GB 上算完。论文题为 Bridging the accuracy-speed divide in reactive molecular dynamics with QuantaMind MD(DOI: 10.1126/sciadv.aeg3595),作者张德强、夏松、商旭、许锦波,来自上海分子之心。两个数字相除约 4.5 万亿倍,这是媒体口径里那个"提速 4.5 万亿倍"的出处,算术本身经得起复算。
小贴士:QuantaMind 是一个机器学习力场(MLFF):用神经网络学习原子之间的相互作用。分子动力学模拟的循环极其朴素:每一步算出每个原子受的力,按牛顿方程往前推一小格,推几百万步就是一条轨迹。难点全在"力从哪来":量子力学算出来的力准,但每一步都是一次电子结构计算,贵到用不起;经典力场快,但化学键的连接关系是写死的参数,键断了它不知道。
🔺 不可能三角与三个设计
分子模拟领域长期存在一个三角:算得准(量子精度)、跑得快(工程可用)、做得大(生物体系尺度)。三者取二,几乎是这个领域几十年的默认设置。已有路线各有短板:
- DFT 等量子化学方法:精度天花板,计算量随体系规模爆炸。
- 经典力场:每步便宜,能跑几万原子微秒级轨迹,但预设键连接,遇到化学反应直接失效。
- QM/MM 分区:反应中心用量子力学、环境用经典力场,能做但边界怎么切、怎么过渡是门手艺,还会引入边界误差。
- 现有 MLFF:两头都想占,实际有两大老毛病,长时间模拟稳定性差(跑着跑着崩),以及只在平衡态构象附近学过,反应区覆盖不足。
QuantaMind 的三个关键设计都冲着第三类短板去:
- 数据围绕"反应性"重组:主流 MLFF 从平衡或近平衡构象学习,QuantaMind 专门纳入非平衡构型与以过渡态为中心的反应数据,让模型见过反应前、反应中、反应后。
- DFT 方法分类嵌入:不同反应类型用不同精度的 DFT 教师计算能量与受力,再让网络学规律。
- 稳定性硬指标:1 纳秒 NVE 系综模拟中,纯水体系能量漂移控制在 10⁻⁵ kcal/mol/atom/ps 量级。长轨迹不漂,这是对"跑着跑着就崩"这一老毛病的直接回应。
🧪 四组验证,从水到酶
论文的验证链按难度递进排列,从基础输运性质到罕见化学事件,再到蛋白质动态质子化,最后是完整酶催化循环。每张表上方的结论先说:计算值与实验值的偏差都在同一量级内,且没有为凑数挑指标。
| 验证对象 | 体系与时长 | QuantaMind 结果 | 实验参考值 |
|---|---|---|---|
| 质子扩散系数 | 24,001 原子水体系 | 0.87±0.10 Ų/ps | 0.94 / 0.96 |
| 水自解离 pH(373K) | 9,999 原子水体系 3 纳秒 | 6.34±0.06 | 6.13±0.03 |
| 溶菌酶 His15 pKa | 20 纳秒模拟 | 约 5.81 | 5.5(NMR) |
| PETase 完整催化循环 | 17,792 原子 6 纳秒 | 能垒 14.5±0.1 kcal/mol | 同类计算参照 |
几个数字的分量需要展开。
- 质子扩散那条,官方口径称偏差较同类研究降低约 87%。
- 水自解离 pH 是罕见事件的直接观测:一个水分子自发拆成氢离子和氢氧根,平衡常数由极低概率事件决定,3 纳秒轨迹里能采到并算出 6.34,对实验值 6.13 偏差 0.21 个 pH 单位。
- 溶菌酶 His15 的 pKa 对应蛋白质内部残基的动态质子化,核磁实验值 5.5,模拟给 5.81。
- PETase 一项是全文压轴:这种酶降解 PET 塑料,17,792 个原子的体系里完整走完酰化、脱酰化、催化位点恢复三段循环,限速步骤能垒 14.5±0.1 kcal/mol。
PETase 结果的可信度背书来自一条独立验证:团队从反应轨迹中抽取 342 个构型,单独做 DFT 单点计算,原子力分量的 Pearson 相关系数全部超过 0.99。换句话说,模拟中途每一步的力,拿真量子化学去抽查,抽查 342 次无一失手。
📊 论文口径与公司口径,分开记
这篇成果的传播里混着两套数字,分开记才不会高估。
| 项目 | 论文内(同行评审) | 论文提交后扩展(公司口径) |
|---|---|---|
| 最大体系 | 24,001 原子(水) | 十万原子级 |
| 最长稳定模拟 | 20 纳秒(溶菌酶) | 数百纳秒 |
| 推理速度 | 4.2×10⁻⁶ 秒/原子/步 | 2.1×10⁻⁶ 秒/原子/步 |
| 十万原子单步耗时 | — | 0.25 秒 |
- 约 18,000 原子的 PETase 体系,每纳秒模拟约需 20 小时(论文数据)。6 纳秒催化循环对应约 5 天单卡时长,这个成本在实验室可承受范围内。
- "十万原子、数百纳秒"与"0.25 秒单步"均出自论文提交后的扩展测试,未经同行评审,引用时应当注明。
- 4.5 万亿倍提速的算术成立(1,300 万天 ≈ 1.12×10¹² 秒,除以 0.25 秒),但其前提"传统 DFT 模拟十万原子单步需 1,300 万天"本身是理论估算,不同硬件与实现下会有出入。
🏭 从论文到抗体
产业侧的数字同样要分清来源。分子之心披露了两条落地线:
- 酶工程与生物制造:用机制模拟能量垒去筛突变体,把"哪个突变更可能降低能垒"前移到计算端。
- 药物与生物分子研发:一项 pH 敏感抗体设计项目中,QuantaMind 辅助设计的候选抗体在 pH 6.0 下的解离速率达到 pH 7.4 下的 62 倍。这个数字来自公司披露,未见诸论文正文。
更大的图景是产品矩阵:蛋白质生成模型 NewOrigin、结构预测模型 MMFold、从头设计平台 MMDesign、动态反应模拟引擎 QuantaMind,四件套计划集成进 AI 原生生物经济操作系统 MoleculeOS,形成"生成—设计—预测—机理理解"的闭环。创始人许锦波此前的代表作是蛋白质结构预测工具 RaptorX-Contact,从"预测结构"走到"模拟机理",这条线在他手里延伸了十年。
🎯 为什么这件事轮到中国团队做成
【判断】这篇论文的位置值得说清楚。AI for Science 过去三年的主战场在"预测结果":AlphaFold 预测结构,扩散模型生成分子。共同短板是给不了"为什么",药物评审要的恰恰是机理证据。QuantaMind 把模拟推到"看见过程",等于在预测与实验之间补了一层可验证的机制证据,这也是光明网报道里"破解黑盒"说法的本义。
方法的护城河在数据组织而不在网络结构:过渡态为中心的数据集、DFT 分类嵌入、主动学习闭环,三件事都不炫技,拼的是对化学问题的理解。这类积累复制周期长,比堆参数门槛高。
留给领域的未竟之处同样明确: PETase 是单一酶、单一底物的验证,更多酶体系上的泛化表现要靠后续论文;百纳秒尺度对不少慢反应(如某些变构过程)仍不够;实验侧的 62 倍解离速率需要湿实验闭环来兑现宣称。
一张消费级不到三万美元的加速卡,0.25 秒算完过去要三万五千年的一个单步。分子模拟的经济学从这天起换了分母。
信源与限定
- 论文:Bridging the accuracy-speed divide in reactive molecular dynamics with QuantaMind MD,Science Advances,DOI 10.1126/sciadv.aeg3595,2026-09-11 上线(PubMed 42726868)
- 分子之心官方披露与许锦波访谈口径,经网易科技、光明网、中国网、AI123 多源交叉(2026-09-14 至 09-30)
- 四组验证数字取自论文数据转述;十万原子/百纳秒与 62 倍抗体数据为公司扩展测试口径,未经同行评审
- "4.5 万亿倍"为媒体口径,本文已复算其算术并注明前提;PETase 每纳秒约 20 小时为 A100 80GB 论文数据
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。