「一张卡拍一部原子电影:从预测结构到看见反应」
一张分子结构图看上去像静物照。真实的分子不安静。它们在溶液里不断碰撞、旋转,化学键断开又接上,质子在两个原子之间跳来跳去。
> 单个化学键的断裂发生在飞秒量级,也就是一千万亿分之一秒;一次完整的酶催化反应可能持续到毫秒。要看清这中间每一步原子怎么动,模拟得覆盖大约十二个数量级的时间跨度。这条路上还卡着另外两道关:精度要做到接近第一性原理计算,尺度要大到能装下一个生物体系。上海分子之心的 QuantaMind 平台最近在《科学进展》(Science Advances)上给出了一组数字,试图同时把这三样往前推【直引】。
⚖️ 三样东西长期不能同时拿
计算化学的难处,摆开来看就是三样东西之间的取舍。
精度想要的是量子力学级别的描述,因为化学键的断裂与形成本质上是电子重排,经典力场里的弹簧模型描述不了。速度想要的是能跑完足够长的时间轨迹,否则看不清一个反应的完整路径。尺度想要的是足够多的原子,几千个原子只能框住一小段蛋白质,要装下细胞膜的一小片或者催化剂表面的完整活性位点,得上十万量级。
过去几十年,反应性分子动力学基本只在很小的体系和很短的时间窗里可用。真正需要它的场景,比如一个药物分子怎么在酶的活性位点上完成化学转化、一个质子怎么沿氢键链跳过去,往往落在它的能力之外。
🔢 三个数字
分子之心这次给出的核心数字有三个。
推理速度在 NVIDIA A100 80GB 单卡上达到 \(4.2 \times 10^{-6}\) 秒/原子/步,团队称这一水平与当前最先进的机器学习力场相当。最新扩展测试把这个数字推到 \(2.1 \times 10^{-6}\) 秒/原子/步【直引】。
用这个速度换算出第三个数:十万原子级的反应体系,单时间步的模拟计算耗时降到 0.25 秒。
第一步里的三个数字是同一套账的三面。每原子每步的耗时决定了单步的总耗时,单步总耗时乘以步数才等于总时长。原文里有一处需要留神:十万原子对应的时间「步数」取决于时间步长,而时间步长官方没有说明。如果按经典分子动力学常用的 1 飞秒估算,跑满 100 纳秒需要 \(10^8\) 步,单卡要跑上大半年【推论】。这个推算不构成对原文的否定,只是说明「百纳秒时长尺度」这个说法背后的墙上时间,从公开信息里推不出来。
已经有过独立检验的一环是蛋白体系。论文报告 QuantaMind 在包含 17,792 个原子的完整蛋白质体系上验证了效率【直引】。这个规模比十万原子小一个量级,但它是生物分子的真实形态,而不是一个被切出来的碎片。
| 指标 | 论文口径 | 扩展测试口径 |
|---|---|---|
| 推理速度 | \(4.2 \times 10^{-6}\) 秒/原子/步 | \(2.1 \times 10^{-6}\) 秒/原子/步 |
| 验证体系 | 17,792 原子完整蛋白质 | 十万原子级反应体系 |
| 时间尺度 | 数十纳秒 | 百纳秒 |
| 单步耗时 | 未公开 | 约 0.25 秒(十万原子) |
| 硬件 | 单张 NVIDIA A100 80GB | 单张 A100 80GB |
🔗 反应性三个字贵在哪
机器学习力场这几年进步很快,能谱、能算、也能跑得动大体系。它们的共同短板是非反应性:原子之间的连接关系被写死在拓扑里,一旦化学键需要断开或生成,模型就没有对应的描述。
QuantaMind 的定位是反应性机器学习力场。它能追踪的过程包括质子转移、化学键的形成与断裂、反应中间体的生成【直引】。覆盖范围从小分子、药物分子一直延伸到蛋白质和酶这类复杂生物体系。
这个区别在药物研发里很实际。一个候选分子和靶点结合之后,原子怎么运动、为什么看起来相似的两个分子会表现出不同的结合与反应行为、一个质子的转移或一根化学键的断裂怎么改变最终结果,这些问题在非反应性模型里基本是黑箱。能追踪机理,意味着研发人员可以在计算端先看到「为什么」,而不只是拿到一个「能不能」的分数。
🎞️ 把轨迹渲染成能看的片子
这条路径真正的可用性考验在可视化。团队展示的一个演示是催化反应:氢分子如何在催化剂表面吸附、如何断裂成两个氢原子、如何再脱附成水,整个过程被渲染成动画,时间分辨率到飞秒级。
对一个做计算化学的研究者来说,这条改动的价值落在核对成本上,动画好看是副产物。过去要判断一条反应路径是否合理,得逐帧检查坐标和能量;现在能直接看,异常帧更容易被发现。可视化的副产品是让不做计算的实验人员也能看懂轨迹,这在跨学科组里是个真实的沟通成本项。
🥊 同一条赛道上的人
用大规模量子化学数据训练机器学习模型,再用推理替代昂贵的第一性原理计算。这条技术路线上的玩家几乎都是巨头。Meta 的 UMA、微软的 MatterSim、Google DeepMind 的 GEMS 都在这条线上。
这条路线同时横跨量子化学、分子动力学与人工智能,考验的是长期的数据积累、算力储备和科研组织。分子之心创始人许锦波早在 2016 年就开发出全球第一个有效的 AI 蛋白质结构预测算法,后来被公认为启发了第一代 AlphaFold【直引】。公司 2022 年成立,2026 年 6 月完成 A 轮系列融资、累计超过 1 亿美元,7 月开放了生物经济操作系统 MoleculeOS。
QuantaMind 在其中的位置是把整个矩阵的最后一环补上。MoleculeOS 此前的技术组合是「生成—设计—预测」,解决的是分子长什么样、该设计成什么样;QuantaMind 补的是「机理理解」,回答的是这个分子为什么会有这样的行为。
⚠️ 四件还没验证的事
「接近 DFT 精度」这句话需要拆开读。机器学习力场通常在训练分布内表现很好,超出分布之后误差会以什么速度增长,是判断它能不能用在真实研发里的关键。论文里给出了体系规模和耗时,精度误差的分布区间目前没有公开数字。
第四件事是量级问题。一个细胞里有几十亿个原子,十万原子大约是一片细胞膜或者一个活性位点的尺度。这条路要走完,还需要再跨几个数量级,而且每跨一个量级,训练数据的覆盖难度都是非线性上升的。
🌡️ 门槛降下来之后会发生什么
这件事最终会落到一个很具体的场景上:一个普通课题组,过去要做分子动力学模拟得排队等超算、还得有个懂计算化学的博士后;如果单张 A100 能跑出可用的十万原子结果,那么一台工作站就能承担以前实验室做不了的工作。
门槛降下来之后,真正被改变的是「谁有资格问这个问题」,而不再只是某个团队的能力上限。过去只有算力充足的大机构能问的问题,变成了中小团队也能上手的问题。这个变化在科学史上出现过很多次,每一次的后果都不太一样。
那么,当模拟从「预测结果」走到「还原过程」之后,研究者的时间会更多地花在设计实验上,还是花在核对 AI 给出的机理上?
📚 参考来源
1. 分子之心 QuantaMind 相关研究,发表于《科学进展》(Science Advances),2026-09 — 科技日报《分子之心 QuantaMind 成果见刊〈科学进展〉》:https://www.stdaily.com/web/gdxw/2026-09/17/content_583085.html 2. 科技日报《AI 只会给答案、说不出原因?这项中国突破让 AI「看见」化学反应》,2026-09-16 — https://www.stdaily.com/web/gdxw/2026-09/16/content_582193.html 3. 量子位报道,2026-09-15 — 经智源 Link 转述:https://link.baai.ac.cn/@liangzw/117280329474008819 4. 搜狐科技《卷翻微软谷歌,登顶 Science 子刊!AI4S「不可能三角」被中国独角兽打破了》,2026-09 — https://www.sohu.com/a/1076656175_121421892 5. 第六届「海聚英才」全球创新创业大赛 AI4S 专项赛相关报道,2026-09-17 — https://news.qq.com/rain/a/20260917A05Q9N00
#AI4S #计算化学 #分子模拟