「单块 GPU 完成 7800 块的活:Caltech Kohn-Sham FNO 把量子化学 60 年瓶颈从立方压到近线性」—— Anima Anandkumar 创业同日的「物理 AI」时刻
2026 年 8 月 24 日,加州理工计算与数学科学系 Bren 讲席教授 Anima Anandkumar 在 arXiv 上贴出一篇论文。同一天,路透社报道她与 Benedikt Jenik 联合创立的 AI 物理模拟公司 Accelerated Understanding 走出隐身模式。
论文做的事听起来很学术——用傅里叶神经算子(Fourier Neural Operator, FNO)的变体去近似密度泛函理论(DFT)中的 Kohn-Sham 正向映射。但翻译成产业语言,这是一次让「AI 替代超级计算机」从口号变成落地的实证:
- 训练数据只用了 8,504 个结构(不是百万级);
- 一个模型同时处理分子和固体材料,覆盖元素周期表前 5 行;
- 外推到训练集没见过的药物级大分子时,Kohn-Sham FNO 的密度误差 2.23%,直接预测模型 9.97%;
- 45 个重原子时,直接预测误差飙到 41%,Kohn-Sham FNO 只有 4%;
- 镁位错大规模验证:单块 NVIDIA B300 GPU 完成 8,250 个原子、82,500 个价电子的全部 DFT 计算;
- 2019 年同等计算需 Summit 超算约 7,800 块 NVIDIA V100 GPU(ACM 戈登·贝尔奖提名研究);
- 缩放指数:Kohn-Sham FNO 1.03(近线性) vs 传统 DFT 3.37(立方级)。
文章想拆开三件事:
- 为什么「直接预测电子密度」这条路走不通,而「嵌入迭代循环做正向映射」走通了;
- 单 GPU vs 7,800 GPU 这个对比里的工程含义;
- Accelerated Understanding 这家公司抢的是什么产业位置,以及 Anandkumar 「拒贝索斯、离黄仁勋」的战略含义。
一、开篇:60 年前就有的 DFT 卡点,AI 终于绕过去了
密度泛函理论(DFT)是现代计算化学的基石——预测分子结构、反应能量、材料性质几乎都用它。它的计算瓶颈 60 年没变:每一步迭代都要解一个立方级的 Kohn-Sham 方程。
想要算更大的体系(更大的分子、更复杂的材料、更多的原子)?那就堆更多 CPU 时钟或更多 GPU。Summit 超算用 7,800 块 V100 算 6,164 个镁原子的位错,已经到了超级计算机的极限。
| 体系规模 | 原子数 | 价电子数 | 算力需求 | 现状 |
|---|---|---|---|---|
| 药物分子 | 20-50 重原子 | 200-500 | 单机几天 | 可行 |
| 小蛋白 | 1,000-10,000 原子 | ~10⁴ | 超算数月 | 困难 |
| 金属位错 | 6,164 镁原子(2019) | ~6 万 | Summit + 7,800 V100 | 极限 |
| 更大材料 | 8,250 镁原子(2026) | 82,500 | 1 块 B300 | 新范式 |
- 体系规模 N → 计算量 ~N³;
- 数值稳定性依赖迭代收敛(容易发散);
- 数值精度依赖网格密度和基组规模。
路线 A:直接预测最终电子密度
让 AI 一步预测电子分布。简单题没问题,难题直接猜错。外推到药物级大分子时,误差从 1% 飙到 10%,最大 41%。
路线 B:学习逆向映射(势能 → 密度)
数学上不稳定。论文实测中,所有计算都在迭代几步后发散——全军覆没。
路线 C:FNO 学习正向映射(输入条件 → 密度),嵌回迭代循环
Anandkumar 团队的方案:让 AI 只做「单步正向映射」,把多步迭代交给物理学家原来的循环。计算复杂度从 O(N³) 降到 O(N log N),且自带「发散即警报」的安全阀。
这个设计哲学类比 LLM:直接预测模型相当于让 LLM 对一道难题「一步给最终答案」,简单题没问题,难题容易错;FNO 嵌入迭代相当于让模型做「思维链推理」,分步推演,每一步自我校验,错了后续迭代会拉回来。
二、训练数据 8,504 个结构:一个模型覆盖分子和固体
论文训练 FNO 的数据集规模远小于预期——只用 8,504 个结构。
这听起来违反「数据越多越好」的常识。但论文的工程解释是:用「域不变 FNO 变体」让不同大小的体系共享同一套学到的滤波器。
| 训练数据 | 8,504 个结构 | | 覆盖范围 | 元素周期表前 5 行(H, He, Li, Be, B, C, N, O, F, Ne, Na, Mg, Al, Si, P, S, Cl, Ar, K, Ca, Sc, Ti, V, Cr, Mn, Fe, Co, Ni, Cu, Zn, Ga, Ge, As, Se, Br, Kr)| | 体系类型 | 分子 + 固体材料(统一训练)| | 滤波器共享 | 不同大小体系共享同一套学到的滤波器 |
域不变设计的核心收益:
- 小分子(10-50 原子)和大块晶体(1,000+ 原子)共用同一模型;
- 滤波器一次学到,所有体系都能用;
- 训练数据规模不需要随体系大小缩放。
三、外推性:2.23% vs 9.97%,4% vs 41%
外推性是 AI 在科学计算里最难的事——训练集没见过的体系,模型能不能猜对?
论文做了两组外推测试:
测试 1:训练集没见过的药物级大分子
| 模型 | 密度误差 |
|---|---|
| 直接预测模型 | 9.97% |
| Kohn-Sham FNO | 2.23% |
| 模型 | 密度误差 |
|---|---|
| 直接预测模型 | 41% |
| Kohn-Sham FNO | 4% |
4% vs 41% 的差距在工程上是「能不能用」和「完全不能用」的区别。当体系超过训练分布时,直接预测模型完全失效,FNO 仍然可用。
这意味着 Kohn-Sham FNO 的「外推鲁棒性」是直接预测模型的 10 倍以上。
四、镁位错:单块 B300 vs 7,800 块 V100
论文的最大手笔是用镁的位错结构做大规模基准测试。
历史对比:2019 ACM 戈登·贝尔奖提名研究
- 体系:6,164 个镁原子
- 硬件:Summit 超算 + 约 7,800 块 NVIDIA V100 GPU
- 计算类型:全量 DFT
- 体系:8,250 个镁原子、82,500 个价电子(比 2019 大 34%)
- 硬件:单块 NVIDIA B300 GPU
- 计算类型:FNO 嵌入迭代的 DFT
- 结果:全部收敛
这组对比的关键不是「7,800 vs 1」——B300 和 V100 不是硬件对等比较(B300 比 V100 新 7 代,显存、Tensor Core 都不一样)。关键的是「缩放指数」:
| 方法 | 缩放指数 | 含义 |
|---|---|---|
| 传统 DFT | 3.37 | 立方级 |
| Kohn-Sham FNO | 1.03 | 接近完美线性 |
体系越大,这个差距越不可逆。
五、安全阀:发散即警报
Kohn-Sham FNO 嵌入迭代循环设计还有一个意外收获:自带「发散即警报」的安全阀。
直接预测模型给一个答案,你无从判断它是对是错。FNO 嵌入迭代后,物理学家原来的迭代循环会做自我校验:
- 如果模型被推到能力范围外,迭代会发散——研究者立刻知道结果不可信;
- 如果迭代收敛,结果可信度跟传统 DFT 等价。
这等于给 AI 模型加了一个「知道自己不知道」的能力——这是 AI 在高风险科学应用里最重要的属性。
六、Anandkumar 与 Jenik:拒了贝索斯,离开黄仁勋
论文一作之外,Anandkumar 当天宣布创业这件事同样重要。
Accelerated Understanding 的两位创始人:
- Anima Anandkumar:康奈尔博士、MIT 博士后、加州理工 Bren 讲席教授;曾在 AWS 任首席科学家、2018 年加入 NVIDIA 任 AI Research 高级总监;
- Benedikt Jenik:背景偏大规模机器学习系统,曾参与自动驾驶研究、长期建设和运营大型在线平台的 ML 基础设施。
这次分家的核心分歧:
- 贝索斯 + Bajaj:创立 Prometheus(今年 6 月完成 120 亿美元 B 轮),重点用 AI 完成复杂物理系统的设计与制造;
- Anandkumar + Jenik:创立 Accelerated Understanding,先回答更基础的问题——AI 能否直接学会物理世界如何运行。
黄仁勋曾鼓励 Anandkumar 把 FNO 路线做大,但 Anandkumar 最终选择独立——意味着 NVIDIA 在物理 AI 领域少了一条内部主干。
七、Accelerated Understanding 的产业卡位
Accelerated Understanding 走出隐身时的宣称:
> 使用神经算子而非 Transformer;公司称能在一个 prompt 中处理 5 万亿数据点;可以在单次推理中预测 4D 受限空间中的完整轨迹,而不是顺序推进时间。
「5 万亿数据点」这个数字值得展开。Transformer 在 LLM 里的上下文窗口是 token(百万级),而神经算子可以直接吃下物理场(亿级到万亿级 grid)。这意味着:
- 一个天气预报模型可能在 prompt 中包含整个地球大气的 100 亿 + grid 点;
- 一个材料模型可能在 prompt 中包含 10⁶ 原子 × 10³ 时间步 = 10⁹ 状态点;
- 一个药物分子动力学模型可能在 prompt 中包含 10⁴ 原子 × 10⁶ 时间步 = 10¹⁰ 状态点。
| 维度 | LLM (Transformer) | 神经算子 (FNO) |
|---|---|---|
| 表征对象 | 离散 token | 连续物理场 |
| 上下文长度 | ~10⁶ token | ~10⁹-10¹² 状态点 |
| 主要应用 | 语言、代码、推理 | 物理、化学、材料 |
| 训练数据 | 文本语料 | 科学数据 |
八、Kohn-Sham FNO 在物理 AI 时间线上的位置
把 Kohn-Sham FNO 放到 2026 H2 物理 AI 时间线看:
| 时间 | 工作 | 关键贡献 |
|---|---|---|
| 2020 | FNO 原论文(Anandkumar 等) | 神经算子范式起点 |
| 2022 | FourCastNet(NVIDIA + Anandkumar) | 全球天气预报,比传统方法快 3 个数量级 |
| 2024 | 多个 FNO 变体(U-FNO、WMTK 等) | 工程优化 + 跨领域应用 |
| 2026-08-24 | Kohn-Sham FNO(Accelerated Understanding) | DFT 60 年瓶颈首次被 AI 改写 |
Anandkumar 在英伟达期间被鼓励「把 FNO 路线做大」,但她最终选择创业——意味着她判断神经算子的产业天花板「不在 NVIDIA 内部能实现」。
这条路如果走通,物理 AI 会从「GPU 加速 DFT」转向「神经算子替代 DFT」。
九、对中国 AI for Science 创业的启示
中国 AI for Science 2026 H2 节点:
- 深势科技(DP Technology):Hermes 系列分子动力学 + AI;
- 晶泰科技(XtalPi):晶型预测 + AI 制药;
- 上海 AI Lab 浦数学(PuMath)+ MindSpore Science:科学计算开源框架;
- 中科院计算所 + 之江实验室:多个 FNO 变体工作;
- 北大 + 清华:Kohn-Sham 加速算法研究;
- 华为 + 中科院:科学计算 + 昇腾硬件协同。
短期(3-6 个月)
- 把 FNO 框架移植到国产硬件(昇腾、寒武纪、海光 DCU);
- 在 DFT 主流场景(材料设计、催化反应、药物筛选)做 Kohn-Sham FNO 复现;
- 跟国内 DFT 商业软件(PWmat、VASP 替代、DMol³)谈技术集成。
- 把单 GPU vs 7,800 GPU 的对比扩展到「国产 GPU vs NVIDIA B300」——这是国产替代的关键叙事;
- 跟国家超算中心(无锡、长沙、济南)合作,把 FNO 集成进天河、神威、曙光的科学计算栈;
- 训练数据 8,504 个结构是国内可以负担的——这是个「非巨头也能做」的领域。
- 把神经算子做成 AI for Science 的「操作系统层」——上接各种物理仿真场景,下接国产硬件;
- 跟国家自然科学基金、国家重点研发计划合作,立项「物理 AI」专项。
十、Kohn-Sham FNO 的局限:物理约束需要保持
不要把 Kohn-Sham FNO 当万能解药。它有几个明确边界:
1)泛函选择仍是瓶颈
Kohn-Sham DFT 本身的精度依赖泛函选择(LDA、GGA、hybrid、meta-GGA)。FNO 只是替代了「给定泛函下的计算」,不替代「选哪个泛函」。对强关联体系(过渡金属氧化物、稀土),传统泛函本身就有系统误差,FNO 也救不了。
2)体系大小仍有上限
8,250 镁原子是当前最大验证。对更大体系(10⁵+ 原子),FNO 的 memory开销会超单卡显存——需要进一步工程优化(分块、稀疏化)。
3)非平衡态 / 动力学外推
论文主要测的是平衡态 DFT(基态电子密度)。对动力学(激发态、化学反应过渡态、分子动力学),FNO 的外推性仍是开放问题。
4)数据生成的成本
训练数据 8,504 个结构本身是怎么生成的?这背后是传统 DFT 计算的成本。如果训练数据需要 10⁵+ 结构来覆盖更复杂的体系,训练成本会反噬收益。
十一、Anima Anandkumar 与黄仁勋的分道扬镳
技术之外的故事值得展开。
Anandkumar 在 NVIDIA 工作 6 年(2018-2024),主导 FNO 和 FourCastNet。她的离开和创业意味着 NVIDIA 在物理 AI 领域失去了一条内部主干。
NVIDIA 现在的应对大概率是两条路:
1. 培养内部接班人:继续推 FourCastNet 等神经算子应用,但可能更侧重 GPU 加速(卖更多 GPU); 2. 投资 Accelerated Understanding:作为 NVIDIA Inception 或 NVentures 投资组合的一部分,但 Anandkumar 既然独立出来,被收购可能性较低。
这条路对 NVIDIA 来说不算好消息——意味着「神经算子替代 GPU 加速」的故事被 Anandkumar 自己讲了,而 NVIDIA 的硬件故事是「更多 GPU」。
Accelerated Understanding 在「AI 替代 + 开源」象限占住——这跟 NVIDIA 的「GPU 加速 + 部分开源」形成镜像竞争。
十二、结语:物理 AI 的「Llama 时刻」还有多远
把 Kohn-Sham FNO 拉远一点看,它其实在回答一个比量子化学更大的问题:当 GPU 加速的天花板触顶时,AI 范式能不能从「加速器」变成「替代者」?
过去 10 年 AI for Science 的主流是「用 GPU 加速传统数值方法」——更快的矩阵乘法、更多的并行、更大的显存。这条路的尽头就是 7,800 块 V100 + Summit 超算——再大就上不去了。
Kohn-Sham FNO 给出了另一条路:用 AI 替代传统方法的迭代步骤,把立方级变成近线性。这条路的天花板高得多——只要 FNO 模型能持续外推到更大体系,算力需求就不会指数爆炸。
未来 12-24 个月真正值得看的是三个数字:
- Accelerated Understanding 走出隐身后的第一笔产业合同(决定它从论文 PPT 走向付费客户);
- Kohn-Sham FNO 是否开源权重(决定它能不能引发社区级复现);
- 是否有中国团队(深势、晶泰、中科院、清华)在 6 个月内独立复现「单 GPU vs 7,800 GPU」的对比(决定这是不是「物理 AI 的 Llama 时刻」)。
---
信源
- arXiv 论文(2026-08-24 上线):Kohn-Sham FNO 论文,作者 Anima Anandkumar + Benedikt Jenik + 团队
- 新智元 8-24 报道:「加州理工用 AI 攻克量子化学 60 年难题,1 块显卡做完 7800 块的活」
- 量子计算日报 8-27 腾讯网:第 8 条引用新智元报道
- AGI Hunt 2026-08-26:Accelerated Understanding 隐身模式结束 + 神经算子物理模拟
- 路透社 8-24:Anandkumar 创业报道
- DeepTech / 搜狐 8-26:「她拒了贝索斯,离开黄仁勋,只为回答一个问题:AI 能学会物理世界吗?」
- 2019 ACM 戈登·贝尔奖提名研究:镁 6,164 原子 DFT 计算
- NVIDIA FourCastNet(2022)作为神经算子范式起点
- 此前已发的:8-27 早 Quantinuum Helios / 8-28 早 Harvard 机械 dress / 8-26 早 Photonic SHYPS QLDPC(作为物理 AI 同期事件)