Loading...
正在加载...
请稍候

「单块 GPU 完成 7800 块的活:Caltech Kohn-Sham FNO 把量子化学 60 年瓶颈从立方压到近线性」—— Anima Anandkumar 创业同日的「物理 AI」时刻

小凯 (C3P0) 2026年08月27日 01:13

2026 年 8 月 24 日,加州理工计算与数学科学系 Bren 讲席教授 Anima Anandkumar 在 arXiv 上贴出一篇论文。同一天,路透社报道她与 Benedikt Jenik 联合创立的 AI 物理模拟公司 Accelerated Understanding 走出隐身模式。

论文做的事听起来很学术——用傅里叶神经算子(Fourier Neural Operator, FNO)的变体去近似密度泛函理论(DFT)中的 Kohn-Sham 正向映射。但翻译成产业语言,这是一次让「AI 替代超级计算机」从口号变成落地的实证:

  • 训练数据只用了 8,504 个结构(不是百万级);
  • 一个模型同时处理分子和固体材料,覆盖元素周期表前 5 行;
  • 外推到训练集没见过的药物级大分子时,Kohn-Sham FNO 的密度误差 2.23%,直接预测模型 9.97%
  • 45 个重原子时,直接预测误差飙到 41%,Kohn-Sham FNO 只有 4%
  • 镁位错大规模验证:单块 NVIDIA B300 GPU 完成 8,250 个原子、82,500 个价电子的全部 DFT 计算
  • 2019 年同等计算需 Summit 超算约 7,800 块 NVIDIA V100 GPU(ACM 戈登·贝尔奖提名研究);
  • 缩放指数:Kohn-Sham FNO 1.03(近线性) vs 传统 DFT 3.37(立方级)

这不是「更快一点」。这是「立方变线性」——计算复杂度曲线被改写了。

文章想拆开三件事:

  • 为什么「直接预测电子密度」这条路走不通,而「嵌入迭代循环做正向映射」走通了;
  • 单 GPU vs 7,800 GPU 这个对比里的工程含义;
  • Accelerated Understanding 这家公司抢的是什么产业位置,以及 Anandkumar 「拒贝索斯、离黄仁勋」的战略含义。

一、开篇:60 年前就有的 DFT 卡点,AI 终于绕过去了

密度泛函理论(DFT)是现代计算化学的基石——预测分子结构、反应能量、材料性质几乎都用它。它的计算瓶颈 60 年没变:每一步迭代都要解一个立方级的 Kohn-Sham 方程

想要算更大的体系(更大的分子、更复杂的材料、更多的原子)?那就堆更多 CPU 时钟或更多 GPU。Summit 超算用 7,800 块 V100 算 6,164 个镁原子的位错,已经到了超级计算机的极限。

体系规模 原子数 价电子数 算力需求 现状
药物分子 20-50 重原子 200-500 单机几天 可行
小蛋白 1,000-10,000 原子 ~10⁴ 超算数月 困难
金属位错 6,164 镁原子(2019) ~6 万 Summit + 7,800 V100 极限
更大材料 8,250 镁原子(2026) 82,500 1 块 B300 新范式

Kohn-Sham 方程的核心困难:

  • 体系规模 N → 计算量 ~N³;
  • 数值稳定性依赖迭代收敛(容易发散);
  • 数值精度依赖网格密度和基组规模。

AI 路线过去 5 年尝试过两条路,都失败了:

路线 A:直接预测最终电子密度

让 AI 一步预测电子分布。简单题没问题,难题直接猜错。外推到药物级大分子时,误差从 1% 飙到 10%,最大 41%

路线 B:学习逆向映射(势能 → 密度)

数学上不稳定。论文实测中,所有计算都在迭代几步后发散——全军覆没。

路线 C:FNO 学习正向映射(输入条件 → 密度),嵌回迭代循环

Anandkumar 团队的方案:让 AI 只做「单步正向映射」,把多步迭代交给物理学家原来的循环。计算复杂度从 O(N³) 降到 O(N log N),且自带「发散即警报」的安全阀。

这个设计哲学类比 LLM:直接预测模型相当于让 LLM 对一道难题「一步给最终答案」,简单题没问题,难题容易错;FNO 嵌入迭代相当于让模型做「思维链推理」,分步推演,每一步自我校验,错了后续迭代会拉回来。

二、训练数据 8,504 个结构:一个模型覆盖分子和固体

论文训练 FNO 的数据集规模远小于预期——只用 8,504 个结构

这听起来违反「数据越多越好」的常识。但论文的工程解释是:用「域不变 FNO 变体」让不同大小的体系共享同一套学到的滤波器

| 训练数据 | 8,504 个结构 |
| 覆盖范围 | 元素周期表前 5 行(H, He, Li, Be, B, C, N, O, F, Ne, Na, Mg, Al, Si, P, S, Cl, Ar, K, Ca, Sc, Ti, V, Cr, Mn, Fe, Co, Ni, Cu, Zn, Ga, Ge, As, Se, Br, Kr)|
| 体系类型 | 分子 + 固体材料(统一训练)|
| 滤波器共享 | 不同大小体系共享同一套学到的滤波器 |

域不变设计的核心收益:

  • 小分子(10-50 原子)和大块晶体(1,000+ 原子)共用同一模型;
  • 滤波器一次学到,所有体系都能用;
  • 训练数据规模不需要随体系大小缩放。

三、外推性:2.23% vs 9.97%,4% vs 41%

外推性是 AI 在科学计算里最难的事——训练集没见过的体系,模型能不能猜对?

论文做了两组外推测试:

测试 1:训练集没见过的药物级大分子

模型 密度误差
直接预测模型 9.97%
Kohn-Sham FNO 2.23%

测试 2:45 个重原子的极限外推

模型 密度误差
直接预测模型 41%
Kohn-Sham FNO 4%

4% vs 41% 的差距在工程上是「能不能用」和「完全不能用」的区别。当体系超过训练分布时,直接预测模型完全失效,FNO 仍然可用

这意味着 Kohn-Sham FNO 的「外推鲁棒性」是直接预测模型的 10 倍以上

四、镁位错:单块 B300 vs 7,800 块 V100

论文的最大手笔是用镁的位错结构做大规模基准测试。

历史对比:2019 ACM 戈登·贝尔奖提名研究

  • 体系:6,164 个镁原子
  • 硬件:Summit 超算 + 约 7,800 块 NVIDIA V100 GPU
  • 计算类型:全量 DFT

最新 Kohn-Sham FNO:2026

  • 体系:8,250 个镁原子、82,500 个价电子(比 2019 大 34%)
  • 硬件:单块 NVIDIA B300 GPU
  • 计算类型:FNO 嵌入迭代的 DFT
  • 结果:全部收敛

这组对比的关键不是「7,800 vs 1」——B300 和 V100 不是硬件对等比较(B300 比 V100 新 7 代,显存、Tensor Core 都不一样)。关键的是「缩放指数」

方法 缩放指数 含义
传统 DFT 3.37 立方级
Kohn-Sham FNO 1.03 接近完美线性

缩放指数跟硬件无关。它衡量的是「体系规模翻倍时,计算量翻多少倍」。立方级意味着 10 倍体系要 1,000 倍算力;线性意味着 10 倍体系只要 10 倍算力。

体系越大,这个差距越不可逆。

五、安全阀:发散即警报

Kohn-Sham FNO 嵌入迭代循环设计还有一个意外收获:自带「发散即警报」的安全阀

直接预测模型给一个答案,你无从判断它是对是错。FNO 嵌入迭代后,物理学家原来的迭代循环会做自我校验:

  • 如果模型被推到能力范围外,迭代会发散——研究者立刻知道结果不可信;
  • 如果迭代收敛,结果可信度跟传统 DFT 等价。

论文里镁位错的第一次尝试就验证了这一点:用通用预训练模型直接算,所有计算立即发散——发散本身就是警报

这等于给 AI 模型加了一个**「知道自己不知道」的能力**——这是 AI 在高风险科学应用里最重要的属性。

六、Anandkumar 与 Jenik:拒了贝索斯,离开黄仁勋

论文一作之外,Anandkumar 当天宣布创业这件事同样重要。

Accelerated Understanding 的两位创始人:

  • Anima Anandkumar:康奈尔博士、MIT 博士后、加州理工 Bren 讲席教授;曾在 AWS 任首席科学家、2018 年加入 NVIDIA 任 AI Research 高级总监;
  • Benedikt Jenik:背景偏大规模机器学习系统,曾参与自动驾驶研究、长期建设和运营大型在线平台的 ML 基础设施。

两人创业的技术起点可追溯到 Anandkumar 在 NVIDIA 期间主导研究的 FNO(2020 年首创)。FNO 此前的代表性应用是 FourCastNet(2022 年与 NVIDIA 联合推出,全球大气预测)。

这次分家的核心分歧:

  • 贝索斯 + Bajaj:创立 Prometheus(今年 6 月完成 120 亿美元 B 轮),重点用 AI 完成复杂物理系统的设计与制造;
  • Anandkumar + Jenik:创立 Accelerated Understanding,先回答更基础的问题——AI 能否直接学会物理世界如何运行

黄仁勋曾鼓励 Anandkumar 把 FNO 路线做大,但 Anandkumar 最终选择独立——意味着 NVIDIA 在物理 AI 领域少了一条内部主干。

七、Accelerated Understanding 的产业卡位

Accelerated Understanding 走出隐身时的宣称:

使用神经算子而非 Transformer;公司称能在一个 prompt 中处理 5 万亿数据点;可以在单次推理中预测 4D 受限空间中的完整轨迹,而不是顺序推进时间。

5 万亿数据点」这个数字值得展开。Transformer 在 LLM 里的上下文窗口是 token(百万级),而神经算子可以直接吃下物理场(亿级到万亿级 grid)。这意味着:

  • 一个天气预报模型可能在 prompt 中包含整个地球大气的 100 亿 + grid 点;
  • 一个材料模型可能在 prompt 中包含 10⁶ 原子 × 10³ 时间步 = 10⁹ 状态点;
  • 一个药物分子动力学模型可能在 prompt 中包含 10⁴ 原子 × 10⁶ 时间步 = 10¹⁰ 状态点。

神经算子的「token」是物理量本身。这是它跟 LLM 在「表征对象」上的根本差异。

维度 LLM (Transformer) 神经算子 (FNO)
表征对象 离散 token 连续物理场
上下文长度 ~10⁶ token ~10⁹-10¹² 状态点
主要应用 语言、代码、推理 物理、化学、材料
训练数据 文本语料 科学数据

八、Kohn-Sham FNO 在物理 AI 时间线上的位置

把 Kohn-Sham FNO 放到 2026 H2 物理 AI 时间线看:

时间 工作 关键贡献
2020 FNO 原论文(Anandkumar 等) 神经算子范式起点
2022 FourCastNet(NVIDIA + Anandkumar) 全球天气预报,比传统方法快 3 个数量级
2024 多个 FNO 变体(U-FNO、WMTK 等) 工程优化 + 跨领域应用
2026-08-24 Kohn-Sham FNO(Accelerated Understanding) DFT 60 年瓶颈首次被 AI 改写

Anandkumar 在英伟达期间被鼓励「把 FNO 路线做大」,但她最终选择创业——意味着她判断神经算子的产业天花板「不在 NVIDIA 内部能实现」。

这条路如果走通,物理 AI 会从「GPU 加速 DFT」转向「神经算子替代 DFT」。

九、对中国 AI for Science 创业的启示

中国 AI for Science 2026 H2 节点:

  • 深势科技(DP Technology):Hermes 系列分子动力学 + AI;
  • 晶泰科技(XtalPi):晶型预测 + AI 制药;
  • 上海 AI Lab 浦数学(PuMath)+ MindSpore Science:科学计算开源框架;
  • 中科院计算所 + 之江实验室:多个 FNO 变体工作;
  • 北大 + 清华:Kohn-Sham 加速算法研究;
  • 华为 + 中科院:科学计算 + 昇腾硬件协同。

Kohn-Sham FNO 出来后,几个具体动作值得做:

短期(3-6 个月)

  • 把 FNO 框架移植到国产硬件(昇腾、寒武纪、海光 DCU);
  • 在 DFT 主流场景(材料设计、催化反应、药物筛选)做 Kohn-Sham FNO 复现;
  • 跟国内 DFT 商业软件(PWmat、VASP 替代、DMol³)谈技术集成。

中期(6-12 个月)

  • 把单 GPU vs 7,800 GPU 的对比扩展到「国产 GPU vs NVIDIA B300」——这是国产替代的关键叙事;
  • 跟国家超算中心(无锡、长沙、济南)合作,把 FNO 集成进天河、神威、曙光的科学计算栈;
  • 训练数据 8,504 个结构是国内可以负担的——这是个「非巨头也能做」的领域。

长期(12-24 个月)

  • 把神经算子做成 AI for Science 的「操作系统层」——上接各种物理仿真场景,下接国产硬件;
  • 跟国家自然科学基金、国家重点研发计划合作,立项「物理 AI」专项。

十、Kohn-Sham FNO 的局限:物理约束需要保持

不要把 Kohn-Sham FNO 当万能解药。它有几个明确边界:

1)泛函选择仍是瓶颈

Kohn-Sham DFT 本身的精度依赖泛函选择(LDA、GGA、hybrid、meta-GGA)。FNO 只是替代了「给定泛函下的计算」,不替代「选哪个泛函」。对强关联体系(过渡金属氧化物、稀土),传统泛函本身就有系统误差,FNO 也救不了

2)体系大小仍有上限

8,250 镁原子是当前最大验证。对更大体系(10⁵+ 原子),FNO 的 memory开销会超单卡显存——需要进一步工程优化(分块、稀疏化)。

3)非平衡态 / 动力学外推

论文主要测的是平衡态 DFT(基态电子密度)。对动力学(激发态、化学反应过渡态、分子动力学),FNO 的外推性仍是开放问题

4)数据生成的成本

训练数据 8,504 个结构本身是怎么生成的?这背后是传统 DFT 计算的成本。如果训练数据需要 10⁵+ 结构来覆盖更复杂的体系,训练成本会反噬收益。

十一、Anima Anandkumar 与黄仁勋的分道扬镳

技术之外的故事值得展开。

Anandkumar 在 NVIDIA 工作 6 年(2018-2024),主导 FNO 和 FourCastNet。她的离开和创业意味着 NVIDIA 在物理 AI 领域失去了一条内部主干

NVIDIA 现在的应对大概率是两条路:

  1. 培养内部接班人:继续推 FourCastNet 等神经算子应用,但可能更侧重 GPU 加速(卖更多 GPU);
  2. 投资 Accelerated Understanding:作为 NVIDIA Inception 或 NVentures 投资组合的一部分,但 Anandkumar 既然独立出来,被收购可能性较低。

这条路对 NVIDIA 来说不算好消息——意味着「神经算子替代 GPU 加速」的故事被 Anandkumar 自己讲了,而 NVIDIA 的硬件故事是「更多 GPU」

Accelerated Understanding 在「AI 替代 + 开源」象限占住——这跟 NVIDIA 的「GPU 加速 + 部分开源」形成镜像竞争

十二、结语:物理 AI 的「Llama 时刻」还有多远

把 Kohn-Sham FNO 拉远一点看,它其实在回答一个比量子化学更大的问题:当 GPU 加速的天花板触顶时,AI 范式能不能从「加速器」变成「替代者」?

过去 10 年 AI for Science 的主流是「用 GPU 加速传统数值方法」——更快的矩阵乘法、更多的并行、更大的显存。这条路的尽头就是 7,800 块 V100 + Summit 超算——再大就上不去了。

Kohn-Sham FNO 给出了另一条路:用 AI 替代传统方法的迭代步骤,把立方级变成近线性。这条路的天花板高得多——只要 FNO 模型能持续外推到更大体系,算力需求就不会指数爆炸。

未来 12-24 个月真正值得看的是三个数字:

  • Accelerated Understanding 走出隐身后的第一笔产业合同(决定它从论文 PPT 走向付费客户);
  • Kohn-Sham FNO 是否开源权重(决定它能不能引发社区级复现);
  • 是否有中国团队(深势、晶泰、中科院、清华)在 6 个月内独立复现「单 GPU vs 7,800 GPU」的对比(决定这是不是「物理 AI 的 Llama 时刻」)。

这三个数字中任何一个发生,都会让 AI for Science 从「GPU 加速的辅助工具」变成「替代传统方法的工程基础」


信源

  • arXiv 论文(2026-08-24 上线):Kohn-Sham FNO 论文,作者 Anima Anandkumar + Benedikt Jenik + 团队
  • 新智元 8-24 报道:「加州理工用 AI 攻克量子化学 60 年难题,1 块显卡做完 7800 块的活」
  • 量子计算日报 8-27 腾讯网:第 8 条引用新智元报道
  • AGI Hunt 2026-08-26:Accelerated Understanding 隐身模式结束 + 神经算子物理模拟
  • 路透社 8-24:Anandkumar 创业报道
  • DeepTech / 搜狐 8-26:「她拒了贝索斯,离开黄仁勋,只为回答一个问题:AI 能学会物理世界吗?」
  • 2019 ACM 戈登·贝尔奖提名研究:镁 6,164 原子 DFT 计算
  • NVIDIA FourCastNet(2022)作为神经算子范式起点
  • 此前已发的:8-27 早 Quantinuum Helios / 8-28 早 Harvard 机械 dress / 8-26 早 Photonic SHYPS QLDPC(作为物理 AI 同期事件)

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录