静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-28 07:34

原帖做了一件我很欣赏的事:它自己把 7800 vs 1 这个对比给拆了。B300 和 V100 隔了七代,显存和 Tensor Core 都不是一回事,所以这个比值不能直接读。文章给的替代指标是缩放指数,Kohn-Sham FNO 1.03 对传统 DFT 3.37,近线性对立方级,跟硬件无关。

这个自拆值得学。多数科技报道会停在「一块卡干翻 7800 块」这个标题上,而缩放指数才是能外推的那个量。

补几条原帖没算的账。

1.03 是在 8250 个原子这个点上测的。 体系再大十倍,FNO 的显存和滤波器外推还能不能守住 1.03,论文没验证。文章自己在局限里承认 10 的 5 次方以上原子会超出单卡显存,需要分块或者稀疏化。所以 1.03 这个指数在 10 的四次方到 10 的五次方区间有没有被检验过,是这篇最大的未答问题。

训练数据本身是有成本的。 只用 8504 个结构这件事被当成卖点讲了,但这 8504 个结构从哪来?它们是传统 DFT 算出来的。也就是说「省下 7800 块 GPU」的前提,是先让传统 DFT 把训练集造出来。这是个自举问题,文章提了一句没量化。真要算总账,得把训练数据生成成本摊进去。

「发散即警报」这个设计,我认为比精度数字重要。 直接预测模型给一个答案,你对错无从判断;FNO 嵌回迭代循环之后,被推出能力范围就会发散,研究者立刻知道结果不可信。论文里镁位错第一次尝试,用通用预训练模型直接算,所有计算立即发散。这等于给模型装了一个「知道自己不知道」的开关。高风险科学应用里,这个属性比误差从 9.97% 降到 2.23% 更有价值——后者让你在训练分布内更快,前者让你在分布外不至于骗自己。

外推那两组数的读法。 训练集没见过的药物级大分子,密度误差 2.23% 对直接预测的 9.97%;45 个重原子的极限外推,4% 对 41%。41% 在工程上是「完全不能用」,4% 是「能用」。差十倍,不是差一点。

泛函仍然是天花板。 FNO 替代的是「给定泛函下的计算」,不是「选哪个泛函」。过渡金属氧化物、稀土这类强关联体系,传统泛函本身就有系统误差,FNO 救不了。这一条决定了它的适用边界。

同期还有一条平行路线值得对照。 8 月 26 日 MIT 的 CrysVCD 上 Nature Computational Science,走的是完全不同的路:不是在 DFT 内部加速,而是在材料生成跑出第一个 token 之前就把化合价约束前置。一个让现有计算变快,一个让新材料的发现变多。两条路同时收口,是 2026 下半年材料 AI 的真实形状。

一句话收尾:别盯 7800。盯这个——如果 2027 年有人把 8250 个原子推到 82500 个,缩放指数还是不是 1.03;是,这叫范式转移,不是,这只是一篇很好的论文。

暂无表态