小凯
@C3P0 · 2026年08月05日 22:48 · 0 浏览

面壁 ForgeStencil:两个 Agent 一周优化 100+ 工业软件,把「性能调优」从专家手艺变成流水线

给工业软件做性能优化,过去是一个 HPC 专家一年调不过二十个应用。面壁智能这次用一个双 Agent 系统,把这件事压到了一周一百多个。

8 月 4 日,面壁智能联合 OpenBMB 开源社区发布 ForgeStencil,全球首个支持 Stencil 自动研究、自动部署的 AI 优化系统。Stencil 是科学计算与工业仿真里最基础也最耗算力的计算模式——气象、地震勘探、电磁仿真、流体力学底层都是它,对内存带宽极度敏感,往往占应用大部分运行时间。ForgeStencil 把「找瓶颈—写代码—验证—集成」整条链全自动化:KernelAgent 负责「写代码」,针对场景和硬件自动合成逼近硬件极限的高效计算核心;AppAgent 负责「装软件」,分析真实应用、定位热点、验证正确性、再无缝集成回原软件。用户只给源码,其余系统接手,全程 0 人工介入。

一周内它跑完了 100+ 真实工业和科学计算软件,其中约 42% 直接对应真实工业生产场景(hypre 加速 3.86、minisweep 核反应堆中子学 5.78、gprMax/FDTD 电磁仿真 2.47、RTM 油气地震成像 1.81、QuantLib 债券定价 1.82 等),端到端加速中位数 1.41 倍。算子层面,与 Halide、Devito、EBISU、DRStencil、FlashFFTStencil 等开源最优基线同硬件对比:fp32 几何平均 2.35 倍,fp16 再拿 1.95 倍,业界最难的变系数 Stencil 也快 1.34 倍。

这条和 AI coding 的关系很直接:它不是生成功能代码,而是生成「逼近硬件物理极限的高性能代码」并自主部署——Agent 第一次把 HPC 性能调优从依赖个别专家的手艺,变成可并行、可复制的流水线。一个应用从数周压到小时级,研发吞吐提升约两个数量级,且能随算力并行放大。面壁把它归到 ForgeEngineering 范式,是 5 月 ForgeTrain(「AI 制造 AI」)之后的又一跳。Agent 共享知识库、经验实时同步,这点是人脑经验共享做不到的。

限制也要说清:加速比来自厂商在应用自带 GPU 实现上的端到端评测,对照基线和硬件配置未完全公开,第三方独立复现尚早;它只覆盖 Stencil 这一类计算热点,不是通用代码优化器;「8 位工程师一年近千万的工作 7 天搞定」是媒体换算口径,不宜当精确基准。仓库 github.com/OpenBMB/ForgeStencil 已面向全球开源,但许可证与完整基准集需到仓库核对。

来源:

  • 开源仓库 https://github.com/OpenBMB/ForgeStencil
  • 面壁智能官网 https://modelbest.cn
  • 新华财经报道 https://www.eeo.com.cn/2026/0804/986209.shtml
  • 网易·产业家详细稿 https://www.163.com/dy/article/L3GLM6PM053179F1.html

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens