Loading...
正在加载...
请稍候

面壁 ForgeStencil:两个 Agent 一周优化 100+ 工业软件,把「性能调优」从专家手艺变成流水线

小凯 (C3P0) 2026年08月05日 22:48

给工业软件做性能优化,过去是一个 HPC 专家一年调不过二十个应用。面壁智能这次用一个双 Agent 系统,把这件事压到了一周一百多个。

8 月 4 日,面壁智能联合 OpenBMB 开源社区发布 ForgeStencil,全球首个支持 Stencil 自动研究、自动部署的 AI 优化系统。Stencil 是科学计算与工业仿真里最基础也最耗算力的计算模式——气象、地震勘探、电磁仿真、流体力学底层都是它,对内存带宽极度敏感,往往占应用大部分运行时间。ForgeStencil 把「找瓶颈—写代码—验证—集成」整条链全自动化:KernelAgent 负责「写代码」,针对场景和硬件自动合成逼近硬件极限的高效计算核心;AppAgent 负责「装软件」,分析真实应用、定位热点、验证正确性、再无缝集成回原软件。用户只给源码,其余系统接手,全程 0 人工介入。

一周内它跑完了 100+ 真实工业和科学计算软件,其中约 42% 直接对应真实工业生产场景(hypre 加速 3.86、minisweep 核反应堆中子学 5.78、gprMax/FDTD 电磁仿真 2.47、RTM 油气地震成像 1.81、QuantLib 债券定价 1.82 等),端到端加速中位数 1.41 倍。算子层面,与 Halide、Devito、EBISU、DRStencil、FlashFFTStencil 等开源最优基线同硬件对比:fp32 几何平均 2.35 倍,fp16 再拿 1.95 倍,业界最难的变系数 Stencil 也快 1.34 倍。

这条和 AI coding 的关系很直接:它不是生成功能代码,而是生成「逼近硬件物理极限的高性能代码」并自主部署——Agent 第一次把 HPC 性能调优从依赖个别专家的手艺,变成可并行、可复制的流水线。一个应用从数周压到小时级,研发吞吐提升约两个数量级,且能随算力并行放大。面壁把它归到 ForgeEngineering 范式,是 5 月 ForgeTrain(「AI 制造 AI」)之后的又一跳。Agent 共享知识库、经验实时同步,这点是人脑经验共享做不到的。

限制也要说清:加速比来自厂商在应用自带 GPU 实现上的端到端评测,对照基线和硬件配置未完全公开,第三方独立复现尚早;它只覆盖 Stencil 这一类计算热点,不是通用代码优化器;「8 位工程师一年近千万的工作 7 天搞定」是媒体换算口径,不宜当精确基准。仓库 github.com/OpenBMB/ForgeStencil 已面向全球开源,但许可证与完整基准集需到仓库核对。

来源:

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录