MegMind的ForgeStencil:AI一周优化100多个工业应用
在现代工业和前沿研究领域,有一个默默无闻的工作马:高性能计算软件。其核心通常是一种称为模板计算的计算模式。想想天气预报、地震勘探、电磁模拟或材料科学——它们都依赖于使用相邻点的加权组合重复更新网格。这种内存密集型过程可能占用应用程序运行时间的很大一部分,其速度可能决定一个国家的工业和科学效率的成败。
传统上,将模板计算优化到硬件的物理极限需要HPC专家的罕见专业知识。编译器、代码生成器和自动调优系统可以生成代码和搜索参数,但优化算法本身仍然需要手动设计和集成。每当场景、形状或硬件发生变化时,专家必须再次介入——这是一个阻碍可扩展性的瓶颈。
现在,这种情况正在改变。面壁智能与OpenBMB开源社区合作,发布了ForgeStencil——世界上第一个用于模板计算的AI优化系统。它是开源的,旨在自动化整个优化过程,从分析到部署。

据团队介绍,ForgeStencil在一周内完成了对100多个真实工业和科学计算软件的自动优化。每个应用程序的优化时间缩短到数小时,研发效率提高了约100倍。这种可扩展性意味着模板优化不再受限于人力。
最具颠覆性的方面是其双智能体、零人工干预的方法。您只需向其提供要优化的应用程序的源代码。从自动分析和热点定位到内核锻造、算子替换、正确性验证以及集成回原始应用程序——决策过程中没有人类专家参与。该系统由两部分组成:内核智能体(Kernel Agent),扮演科学家的角色,研究和合成高性能内核,为各种模板类型、形状和精度要求构建专门的算子矩阵,并将数学表达式转化为接近硬件极限的优雅代码;应用程序智能体(App Agent),则是务实的工程师,为每个实际应用定制解决方案,识别热点,建立GPU基线,验证集成,最后使用应用程序自身的测试用例进行端到端评估。
在与Halide、Devito、EBISU、DRStencil和FlashFFTStencil等知名框架的正面比较中,ForgeStencil在相同的fp32精度下实现了2.35倍的几何平均加速。使用混合fp16精度时,额外获得了1.95倍的加速。即使在所有形状的变系数模板这一公认难题上,它仍然比最佳基线实现了1.34倍的几何平均加速。

但ForgeStencil不仅仅关乎基准测试——它处理真实的工业场景。其约42%的优化直接对应真实的生产负载。例如,hypre结构化多重网格求解器库加速了3.86倍,minisweep核反应堆中子输运加速了5.78倍,gprMax和FDTD电磁模拟加速了2.47倍,用于油气地震成像的RTM逆时偏移加速了1.81倍,Total的minimod地震小应用加速了1.22倍,QuantLib债券定价加速了1.82倍,非笛卡尔MRI重建加速了2.45倍,数字乳腺断层合成反投影加速了1.63倍。这些是来自石油公司、医疗设备和气象部门的真实生产负载。
与将知识锁在脑海中的人类专家相比,ForgeStencil允许大量并行智能体共享一个共同的知识库,实现经验的实时交流,并实现智能集体同步和进化。这是面壁智能基于Forge工程软件工程范式继5月发布ForgeTrain之后的又一成果。它从自生成代码转向自动研究和优化,从局部算子加速转向实际应用部署。
短期内,现有工业软件的自动优化可以在数小时内达到接近硬件极限的结果,通过计算成本节约和研发压缩直接降低成本和提高效率。从长远来看,当高端设备、能源勘探和芯片设计的数字基础——如CAE仿真、地震成像、电磁学和流体动力学——被自动优化时,国内制造业升级的加速将得到推动。目前,ForgeStencil已在GitHub上开源,面壁智能已向HPC学者、工业软件专业人士和开源开发者发出邀请,共同参与建设。
关键要点
- ForgeStencil是一个AI驱动的自动模板优化系统,由面壁智能和OpenBMB开源。
- 它采用双智能体方法(内核智能体和应用智能体)实现零人工干预优化。
- 在一周内,它优化了超过100个工业软件,在实际应用中加速比高达5.78倍。
- 它优于现有框架如Halide和Devito,在fp32下实现了2.35倍的几何平均加速。
- 该系统旨在随计算能力扩展,实现智能体之间的集体智能。