「神经加速器被塞进着色器核心:Arm 把 AI 原生图形推到手机上」
2026 年 9 月 8 日,Arm 在 Arm Everywhere China 年度大会发布第二代移动终端计算子系统 CSS for Mobile 2,其中的 Mali G2-Ultra NX 是第一款把专用神经网络加速器直接集成进着色器核心的 Mali GPU。配套三项技术:神经超级采样 NSS、神经帧率提升…
2026 年 9 月 8 日,Arm 在 Arm Everywhere China 年度大会发布第二代移动终端计算子系统 CSS for Mobile 2,其中的 Mali G2-Ultra NX 是第一款把专用神经网络加速器直接集成进着色器核心的 Mali GPU。配套三项技术:神经超级采样 NSS、神经帧率提升 NFRU、神经超级采样与降噪 NSSD。Arm 报的三个数里有两个落在带宽上,而不是算力上。手机上最贵的资源从来不是算得够不够快,是把数据在芯片和内存之间搬来搬去的开销。
🎮 一帧 33 毫秒里能塞什么
30 FPS 下,一帧的预算是 33 毫秒。想要 120 FPS,预算压到 8.3 毫秒。在这段时间里 GPU 要完成几何处理、光栅化、着色、后处理,还要把中间结果写进内存再读出来。
移动端还有一条硬约束:功耗和散热。Arm 给出的定位是,传统渲染能做出高画质,但要在移动端的功耗、散热和带宽限制内达到桌面级保真度,得靠更高的效率;神经图形是另一条路,用 AI 重建细节、生成中间帧、优化图像,同时降低 GPU 和整机的工作量。
Mali G2-Ultra NX 的做法是把神经加速器紧耦合进着色器核心,让神经图形负载和常规图形、计算负载一起跑。这种紧集成复用 GPU 的内存系统、一致性缓存和控制结构,减少数据在流水线上的搬运。产品页描述这个加速器块支持 INT8 与 INT16 处理,并带光流加速。
🔧 三项技术各管一段
NSS 做的是从低分辨率渲染重建出高分辨率画面,减少要产出高质量最终图像所需的常规渲染工作量。它结合时间数据和内置抗锯齿来提升画质。
NFRU 用运动、深度和已渲染帧的数据生成中间帧,把帧率提上去。Arm 的工程师在媒体问答里说明,目前的 NFRU 只在两个渲染帧之间插一帧 AI 生成帧,未来规划支持多帧生成,但延迟控制是优先考量:在 30 FPS 的 33 毫秒预算里要完成原始帧和 AI 帧的渲染,需要开发者配合帧步调方案来稳定输出。
NSSD 把神经超采样和降噪合在一起,用在光照阴影复杂的光线追踪场景里。
Arm 与 Sumo Digital 做的演示游戏 Neural Dawn 展示了 NFRU 和 NSSD 怎么接进生产管线:相比原生渲染,性能效率最高提升 4 倍,外部内存流量最高降低 70%。Arm 说这些增益能让 Unreal Engine MegaLights 这类进阶技术在移动硬件上变得可行。
💾 带宽才是主战场
Arm 的 James McNiven 列了三层带宽优化:神经网络加速器本身降低复杂内容的带宽占用;NSS 提供可调节模式,让开发者在画质和带宽之间取舍,最高可实现 70% 的带宽节省;光线追踪单元的硬件升级再贡献约 13% 的带宽降低,而这个收益会随光追内容占比提升继续扩大。
| 优化层 | 口径 |
|---|---|
| NSS 可调节模式 | 最高 70% 带宽节省 |
| 第三代光线追踪单元 | 主流光追基准上 DRAM 流量降低最多 13% |
| Opacity Micromaps | Arm 演示中帧率 +30%,光追工作负载最多降 70% |
| Neural Dawn 演示 | 外部内存流量最高降低 70%,性能效率最高 4 倍 |
🖥️ 桌面端已经跑过一遍的路,移动端约束不同
神经超采样在桌面端不算新东西,超分和插帧技术已经迭代了几代。移动端的差别不在有没有,而在约束排序。
桌面 GPU 先撞算力墙,电源和散热相对宽松。手机先撞带宽墙和功耗墙:多读一次显存的能耗,比多做一次算术高得多,而电池和机身温度不提供任何谈判空间。这解释了为什么 Arm 这次报的头号收益是外部内存流量降 70%,而不是帧数翻了多少倍。
⚙️ 传统管线这一侧也动了大手术
神经部分之外,Mali G2-Ultra NX 换了新的执行引擎,Arm 称这是七代以来最大的 Mali GPU 指令集架构升级。每个 warp 的寄存器最多翻倍,给复杂场景留出余量。
架构改动换来的数字是:基准性能最高提升 24%,非 AI 游戏性能最高提升 14%,都与上一代对比。配合 NFRU,Arm 说可以支持最高 120 FPS 的移动游戏会话。
第三代光线追踪单元支持更复杂的光照、阴影、反射和几何。产品页的脚注写明,这些对比是与前代相比,基于 2026 年 3 月至 8 月的内部测试。
📦 GPU 之外,整个子系统也在调
Mali G2-Ultra NX 是 CSS for Mobile 2 的一部分,不是孤立升级。同平台的 C2 CPU 集群支持 SME2,执行轻量 AI 模型比前代快 1.7 倍;另有 SI L2 互联和系统 IP。Arm 的说法是这套组合针对 AI 代理这类新负载做了协同优化,特征是延迟敏感、突发、内存密集。
把这条和 GPU 侧放在一起看,方向是一致的:神经推理正在从「一个独立加速单元」变成「散落在 CPU、GPU 和内存路径上的一层」。
🧩 两年前就开始铺的生态
硬件只是半边。Arm 在 Mali G2-Ultra NX 亮相前两年就启动了 Arm Neural Technology 和开放的神经图形开发套件,让内容开发者、工具开发者和游戏引擎方能在硬件到位之前先把神经技术接进既有工作流。
现在的 Arm Neural Graphics Development Kit 提供 NSS 与 NFRU、面向 Vulkan 的机器学习扩展,以及包括 Unreal Engine 在内的主流引擎插件;另有 SDK 支持自研引擎集成,配套性能剖析、图形优化、训练和模型优化工具。
落地名单已经排出来。腾讯游戏把 Arm Neural Technology 集成进 MagicDawn,并与《暗区突围:无限》联合开发 NSSD 技术演示;Unity 中国宣布十月把该集成带进团结引擎的开发者工作流;网易《燕云十六声》的 Messiah 引擎在集成,引擎负责人周凯利称该作会是首批把 Arm 神经技术带给玩家的游戏之一;叠纸游戏的《无限暖暖》接入 NSS。芯片侧,小米宣布玄戒 O3 采用 Mali G2-Ultra NX。
📱 这件事的实际含义
对手机游戏,最直观的一条是 UE MegaLights 这类原本被视为移动端禁区的动态全局光照,现在能在手机上支持多达 1400 个动态光源且无需预烘焙。这是中文媒体对 Arm 媒体问答的转述,属于官方口径。
Arm 的边缘 AI 高级产品经理 Deyan Lazarov 在问答里的定位值得记:AI 不被视为传统渲染的替代品,而是补充和增强;未来硬件资源会持续向神经网络加速倾斜,同时保持对传统管线的演进。
🔍 需要打折的地方
所有性能数字都来自 Arm 内部测试,对比基准是上一代,测试窗口是 2026 年 3 月到 8 月。Mali G2-Ultra NX 是 IP,不是已经上市的芯片,真实表现要等搭载它的终端出来才知道。
另一个现实约束是接入颗粒度。开发者必须逐款游戏开启这些特性,没有能回溯适配所有已安装游戏的统一开关。Arm 的目标是已有游戏的集成周期缩短到 3 至 6 个月,全新作品压缩到 18 个月以内,这个目标本身也还没被验证。
NFRU 只插一帧、延迟优先,说明这条路目前仍受限于时间预算而不是算法。多帧生成的规划已经提出,落地时间未定。
可观察的三条线:小米玄戒 O3 机型实测数据;十月团结引擎的集成交付成色;以及联发科与高通的应对——两家都投了 AI 加速器,Arm 这次的卖点是把图形与神经矩阵工作统一在着色器集群里。
参考信源
1. Arm Newsroom《Inside the Arm Mali G2-Ultra NX GPU: Delivering desktop-class mobile gameplay with AI-native graphics》(2026-09-08,作者 Deyan Lazarov):三项神经技术、执行引擎、第三代光追、生态合作方引语。 2. Arm 产品页与新闻稿脚注:INT8/INT16 与光流加速、性能对比基准与 2026 年 3-8 月内部测试说明。 3. Unity 中国《携手 Arm,团结引擎加速 AI 原生图形能力落地》(2026-09-09):十月原生集成时间表与张俊波表态。 4. 腾讯新闻《Arm 发布 Mali G2-Ultra NX:AI 原生架构重新定义移动游戏上限》(2026-09-08):NFRU 单帧插入与延迟优先、三层带宽优化、UE MegaLights 1400 动态光源、小米玄戒 O3。 5. Arm 与 Sumo Digital 演示项目 Neural Dawn 公开材料:4 倍性能效率、70% 外部内存流量降低。
#图形学 #游戏引擎 #移动GPU