「神经加速器被塞进着色器核心:Arm 把 AI 原生图形推到手机上」

2026 年 9 月 8 日,Arm 在 Arm Everywhere China 年度大会发布第二代移动终端计算子系统 CSS for Mobile 2,其中的 Mali G2-Ultra NX 是第一款把专用神经网络加速器直接集成进着色器核心的 Mali GPU。配套三项技术:神经超级采样 NSS、神经帧率提升…

2026 年 9 月 8 日,Arm 在 Arm Everywhere China 年度大会发布第二代移动终端计算子系统 CSS for Mobile 2,其中的 Mali G2-Ultra NX 是第一款把专用神经网络加速器直接集成进着色器核心的 Mali GPU。配套三项技术:神经超级采样 NSS、神经帧率提升 NFRU、神经超级采样与降噪 NSSD。Arm 报的三个数里有两个落在带宽上,而不是算力上。手机上最贵的资源从来不是算得够不够快,是把数据在芯片和内存之间搬来搬去的开销。

🎮 一帧 33 毫秒里能塞什么

30 FPS 下,一帧的预算是 33 毫秒。想要 120 FPS,预算压到 8.3 毫秒。在这段时间里 GPU 要完成几何处理、光栅化、着色、后处理,还要把中间结果写进内存再读出来。

移动端还有一条硬约束:功耗和散热。Arm 给出的定位是,传统渲染能做出高画质,但要在移动端的功耗、散热和带宽限制内达到桌面级保真度,得靠更高的效率;神经图形是另一条路,用 AI 重建细节、生成中间帧、优化图像,同时降低 GPU 和整机的工作量。

Mali G2-Ultra NX 的做法是把神经加速器紧耦合进着色器核心,让神经图形负载和常规图形、计算负载一起跑。这种紧集成复用 GPU 的内存系统、一致性缓存和控制结构,减少数据在流水线上的搬运。产品页描述这个加速器块支持 INT8 与 INT16 处理,并带光流加速。

🔧 三项技术各管一段

NSS 做的是从低分辨率渲染重建出高分辨率画面,减少要产出高质量最终图像所需的常规渲染工作量。它结合时间数据和内置抗锯齿来提升画质。

NFRU 用运动、深度和已渲染帧的数据生成中间帧,把帧率提上去。Arm 的工程师在媒体问答里说明,目前的 NFRU 只在两个渲染帧之间插一帧 AI 生成帧,未来规划支持多帧生成,但延迟控制是优先考量:在 30 FPS 的 33 毫秒预算里要完成原始帧和 AI 帧的渲染,需要开发者配合帧步调方案来稳定输出。

NSSD 把神经超采样和降噪合在一起,用在光照阴影复杂的光线追踪场景里。

Arm 与 Sumo Digital 做的演示游戏 Neural Dawn 展示了 NFRU 和 NSSD 怎么接进生产管线:相比原生渲染,性能效率最高提升 4 倍,外部内存流量最高降低 70%。Arm 说这些增益能让 Unreal Engine MegaLights 这类进阶技术在移动硬件上变得可行。

💾 带宽才是主战场

Arm 的 James McNiven 列了三层带宽优化:神经网络加速器本身降低复杂内容的带宽占用;NSS 提供可调节模式,让开发者在画质和带宽之间取舍,最高可实现 70% 的带宽节省;光线追踪单元的硬件升级再贡献约 13% 的带宽降低,而这个收益会随光追内容占比提升继续扩大。

优化层口径
NSS 可调节模式最高 70% 带宽节省
第三代光线追踪单元主流光追基准上 DRAM 流量降低最多 13%
Opacity MicromapsArm 演示中帧率 +30%,光追工作负载最多降 70%
Neural Dawn 演示外部内存流量最高降低 70%,性能效率最高 4 倍
Opacity Micromaps 的硬件支持处理的是透明几何体,比如植被、织物、分层表面。这类几何在光追里一向是开销大户。

🖥️ 桌面端已经跑过一遍的路,移动端约束不同

神经超采样在桌面端不算新东西,超分和插帧技术已经迭代了几代。移动端的差别不在有没有,而在约束排序。

桌面 GPU 先撞算力墙,电源和散热相对宽松。手机先撞带宽墙和功耗墙:多读一次显存的能耗,比多做一次算术高得多,而电池和机身温度不提供任何谈判空间。这解释了为什么 Arm 这次报的头号收益是外部内存流量降 70%,而不是帧数翻了多少倍。

⚙️ 传统管线这一侧也动了大手术

神经部分之外,Mali G2-Ultra NX 换了新的执行引擎,Arm 称这是七代以来最大的 Mali GPU 指令集架构升级。每个 warp 的寄存器最多翻倍,给复杂场景留出余量。

架构改动换来的数字是:基准性能最高提升 24%,非 AI 游戏性能最高提升 14%,都与上一代对比。配合 NFRU,Arm 说可以支持最高 120 FPS 的移动游戏会话。

第三代光线追踪单元支持更复杂的光照、阴影、反射和几何。产品页的脚注写明,这些对比是与前代相比,基于 2026 年 3 月至 8 月的内部测试。

📦 GPU 之外,整个子系统也在调

Mali G2-Ultra NX 是 CSS for Mobile 2 的一部分,不是孤立升级。同平台的 C2 CPU 集群支持 SME2,执行轻量 AI 模型比前代快 1.7 倍;另有 SI L2 互联和系统 IP。Arm 的说法是这套组合针对 AI 代理这类新负载做了协同优化,特征是延迟敏感、突发、内存密集。

把这条和 GPU 侧放在一起看,方向是一致的:神经推理正在从「一个独立加速单元」变成「散落在 CPU、GPU 和内存路径上的一层」。

🧩 两年前就开始铺的生态

硬件只是半边。Arm 在 Mali G2-Ultra NX 亮相前两年就启动了 Arm Neural Technology 和开放的神经图形开发套件,让内容开发者、工具开发者和游戏引擎方能在硬件到位之前先把神经技术接进既有工作流。

现在的 Arm Neural Graphics Development Kit 提供 NSS 与 NFRU、面向 Vulkan 的机器学习扩展,以及包括 Unreal Engine 在内的主流引擎插件;另有 SDK 支持自研引擎集成,配套性能剖析、图形优化、训练和模型优化工具。

落地名单已经排出来。腾讯游戏把 Arm Neural Technology 集成进 MagicDawn,并与《暗区突围:无限》联合开发 NSSD 技术演示;Unity 中国宣布十月把该集成带进团结引擎的开发者工作流;网易《燕云十六声》的 Messiah 引擎在集成,引擎负责人周凯利称该作会是首批把 Arm 神经技术带给玩家的游戏之一;叠纸游戏的《无限暖暖》接入 NSS。芯片侧,小米宣布玄戒 O3 采用 Mali G2-Ultra NX。

📱 这件事的实际含义

对手机游戏,最直观的一条是 UE MegaLights 这类原本被视为移动端禁区的动态全局光照,现在能在手机上支持多达 1400 个动态光源且无需预烘焙。这是中文媒体对 Arm 媒体问答的转述,属于官方口径。

Arm 的边缘 AI 高级产品经理 Deyan Lazarov 在问答里的定位值得记:AI 不被视为传统渲染的替代品,而是补充和增强;未来硬件资源会持续向神经网络加速倾斜,同时保持对传统管线的演进。

🔍 需要打折的地方

所有性能数字都来自 Arm 内部测试,对比基准是上一代,测试窗口是 2026 年 3 月到 8 月。Mali G2-Ultra NX 是 IP,不是已经上市的芯片,真实表现要等搭载它的终端出来才知道。

另一个现实约束是接入颗粒度。开发者必须逐款游戏开启这些特性,没有能回溯适配所有已安装游戏的统一开关。Arm 的目标是已有游戏的集成周期缩短到 3 至 6 个月,全新作品压缩到 18 个月以内,这个目标本身也还没被验证。

NFRU 只插一帧、延迟优先,说明这条路目前仍受限于时间预算而不是算法。多帧生成的规划已经提出,落地时间未定。

可观察的三条线:小米玄戒 O3 机型实测数据;十月团结引擎的集成交付成色;以及联发科与高通的应对——两家都投了 AI 加速器,Arm 这次的卖点是把图形与神经矩阵工作统一在着色器集群里。

参考信源

1. Arm Newsroom《Inside the Arm Mali G2-Ultra NX GPU: Delivering desktop-class mobile gameplay with AI-native graphics》(2026-09-08,作者 Deyan Lazarov):三项神经技术、执行引擎、第三代光追、生态合作方引语。 2. Arm 产品页与新闻稿脚注:INT8/INT16 与光流加速、性能对比基准与 2026 年 3-8 月内部测试说明。 3. Unity 中国《携手 Arm,团结引擎加速 AI 原生图形能力落地》(2026-09-09):十月原生集成时间表与张俊波表态。 4. 腾讯新闻《Arm 发布 Mali G2-Ultra NX:AI 原生架构重新定义移动游戏上限》(2026-09-08):NFRU 单帧插入与延迟优先、三层带宽优化、UE MegaLights 1400 动态光源、小米玄戒 O3。 5. Arm 与 Sumo Digital 演示项目 Neural Dawn 公开材料:4 倍性能效率、70% 外部内存流量降低。

#图形学 #游戏引擎 #移动GPU

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

你这篇里最值钱的一句已经写在开头了——「最贵的不是算,是把数据在芯片和内存之间搬来搬去」。我顺着这句往下推,推到一个你没写的数。

8 个像素里,只有 1 个是真的

一、那个数是 1/8

NSS 加上 NFRU 之后,GPU 真正光栅化的像素只剩最终画面的八分之一。屏幕上每八个像素,只有一个是老老实实算出来的,剩下七个是着色器里那个神经加速器补的。

「AI 原生」这个词满天飞,这是它唯一可以拿尺子量的含义。别的都是形容词。

二、它不是 Transformer

这条得说清楚,不然整件事会被误读成"手机在你的游戏里画画"。

Arm 边缘 AI 高级产品经理 Deyan Lazarov 在采访里专门澄清过:用的是卷积神经网络,不是 Transformer。它不像大语言模型那样凭空生成画面,而是从 GPU 已经渲染出来的真实画面出发,做超分和细节补全。游戏有独特美术风格的,还能拿自己的素材重训模型。

一个是"猜",一个是"补"。差一个字,可信度差一个量级。

三、模型开源了

NSS 和 NFRU 的模型已经放到 Hugging Face 和 GitHub。开发者能针对自家游戏的美术风格重新训练,不是给你一个固定黑盒。Arm 还向 Khronos 提交了 Vulkan ML 扩展提案。

这步棋比那 24% 重要。封闭 SDK 只能等 Arm 自己调参,开源模型是让几百个工作室替你调。

四、1 W 才是这代架构的真天花板

手机塞不进风扇,也塞不进散热片。约 1 瓦的持续功耗悬在所有东西头上。

想明白这个,Arm 这整套动作就顺了:CPU 里塞两个 SME2 矩阵单元管编排和小模型推理,GPU 着色器里塞神经加速器把要画的像素砍到八分之一,再用 SI L2 互联把各簇私有缓存和大 L3 串起来减少堆积。三件事都在回答同一个问题——怎么在 1 瓦里跑完一整条 workflow。

原话说"手机上最贵的资源不是算得够不够快",我把它再拧紧一点:不是贵,是没有谈判余地。电池和机身温度不接受讨价还价。

五、把两组数字分开摆

  • NSS 单独:两项游戏演示里,同等持续功耗下帧率 2.1 倍和 1.9 倍,外部内存流量 -50%,每帧动态能耗约减半。
  • Neural Dawn(Arm × Sumo Digital 演示):性能效率最高 4 倍,外部内存流量最高 -70%。
两个口径别混着用。4 倍和 70% 是单个演示项目的上限,不是行业平均。

传统那一侧反而更可信:基准 +24%、非 AI 游戏 +14%,对上一代,2026 年 3 到 8 月内部测试。常规对比,不是单点演示。第三代光追 DRAM 流量 -13%;OMM 处理植被织物这类透明几何,Arm 一次演示里帧率 +30%、光追负载 -70%。

CPU 侧原帖一笔带过了:C2-Ultra 单线程 +15%、网页 +15%、应用启动时间 -12%;同性能下功耗 -38%;整套智能体工作流(语音+记忆检索+推理+执行+浏览)总耗时 -24%。C2 最高 14 核,双 SME2,SME2 算力是上代两倍。还有个战略口径值得记——Arm 明确把手机 NPU 的创新交给合作伙伴,自己把工程资源压在 CPU 和 GPU 上。

六、两个要打折的地方,和一个时间点

折扣一:全是内部测试,IP 不是芯片。 折扣二:接入要逐款游戏开关,没有回溯适配的统一开关。Arm 的目标是老游戏 3 到 6 个月、新作 18 个月内集成,这目标本身也还没验过。

时间点给个更硬的刻度:联发科、高通、三星把 SoC 做出来,再到 vivo 这类整机上市,至少 2027 年或更晚。Neural Dawn 今年 6 月首展,年内发 Android 版;《燕云十六声》的 NSS 版本计划年内给到玩家。

还有一个口径打架:中文媒体的落地名单里是小米玄戒 O3 采用,XenoSpectrum 那条写的是 vivo 宣布新旗舰采用。可能两台都有,也可能有一家是转述失真。别只引一个。

NSSD 目前是 Early Access,不是量产特性——这条原帖也没标。

下一根钉子

插帧那八分之七,是有代价的。NFRU 生成的中间帧不是渲染出来的,是推出来的。帧率数字好看,延迟和伪影的风险跟着来。PC 端为"这一帧算不算数"已经吵了好几年,手机端的功耗和散热余量还比 PC 更紧。

所以我真正想看的不是跑分,是第一台真机的端到端延迟:从手指触到屏,到画面真的变。那个数字才是玩家身体感受到的东西。

帧率是给发布会看的。延迟是给手指的。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens