你坐在房间里想一件事:为什么墙角的阴影是柔的,而不是硬边。因为光不是只在灯泡和物体之间走一次:它打到墙上、天花板、桌面上,再弹回来,一次、两次、很多次。你看到的柔和感,绝大部分来自那些你根本没看见的光线。
现在每个像素要发射几十条光线去追这些弹射,还得去噪。AMD 在 ECCV 上展示的研究换了一条路:GPU 只算直接光照,一次弹射都不算,剩下的漫反射间接光照交给一个单步潜扩散模型现场补上。 论文给出的对比是,复杂间接光照的计算量相比不带降噪的纯硬件光线弹射快约 3 到 5 倍。
💡 先量一下「弹一次」有多贵
路径追踪的原理不难讲:从相机往场景里打光线,碰到物体后按材质随机反弹,一直弹到撞上光源。弹的次数越多,画面越接近物理真实。
难点在于噪声。为了消除噪声,硬件路径追踪往往要求每个像素计算几十条光线,而每一条光线都要算几何求交,也就是判断这条线打到了哪个三角形。这是整个渲染管线里最贵的一类运算。
AMD 的切入点是砍掉中间那串弹射:只算零次弹射的直接光照,剩下的补。
🧠 那台「补光」的机器长什么样
按 ECCV 上公开的研究内容,这套方案的核心是一个单步潜扩散模型,任务是实时光照的生成式计算。
它的工作方式是:GPU 算出只含直接光照的图像,神经网络负责把漫反射的间接光照补齐。为了让结果在连续帧之间不抖,研究用了空间适配器加变分自编码器的组合,目标是严格的时域稳定性,同时不出现几何退化,也就是画面不该被「猜」出原本不存在的结构。
速度来自两件事。一是数学上省掉了几何求交这类重计算,改成低精度的矩阵张量运算。二是这些张量运算用 FP8 和 FP16 精度跑在 RDNA 4 架构的硬件单元上,效率最高。按原文的表述,单步扩散的执行时间在毫秒量级。
这里必须标清楚两条边界。第一,3 到 5 倍这个数字是相对于不带降噪器的纯硬件光线弹射计算得出的,不是相对于完整生产管线的端到端帧时间;第二,这是研究项目,不是已经发布的驱动功能。
📍 位置的区别:在管线里,还是在帧上面
这项研究真正值得琢磨的地方,不是快了多少,而是它插在哪一层。
GPUOpen 上的技术文档表明,AMD 的方向是把生成式渲染算法深度集成进图形管线本身,而不是在画好的成品帧上叠一层后处理滤镜。官方研究文章《Lightweight attention-based indirect illumination》讲的就是这个思路:用轻量级注意力机制处理间接光照,由 AI 实时计算全局光照。
两者的差别在信息来源。后处理式方案的输入是一张已经画好的二维图,神经网络要从结果里反推光照是怎么形成的;管线内嵌式的输入是场景生成阶段就在用的底层数据:深度缓冲区、材质属性、精确的几何坐标。一个是从成片猜拍法,一个是拿着拍法去拍。
| 对比维度 | 后处理式重建 | 管线内嵌式重建 |
|---|---|---|
| 输入 | 已渲染的二维帧 | 引擎的三维原始数据 |
| 需要重构的对象 | 光照、材质、色调一起 | 主要只剩间接光照 |
| 设计意图的保留 | 靠网络猜测 | 使用原始数据,偏差更小 |
| 主要风险 | 伪影与风格漂移 | 与引擎耦合更深,落地依赖适配 |
这张表要说的其实是一条:输入越原始,需要神经网络「猜」的东西越少,但代价是与引擎的绑定越紧。
🕵️ 传闻那一层要单独放
在官方研究之外,9 月 16 日前后还有一条流传很广的爆料,来源是硬件爆料人 Kepler_L2 在 AnandTech 论坛的发帖。这条没有得到 AMD 官方确认,技术细节仍处于爆料阶段。
按他的说法,AMD 正在为下一代 RDNA 5 架构开发自研的神经渲染技术,可能的正式名称叫「Neural Lighting」;这套东西不只分析已渲染的二维画面,而是直接读取引擎内部的深度缓冲、材质属性和几何坐标,还能处理摄像机视野之外物体的光影;由于复杂神经渲染模型的运行成本极高,它极大概率由 RDNA 5 独占。
爆料里有一组数字很能说明量级:有发烧友尝试通过模组,在 RDNA 4 显卡(如 RX 9070 XT)上跑类似的神经渲染模型,结果是游戏帧率迅速跌到 20 帧以下,甚至低到十几帧。这与官方研究能在 RDNA 4 上跑出加速并不矛盾,研究场景是受控的、单步的、目标明确的;把同类模型塞进一个真实游戏的完整管线里,是另一回事。
还有一层延伸猜测:如果下一代 Xbox Project Helix 与 PS6 采用 RDNA 5 架构,两款主机可能具备类似能力。这个推测的前提是主机先用上 RDNA 5,而 AMD 与两家主机厂商都没有正式公布相关方案。
把这两层分开放,是因为它们对判断的用处完全不同。已确认的部分告诉我们技术方向在往哪走:从「修图」往「参与生成」。未确认的部分告诉我们工程约束有多硬:算力不够就是跑不动,而这条约束恰恰解释了为什么它会先出现在下一代架构上。
🧩 真正的难点不在快,在稳
渲染领域的 AI 方案有一个反复出现的失败模式:单帧看很美,动起来就露馅。
AMD 研究里的空间适配器与变分自编码器,针对的是第一项;「不出现几何退化」是明确的自我约束,对应第二项;而使用引擎提供的原始几何与材质数据,正是第三项的解法,因为美术在引擎里设定的东西,不会经过一次「猜」的过程。
对玩家来说,帧率稳不稳有时比画面多几个细节更实在。这也是为什么这套方案强调的重点之一是维持稳定帧率,而不只是峰值画质。
🎓 那台机器是怎么学会补光的
扩散模型用在渲染上不算新事,难的是训练数据从哪来。
这类模型吃的是配对样本:同一份场景几何,一份是只有直接光照的图像,一份是包含完整间接光照的离线渲染结果。后者只能用传统路径追踪慢慢算,代价高,好处是它物理正确。网络要学的,就是从前者到后者的映射。
这个流程决定了三件事。
真值的质量上限就是模型的质量上限。离线渲染本身如果带噪,网络学到的就是一个有偏的映射,而这类偏差会均匀铺满整个画面,比单帧噪声更难被察觉。
泛化是更大的考验。训练用的场景和玩家实际跑的场景不会重合,一个新的房间布局、一种没见过的材质组合,都可能让模型给出错误的光照。单步扩散只做一次前向计算,省掉了迭代采样的时间,也一并省掉了逐步修正的机会。
还有一层耦合值得记住:模型的输入包含引擎给的几何与材质数据,那么换了引擎、换了美术的资产组织方式,模型就要重新适配。这是它比后处理式方案更强的原因,也是它比后处理式方案更难铺开的原因。
| 训练环节 | 需要什么 | 主要代价 |
|---|---|---|
| 真值生成 | 高样本数离线路径追踪 | 离线计算成本高 |
| 泛化能力 | 覆盖多场景与多材质 | 分布外场景容易出错 |
| 引擎适配 | 与引擎的接口约定 | 换引擎需重新适配 |
| 时域稳定 | 连续帧的一致性约束 | 抑制闪烁的额外开销 |
⚔️ 和对手的路线差异
把 AMD 的这套思路和英伟达的 DLSS 5 放在一起比,是目前社区讨论最多的一件事。需要说明的是,下面关于 DLSS 5 的实现描述来自爆料方的转述与媒体归纳,其中一部分细节并未由英伟达以技术文档形式公开确认。
按这些转述,两者的差别在输入端:DLSS 5 更侧重通用的屏幕空间模型,在开发者与美术提供输入的前提下,对已经渲染完成的画面做调整;AMD 的方案被描述为直接处理引擎提供的三维数据,而不是把最终二维画面作为主要分析对象。
这个差异现在只能算一个有道理的推断,不是已经分出胜负的结论。实际效果、两套方案的差距、以及各家引擎的适配成本,都得等产品发布和独立测试之后才有答案。
❓ 值得盯的几件事
社区里目前讨论最热的是「面向开发者的开放库即将可用」这个说法:如果 DirectX 12 与 Vulkan 侧真的放出可用的库,那么这类渲染方式会不会扩散到更广的显卡区间,就是一个能被验证的问题,而不是一句预期。
另一个更长期的看点是这条路线把渲染管线推向了哪里。如果间接光照可以由网络在毫秒内补出来,那么引擎里原本为「省弹射次数」而做的大量设计,比如烘培光照贴图、预计算传输、各种近似,存在的理由会被重新评估。这件事对游戏工业的影响,可能比某个画质开关大得多。
📚 参考来源
- GameGPU《AMD unveiled a neural Path Tracing for RDNA 4 with 5x acceleration》,2026-09-16 — https://en.gamegpu.com/news/zhelezo/amd-pokazala-alternativu-path-tracing-dlya-rdna-4-rabotayushchuyu-v-5-raz-bystree
- GPUOpen 研究文章《Lightweight attention-based indirect illumination》,AMD,2026
- 腾讯新闻 / 快科技《A 卡也要玩 AI 光追!AMD RDNA 5 神经光照技术曝光:对标 DLSS 5》,2026-09-16 — https://news.qq.com/rain/a/20260916A0AR9L00
- 游民星空《曝 AMD 版 DLSS 5 酝酿中!有望实装下代主机平台》,2026-09 — https://www.gamersky.com/news/202609/2210875.shtml
- 网易《AMD 的 FSR 5 要读游戏引擎底层数据?这思路和 DLSS 不太一样》,2026-09-16 — https://www.163.com/dy/article/L6VOU69K05561FY3.html
#图形学 #游戏引擎 #神经渲染
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。