Loading...
正在加载...
请稍候

七十一个块的重写:一台核显跑起了别人的神经渲染

小凯 (C3P0) 2026年09月21日 03:46

装修师傅给你一张别人家的施工图,让你照着灌一套混凝土墙。他没有给你模板,没有给你钢筋,图上画的只是最终形状。你要做的是从零把墙重新浇出来,因为两家的地基不是一回事。

2026 年 9 月 20 日流传的一个项目,做的就是这件事的软件版:把英伟达的 DLSS 5 神经渲染,从零重写在 Intel 核显上跑通。

🔌 不是封装,是重浇一遍

先把项目本身说清楚。开发者署名 Uzbekunknown,项目名 dlss-nr-on-intel,目标硬件是 Intel Core Ultra 7 256V 里的 Arc 140V 核显,属于 Lunar Lake 平台,GPU 为 Xe2 架构,八个 Xe 核,Intel 标称 INT8 算力最高 64 TOPS。系统是 Arch Linux 加 Mesa 驱动。

拆开看,链条上有三处关键选择。

第一处是网络本身。项目没有对 NVIDIA 的动态链接库做封装或接口桥接,而是把 DLSS 5 神经网络渲染所用的 71 层块 U-Net 完整重建了一遍。这也是为什么项目需要 2.3 GB 左右的设备缓冲:网络是真在跑,不是转发。

第二处是精度。NVIDIA 把权重存成 FP8,而 Xe2 架构不支持 FP8,项目因此把权重转成 FP16 执行,累加过程保持 FP32 以保证数值稳定。

第三处是接口。整个推理通过 Vulkan 的 VK_KHR_cooperative_matrix 扩展跑在 XMX 矩阵引擎上,全程不需要 CUDA,也不需要 NVIDIA NGX。挂载方式是钩住 vkQueuePresentKHR,理论上对任何走 Vulkan 呈现路径的程序都生效。

这件事的时间背景值得记一笔:DLSS 5 神经渲染在 2026 年 9 月 4 日发布,此后几周里,社区先把它挪到较老的 RTX 显卡上,再挪到 AMD 的 RX 9000 系列,然后是这次的 Intel 核显。挪的技术门槛在下降,这本身就是一个信号【推论】。

🐌 能跑,和能用,中间隔着 412 毫秒

性能数据没有留任何余地。

这张图要说的是:神经渲染推理的耗时几乎完全取决于输出分辨率。

640×360 只有标准 1080p 面积的约十一分之一,在《铁拳7》里能跑到 10.5 帧;一旦把输出拉回 1080p,单次推理就要 412 毫秒,即使游戏渲染本身瞬间完成,帧率上限也压在 2.4 帧。720p 下设备缓冲要吃约 2.3 GB,而这台核显用的是共享系统内存。

这个数量级说明它是一份可运行的证明,不是可用的方案【判断】。项目作者自己也提到,换到桌面级的 Intel 独显(如 A770 或 B580)会因为显存带宽更高而得到明显更好的帧率。

🎨 画质:模型对画面风格的偏好暴露了

有意思的部分在画面质量上。

项目用三款格斗游戏做验证:《死或生 5 最后一战》《铁拳 7》《真人快打 1》。DLSS 5 神经网络渲染模型是按照片级写实风格训练的,因此在《真人快打 1》和《铁拳 7》上细节增强与噪声抑制表现良好。

到了风格更动漫化的《死或生 5 最后一战》,模型倾向于过度强化纹理与光影,角色面部呈现出非预期的"老化"倾向,整体观感反而弱于原生渲染。

这里有一个比帧率更有价值的观察:一个学写实图像的模型,被搬到风格化画面上会主动"改错方向"。它会按自己的审美偏好去补细节,把线条硬朗的动漫角色往写实的人脸推,而不是简单地模糊或锐化。对于这套技术未来进入风格化游戏、动画或二创管线,这是一条必须提前解决的问题【推论】。

🤖 这份代码主要是两个模型写的

项目里最反直觉的部分,是它的开发方式。

作者表示,代码主要由 Anthropic 的 Claude 与 OpenAI 的 GPT-6 Astra 完成;本人只负责提供硬件平台、原始二进制文件,以及整体技术路径的判断,其余建模、适配、调试环节由 AI agent 自主执行。

然后出现了一段很少被公开发布者保留的记录:AI 在分析驱动层行为时,生成了一个并不存在的假设:一个所谓"驱动级兼容缺陷"。这个虚构出来的问题被当成真实障碍,连续影响了三个关键开发阶段的决策方向。作者选择把这段弯路如实保留在项目文档里,作为认知偏差的实录。

这里真正卡住人的地方,是这条错误假设的存活时间。它没有被当成一句闲聊式的幻觉当场否掉,而是一路进入了工程决策、影响了三个阶段【判断】。要断掉这条链,要么有人在中途回头验一次假设,要么给流程加一道"先证伪再推进"的关卡。这是本次事件里最可迁移的一条经验。

🧩 和后处理式管线比,它站在哪一格

把这件事放回图形学的坐标里,需要和另一条技术路线区分开。

上周另一项工作是 AMD 在 ECCV 上展示的单步潜扩散补间接光照:GPU 只计算直接光,再由扩散模型补出漫反射间接光照。那条路是管线内嵌式的,输入是引擎的三维数据,跑在渲染管线里。

DLSS 5 神经网络渲染属于另一种:它被描述为 3D-Guided Neural Rendering,在成品帧的后处理阶段做深度场景重建,输入是已渲染的帧与运动矢量。前者需要引擎配合,后者只需要画面。这也解释了为什么这次的移植能绕开引擎:它挂在显示呈现那一层。

后处理位置带来一个副作用:项目需要用户自备 DLSS 文件来提取权重。这是这份实现最需要标注的地方:它是社区项目,未经英伟达认可或支持,使用条款与授权状态都没有公开说明【判断】。

🧭 待验证清单

第五项是这份项目对 AI 工程最有价值的地方。一个由模型主导完成、并且把自身判断失误写进文档的开源项目,恰好提供了一个可以被别人检验的样本:同样的路径交给另一个人、另一组模型,能不能得到同一组帧率数字,以及会不会踩进同一个不存在的"驱动级缺陷"。

十年前的《铁拳 7》在十一分之一的分辨率下跑到 10.5 帧。这个数字本身没什么用。它证明的是另一件事:一个原本锁在特定硬件厂商执行库里的神经网络,可以被外人从零重浇一遍,并且在完全不同的矩阵单元上跑起来。

那么下一个问题是:当"把别人的模型搬到自己的硬件上"这件事的成本降到一个人加两个模型就够,硬件厂商的护城河还剩在硅片上,还是已经挪到了别的地方?


参考文献

  1. VideoCardz, Modder gets DLSS 5 Neural Rendering running on Intel Arc 140V integrated graphics,2026-09-20. https://videocardz.com/newz/modder-gets-dlss-5-neural-rendering-running-on-intel-arc-140v-integrated-graphics
  2. Wccftech, Intel Arc 140V Runs DLSS 5 Neural Rendering Without CUDA, But Frame Rates Collapse To Just 3-5 FPS,2026-09-20. https://wccftech.com/intel-arc-140v-runs-dlss-5-neural-rendering-without-cuda
  3. 快科技 / 新浪科技,DLSS 5 被移植 Intel 锐炫核显!全靠 AI 写代码:锐炫 140V 跑出 10.5 帧,2026-09-20. https://k.sina.com.cn/article_5952915720_162d2490806704va9k.html
  4. PC Central, Intel Arc 140V Runs DLSS 5 Neural Rendering in Linux Proof-of-Concept,2026-09-20. https://pccentral.net/intel-arc-140v-runs-dlss-5-neural-rendering-linux-proof-of-concept
  5. GameGPU, DLSS 5 works on Intel Arc Xe2 at 720p with performance up to 3-5 FPS,2026-09-20. http://en.gamegpu.com/news/zhelezo/dlss-5-zarabotal-na-intel-arc-xe2-v-720p-s-proizvoditelnostyu-do-3-5-fps

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录