30 系帧生成实测:40 帧上 100,代际墙原来是软件墙

dlssg_for_sm86(github.com/sdli1995/dlssg_for_sm86,★4102,09-07 创建)——在 RTX 30 系(SM86)和 RTX 20 系(SM75)上启用 NVIDIA 官方 DLSS 帧生成。NVIDIA 官方把 DLSS-G 锁在 40 系以上,这个插件用代理 D…

dlssg_for_sm86(github.com/sdli1995/dlssg_for_sm86,★4102,09-07 创建)——在 RTX 30 系(SM86)和 RTX 20 系(SM75)上启用 NVIDIA 官方 DLSS 帧生成。NVIDIA 官方把 DLSS-G 锁在 40 系以上,这个插件用代理 DLL 内嵌原厂运行库、向游戏改报 RTX 50 架构,绕过检查直接跑原版帧生成内核。作者实测口径:0.3.2 版起,RTX 3080 Ti 的生成画面与 RTX 5070 逐位相同——不是模拟,不是近似,是同一个内核跑出来的同一份输出。

以下是上手实测(本机 30 系实测,供参考):

其实一开始没测试的时候,我个人对于 20 系和 30 系用帧生成的评价是「锦上添花而已,无法雪中送炭」。实际测试下来以后,个人认为对 30 系的提升还蛮大。

特别是在原本没有帧生成的时候,画质拉高以后 40~50 帧属于「硬玩可以、玩起来很难受」的帧数。现在开了帧生成,原本的 40~50 帧开个 X2 直接变成 70~80 帧,开个 X3 直接上 100 帧。而且因为帧生成绑定 Reflex,你会神奇地发现:某些默认关闭 Reflex 的游戏,开了帧生成以后不仅帧数高了,甚至 PCL 延迟都大幅降低。

不过我认为目前 30 系里提升最大的是 3080 和 3080 Ti,毕竟显存更充足。3070 因为 8G 显存受限制会很严重——帧生成本身也要占一定的显存。

插件大部分游戏安装起来相对简单,小白看一眼基本能学会,只是部分游戏需要折腾一下,比如替换注册表什么的。另外注意:最好不要在带反作弊的网游里用,万一被判定成外挂就不好玩了。


本号补充核对(海关视角,发布前已对照 README 与仓库):

TA 的实测与 README 官方口径全部对得上,几处 README 里的硬货值得展开:

一,「逐位一致」是这份答卷最硬的部分。0.3.2 重写了推理内核(310.9 版运行库),实测 3080 Ti 与 RTX 5070 输出逐位相同,2080 Ti 的输出与 3080 Ti 逐位相同——同一份输入,20 系、30 系、50 系吐出同一个比特流。优化也分四档明码标价:Optimized=0 原厂内核不加速;1 加速但仍逐位一致(出厂默认);2 开有损图像内核,PSNR 50dB 以上;3 全有损最快。无损与有损的边界写在配置文件里,不藏在宣传页里。

二,显存账有官方表格。帧生成自身的增量只随输出分辨率变化,与倍率无关——2X 和 6X 占用相同:1080p 约 350 MiB,1440p 约 540 MiB,4K 约 810 MiB。3070 用户可以拿这个表算账:游戏本体 + 超分 + 350~540 MiB 之后还剩多少,比「8G 会受限」的体感更精确。这也是为什么作者说 3080(10G)/3080 Ti(12G)提升最大——账算得过来。

三,倍率上限:2X/3X/4X 默认,310.9 版运行库支持 6X(需游戏自带插件支持 Dynamic MFG)。20 系 2080 Ti 实测可用,生成画面同样逐位一致,性能数据作者还没测。

四,路线区分:这不是 Nukem「dlssg-to-fsr3」那条换算法的路(用 AMD FSR3 的帧生成顶替 DLSS-G),而是原装内核 + 绕过代际检查。DLSS-G 的 CUDA 内核本来就能在 30 系的光流加速器上跑,挡在中间的只是一行架构判定。作者声明内核优化已到现阶段最优,后续重心是 Transformer 超分模型的 INT8 优化——目标是拉高 20/30 系的基础帧率,也就是提高被插帧的「真帧」。

反作弊提醒原文保留:单机随便折腾,带反作弊的网游别用,被判定外挂不值得。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens