有人把英伟达DLSS 5的神经渲染网络完整复刻了出来。GitHub项目OpenDLSS-NR用Vulkan重写了DLSS-NR build 310.8.0的71模块Swin/ViT网络,宣称与原版逐字节一致:不仅最终图像相同,全部75个模块边界的中间结果也逐字节对齐。项目采用MIT协议,已收获683颗星、59个复刻。作者宣称复刻的精确度达到中间结果逐字节对齐,而非仅最终图像相似,75个模块边界全部比对通过,这是项目最硬核的技术声明。
网络本体是一个带全局ViT的U形移位窗口Transformer:6个池化层级、71个模块,FP8激活、FP16累加,权重141MiB。它是英伟达所说的生成式神经渲染网络:重渲染引擎已画好的帧,从注入噪声中生成细节,并按风格设置调整色调、结构与皮肤。输入输出同分辨率,它不是超分器。网络每次取一帧低动态范围代理图像,叠加三通道高斯噪声与上一帧重投影结果,输出四通道残差。
浏览器移植版同样逐字节一致,无需张量核心
除了Vulkan主实现,项目还提供第二个独立实现:在浏览器里跑的WebGPU移植版。同一组字节在浏览器中执行,不用张量核心、不用FP8、模块间不做融合,精确性来自规范本身而非硬件。代价是速度:512x512下WebGPU版需72毫秒,而Vulkan版仅2.7毫秒,差距接近27倍。移植版的意义在于证明:精确性来自对规范的忠实实现,而不依赖特定硬件加速,这种跨硬件的一致性在逆向工程领域相当罕见。
性能数据在RTX 4070 SUPER上测得,取40帧最小值,全网每帧241次dispatch:768x768为2.8毫秒,1920x1080为7.8毫秒,2560x1440为12.6毫秒,3840x2160为29.3毫秒。需要注意,仓库不提供权重与比对夹具:用户需自备模型目录,网络只接受71模块的310.8.0计算图。作者还提供了校验工具,可对原始捕获做一致性比对。需要注意的是,模型权重与比对夹具都不在仓库中,用户需要自行准备符合清单格式的模型目录。
运行门槛不低,需要Ada架构显卡与特定Vulkan扩展
运行要求Windows系统、英伟达Ada或更新架构显卡,以及暴露特定协作矩阵与FP8扩展的驱动。构建链用glslang 16.6.0、Vulkan-Headers v1.4.363等固定版本,无需安装Vulkan SDK;演示程序基于Filament 1.77.0打补丁,构建约需15分钟与6GB空间。工具链全部固定版本并可一键下载,无需安装完整的Vulkan SDK,演示程序支持glTF场景加载与交互式控制,方便研究者做可视化验证。
这类干净复刻项目的价值在于可验证性:配套工具提供性能测试、逐dispatch计时、一致性比对与逐内核二分定位四种模式。对图形开发者而言,它把黑盒的神经渲染管线变成了可以逐字节审计的开放实现,研究价值很高。对想理解神经渲染管线内部机理的开发者来说,这是一个难得的开放参照实现。