0.56 FPS 这个数字让我停下来想了一下。
我家里没有 H200,但我知道 30 FPS 是基本盘。0.56 是什么意思?一秒不到一帧。这意味着原版 AlayaRenderer 的「生成式世界渲染」,每一帧的推理时间比 1.8 秒还长。在游戏里,玩家按一下右键,等将近两秒才能看到角色转头——这根本不是游戏,这是逐帧播放的 PPT。
而 AlayaRenderer-Flash 把它压到了 31.54 FPS,单张 H200 上跑通,56 倍加速。这不是「变快了」,这是从研究 demo 走到了可玩。
论文最让我意外的不是速度提升本身,而是没有用任何新架构。没有新的 transformer 变体、没有新的损失函数、没有新的数据集。全是已有方案的工程深化:
- 三阶段蒸馏:把 CFG 引导蒸馏进学生权重(每步一次评估而非两次)+ 50→32→16→8→4 步渐进缩减 + Mean Flow Distillation 配轻量 GAN 头
- 轻量 codec:把 Wan VAE 的 5 次独立编码换成单次前向传播;TAEHV 风格的 Tiny Decoder 用 Wan 2.1 权重初始化再蒸馏
- 自回归流式:从「21 帧双向窗口」改成「每 chunk 4 帧 + 上一 chunk 潜变量作为历史」,无限长生成成为可能
- 三级历史压缩 + 持久文本 sink:最新帧全保真、稍远帧中间粒度、最远帧最粗表示、首帧作为全局锚点,配合风格提示的持久 KV 项实现 637 帧在线风格切换无鬼影
但真正的关键实验是 SuperTuxKart 的端到端部署:玩家在开源卡丁车里实际开车,通过文本提示在线切换赛博朋克 / 火山 / 沙尘暴 / 北极 / 蒸汽波 / 圣金 / 深海 / 红外 8 种视觉外观,游戏不中断,过渡平滑无边界伪影。这是「生成式世界渲染 + 真实游戏 + 在线提示切换」三件事第一次同时在工程上跑通。
接下来 12 个月要追的不是 AlayaRenderer 本身,而是两条神经渲染路线的汇合:
- NVIDIA DLSS 5 的「3D-Guided 神经渲染」——用 3D 数据约束着色,速度天花板更高但灵活度有限
- AlayaRenderer 的「G-buffer 输入生成式渲染」——用全画面生成外观,灵活度天花板更高但显存压力大
但这些都不影响主旋律:
> 2026-08-10 之前,神经渲染是研究问题;之后,是工程问题。AlayaRenderer-Flash 证明了「实时性瓶颈可以通过纯工程路径突破」——这件事给所有「神经渲染产业化」画了一条分水岭。接下来 12 个月,看 Unity / Unreal / Godot 哪家先在 2026 Q4 - 2027 Q1 推出「生成式外观通道」SDK,谁就把「AI 时代的游戏引擎」入场券拿到了手里。