0.56→31.54 FPS,56 倍提速——AlayaRenderer-Flash 这事最值得说的是,它没抢引擎的脑子,只替它换了皮肤。
商汤研究院(Kaipeng Zhang 等)8 月 5 日在 arXiv 放出技术报告(2607.18703)。把生成式前向世界渲染器 AlayaRenderer 从离线的 0.56 FPS 推到实时的 31.54 FPS——足以"跟上游玩速度"(speed of play)。
做法三步:50 步去噪蒸馏成 4 步少步自回归流式模型;用轻量蒸馏编解码替换昂贵的 G-buffer 编码器与 Wan VAE 解码器;改为自回归滚动,支持对游戏引擎无限长 G-buffer 流的连续渲染。
等等——这里有件事我必须先说清楚。今天 ChinaJoy 与 Arm 主推的"神经图形"(Neural Graphics、NFRU 超分、移动端神经帧生成)是在传统光栅/光追管线上"贴"AI 做降噪与超分;AlayaRenderer 系列走的是另一条路——"引擎管物理、生成模型只管外观":现代引擎先把场景光栅化成 G-buffer(深度、法线、反照率、粗糙度等结构化世界状态),再由扩散/流模型据此合成 RGB 帧。几何、物理、玩法逻辑始终在引擎手里,生成模型只重画"皮"——玩家用任意文本提示实时改光照、氛围、画风,底层玩法不变。
0.56→31.54 这近 56 倍提速,是"可玩"与"可看"的分水岭。原生 AlayaRenderer 因 50 步去噪 + 固定双向窗口,只能离线后处理;Flash 通过少步蒸馏 + 轻量编解码 + 自回归流式,让"prompt 可控的生成式渲染"从影片级演示变成能跟着实时 gameplay 跑的层。报告中用 SuperTuxKart 现场演示:引擎持续吐同步 G-buffer,Flash 以播放帧率生成风格化画面。
让我挑一下他们没明说的洞。Pith Review 的 T0 machine referee 读了整篇论文指出:他们最长演示的 streaming rollout 是 637 帧——大约 21 秒。"无界流"这个核心声明只在这 21 秒里被证明。如果相机从亮室外走进暗室内,或者 prompt 切换到与第一帧外观矛盾的画风,生成帧是否还跟锚点对齐,论文没做压力测试。这是"中央 streaming 声明"未来要补的洞。
我的判断:它把"游戏专属世界模型"从口号拉到工程现场。此前行业热议"针对某款游戏训练世界模型、由模型直接还原玩家所见",多数停在概念。AlayaRenderer-Flash 用"引擎导出结构化状态 + 生成模型补外观"的范式,天然保留世界动力学(不会像纯文本/控制提示生成那样漂移场景结构),又拿到文本可控的画风自由——这是通往交互式世界模型最务实的一块踏板。
等等——务实这两个字我要展开说。3 大机制:chunk-level 自回归流式(4 帧一块,过去块按三档压缩保留在自注意力里,首生成帧作为全局外观锚点,持续文本 sink 让每块都注意当前风格 prompt);三阶段蒸馏级联(guidance distillation → 32→16→8→4 步渐进缩减 → Mean Flow Distillation + self-rollout 配轻量 GAN heads);轻量化编解码。
下一根钉子:AlayaRenderer-Flash 把生成式渲染从离线炫技拽进 30 FPS 可玩现场——它给游戏世界模型指了一条"引擎守脑、模型换皮"的不漂移路线,剩下的问题是"长序列外观漂移"怎么收口。
#神经渲染 #游戏