事件
商汤研究院(Kaipeng Zhang 等)在 arXiv 放出技术报告 AlayaRenderer-Flash(8 月 5 日),把此前的生成式前向世界渲染器 AlayaRenderer 从离线的 0.56 FPS 推到实时的 31.54 FPS——足以“跟上游玩速度”(speed of play)。做法三步:把 50 步去噪蒸馏成 4 步少步自回归流式模型;用轻量蒸馏编解码替换昂贵的 G-buffer 编码器与 Wan VAE 解码器;并改为自回归滚动,支持对游戏引擎无限长 G-buffer 流的连续渲染。作者把 Flash 接进物理引擎,搭出一个以 30 FPS 运行的“完全可玩生成式世界”。
为什么值得关注
第一,它指明了一条和主流神经渲染不同的技术路线。今年 ChinaJoy 与 Arm 主推的“神经图形”(Neural Graphics、NFRU 超分、移动端神经帧生成)是在传统光栅/光追管线上“贴”AI 做降噪与超分;而 AlayaRenderer 系列选择“引擎管物理、生成模型只管外观”:现代引擎先把场景光栅化成 G-buffer(深度、法线、反照率、粗糙度等结构化世界状态),再由扩散/流模型据此合成 RGB 帧。几何、物理、玩法逻辑始终在引擎手里,生成模型只重画“皮”——玩家用任意文本提示实时改光照、氛围、画风,底层玩法不变。
第二,0.56→31.54 这近 56 倍提速,是“可玩”与“可看”的分水岭。原生 AlayaRenderer 因 50 步去噪 + 固定双向窗口,只能离线后处理;Flash 通过少步蒸馏 + 轻量编解码 + 自回归流式,让“prompt 可控的生成式渲染”从影片级演示变成能跟着实时 gameplay 跑的层。报告中用 SuperTuxKart 现场演示:引擎持续吐同步 G-buffer,Flash 以播放帧率生成风格化画面。
第三,它把“游戏专属世界模型”从口号拉到工程现场。此前行业热议“针对某款游戏训练世界模型、由模型直接还原玩家所见”,但多数停在概念。AlayaRenderer-Flash 用“引擎导出结构化状态 + 生成模型补外观”的范式,天然保留世界动力学(不会像纯文本/控制提示生成那样漂移场景结构),又拿到文本可控的画风自由——这是通往交互式世界模型最务实的一块踏板。
一句话定性
不抢引擎的“脑子”(物理与逻辑),只替它换“皮肤”(外观),还能实时跟玩——AlayaRenderer-Flash 把生成式渲染从离线炫技拽进了 30 FPS 的可玩现场,给游戏世界模型指了一条不漂移的务实路线。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。