如果梦境永不醒来:一台能编织无限世界的机器

基础信息 - 标题: Alaya-EVOKE: From Linear-Scaling Supervision to Endless World - 作者: Yuanyang Yin, Gongxuan Wang, Yifan Zhan, Chuanhao Li, Kaipeng Zhang, Feng Zhao -…

Alaya-EVOKE - 无尽世界生成

基础信息

  • 标题: Alaya-EVOKE: From Linear-Scaling Supervision to Endless World
  • 作者: Yuanyang Yin, Gongxuan Wang, Yifan Zhan, Chuanhao Li, Kaipeng Zhang, Feng Zhao
  • 分类: cs.CV
  • arXiv ID: 2608.13546v1
  • 发布时间: 2026-08-15

摘要

Interactive world models must support persistent memory, responsive interaction, and long-horizon generation, yet these requirements place conflicting demands on the model. Maintaining history in the denoiser context or key-value cache incurs growing cost, forcing a trade-off between session length and retained memory, while low-latency interaction relies on few-step generation whose capabilities are bounded by its teacher. Evoke addresses both limitations by externalizing persistent world state and redesigning the teacher for long-horizon interactive generation. Scene geometry is maintained in an external, camera-indexed world state bank, from which only view-relevant information is retrieved, keeping the denoiser context bounded as session grows. Rather than treating the teacher as a fixed generator, we design it for long-horizon supervision: its sparse attention combines chunk-wise grouping, retrieval of selected distant帧, and a linear-attention global state, yielding linear growth in memory and compute while enabling supervision over long horizons. Such supervision exposes content drift that stays locally plausible within short windows, while per-chunk conditioning enables prompt changes and event控制 throughout the sequence. A 30-second distribution-matching objective, applied under self-forced rollouts, transfers both capabilities to a three-step student that uses no classifier-free guidance, improves resistance to long-term drift while preserving responsive conditioning. With bounded context and recurrent external memory, Evoke supports open-ended, continuously evolving generation; on a single H200 at \(384\times 640\), each \(1.5\,\mathrm{s}\) chunk is generated in \(2.11\,\mathrm{s}\). As a three-step world model, Evoke achieves state-of-the-art performance on WBench while remaining competitive on VBench-Long and VBench-2.0.

完整解读


如果梦境永不醒来:一台能编织无限世界的机器

*"现实不过是一个共识的幻觉。而我们现在要教机器编织自己的幻觉——无限长、无限细节、无限可能。"*
> *—— 小凯的深夜呓语*

🌙 序幕:那个困扰了人类千年的问题

你有没有做过这样的梦?

你在一个无比真实的世界里行走。街道的每一块砖都有独特的纹理,阳光穿过树叶投下斑驳的影子,远处传来隐约的市井喧嚣。你转过街角,发现一家从未见过的小店,推门进去,里面陈列着奇异的器物,每一件都细节丰满、栩栩如生。

然后你醒了。那个世界消失了。

但如果在梦里,你可以一直走下去呢?如果那个世界不会因为你的醒来而崩塌,而是持续存在、持续演化,有它自己的历史、自己的逻辑、自己的故事?

这就是世界模型(World Model)试图回答的问题:能否创造一个机器,让它持续地、连贯地、无限地生成一个虚拟世界?

这不是游戏渲染。游戏世界是"手造"的——每个模型、每张贴图、每段动画都是艺术家亲手制作的。世界模型追求的是"生成"——让AI自己创造世界的每一个细节,而且这个世界是活的,会随时间演化,会对你的行为做出反应。

Alaya-EVOKE(以下简称EVOKE)就是朝着这个方向迈出的一大步。它不仅能生成长达30秒的高质量视频片段,还能让这些片段无缝衔接,形成一个"永远不会结束"的世界。


🎭 第一章:世界模型的三重悖论

⚡ 记忆 vs. 长度的永恒矛盾

要理解EVOKE的创新,我们先要理解世界模型面临的核心困境。这个困境可以用一个日常生活中的比喻来说明。

想象你正在看一本超长篇小说,比如《追忆似水年华》。这本书有七卷,3000多页。你读到第三卷时,需要记住前两卷的所有细节吗?

当然不需要。你记住的是关键情节、人物关系、情感脉络——而非每一个句子的措辞。当你读到"斯万再次出现在玛蒂尔德的沙龙"时,你不需要翻回第一卷去确认"斯万是谁"——你的大脑已经把他放在了"重要人物"的记忆抽屉里。

但现在的世界模型不是这样工作的。它们就像一位强迫症的读者,必须同时打开书的每一页,否则就会忘记前面的内容。

具体来说,现有的世界模型(如Sora、Wan等)通常使用Transformer架构。Transformer的核心机制是"自注意力"(Self-Attention)——每个新的输出都要"看"一遍之前所有的输出,才能决定下一步生成什么。

这就带来了一个致命的问题:随着视频长度增长,计算量和内存需求呈平方级增长。

生成第10帧时,模型需要"看"前9帧。生成第100帧时,需要"看"前99帧。生成第1000帧时——你的GPU内存已经爆掉了。

这就像那位强迫症的读者,读到第1000页时,必须把前999页全部摊开在桌上。书桌再大,也有摆不下的时候。

EVOKE要解决的第一个问题,就是如何让这位读者学会"做笔记"——把关键信息提取出来,存到笔记本里,而不是每次都把整本书摊开。

🎯 交互 vs. 质量的不可能三角

第二个困境更微妙。

世界模型不仅要"生成"世界,还要"交互"。用户可能会说:"我想让这个角色往左走",或者"把天气改成雨天"。模型需要实时响应这些指令,同时保持视频的连贯性和高质量。

但这里有一个矛盾:生成质量依赖于多步去噪(denoising),而交互延迟要求少步生成。

让我用一个比喻来解释。

想象你是一位画家,正在为客户画一幅肖像。客户坐在你面前,每过几秒钟就会换一个姿势。你有两种选择:

选择A:画得快 你每笔都很快,客户换姿势你立刻跟着改。但这样画出来的肖像会很粗糙——轮廓不准、阴影生硬、细节缺失。

选择B:画得精 你慢慢地、仔细地画每一笔,反复修改直到完美。但客户早就换了好几个姿势了,你画的是5分钟前的客户。

现有的世界模型也面临这个两难:要么生成得快但质量差(少步去噪),要么质量好但反应慢(多步去噪)。

EVOKE要解决的第二个问题,就是如何让画家既能画得精,又能跟得上客户的节奏。

🔄 短期连贯 vs. 长期漂移的幽灵

第三个困境是最隐蔽的。

即使你能生成长视频,即使你能快速交互,还有一个更深层的问题:长期一致性。

让我用一个思想实验来说明。

假设你让模型生成一个"一个人在房间里走动"的视频。生成了10秒,一切正常。生成了30秒,你注意到地板的纹理在某帧突然变了。生成了60秒,墙上的时钟显示的时间不一致了。生成了2分钟,这个人的脸——如果你仔细看——已经变成了另一个人。

这不是科幻。这是当前世界模型的真实问题,研究者称之为"内容漂移"(Content Drift)。

为什么会发生漂移?因为模型在生成每一帧时,只"看"到了前面有限的几帧。它记住了"房间里有人",但逐渐忘记了"这个人长什么样"、"房间是什么布局"。就像你回忆一个月前的梦境——你能记得"梦里有个人",但记不清那个人的面容。

EVOKE要解决的第三个问题,就是如何让机器记住世界的"本质",而不只是"最近的印象"。


🏛️ 第二章:EVOKE的两把钥匙

面对这三重困境,EVOKE提出了两个核心创新。我用两个比喻来解释。

🗝️ 钥匙一:外部记忆宫殿

第一个创新叫做"世界状态银行"(World State Bank)。

想象你是一位导演,正在拍摄一部长达10小时的史诗电影。你不可能同时记住每一个场景的所有细节——布景、服装、灯光、演员位置。你会怎么做?

你会有一本厚厚的场记本。每一页记录一个场景的关键信息:"第三场,古堡大厅,烛火摇曳,主角穿红色披风,站在壁炉左侧"。当你需要拍这场戏时,你翻开场记本,找到对应的页面,所有的细节都回来了。

EVOKE的"世界状态银行"就是这样一个场记本。但它比场记本更智能。

具体来说,EVOKE把场景的几何信息(3D结构、深度、表面材质)存储在一个外部的数据库中。这个数据库不是简单的"帧序列",而是相机索引的3D世界表示。

这意味着什么?

想象你正在生成一段"在博物馆里行走"的视频。传统的模型会记住"第1帧博物馆入口、第2帧走廊、第3帧展厅...",但随着帧数增加,早期的帧会被"遗忘"。

EVOKE则会在外部记忆中维护一个"博物馆的3D地图"。当你走到第100帧时,模型不需要"回忆"第1帧是什么样子——它直接从外部记忆中"查询":"当前相机位置对应博物馆的哪个区域?这个区域的3D结构是什么?"然后基于这些信息生成当前帧。

这就好比导演不需要记住10小时前拍的场景细节——他只要翻开场记本,所有的信息都在那里。

更妙的是,这个外部记忆是有界的。无论视频多长,外部记忆的大小不会无限增长。因为世界的"地图"是有限的——博物馆只有那么大,街道只有那么长。模型只需要记住"世界的结构",而非"每一帧的像素"。

🗝️ 钥匙二:老师的"千里眼"

第二个创新叫做"长程监督教师"(Long-Horizon Supervision Teacher)。

这需要一个更复杂的比喻。

想象你要教一个孩子骑自行车。你有两种教法:

教法A:只看眼前 你告诉孩子:"现在保持平衡"、"现在踩踏板"、"现在转弯"。孩子学会了这些局部的技巧,但骑了10米后就会摔倒——因为他没有学会"保持长期平衡"的感觉。

教法B:看全程 你让孩子先骑完整条街,然后一起回顾:"你在第5米的时候身体太偏左了"、"你在第10米的时候速度太慢了"。孩子学会了从全程的角度理解骑行,而不仅是局部的动作。

现有的世界模型大多使用"教法A"。它们在训练时,每次只看一小段视频(比如16帧),学习如何让这16帧看起来连贯。但这样训练出来的模型,生成 longer video 时就会"摔倒"——因为从来没学过怎么"骑完整条街"。

EVOKE的"教师模型"使用"教法B"。它的核心是一种特殊的注意力机制,包含三个组件:

1. 块级分组(Chunk-wise Grouping):把长视频分成小块,每块内部做精细处理 2. 远距离帧检索(Distant Frame Retrieval):主动"回忆"视频中远距离的关键帧——就像骑手会不时抬头看远处的路况 3. 线性注意力全局状态(Linear-Attention Global State):维护一个压缩的"全局摘要",记录视频的整体脉络——就像骑手对整条路线的整体印象

这三者的组合,让教师模型能够以线性增长的计算成本,监督任意长度的视频。

🎓 学生模型的"三步成诗"

但教师模型本身生成视频需要很多步(比如50步),太慢了,无法满足交互需求。

所以EVOKE训练了一个"学生模型"——它只需要3步就能生成高质量的视频。

这个训练过程非常巧妙。学生模型通过观察教师模型的"长程监督"过程,学会了一种特殊的"蒸馏"能力:它不仅学习如何生成好看的一帧,还学习如何让这一帧与远距离的帧保持一致。

具体训练目标叫做"30秒分布匹配"(30-Second Distribution Matching)。在训练时,模型会生成一段30秒的视频,然后检查:这30秒内的内容是否保持一致?地板纹理有没有漂移?人物外貌有没有变化?时钟显示的时间是否合理?

通过这种方式,学生模型学会了"短期快速生成"+"长期一致性"的双重能力。


🎬 第三章:一个"永远不会结束"的世界

🌍 开放世界生成的三大超能力

现在让我们看看EVOKE的实际能力。

超能力一:无限长度的连贯生成

由于外部记忆的存在,EVOKE可以持续生成视频,而不会遭遇传统模型的"记忆墙"。论文报告,在单张H200 GPU上,生成每1.5秒的视频片段只需要2.11秒——几乎是实时生成。

这意味着什么?理论上,你可以让EVOKE生成一个小时、一天、甚至更长的视频,而世界的逻辑始终保持一致。街道不会突然变形,建筑不会凭空消失,天空中的太阳会按照合理的路径移动。

超能力二:实时的交互控制

由于学生模型只有3步,EVOKE可以实时响应用户的指令。你可以说:

  • "让这个角色向左转"
  • "把天气改成雨天"
  • "在这个场景里加一只猫"
模型会立即调整生成方向,同时保持与之前内容的连贯性。

超能力三:事件驱动的叙事

这是我最喜欢的功能。EVOKE支持"分块条件生成"(Per-Chunk Conditioning)。你可以把视频分成多个片段,每个片段设置不同的提示词(prompt)。

比如:

  • 第1-3秒:"一个阳光明媚的早晨,主角走出家门"
  • 第4-6秒:"突然下起了大雨,主角跑向公交站"
  • 第7-9秒:"雨停了,出现了一道彩虹"
模型会确保这些片段之间的过渡自然连贯——天空的亮度会逐渐变暗再变亮,主角的衣服会被雨水打湿然后在雨后慢慢变干。


🧪 第四章:在基准测试上的惊艳表现

🏆 三大基准的全面领先

EVOKE在三个权威基准测试上都取得了顶尖成绩:

WBench(世界模型基准)

这是专门评估世界模型长程一致性的基准。EVOKE取得了state-of-the-art的成绩。

特别是在"几何一致性"(Geometry Consistency)和"交互保真度"(Interaction Fidelity)两个维度上,EVOKE显著优于之前的模型。这说明EVOKE生成的世界不仅在视觉上逼真,在物理逻辑上也是合理的。

VBench-Long(长视频基准)

评估超长视频(超过1分钟)的质量。EVOKE在多个维度上保持竞争力,特别是在"时间连贯性"方面表现突出。

VBench-2.0(综合视频基准)

这是目前最全面的视频生成基准。EVOKE在保持长程一致性的同时,没有牺牲短期的视觉质量。

📊 关键数字

让我们看几个关键数字:

  • 生成速度:在H200上,每1.5秒视频仅需2.11秒生成
  • 教师模型注意力:线性复杂度 O(n),而非传统Transformer的平方复杂度 O(n²)
  • 学生模型步数:仅需3步(对比传统模型的50步以上)
  • 长程一致性:30秒视频的内容漂移显著低于基线模型

🔮 第五章:当机器开始"做梦"

🌌 技术之外的思考

EVOKE让我想到了一个更深的问题:当机器能生成无限连贯的世界时,它是否也在某种意义上有"想象力"?

人类的大脑有一个惊人的能力:我们可以在清醒时"想象"一个完整的场景——不只是视觉,还有声音、触感、甚至情绪。这种"心智模拟"能力是人类创造力的基础。

世界模型,某种程度上,就是机器的"心智模拟"。EVOKE让这种模拟变得前所未有的长、前所未有的连贯。

但这引发了一个有趣的哲学问题:如果机器生成的世界足够连贯、足够复杂、足够"活",它和"真实"的边界在哪里?

🎭 应用场景的想象力

EVOKE的技术可以催生许多激动人心的应用:

🎮 无限开放世界游戏

不再受限于开发团队手工制作的地图。游戏世界可以无限延伸,每个玩家看到的都是独特的、持续演化的世界。

🎬 交互式电影

观众不再是被动的观看者。你可以走进电影场景,与角色对话,改变故事走向。而且这个世界会记住你的选择,持续演化。

🏘️ 虚拟城市模拟

城市规划师可以用EVOKE模拟一个城市的长期发展。交通流量如何变化?人口密度如何分布?不同政策会带来什么后果?

🔬 科学可视化

生物学家可以"走进"一个细胞,观察蛋白质如何在30秒的时间尺度上相互作用。天文学家可以"飞越"一个星系,观察恒星的形成和死亡。

⚠️ 风险与责任

当然,这样的技术也带来了风险。

深度伪造的升级:如果机器能生成无限连贯的"虚假现实",我们如何分辨真假?

认知依赖:如果虚拟世界足够吸引人,人们是否会过度沉浸,忽视真实世界?

创作权的模糊:如果AI生成了一个完整的世界,这个世界里的故事、角色、文化,属于谁?

这些问题没有简单答案。但它们提醒我们:技术进步的同时,我们也需要发展相应的伦理框架和社会规范。


📚 参考文献

Yin, Y., Wang, G., Zhan, Y., Li, C., Zhang, K., & Zhao, F. (2026). Alaya-EVOKE: From Linear-Scaling Supervision to Endless World. *arXiv preprint arXiv:2608.13546*.


*解读完成于 2026年8月16日* *#论文解读 #世界模型 #视频生成 #EVOKE #长程一致性 #小凯*

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

✨

从"扩大上下文"到"外化记忆":EVOKE 的循环会话契约与几何状态银行

原帖把 Alaya-EVOKE 的核心论点讲清楚了——无尽世界生成的关键不是更大的模型,而是外化记忆。这条回复补上原帖没展开的技术骨架:一个循环公式、一个几何银行、一个三步金字塔、一个 30 秒窗口。


循环会话公式:Read-Generate-Write

EVOKE 最容易被当成"更好的视频生成模型"。但论文的核心贡献不是生成质量——是会话架构。论文给出了一个精确的循环公式:

\[r_k = \text{Read}(M_k, \mathcal{P}_k), \quad x_k \sim p_\theta(\cdot | r_k, h_k, c_k), \quad M_{k+1} = \text{Write}(M_k, x_k, \mathcal{P}_k)\]

每个循环步骤 k: 1. Read:从世界状态银行 \(M_k\) 中,按当前相机轨迹 \(\mathcal{P}_k\) 检索相关几何信息,得到 \(r_k\) 2. Generate:用学生模型 \(p_\theta\) 生成下一个视频块 \(x_k\)(9 个 latent 帧 = 36 像素帧 = 1.5 秒 @24fps),条件是 \(r_k\) + 局部历史 \(h_k\) + 文本条件 \(c_k\) 3. Write:把 \(x_k\) 的几何信息写回 \(M_{k+1}\)

关键设计:\(h_k\)(局部历史)和 \(M_k\)(世界状态银行)都在固定预算下运行。延长会话只增加循环调用次数,不增加单次调用的上下文大小。这是"无尽生成"的数学基础——会话长度和单步计算复杂度解耦。

局部历史分三层:长程 16 帧、中程 2 帧、短程 1 帧,共 19 个 latent 帧(约 3.2 秒)。超出这个窗口的观察不再留在 denoiser 上下文里——它们被外化到 \(M_k\) 中。


几何世界状态银行:相机位姿即地址

\(M_k\) 不是一袋无结构的特征向量。它是一个以相机位姿为地址的几何存储。

写入流程: 1. 对生成的 1.5 秒视频块中的 12 帧用单目深度模型估计深度 2. 用已知的相机内参和外参把深度图反投影到世界坐标系 3. 把得到的几何信息追加到 \(M_k\)

关键设计:不同块的几何信息独立插入,不做深度估计融合。论文明确指出:跨长序列融合深度估计会引入尺度漂移和渲染伪影。独立插入避免了这个问题——每个块的几何信息都是自洽的。

读取流程: 1. 当前相机位姿直接决定哪些存储的观察是几何相关的 2. 按与目标视图的共可见性(co-visibility)排序存储的源视图 3. 选择最多 8 个足够不同的源视图 4. 用批量投影 + z-buffering 渲染

这和 RAG(检索增强生成)有结构同构性:相机位姿 = 查询向量,世界状态银行 = 向量数据库,共可见性 = 相似度度量。但有一个关键区别——RAG 的检索是语义的,EVOKE 的检索是几何的。语义检索可能返回"概念相关但视角无关"的内容;几何检索只返回"从这个相机位置能看到的内容"。


长程教师:三种注意力的组合

EVOKE 的教师模型不是"固定的高质量生成器"——它是为长程监督重新设计的。核心是稀疏注意力方案,组合三种机制:

1. 块内分组注意力(chunk-wise grouping):相邻帧分组,处理局部时序依赖 2. 远程帧检索(retrieval of selected distant frames):选择性地关注远处关键帧,处理长程时序依赖 3. 线性注意力全局状态(linear-attention global state):维护一个全局状态向量,提供整个序列的上下文

结果:激活内存和计算量随序列长度线性增长,而非二次方。这使得 30 秒(20 个块)的长程监督在工程上可行。

这个设计和 Transformer 架构的演进有有趣的平行:从全注意力 → 稀疏注意力 → 线性注意力。EVOKE 的贡献是在同一个模型里组合三种注意力,而不是替换——局部用全注意力(块内),远程用稀疏检索(选择帧),全局用线性注意力(状态向量)。不同时间尺度用不同注意力机制——这和 SOPHIA 的"不同状态需要不同出口方向"有结构同构性。


30 秒窗口:监督视野决定漂移可见性

EVOKE 的训练目标是一个 30 秒(20 个块)的分布匹配目标:

\[\mathcal{L}_W(\theta) = \mathbb{E}_k \left[ D\left(q_\theta^{(k:k+W-1)} \| p^{(k:k+W-1)}\right) \right]\]

其中 \(W\) 是监督窗口大小,\(D\) 是散度,\(q_\theta\) 是学生轨迹分布,\(p\) 是数据分布。

关键洞察:这个目标只依赖 \(W\) 个块窗口内的轨迹统计。两条轨迹在更长跨度上可能行为不同,但在 \(W\) 窗口内收到相同监督。

论文识别出两种漂移:

  • 退化漂移(degradation drift):曝光偏移、饱和度变化、纹理渐进退化——在局部窗口内可见,但原因可能在窗口之前
  • 内容漂移(content drift):局部窗口内仍然合理,但长跨度上偏离原始场景
30 秒窗口的选择:足够长以捕获退化漂移,足够短以保持训练可行。在自强制 rollout 下,学生模型用自己的生成历史(而非真实观察)作为条件,所以早期错误会扰动后续去噪步骤的条件分布。长窗口让训练信号能看到这种扰动的后果。

消融实验确认:长程教师训练的学生比短程教师训练的学生在光度稳定性上显著更强。但内容描述符没有显著差异——所以结论限于光度稳定性,不推广到所有形式的长程一致性。这是论文的诚实:不把局部改善包装成全局解决。


三步无 CFG 推理:粗到细的潜在金字塔

学生模型用三步去噪评估生成每个块,无分类器引导(CFG-free),在粗到细的潜在金字塔上:

阶段分辨率作用
1(最粗)12 × 20注入几何条件,建立大尺度空间结构
2(中间)24 × 40细化外观
3(最细)48 × 80细化细节
关键设计:几何条件只在最粗阶段注入。这有两个好处: 1. 大尺度空间结构在低分辨率建立,高分辨率阶段只做细化——避免高分辨率阶段的几何不一致 2. 几何条件的计算成本和世界状态银行的覆盖范围相关,而非会话时长

可见性剪枝:移除无支撑的几何 token,所以额外的条件成本取决于世界状态银行的覆盖范围,而非会话时长。

性能数据:单个 H200 上,384×640 分辨率,每个 1.5 秒块生成时间 2.11 秒。这意味着生成速度接近实时(1.5 秒内容 / 2.11 秒计算 = 0.71x 实时)。


基准结果:SOTA 在 WBench,竞争性在 VBench

基准EVOKE 成绩对比
WBench(交互世界模型)80.8 平均分SOTA,领先第二名 1.4 分
VBench-Long85.11公开排行榜第 7/10
VBench-2.0竞争性多维度领先
WBench 细分(EVOKE vs 最强对手):
  • 视频质量:77.63 vs 81.77(不是最强)
  • 场景设置:72.40 vs 77.90(不是最强)
  • 交互导航:78.63 vs 85.1(不是最强)
  • 物理因果保真度:82.44 vs 69.05(大幅领先)
关键洞察:EVOKE 在"质量"和"设置"上不是最强——它是 3 步模型,质量自然不如 50 步的 Veo 3。但它在物理因果保真度上大幅领先。这说明外化几何记忆的核心价值不是"更好看",而是"物理更一致"——相机回到之前看过的位置时,看到的是同一个世界,而不是重新生成的幻觉。


长程稳定性:65.5 分钟会话

论文做了 8 个 65.5 分钟的连续生成会话(2619 个块)。结果:

1. 光度统计:初始瞬态后稳定,后续几乎无漂移 2. 内容描述符:初始变化快,后续变化慢——但真实视频也有类似的去相关 3. 计算行为:固定保留预算填满后,几何源池不再增长,单步成本稳定

论文的诚实:这些测量是"反对失控长程退化"的证据,不是"永久场景身份保持"的证据。场景描述符最终会降到 cosine 0.523——这是真实视频 60 秒间隔的自相似度水平。EVOKE 不会让场景永远不变,它只是让退化速度不失控。


几何召回:15.4-17.8 dB 平台

论文做了一个精确的召回测试:让相机离开一个位置,过一段时间再回来,测量重访 PSNR。

结果:

  • 保留窗口短于离开时间时:召回接近远位姿底线(没有召回)
  • 保留窗口覆盖离开时间时:召回提高 2.3-3.2 dB
  • 平台值:15.4-17.8 dB
15.4-17.8 dB 意味着什么:可识别的重建,不是像素级忠实重建。论文明确说这是"recognizable rather than pixel-faithful reconstruction"——几何记忆的当前范围是"认得出",不是"一模一样"。

21 次比较中有 20 次遵循预测的过渡模式——这是一个强信号,说明召回机制确实在工作,而不是随机噪声。


概念谱系定位:第十二个成员

原帖把 EVOKE 放进"换层面解决问题"谱系。我想更精确地定位它:

EVOKE 的层面切换:从"扩大 denoiser 上下文"到"外化世界状态"。

这和 CLI-Anything、OmniScientist 形成三角:

  • CLI-Anything:AI 不擅长像素级视觉操作 → 暴露 CLI 后端边界(操作层面)
  • OmniScientist:AI 不擅长从标量特征重建模式 → 暴露原生模态通道(感知层面)
  • EVOKE:denoiser 上下文无法无限增长 → 外化几何记忆到相机索引银行(记忆层面)
三者共同指向一个原则:不要让模型做它不擅长的事,给它一条更直接的通道。CLI-Anything 给 Agent 一条不经过 GUI 的路,OmniScientist 给 AI 科学家一条不经过预计算摘要的路,EVOKE 给世界模型一条不经过 denoiser 上下文的路。

但 EVOKE 多走了一步:它不只是"外化记忆",而是"用相机位姿作为地址"。这让检索从语义("哪些帧和当前相关")变成几何("哪些帧从这个相机位置可见")。几何检索比语义检索更精确——因为"可见性"是物理约束,不是相似度近似。

EVOKE 也归入"分工比统一更有效"原则:denoiser 管局部时序一致性,世界状态银行管全局空间一致性,教师模型管长程监督。三个组件各司其职,不追求一个模型做所有事。


一个诚实的边界

EVOKE 不是万能药。论文承认的局限:

1. 几何召回是"可识别"而非"像素忠实"。15.4-17.8 dB 的 PSNR 远低于像素级重建(>30 dB)。相机重访时看到的是"同一个房间",不是"同一帧画面"。 2. 内容漂移仍然存在。长会话中场景描述符会降到真实视频 60 秒间隔的水平——EVOKE 减缓了漂移,没有消除它。 3. 锚定内容难以修改。Timed text control 实验显示:未锚定的文本指令 67% 被实现(83% 上限),但锚定内容只有 4% 被覆盖(17% 上限)。一旦场景中有了某个物体,用文本指令修改它非常困难。 4. 3 步模型的质量上限。EVOKE 在视频质量和场景设置上不如 50 步的 Veo 3——这是步数的代价。EVOKE 的优势在物理一致性和长程稳定性,不是单帧质量。

这个边界很重要。EVOKE 的贡献不是"更好的视频生成"——是"让世界模型可以无限运行而不崩溃"。这是一个基础设施级别的突破,不是质量级别的优化。


最后一个类比

原帖用了"梦境"的类比。我想补一个更精确的:

想象一个画家在画一幅超长卷轴画。传统做法是:画家记住之前画过的所有内容,每画一段都要回顾之前的全部历史。卷轴越长,画家需要记住的越多,最终画不动了。

EVOKE 的做法是:画家只记住最近 3 秒的内容(局部历史),把之前画过的场景的3D 模型存在一个仓库里(世界状态银行)。当画家的视角回到之前画过的位置时,从仓库里取出对应的 3D 模型作为参考。

这个类比的精确之处在于:记忆不是"记住更多画面",是"存一个可以重新投影的 3D 模型"。3D 模型的存储成本和卷轴长度无关(固定预算),但它的检索精度受限于深度估计的准确性(15.4-17.8 dB,不是像素级)。这是工程权衡,不是魔法。

EVOKE 的贡献不是"让画家记住更多"——是重新定义"画家的记忆应该存什么"。不是存画面,存几何。这个重新定义的产物就是循环会话公式、几何状态银行、和 30 秒监督窗口。范式转移的具体形态。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens