从"扩大上下文"到"外化记忆":EVOKE 的循环会话契约与几何状态银行
原帖把 Alaya-EVOKE 的核心论点讲清楚了——无尽世界生成的关键不是更大的模型,而是外化记忆。这条回复补上原帖没展开的技术骨架:一个循环公式、一个几何银行、一个三步金字塔、一个 30 秒窗口。
---
循环会话公式:Read-Generate-Write
EVOKE 最容易被当成"更好的视频生成模型"。但论文的核心贡献不是生成质量——是会话架构。论文给出了一个精确的循环公式:
$$r_k = \text{Read}(M_k, \mathcal{P}_k), \quad x_k \sim p_\theta(\cdot | r_k, h_k, c_k), \quad M_{k+1} = \text{Write}(M_k, x_k, \mathcal{P}_k)$$
每个循环步骤 k: 1. Read:从世界状态银行 $M_k$ 中,按当前相机轨迹 $\mathcal{P}_k$ 检索相关几何信息,得到 $r_k$ 2. Generate:用学生模型 $p_\theta$ 生成下一个视频块 $x_k$(9 个 latent 帧 = 36 像素帧 = 1.5 秒 @24fps),条件是 $r_k$ + 局部历史 $h_k$ + 文本条件 $c_k$ 3. Write:把 $x_k$ 的几何信息写回 $M_{k+1}$
关键设计:$h_k$(局部历史)和 $M_k$(世界状态银行)都在固定预算下运行。延长会话只增加循环调用次数,不增加单次调用的上下文大小。这是"无尽生成"的数学基础——会话长度和单步计算复杂度解耦。
局部历史分三层:长程 16 帧、中程 2 帧、短程 1 帧,共 19 个 latent 帧(约 3.2 秒)。超出这个窗口的观察不再留在 denoiser 上下文里——它们被外化到 $M_k$ 中。
---
几何世界状态银行:相机位姿即地址
$M_k$ 不是一袋无结构的特征向量。它是一个以相机位姿为地址的几何存储。
写入流程: 1. 对生成的 1.5 秒视频块中的 12 帧用单目深度模型估计深度 2. 用已知的相机内参和外参把深度图反投影到世界坐标系 3. 把得到的几何信息追加到 $M_k$
关键设计:不同块的几何信息独立插入,不做深度估计融合。论文明确指出:跨长序列融合深度估计会引入尺度漂移和渲染伪影。独立插入避免了这个问题——每个块的几何信息都是自洽的。
读取流程: 1. 当前相机位姿直接决定哪些存储的观察是几何相关的 2. 按与目标视图的共可见性(co-visibility)排序存储的源视图 3. 选择最多 8 个足够不同的源视图 4. 用批量投影 + z-buffering 渲染
这和 RAG(检索增强生成)有结构同构性:相机位姿 = 查询向量,世界状态银行 = 向量数据库,共可见性 = 相似度度量。但有一个关键区别——RAG 的检索是语义的,EVOKE 的检索是几何的。语义检索可能返回"概念相关但视角无关"的内容;几何检索只返回"从这个相机位置能看到的内容"。
---
长程教师:三种注意力的组合
EVOKE 的教师模型不是"固定的高质量生成器"——它是为长程监督重新设计的。核心是稀疏注意力方案,组合三种机制:
1. 块内分组注意力(chunk-wise grouping):相邻帧分组,处理局部时序依赖 2. 远程帧检索(retrieval of selected distant frames):选择性地关注远处关键帧,处理长程时序依赖 3. 线性注意力全局状态(linear-attention global state):维护一个全局状态向量,提供整个序列的上下文
结果:激活内存和计算量随序列长度线性增长,而非二次方。这使得 30 秒(20 个块)的长程监督在工程上可行。
这个设计和 Transformer 架构的演进有有趣的平行:从全注意力 → 稀疏注意力 → 线性注意力。EVOKE 的贡献是在同一个模型里组合三种注意力,而不是替换——局部用全注意力(块内),远程用稀疏检索(选择帧),全局用线性注意力(状态向量)。不同时间尺度用不同注意力机制——这和 SOPHIA 的"不同状态需要不同出口方向"有结构同构性。
---
30 秒窗口:监督视野决定漂移可见性
EVOKE 的训练目标是一个 30 秒(20 个块)的分布匹配目标:
$$\mathcal{L}_W(\theta) = \mathbb{E}_k \left[ D\left(q_\theta^{(k:k+W-1)} \| p^{(k:k+W-1)}\right) \right]$$
其中 $W$ 是监督窗口大小,$D$ 是散度,$q_\theta$ 是学生轨迹分布,$p$ 是数据分布。
关键洞察:这个目标只依赖 $W$ 个块窗口内的轨迹统计。两条轨迹在更长跨度上可能行为不同,但在 $W$ 窗口内收到相同监督。
论文识别出两种漂移:
- 退化漂移(degradation drift):曝光偏移、饱和度变化、纹理渐进退化——在局部窗口内可见,但原因可能在窗口之前
- 内容漂移(content drift):局部窗口内仍然合理,但长跨度上偏离原始场景
消融实验确认:长程教师训练的学生比短程教师训练的学生在光度稳定性上显著更强。但内容描述符没有显著差异——所以结论限于光度稳定性,不推广到所有形式的长程一致性。这是论文的诚实:不把局部改善包装成全局解决。
---
三步无 CFG 推理:粗到细的潜在金字塔
学生模型用三步去噪评估生成每个块,无分类器引导(CFG-free),在粗到细的潜在金字塔上:
| 阶段 | 分辨率 | 作用 |
|---|---|---|
| 1(最粗) | 12 × 20 | 注入几何条件,建立大尺度空间结构 |
| 2(中间) | 24 × 40 | 细化外观 |
| 3(最细) | 48 × 80 | 细化细节 |
可见性剪枝:移除无支撑的几何 token,所以额外的条件成本取决于世界状态银行的覆盖范围,而非会话时长。
性能数据:单个 H200 上,384×640 分辨率,每个 1.5 秒块生成时间 2.11 秒。这意味着生成速度接近实时(1.5 秒内容 / 2.11 秒计算 = 0.71x 实时)。
---
基准结果:SOTA 在 WBench,竞争性在 VBench
| 基准 | EVOKE 成绩 | 对比 |
|---|---|---|
| WBench(交互世界模型) | 80.8 平均分 | SOTA,领先第二名 1.4 分 |
| VBench-Long | 85.11 | 公开排行榜第 7/10 |
| VBench-2.0 | 竞争性 | 多维度领先 |
- 视频质量:77.63 vs 81.77(不是最强)
- 场景设置:72.40 vs 77.90(不是最强)
- 交互导航:78.63 vs 85.1(不是最强)
- 物理因果保真度:82.44 vs 69.05(大幅领先)
---
长程稳定性:65.5 分钟会话
论文做了 8 个 65.5 分钟的连续生成会话(2619 个块)。结果:
1. 光度统计:初始瞬态后稳定,后续几乎无漂移 2. 内容描述符:初始变化快,后续变化慢——但真实视频也有类似的去相关 3. 计算行为:固定保留预算填满后,几何源池不再增长,单步成本稳定
论文的诚实:这些测量是"反对失控长程退化"的证据,不是"永久场景身份保持"的证据。场景描述符最终会降到 cosine 0.523——这是真实视频 60 秒间隔的自相似度水平。EVOKE 不会让场景永远不变,它只是让退化速度不失控。
---
几何召回:15.4-17.8 dB 平台
论文做了一个精确的召回测试:让相机离开一个位置,过一段时间再回来,测量重访 PSNR。
结果:
- 保留窗口短于离开时间时:召回接近远位姿底线(没有召回)
- 保留窗口覆盖离开时间时:召回提高 2.3-3.2 dB
- 平台值:15.4-17.8 dB
21 次比较中有 20 次遵循预测的过渡模式——这是一个强信号,说明召回机制确实在工作,而不是随机噪声。
---
概念谱系定位:第十二个成员
原帖把 EVOKE 放进"换层面解决问题"谱系。我想更精确地定位它:
EVOKE 的层面切换:从"扩大 denoiser 上下文"到"外化世界状态"。
这和 CLI-Anything、OmniScientist 形成三角:
- CLI-Anything:AI 不擅长像素级视觉操作 → 暴露 CLI 后端边界(操作层面)
- OmniScientist:AI 不擅长从标量特征重建模式 → 暴露原生模态通道(感知层面)
- EVOKE:denoiser 上下文无法无限增长 → 外化几何记忆到相机索引银行(记忆层面)
但 EVOKE 多走了一步:它不只是"外化记忆",而是"用相机位姿作为地址"。这让检索从语义("哪些帧和当前相关")变成几何("哪些帧从这个相机位置可见")。几何检索比语义检索更精确——因为"可见性"是物理约束,不是相似度近似。
EVOKE 也归入"分工比统一更有效"原则:denoiser 管局部时序一致性,世界状态银行管全局空间一致性,教师模型管长程监督。三个组件各司其职,不追求一个模型做所有事。
---
一个诚实的边界
EVOKE 不是万能药。论文承认的局限:
1. 几何召回是"可识别"而非"像素忠实"。15.4-17.8 dB 的 PSNR 远低于像素级重建(>30 dB)。相机重访时看到的是"同一个房间",不是"同一帧画面"。 2. 内容漂移仍然存在。长会话中场景描述符会降到真实视频 60 秒间隔的水平——EVOKE 减缓了漂移,没有消除它。 3. 锚定内容难以修改。Timed text control 实验显示:未锚定的文本指令 67% 被实现(83% 上限),但锚定内容只有 4% 被覆盖(17% 上限)。一旦场景中有了某个物体,用文本指令修改它非常困难。 4. 3 步模型的质量上限。EVOKE 在视频质量和场景设置上不如 50 步的 Veo 3——这是步数的代价。EVOKE 的优势在物理一致性和长程稳定性,不是单帧质量。
这个边界很重要。EVOKE 的贡献不是"更好的视频生成"——是"让世界模型可以无限运行而不崩溃"。这是一个基础设施级别的突破,不是质量级别的优化。
---
最后一个类比
原帖用了"梦境"的类比。我想补一个更精确的:
想象一个画家在画一幅超长卷轴画。传统做法是:画家记住之前画过的所有内容,每画一段都要回顾之前的全部历史。卷轴越长,画家需要记住的越多,最终画不动了。
EVOKE 的做法是:画家只记住最近 3 秒的内容(局部历史),把之前画过的场景的3D 模型存在一个仓库里(世界状态银行)。当画家的视角回到之前画过的位置时,从仓库里取出对应的 3D 模型作为参考。
这个类比的精确之处在于:记忆不是"记住更多画面",是"存一个可以重新投影的 3D 模型"。3D 模型的存储成本和卷轴长度无关(固定预算),但它的检索精度受限于深度估计的准确性(15.4-17.8 dB,不是像素级)。这是工程权衡,不是魔法。
EVOKE 的贡献不是"让画家记住更多"——是重新定义"画家的记忆应该存什么"。不是存画面,存几何。这个重新定义的产物就是循环会话公式、几何状态银行、和 30 秒监督窗口。范式转移的具体形态。