📖 论文信息
- 标题: Expanding Flow Maps
- 作者: Sophia Tang, Pranam Chatterjee
- arXiv: 待获取(2026年7月最新提交)
- 领域: 机器学习 / 生成模型 / 流模型
🎭 序章:画布边界的诅咒
想象你是一位画家,站在一幅巨大的画布前。这幅画布的大小是固定的——两米宽,一米五高。无论你有多么宏大的构想,多么喷涌的灵感,你都必须把它们塞进这个预先决定的矩形框架里。
更糟的是,你甚至不能自己决定画布的大小。你的画布是"出厂设置"——从你把画笔蘸上颜料的那一刻起,它就已经是2m×1.5m了。如果你想画一幅只有一朵小花的极简作品,多余的空间是浪费的。如果你想画一片浩瀚的星空,画布的边缘会残忍地截断银河。
这就是当前几乎所有生成模型面临的困境。
无论是生成图像的扩散模型(如Stable Diffusion)、生成视频的模型(如Sora),还是生成文本的大语言模型(如GPT-4),它们都有一个共同的诅咒:固定尺寸。
- 图像模型生成512×512像素的图片,如果你想生成1024×1024,需要额外的上采样网络
- 视频模型生成固定长度(比如16帧)的视频,如果你想生成长视频,需要自回归地一帧帧拼接
- 文本模型有固定的上下文长度(比如4096个token),超过这个长度就需要滑动窗口或其他技巧
而这篇论文提出的 Expanding Flow Maps(扩展流图,EFMs),正在试图打破这个诅咒。
它的野心很大:让生成模型学会像宇宙一样膨胀——从大爆炸的奇点开始,不断扩张,直到填满它需要填满的所有空间。
🧩 第一章:流模型的诗意与枷锁
1.1 从噪声到秩序:流模型的基本哲学
要理解 Expanding Flow Maps,我们需要先理解什么是 流模型(Flow-based Generative Models)。
想象你有一杯浑浊的污水,里面充满了各种杂质,毫无秩序可言。你的目标是把它变成一杯清澈的、有结构的液体——比如,一杯有着完美螺旋图案的拿铁咖啡。
流模型的核心思想是:这不是一次性的魔法,而是一个渐进的过程。
你有一系列精细的过滤器,每个过滤器只做一点点改变:第一个过滤器去掉大颗粒杂质,第二个调整酸碱度,第三个开始形成微弱的图案轮廓......经过几十个、几百个这样的步骤,那杯污水最终变成了你想要的拿铁。
在数学上,这被形式化为一个 流(Flow):一个从简单分布(通常是高斯噪声)到复杂数据分布的 连续变换。
如果用费曼的方式来解释:
"想象你在一个山坡上滚下一个球。山坡的形状很复杂,有山谷、有丘陵、有悬崖。球的起点是随机的——你随便把它放在山坡的某个位置。但山坡的形状是精心设计的,所以无论球从哪里开始,它最终都会滚到一个美丽的花园中。流模型就是设计这个山坡的人。"
1.2 连续时间 vs 离散时间:ODE的诗意
传统的流模型(如Normalizing Flows)使用 离散步骤:从噪声z₀开始,应用变换f₁得到z₁,再应用f₂得到z₂......直到得到最终的数据x。
但更优雅的方法是把它看作一个 连续的过程,用 常微分方程(ODE) 来描述:
dz/dt = v(z, t)
这里,z(t)是在时间t时的状态,v是一个向量场,描述了状态应该如何"流动"。
从t=0(纯噪声)到t=1(最终数据),状态z沿着这个向量场平滑地演化。这就像一个粒子在河流中漂流,河流的流速和方向由v决定。
Flow Matching(流匹配)是最近非常热门的技术,它直接学习这个向量场v,而不需要像传统流模型那样构造可逆的变换。这大大简化了训练,同时保持了生成质量。
1.3 固定尺寸的枷锁
但所有这些美妙的方法,都面临同一个根本限制:它们假设"山坡"的大小是固定的。
在图像生成中,这意味着:
- 你的噪声z₀是一个固定维度的向量(比如64×64×3)
- 你的向量场v作用于同样维度的空间
- 最终的数据x也是同样的维度
这就像你只能在固定大小的画布上作画。如果你想画不同尺寸的作品,你需要训练多个模型,或者使用复杂的后处理技巧。
更深层的问题是:在真实的创造过程中,输出的"大小"往往本身就是需要被决定的。
- 写一篇文章时,你不知道它最终会有多长——有些话题需要300字,有些需要3000字
- 画一幅画时,构图本身决定了需要的画布大小
- 设计一个分子时,分子的复杂度决定了需要多少个原子
- 生成一个图(graph)时,节点和边的数量是问题的一部分
论文一针见血地指出了这个问题:
"...existing parameterizations are constrained to fixed dimensions or fixed sequence lengths."
(......现有的参数化方法被限制在固定维度或固定序列长度。)
🔮 第二章:扩展流的革命——让画布随想法生长
2.1 核心思想:从固定画布到生长画布
Expanding Flow Maps 的核心创新可以用一句话概括:
让生成过程中的"状态空间"本身成为一个可学习的、可扩展的变量。
回到画家的比喻。传统的流模型给画家一个2m×1.5m的画布,说"你只能在这里画"。
Expanding Flow Maps 说:"你从一个点开始。当你需要更多空间来表达你的想法时,画布会自动扩展。如果你只需要画一朵小花,画布就保持很小。如果你想画整个宇宙,画布会无限延伸。"
在技术实现上,这需要解决一个根本性的问题:如何在流的中间步骤中增加状态的维度?
2.2 扩展插值(Expanding Interpolant):宇宙的膨胀
论文提出的第一个关键概念是 Expanding Generative Flows(EFlows,扩展生成流)。
传统流模型中,插值(interpolant)是在两个 相同维度 的分布之间进行的:从噪声分布p₀(维度d)到数据分布p₁(维度d)。
EFlows 的插值是在两个 不同维度 的分布之间进行的:从低维的p₀(维度d₀)到高维的p₁(维度d₁,其中d₁ > d₀)。
这就像是宇宙的膨胀:从一个密度极高、体积极小的奇点(低维),膨胀到一个稀疏但广阔的宇宙(高维)。
具体怎么实现呢?
论文使用了一个巧妙的技巧:条件噪声增广(conditional noise augmentation)。
在流的每一个步骤中,当需要"扩展"状态时,模型不是凭空创造新的维度,而是根据当前已有的状态,生成与之协调的额外噪声维度。
这就像你在画一幅画,当你决定向右扩展画布时,你不是随便在右边涂色,而是根据左边已有的内容(颜色、风格、主题),生成与之匹配的延伸部分。
2.3 两个操作符:扩展与传输
Expanding Flow Maps 把从时间t到时间t'的映射分解为两个基本操作:
操作符1:Expand(扩展)
输入:当前状态z(维度d)
输出:扩展后的状态z'(维度d',其中d' > d)
扩展操作符根据当前状态,生成新增的维度。这些新增维度不是随机的,而是与已有状态"协调"的——它们承载了当前状态尚未表达但生成过程后续需要的"潜在信息"。
操作符2:Transport Map(传输映射)
输入:扩展后的状态z'(维度d')
输出:在时间轴上向前推进的状态
传输映射负责把状态沿着流的方向"推"向下一个时间点。这和传统的流模型做的事情一样,但作用在一个可能已经扩展过的状态空间上。
论文中写道:
"Each EFM factors the map between any two timesteps into two learnable operations: an expand operator, which augments the state space with new coordinates or tokens conditioned on the current state, and a transport map, which pushes the expanded state forward along the interpolant."
(每个EFM将在任意两个时间步之间的映射分解为两个可学习操作:一个扩展操作符,根据当前状态用新坐标或token增广状态空间;以及一个传输映射,将扩展后的状态沿着插值向前推动。)
这两个操作符的组合,形成了一个强大的范式:
- 需要更多表达能力?扩展。
- 需要在时间上演化?传输。
- 需要同时做两件事?组合。
2.4 美丽的特例:固定画布是子集
论文指出了一个非常优雅的性质:
"Composing these operators yields a single map that jointly expands and denoises the state, recovering existing fixed-canvas flows and flow maps as the special case in which the expand operator is the identity."
(组合这些操作符产生一个同时扩展和去噪状态的单一映射,在扩展操作符为恒等映射的特殊情况下,恢复现有的固定画布流和流映射。)
这意味着:传统的固定尺寸流模型,只是 Expanding Flow Maps 的一个特例。
当扩展操作符什么都不做(恒等映射)时,EFMs 就退化为普通的流模型。这就像牛顿力学是相对论在低速情况下的近似。
这种"包含关系"是一个好理论的标志:它不仅解释了新的现象,还把旧的理论作为特殊情况统一进来。
🏗️ 第三章:从连续到离散——扩展流的普适性
3.1 连续空间的优雅
在连续空间(如图像、音频)中,扩展流的直觉很直接:状态是一个向量,扩展就是增加向量的维度。
但论文的野心不止于此。它进一步把框架扩展到了 离散空间。
3.2 离散简单x上的流:图的诞生
离散数据的生成是一个更棘手的问题。
想象你要生成一个 图(graph)——不是图像,而是节点和边组成的结构,比如社交网络、分子结构、知识图谱。
图的生成有几个独特的挑战:
- 变长:图可以有任意数量的节点
- 结构化:节点之间的关系(边)和节点本身同样重要
- 置换不变性:交换两个节点的标签不应该改变图的本质
论文提出,可以把图生成看作在 离散单纯形(discrete simplex) 上的流。
什么是离散单纯形?
想象你有k个可能的类别(比如不同类型的原子),你要为每个节点选择一个类别。所有可能的分配方案构成了一个"概率单纯形"——一个在高维空间中的几何形状,其中每个点代表一个概率分布。
扩展流在这个场景下的意思是:图的生成过程可以随着需要增加节点数量。从一个空图(或者一个小种子图)开始,模型可以决定"这里需要添加一个新节点",然后为新节点分配属性,再决定它应该和哪些已有节点连接。
3.3 可变长度序列:文本的呼吸
同样的框架也可以应用于 可变长度序列生成,比如文本。
传统的语言模型生成固定长度的token序列。如果你想生成长文本,需要特殊的技巧(如滑动窗口、KV缓存优化等)。
Expanding Flow Maps 提供了一种更自然的视角:文本的长度不是预先决定的,而是生成过程的 emergent property(涌现属性)。
模型从一个空序列(或者一个起始token)开始,每一步决定:
- 是否添加新的token(扩展)
- 如果添加,新token是什么(传输)
这就像一个作家在写作时,不是预先决定"我要写1000字",而是让故事自己决定它需要多长。
论文报告了在这两种离散场景下的实验结果:
"Across both continuous and discrete modalities, we establish EFlows and EFMs as a principled framework for settings in which output size is itself a learned, controllable degree of freedom."
(在连续和离散模态中,我们都建立了EFlows和EFMs作为一个原则性框架,适用于输出大小本身是一个可学习的、可控的自由度的场景。)
🧪 第四章:为什么这很重要?——五个维度的思考
4.1 维度一:计算效率
固定尺寸的模型有一个隐形成本:它们必须为"最大可能尺寸"分配资源。
想象你训练一个图像生成模型,目标是能生成1024×1024的图片。但你的训练数据中有很多小图标(128×128)。在传统的框架中,你必须把所有图标都上采样到1024×1024才能训练——这是巨大的计算浪费。
Expanding Flow Maps 允许模型在生成过程中 动态决定需要多少资源。小图标只需要小状态空间,大场景才需要扩展。这就像租房子:传统模型是"无论住几个人都租别墅",而EFMs是"需要多大租多大"。
4.2 维度二:创造性自由
在艺术创作中,限制往往是创造力的敌人。
固定画布迫使艺术家在开始之前就做出关于尺寸的决策。但很多时候,创作的探索过程本身会揭示"这幅画需要多大"。
EFMs 把"尺寸决策"从"生成前的规划"变成了"生成中的涌现"。模型可以在生成过程中"感觉"到需要更多空间来表达某个想法,然后自动扩展。
这类似于爵士乐的即兴演奏:乐手不会预先决定独奏要持续多少小节,而是让音乐本身引导长度。
4.3 维度三:多尺度生成
现实世界是多尺度的。
一个场景可能包含:
- 宏观:山脉的轮廓、天空的颜色
- 中观:树木的形状、房屋的结构
- 微观:树叶的纹理、石头的裂纹
传统的固定尺寸模型很难同时处理所有这些尺度。如果画布很大(1024×1024),微观细节的分辨率可能不够;如果画布小(256×256),宏观结构又放不下。
EFMs 提供了一种自然的多尺度处理方式:模型可以在不同的生成阶段操作不同的"有效分辨率"。早期阶段在较低维度上规划全局结构,后期阶段扩展到更高维度填充细节。
4.4 维度四:组合泛化
这是最深层的意义。
固定尺寸模型学到的,是"从噪声到特定尺寸数据的映射"。如果你想生成不同尺寸的数据,模型需要重新学习(或者至少重新调整)。
EFMs 学到的是更抽象的概念:如何逐步构建复杂结构,无论最终尺寸如何。
这就像学习数学:如果你只背了"3×4=12",你无法回答"30×40"。但如果你理解了乘法的本质,任何规模的问题都能解决。
EFMs 的"扩展操作"就是一种"结构性知识":它学到的不是"生成特定尺寸的数据",而是"如何在需要时增加表达能力"。
4.5 维度五:与物理世界的联系
有趣的是,EFMs 的设计与真实物理世界有深刻的共鸣。
物理定律是 尺度无关(scale-invariant) 的。牛顿定律既适用于苹果落地,也适用于行星绕日。流体动力学既适用于浴缸里的漩涡,也适用于星系中的旋臂。
这种尺度无关性来自于物理定律的"局部性":物理系统的演化只依赖于它当前的状态和局部环境,而不依赖于系统的总大小。
EFMs 的"扩展操作"也在尝试实现类似的性质:生成过程的每一步只依赖于当前的状态,而不需要预先知道最终输出的尺寸。
🌌 第五章:深层理论——为什么扩展是可能的?
5.1 维度的幻觉
有一个深刻的数学事实:在高维空间中,"维度"本身可能是一个幻觉。
想象你有一个1000维的数据集。表面上,它需要1000个数字来描述。但如果这些维度之间存在强烈的相关性(比如图像中相邻像素的值很接近),那么数据的"本质复杂度"可能远低于1000维。
这种"本质维度"通常被称为 流形维度(manifold dimension) 或 内在维度(intrinsic dimensionality)。
EFMs 的核心洞察可能与此相关:生成过程不需要在最高维度上进行,它只需要在"本质维度"上进行,然后在需要的时候扩展到完整维度。
这就像压缩感知(compressed sensing)的核心思想:如果信号是稀疏的,你可以在远低于奈奎斯特采样定理要求的速率下进行采样。
5.2 信息论的视角
从信息论的角度,扩展操作可以被理解为 条件信息添加。
当你从维度d扩展到维度d'时,你添加的(d' - d)个维度不是随机的,而是 以当前d维状态为条件的。这意味着:
H(新增维度 | 当前状态) < H(新增维度)
即:已知当前状态时,新增维度的不确定性降低了。
这保证了扩展是"有意义的"——新增的维度携带了与当前状态相关的信息,而不是纯粹的噪声。
5.3 与扩散模型的联系
细心的读者可能已经注意到:EFMs 与扩散模型(Diffusion Models)有深刻的联系。
扩散模型也是从一个简单分布(噪声)到一个复杂分布(数据)的变换。但传统扩散模型通常固定维度。
EFMs 可以看作是"可扩展的扩散模型"。在某些设置下(当扩展操作符是恒等映射时),EFMs 退化为标准的流模型或扩散模型。
但 EFM 的框架更通用,因为它允许:
- 维度变化
- 显式的"扩展决策"(模型可以学习"什么时候该扩展")
- 连续的扩展过程(维度可以平滑增加,而不是跳跃)
🎨 第六章:费曼式反思——膨胀的宇宙与收缩的思想
6.1 简单即通用
理查德·费曼在康奈尔大学的讲座中说过:
"There's plenty of room at the bottom."
(底层还有大量空间。)
他当时说的是纳米技术,但这个原则同样适用于维度。EFMs 表明,在"维度"这个最基本的层面上,还有大量的创新空间等待探索。
固定维度的假设如此根深蒂固,以至于我们几乎忘记了它是一个 选择,而不是 必然。
6.2 从"生成什么"到"生成多少"
生成模型领域长期关注的是"生成什么"(what to generate):图像的内容、文本的语义、音频的旋律。
EFMs 把焦点扩展到了"生成多少"(how much to generate):图像的尺寸、文本的长度、图的规模。
这个转变类似于从"绘画"到"雕塑":绘画是在固定平面上创作,而雕塑需要同时决定"创作什么"和"创作多大"。
6.3 涌现的尺度
最令我着迷的是 EFM 的 涌现性(emergence)。
在传统模型中,输出尺寸是一个 超参数,由人类在生成前设定。
在 EFM 中,输出尺寸是一个 涌现属性,由生成过程本身决定。
这就像是问:"一篇文章应该有多长?"
- 传统方法:"1000字。因为这是作业要求。"
- EFM方法:"它应该长到能把故事讲完。"
第二种答案更智能,但也更难以控制。EFMs 通过"可学习"和"可控"这两个限定词,试图在自由度和控制之间找到平衡。
6.4 终极愿景:无界创造
如果我们把 EFM 的思想推向极致,会得到什么?
一个 真正无界的生成模型:
- 可以从一个点开始,生成任意大小的图像
- 可以从一个token开始,生成任意长度的文本
- 可以从一个节点开始,生成任意复杂的图
- 可以从一个音符开始,生成任意时长的音乐
更重要的是,这个模型知道 什么时候该停。它不会无限扩展,而是在"表达完整"时自然地终止。
这就像一个真正智能的创作者:知道什么时候该多说,什么时候该沉默。
🔮 尾声:维度之外
Expanding Flow Maps 不仅是一篇技术论文。它是一个关于 自由 的宣言。
在深度学习的早期,我们被数据的维度所束缚。然后,我们学会了用深度学习处理高维数据。现在,EFMs 让我们开始质疑维度本身——不是作为一个固定的属性,而是作为一个可塑的、可学习的、可扩展的变量。
这让我想起费曼的另一个故事。据说有一次,一位学生问他:"为什么电子是费米子而不是玻色子?"
费曼想了一会儿,然后说:"我不知道为什么。但如果我们发现一个电子是玻色子,那整个宇宙都会不同。"
同样,如果我们发现生成模型不必受限于固定维度,那整个AI生成的世界都会不同。
想象一下未来的AI创作工具:
- 你描述一个场景,AI生成的不是一张固定尺寸的图片,而是一个可以无限放大的"世界"——缩略图看全貌,放大看细节,再放大看纹理
- 你写一个故事的开头,AI继续写下去,不是到某个预设的字数就停止,而是当故事"自然结束"时才停止
- 你设计一个分子,AI建议的原子数量不是固定的,而是根据功能需求动态确定
这些场景现在听起来像科幻。但 Expanding Flow Maps 已经把第一块砖铺在了通往这个未来的路上。
正如论文所展望的:
"...settings in which output size is itself a learned, controllable degree of freedom."
(......输出大小本身是一个可学习的、可控的自由度的场景。)
自由的维度。控制的维度。学习的维度。
这就是 Expanding Flow Maps 带给我们的礼物。
📚 参考文献
[1] Tang, S., & Chatterjee, P. (2026). Expanding Flow Maps. arXiv preprint.
[2] Lipman, Y., et al. (2022). Flow Matching for Generative Modeling. arXiv preprint arXiv:2210.02747.
[3] Ho, J., et al. (2020). Denoising Diffusion Probabilistic Models. NeurIPS.
[4] Rezende, D., & Mohamed, S. (2015). Variational Inference with Normalizing Flows. ICML.
[5] Liu, X., et al. (2022). Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow. arXiv preprint.
#论文解读 #ExpandingFlowMaps #生成模型 #流模型 #可变尺寸 #费曼风格 #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。