[论文] [论文] Expanding Flow Maps

研究领域: ML 作者: Sophia Tang, Pranam Chatterjee 发布时间: 2026-07-24 arXiv: 2507.19317

论文概要

研究领域: ML 作者: Sophia Tang, Pranam Chatterjee 发布时间: 2026-07-24 arXiv: 2507.19317

中文摘要

基于流的生成模型在连续和离散状态空间的快速可控生成方面取得了显著进展,但现有参数化受限于固定维度或固定序列长度。在此,我们引入了扩展生成流(EFlows),它定义了沿扩展插值分布之间维数递增的流,通过用条件噪声增强状态来增长状态。基于这一构建,我们提出了扩展流映射(EFMs),一类新的流映射,将扩展插值蒸馏为高效的少步生成模型。每个EFM将任意两个时间步之间的映射分解为两个可学习操作:扩展操作,基于当前状态用新坐标或Token增强状态空间;以及传输映射,将扩展状态沿插值向前推进。组合这些操作得到一个联合扩展和去噪状态的单一映射,恢复现有固定画布流和流映射作为扩展操作为恒等映射的特例。我们进一步将该框架扩展到离散单纯形,实现可变大小图生成和可变长度序列生成。在连续和离散模态中,我们将EFlows和EFMs确立为输出大小本身是可学习的、可控的自由度的有原则框架。

原文摘要

Flow-based generative models have enabled remarkable progress in fast and controllable generation across continuous and discrete state spaces, yet existing parameterizations are constrained to fixed dimensions or fixed sequence lengths. Here, we introduce Expanding Generative Flows (EFlows), which define flows between distributions of increasing dimensionality along an expanding interpolant that grows the state by augmenting it with conditional noise. Building on this construction, we propose Expanding Flow Maps (EFMs), a new class of flow maps that distill the expanding interpolant into efficient few-step generative models. Each EFM factors the map between any two timesteps into two learnable operations: an expand operator, which augments the state space with new coordinates or tokens con...


*自动采集于 2026-07-25*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

Expanding Flow Maps:让“输出有多大”成为可学习的自由度

——评 Sophia Tang、Pranam Chatterjee 的扩展流框架(arXiv: 2607.21585)

注:题中所给编号 2507.19317 实链至一篇范畴论论文,与本文主题不符;与其摘要在内容上完全吻合的,是 2026-07-23 提交的 2607.21585。以下按该文展开。

一、核心问题:画布为何总要先定好?

要讲清这篇论文,先得说清它想砸掉的“旧墙”。

近年,流匹配(flow matching)已成取代扩散模型的主流训练范式——它不模拟“逐步加噪”的随机过程,而是直接让网络回归一条把噪声“搬运”到数据的向量场(速度场)。白话讲:训练时取一对(噪声 x_0,数据 x_1),在时间 t 做线性插值 x_t=(1-t)x_0+t x_1,教网络预测指向终点的速度 (x_1-x_0);推理时沿这条常微分方程积分若干步,即得样本。Rectified Flow 再把路径“拉直”,少至一两步也能出好图;一致性模型(consistency model)则直接学“轨迹上任一点→终点”的映射,做到一步生成。

可这一切有个暗坑:状态维度 d 从头到尾被焊死。图像是固定画布 64×64×3,文本是定长 512 的 token 序列。但真实世界里,一张分子图该有几个原子、一句话该有多长,本该由生成过程自己拿主意。旧框架把“输出尺寸”当成先验超参,甩在模型之外——于是变尺寸图生成、变长度序列生成,要么靠自回归硬凑,要么靠后处理裁剪。尺寸与内容,被生生劈成两件事。痛点正在此处。

二、一句话洞见

现有流模型只在“固定维度的空间里搬运概率质量”;EFlows 把维度本身也变成一条会生长的轨迹——于是“输出有多大”不再是生成前定死的常数,而是生成途中由模型学习、且可调控的自由度。

三、通俗类比:边行军边筑路

把它想成一支边走边修路的队伍。

普通流模型,是两条固定端点之间的直通道,路宽不变——你从噪声城走到数据城,沿途路面宽度恒定。EFlows 却不同:队伍每前进一段,就依据当前地形,“长出”一段新路面(这便是 expand 算子),再把整支队伍沿路向前推进一段(这便是 transport 映射)。路不是预先铺好的,是走出来的;路面也不是一开始就全在,是边走边长出来的。

换个比方,更像晶体生长:新原子不是预先摆好的,而是依据已成型晶面的局部环境,在合适的位置附着上去。EFlows 的 expand 算子正是如此——依据当前状态,往里“长”出新的坐标或 token(以条件噪声初始化),再统一去噪结晶。

四、方法拆解:两个算子,一支复合笔

论文的精妙,在于把“扩容”与“去噪”这两件常被揉在一起的事,干净地分开。

1. 扩展插值(expanding interpolant):一条维度随 t 递增的插值路径。新坐标在各自的插入时刻 t_ins^i 以条件噪声形式注入(Gaussian noise tokens),此后随插值一同演化。

2. EFM 的因式分解:任意两时刻 s→t 的映射被拆成

Φ_{s,t}=X_{s,t}∘E_{s,t}

  • E_{s,t}(expand 算子):把状态从 d(s) 维提升到 d(t) 维。手段有三——拼接(concatenation)、位置插入、子节点扩展(child expansion,专给图结构用)。新插入的部分以“条件噪声”打底,按当前状态条件化。
  • X_{s,t}(transport 映射):沿插值把扩容后的状态去噪、推向目标分布。
3. 最巧一笔——局部时间坐标:

t_i = (t − t_ins^i)/(1 − t_ins^i)

不同坐标在不同全局时刻被插入,若共用全局时钟,它们的“去噪进度”会乱套;引入局部时间,让每个坐标都从自己被插入的那一刻起,在 [0,1] 上共享同一去噪钟。好比一栋楼的不同楼层,各自有一条“装修进度条”。

4. 一致性即合法性:论文证明,这个复合映射满足与 ordinary flow map 完全相同的 Lagrangian / Eulerian / semigroup 三类一致性恒等式。最关键的推论——当 expand 算子退化成恒等映射(啥也不加),EFM 就塌缩回现有的 fixed-canvas 流/流映射。换言之,旧方法是本框架的特例,而非被推翻。

5. PDMP 视角:两段式动态被包装成分段确定性马尔可夫过程(PDMP),生成元 = 传输项 + 跳跃核(插入即“跳跃”)。这给了整条扩展轨迹一个统一的生成过程,而非一串孤立的跳。

6. 离散扩展:搬到离散单纯形(simplex,即每个 token 取类别分布的多边形空间),便能在离散模态下做 few-step 生成——变尺寸图(分子图节点/边逐步“长”出)、变长度序列(语言 token 逐批补,无需预设定长)。

五、实验与结论

论文在三类任务上铺开:分子构象、分子图、文本。分子图对比 DeFoG 等基线,EFM 的 FCD 落在 0.44 vs 0.49 区间,具竞争力;文本(LM1B)演示了单步与两步生成,两步已可堪一用。核心结论:连续与离散模态下,EFlows/EFMs 是一套“输出大小为可学习自由度”的、有原则(principled)的框架。

六、意义与局限

意义显而易见:首次把流建模系统性地扩到可变维状态空间;“输出尺寸”成为可控旋钮,与可控生成、生成式 scaling 直接呼应。

局限(含外部评审指正)也得说清:

  • 离散 Eulerian 恒等式依赖的 Assumption A5 在类型上未良定义(潜状态上插 Gaussian,与 simplex 输出类型不匹配),证明有缺口;好在训练用的 semigroup 目标不依赖 A5,方法主体或仍成立。
  • 单步语言生成在 LM1B 上出现 mode collapse(困惑度 98.35、熵偏低),削弱其“一步出文”的声量。
  • 主表均无误差棒(单跑),临界差值的统计意义未验证;插入 schedule、先验尺度等超参多为手工调,缺原理推导。

七、延伸思考

  • 与生成模型 scaling:旧范式的“规模”指参数与数据;EFlows 把“输出结构规模”也纳入可学习变量,仿佛给模型装上一枚“自行决定画多大画布”的旋钮。
  • 与自回归/可控生成:自回归天然变长却串行慢;EFlows 用 few-step 并行扩展,试图兼得两者之长——快,且长短由己。
  • 一个可检验的延伸:若让 expand 算子对称地支持“删除”,同一 PDMP 框架便能处理推理中收缩的输出;把插入噪声分布也设为可学习,或许正是缓解语言单步 collapse 的那把钥匙。
费曼有言:若你不能浅出,便算不得真懂。这篇论文的“浅出”之处正在——它把“该生成多大”这件常被忽略的事,重新请回了生成过程的正中央。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens