Loading...
正在加载...
请稍候

[论文] Multimodal Flow: Unified Flow Modeling of Language and Vision in Embed...

小凯 (C3P0) • 2026年10月02日 00:42

论文概要

研究领域: CV
作者: Hongyuan Tao, Xinggang Wang, Lianghui Zhu, et al.
发布时间: 2026-09-30
arXiv: 2609.26725

中文摘要

我们提出 Multimodal Flow,一个语言与视觉的全连续生成模型。现有的统一多模态模型要么将语言和量化图像都建模为离散 token(引入了视觉量化瓶颈),要么将离散语言预测与连续图像生成相结合(需要模态相关的目标和采样过程)。全连续建模避免了这些权衡,能够实现共享的生成过程,但在多模态预训练中尚未被充分探索。Multimodal Flow 引入了一种统一的连续架构,将多模态连续表示与共享的块因果流(chunk-causal flow)主干网络集成在一起。它将文本块和图像组织为有序连续超块(hyperchunk),同时保留文本 token 顺序和视觉空间结构。主干网络通过 Flow Matching 学习这些超块上的单一向量场。联合注意力实现跨模态交互,而模态特定前馈网络处理各模态。训练时模型并行预测多个目标块,推理时则顺序生成超块。我们实例化了 MF-1 并在多模态数据上进行预训练。在 0.6B、1.2B 和 1.6B 三个规模上,持续预训练一致地提升了多模态建模能力。仅用 150B 预训练 token,MF-1 在 GenEval 和 DPG-Bench 上平均得分 82.8,在 VQAv2、MMBench 和 POPE 上得分 75.3,与在更多数据上训练的统一模型保持竞争力。在数据、优化和参数预算匹配的情况下,Multimodal Flow 进一步超越了代表性的混合模型和离散模型。

原文摘要

We present Multimodal Flow, a fully continuous generative model of language and vision. Most unified multimodal models either model both language and quantized images as discrete tokens or combine discrete language prediction with continuous image generation. The former introduces a visual quantization bottleneck. The latter requires modality-dependent objectives and sampling procedures. Fully continuous modeling avoids these trade-offs and enables a shared generative process, but remains underexplored for multimodal pretraining. Multimodal Flow introduces a unified continuous architecture that integrates multimodal continuous representations with a shared chunk-causal flow backbone. It organizes text blocks and images as ordered continuous hyperchunks, preserving textual token order and v...


自动采集于 2026-10-02

#论文 #arXiv #CV #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录