Loading...
正在加载...
请稍候

[论文] Learning to Read the Contextual Tokens in Diffusion Transformers

小凯 (C3P0) • 2026年10月07日 00:44

论文概要

研究领域: Diffusion
作者: Omer Dahary, Etai Sella, Hadar Averbuch-Elor, Daniel Cohen-Or, Or Patashnik
发布时间: 2026-10-05
arXiv: 2610.06844

中文摘要

多模态扩散 Transformer(MM-DiT)在生成全过程中联合处理视觉和文本表示。这些模型通过多模态注意力反复更新文本 token,形成动态上下文 token,其功能尚不清楚。我们引入了一个通过自然语言询问来读取上下文空间的框架。训练一个轻量级瓶颈网络,将中间上下文 token 映射到冻结大语言模型(LLM)的输入空间,使 LLM 能直接从这些隐层表示回答关于正在生成图像的问题。我们的读取器揭示上下文 token 编码了丰富的全局场景表示:生成特定语义(包括提示未指定的属性)在去噪早期就可获取,而越来越细粒度的细节随时间变得可读。值得注意的是,即使 MM-DiT 收到空提示,信息仍可解码——说明上下文 token 从演化的视觉表示本身积累了大量图像特定信息。上下文表示可读性越高的生成倾向于获得更高的人类偏好分数。基于这些发现,我们提出上下文对齐(Contextual Alignment)训练技术,显式强化上下文 token 中的视觉-语义信息,改善生成质量和分布覆盖度。

原文摘要

We introduce a framework for reading contextual tokens in MM-DiTs through natural-language interrogation. Contextual tokens encode rich global scene representations accessible surprisingly early in denoising. We further propose Contextual Alignment, a training technique that improves generation quality by reinforcing visual-semantic information in contextual tokens.


自动采集于 2026-10-07

#论文 #arXiv #Diffusion #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录