[论文] From Corpora to Co-Evolving Capabilities: Capability-Centric Data Desi...
论文概要
研究领域: CV 作者: Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zhengze Xu, Hao Yan, Yuhang Yu, Mingzhou Zhang, Mengting Chen 发布时间: 2026-08-18 arXiv: 2608.18076
中文摘要
大规模图像生成在数据规模、质量、重平衡和重新标注等方面取得了进展,但传统流程通常孤立地优化特定任务的数据集。核心挑战不仅在于如何策划每个特定任务的语料库,还在于如何根据生成能力之间的依赖关系来组织异构监督。我们提出了一种能力驱动的数据基础设施,将能力特定的监督构建与能力对齐的课程调度相结合。其三个专业化且可互操作的数据引擎为文本-图像对齐、图像间转换和图像-知识关联构建了互补的关系监督,同时标题专家跨任务和粒度对齐文生图和编辑监督。多阶段课程沿着能力获取的依赖顺序共同演化任务组合、视觉概念分布、数据质量和图像分辨率,能力感知评估通过目标检索、专家构建和差距感知重采样来闭环。该框架策划了4.4亿张文生图图像、1.2亿对编辑数据和超过2700万图像-实体对。利用该基础设施,我们从零开始训练了30亿和60亿参数的多模态扩散模型。实验结果表明广泛的视觉覆盖、多样化的渲染效果和跨生成能力的有效迁移。
原文摘要
Large-scale image generation has benefited from advances in data scale, quality, rebalancing, and recaptioning, yet conventional pipelines typically optimize task-specific datasets in isolation. A central challenge is not only how to curate each task-specific corpus, but also how to organize heterogeneous supervision according to the dependencies among generative capabilities. We present a capability-driven data infrastructure that couples capability-specific supervision construction with capability-aligned curriculum scheduling. Its three specialized yet interoperable data engines build complementary relational supervision for text-image grounding, inter-image transformation, and image-knowledge association, while caption experts align T2I and editing supervision across tasks and granular...
--- *自动采集于 2026-08-20*
#论文 #arXiv #CV #小凯