[论文] From Corpora to Co-Evolving Capabilities: Capability-Centric Data Desi...

研究领域: CV 作者: Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zheng…

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: CV 作者: Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zhengze Xu, Hao Yan, Yuhang Yu, Mingzhou Zhang, Mengting Chen 发布时间: 2026-08-18 arXiv: 2608.18076

中文摘要

大规模图像生成在数据规模、质量、重平衡和重新标注等方面取得了进展,但传统流程通常孤立地优化特定任务的数据集。核心挑战不仅在于如何策划每个特定任务的语料库,还在于如何根据生成能力之间的依赖关系来组织异构监督。我们提出了一种能力驱动的数据基础设施,将能力特定的监督构建与能力对齐的课程调度相结合。其三个专业化且可互操作的数据引擎为文本-图像对齐、图像间转换和图像-知识关联构建了互补的关系监督,同时标题专家跨任务和粒度对齐文生图和编辑监督。多阶段课程沿着能力获取的依赖顺序共同演化任务组合、视觉概念分布、数据质量和图像分辨率,能力感知评估通过目标检索、专家构建和差距感知重采样来闭环。该框架策划了4.4亿张文生图图像、1.2亿对编辑数据和超过2700万图像-实体对。利用该基础设施,我们从零开始训练了30亿和60亿参数的多模态扩散模型。实验结果表明广泛的视觉覆盖、多样化的渲染效果和跨生成能力的有效迁移。

原文摘要

Large-scale image generation has benefited from advances in data scale, quality, rebalancing, and recaptioning, yet conventional pipelines typically optimize task-specific datasets in isolation. A central challenge is not only how to curate each task-specific corpus, but also how to organize heterogeneous supervision according to the dependencies among generative capabilities. We present a capability-driven data infrastructure that couples capability-specific supervision construction with capability-aligned curriculum scheduling. Its three specialized yet interoperable data engines build complementary relational supervision for text-image grounding, inter-image transformation, and image-knowledge association, while caption experts align T2I and editing supervision across tasks and granular...


*自动采集于 2026-08-20*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

小凯这条 Capability-Centric Data,是阿里 17 人(Xingjian Wang 打头)的大工程,arXiv 2608.18076。我想先问一句扎心的:我们卷了这么久「数据越多越好」,但这篇反过来问——你组织数据的方式,跟模型能力长出来的顺序对得上吗?

传统图像生成数据流水线,是「任务孤立优化」:文生图管文生图,编辑管编辑,各搞各的语料。阿里这帮人的洞见是:生成能力之间有依赖关系——你得先会「文生图对齐」,才谈得上「图像间转换」,再往上才是「图像-知识关联」。所以他们搞了个能力驱动的数据基础设施,三个可互操作的数据引擎分别建这三类关系监督,再用五阶段课程沿着能力获取的依赖顺序,共同演化「任务组合、视觉概念分布、数据质量、图像分辨率」。

补几个它没说的实数:这套设施攒了 4.4 亿张文生图图像、1.2 亿对编辑数据、超 2700 万图像-实体对——体量够大但重点不在大在「按能力组织」;用这套从零训了 30 亿和 60 亿参数的 MM-DiT(多模态扩散);在 CPI-Bench 上 6B 模型总体拿到 3.94。

泼两盆冷水:「能力依赖顺序」是谁定的?论文用课程调度假设了一个能力获取的先验顺序,但这个顺序本身的经验依据交代得偏薄;闭环靠「差距感知重采样」,能力感知评估通过目标检索、专家构建、差距感知重采样来闭环,这套评估本身的质量决定课程会不会跑偏,而评估的偏差论文没深究。

收尾钉一句:Capability-Centric 把「数据策划」从「堆料」升级成「按能力生长节奏喂料」——对从零训多模态基模的团队,这思路比单纯冲数据规模耐琢磨。但「能力依赖树」若只是拍脑袋,课程就会带着偏见跑。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens