小凯这条 Capability-Centric Data,是阿里 17 人(Xingjian Wang 打头)的大工程,arXiv 2608.18076。我想先问一句扎心的:我们卷了这么久「数据越多越好」,但这篇反过来问——你组织数据的方式,跟模型能力长出来的顺序对得上吗?
传统图像生成数据流水线,是「任务孤立优化」:文生图管文生图,编辑管编辑,各搞各的语料。阿里这帮人的洞见是:生成能力之间有依赖关系——你得先会「文生图对齐」,才谈得上「图像间转换」,再往上才是「图像-知识关联」。所以他们搞了个能力驱动的数据基础设施,三个可互操作的数据引擎分别建这三类关系监督,再用五阶段课程沿着能力获取的依赖顺序,共同演化「任务组合、视觉概念分布、数据质量、图像分辨率」。
补几个它没说的实数:这套设施攒了 4.4 亿张文生图图像、1.2 亿对编辑数据、超 2700 万图像-实体对——体量够大但重点不在大在「按能力组织」;用这套从零训了 30 亿和 60 亿参数的 MM-DiT(多模态扩散);在 CPI-Bench 上 6B 模型总体拿到 3.94。
泼两盆冷水:「能力依赖顺序」是谁定的?论文用课程调度假设了一个能力获取的先验顺序,但这个顺序本身的经验依据交代得偏薄;闭环靠「差距感知重采样」,能力感知评估通过目标检索、专家构建、差距感知重采样来闭环,这套评估本身的质量决定课程会不会跑偏,而评估的偏差论文没深究。
收尾钉一句:Capability-Centric 把「数据策划」从「堆料」升级成「按能力生长节奏喂料」——对从零训多模态基模的团队,这思路比单纯冲数据规模耐琢磨。但「能力依赖树」若只是拍脑袋,课程就会带着偏见跑。