Qwen-Image-2.1 深度专栏:第四通道——当模型学会"不碰"
一张 2048×2048 的图,有 4,194,304 个像素。如果它带透明背景,那么除了红、绿、蓝三组数,每个像素还要多出 8 个比特。单独这一个通道,未经压缩就是约 4 MB 的信息。
第四通道:当模型学会"不碰"
先做一道算术题,不用草稿纸。
一张 2048×2048 的图,有 4,194,304 个像素。如果它带透明背景,那么除了红、绿、蓝三组数,每个像素还要多出 8 个比特。单独这一个通道,未经压缩就是约 4 MB 的信息。
这 4 MB 里没有颜色,没有形状,也没有光线。它只记录一件事:这个像素,算不算数。
做过设计的人对这件事的记忆比数字具体。主图要白底,详情页要透明底,海报要把人从背景里切出来,Banner 可能还要单独抠出产品。同一张照片,四个去处,抠四遍。套索沿着头发丝走,魔棒在边界上抖,最后放大到 800% 手动修边缘那圈灰色像素——因为自动分界线总要留下一道半透明的光晕,像撕开的贴纸背面。
2026 年 9 月 20 日,阿里通义千问团队开源的 Qwen-Image-2.1,把目标对准的正是这个动作。视觉生成部分 7B 参数,32 层单流 DiT,文生图与图像编辑收进同一套权重,原生支持 RGBA——透明不再是生成之后的一道工序,而是生成结果本身的一种属性。官方博客的四个改进条目里,"原生透明"排在第二位。(qwen.ai/blog?id=qwen-image-2.1)
同一天,同一个仓库里还放着一份 LICENSE 文件。那份文件指的方向,与这个模型的技术方向恰好相反。
🎛️ 减去七分之五:参数都去哪了
2025 年 8 月首发时,Qwen-Image 是 20B 参数,MMDiT 双流架构,Apache 2.0 许可。(Qwen-Image Technical Report, arXiv:2508.02324;架构、参数量与许可为公开可查事实)十三个月之后的这一版,视觉生成部分只剩 7B。
三分之二不见了。这件事本身值得停下来问一句:消失的是什么?
双流与单流的差别,用一句话说:文本和图像在每一层里,是各自带着一套权重走,还是共用一套权重走。
SD3 的 MMDiT 选择前者。每个 transformer 块里,文本流和图像流各有自己的 LayerNorm、QKV 投影、输出投影和 MLP,两股流只在联合注意力那一步相遇。这个设计有它的道理——文本是离散的语义符号,图像是连续的空间潜变量,让它们从一开始就在同一个矩阵里乘法,模型得额外花力气学会"别把两者混起来"。(Esser et al., SD3, 2024)
代价是参数。同一宽度下,双流块里每一项都要备两份。(Demystifying Flux Architecture, arXiv:2507.09595)FLUX.1 的处理办法是折中:57 个块里,前 19 个用双流,后 38 个换成单流,把两套权重的开销限制在局部。
Qwen-Image-2.1 走的是更彻底的一条。官方 README 的架构描述里只有一个 Transformer 条目:32 层,7B 参数,单流,block-causal 注意力。没有双流段。(github.com/QwenLM/Qwen-Image-2.1)
这条路有人系统地走过。DiT-Air 那项工作的结论是:参数高效的单流 DiT 配自适应 LayerNorm 和共享 QKV/MLP,在大规模下能保持与双流相当甚至更好的表现,模型体积可减少约 66%;进一步共享注意力权重、只保留逐层独立的 MLP,参数量还能往下压。(Chen et al., DiT-Air, 2025-03,转引自 Emergent Mind 的架构综述)
66% 这个数字,和 20B 到 7B 差不多是同一个量级。
但有一处不能略过。7B 只是视觉生成部分。整条推理管线还要额外加载一个 8B 的 Qwen3-VL 文本编码器,它把文本指令和条件图像编码成统一表示。(官方 README)所以"7B 模型"这个说法,指的是扩散主干,不是端到端的总量。做显存规划的时候,这个区别会直接变成几 GB。
Qwen-Image 家族:13 个月的能力清单与体积
下面这张表列出该系列从首发到 2.1 各版本的参数量、许可与新增能力。
| 版本 | 时间 | 视觉主干 | 许可 | 这一版新增了什么 |
|---|---|---|---|---|
| Qwen-Image | 2025.08 | 20B MMDiT | Apache 2.0 | 中英文字渲染;九项基准第一 |
| Qwen-Image-Edit | 2025.08 | 20B 系 | Apache 2.0 | 独立编辑模型;双语文字改写 |
| Qwen-Image-Edit-2509 | 2025.09 | 20B 系 | Apache 2.0 | 多图输入;一致性提升 |
| Qwen-Image-Layered | 2025.12 | VLD-MMDiT | Apache 2.0 | RGBA 分层分解 |
| Qwen-Image-2512 | 2025.12 | 20B 系 | Apache 2.0 | 人物描绘与面部细节 |
| Qwen-Image-Edit-2511 | 2025.12 | 20B 系 | Apache 2.0 | 编辑一致性 |
| Qwen-Image-2.0 | 2026.02 | 7B | 未见明确公开记录 | 生成与编辑统一;原生 2K |
| Qwen-Image-2.1 | 2026.09.20 | 7B 单流 DiT | Qwen Research License | 原生 RGBA;10 张参考图;混合粒度注意力 |
参数量砍掉三分之二,能力清单反而变长了。这两件事同时成立,说明这一年的主要工程进展不在"更大的模型",而在"更会省的模型"。
而省得最狠的地方,不在参数量上。
🔍 混合粒度:为什么最贵的那部分只算一次
去噪过程是一遍一遍地重复同一件事:拿一张满是噪声的潜变量,减掉一点噪声,再减掉一点,四十次之后得到图。
每一遍都要把序列里所有 token 过一遍注意力。而序列的构成是:前面一段条件(系统前缀、编辑指令、参考图的视觉 token),后面一段待去噪的潜变量。参考图越多,前面那段越长。
问题在这里:前面那段条件,在四十步里一个字节都没变。但标准做法是每一步都重新算一遍它的 K 和 V。这就像每翻一页书都要把前面所有页重读一次。
在这类序列结构里,缓存能成立的前提是前缀本身保持不变;而"不变"这件事不会自己发生,需要注意力结构先给出保证。
Qwen-Image-2.1 的做法是把注意力拆成两种粒度。文本 token,包括系统前缀和编辑指令,用 token 级因果掩码;图像生成部分用 chunk 级掩码(同一张图的块内双向)。官方 README 把掩码条件写成一行:
(q_idx >= kv_idx) or same_image_block
这个式子说的是:一个 query 位置能看见某个 key 位置,当且仅当——要么 key 排在 query 前面(因果允许),要么两者属于同一张图的同一个块(双向允许)。
关键在于条件前缀在序列里的位置。它排在待去噪的潜变量之前。而掩码的第一条是因果的,所以前缀里的 token 永远不可能 attend 到它后面的东西。既然它看不见后面,后面怎么变都影响不到它的 K 和 V。
这不是"近似得还可以",是数学上的恒定。 前缀的 KV 可以只在第一步算一次,之后四十步直接用。官方把这一步叫作 prefix KV cache reuse:输入图像与编辑指令作为静态上下文,首步预计算并缓存,用于后续所有去噪步。(官方博客)
同样的问题,另一个领域给出的答案不一样
扩散语言模型(DLM)也遇到过同一道题,解法却完全不同。BICACHE 那篇论文的第一句话就把困难说清了:在双向注意力下,更新任何一个 token 都会动态改变整个上下文和对应的 KV,所以为大语言模型设计的共享前缀缓存会污染共享前缀的 KV。作者的实验显示,把这类技术直接搬到 DLM 上,模型准确率"崩到近零"。(Go et al., BICACHE, arXiv:2606.07571)
他们观察到共享前缀在真实负载里占 prompt token 的 85%–97%,所以这个问题值得做。最终的方案是动态找出可以安全复用 KV 的浅层层数,把服务吞吐提升 36.3%–98.3%,准确率差 0–1.8%。
对比着看,两条路的差别在"放弃什么"上:BICACHE 放弃深层的复用(只复用浅层,且以 0–1.8% 的准确率差为代价);Qwen 的做法不放弃任何位置,代价是把原本统一的注意力规则拆成两套粒度规则,让需要缓存的那部分精确地落在因果的一侧。
【推论】把双向注意力改成分粒度掩码,会限制图像 token 与前缀 token 之间的交互方式。文本前缀因此看不到图像块内部的发展——这是设计上主动接受的不对称,换来的是无损缓存。
省下的量级
官方没有披露确切的 token 数,也没有给出实测的加速比。可以确定的只是结构:省下的重复计算量,正比于条件序列的视觉 token 总数乘以去噪步数;参考图越多、步数越多,省得越多。官方博客对优势位置的表述是"在多图输入场景中尤其明显"【直引】,这与上面的结构一致。
【推论】量级估算:按 Qwen3-VL 系列常见的 28×28 视觉 patch 习惯推算,一张 2048×2048 的参考图约产生 (2048/28)² ≈ 5,350 个视觉 token;十张约 53,500 个。四十步去噪若每步重算,冗余量级在百万 token 次。这个数字依赖我对 patch 尺寸的假设,官方未公布实际数值,只能当作量级感的参照。
三种注意力规则各自的可缓存性
下表列出三种注意力规则下,一个 query 位置能看见哪些位置,以及条件段的 KV 在多次去噪之间是否会变。
| 规则 | 谁看谁 | 条件段的 KV 在去噪中变不变 | 能不能跨步缓存 |
|---|---|---|---|
| 全因果(GPT 式) | 只能看前面 | 不变 | 能,且无损 |
| 全双向(BERT 式) | 互相都能看 | 每步都变 | 不能,硬套会崩 |
| 分粒度(Qwen-Image-2.1) | 文本因果;图像块内双向 | 不变(前缀落在因果一侧) | 能,且无损 |
🫥 第四通道:从"生成后抠"到"生成时就有"
透明这件事,学术界啃了不止一年。
2024 年 2 月,张吕敏和 Maneesh Agrawala 提出 LayerDiffuse,核心概念叫"潜透明度"(latent transparency):把 alpha 通道的透明度信息编码进预训练潜扩散模型的潜流形里。关键手法是调节方式——透明度被当作一个"潜偏移量"(latent offset)加入,对原模型潜分布的改动被压到最小。这样任何潜扩散模型都能通过微调被改造成透明图生成器。(Zhang & Agrawala, arXiv:2402.17113)
他们用人工介入的收集流程攒了 100 万对透明图层做训练。用户研究的结论是:在 97% 的情况下,用户更偏好原生生透明内容,而不是"先生成再抠图"这类事后方案;用户还报告生成质量与真实商业透明素材(如 Adobe Stock)相当。
那个 97% 值得多想一秒。它说明"事后抠图"在质量上是系统性落后的,不是偶尔出问题。原因不难理解——抠图工具看到的是一张已经画完的图,它只能猜哪些像素属于前景;而原生透明的模型在画的时候就一直知道自己在画什么。
从"多一个模型"到"多一个通道"
2025 年 12 月 17 日,Qwen 团队发布 Qwen-Image-Layered,把这件事往前推了一大步。它不再只生成一张透明图,而是把单张 RGB 图像端到端地分解成多个语义解耦的 RGBA 层,每一层都能被独立操作而不影响其他内容。(Yin et al., arXiv:2512.15603)
支撑它的是三个部件:一个 RGBA-VAE,把 RGB 图像和 RGBA 层的潜表示统一到同一个空间;一个 VLD-MMDiT(Variable Layers Decomposition MMDiT),能分解可变数量的图层;以及一套多阶段训练策略,把预训练的图像生成模型改造成多层分解器。训练数据从 Photoshop 的 PSD 文件里提取和标注——因为高质量多层图像本身就稀缺,得从专业设计师的工作文件里挖。(同上)该版本以 Apache 2.0 发布。
Qwen-Image-2.1 做的事情,是把这项能力并进统一模型。
区别在于形态。Layered 是一个独立模型,你要用它就得再多加载一套权重;2.1 里透明只是一个通道——VAE 是 64 通道的 RGBA 自编码器,16 倍空间压缩,原生支持透明。(官方 README)
64 通道,16 倍压缩。这两个数字放在一起,可以还原出模型实际在操作什么:一张 2048×2048×3 的图,被压成 128×128×64 的潜表示【推论:通道数与压缩比出自官方 README,具体形状比由两者直接推得】。模型真正"画"的不是 419 万个像素,是 16,384 个位置、每个位置 64 个数的张量。alpha 不是被单独预测出来的,它是这 64 个数共同决定的一个结果——官方未披露 alpha 在这 64 个通道中的具体编码方式,此处是对"原生支持透明"这一表述的结构性理解【推论】。
透明图像生成的三代路径
下面这张表列出三代做法各自把"透明度"放在了流程的哪个位置。
| 代际 | 代表实现 | 透明度住在哪 | 用户拿到的接口 |
|---|---|---|---|
| 生成后抠图 | 生成模型 + matting 工具 | 模型之外 | 两个工具串起来 |
| 潜透明度 | LayerDiffuse(2024) | 潜空间里的一个偏移量 | 一个模型,一个开关 |
| 分层分解 | Qwen-Image-Layered(2025.12) | RGBA-VAE 潜表示 + 可变层数 | 一个模型,N 个图层 |
| 统一通道 | Qwen-Image-2.1(2026.09) | 64 通道 VAE 中的一个通道 | 一个模型,提示词决定 |
【判断】抠图难的地方,从来不是把像素切开——Photoshop 三十年前就能切开。难的是知道该在哪里切,而"该在哪里切"是个语义问题,不是像素问题。所以这条路径的共同方向,是把"这两个东西是分开的"这个判断,从外挂工具挪进模型的内部表示。
一个诚实的边界
官方 README 给出了透明生成的推荐提示词模板:
This is an RGBA image with transparency. . The image has alpha channel and the background is transparent. 模板的前后两句是固定的,只有中间那句话由用户填写。
【判断】需要一句固定咒语来告诉模型"我要透明",说明在训练分布里,透明仍然是一个要被显式点名的模式,而不是一个能从上下文自动推断出来的常识。这是个边界,不是缺陷,它标出的是当前能力所在的位置。
还有一个边界藏在本地编辑的例子里。Qwen-Image-2.1 支持用彩色圆圈、画笔标注或独立 mask 指定编辑区域。官方展示的一个例子是:蓝色圆圈里去掉金属手表,红色圆圈里把头发改成黑色,绿色圆圈里把衣服换成灰色短袖亚麻睡衣——一次指令,三个区域。(官方博客)
圆圈很方便。但圆圈框住手表的时候,也会一并框住手腕的皮肤和衬衫袖口,模型得自己判断哪些像素该动【推论】。
【判断】三种交互里,独立 mask 是最诚实的一种。它不假装理解区域边界,而是让用户把边界直接画出来。官方也给了这个方案的位置:圆圈和画笔标注会遮挡部分原始内容,所以模型同时接受"原图 + 独立 mask"作为两个输入。(官方博客)
🧩 十张参考图:一致性的两种做法
多参考图合成是这条赛道上最难的一关,难点有个专门的名字:概念渗漏(concept bleeding)——参考物体的颜色渗进参考人物的头发,参考衣服的质感跑到参考鞋子上。
DreamO 给出的解法是约束注意力。他们对模型的交叉注意力图施加 MSE 损失,逼模型把参考图的 token 只路由到生成潜空间里该物体应该出现的空间位置。路由一旦稀疏,属性就不容易跨主体流动。他们还用了三阶段渐进训练:先建立单主体的高保真复制能力,再进入多任务多条件训练,最后用高质量合成数据做一轮"美学复位",把被网络爬取数据拉低的原始生成质量找回来。(Mou/Wu et al., DreamO, arXiv:2504.16915)
数据规模:身份任务 21 万对,主体任务 20 万对以上,试穿任务 50 万对模型-服装配对。多主体一致性测试的 CLIP-sim 得分 0.7775,对比 MS-Diffusion 的 0.7686,同时文本遵循度没有被牺牲。(同上,转引自项目解读)
字节的 UNO 走的是另一条:不额外设计约束,而是先做一个高一致性的数据合成管线,利用扩散 transformer 本身的内上下文生成能力造出多主体配对数据,再让模型从单主体泛化到多主体。ICCV 2025 接收。(bytedance/UNO)
Qwen-Image-2.1 的路线更接近后者:把参考图当条件 token 直接放进统一序列,用结构(混合粒度掩码)而不是用额外的约束损失来处理它们。官方给出的三个上限例子是:六张单人肖像合成一张合影、五张参考(模特、衣服、鞋、包、帽)拼出一套完整穿搭、十张家具图生成一个完整房间布置。(官方博客)
能接收十张,不等于能调和十张
下表列出参考图数量与官方承诺、以及目前可核查的反馈之间的关系。
| 参考图数量 | 官方定位 | 可核查的反馈 |
|---|---|---|
| 1 张 | 单图编辑 | 提示词遵循最好的区间之一(社区报告) |
| 2–4 张 | 常用多图组合 | 社区报告称此区间提示词遵循仍然良好 |
| 5 张 | 官方展示的虚拟试穿案例(模特+衣+鞋+包+帽) | 处在社区报告所说的分界线上 |
| 6–10 张 | 官方展示的合影与室内布置 | 社区报告称超过 5 张后,模型倾向优先主主体,并混合次要条件图的风格细节 |
另一个被转述的早期信号是暖色偏移:不加负向提示时,人像和户外场景带有轻微的黄或暖琥珀色调。同一来源提到,在 15 条困难提示词的压力测试中,Qwen-Image-2.1 通过 7 条,对比同一测试下 Ideogram 4 通过 8 条、原版 Qwen-Image 1.0 通过 4 条。(转述来源:saascity.io 的本地部署指南,未披露测试脚本)
【判断】这些数字我不建议直接引用。它们来自一处二手汇总,样本小、口径未公开、且是第三方自设测试。摆在这里的理由不是让你信,是让你知道公开材料里存在哪些待验证的信号。
📊 60.28 分:谁在谁的考场上
官方博客放出的评测对比图里,Qwen-Image-2.1 的 Qwen-Image-Bench 总分为 60.28。
放在它旁边的是:Nano Banana 2.0 的 59.82,FLUX 2 Max(32B)的 55.33,以及六个分数更高的闭源模型,最高的是 GPT Image 2.5 Sunburst 的 67.01。按多家转述,它在 29 个受测模型中排第七。(转述来源:pondero.ai、traictory.com,均引官方榜单)
社群传播最广的一句话是"超越 Nano Banana"。
这句话的适用范围,取决于一个前置问题:Qwen-Image-Bench 是谁的考场。
口径第一问:同任务吗
Qwen-Image-Bench 把生成与编辑合成为一个总分。总分高不等于两项都高。一个在生成上领先、在编辑上落后的模型,和一个两项均衡的模型,可能拿到相近的总分。
口径第二问:同模型吗
榜单上的"Nano Banana 2.0"需要先拆清。Nano Banana 2 的实际模型是 Gemini 3.1 Flash Image(2026 年 2 月),而 Nano Banana Pro 是 Gemini 3 Pro Image,是两个不同模型。比较对象是哪个,直接影响结论。(orcarouter.ai、futuretweets.com 的规格汇总)
口径第三问:同轮次与预算吗
各家推理步数、guidance 配置、是否启用提示词改写,官方未披露。这一问在 Qwen-Image-2.1 这里格外要紧:官方专门发布了两个提示词改写模型(基于 Qwen3.5-VL 9B 微调,分文生图版和编辑版),并明确"推荐使用"。(官方 README)那么榜单分数是在有 PE 还是无 PE 的条件下得到的,会显著影响可比性。
口径第四问:口径取标题还是小字
"开源第一""超越 Nano Banana"都是从同一张图里读出来的。图上没有写各家的硬件、步数、CFG 设置。
口径第五问:用的是哪个子集
29 个模型。考场由阿里设计与执行。
换成第三方口径,画面是什么样
学术界的常用口径是 GEdit-Bench-EN(真实用户编辑请求)与 ImgEdit-Bench(九个任务族:增、调、抽、替、删、背景、风格、混合、动作)。评分为语义一致性、感知质量、总分三项,由 GPT-4.1 打分。
在 FireRed-Image-Edit 的技术报告里,Qwen-Image-Edit-2511 的 GEdit-EN 总分 8.297、GEdit-CN 8.202;同一张表上 FireRed 自己 8.363 与 8.245,Qwen-Image-Edit-2509 是 7.974 与 7.714。(arXiv:2602.13344)
这类数字同样是各家自报,但任务分解方式和评分协议是公开的,可复核性比总分图高一档。
另一个参照是 Artificial Analysis 的盲测竞技场。截至 2026 年 9 月 17 日的快照,文生图榜前三分别是 GPT Image 2.5 Flare(1186)、Sunburst(1180)、GPT Image 2(1169)。Qwen-Image 系列——包括 2.1 和未发布的 3.0——不在这个榜上。(futuretweets.com 引 Arena 快照)
【判断】不在榜上不等于差。它只意味着这些模型没有进入该榜的投票样本,所以跨场地比较目前缺少一份独立数据。这一格和前面 2.0 架构那一格一样,属于"没查到",不属于"被证伪"。
四种口径的对照
下表列出各评测口径的执行方、测量对象,以及基于它可以说与不可以说什么。
| 口径 | 谁在做 | 测什么 | 可以说什么 | 不可以说的话 |
|---|---|---|---|---|
| Qwen-Image-Bench | 阿里自设自跑 | 生成+编辑合成总分 | 在同一次考试中,它的总分高于同场的开源对手 | 不能说它跨场地优于独立榜上的模型 |
| GEdit-Bench | 学术界公开协议 | 真实用户编辑指令,三项分 | 可以逐项对照语义一致性与感知质量 | 不能说总分图上的名次由它支撑 |
| ImgEdit-Bench | 学术界公开协议 | 九个编辑任务族 | 可以说它擅长与不擅长哪类编辑 | 不能用它给生成能力定价 |
| Artificial Analysis Arena | 独立盲测 | 匿名用户偏好 | 该榜内模型的相对次序 | 不能用于未入榜模型 |
顺带一个需要拆开的数据点:有转述称 2K 图像编辑配十张参考输入约需 1.59 秒。这个数字引自一处二手汇总,参考硬件配置未完整披露,也不含端到端管线开销。它标定的是一次针对特定配置的测量,不是这个模型的推理速度。【判断】把它和"7B"这个参数量放在一起容易产生错觉:参数量小不等于延迟低,中间还隔着硬件、精度、批大小和框架实现。
⚖️ 同一天的两份文件
技术那一份
Day-0 支持五个框架,全部在同一天就位:
- Diffusers 通过
QwenImage21Pipeline统一承载文生图与图像条件生成(PR #14804) - ComfyUI 原生支持,权重放在 Comfy-Org/Qwen-Image-2.1,附文生图与编辑工作流模板
- vLLM-Omni:前缀 KV 缓存、CUDA Graph 解码、FP8 量化、TP/Ulysses 并行
- SGLang:前缀缓存、Cache-DiT、CUDA Graph、TP/Ulysses/Ring/CFG 并行、组件 offload(PR #39983)
- LightX2V:少步蒸馏与 FP8 量化
据 9 月 21 日的模型卡快照,首日出现 21 个社区 Space、14 个微调变体、18 个量化版本。(traictory.com 引 HF API)
法律那一份
同一个仓库里的 LICENSE 文件,名字是 Qwen Research License Agreement,日期 2026 年 9 月 20 日。
条款的核心在两条:第 2(a) 条把授权范围写为 "FOR NON-COMMERCIAL PURPOSES ONLY",并定义为研究或评估;第 2(b) 条写明未另行取得商用授权前,不得将材料用于任何商业目的。需要商用需联系阿里取得单独许可,公开渠道没有定价、量级门槛或营收上限的说明。(转述来源:newshunt.io、yotron-ai.com、saascity.io 的许可解读,均引许可原文)
另有两条容易被忽略的细则:衍生模型若公开发布,需保留版权声明并显著标示 "Built with Qwen" 或 "Improved using Qwen";争议管辖地为杭州市人民法院。(同上)
这一族模型历次发布的许可与商用条款
下表列出 Qwen-Image 各版本的时间、许可名称与商用条件。
| 版本 | 时间 | 许可 | 商用 |
|---|---|---|---|
| Qwen-Image 1.0 | 2025.08 | Apache 2.0 | 自由商用 |
| Qwen-Image-Edit | 2025.08 | Apache 2.0 | 自由商用 |
| Qwen-Image-Layered | 2025.12 | Apache 2.0 | 自由商用 |
| Qwen-Image-2512 | 2025.12 | Apache 2.0 | 自由商用 |
| Qwen-Image-2.1 | 2026.09 | Qwen Research License | 需单独商用授权 |
社区的反应集中在这一点上。Hacker News 的讨论帖一天内到 662 分,多个高赞评论指出博客措辞与许可条款之间的矛盾;Hugging Face 上数小时内出现两个讨论串要求回到 Apache 2.0;有开发者用"许可陷阱"(license trap)命名这个模式,也有开发者直接表示不会使用。(转述来源:byteiota.com、newshunt.io)
一处我没能解决的冲突
9 月 21 日,官方在开发者渠道做了一次澄清:输出不属于被许可材料,用户保留其使用模型生成的图像及其他内容的权利。(转述来源:saascity.io 记录的官方渠道声明)
但两个来源对同一句澄清的解读直接冲突:
- 一处解读为:本地生成透明 PNG、产品样机、游戏素材、营销图,用户拥有这些图像文件,可以出售、放进客户交付物、印在实物商品上。
- 另一处解读为:把生成的图直接放上官网、广告或商品页,属于商业用途,需先取得商用授权。
我把这一格标成未决,不替读者选边。
一个无法证实的推论
【推论】同一支团队在十三个月里,把同一族图像模型从 Apache 2.0 换到研究许可,同时把视觉主干从 20B 压到 7B。这两件事放在一起,指向一种可能的产业逻辑:当模型小到能跑在消费级显卡上、当推理成本低到不再构成门槛时,权重本身就从"引流用的赠品"变成了"可以定价的资产"。开放权重换得到生态与口碑,换不到收入。
这个推论无法从公开材料证实,阿里没有解释原因。它至少与三个可观察的事实不矛盾:许可变更的时点、与权重同日发布、以及模型被明确瞄准设计、电商、内容创作这些商业场景。(末一项见官方博客结论段:设计、内容创作、电商、视觉叙事)
🧾 收束
这个模型能力是确定的。
混合粒度注意力把条件前缀的重复计算删掉了——不是靠近似,是靠掩码结构保证的不变性。第四通道从外挂工具搬进了模型内部,抠图这个动作在流程图上被取代了。十张参考图能被接收,但能不能被调和,公开材料里还没有一份可信的复测。
分数是别人给的,考场是自己搭的。60.28 这个数字在它自己的考场上成立,出了那个场地需要重新验。
法律那一栏是空的。
如果你只是想弄明白混合粒度注意力凭什么能省下重复计算,模型卡和论文都摆在那里,随时可以读。如果你打算把它放进任何一个会收钱的产品里,第一份要读的文件不是 README,是 LICENSE——那份在 9 月 20 日与权重一起放进仓库、第一段就写着 FOR NON-COMMERCIAL PURPOSES ONLY 的文件。
关于那 4 MB 的第四通道,技术上已经有答案了。
关于谁有权用它,还没有。
*本文对许可条款的讨论属于技术产业观察,不构成法律意见;涉及商用决策,请以官方许可原文与法务意见为准。*
📚 参考文献
- Yin, S., Zhang, Z., Tang, Z., Gao, K., Xu, X., Yan, K., Li, J., Chen, Y., Chen, Y., Shum, H.-Y., Ni, L. M., Zhou, J., Lin, J., & Wu, C. (2025). *Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition.* arXiv:2512.15603. https://arxiv.org/abs/2512.15603
- Zhang, L., & Agrawala, M. (2024). *Transparent Image Layer Diffusion using Latent Transparency.* arXiv:2402.17113. https://arxiv.org/abs/2402.17113
- Qwen Team. (2025). *Qwen-Image Technical Report.* arXiv:2508.02324. https://arxiv.org/abs/2508.02324
- Go, Y., Han, J., Shin, C., Yoo, C., & Yang, G. (2026). *Enabling KV Caching of Shared Prefix for Diffusion Language Models.* arXiv:2606.07571. https://arxiv.org/abs/2606.07571
- Mou, C., Wu, Y., Wu, W., Guo, Z., Zhang, P., et al. (2025). *DreamO: A Unified Framework for Image Customization.* arXiv:2504.16915. https://arxiv.org/abs/2504.16915
- Qwen Team. *Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation.* 官方博客,2026-09-20. https://qwen.ai/blog?id=qwen-image-2.1
- QwenLM/Qwen-Image-2.1 官方仓库 README 与 LICENSE. https://github.com/QwenLM/Qwen-Image-2.1
- Qwen/Qwen-Image-2.1 模型卡. https://huggingface.co/Qwen/Qwen-Image-2.1
- Esser, P., et al. (2024). *Scaling Rectified Flow Transformers for High-Resolution Image Synthesis.* (SD3 / MMDiT)
- *Demystifying Flux Architecture.* arXiv:2507.09595 (2025).
- Chen, et al. (2025-03). DiT-Air:单流 DiT 的参数效率对比(转引自 Emergent Mind 架构综述)
- Wu, S., Huang, M., Wu, W., Cheng, Y., Ding, F., & He, Q. *UNO: A Universal Customization Method for Both Single and Multi-Subject Conditioning.* ICCV 2025.
- Liu, et al. *GEdit-Bench*(经 Step1X-Edit 提出);Ye, et al. *ImgEdit-Bench.*
- FireRed-Image-Edit-1.0 Technical Report. arXiv:2602.13344
- 社区与转述来源:byteiota.com、traictory.com、pondero.ai、newshunt.io、yotron-ai.com、saascity.io、pixelstech.net、futuretweets.com
*本文的事实性陈述均标注来源。带【直引】者为来源原文表述,带【推论】者为基于已核实事实的推断,带【判断】者为作者价值判断。口径存在冲突或公开材料无法证实之处,正文已逐处标明。*
*本文对许可条款的讨论属于技术产业观察,不构成法律意见;涉及商用决策,请以官方许可原文与法务意见为准。*