2026 年 9 月 21 日——阿里通义千问团队于 9 月 20 日开源图像模型 Qwen-Image-2.1,将文生图与图像编辑整合在同一模型中,视觉生成部分仅 7B 参数,原生支持透明(RGBA)图像的生成与编辑,权重与代码同步上架 Hugging Face 与 ModelScope。

官方模型卡称,Qwen-Image-2.1 是千问图像系列当前兼顾生成效果、推理效率与使用成本的开源图像模型。从系列沿革看,初代 Qwen-Image 于 2025 年 8 月发布,采用 20B 参数 MMDiT 架构;Qwen-Image-2.0 于 2026 年 2 月 10 日推出(据 CyberQ 整理的发布时间线)。2.1 版将生成侧参数量从 20B 降至 7B,本地部署门槛随之下降。

1. 官方发布要点

据官方模型卡,本次更新聚焦四个方向:

方向 具体内容
轻量高效 混合粒度注意力机制,配合前缀 KV 缓存复用,条件图像与文字指令仅在首个去噪步骤计算一次,后续步骤直接复用缓存,多参考图编辑任务加速明显
原生透明通道 支持由文字直接生成普通图像或 RGBA 透明图像,可编辑透明图层、从照片中提取主体
多样化编辑 最多支持 10 张参考图,可通过圈选、涂鸦标注或独立遮罩指定局部编辑范围,保持人物与商品一致性;官方展示案例包括用 6 张个人肖像合成合影、用模特与服饰共 5 张参考图组装完整穿搭
质感与美学 官方表示文字排版、人像光影与细节表现均有改善

2. 技术架构与规格

据官方 GitHub 仓库说明,Qwen-Image-2.1 采用单流 DiT 架构,文本使用 token 级因果掩码,图像使用块级双向掩码,该设计是前缀 KV 缓存得以成立的关键。

项目 规格
Transformer 32 层单流 DiT,7B 参数,块因果注意力
文本编码器 Qwen3-VL 8B,同时编码文字指令与条件图像
VAE 64 通道 RGBA 自编码器,空间压缩 16 倍
调度器 Flow Matching,Euler 离散调度与动态位移
默认输出 2048 × 2048,40 步去噪,原生 2K 分辨率
推荐长宽比 7 种,含 4:3、3:2、16:9 及对应竖版(16:9 对应 2752 × 1536)
参考图上限 10 张
提示词改写模型 两个 Qwen3.5-VL 9B 微调检查点(PE-T2I 对应文生图、PE-I2I 对应图像编辑)

3. 首日生态支持

据官方仓库整理,Diffusers 以 QwenImage21Pipeline 提供首日支持,单条管线同时处理文生图与图像条件生成;ComfyUI 原生支持并随附文生图与图像编辑两份示例工作流;vLLM-Omni 提供前缀 KV 缓存、CUDA Graph、FP8 量化与 TP/Ulysses 并行,并暴露 OpenAI 兼容的 /v1/images/generations 接口;SGLang 与 LightX2V 同步提供首日推理与加速方案。硬件侧,AMD Radeon GPU 可经 ROCm 运行,FlagOS 软件栈释出 8 种芯片平台的预建镜像与权重;ModelScope 基于 DiffSynth-Studio 提供下载、在线生成与 LoRA 训练;wuli.art 面向中国大陆用户提供全部功能的免费体验入口。

4. 许可证改为研究许可,商用需另行申请

官方 README 显示,本次仓库采用 Qwen Research License Agreement。据 CyberQ 对授权全文的解读,该协议仅允许非商业的研究与评估用途,商业使用需另行向官方申请授权;使用模型或其输出训练、微调其他对外发布的模型时,须在产品文档中标注 "Built with Qwen" 或 "Improved using Qwen"。对比初代 Qwen-Image 采用的 Apache 2.0 许可证,2.1 的授权条件明显收紧。

5. 分析与判断:开源之名,商用之槛

模型本身的工程进步值得肯定:7B 单流 DiT、原生 RGBA 通道、10 张参考图合成与首日全生态支持,都是实打实的工作。但在许可证这一步,本文认为千问团队做得有些过分,理由有四。

其一,名实落差。官方 README 第一句话是 "We are excited to open-source Qwen-Image-2.1",各路通稿也以"开源"传播,而 Qwen Research License 仅允许非商业研究与评估,并不符合 OSI 对开源的定义——以开源叙事收获声量,再用许可条款把商用权利收回去,名实不符。

其二,对自家生态断崖式收紧。初代 Qwen-Image 采用 Apache 2.0,社区一年多来建立的商用工作流、插件与下游产品都以可商用为前提。本次发布却首日铺开 ComfyUI、vLLM、SGLang 支持,ModelScope 同步提供 LoRA 训练入口,引导创作者与团队投入,转头用研究许可把这些投入锁死在"内部评估"——生态拉得越广,被许可卡住的人越多。

其三,横向对比之下退步更明显。据各官方模型页标注:FLUX.1-dev 虽为非商用许可,但黑森林实验室同步提供 Apache 2.0 的 FLUX.1-schnell;SDXL 采用允许商用的 OpenRAIL 系列许可;HiDream-I1 直接采用 MIT;千问自家初代也是 Apache 2.0。2.1 在商用友好度上从最开放的一档退到最严格的一档,且没有同步提供任何可商用的替代版本。

其四,隐性门槛层层叠加。官方宣传"兼顾使用成本",但 7B 只是生成组件,复现官方展示品质还需搭配 8B 文本编码器与 9B 提示词改写模型,全 bf16 管线权重约 31.7GB(据 CyberQ 按 Comfy-Org 权重文件估算),商用还要逐家洽谈授权。

本文的判断是:防止套壳、保护 3.0-Pro 云端产品线,这些动机可以理解,但把收紧的成本转嫁给投入最早的社区并不厚道。与"开源"宣传相称的做法,是恢复 Apache 2.0,或至少同步释出一个可商用版本。在此之前,建议商用团队将 2.1 仅用于内部评估,产线上线前先落实授权;社区使用者也应留意自行训练的 LoRA 成果同样落在非商业边界之内。