为文章《Qwen-Image 2.1 悄然发布》生成的头图卡片:一张圆角卡片标着"Qwen-Image 2.1",带有 7B 参数标记;旁边是两张较小的卡片,分别标着"PE-T2I"和"PE-I2I",均标记为 9B;还有一条横幅写着"悄然发布,并非毫无预告"。
Engineering & Research

Qwen-Image 2.1 悄然发布:深入解析 Qwen/Qwen-Image-2.1-PE-I2I

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年9月20日,Qwen-Image 团队把 Qwen-Image 2.1发布到了 Hugging Face 和 ModelScope——权重、许可证文件、模型卡和一篇博客文章,全都在同一天内完成,几乎没有留出预热时间。最醒目的数字是视觉生成组件中的 7B 参数。几乎还没有人打开过的部分,是 Qwen/Qwen-Image-2.1-PE-I2I,它是随图像模型一同发布的两个提示词重写检查点之一。它不是图像模型。它负责在图像模型看到你的指令之前,决定这条指令意味着什么——而在这次发布中,它正是那个悄悄设定你的输出以何种语言返回的组件。

“悄然发布”在这里到底意味着什么

措辞很重要,因为无论往哪个方向都容易说过头。Qwen-Image 2.1 既不是被泄露的,也不是未经宣布的。有一篇日期为 2026 年 9 月 20 日的厂商博客文章,一个新闻栏目日期同为当天的 GitHub 仓库,以及可直接下载的线上权重。它没有得到的,是事前预热:唯一的提前信号是 9 月 17 日的一则通知,通过 ModelScope 提供 50 个抢先体验名额,并要求入选的测试者在 9 月 29 日前发布一个样本或一篇评测。三天后,权重就公开了。没有主题演讲,没有基准测试的禁言期,也没有媒体宣传周期。

这是一种特定类型的发布,值得精确地为其命名。厂商宣布了它。厂商并没有推广它。对于任何正在决定是否要基于它进行构建的人来说,实际的后果是目前还没有可依赖的独立评估——只有厂商自己的材料,以及抢先体验测试者在接下来一周内发布的任何内容。在阿里巴巴之外的人公开运行它之前,请把本文中的每一项质量声明都视为来自模型卡和博客文章。

为什么 PE-I2I 检查点才是那个有意思的

Qwen-Image 2.1 版本包含三个可下载的部分,而不是一个:

Qwen/Qwen-Image-2.1 — 图像模型本身。视觉生成组件是一个 32 层单流 DiT,拥有 7B 参数,另配一个 Qwen3-VL 8B 文本编码器,以及一个具备 16× 空间压缩的 64 通道 RGBA VAE。三个组件合计约 33 GB。

Qwen/Qwen-Image-2.1-PE-T2I——用于文本生成图像的提示词改写器。基于 Qwen3.5-VL 9B 微调,约 18.8 GB。

Qwen/Qwen-Image-2.1-PE-I2I —— 用于图像到图像编辑的提示词重写器。同样是一个微调后的 Qwen3.5-VL 9B,大小也约为 18.8 GB,于 9 月 20 日 08:46 UTC 上传至 Hugging Face。

“PE”是提示增强(prompt enhancement)。I2I 变体接收一条模糊的编辑指令以及一张或多张输入图像,并将其改写为精确、无歧义的编辑指令,供下游扩散模型使用。该仓库自身的描述对输入形态直言不讳:输入图像始终存在,因此这始终是图像编辑任务,而绝不是凭空进行的文本到图像生成。改写代码位于 prompt_rewrite/ 文件夹中,该文件夹同时服务于两个检查点—— --task t2i--task edit——并配有 transformers 路径、vLLM 路径、用于常驻服务的 serve.shclient.py,以及用于共享逻辑的 pe_core.py

这就是为什么这一点比听起来更重要。图像模型根本不知道你想表达什么。它所掌握的只是你的提示词字面上说了什么,再叠加文本编码器对其的处理权重。而坐在它前面的重写器,正是消解歧义的地方——或者把歧义错误地消解掉,而且在你生成的每一张图上都保持一致。在一个支持多达 10 张参考图的统一生成与编辑模型中,这个消解环节比平时更容易出错。

语言决策就存在于系统提示词中

PE-I2I 仓库发布了一个 system_prompt.txt,与权重一同,并且它对一件事异常明确:语言。直接阅读它,重写器被要求做出 两个彼此独立的语言决策,并将它们区分开来。

描述语言。 重写器用来描述编辑的说明文字遵循用户指令所用的语言——中文指令对应中文描述,英文指令对应英文描述;若指令为日语、韩语、法语、泰语或其他任何语言,则描述使用英文。

渲染文本的语言。 实际绘制到输出图像中的文本(包含在双引号内)由严格的优先级顺序决定:首先,如果用户指定了确切的文本或目标语言,则严格照办;其次,如果输入图像已包含文本,则匹配该现有文本的主要语言——即使指令是用另一种语言编写的;第三,如果图像中没有文本且未指定语言,则使用指令本身的语言,并且特别不要强制使用英语。

该提示以一个实例强化了第二条规则——一张以泰文为主的图片,在用未指明语言的英文指令进行编辑后,必须渲染出泰文——并追加了两项约束:渲染出的文字必须是单一语言,而非中英对照;而“规格表”或“分镜脚本”这类视觉体裁,应通过版式与字体排印来实现,绝不能靠把渲染出的标签切换成英文。

这是一项规模很小但影响范围很大的工程工作。如果你正在为一个包装文字至关重要的市场生成产品图像,那么“重写器保留现有的标签语言”和“重写器贴心地把所有内容都翻译成英语”之间的差别,就是可用素材与被拒素材之间的差别。而且,由于这一行为是在随仓库一同发布的系统提示中规定的,你可以阅读它、对它做差异对比,并覆盖它——这可比在封闭的托管模型中同一步骤所能做到的要多得多。

什么是已确认的,什么是未确认的

在这里,精确界定边界正是我们已知信息部分的核心要义。

已从代码仓库和模型卡中确认——7B / 32 层单流 DiT 的规模;Qwen3-VL 8B 文本编码器;64 通道 RGBA VAE,16× 空间压缩;块因果注意力,文本使用 token 级因果掩码,图像生成使用 chunk 级双向掩码;前缀 KV 缓存复用——模型卡称,当检查点带有causal_condition: true(确实如此);基于 Euler 离散调度的流匹配;原生 2K 输出,默认以 2048×2048 在 40 个推理步数下生成;七种已文档化的宽高比预设;支持最多 10 张参考图像;通过圈选、绘制标注或单独掩码进行局部编辑;以及 RGBA 生成、透明图层编辑和从 RGB 照片中提取主体。

关于许可证的情况已确认,而这正是关键所在——该版本依据《Qwen 研究许可协议》发布,协议日期为 2026 年 9 月 20 日,授予的权利为“仅限非商业用途”,并声明商业使用需向供应商单独申请许可。与早前以 Apache 2.0 发布的 Qwen-Image 系列相比,这是一项实质性变化。在基于此构建产品之前,请先阅读许可文件,而不是事后才看。

未确认 —— 目前尚不存在独立的基准测试分数。该博文引用了一张 Qwen-Image-Bench 对比图,但其中的数字来自厂商自身,在撰写本文时尚未被任何第三方复现。Qwen-Image 2.1 没有公布托管端点价格,也没有说明商业许可条款。而且,目前还没有消息表明是否会推出采用宽松许可证的变体。

唯一确实存在的独立数据点,是一位通过 Qwen 大使计划获得访问权限的测试者所做的上手早期体验评测,他通过 ModelScope Studio 界面运行了最终发布版本的权重。该评测报告称,文生图生成时间约为 10–15 秒,编辑为 18–23 秒,在镜头位置预设和多角色角色分配方面表现强劲,并指出一个值得了解的具体故障模式:从大约三张输入图像起,多参考一致性开始下降,在侧脸角度下,侧马尾的位置会塌缩成居中马尾。那只是在一个早期体验界面上、由一位评测者得出的结果,而且没有显示计时器。这是有用的信号。这不是基准测试。

A generated single-column spec scoreboard titled 'Qwen-Image 2.1 — the scoreboard' listing rows: Generation component 7B, 32-layer single-stream DiT; Text encoder Qwen3-VL 8B; Licence Qwen Research License, non-commercial only; Native output 2048 x 2048 at 40 steps; Reference images up to 10; Transparency native RGBA; Independent score none yet. Footer reads 'Figures per the Qwen vendor model card, unaudited; no third-party reproduction at the time of writing.'

首日框架支持,这才是那个低调的好消息

一个模型在发布当天铺开的范围,比模型卡更能说明你是否真的用得上它,而 Qwen-Image 2.1 铺得很广:

Diffusers —— QwenImage21Pipeline在发布当天即被合并,且模型仓库带有 diffusers:QwenImage21Pipeline 标签。

ComfyUI — 原生首日支持,提供文生图与图像编辑工作流模板,并另设一个 Comfy 兼容的权重仓库。

vLLM-Omni — 逐步执行、前缀 KV 缓存、CUDA Graph 解码、FP8 量化以及张量/Ulysses 并行。

SGLang — 一个原生支持的拉取请求于9月17日落地,比权重发布三天,涵盖DiT、RGBA VAE、Qwen3-VL条件生成、多张参考图像以及RGBA输入/输出,并已在H200、B200、RTX PRO 6000、RTX 5090和RTX 4090上验证通过。

LightX2V — 首日即支持加速,并通过 ROCm 支持 AMD Radeon,同时通过 FlagOS 实现多芯片支持。

预发布的 SGLang pull request 就是线索。框架支持比权重更早落地,意味着服务路径当时是拿检查点测出来的,而不是事后照着模型卡写出来的。对于一个 7B 组件、旁边还杵着一个 17.5 GB 的文本编码器来说,这就是周末无谓折腾和一个下午搞定的区别。

对于显存受限的 GPU,模型卡推荐使用 CPU 卸载 —— pipe.enable_model_cpu_offload() —— 这是标准的应急手段,而非真正的修复方案。33 GB 的下载体积主要来自文本编码器,而非 DiT;扩散 Transformer 本身只是这个组合中较小的一半,约 14 GB。

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.

实用的解读

如果你想今天就试用 Qwen-Image 2.1,老实说,你可以做到——在本地,依据研究许可证,但没有独立基准测试,也没有商业权利。对于评估来说,这是一笔合理的取舍;对于生产管线来说,则是一笔糟糕的取舍,而这两者之间的差距,正是许可证文件所决定的。

对于想要对图像模型进行基准测试、又不愿把生产路径押在一个才发布几天的检查点上的团队来说,路由层正是把这种风险收拢控制住的地方。OrcaRouter 在一个 OpenAI 兼容端点之后接入 200 多个模型,按提供商目录价提供、零加价,并支持跨提供商的自动故障转移,因此一个尚未经过验证的模型可以与您已经信任的模型并排放在同一条路由之后,而不是取代它——而且由于目录价是直接透传的,任何被路由模型的供应商降价当天就能生效,无需等待合同变更。在撰写本文时,Qwen-Image 2.1 并不在我们所路由的模型之列,本文也不会暗示相反的情况。我们实际路由的是其周边的图像系列——OpenAIGPT-Image 系列、Google 的 Imagen 4 各档以及 Gemini 图像预览版,还有 xAI 的 Grok Imagine 图像端点——在您于自有硬件上评估这个新来者时,故障转移路径正可以从这里获得。

悬而未决的问题,正是这个仓库无法回答的那个。阿里巴巴发布了一个70亿参数的开放权重图像模型,采用仅限研究用途的许可证;而就在同年,它又把 Qwen-Image 3.0 作为完全不提供权重的闭源托管模型发布。两次发布,两个相反的押注,相隔四个月。这两者中哪一个会决定下一代 Qwen 图像模型的形态——以及那份研究许可证究竟会不会转变成企业可用的东西——才是值得关注的地方。权重如今已在 Hugging Face 上,任何人都可以自己去读许可证文件。

A screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1, captured September 20 2026, showing the Like and Follow counts, the tags Text-to-Image, Diffusers, Safetensors, QwenImage21Pipeline, rgba, the qwen-research licence, 7B params, BF16 tensor type, and the notice that the model is not deployed by any inference provider.