为文章《Qwen-Image 2.1 vs Qwen-Image 3.0》生成的主视觉卡片,展示两张圆角模型卡片,分别标注为“Qwen-Image 2.1”和“Qwen-Image 3.0”,带有 20 Sep 2026 和 21 Jul 2026 的日期标记,其中一张带下载图标,另一张带云图标,还有一条写着“数字越小,模型越新”的绶带。
Guides & Insights

Qwen-Image 2.1 vs Qwen-Image 3.0:数字更低的才是更新的模型

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

先说最容易把人绕晕的那件事。Qwen-Image 2.1Qwen-Image 3.0更新。厂商于 2026 年 7 月 21 日发布 Qwen-Image 3.0,并在 8 月 5 日将其推向正式可用。它于 2026 年 9 月 20 日发布 Qwen-Image 2.1——晚了七周,版本号却更低。这个编号并不是一条序列,而是共享同一个名字的两条不同产品线,而关于这两者最有用的一个事实是:在决定你能否在其之上构建的那个问题上,它们站在截然相反的立场。Qwen-Image 3.0 是闭源且托管的,没有权重、没有许可证,也没有技术报告。Qwen-Image 2.1 则是开放权重,今天就能下载,采用的是仅允许非商业用途的研究许可证。

两款恰好同名的产品

Qwen-Image 系列在十四个月里已经采取了三种截然不同的许可立场,把它们梳理清楚就能消除大部分困惑:

Qwen-Image 1.0 与 2.0 — 在 Hugging Face 和 ModelScope 上以 Apache 2.0 协议开放权重,发布当日即发布技术报告,可自托管、可微调、可量化。

Qwen-Image 3.0 —— 闭源。无权重、未声明许可证、无模型卡、无技术报告、无已发布的基准测试表。仅能通过托管 API 访问,提供 Pro 和 Standard 两个版本。

Qwen-Image 2.1——再次开放权重,但依据的是 2026 年 9 月 20 日签署的《Qwen 研究许可协议》,该协议授予的权利“仅限非商业用途”,商业使用则须另行协商许可。

把这理解为一种模式而非时间线,其轮廓便清晰可辨:阿里巴巴不再把“开放”当作二元选项。Qwen-Image 2.1 既不是 1.0 和 2.0 那样宽松的发布,也不是 3.0 那样的闭源发布。它是第三种立场——权重可供检查、运行和修改,但在前端加装了一道商业闸门。

每个模型到底是什么

Qwen-Image 2.1—— 一个统一的文生图生成与图像编辑模型,其视觉生成组件拥有 7B 参数,采用 32 层单流 DiT 架构。与之搭配的是一个 Qwen3-VL 8B 文本编码器,以及一个在 16 倍空间压缩下的 64 通道 RGBA VAE;完整下载约 33 GB,其中文本编码器占了一半以上。采用块因果注意力:文本使用 token 级因果掩码,图像生成使用 chunk 级双向掩码,并针对多图编辑复用前缀 KV 缓存。原生支持 2K,默认 2048×2048、40 步,提供七种宽高比预设。

Qwen-Image 3.0 —— 一款闭源托管模型,提供 Pro 和 Standard 版本,通过单一 API 实现图像生成与编辑。阿里巴巴的发布资料宣称提示词最长可达约 4,500 个 token,小至约 10 像素的文字仍清晰可辨,覆盖 12 种语言、20 多种字体,输出最高 2048×2048,每次调用最多生成六张图像。官方未公布参数量;广为流传的约 20B MMDiT 这一数字只是报道,并未得到证实。

实践中最重要的架构差异不是规模——而是模型在哪里运行,以及你能对它做什么。Qwen-Image 2.1 以文件形式发布,你可以检查、量化、在私有数据上微调,并在自己的硬件上运行;早在权重发布的三天前,SGLang 支持的拉取请求就已合并。Qwen-Image 3.0 则以端点形式提供。你无法量化它,无法微调它,也无法在阿里巴巴运行它的地方之外的任何地方运行它。

编辑恰恰是二者分歧最悬殊之处

两个模型都在同一个系统内完成生成和编辑,因此真正有趣的对比在于编辑功能的具体细节——而在这方面,从纸面上看,更新、更小的那个模型反而是能力更强的那个。

参考图像 — Qwen-Image 2.1 最多接受 10 张输入参考图。Qwen-Image 3.0 的 Pro 文档称支持 1–3 张输入图像。

局部编辑控制 — Qwen-Image 2.1 支持圈选、涂抹标注,以及作为独立输入提供的单独蒙版,因此原始图像保持无标记。Qwen-Image 3.0 已记录的编辑路径涵盖局部改写、内容扩展、风格迁移和多机位视角生成,但未公布基于蒙版的工作流。

透明度 — Qwen-Image 2.1 原生支持生成和编辑 RGBA 图像,可编辑透明图层内的文字,并能将 RGB 照片中的主体提取到透明图层中。Qwen-Image 3.0 的发布公告未提及任何透明度相关能力。

提示词改写 —— Qwen-Image 2.1 提供了两个专门的改写检查点,均为微调后的 Qwen3.5-VL 9B 模型,一个用于文生图,一个用于图像编辑,其改写代码与系统提示词均已公开。而 Qwen-Image 3.0 的提示词处理则是藏在 API 背后的黑盒。

生态系统 — Qwen-Image 2.1 在 Diffusers、ComfyUI、vLLM-Omni、SGLang 和 LightX2V 中提供首日支持,并支持 AMD ROCm 和 FlagOS 路径。Qwen-Image 3.0 提供 API。

最后那句话并非修辞上的夸张。对于一个流水线运行在 ComfyUI 中,或推理栈采用 vLLM 的团队来说,一个带有已合并 pipeline 类的模型与一个带有 HTTP 端点的模型之间的差别,就是集成任务与重写之间的差别。

A generated two-column comparison scoreboard titled 'Qwen-Image 2.1 vs Qwen-Image 3.0 — the scoreboard'. Left column 'Qwen-Image 2.1': rows reading Released: 20 Sep 2026; Licence: research, non-commercial; Access: 33 GB open download; Reference images: up to 10; Transparency: native RGBA; Published price: none. Right column 'Qwen-Image 3.0': rows reading Released: 21 Jul 2026, GA 5 Aug; Licence: not published; Access: closed hosted API; Reference images: 1 to 3; Transparency: none claimed; Published price: ~$0.04 Pro, $0.03 Std. Footer reads 'Qwen-Image 2.1 specs per vendor model card, unaudited; Qwen-Image 3.0 pricing is vendor list, unaudited.'

价格,以及价格无法捕捉的东西

Qwen-Image 3.0 是两者中唯一公布了价格的:在该厂商的云平台上,Pro 约为每张图像 $0.04,Standard 约为 $0.03,国内消费者定价则从约 ¥0.18 起。这些都是发布时的数字,尚未经过独立审计。Qwen-Image 2.1 则完全没有公布托管费率——它是一款可下载的模型,成本取决于你自己的 GPU 时间花费。

这两条价格线不可相提并论,而假装它们可以相提并论,是这种对比中最常见的错误。按图像计费的价格涵盖了模型、服务基础设施、扩展能力以及别人的正常运行时间。权重下载则这些都不包含。正确的问题不是哪个数字更小;而是你是否有运营能力来运行一套 33 GB 的模型栈,以及便宜那一侧的许可证是否允许你计划用它做的事情。

这就把许可证问题重新拉回到比较的中心,而这本就该是它所在的位置。Qwen-Image 3.0 的条款并未公布,这对受监管行业或代理机构的工作而言本身就是个麻烦——没有任何文件可供引用。Qwen-Image 2.1 的条款已公布的,而且写明是非商业用途。在含糊不清的许可证与明确受限的许可证之间,明确受限的那一个更容易提前规划,因为至少你知道该展开什么样的对话。

A screenshot of the Qwen vendor blog page for Qwen-Image 3.0, captured September 20 2026, showing the launch announcement, the Pro and Standard edition descriptions, the claimed prompt-length and text-rendering figures, and the per-image list pricing.

你应该选择哪一个

你需要大量含文字的生产级图像,并且希望由别人来运行——Qwen-Image 3.0 正合适,但需注意:它标榜的文字渲染数据属于厂商宣称,而现有的独立测试表明,小字号文字在某些情况下仍会出现乱码。

你需要自行运行模型、对它进行微调,或者把数据留在自己的硬件上——两者之中只有 Qwen-Image 2.1 能做到,而研究许可证就是入场代价。

你需要透明素材、产品抠图,或超过三张参考图——按照已公布的规格,Qwen-Image 2.1 是更强大的工具,而且在参考图数量上毫无悬念。

你需要商业权利和宽松的许可 —— 而你的模型这两者都不具备。Qwen-Image 3.0 完全没有公开条款,Qwen-Image 2.1 则需要协商商业许可。该系列中以 Apache-2.0 发布的版本是较早的 Qwen-Image 1.0 和 2.0。

最后一行值得仔细琢磨,因为它描述的是一个正在缩小的集合。已经授予的许可证不会追溯性地改变,因此 Apache-2.0 Qwen-Image 的发布版本仍可按其原始条款使用。但如果你正围绕最新 Qwen-Image 将采用宽松许可证这一假设来规划商业图像流水线,那么最近三个发布版本就是反对该假设的证据。

运行其中任何一个,而不把整个流水线押在它上面

这两个模型出于不同原因,如今都很难被放到生产路径之后——一个是因为许可证,另一个是因为黑箱和未公开的参数量。而这正是路由层所要应对的情形。OrcaRouter 用一个兼容 OpenAI 的端点来承载 200 多个模型,按提供商标价、零加价,并支持跨提供商自动故障转移,以及一种路由 DSL,让你能把多个模型组合成一次调用,这样新的或难处理的模型就能与经过验证的模型并排放置,而不是挡在它前面。模型融合把同样的思路推进得更远:让一组模型共同运行,并让你根据自己的提示词来比较它们,而不是依据发布图表。

Qwen-Image 2.1 和 Qwen-Image 3.0 都不在我们目前路由的模型之列,本文也不会暗示相反的情况。我们确实在路由的图像模型——OpenAIGPT-Image 系列、Google 的 Imagen 4 各档位与 Gemini 图像预览版,以及 xAI 的 Grok Imagine 图像端点——才是你在按自己的标准评估 Qwen 这两款模型期间,真正可用于构建故障转移路径的组成部分。

值得关注的范围比看上去更窄。Alibaba 现在已经证明,它会在同一季度内、同一系列中发布开放权重、闭源托管模型和研究许可下载。下一次发布不会告诉你哪种模式胜出。许可证文件才会。

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.