Qwen-Image 2.1 与 LLaDA-Image-Turbo 对比的主视觉卡片,将 Qwen 仅限研究的许可证与 LLaDA-Image-Turbo 未声明的许可证相对照,并将 40 步 7B 扩散 Transformer 与 4 步 6B 蒸馏模型进行对比
Guides & Insights

Qwen-Image 2.1 与 LLaDA-Image-Turbo:两个开放图像模型,两种截然不同的许可证

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

两个开放权重的图像模型在同一个三周内相继落地。Qwen-Image 团队于 2026 年 9 月 20 日发布了 Qwen-Image 2.1——权重、许可证文件、模型卡和一篇博客文章全都在同一天上线,之前几乎没有任何预热。而在此前十六天,也就是 2026 年 9 月 4 日,inclusionAI(蚂蚁集团的研究实验室)发布了 LLaDA-Image-Turbo,没有发布帖、没有新闻稿,也没有任何形式的公告。如今两者都可以下载。两者都没有任何一个独立的基准测试分数。而真正决定你能用哪一个的差别,并不在任何一个模型卡里——而在那些文书里。Qwen-Image 2.1 采用的是直接禁止商业使用的研究许可证。LLaDA-Image-Turbo 则在它的所有代码仓库中都没有声明任何许可证。

许可证问题排在第一位,因为它是唯一一个有明确答案的问题。

从这里开始,因为这一对比中的其他一切都只是暂时的,而这个不是。

Qwen-Image 2.1根据日期为 2026 年 9 月 20 日的《Qwen Research License Agreement》发布,该协议授予的权利“仅限非商业用途”,并声明商业使用需要向厂商另行申请许可。与早先以 Apache 2.0 许可发布的 Qwen-Image 系列相比,这是一个重大变化。这一点毫不含糊:你可以阅读、评估、进行基准测试并撰写相关内容,但不能将其用于产品中。

LLaDA-Image-Turbo根本没有声明任何许可证。既不是宽松许可证,也不是限制性许可证,甚至连占位符都没有。一个没有许可证的仓库在任何法律意义上都谈不上“可自由使用”——它默认保留所有权利,这比 Qwen 的研究许可证更为严格,而非更宽松。如果你打算基于它进行开发,这该去问实验室,而不是看 README。

这种讽刺值得直白地说出来:那个带着正式、限制性许可证而来的模型,才是你今天可以围绕它做规划的那一个,因为你清楚自己究竟处在什么位置。而没有许可证的那个模型,才是你无法围绕它做规划的那一个。

Screenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

这两个模型实际上是什么

抛开授权问题,这是两种真正不同的设计,出于不同的原因而打造。

架构 — Qwen-Image 2.1 是一个 32 层单流扩散 Transformer,其视觉生成组件拥有 7B 参数,配备 Qwen3-VL 8B 文本编码器和 64 通道 RGBA VAE(16× 空间压缩),整个套件约 33 GB。LLaDA-Image-Turbo 则是一个 6B 的统一生成与编辑模型——用同一套权重同时完成两项任务,而非基础模型外加一条独立编辑路径。

推理步数 — Qwen-Image 2.1 默认在 2048×2048 分辨率下以 40 步运行,采用流匹配与 Euler 离散调度。LLaDA-Image-Turbo 通过 Twin-DMD 蒸馏至 2–4 步,推荐使用 4 步,其在引导尺度 1.0 下运行,而 Base 模型为 5.0。

精度选项 — Qwen-Image 2.1 通过其 vLLM-Omni 路径发布了 FP8 量化支持。LLaDA-Image-Turbo 以独立下载的形式同时提供 BF16 和 FP8 检查点。

参考条件控制 — Qwen-Image 2.1 最多可接受 10 张参考图像,支持通过圈选、涂鸦标注或独立蒙版进行局部编辑,并可生成原生 RGBA,实现透明图层编辑。LLaDA-Image-Turbo 的卡片未公布参考图像数量上限。

注意——Qwen-Image 2.1 采用块因果注意力:对文本使用令牌级因果掩码,对图像生成使用块级双向掩码,当检查点带有 causal_condition: true 时,会复用前缀 KV 缓存。LLaDA-Image-Turbo 的模型卡未以同样详尽的程度描述其掩码方案。

许可证 — 仅限研究且明确声明,相对于未声明。

注意步数与参数量的含义。Qwen-Image 2.1 是一个更大的模型,运行步数是其十倍;LLaDA-Image-Turbo 则是一个更小的模型,被蒸馏到只需少数几步。这是对图像生成成本究竟落在何处的两种相反押注,而正确答案完全取决于你的瓶颈是每张图消耗的 GPU 秒数,还是一张图能达到的视觉上限。

速度经济学:40 步对 4

Turbo 这个名字在这里名副其实。Twin-DMD 蒸馏把扩散轨迹压缩为少数几次大跳跃,这正是 LLaDA-Image-Turbo 能在 4 步下运行、而其 Base 模型却需要常规调度方案的原因。在 guidance 1.0 下,它还跳过了无分类器引导,而后者通常会使每步的前向传播次数翻倍——因此,实际差距比单看 40 对 4 所体现的要更大。

这为你换来的是吞吐量和可预测性。一个 6B 模型在四步下,正是那种能装进单张消费级显卡、并且生成草稿图像快到足以放进交互循环里的东西。Qwen-Image 2.1 在 40 步和 2048×2048 下是质量优先型配置;模型卡自身针对受限硬件的建议是采用 CPU 卸载,具体通过 pipe.enable_model_cpu_offload(),这更像一种权宜之计,而非修复方案。

平衡因素在于,蒸馏是对能力的压缩,而这里的一切都尚未被两家实验室之外的任何人测量过。对于这两个模型来说,唯一存在的独立数据点,是来自 Qwen Ambassador 计划的一位测试者对 Qwen-Image 2.1 的早期访问上手评测,他通过 ModelScope Studio 界面运行了最终权重,并报告文本到图像大约需要 10–15 秒,编辑大约需要 18–23 秒。这只是一名评测者、在一个早期访问 UI 上、没有显示计时器的情况下得出的结果——是有用的信号,而不是基准测试。LLaDA-Image-Turbo 则完全没有任何可比的公开上手报告。

Two-column scoreboard for Qwen-Image 2.1 and LLaDA-Image-Turbo: Qwen rows read Release 20 Sept 2026 / Licence research-only, non-commercial / Architecture 32-layer DiT, 7B generation component / Steps 40 at 2048x2048 / Reference images up to 10 / Independent score none yet; LLaDA-Image-Turbo rows read Release 4 Sept 2026 / Licence undeclared on any repo / Architecture 6B unified gen+edit / Steps 2-4, recommended 4 / Reference images not published / Independent score none yet; footer reads 'Both sets of figures vendor-reported; neither model has an independent benchmark score.'

编辑功能是两种设计差异最大之处

这两个模型都能实现文本生成图像和图像编辑,但它们的实现路径不同,而这种差异体现在底层机制上,而非输出结果上。

Qwen-Image 2.1 将指令遵循视为一个独立的、可检查的组件。除图像模型之外,该版本还包含两个提示词改写检查点——Qwen/Qwen-Image-2.1-PE-T2IQwen/Qwen-Image-2.1-PE-I2I,二者均为微调后的 Qwen3.5-VL 9B,体积约 18.8 GB——它们会在扩散模型看到提示词之前,先把含糊的指令改写成明确无歧义的指令。I2I 变体始终有输入图像,因此它永远是一项编辑任务,而绝非从无到有的生成。关键在于,该改写器附带一份你可以阅读并覆盖的 system_prompt.txt,而且它对语言的说明异常明确:描述所用的语言遵循你的指令,而绘制图像中的文字采用何种语言,则由一套严格的优先级顺序决定——即使你用另一种语言发出提示,它也会保留输入图像中已有的标签语言。

这是一项小工程,但影响范围很大。如果你正在为一个包装文案至关重要的市场制作产品图像,那么“重写器保留现有标签语言”和“重写器好心地将所有内容翻译成英语”就是可用素材与被拒素材之间的区别——而且因为它存在于系统提示中,而不是在某个托管黑盒里,你可以对它进行 diff 并修改它。

LLaDA-Image-Turbo 做出了相反的取舍:一个 6B 模型、一套权重,生成与编辑共享一切。更少的活动部件,更少的配置项,也没有任何可供检查或覆盖的东西。它的模型卡引用了 Qwen-Image-Bench 上的分数:英文 53.53、中文 53.38,并宣称开源 SOTA——但这是厂商自报、未经复现,而且请注意,它所赢得的这个基准,是以它暗中竞争的模型命名的。

你实际上会在什么上面运行它们

发布日的生态系统支持是发布过程中最不引人注目的部分,却也是决定你是花一个下午还是一个周末的部分。

Qwen-Image 2.1实现了全面落地:QwenImage21Pipeline在首发当天即合并进 Diffusers;原生支持 ComfyUI,并提供文生图与图像编辑工作流模板;vLLM-Omni 支持分步执行、前缀 KV 缓存、CUDA Graph 解码、FP8 量化以及张量/Ulysses 并行;一项原生支持 SGLang 的 pull request 于 9 月 17 日落地——提前三天,权重发布之前——涵盖 DiT、RGBA VAE、Qwen3-VL 条件注入与多参考输入,并已在 H200、B200、RTX PRO 6000、RTX 5090 和 RTX 4090 上完成验证;同时通过 LightX2V 实现零日加速,在 AMD Radeon 上经由 ROCm 运行,并通过 FlagOS 实现多芯片支持。

LLaDA-Image-Turbo于 2026 年 9 月 7 日获得 ComfyUI 支持,比权重发布晚三天,同时还提供了 Diffusers 和 Safetensors 分发版本。这确实是一条可行的运行路径,但相对单薄,而且没有可与之对应的预发布服务阶段的工作可资参照。

SGLang 的预发布拉取请求是 Qwen-Image 2.1 的信号。框架支持先于权重落地,意味着有人是在用检查点测试服务路径,而不是事后照着模型卡来补写。

Screenshot of the Hugging Face repository page for inclusionAI/LLaDA-Image-Turbo, showing the inclusionAI organisation, the model name and its Text-to-Image, Diffusers and Safetensors tags, and the opening of the model card describing LLaDA-Image as a unified model for high-quality image generation and editing

你与实验一起保留的托管路径

在撰写本文时,这两个模型都无法通过 OrcaRouter 进行路由,本文也不会暗示并非如此——两者都是自托管方案,一个采用的许可证排除了生产用途,另一个则完全没有任何许可证。对于评估它们的团队来说,重要的是,评估不必处于关键路径上。

OrcaRouter 将 200 多个模型统一置于一个兼容 OpenAI 的端点之后,按供应商目录价提供、零加价,并具备跨供应商的自动故障转移能力,以及一套路由 DSL,让你可以把多个模型组合成一次调用。对于眼下这个决策,其实际形态就是一条路由:你已信任的模型承载生产流量,同时让一个自托管检查点在它旁边接受测试——而且由于目录价是直接透传而非加价,任何被路由模型的供应商调价当天就会在我们这边生效,而不必等待合同修订。我们今天实际路由的图像模型包括 OpenAIGPT-Image 系列、Google 的 Imagen 4 各档位以及 Gemini 图像预览版,还有 xAI 的 Grok Imagine 图像端点。如果你打算花一周时间搭建一个 33 GB 的扩散 Transformer,只为弄清它能否胜过某个托管模型,那么托管模型就是对照组,而让对照组已经挂在一把密钥上,是值得的

什么会改变这一比较?

三件事,按它们的重要性排序。

第一,要为这两个模型中的任何一个给出独立的基准测试分数。两者都没有,而在这一点改变之前,双方所有关于质量的宣称都不过是实验室在给自己批改作业。第二,许可证:Qwen-Image 2.1 若有一个宽松许可证的变体,就会让它成为 7B 规模开放图像工作的显然默认选择;而 LLaDA-Image-Turbo 只要声明任何许可证,至少就能让人把它纳入规划。第三,Qwen 于9月17日在 ModelScope 项目中的早期访问测试者被要求在9月29日之前发布样本或评测——也就是八天后。到那时,这就不再只是两份模型卡之间的比较,而开始成为真正的对比。在那之前,诚实的总结是:Qwen-Image 2.1 是看起来能力更强、却无法商用的模型;LLaDA-Image-Turbo 是速度更快、但不谈一谈就完全没法用的那个;而许可证文件是这两个发布中唯一完全尘埃落定的部分。