
Qwen-Image 2.1 与 LLaDA-Image-Turbo:两个开放图像模型,两种截然不同的许可证
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
两个开放权重的图像模型在同一个三周内相继落地。Qwen-Image 团队于 2026 年 9 月 20 日发布了 Qwen-Image 2.1——权重、许可证文件、模型卡和一篇博客文章全都在同一天上线,之前几乎没有任何预热。而在此前十六天,也就是 2026 年 9 月 4 日,inclusionAI(蚂蚁集团的研究实验室)发布了 LLaDA-Image-Turbo,没有发布帖、没有新闻稿,也没有任何形式的公告。如今两者都可以下载。两者都没有任何一个独立的基准测试分数。而真正决定你能用哪一个的差别,并不在任何一个模型卡里——而在那些文书里。Qwen-Image 2.1 采用的是直接禁止商业使用的研究许可证。LLaDA-Image-Turbo 则在它的所有代码仓库中都没有声明任何许可证。
许可证问题排在第一位,因为它是唯一一个有明确答案的问题。
从这里开始,因为这一对比中的其他一切都只是暂时的,而这个不是。
• Qwen-Image 2.1根据日期为 2026 年 9 月 20 日的《Qwen Research License Agreement》发布,该协议授予的权利“仅限非商业用途”,并声明商业使用需要向厂商另行申请许可。与早先以 Apache 2.0 许可发布的 Qwen-Image 系列相比,这是一个重大变化。这一点毫不含糊:你可以阅读、评估、进行基准测试并撰写相关内容,但不能将其用于产品中。
• LLaDA-Image-Turbo根本没有声明任何许可证。既不是宽松许可证,也不是限制性许可证,甚至连占位符都没有。一个没有许可证的仓库在任何法律意义上都谈不上“可自由使用”——它默认保留所有权利,这比 Qwen 的研究许可证更为严格,而非更宽松。如果你打算基于它进行开发,这该去问实验室,而不是看 README。
这种讽刺值得直白地说出来:那个带着正式、限制性许可证而来的模型,才是你今天可以围绕它做规划的那一个,因为你清楚自己究竟处在什么位置。而没有许可证的那个模型,才是你无法围绕它做规划的那一个。

这两个模型实际上是什么
抛开授权问题,这是两种真正不同的设计,出于不同的原因而打造。
• 架构 — Qwen-Image 2.1 是一个 32 层单流扩散 Transformer,其视觉生成组件拥有 7B 参数,配备 Qwen3-VL 8B 文本编码器和 64 通道 RGBA VAE(16× 空间压缩),整个套件约 33 GB。LLaDA-Image-Turbo 则是一个 6B 的统一生成与编辑模型——用同一套权重同时完成两项任务,而非基础模型外加一条独立编辑路径。
• 推理步数 — Qwen-Image 2.1 默认在 2048×2048 分辨率下以 40 步运行,采用流匹配与 Euler 离散调度。LLaDA-Image-Turbo 通过 Twin-DMD 蒸馏至 2–4 步,推荐使用 4 步,其在引导尺度 1.0 下运行,而 Base 模型为 5.0。
• 精度选项 — Qwen-Image 2.1 通过其 vLLM-Omni 路径发布了 FP8 量化支持。LLaDA-Image-Turbo 以独立下载的形式同时提供 BF16 和 FP8 检查点。
• 参考条件控制 — Qwen-Image 2.1 最多可接受 10 张参考图像,支持通过圈选、涂鸦标注或独立蒙版进行局部编辑,并可生成原生 RGBA,实现透明图层编辑。LLaDA-Image-Turbo 的卡片未公布参考图像数量上限。
• 注意——Qwen-Image 2.1 采用块因果注意力:对文本使用令牌级因果掩码,对图像生成使用块级双向掩码,当检查点带有 causal_condition: true 时,会复用前缀 KV 缓存。LLaDA-Image-Turbo 的模型卡未以同样详尽的程度描述其掩码方案。
• 许可证 — 仅限研究且明确声明,相对于未声明。
注意步数与参数量的含义。Qwen-Image 2.1 是一个更大的模型,运行步数是其十倍;LLaDA-Image-Turbo 则是一个更小的模型,被蒸馏到只需少数几步。这是对图像生成成本究竟落在何处的两种相反押注,而正确答案完全取决于你的瓶颈是每张图消耗的 GPU 秒数,还是一张图能达到的视觉上限。
速度经济学:40 步对 4
Turbo 这个名字在这里名副其实。Twin-DMD 蒸馏把扩散轨迹压缩为少数几次大跳跃,这正是 LLaDA-Image-Turbo 能在 4 步下运行、而其 Base 模型却需要常规调度方案的原因。在 guidance 1.0 下,它还跳过了无分类器引导,而后者通常会使每步的前向传播次数翻倍——因此,实际差距比单看 40 对 4 所体现的要更大。
这为你换来的是吞吐量和可预测性。一个 6B 模型在四步下,正是那种能装进单张消费级显卡、并且生成草稿图像快到足以放进交互循环里的东西。Qwen-Image 2.1 在 40 步和 2048×2048 下是质量优先型配置;模型卡自身针对受限硬件的建议是采用 CPU 卸载,具体通过 pipe.enable_model_cpu_offload(),这更像一种权宜之计,而非修复方案。
平衡因素在于,蒸馏是对能力的压缩,而这里的一切都尚未被两家实验室之外的任何人测量过。对于这两个模型来说,唯一存在的独立数据点,是来自 Qwen Ambassador 计划的一位测试者对 Qwen-Image 2.1 的早期访问上手评测,他通过 ModelScope Studio 界面运行了最终权重,并报告文本到图像大约需要 10–15 秒,编辑大约需要 18–23 秒。这只是一名评测者、在一个早期访问 UI 上、没有显示计时器的情况下得出的结果——是有用的信号,而不是基准测试。LLaDA-Image-Turbo 则完全没有任何可比的公开上手报告。

编辑功能是两种设计差异最大之处
这两个模型都能实现文本生成图像和图像编辑,但它们的实现路径不同,而这种差异体现在底层机制上,而非输出结果上。
Qwen-Image 2.1 将指令遵循视为一个独立的、可检查的组件。除图像模型之外,该版本还包含两个提示词改写检查点——Qwen/Qwen-Image-2.1-PE-T2I 和 Qwen/Qwen-Image-2.1-PE-I2I,二者均为微调后的 Qwen3.5-VL 9B,体积约 18.8 GB——它们会在扩散模型看到提示词之前,先把含糊的指令改写成明确无歧义的指令。I2I 变体始终有输入图像,因此它永远是一项编辑任务,而绝非从无到有的生成。关键在于,该改写器附带一份你可以阅读并覆盖的 system_prompt.txt,而且它对语言的说明异常明确:描述所用的语言遵循你的指令,而绘制到图像中的文字采用何种语言,则由一套严格的优先级顺序决定——即使你用另一种语言发出提示,它也会保留输入图像中已有的标签语言。
这是一项小工程,但影响范围很大。如果你正在为一个包装文案至关重要的市场制作产品图像,那么“重写器保留现有标签语言”和“重写器好心地将所有内容翻译成英语”就是可用素材与被拒素材之间的区别——而且因为它存在于系统提示中,而不是在某个托管黑盒里,你可以对它进行 diff 并修改它。
LLaDA-Image-Turbo 做出了相反的取舍:一个 6B 模型、一套权重,生成与编辑共享一切。更少的活动部件,更少的配置项,也没有任何可供检查或覆盖的东西。它的模型卡引用了 Qwen-Image-Bench 上的分数:英文 53.53、中文 53.38,并宣称开源 SOTA——但这是厂商自报、未经复现,而且请注意,它所赢得的这个基准,是以它暗中竞争的模型命名的。
你实际上会在什么上面运行它们
发布日的生态系统支持是发布过程中最不引人注目的部分,却也是决定你是花一个下午还是一个周末的部分。
• Qwen-Image 2.1实现了全面落地:QwenImage21Pipeline在首发当天即合并进 Diffusers;原生支持 ComfyUI,并提供文生图与图像编辑工作流模板;vLLM-Omni 支持分步执行、前缀 KV 缓存、CUDA Graph 解码、FP8 量化以及张量/Ulysses 并行;一项原生支持 SGLang 的 pull request 于 9 月 17 日落地——提前三天,在权重发布之前——涵盖 DiT、RGBA VAE、Qwen3-VL 条件注入与多参考输入,并已在 H200、B200、RTX PRO 6000、RTX 5090 和 RTX 4090 上完成验证;同时通过 LightX2V 实现零日加速,在 AMD Radeon 上经由 ROCm 运行,并通过 FlagOS 实现多芯片支持。
• LLaDA-Image-Turbo于 2026 年 9 月 7 日获得 ComfyUI 支持,比权重发布晚三天,同时还提供了 Diffusers 和 Safetensors 分发版本。这确实是一条可行的运行路径,但相对单薄,而且没有可与之对应的预发布服务阶段的工作可资参照。
SGLang 的预发布拉取请求是 Qwen-Image 2.1 的信号。框架支持先于权重落地,意味着有人是在用检查点测试服务路径,而不是事后照着模型卡来补写。

你与实验一起保留的托管路径
在撰写本文时,这两个模型都无法通过 OrcaRouter 进行路由,本文也不会暗示并非如此——两者都是自托管方案,一个采用的许可证排除了生产用途,另一个则完全没有任何许可证。对于评估它们的团队来说,重要的是,评估不必处于关键路径上。
OrcaRouter 将 200 多个模型统一置于一个兼容 OpenAI 的端点之后,按供应商目录价提供、零加价,并具备跨供应商的自动故障转移能力,以及一套路由 DSL,让你可以把多个模型组合成一次调用。对于眼下这个决策,其实际形态就是一条路由:你已信任的模型承载生产流量,同时让一个自托管检查点在它旁边接受测试——而且由于目录价是直接透传而非加价,任何被路由模型的供应商调价当天就会在我们这边生效,而不必等待合同修订。我们今天实际路由的图像模型包括 OpenAI 的 GPT-Image 系列、Google 的 Imagen 4 各档位以及 Gemini 图像预览版,还有 xAI 的 Grok Imagine 图像端点。如果你打算花一周时间搭建一个 33 GB 的扩散 Transformer,只为弄清它能否胜过某个托管模型,那么托管模型就是对照组,而让对照组已经挂在一把密钥上,是值得的。
什么会改变这一比较?
三件事,按它们的重要性排序。
第一,要为这两个模型中的任何一个给出独立的基准测试分数。两者都没有,而在这一点改变之前,双方所有关于质量的宣称都不过是实验室在给自己批改作业。第二,许可证:Qwen-Image 2.1 若有一个宽松许可证的变体,就会让它成为 7B 规模开放图像工作的显然默认选择;而 LLaDA-Image-Turbo 只要声明任何许可证,至少就能让人把它纳入规划。第三,Qwen 于9月17日在 ModelScope 项目中的早期访问测试者被要求在9月29日之前发布样本或评测——也就是八天后。到那时,这就不再只是两份模型卡之间的比较,而开始成为真正的对比。在那之前,诚实的总结是:Qwen-Image 2.1 是看起来能力更强、却无法商用的模型;LLaDA-Image-Turbo 是速度更快、但不谈一谈就完全没法用的那个;而许可证文件是这两个发布中唯一完全尘埃落定的部分。
