一张生成的主视觉卡片,标题为 Qwen-Image-2.1 vs GPT-Image-2.5,画面中一张标注为 Qwen-Image-2.1 的卡片带有下载图标,旁边写着 33 GB 权重,紧挨着的另一张卡片标注为 GPT-Image-2.5,带有计量表盘图标,文字为按 token 计费,卡片配文是:一个供你下载,一个按量计费。
Guides & Insights

Qwen-Image-2.1 对比 GPT-Image-2.5:差距只是一个数字,而且不是质量

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Qwen-Image-2.1GPT-Image-2.5放在规格参数上并排对比,它们看起来就像一对孪生兄弟:两者都是统一的生成与编辑图像模型,都支持透明背景输出,都在最近五周内发布,都能输出 2K 级静态图像。决定二者之间如何取舍的差异只有一个数字,而且并非基准测试得分。Qwen-Image-2.1 可以免费下载,却无法拿来售卖。GPT-Image-2.5 无法下载,却可以轻而易举地售卖。其余的一切——架构、延迟、透明效果的实现方式——都是这一点的下游产物。Qwen-Image-2.1 于 2026 年 9 月 20 日开源;GPT-Image-2.5 于 2026 年 9 月 8 日发布,其 API 模型同日上线。

两种增加透明度的方式,相隔一个月

两个模型在几周内先后获得透明输出,这一巧合值得深究,因为这两种实现方式并不等同。

Qwen-Image-2.1 将 alpha 放进了模型内部。它在具有 16× 空间压缩的 64 通道 RGBA 潜空间中进行去噪,因此 alpha 通道是采样器所生成结果的一等组件。没有分割步骤,也没有抠图环节。除此之外,还有一个不同寻常的额外特性:由于模型可以按提示决定是输出 RGB 还是带 alpha 通道的图像,它也能从一张普通照片中提取出主体,返回一个透明图层,而不是二值掩码。

GPT-Image-2.5 走的是参数路线。OpenAI 的 API 接受 background设置为 auto、opaque 或 transparent,模型会据此作出相应的响应。这是在托管端点上的一个能力开关,而非潜在空间本身的属性;它的好处在于你根本不用为它费心:设好标志,拿到抠图,继续手头的事。代价则是端点给什么你就得什么,分辨率和成本都由端点说了算。

哪个更好,至今确实尚无定论。在撰写本文时,还不存在将 Qwen-Image-2.1 的 alpha 边缘与专用抠图模型进行对比的公开比较;而在 Qwen 一侧,唯一公开的检查是功能性的——透明 PNG 输出通过,alpha 在完整的 0–255 范围内得以保留,单个样本的 RGBA PSNR 为 60.69 dB。那是一项正确性检查,而非质量评判。它只能说明该通道是真实存在的。

你实际可以衡量的内容

参数 —— Qwen-Image-2.1 的生成组件是一个 7B、32 层的单流扩散 Transformer,搭配 Qwen3-VL 8B 文本编码器;权重总计约 33 GB,其中 DiT 约占 14 GB。OpenAI 未公布 GPT-Image-2.5 的参数数量。
分辨率 —— Qwen-Image-2.1 在 40 个推理步数下原生输出最高 2048×2048,提供七种宽高比预设。GPT-Image-2.5 支持最高 3840×2160 和 2160×3840 的尺寸,每条边上限为 3840 px,且必须为 16 的倍数。
参考图像 —— Qwen-Image-2.1 最多接收 10 张,用于多主体合成和虚拟试穿。OpenAI 的图像模型可接受参考输入用于编辑,但实际限制和保真表现因模型和质量档位而异。
延迟 —— SGLang-Diffusion 公布的数据为:在单块 B200 上,1024×1024、40 步生成耗时 2.748 秒;在 24 GB 的 RTX 4090 上使用 Cache-DiT 和 INT8 内核时耗时 4.74 秒(仅去噪阶段)。OpenAI 称 GPT-Image-2.5 的 Flare 变体延迟比 GPT-Image-2 最多降低 50%,另有一家发布合作伙伴测得的降幅为 2–4 倍——前者为厂商自报,后者为合作伙伴自报,均非受控对比。
价格 —— Qwen-Image-2.1 没有托管价格,因为没有托管端点;成本就是你自己的 GPU 时间。GPT-Image-2.5 按与 GPT-Image-2 相同的 token 费率计费:每 100 万图像输入 token 8.00 美元,每 100 万图像输出 token 30.00 美元,每 100 万文本输入 token 5.00 美元。
许可证 —— Qwen-Image-2.1 依据 2026 年 9 月 20 日签署的《Qwen 研究许可协议》发布,仅限非商业用途。GPT-Image-2.5 是商业 API,输出带有 C2PA 来源信息和不可见水印。

那份清单里有一行比看起来更单薄。OpenAI 不公布 GPT-Image-2.5 的每张图价格,只公布 token 费率,而图像 token 消耗会随分辨率和质量档位而变化。第三方测量给出的范围大约是每张图 $0.0059 到 $0.712,涵盖 1K、2K 和 4K,在低、中、高设置以及 1:1 宽高比下——可作为数量级参考,而不是报价。如果你在做预测,请根据 token 数量和你自己的提示词分布来构建估算,而不是依据别人测得的每张图数字。

A generated two-column scoreboard titled Qwen-Image-2.1 vs GPT-Image-2.5 - the scoreboard. Left column Qwen-Image-2.1 rows: Generation component 7B DiT; Transparency native RGBA; Resolution 2048 x 2048 native; Reference images up to 10; Price self-hosted GPU time; Licence non-commercial research only. Right column GPT-Image-2.5 rows: Generation component undisclosed; Transparency API parameter; Resolution up to 3840 x 2160; Reference images per the editing API; Price 8 and 30 dollars per 1M tokens; Licence commercial, C2PA and watermark. Footer: Qwen figures per the vendor model card, unaudited; OpenAI figures per the vendor API reference.

没人会把这两项成本放在同一栏里

这个比较之所以难以给出一个简单的答案,是因为这两种模式用不同的货币向你收费,而汇率恰恰取决于你自己的具体情况。

GPT-Image-2.5 按 token 计费,这意味着计量可见、可预测,并随用量线性增长。对于流量已知的产品来说,这是一个真正的优势:你可以把它纳入预算,而供应商降价后,你的成本当天就会跟着下降。它也是对探索征收的一种税,因为提示词的第 10 次迭代与第 1 次成本相同。input_fidelity 行为让这一点比表面费率所暗示的更加尖锐——API 可以自动对图像输入应用高保真处理,这会消耗比随便看一眼价目表所暗示的更多的输入 token,因此编辑循环的成本高于人们引用的单图数字。

Qwen-Image-2.1 把这两种属性都颠倒了过来。第 100 次生成的边际成本是电费。这使它成为更适合迭代、批量回填,以及任何提示词仍在摸索阶段的场景的工具。但它无法为财务报表提供一个数字——无论 GPU 是忙是闲,你都在为它付费——也不赋予你出售生成结果的权利。《Qwen 研究许可协议》仅允许非商业性的研究与评估,并声明商业部署需要获得杭州通义实验室技术有限公司的单独许可。该许可没有公开的价格,也没有列明条款。这不是一条脚注;对于商业流水线而言,这就是整个决策本身。

同时运行两者,无需第二份合同

对大多数团队来说,现实的答案不是二选一,而是两者都要。GPT-Image-2.5 负责生产路径,在这条路径上,输出会交付给客户,而按 token 计量的费用会作为单独一项列出。Qwen-Image-2.1 负责探索路径,在这条路径上,你需要一张透明产品图的两百个变体,而没有供应商会以合理的价格卖给你这个量。

摩擦在于,这两者通过完全不同的途径抵达。一个是 API 密钥。另一个是 33 GB 的下载、一个 Python 环境,以及一块你自己拥有的 GPU。OrcaRouter 覆盖托管的那一半:200 多个模型统合在一个 OpenAI 兼容端点之后,提供商目录价以零加价透传,跨提供商自动故障转移、用于表达回退的路由 DSL,以及将多个模型合并为一次调用的模型融合。在这个模型上保持精确很重要——我们今天并不路由 GPT-Image-2.5;我们的 OpenAI 图像路由是 GPT-Image-2、GPT-Image-1.5GPT-Image-1-mini,全部按 OpenAI 目录价,而当上游提供商添加 gpt-image-2.5 标识符的那一天,同一个密钥无需更改代码即可调用它们。我们也不路由任何版本的 Qwen-Image 模型,因此 Qwen-Image-2.1 在我们这边根本不是一条路由。与此同时,透传定价给你带来的好处是:当 OpenAI 调整费率时,我们这边的数字会随之变动,而不是滞后变动。

结论以条件而非胜者的形式陈述

如果产出需要对外销售,这就没什么好争的:GPT-Image-2.5 是这两者中你获准使用的唯一一个,而 token 计量就是为此付出的代价。如果产出用于研究、内部工具或评估,Qwen-Image-2.1 则是更强的工具——原生 2K、采样器直接输出 alpha、十张参考图,而且一旦硬件成本付清,边际成本就是零。如果你两者都需要,那就两个都跑,并把许可证视为决定某项具体任务进入哪条流水线的边界。

有两件事会改变这一点。一份正式发布的 Qwen-Image-2.1 商业条款清单,将会弥合许可条款那一行的差距——而这一行目前在这项对比中起着主要作用。此外,如果 Qwen-Image-2.1 能在某个独立图像排行榜上占有一席之地,就能告诉我们:厂商自家的 Qwen-Image-Bench 成绩——60.28,领先于 Nano Banana 2.0 的 59.82 和 GPT Image 1.5 的 59.65,在开源模型中排名第一——能否在产出该成绩的实验室之外依然站得住脚。这两者目前都还不存在。在它们出现之前,最诚实的建议是:依据许可条款和计价方式来选,而不是看记分牌。

A screenshot of OrcaRouter's own model page for openai/gpt-image-2, captured September 21 2026, showing the model description as OpenAI's token-billed image model reached through the Images API, the /v1/images/generations endpoint, and the published list rates of $8.00 per 1M image input tokens and $30.00 per 1M image output tokens.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.