主视觉卡片标题为“Qwen-Image-2.1 vs GPT Image 2”,副标题为“免费下载,或租用排名靠前的那一个”,并有三行:Qwen-Image-2.1 33 GB 下载、非商用,GPT Image 2 仅提供 API、按 token 计费,透明度 RGBA VAE 对比请求参数,旁边配有下载箭头和仪表图标。
Guides & Insights

Qwen-Image-2.1 vs GPT Image 2:免费下载,还是租用最好的那个

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Qwen-Image-2.1是一个 33 GB 的下载包,你可以免费运行,却不能出售。GPT Image 2则是一个根本无法下载的 API,按 token 计费,投入生产已有四个月,并稳居独立图像排行榜榜首。这两个事实就构成了这笔交易的全部,而有趣之处在于,那个一开始就让人值得一看 Qwen-Image-2.1 的透明功能,在一个月之内以完全不同的路径登陆了两套系统。Qwen-Image-2.1 于 2026 年 9 月 20 日发布,其潜在空间中内建了 alpha。GPT Image 2 则在 2026 年 8 月 20 日通过 API 标志新增了 background: "transparent"参数。

通往同一功能的两种路径

透明的输出结果,正是大多数人最终会去比较这两者的原因,所以就从这里入手吧,因为它们的实现方式并不等同,而这种差异比输出结果本身更重要。

Qwen-Image-2.1 的透明度是架构层面的。一个 64 通道的 RGBA VAE,配合 16 倍空间压缩,意味着 alpha 是模型进行去噪的潜空间的一部分。同一套机制带来了三种用途:生成带透明度的图像;在已有透明度的图像内部进行编辑而不将其压平;从普通 RGB 照片中提取主体并返回 alpha 而非二值掩码。这是一项能力、三种用法,而厂商自己的说法是:无需单独的背景移除节点、抠像模型或边缘清理环节。

GPT Image 2 的透明度是一个请求参数。添加background: "transparent"并搭配output_format: "png",即可返回一张带有真实 alpha 通道的图像,并且在文生图、图像编辑以及 Responses API 中的图像生成工具中都可正常使用。基于蒙版的局部重绘(inpainting)与透明背景可以结合使用。它是以预览版形式发布的,因此 OpenAI 官方的说明是结果可能不稳定——而且带透明度的编辑被描述为重新绘制或移除背景,而非精确的轮廓抠图。至少有两个二手来源声称该参数不可用,且 GPT Image 2 根本不输出透明度;这些说法与发布报道、API 文档镜像以及第三方测试相矛盾,因此应将其视为过时或错误的信息,而非反向信号。透明度不会改变 token 成本——在给定的质量和尺寸下,透明图像与不透明图像消耗相同的图像 token。

所以两者都会产生 alpha。一个之所以如此,是因为模型本来就是那样构建的;另一个则是因为某个参数向服务请求了它。哪一种更好,完全取决于这个 alpha 是否必须经受住编辑循环的考验,而这在一个下午之内就能验证。

GPT Image 2 的先发优势能为你带来什么

四个月的投产时间不是卖点,而是成熟度上的差距,而且它会在一些平淡却关键的地方暴露出来。

独立排名 —— GPT Image 2 位居独立图像排行榜榜首,且占据该位置的时间已足够长,足以说明这是稳定表现,而非发布周的短暂冲高。本文撰写时,Qwen-Image-2.1 完全未出现在这些榜单上。
有据可查的失败模式 —— 一个已公开使用四个月的模型,积累了可供查阅的已知失败案例,让你能在踩坑之前先了解清楚。而昨天才公开的模型,只有厂商的评分卡和一次集成测试。
运维能力面 —— 以每分钟令牌数和每分钟图像数双重维度给出的分级速率限制(从入门级的 100,000 TPM 和 5 IPM,一直到最高档的 8,000,000 TPM 和 250 IPM),并支持批量端点。这正是演示与可估算容量的队列之间的区别。
来自第三方的质量数据 —— 榜单排名是独立测得的。Qwen-Image-2.1 唯一的数字来自厂商自家的 Qwen-Image-Bench 图表,其中它显示为 60.28,而 Nano Banana 2.0 为 59.82,GPT Image 1.5 为 59.65。此为厂商材料,未经复现。

关于 Qwen-Image-2.1 唯一真正独立的数据点,是随 SGLang 集成一同发布的功能验证:透明 PNG 输出通过,alpha 在完整的 0–255 范围内得以保留,在单个样本上测得 RGBA PSNR 为 60.69 dB,且 FP8 配置通过了透明 PNG 生成。SGLang 作者明确表示,这是一项正确性检查,而非通用质量保证。这是目前可获得的、证明 alpha 通道真实存在的最强证据。它完全没有说明这些图片是否好看。

该法案,已审议完毕

GPT Image 2 按 token 计费,这意味着素材成本取决于质量档位和分辨率,而按图计价会掩盖这一点。公布的目录价为每百万文本输入 token 5.00 美元、每百万图像输入 token 8.00 美元、每百万图像输出 token 30.00 美元,缓存费率分别为 1.25 美元和 2.00 美元。OpenAI 并未发布该模型的静态输出 token 表——涵盖低、中、高 token 数量的旧表已明确标注不适用于 GPT Image 2——因此下面的数字是第三方在 1:1 宽高比、文生图条件下对目录价格的实测值:

1K 输出—— 每张图片:低质量 $0.0059,中等 $0.053,高质量 $0.211。
2K 输出—— 低质量 $0.012,中等 $0.107,高质量 $0.428。
4K 输出—— 低质量 $0.020,中等 $0.178,高质量 $0.712。

在相同分辨率下,低质量与高质量之间的差距大约是三十五倍。这才是 GPT Image 2 流水线中真正要做的决策:不是选哪个模型,而是在最低成本下哪一档质量能通过审核。而它与编辑功能的相互作用方式,往往让人措手不及——input_fidelity在该模型上无法调整,因为它会自动以高保真度处理每一张图像输入,所以带有参考图的编辑请求所消耗的图像输入 token 会比你根据输出尺寸估算的更多。因此,在这里“生成—检查—编辑”循环的成本,比单张图片的数字所显示的要高。

相比之下,Qwen-Image-2.1 每张图像的边际成本就是电费。问题出在固定成本和许可上。下载需要三十三吉字节,其中 DiT 约占 14 GB,其余归于 Qwen3-VL 8B 文本编码器,在显存受限的显卡上建议启用 CPU 卸载,而这一切都受 2026 年 9 月 20 日签订的 Qwen Research License Agreement 约束——仅限非商业用途,商业权利需另行安排,且没有公布的价格或条款。

A two-column board for Qwen-Image-2.1 and GPT Image 2 carrying both sides on one line per dimension: Weights, Licence, Transparency, Quality evidence, Pricing and Maturity. Footer separates vendor-reported figures from independently verified ones and notes that per-image API cost moves with quality tier and resolution.

托管选项所处的位置

有一条中间道路可以同时绕开 GPU 和授权问题,而且这也是大多数团队实际采用的做法。OrcaRouter 将 OpenAI 的 GPT-Image 系列与 Google 的 Imagen 4 各档位、Gemini 图像预览版以及 xAI 的 Grok Imagine 图像端点一并路由——200 多个模型汇聚在一个兼容 OpenAI 的端点之后,供应商标价零加价直通,跨供应商自动故障转移,外加路由 DSL 和模型融合。由于是标价直通而非加价转售,任何被路由模型一旦降价,当天就能生效;又因为故障转移是自动的,某家供应商出状况也不会变成你的服务中断。Qwen-Image-2.1 不在我们路由的模型之列,其他任何 Qwen-Image 版本也一样——它只能本地部署——所以这并不是为新来者做宣传。这是对“在评估这个新来者期间我该用什么”的诚实回答。

Decision card titled 'The tiebreak' with two panels: 'Download it - Qwen-Image-2.1', free to run and non-commercial with alpha that is part of the latent space, and 'Rent it - GPT Image 2', independently ranked with a per-image cost from about $0.006 to $0.71 depending on tier and resolution.

这个决定,直白地说

如果输出用于商业用途,如果你需要独立测量的质量下限,如果你想要可预测且可设上限的按资产成本,或者如果你需要它本周就能用上而无需购买硬件,那就选 GPT Image 2。接受你是在租用、无法微调、无法离线运行,并且每张图像成本会随用量永久线性增长。

如果输出用于研究、评估或个人用途,就选 Qwen-Image-2.1;如果你特别想要的是能在编辑循环中保留下来的 alpha,而不是某个参数一次性生成的 alpha;如果你想读懂重写逻辑——随附的 PE-T2I 和 PE-I2I 检查点是微调过的 Qwen3.5-VL 9B 模型,配有可读的 system_prompt.txt,这比任何托管图像 API 能提供给你的都多——或者你只是想知道,到 2026 年 9 月,一个 7B 开放权重图像模型能做到什么,而又不必为每张图付费去一探究竟。

两个都不选,而是把它转出去——前提是交付物属于商业性质,且截止日期是硬性的。这不是推诿回避,而是那个不需要你去解决一个目前还无人能答复的许可问题的选项。

Screenshot of the OrcaRouter catalogue page for the openai/gpt-image-2 model, showing the model listing, the $8.00 per 1M token input and $30.00 per 1M token output pricing cards, and the LM Arena image-edit Elo figure quoted in the model description.