
Qwen-Image-2.1 对比 Grok Imagine Image 2.0:免费权重对决付费环境
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
其中一个每张图片不花一分钱,但附带的许可证禁止出售生成结果。另一个则每张图片要花两到六美分,具体取决于你在哪里购买,没有此类限制,而且会出现在你真正查得到的排行榜上。Qwen-Image-2.1于2026年9月20日以研究许可证下的开放权重形式公开发布。Grok Imagine Image 2.0是该厂商的付费图像端点,通过其自有API以及众多第三方提供商分发。在两者之间做选择,关键不在质量——而在于你是想拥有模型,还是租用其周边的环境,而这个环境所做的工作,比价格标签所暗示的要多。
每一方为一幅画付出的代价是多少
Qwen-Image-2.1 的按图价格为零,而一次性成本则不为零。你需要下载大约 33 GB——一个约 14 GB 的 7B、32 层单流扩散 Transformer,再加上占据其余大部分体积的 Qwen3-VL 8B 文本编码器——在那之后,每张图片的边际成本就是运行它的电费。在显存受限的显卡上,模型卡建议通过 pipe.enable_model_cpu_offload() 启用 CPU 卸载,这是标准的逃生舱,代价是速度而不是金钱。
Grok Imagine Image 2.0 的价格形态恰好相反。xAI 自己的文档将旗舰产品列为每张输出图像 $0.04,基础 Grok Imagine 图像端点为 $0.02,质量层级为 $0.05。第三方提供商也落在类似区间,并各自采用分层定价——一家列出文本生图和编辑的固定费率分别为 $0.05 和 $0.06,无论分辨率或质量设置如何;另一家报价其质量层级在 1K 和 2K 下均为固定 $0.045;还有一家宣传文本生图或参考编辑为 $0.025,最多可使用五张输入图像。在整个市场上,这大致落在每张图像 $0.02 到 $0.06 之间,而消费者使用权限则捆绑在 X Premium 和 SuperGrok 中,而非按图片计费。
• 成本模型 — Qwen-Image-2.1 是固定的硬件与下载成本,每张图像的边际成本为零;Grok Imagine Image 2.0 则纯粹是边际成本,随用量永远线性增长。
• 盈亏平衡点 — 交叉点是一个你可以计算的用量问题,而且每当供应商调整费率,它就会移动。在每月几千张图像的规模下,托管路线远比买一块 GPU 便宜;在持续高用量下,本地路线在成本上胜出,却在其他所有维度上落败。
• 本地路线买不到的东西 — 速率限制、正常运行时间,以及别人的运维团队。而托管路线买不到的,是权重。
排行榜说明了什么,又没有说明什么
Grok Imagine Image 2.0 有公开的排名声明。xAI 的发布材料称,截至 2026 年 8 月 7 日,它在 Text-to-Image 和 Image Edit Arena 两个榜单上总体均位列第二,仅次于 GPT Image 2——这是厂商援引、带有时间戳的快照,也应按此性质来解读。此后数周的第三方追踪机构将其排在图像编辑约第二、文生图第三,同样落后于 GPT Image 2,Elo 分数在 1,300 分出头,而一些追踪网站报告的数字更接近 1,173–1,175。这些数字之间的差距本身就是启示:该类别排行榜上的位次每周都在变动,而没有标注日期的排名算不上信息。
Qwen-Image-2.1 完全没有排名。在撰写本文时,它未出现在独立图像排行榜中。其唯一的质量数据是厂商自己的 Qwen-Image-Bench 图表,其中它的得分为 60.28,而 Nano Banana 2.0 为 59.82,GPT Image 1.5 为 59.65——这是厂商材料,未经任何第三方复现。唯一真正独立的数据点是随 SGLang 集成工作一同发布的功能验证:透明 PNG 输出通过,alpha 在完整的 0–255 范围内得以保留,并且 RGBA PSNR 在单个样本中测得 60.69 dB,作者明确将其描述为正确性检查而非质量保证。
所以,诚实的记分牌是这样的:一个模型拥有一个会变动的公开排名,还附带着一项厂商声明;另一个则拥有一份厂商评分卡和一项通过的集成测试。这算不上对比,而任何声称并非如此的文章都没有把两者都实际跑过。

Alpha,以及为何它是唯一的技术不对称性
Qwen-Image-2.1 的透明度是内建于模型之中的。一个 64 通道的 RGBA VAE,配合 16× 空间压缩,意味着 alpha 通道本身就是被去噪的潜空间的一部分,由此一种机制带来三件事:带透明度生成、在已具备透明度的图像内部进行编辑而无需先将其压平,以及从普通 RGB 照片中提取主体并返回 alpha 而非硬掩码。无需背景移除节点、无需抠图模型、无需边缘清理——这是厂商的说法,而 SGLang 的功能验证是唯一独立的证据,表明该通道是真实存在的,而非名义上的。
Grok Imagine Image 2.0 没有有据可查的同类方案。其公开的能力范围是文生图和基于参考图的编辑,具备分辨率与质量档位,在某些提供商处最多支持五张输入图像。如果你的素材需要一个边缘干净、带半透明效果的抠像主体——头发、玻璃、烟雾——那么在 Grok 这一侧你就得额外加一步抠图处理,而在 Qwen 那一侧则不需要。这一步的成本是否高于另一侧的许可问题,才是真正的工程问题,而这取决于你的具体题材。
编辑环境与检查点的对比
这两个系统在编辑智能应该位于何处的问题上意见不一。
Grok Imagine Image 2.0 把它放进了服务里。你发送一张参考图像和一条指令,由提供商来决定这意味着什么,而分辨率和质量层级则按每次请求来选择。没有什么需要阅读,没有什么需要调优,也没有什么会出故障——对于不想自己拥有一套 diffusers 流水线的团队来说,这是一个实实在在的优势。这也正是为什么名义上相同的模型,价格会因提供商而异:你购买的是一个环境,而不只是权重。
Qwen-Image-2.1 把它放进了可以检查的检查点里。除了图像模型,它还附带两个提示词重写模型——PE-T2I 和 PE-I2I,每个都是微调过的 Qwen3.5-VL 9B,约 18.8 GB——重写代码位于一个 prompt_rewrite/ 文件夹中,并附带一份 system_prompt.txt,其中除其他内容外,还说明了渲染文本的语言是如何选择的。这种可检查程度是任何托管式图像 API 都无法提供的。同时,它也是在模型之上额外增加的 37.6 GB 重写器,对于大多数流水线都会视为可选组件的部分来说,这是磁盘占用和加载时间上的实际成本。
• 编辑方式 — Qwen-Image-2.1 支持通过圈选、涂抹标注或单独蒙版进行局部编辑,还支持透明图层编辑与主体提取;Grok Imagine Image 2.0 有文档记录的编辑方式为参考图驱动。
• 参考输入 — Qwen-Image-2.1 最多接受 10 张参考图,一位抢先体验的评测者报告称,从大约三张图开始,多参考一致性就会下降;多家 Grok 服务商记录最多支持五张输入图像。
• 原生分辨率 — Qwen-Image-2.1 原生以 2K 输出,在七种宽高比预设下,默认 40 步时为 2048×2048;Grok Imagine Image 2.0 的分辨率是按请求选择的,由服务商定价。
分发与许可证
这正是两者分歧最为尖锐之处,而这根本不是技术上的差异。
Grok Imagine Image 2.0 可通过 xAI 的 API 以及多家独立的第三方服务商获取,这意味着存在价格竞争,也就意味着你支付的价格是市场价格,而非标价。无需下载,无需 GPU,没有需要阅读的许可证文件,除服务商自身的条款之外,商业使用也不受任何限制。
Qwen-Image-2.1 只有一种获取方式:下载。它依据 2026 年 9 月 20 日发布的《Qwen 研究许可协议》分发,该协议仅授予非商业用途的权利,并明确说明商业使用需向供应商另行申请许可。相比此前采用 Apache 2.0 分发的 Qwen-Image 系列,这是一次收紧,而也正是这一个事实,决定了这两者之间大多数实际选择的走向。一家以输出质量来对比二者的工作室,问的是错的问题;而一家无法将 Qwen-Image-2.1 用于客户项目的工作室,根本就不会把二者放在一起比较。
OrcaRouter 正是这套安排中“租用”那一侧的所在。我们把200+ 个模型统一置于一个兼容 OpenAI 的端点之后,按供应商标价提供、零加价,并支持跨供应商自动故障转移,还有路由 DSL 和模型融合——这样一来,一条图像路由可以指定一个主用和一个备用,而不必把赌注押在某个供应商当天下午的状态上。我们路由了 xAI Grok Imagine 图像端点,但请注意版本:我们的目录里收录的是grok/grok-imagine-image,而不是 Grok Imagine Image 2.0,因此更新的模型目前我们无法为你提供。我们也没有路由任何版本的 Qwen-Image 模型,所以 Qwen-Image-2.1 只能在本地运行。我们确实路由的图像产品线是 OpenAI 的 GPT-Image 系列、Google 的 Imagen 4 各档位和 Gemini 图像预览版,以及那个较旧的 Grok Imagine 图像端点;由于标价是原样透传而非加价,其中任何一项的厂商降价当天就会生效。

什么会改变这个答案
三件事,而且这三件事在一个季度内都是有可能发生的。
• Qwen-Image-2.1 的商业许可证。如果供应商以工作室愿意支付的价格发布条款,那么透明度优势和零边际成本就都能用于商业工作,这一比较的格局也将彻底改变。目前既没有公布价格,也没有明确条款。
• 针对 Qwen-Image-2.1 的独立基准测试。若有第三方复现供应商的 Qwen-Image-Bench 数据,或将该模型放到公开的图像榜上,就能把仅剩的未解问题——它到底好不好——变成已有定论的问题。
• Grok 一方的价格动作。供应商之间的竞争已经让名义上相同的模型出现了从 $0.02 到 $0.06 的价格区间。一次持久性的降价将使托管路线在比目前更多的用量区间成为默认选择。
在其中任何一个落地之前,决胜因素既不是质量,也不是价格。而在于:你是需要 alpha,并且能接受非商业许可证——那样的话你就把它下载下来,用硬件来买单;还是你需要把产品交付上线,并且希望由别人来运行模型——那样的话你就按图像付费,从此再也不用操心 VAE。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
