
Qwen-Image 2.1 对决 MAI-Image-2.5-Pro:6,100 次盲投对零
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
这两个模型中,有一个已经经过了约6,100次人类盲测对比排名。另一个则从未被其自家实验室以外的任何人排名过。MAI-Image-2.5-Pro是微软的高端图像模型,它以1,272的Elo分数位居Artificial Analysis图像编辑竞技场第一名——是该类别中获投票最多的结果。Qwen-Image 2.1由Qwen-Image团队于2026年9月20日开源,它完全没有独立评分,而且在足够多的人在公开场合运行它并产生投票之前,也不会有。这一差距才是本次对比的真正主题,因为它是两个模型之间唯一不属于厂商声明的差异。其余的一切——架构、分辨率、价格——可知但未经证实,而这两个模型在纸面上足够接近,因此真正应当驱动决策的是这一测量上的差距。
选票实际表达了什么,又没有表达什么
Artificial Analysis 进行的是盲测两两对比:两个模型拿到相同的提示词,投票者选出更好的输出,Elo 评分由此得出。它并非完美的工具,但却是这一领域最接近共同计分板的东西,而样本量的重要性与分数本身不相上下。
• MAI-Image-2.5-Pro — 在约 6,100 次对比中,图像编辑排名第 1,Elo 为 1,272。在文生图方面,它以 Elo 1,292 位列第 7,落后于 Elo 1,369 的 GPT Image 2(high)、1,322 的 Reve 2.1、1,320 的 Nano Banana 2、1,310 的 GPT Image 1.5(high)以及 1,304 的 MAI-Image-2.5。
• Qwen-Image 2.1——两个榜单上均无条目。不是低分,而是根本没有分数。本文撰写时,该版本发布仅一天。
那些数字的形态值得仔细解读,因为它并不是营销所暗示的那种形态。微软的模型在编辑上确实排名第一,在生成上确实排名第七。这是一个具体、站得住脚的位置——一个领先于其类别的编辑专精者——这与成为最佳图像模型是两码事,而它并非最佳。与此同时,在文生图方面击败它的是 GPT Image 2 (high),而后者也不是 OpenAI 在这个领域最新的模型。独立排行榜所奖励的,是被测量得最多的模型,而在这次对比中,那毫无疑问是微软的那个。
开源模型完胜的唯一一项指标
这两者之间存在一个具体的、非主观的差异,那就是分辨率。
• Qwen-Image 2.1原生以 2K 分辨率生成,官方文档记录的默认值为 40 个推理步数下的 2048×2048,另有七种宽高比预设,并输出 RGBA 格式,搭载真正的 Alpha 通道而非遮罩。
• MAI-Image-2.5-Pro将输出上限设为 1,048,576 像素——约一百万像素。它真正亮眼的规格参数在别处:32,000 个文本输入 token、131k 上下文窗口和 4,096 个输出 token,这些说明的是它能吸收多少指令,而不是能输出多少图像。
对于大多数社交媒体和产品类工作来说,一百万像素的上限并不构成限制。但对于印刷、大幅面合成,以及任何裁切后必须经得起考验的场景而言,它就是限制。在整个对比中,这是唯一一个你可以指着一个数字说开源模型领先的维度——并且请注意,这是模型卡片中记载的架构事实,而非质量层面的论断。Qwen-Image 2.1 都会以 2048×2048 渲染,无论它渲染出的东西是否值得一看。
价格,这正是比较变得令人不安的地方
MAI-Image-2.5-Pro 被定位为高端型号,其定价数字并不含糊:每百万文本输入 token 5 美元、每百万图像输入 token 8 美元,以及每百万图像输出 token 106 美元。按 1024 像素输出计算,这约合每千张图像 108.50 美元。作为规模参照,这大约是 MAI-Image-2.5 成本的 2.3 倍,也约为 MAI-Image-2.5-Flash 的 5.4 倍,因此微软是有意对自家产品线进行分层,而不是把 Pro 档定价为一次增量升级。
Qwen-Image 2.1 没有托管价格,因为根本不存在托管端点——它是一款在研究许可下发布的权重下载。它的成本是你的 GPU 时间,而它的限制在于:你无法合法地出售它生成的内容。把每千张图片 108.50 美元与“免费权重”相比,是在拿一项服务与一台机器作比较,而这种比较的诚实版本是:按量计费的价格为你换来的是一个经过实测、有支持、可商用授权的模型,而权重换来的是 33 GB 的下载文件,以及一个写着“仅限非商业用途”的许可文件。
这种取舍正是路由层体现价值的地方。OrcaRouter 将 200 多个模型置于同一个兼容 OpenAI 的端点之后,按供应商标价提供、零加价,并支持跨供应商自动故障转移——因此,想要评估某个尚未经过实测的开源模型的团队,不必为此把生产环境迁移到该模型上,而且由于标价是直接透传的,被路由模型上任何供应商的价格变动都会在当天体现到我们这边,而不是等到下一次合同续约。MAI-Image-2.5-Pro 和 Qwen-Image 2.1 都不在我们目前路由的模型之列,本文也不会暗示事实并非如此。我们确实提供前置支持的图像系列是 OpenAI 的 GPT-Image 家族、Google 的 Imagen 4 各档位和 Gemini 图像预览,以及 xAI 的 Grok Imagine 图像端点。

供应商的主张处于什么位置,以及应给予它们多大的权重
两家供应商公布的数字均未得到任何第三方复现,因此无论对哪一方,都应以同样的怀疑态度看待。
• 微软的说法——在英语、中文、日语、韩语和西班牙语上的文本渲染准确率达 96.8%;提示词遵循度比 GPT-Image-1.5 高出 27%;多图角色一致性达 94%;在微软内部的特定场景中,GPU 成本最多可降低 84–89%。最后一项需要格外留心:它描述的是微软自己的服务配置,而非客户能够验证的任何内容。
• 阿里巴巴的说法 —— Qwen-Image 2.1 的博客文章附带了一张 Qwen-Image-Bench 对比图表,其中的数字均出自厂商自身。第三方报道中还流传着一种说法,称该模型是一个 20 层 transformer,这与模型卡中描述的 32 层单流 DiT 相矛盾;模型卡是一手来源,应以 32 层这一数字为准。
这两种情况的区别不在于任何一家供应商是否诚实,而在于微软的模型已经过独立测量,而阿里巴巴的模型还没有,因此微软的说法可以有东西作为对照来核查,而阿里巴巴的说法目前还无法与任何东西进行核对。
每一个是干什么用的
合起来看,它们并不是在争夺同一个位置。
• MAI-Image-2.5-Pro 就是那把编辑利器。在庞大的投票基数上,它位居编辑排行榜首位;它可接受长指令(32k 文本输入 token,131k 上下文);它拥有商业许可;并且现在已在 Microsoft Foundry 和 MAI Playground 上以公开预览形式提供。如果你的工作是迭代式图像修正,而你需要在下定决心投入之前就知道它在这项任务上是否是最佳可用选择,那么这就是经过实测的答案,其成本约为每千张图像 108.50 美元。
• Qwen-Image 2.1 是开放的研究成果。它的渲染尺寸更大,在图像模型之外还附带一个可检查的提示词重写检查点,最多可接受 10 张参考图像,并支持通过圈选、涂抹标注或蒙版进行局部编辑;而且它可以免费下载,但禁止将其用于销售。如果你的工作是评估、基准测试,或是基于可读的权重进行构建,那它就是更有意思的对象——而你在做这些工作时,并没有排行榜告诉你它到底好不好。
还有一个值得点明的时间错位。MAI-Image-2.6 于 2026 年 8 月 19 日进入私密预览,这意味着编辑榜榜首的模型已经比微软准备发布的版本落后了一代。相比之下,Qwen-Image 2.1 才处于第一天,其早期访问计划要求测试者最迟在 9 月 29 日发布。一个月之内,本次对比中的两个排行榜都会变得不同。


什么能解决这个问题
有一点:Qwen-Image 2.1 出现在某个排行榜上。本文中除分辨率上限和价格之外的一切,都是某一家实验室或另一家实验室的说法,而 MAI-Image-2.5-Pro 之所以能被一本正经地推荐,完全是因为 6,100 名并非为微软工作的人看过它与其他模型的输出并更喜欢它。这正是那个开放模型尚未达到的标准,也是它应该被要求达到的标准。
在那之前,实际的判断很简单。如果你今天就需要一个编辑模型,要有商业许可,还要有榜单背书,那答案就是微软的,价格约为每千张图片 108.50 美元。如果你想知道一个原生支持 2K 输出、提示词改写器可检视的 7B 开放权重模型是否更好,你就得自己去做测量——而你对结果能做的最有用的事,就是把它公开,因为整个类别目前正缺一个数据点。
