一张生成的 hero 标题卡,主标题为 Qwen-Image-2.1 登顶两大图像竞技场,副标题为 #1 开源标签掩盖了什么,展示了两张排行榜卡片,分别标注为 Image Edit Arena,其排名标签显示 16 / 56,分数标签显示 1367;以及 Text-to-Image Arena,其排名标签显示 17 / 79,分数标签显示 1228,上方有一个写着 qwen-research licence 的标签。
Guides & Insights

Qwen-Image-2.1 登顶两大图像竞技场:#1 开源头衔背后隐藏着什么

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Qwen-Image-2.1 背后的团队感谢 Arena 的认可,而这份认可也是真实存在的。Qwen-Image-2.1 在 Arena 的两个图像榜单上,都是榜单未标注为专有的模型中得分最高的:在 2026 年 9 月 22 日的快照中,Image Edit 上为 1,367,Text-to-Image 上为 1,228。在两个榜单上,它上方的每一行都带有专有标签。公告没有提到的三个事实,与这一说法本身一样可核实——这些分数换来的总排名、两行都附带的初步标记,以及一个写着 qwen-research 而非其早期图像模型上的 Apache 2.0 的许可证字符串。这一说法经得起与榜单的对照。只是它所说的,比标题所暗示的要少。

并排读取这两块板

Arena 分数是基于盲测成对投票构建的 Elo 风格评分:一个人看到两个输出,不知道哪个模型生成了哪个,然后做出选择。这与厂商基准测试属于截然不同的证据类别,因此,依赖它的说法值得核实,而不是照搬。两个榜单均于 2026 年 9 月 22 日抓取,而且都是逐行读取的,而不是从排名图表中粗略扫过。

A screenshot of the LMArena Image Edit Arena leaderboard, captured September 22 2026, showing the board header reading 29,902,508 votes and 56 models, with ranks 13 to 22 visible: gemini-3-pro-image-preview at 1385, reve-2.1 at 1375, gpt-image-1.5-high-fidelity at 1370, qwen-image-2.1 at rank 16 with 1367 and a confidence interval of plus or minus 9 and 4,841 votes marked Preliminary, reve-2.0 at 1358, uni-1.1-max at 1334, grok-imagine-image at 1329, uni-1.1 at 1315, gemini-3.1-flash-lite-image at 1314 and qwen-image-2.0-pro-2026-06-22 at 1304, with every row above qwen-image-2.1 labelled Proprietary.

图像编辑榜单列出了 56 个模型和 29,902,508 张投票。Qwen-Image-2.1 以 1,367 的分数、±9 的置信区间和 4,841 张投票位列第 16 名。排在其上方的十五行——从 1,526 的 gpt-image-2.5-sunburst 到 1,370 的 gpt-image-1.5-high-fidelity——全部为专有模型。紧随其下的两行也是如此:1,358 的 reve-2.0 和 1,334 的 uni-1.1-max。

A screenshot of the LMArena Text-to-Image Arena leaderboard, captured September 22 2026, showing the board header reading 6,258,152 votes and 79 models, with ranks 14 to 21 visible: gemini-3-pro-image-2k at 1246, gpt-image-1.5-high-fidelity at 1239, gemini-3-pro-image-preview at 1232, qwen-image-2.1 at rank 17 with 1228 and a confidence interval of plus or minus 11 and 2,843 votes marked Preliminary, ideogram-4.0-quality at 1204 labelled Ideogram Open Model, qwen-image-2.0-pro-2026-06-22 at 1191, uni-1.1-max at 1188 and mai-image-2 at 1183, with Proprietary labelling on every row above qwen-image-2.1.

同一天,Text-to-Image 榜单列出了 79 个模型和 6,258,152 票。Qwen-Image-2.1 排名第 17,得分为 1,228,置信区间为 ±11,共获得 2,843 票。同样的模式:它上方的 16 行均为专有,而它下方第一个非专有行是 ideogram-4.0-quality,得分为 1,204,标注为 Ideogram 开放模型。

这些行中有两个细节值得单独拎出来,因为它们与那种说法通常被重复的方式相悖。

排名与得分讲述的是不同的故事——1,367 是图像编辑榜上非 Proprietary 的最佳成绩,但它同时也是第十六名,落后榜首 159 分,距第十五名仅差 3 分。
在其中一个榜单上,阿里巴巴自家的闭源模型胜出——标记为 Proprietary 的 qwen-image-3.0-pro 在文生图榜上以 1,254 分位居其后,比 qwen-image-2.1 的 1,228 分高出二十六分。而在编辑榜上,这款开源模型以 1,304 分胜过更早的专有模型 qwen-image-2.0-pro-2026-06-22。自家的冠军在两个榜单上并非同一款模型。
与下一款开源模型的差距,在一个榜单上很宽,在另一个榜单上则很窄——在图像编辑榜上,下一行非 Proprietary 的成绩是 hunyuan-image-3.0-instruct 的 1,302,落后六十五分;在文生图榜上则是 ideogram-4.0-quality 的 1,204,落后二十四分。

许可证字符串承担的作用比排名还大

Arena 的每一行都带有机构和许可证标签。Qwen-Image-2.1 的标签显示为 Alibaba · qwen-research,在两个榜单上都是如此。这并不是阿里巴巴更早的图像模型上标注的 Apache 2.0 许可证:编辑榜单上的 qwen-image-edit(1,241)和 qwen-image-edit-2511(1,235)都标注为 Apache 2.0,文生图榜单上的 qwen-image-2512(1,125)和 qwen-image(1,057)也是如此。厂商的博客文章也印证了这一点,它依据 2026 年 9 月 20 日的《Qwen 研究许可证协议》发布权重,该协议允许研究和评估,但不允许商业使用。

所以,对“#1 开源模型”的诚实解读比听起来更狭窄。按照榜单自身的二分法——专有,还是非专有——Qwen-Image-2.1 排第一。但按 OSI 对开源的定义(不接受使用领域限制),它根本不算开源,而大多数被拿来与它比较的模型也一样:同一批榜单上还有标记为 flux-non-commercial-licensetencent-hunyuan-communitykrea-2-community-license以及Ideogram Open Model。Arena 的“Open Source”筛选器是一个粗略的专有与非专有开关。它很有用。它不是许可证审查。

这一区别在这里比两分的差距更重要,因为它是唯一不会因再投一周票而改变的事。如果你今天想要这个家族中一个以宽松许可证授权的图像模型,Apache 2.0 对应的行是 qwen-image-edit 和 qwen-image-edit-2511——两者都更旧,而且在同一个编辑榜单上低了一百二十多分(1,241 和 1,235,对比 1,367)。得分最高的开放标注 Qwen 图像模型和可商用的 Qwen 图像模型并不是同一个下载。

初步意味着这个数字仍可能变动

Qwen-Image-2.1 的两行都带有该榜单的初步标记——当某一行尚未累积到足够票数、其分数还不能被视为最终结果时,Arena 就会加上这一标记。原因就在于票数:在图像编辑榜上,它只有 4,841 票,而该榜单总票数为 29,902,508;在文生图榜上,它只有 2,843 票,而总票数为 6,258,152。相比之下,它周围的行票数要多得多——gpt-image-1.5-high-fidelity 在编辑榜上有 589,013 票,qwen-image-2.0-pro-2026-06-22 在文生图榜上有 307,705 票。

对一个发布仅三天的模型来说,±9 和 ±11 的置信区间并不是警示信号;这正是新版本发布时会呈现的样子。但这确实意味着,随着投票不断累积,开放梯队顶部的具体排序可能会发生变化,尤其是在文生图(Text-to-Image)上,它相对于下一个开放条目的领先优势为 24 分。

供应商自家规格表上写的模型到底是什么

阿里巴巴自己的介绍文章描述了一个统一的文生图与编辑模型:其视觉生成组件有70亿参数,由32层Single-Stream DiT构建,支持透明图像的原生生成与编辑,最多可使用10张参考图像,原生输出上限为2048×2048——完整管线的下载大小约为33 GB。透明支持是这份列表中最不常见的一项;Arena的编辑榜并不明显在衡量它,因此榜单排名并不能就这一特定能力提供任何一方的证据。

厂商主推的基准是 Qwen-Image-Bench,该模型在此项上报告为 60.28,领先于 Nano Banana 2.0 的 59.82 和 GPT Image 1.5 的 59.65。这是一项由厂商自行开展的评测,没有第三方复现,而且分差不到一分——这样的差距经不起更换一套提示词。有一点值得直说:上面的 Arena 数字是别人的投票,而 Qwen-Image-Bench 的数字是阿里巴巴自家的。两者并非同一类证据,不应被平均成对这款模型的单一印象。

部署支持与版本发布同步到来,而非在其之后才出现:该模型在 ComfyUI、SGLang、vLLM-Omni、LightX2V 和 Diffusers 库中都已有首日集成,这意味着对大多数团队而言,实际问题不在于模型能否被部署,而在于部署成本是否可承受。

如果你这周就需要一个图像 API,这样的说法会落到什么境地

在这里,准确说明我们自己的立场很重要。OrcaRouter 不为 Qwen-Image-2.1 提供路由,也不为任何版本的 Qwen-Image 模型提供路由。如果让你信服的是 Arena 分数,那么这个模型可以通过厂商自己的 API 和几个第三方平台访问,或者以自托管下载的方式获取——但不是通过我们。我们没有任何 Qwen 图像路由可卖给你,榜单排名也不是假装有路由的理由。

我们实际路由的是那些榜单所排名的图像梯队中的其余部分,而 Qwen-Image-2.1 上方的若干行也在其中。OpenAIGPT-Image-2、GPT-Image-1.5 和 GPT-Image-1-mini 都可用,Google 的 Imagen 4 各档以及 Gemini 图像预览端点也可用,还有 xAI 的 Grok Imagine 图像端点。对于像这样的主张,这种组合就是务实的答案。如果 Arena 直接把某个开放模型放在榜首,那么切换就只是在单个密钥上改一行代码。但它并没有这样做——两个榜单的榜首都是专有模型,而真正有意思的抉择,是在研究许可的下载版本和今天就能调用的托管端点之间。

决定这件事时,该平台有三个特性值得关注。路由通过一个兼容 OpenAI 的端点覆盖 200 多个模型,因此把各个托管行相互比较,并不意味着要再签一份合同或再引入一个 SDK。供应商标价以零加价原样传递,这意味着厂商调价在公布当天就会反映到你的账单上,而不必等到下一次合同续签。而跨供应商的自动故障转移,意味着一个票数不多的新模型可以排在成熟模型之后、处于回退链中,而不必在第三天就成为生产依赖——而 Qwen-Image-2.1 目前大致正处于这个阶段。

该说法属实,但比读起来的样子更单薄。

阿里巴巴发布的内容是可以核实的:在 2026 年 9 月 22 日两个 Arena 图像榜单的快照中,Qwen-Image-2.1 是未被标记为 Proprietary 的模型中得分最高的。这篇帖子压缩掉的,是所有对其构成限定的信息——总排名第十六和第十七、基于几千张投票的初步得分,以及一个研究许可证,它替代了这句话让人联想到的开源许可证。

A generated scoreboard titled Qwen-Image-2.1 - the scoreboard, with rows reading Image Edit Arena score 1367 at rank 16 of 56, Text-to-Image Arena score 1228 at rank 17 of 79, row status Preliminary on both boards, licence qwen-research non-commercial, Apache 2.0 sibling qwen-image-edit at 1241, and vendor benchmark Qwen-Image-Bench 60.28 unreproduced, above a footer reading Arena figures per the LMArena boards captured September 22 2026; Qwen-Image-Bench figure vendor-reported, no third-party reproduction.

这一切都不会让这个结果变得微不足道。发布三天后,就在两个榜单上都成为首个非专有条目,这确实改变了开放梯队所处的位置——在它之前、采用宽松许可的 Qwen 图像模型,在同一个编辑榜单上落后超过一百二十分。但这并不等同于“最好的开源图像模型”这一说法,而差别就在于一行许可证信息和一列排名,核对起来大约只需一分钟。