Qwen 供应商博客上宣布 Qwen-Image-2.1 的文章页眉,标题“Qwen-Image-2.1:紧凑、高效、统一的图像创作”位于“现已开放权重”字样和 Qwen 标志上方,页面语言切换器设置为 EN
Guides & Insights

Qwen-Image-2.1 是 Artificial Analysis 两大榜单上排名第一的开放权重图像模型

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

阿里巴巴的 Qwen 团队发布了Qwen-Image-2.1,并于 2026 年 9 月 20 日开放权重。十二天后,独立的排行榜追上了它,而结果比这次发布本身更有意思。在AA-Image-T2I v2.0排行榜上,Qwen-Image-2.1 以 1,034 的 Elo 位列 166 个模型中的第 18 名,来自 5,286 次盲测对比。在AA-Image-Editing v2.0上,它以 1,074 的 Elo 位列 97 个模型中的第 18 名,来自 5,536 次对比。这两行在一张对每个模型逐一标注的榜单上都被标记为开放权重。在两块榜单上,没有任何其他带有该标记的模型排在他们之上。这就是全部发现:在仅有的两块通过盲测两两对比为模型打分的公开图像榜单上,已发布的 Qwen-Image-2.1 是该领域中最强的可下载权重,而且正是Qwen-Image-2.1本身,而非其预览版本,同时占据着这两个位置。

接下来要讲的是这两个数字从何而来、它们周围的那些行是什么样子,以及榜单上大多数发布报道都遗漏的三个细节——首先要说的是,榜单上完全没有为该模型记录任何 API。

两行所在的位置

Artificial Analysis 的两个榜单都是通过盲测成对比较构建的:两个模型回答同一个提示词,投票者选出更好的输出,Elo 分数则从汇总结果中得出。这两个榜单只有统一的风格,除此之外别无共同之处。它们评估的任务不同,样本群体也不同,各自的 Elo 值无法相互比较。Qwen-Image-2.1 恰好在这两个榜单上排名相同,而这只是两个不同分布下的巧合。

文生图,榜单上有166个模型:

• 榜单榜首是 GPT Image 2.5 Sunburst (max),以 1,107 Elo、来自 14,023 次出场位居第一——这是一个专有模型,其样本量是 Qwen-Image-2.1 的两倍多。

• Qwen-Image-2.1 以 1,034 Elo 分位列第 18 名,95% 置信区间为 1,024 至 1,044,共出现 5,286 次。

• 先看行数,再看排名。 Qwen-Image-2.1 在两个榜单上都位列第 18 名,但这些排名来自不同的样本总体——文生图有 166 个模型,编辑有 97 个——而且这两个 Elo 值分属两套不同的量表。排名相同只是算术上的巧合,并不能证明两个榜单在任何事情上达成了一致。

• Aliba​ba 自家的两款 Pro 级模型在本榜上位居其之上:Qwen-Image-3.0-Pro 以 1,089 Elo 排在第 14 名,Qwen-Image-3.0 以 1,075 排在第 16 名。两者均未带有 Open Weights 标记。该榜单的 9 月快照将两者列为 2026 年 7 月发布,也就是说,在这个版本的说法里,最新的 Qwe​n 图像模型并非得分最高的那个——而在文生图方面,它确实不是。

图像编辑,97 个模型上榜:

• GPT Image 2.5 Sunburst(max)也以 17,899 次出场获得的 1,182 Elo 位居本榜首。

• Qwen-Image-2.1 以 1,074 Elo 位列第 18 名,区间为 1,065 至 1,083,来自 5,536 次出现——样本量比其文生图那一行略大,这对于一个编辑侧获得了更响亮发布文案的模型来说很合理。

• 它周围的排名相当拥挤。grok-imagine-image 以 1,071 分紧随其后,位列下方一位,Luma UNI 1 Max 则为 1,069。在这张榜单上,它下方最近的开源权重排名是 HunyuanImage 3.0 Instruct,得分为 1,066,共 5,221 次出场——相差 8 Elo。有七个排名都落在 18 Elo 分之内。

诚实解读“顶级开放权重模型”这一说法

标题中的这个措辞承担着特定的作用,它值得推敲,而非简单重复。

• 这是带有该标记者之中的排名,而非总排名。Qwen-Image-2.1 在两个榜单的总排名中均位列第 18。是 Open Weights 标签让它在两个榜单上都位居第一,而该标签由各榜单自行按其标准逐模型认定——文生图榜单有 47 行带有该标记;编辑榜单共列出 97 行,其中 36 行带有该标记。

• 该标记描述的是权重,而非条款。 Qwen-Image-2.1 依据日期为 2026 年 9 月 20 日的《Qwen 研究许可协议》发布,该协议仅授予非商业用途的权利。董事会的“开放权重”标签在可下载性方面表述准确,却对你下载之后可以做什么只字不提。任何把“顶级开放权重图像模型”读作“可在产品中免费使用”的人,都读出了标签本身并不包含的含义。

• 这是一张快照,而非已定局的排名。随着投票不断累积,榜单每天都在变动。Qwen-Image-2.1 在文生图上的置信区间为 ±10 Elo,在图像编辑上为 ±9;其下方各行所处的区间相互重叠。请将该名次视为当前状态,而非永久结果。

发布报道缺失的细节:没有API

Qwen-Image-2.1 的两行都带有一个明确的 无可用 API 注释。这对排名来说是一个实实在在的代价,而且它告诉了你一些关于谁生成了那 5,286 票和 5,536 票的信息——如果没有可以指向提示词的端点,那么这些比较就来自那些自己运行权重并提交输出的人。对于一个仅支持自托管的模型来说,独立的 Elo 是一项比任何人都可以调用的模型所获得的 Elo 真正更难的测量,这也是为什么这里的样本量只有顶部各行的三分之一。

对开发者来说,这种形态再熟悉不过:该领域最强的可下载图像模型,并不是你今天就能调用的那一个。实际来看,这会把工作一分为二。你要么在自己的硬件上自行部署 Qwen-Image-2.1,要么在这个平台上调用它周边的某个模型。第二种选择正是路由发挥价值之处——一个 API 覆盖 200 多个模型,按提供商标价零加价透传,当提供商服务劣化时自动故障转移,以及一套路由 DSL,可将多个模型组合成单次调用。OrcaRouter 目前并不提供 Qwen-Image-2.1;平台上的图像线包括 Google 的 Imagen 各档位与 Gemini 图像预览、xAI 的 Grok Imagine 图像端点以及 OpenAI 的 GPT-Image 系列。在这个平台上,那就是位于最顶端的 GPT Image 2.5 Sunburst 一行,而这正是对“我想要最高分,并且今天下午就要能调用”的一个真正可行的答案。

Screenshot of the Artificial Analysis text-to-image leaderboard, AA-Image-T2I v2.0, captured in English, listing GPT Image 2.5 Sunburst (max) first at 1,107 Elo from 14,023 samples, the Qwen-Image-3.0-Pro row at rank 14 with 1,089 Elo and 6,353 samples, and the Qwen-Image-2.1 row at rank 18 with 1,034 Elo from 5,286 samples

看板上要关注什么

有三件事将推动这一叙事发展,而这三件事在留言板上均已显露端倪。

第一点是会不会出现 API。如果阿里巴巴或某家服务合作伙伴把 Qwen-Image-2.1 放到某个端点后面,无可用 API的说明便会消失,投票量应会向相邻各行的规模攀升,置信区间也会收窄。在 1,034 或 1,074 这样的大样本上得到更窄的区间,其说服力远胜于当前的说法。

第二个是阿里巴巴自家的技术栈。Qwen-Image-3.0-Pro 以 1,089 分、Qwen-Image-3.0 以 1,075 分,在文生图上都超过了 Qwen-Image-2.1,同时都没有开放权重标记。如果 Qwen-Image-2.1 的定位是那条产品线可下载的对应版本,而不是它的后继者,那么有趣的问题是差距是否会缩小——而在编辑榜单上,差距已经缩小了:Qwen-Image-3.0-Pro 仅以两个 Elo 分领先 Qwen-Image-2.1。

第三点是许可证。两个榜单上每一行 Open Weights 都同样有资格获得这个标签,而它们背后的许可证却完全不可同日而语。榜单永远不会告诉你这一点。这是记分牌所没有的那一列。

Generated summary card for Qwen-Image-2.1 on the Artificial Analysis boards, listing text-to-image rank 18 of 166 at 1,034 Elo from 5,286 votes, editing rank 18 of 97 at 1,074 Elo from 5,536 votes, the note that it is the top Open Weights row on both boards, and the sourcing line that the figures are per Artificial Analysis

常见问题

Qwen-Image-2.1 是最好的开放权重图像模型吗?

在这两个榜单上,是的——它是同时带有 Open Weights 标记的最高 Elo 行,文本生成图像为 1,034,编辑为 1,074。总体而言,它在每个榜单上都排第 18——而这个 18 在一个榜单上是 166 行内的排名,在另一个榜单上则是 97 行内的排名,代表着两个无法相互比较的 Elo 标度。只有当这两个限定条件都始终附带时,这一说法才成立。

为什么两个榜单对同一个模型显示的 Elo 分数不同?

它们以不同的模型群体为基准,对不同任务进行评分。文生图 Elo 和编辑 Elo 是两套独立的量表;比较 1,034 和 1,074 衡量的是榜单,而不是模型。

我可以通过 API 调用 Qwen-Image-2.1 吗?

榜单的两行均记录为无可用 API。权重可从 Aliba​ba 的代码仓库下载,因此模型是能运行的——只是它并没有一个被榜单认定用于为其提供服务的托管端点。

如果你今天要的是一个数字而不是一次下载,那两个排行榜的榜首都可以通过各家厂商自己的 API 调用,而 GPT-Image 系列、Google 的 Imagen 各档位以及 xAI 的 Grok Imagine 都是 OrcaRouter 直接对接的图像模型。权重文件留给实验,端点留给截止日期。