
Qwen-Image-2.1 是 Artificial Analysis 两大榜单上排名第一的开放权重图像模型
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
阿里巴巴的 Qwen 团队发布了Qwen-Image-2.1,并于 2026 年 9 月 20 日开放权重。十二天后,独立的排行榜追上了它,而结果比这次发布本身更有意思。在AA-Image-T2I v2.0排行榜上,Qwen-Image-2.1 以 1,034 的 Elo 位列 166 个模型中的第 18 名,来自 5,286 次盲测对比。在AA-Image-Editing v2.0上,它以 1,074 的 Elo 位列 97 个模型中的第 18 名,来自 5,536 次对比。这两行在一张对每个模型逐一标注的榜单上都被标记为开放权重。在两块榜单上,没有任何其他带有该标记的模型排在他们之上。这就是全部发现:在仅有的两块通过盲测两两对比为模型打分的公开图像榜单上,已发布的 Qwen-Image-2.1 是该领域中最强的可下载权重,而且正是Qwen-Image-2.1本身,而非其预览版本,同时占据着这两个位置。
接下来要讲的是这两个数字从何而来、它们周围的那些行是什么样子,以及榜单上大多数发布报道都遗漏的三个细节——首先要说的是,榜单上完全没有为该模型记录任何 API。
两行所在的位置
Artificial Analysis 的两个榜单都是通过盲测成对比较构建的:两个模型回答同一个提示词,投票者选出更好的输出,Elo 分数则从汇总结果中得出。这两个榜单只有统一的风格,除此之外别无共同之处。它们评估的任务不同,样本群体也不同,各自的 Elo 值无法相互比较。Qwen-Image-2.1 恰好在这两个榜单上排名相同,而这只是两个不同分布下的巧合。
文生图,榜单上有166个模型:
• 榜单榜首是 GPT Image 2.5 Sunburst (max),以 1,107 Elo、来自 14,023 次出场位居第一——这是一个专有模型,其样本量是 Qwen-Image-2.1 的两倍多。
• Qwen-Image-2.1 以 1,034 Elo 分位列第 18 名,95% 置信区间为 1,024 至 1,044,共出现 5,286 次。
• 先看行数,再看排名。 Qwen-Image-2.1 在两个榜单上都位列第 18 名,但这些排名来自不同的样本总体——文生图有 166 个模型,编辑有 97 个——而且这两个 Elo 值分属两套不同的量表。排名相同只是算术上的巧合,并不能证明两个榜单在任何事情上达成了一致。
• Alibaba 自家的两款 Pro 级模型在本榜上位居其之上:Qwen-Image-3.0-Pro 以 1,089 Elo 排在第 14 名,Qwen-Image-3.0 以 1,075 排在第 16 名。两者均未带有 Open Weights 标记。该榜单的 9 月快照将两者列为 2026 年 7 月发布,也就是说,在这个版本的说法里,最新的 Qwen 图像模型并非得分最高的那个——而在文生图方面,它确实不是。
图像编辑,97 个模型上榜:
• GPT Image 2.5 Sunburst(max)也以 17,899 次出场获得的 1,182 Elo 位居本榜首。
• Qwen-Image-2.1 以 1,074 Elo 位列第 18 名,区间为 1,065 至 1,083,来自 5,536 次出现——样本量比其文生图那一行略大,这对于一个编辑侧获得了更响亮发布文案的模型来说很合理。
• 它周围的排名相当拥挤。grok-imagine-image 以 1,071 分紧随其后,位列下方一位,Luma UNI 1 Max 则为 1,069。在这张榜单上,它下方最近的开源权重排名是 HunyuanImage 3.0 Instruct,得分为 1,066,共 5,221 次出场——相差 8 Elo。有七个排名都落在 18 Elo 分之内。
诚实解读“顶级开放权重模型”这一说法
标题中的这个措辞承担着特定的作用,它值得推敲,而非简单重复。
• 这是带有该标记者之中的排名,而非总排名。Qwen-Image-2.1 在两个榜单的总排名中均位列第 18。是 Open Weights 标签让它在两个榜单上都位居第一,而该标签由各榜单自行按其标准逐模型认定——文生图榜单有 47 行带有该标记;编辑榜单共列出 97 行,其中 36 行带有该标记。
• 该标记描述的是权重,而非条款。 Qwen-Image-2.1 依据日期为 2026 年 9 月 20 日的《Qwen 研究许可协议》发布,该协议仅授予非商业用途的权利。董事会的“开放权重”标签在可下载性方面表述准确,却对你下载之后可以做什么只字不提。任何把“顶级开放权重图像模型”读作“可在产品中免费使用”的人,都读出了标签本身并不包含的含义。
• 这是一张快照,而非已定局的排名。随着投票不断累积,榜单每天都在变动。Qwen-Image-2.1 在文生图上的置信区间为 ±10 Elo,在图像编辑上为 ±9;其下方各行所处的区间相互重叠。请将该名次视为当前状态,而非永久结果。
发布报道缺失的细节:没有API
Qwen-Image-2.1 的两行都带有一个明确的 无可用 API 注释。这对排名来说是一个实实在在的代价,而且它告诉了你一些关于谁生成了那 5,286 票和 5,536 票的信息——如果没有可以指向提示词的端点,那么这些比较就来自那些自己运行权重并提交输出的人。对于一个仅支持自托管的模型来说,独立的 Elo 是一项比任何人都可以调用的模型所获得的 Elo 真正更难的测量,这也是为什么这里的样本量只有顶部各行的三分之一。
对开发者来说,这种形态再熟悉不过:该领域最强的可下载图像模型,并不是你今天就能调用的那一个。实际来看,这会把工作一分为二。你要么在自己的硬件上自行部署 Qwen-Image-2.1,要么在这个平台上调用它周边的某个模型。第二种选择正是路由发挥价值之处——一个 API 覆盖 200 多个模型,按提供商标价零加价透传,当提供商服务劣化时自动故障转移,以及一套路由 DSL,可将多个模型组合成单次调用。OrcaRouter 目前并不提供 Qwen-Image-2.1;平台上的图像线包括 Google 的 Imagen 各档位与 Gemini 图像预览、xAI 的 Grok Imagine 图像端点以及 OpenAI 的 GPT-Image 系列。在这个平台上,那就是位于最顶端的 GPT Image 2.5 Sunburst 一行,而这正是对“我想要最高分,并且今天下午就要能调用”的一个真正可行的答案。

看板上要关注什么
有三件事将推动这一叙事发展,而这三件事在留言板上均已显露端倪。
第一点是会不会出现 API。如果阿里巴巴或某家服务合作伙伴把 Qwen-Image-2.1 放到某个端点后面,无可用 API的说明便会消失,投票量应会向相邻各行的规模攀升,置信区间也会收窄。在 1,034 或 1,074 这样的大样本上得到更窄的区间,其说服力远胜于当前的说法。
第二个是阿里巴巴自家的技术栈。Qwen-Image-3.0-Pro 以 1,089 分、Qwen-Image-3.0 以 1,075 分,在文生图上都超过了 Qwen-Image-2.1,同时都没有开放权重标记。如果 Qwen-Image-2.1 的定位是那条产品线可下载的对应版本,而不是它的后继者,那么有趣的问题是差距是否会缩小——而在编辑榜单上,差距已经缩小了:Qwen-Image-3.0-Pro 仅以两个 Elo 分领先 Qwen-Image-2.1。
第三点是许可证。两个榜单上每一行 Open Weights 都同样有资格获得这个标签,而它们背后的许可证却完全不可同日而语。榜单永远不会告诉你这一点。这是记分牌所没有的那一列。

常见问题
Qwen-Image-2.1 是最好的开放权重图像模型吗?
在这两个榜单上,是的——它是同时带有 Open Weights 标记的最高 Elo 行,文本生成图像为 1,034,编辑为 1,074。总体而言,它在每个榜单上都排第 18——而这个 18 在一个榜单上是 166 行内的排名,在另一个榜单上则是 97 行内的排名,代表着两个无法相互比较的 Elo 标度。只有当这两个限定条件都始终附带时,这一说法才成立。
为什么两个榜单对同一个模型显示的 Elo 分数不同?
它们以不同的模型群体为基准,对不同任务进行评分。文生图 Elo 和编辑 Elo 是两套独立的量表;比较 1,034 和 1,074 衡量的是榜单,而不是模型。
我可以通过 API 调用 Qwen-Image-2.1 吗?
榜单的两行均记录为无可用 API。权重可从 Alibaba 的代码仓库下载,因此模型是能运行的——只是它并没有一个被榜单认定用于为其提供服务的托管端点。
如果你今天要的是一个数字而不是一次下载,那两个排行榜的榜首都可以通过各家厂商自己的 API 调用,而 GPT-Image 系列、Google 的 Imagen 各档位以及 xAI 的 Grok Imagine 都是 OrcaRouter 直接对接的图像模型。权重文件留给实验,端点留给截止日期。
