Qwen 廠商部落格文章的頁首,宣布 Qwen-Image-2.1,在「現已開放權重」字樣與 Qwen 標誌上方顯示標題「Qwen-Image-2.1:精巧、高效且統一的影像生成」,頁面的語言切換器設為 EN
Guides & Insights

Qwen-Image-2.1 是兩個 Artificial Analysis 排行榜上排名第一的開放權重圖像模型

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

阿里巴巴的 Qwe​n 團隊發布了 Qwen-Image-2.1,並於 2026 年 9 月 20 日開放權重。十二天後,獨立排行榜已經追上,而結果比發布本身更有意思。在 AA-Image-T2I v2.0 排行榜上,Qwen-Image-2.1 在 166 個模型中名列第 18,Elo 為 1,034,來自 5,286 次盲測比較。在 AA-Image-Editing v2.0 上,它在 97 個模型中名列第 18,Elo 為 1,074,來自 5,536 次比較。這兩列在一個逐一標示每個模型的榜單上都被標記為 開放權重。在兩個榜單上,沒有其他帶有此標記的模型排在它們之上。這就是全部的發現:在唯一兩個以盲測成對比較為模型評分的公開圖像榜單上,已發布的 Qwen-Image-2.1 是該領域中最強的一套可下載權重,而且佔據這兩個位置的正是 Qwen-Image-2.1 本身,而非它的預覽版。

接下來要說的是那兩個數字從何而來、它們周遭的列長什麼樣子,以及看板上大多數發表報導都漏掉的三個細節——首先從這塊看板完全沒有登錄該模型的任何 API 說起。

兩排所在的位置

Artificial Analysis 的這兩個排行榜都以盲測的兩兩配對比較為基礎建立:兩個模型回答同一個提示,投票者選出較佳的輸出,Elo 分數便從彙總結果中得出。這兩個排行榜共有的只有一致的風格慣例,除此之外別無其他。它們評測的任務不同,模型群體也不同,而且彼此的 Elo 值無法互相比較。Qwen-Image-2.1 恰好同時在兩者中落在相同名次,這只是兩個不同分布下的巧合。

文字轉圖像,166 個模型上榜:

• 排行榜最上方的是 GPT Image 2.5 Sunburst(max),以 1,107 Elo 位居第一,出現次數達 14,023 次——這是一款專有模型,其樣本數是 Qwen-Image-2.1 的兩倍以上。

• Qwen-Image-2.1 以 1,034 的 Elo 排名第 18,95% 信賴區間為 1,024 至 1,044,來自 5,286 次出賽。

• 先讀各列的資料筆數,再看名次。 Qwen-Image-2.1 在兩個排行榜上都名列第 18,但這些名次來自不同的母體——文生圖有 166 個模型,圖像編輯有 97 個——而且這兩個 Elo 數值分屬兩套不同的量尺。名次相同只是算術上的巧合,並不證明這兩個排行榜在任何事情上看法一致。

• 阿里巴巴自家的兩個 Pro 級模型在這份榜單上排名更高:Qwen-Image-3.0-Pro 以 1,089 Elo 位列第 14 名,Qwen-Image-3.0 則以 1,075 位列第 16 名。兩者都沒有標記為開放權重。榜單的九月快照將兩者列為 2026 年 7 月發布,這正是故事的另一個版本——最新的 Qwen 圖像模型並非得分最高的那一個,而在文生圖方面,它確實不是。

影像編輯,97 個模型已上榜:

• GPT Image 2.5 Sunburst (max) 也憑藉 17,899 次登場、1,182 Elo 的成績登上這個排行榜的榜首。

• Qwen-Image-2.1 以 1,074 Elo 位居第 18 名,區間為 1,065 至 1,083,出現次數 5,536 次——樣本數比它的文字生圖那一列略大一些,而這對一個編輯端在發表時拿到更響亮宣傳文案的模型來說很合理。

• 它周圍的名次相當密集。grok-imagine-image 以 1,071 分位居其下一名,Luma UNI 1 Max 則為 1,069 分。在這張榜單上,位於它下方最近的開放權重名次是 HunyuanImage 3.0 Instruct以 1,066 分、5,221 次登場,落後 8 Elo。有七個名次落在十八個 Elo 分之內。

誠實解讀「頂尖開放權重模型」這項說法

標題裡的這個說法正在發揮特定作用,值得加以檢視,而不是照樣重複。

• 這是標記範圍內的排名,而非整體排名。Qwen-Image-2.1 在兩個榜單的整體排名皆為第 18 名。正是 Open Weights 標籤讓它在各榜單上名列第一,而該標籤是由各榜單自行認定、逐個模型套用的——文生圖榜有 47 列帶有此標記;編輯榜列出 97 列,其中 36 列帶有此標記。

• 這個標籤描述的是權重,而非條款。Qwen-Image-2.1 依 2026 年 9 月 20 日的《Qwen 研究授權協議》發布,該協議僅授予非商業用途的權利。董事會的「開放權重」標籤對可下載性描述準確,但對你下載後能拿它做什麼卻隻字未提。任何把「頂尖開放權重圖像模型」讀成「可免費用於產品」的人,都已經讀到超出這個標籤的原意了。

• 這是一份快照,而非已定案的排名。 隨著票數累積,排行榜每天都會變動。Qwen-Image-2.1 在文字生圖上的信賴區間為 ±10 Elo,在編輯上則為 ±9;其下方的各列區間彼此重疊。請將這個位置視為當前狀態,而非永久定論。

發表報導所沒有的細節:沒有 API

Qwen-Image-2.1 的兩個列項都帶有一則明確的無可用 API標註。這對排名來說是實實在在的成本,也透露出 5,286 與 5,536 票是誰投出來的——如果沒有端點可以讓提示詞指向,那些比較就是來自自行跑權重並提交輸出的人。對一個只能自架部署的模型而言,獨立 Elo 是比任何人都能呼叫的模型更困難許多的量測,這也是為什麼這裡的樣本規模只有最前面幾列的三分之一。

對開發者來說,這樣的局面再熟悉不過:這個領域中最強的可下載圖像模型,並不是你今天就能呼叫的那一個。實際上,這讓工作分成了兩條路。你要嘛在自己的硬體上自行部署 Qwen-Image-2.1,要嘛在這塊看板上呼叫它周遭的其中一個模型。第二個選項正是路由發揮價值之處——一個 API 涵蓋 200 多個模型,並以零加成的方式轉嫁供應商的定價,當供應商服務品質下滑時自動容錯移轉,還有一套路由 DSL,能把多個模型組合成單一次呼叫。OrcaRouter 目前並未提供 Qwen-Image-2.1;平台上的圖像系列是 Google 的 Imagen 各級方案與 Gemini 圖像預覽版、xAI 的 Grok Imagine 圖像端點,以及 OpenAI 的 GPT-Image 系列。在這塊看板上,那就是最頂端的 GPT Image 2.5 Sunburst 那一列,而對於「我想要最高分,而且我下午就要能呼叫它」這個需求,這是個合情合理的答案。

Screenshot of the Artificial Analysis text-to-image leaderboard, AA-Image-T2I v2.0, captured in English, listing GPT Image 2.5 Sunburst (max) first at 1,107 Elo from 14,023 samples, the Qwen-Image-3.0-Pro row at rank 14 with 1,089 Elo and 6,353 samples, and the Qwen-Image-2.1 row at rank 18 with 1,034 Elo from 5,286 samples

看板上要留意什麼

有三件事會推動這個故事的發展,而這三件事早已在那些看板上清楚可見。

第一點是 API 是否出現。如果 Alibaba 或某個服務合作夥伴把 Qwen-Image-2.1 放上端點,無可用 API這項附註就會消失,票數應該會攀升至接近鄰近各列的水準,而信賴區間也會收窄。在 1,034 或 1,074 上取得更窄的區間,會是比目前強得多的主張。

第二個是阿里巴巴自家的技術棧。Qwen-Image-3.0-Pro 拿下 1,089 分、Qwen-Image-3.0 拿下 1,075 分,在文生圖項目上雙雙超越 Qwen-Image-2.1,且兩者都沒有標示開放權重。如果 Qwen-Image-2.1 的定位是這條產品線可下載的對應版本,而非其後繼機型,那麼有趣的問題就在於這個差距是否會縮小——而在圖像編輯排行榜上,差距已經縮小了:Qwen-Image-3.0-Pro 領先 Qwen-Image-2.1 兩分 Elo。

第三個是授權條款。兩張榜單上的每一列 Open Weights 都同樣有資格獲得這個標籤,而它們背後的授權條款卻完全不能相提並論。榜單永遠不會告訴你這件事。那是計分板唯一缺少的一欄。

Generated summary card for Qwen-Image-2.1 on the Artificial Analysis boards, listing text-to-image rank 18 of 166 at 1,034 Elo from 5,286 votes, editing rank 18 of 97 at 1,074 Elo from 5,536 votes, the note that it is the top Open Weights row on both boards, and the sourcing line that the figures are per Artificial Analysis

常見問題

Qwen-Image-2.1 是最好的開放權重圖像模型嗎?

在這兩個排行榜上,是的——它是兩者上帶有 Open Weights 標記的最高 Elo 列,在文字轉圖像上為 1,034,在編輯上為 1,074。整體而言,它在每個排行榜上都排名第 18——而這個第 18 名,是在其中一個排行榜的 166 列中、在另一個的 97 列中的排名,代表著兩套無法互相比較的 Elo 尺度。這個說法唯有在兩個限定條件都保持附帶時才成立。

為什麼這兩個排行榜對同一個模型顯示不同的 Elo 值?

他們以不同的模型群體來為不同任務評分。文字轉圖像 Elo 與編輯 Elo 是兩套各自獨立的量表;比較 1,034 與 1,074 衡量的是排行榜,而不是模型。

我可以透過 API 呼叫 Qwen-Image-2.1 嗎?

榜單的兩列都記錄為無可用的 API。權重可從 Alibaba 的儲存庫下載,因此模型能運行——只是它並沒有被該榜單認定為其提供服務的託管端點。

如果你今天要的是數字而不是下載檔,那兩個排行榜的榜首都能透過各家廠商自家的 API 直接呼叫;而 GPT-Image 系列、Google 的 Imagen 各級方案,以及 xAI 的 Grok Imagine,都是 OrcaRouter 直接對外提供的圖像模型。權重檔留給實驗,端點留給截止期限。