
Qwen-Image-2.1 是兩個 Artificial Analysis 排行榜上排名第一的開放權重圖像模型
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
阿里巴巴的 Qwen 團隊發布了 Qwen-Image-2.1,並於 2026 年 9 月 20 日開放權重。十二天後,獨立排行榜已經追上,而結果比發布本身更有意思。在 AA-Image-T2I v2.0 排行榜上,Qwen-Image-2.1 在 166 個模型中名列第 18,Elo 為 1,034,來自 5,286 次盲測比較。在 AA-Image-Editing v2.0 上,它在 97 個模型中名列第 18,Elo 為 1,074,來自 5,536 次比較。這兩列在一個逐一標示每個模型的榜單上都被標記為 開放權重。在兩個榜單上,沒有其他帶有此標記的模型排在它們之上。這就是全部的發現:在唯一兩個以盲測成對比較為模型評分的公開圖像榜單上,已發布的 Qwen-Image-2.1 是該領域中最強的一套可下載權重,而且佔據這兩個位置的正是 Qwen-Image-2.1 本身,而非它的預覽版。
接下來要說的是那兩個數字從何而來、它們周遭的列長什麼樣子,以及看板上大多數發表報導都漏掉的三個細節——首先從這塊看板完全沒有登錄該模型的任何 API 說起。
兩排所在的位置
Artificial Analysis 的這兩個排行榜都以盲測的兩兩配對比較為基礎建立:兩個模型回答同一個提示,投票者選出較佳的輸出,Elo 分數便從彙總結果中得出。這兩個排行榜共有的只有一致的風格慣例,除此之外別無其他。它們評測的任務不同,模型群體也不同,而且彼此的 Elo 值無法互相比較。Qwen-Image-2.1 恰好同時在兩者中落在相同名次,這只是兩個不同分布下的巧合。
文字轉圖像,166 個模型上榜:
• 排行榜最上方的是 GPT Image 2.5 Sunburst(max),以 1,107 Elo 位居第一,出現次數達 14,023 次——這是一款專有模型,其樣本數是 Qwen-Image-2.1 的兩倍以上。
• Qwen-Image-2.1 以 1,034 的 Elo 排名第 18,95% 信賴區間為 1,024 至 1,044,來自 5,286 次出賽。
• 先讀各列的資料筆數,再看名次。 Qwen-Image-2.1 在兩個排行榜上都名列第 18,但這些名次來自不同的母體——文生圖有 166 個模型,圖像編輯有 97 個——而且這兩個 Elo 數值分屬兩套不同的量尺。名次相同只是算術上的巧合,並不證明這兩個排行榜在任何事情上看法一致。
• 阿里巴巴自家的兩個 Pro 級模型在這份榜單上排名更高:Qwen-Image-3.0-Pro 以 1,089 Elo 位列第 14 名,Qwen-Image-3.0 則以 1,075 位列第 16 名。兩者都沒有標記為開放權重。榜單的九月快照將兩者列為 2026 年 7 月發布,這正是故事的另一個版本——最新的 Qwen 圖像模型並非得分最高的那一個,而在文生圖方面,它確實不是。
影像編輯,97 個模型已上榜:
• GPT Image 2.5 Sunburst (max) 也憑藉 17,899 次登場、1,182 Elo 的成績登上這個排行榜的榜首。
• Qwen-Image-2.1 以 1,074 Elo 位居第 18 名,區間為 1,065 至 1,083,出現次數 5,536 次——樣本數比它的文字生圖那一列略大一些,而這對一個編輯端在發表時拿到更響亮宣傳文案的模型來說很合理。
• 它周圍的名次相當密集。grok-imagine-image 以 1,071 分位居其下一名,Luma UNI 1 Max 則為 1,069 分。在這張榜單上,位於它下方最近的開放權重名次是 HunyuanImage 3.0 Instruct以 1,066 分、5,221 次登場,落後 8 Elo。有七個名次落在十八個 Elo 分之內。
誠實解讀「頂尖開放權重模型」這項說法
標題裡的這個說法正在發揮特定作用,值得加以檢視,而不是照樣重複。
• 這是標記範圍內的排名,而非整體排名。Qwen-Image-2.1 在兩個榜單的整體排名皆為第 18 名。正是 Open Weights 標籤讓它在各榜單上名列第一,而該標籤是由各榜單自行認定、逐個模型套用的——文生圖榜有 47 列帶有此標記;編輯榜列出 97 列,其中 36 列帶有此標記。
• 這個標籤描述的是權重,而非條款。Qwen-Image-2.1 依 2026 年 9 月 20 日的《Qwen 研究授權協議》發布,該協議僅授予非商業用途的權利。董事會的「開放權重」標籤對可下載性描述準確,但對你下載後能拿它做什麼卻隻字未提。任何把「頂尖開放權重圖像模型」讀成「可免費用於產品」的人,都已經讀到超出這個標籤的原意了。
• 這是一份快照,而非已定案的排名。 隨著票數累積,排行榜每天都會變動。Qwen-Image-2.1 在文字生圖上的信賴區間為 ±10 Elo,在編輯上則為 ±9;其下方的各列區間彼此重疊。請將這個位置視為當前狀態,而非永久定論。
發表報導所沒有的細節:沒有 API
Qwen-Image-2.1 的兩個列項都帶有一則明確的無可用 API標註。這對排名來說是實實在在的成本,也透露出 5,286 與 5,536 票是誰投出來的——如果沒有端點可以讓提示詞指向,那些比較就是來自自行跑權重並提交輸出的人。對一個只能自架部署的模型而言,獨立 Elo 是比任何人都能呼叫的模型更困難許多的量測,這也是為什麼這裡的樣本規模只有最前面幾列的三分之一。
對開發者來說,這樣的局面再熟悉不過:這個領域中最強的可下載圖像模型,並不是你今天就能呼叫的那一個。實際上,這讓工作分成了兩條路。你要嘛在自己的硬體上自行部署 Qwen-Image-2.1,要嘛在這塊看板上呼叫它周遭的其中一個模型。第二個選項正是路由發揮價值之處——一個 API 涵蓋 200 多個模型,並以零加成的方式轉嫁供應商的定價,當供應商服務品質下滑時自動容錯移轉,還有一套路由 DSL,能把多個模型組合成單一次呼叫。OrcaRouter 目前並未提供 Qwen-Image-2.1;平台上的圖像系列是 Google 的 Imagen 各級方案與 Gemini 圖像預覽版、xAI 的 Grok Imagine 圖像端點,以及 OpenAI 的 GPT-Image 系列。在這塊看板上,那就是最頂端的 GPT Image 2.5 Sunburst 那一列,而對於「我想要最高分,而且我下午就要能呼叫它」這個需求,這是個合情合理的答案。

看板上要留意什麼
有三件事會推動這個故事的發展,而這三件事早已在那些看板上清楚可見。
第一點是 API 是否出現。如果 Alibaba 或某個服務合作夥伴把 Qwen-Image-2.1 放上端點,無可用 API這項附註就會消失,票數應該會攀升至接近鄰近各列的水準,而信賴區間也會收窄。在 1,034 或 1,074 上取得更窄的區間,會是比目前強得多的主張。
第二個是阿里巴巴自家的技術棧。Qwen-Image-3.0-Pro 拿下 1,089 分、Qwen-Image-3.0 拿下 1,075 分,在文生圖項目上雙雙超越 Qwen-Image-2.1,且兩者都沒有標示開放權重。如果 Qwen-Image-2.1 的定位是這條產品線可下載的對應版本,而非其後繼機型,那麼有趣的問題就在於這個差距是否會縮小——而在圖像編輯排行榜上,差距已經縮小了:Qwen-Image-3.0-Pro 領先 Qwen-Image-2.1 兩分 Elo。
第三個是授權條款。兩張榜單上的每一列 Open Weights 都同樣有資格獲得這個標籤,而它們背後的授權條款卻完全不能相提並論。榜單永遠不會告訴你這件事。那是計分板唯一缺少的一欄。

常見問題
Qwen-Image-2.1 是最好的開放權重圖像模型嗎?
在這兩個排行榜上,是的——它是兩者上帶有 Open Weights 標記的最高 Elo 列,在文字轉圖像上為 1,034,在編輯上為 1,074。整體而言,它在每個排行榜上都排名第 18——而這個第 18 名,是在其中一個排行榜的 166 列中、在另一個的 97 列中的排名,代表著兩套無法互相比較的 Elo 尺度。這個說法唯有在兩個限定條件都保持附帶時才成立。
為什麼這兩個排行榜對同一個模型顯示不同的 Elo 值?
他們以不同的模型群體來為不同任務評分。文字轉圖像 Elo 與編輯 Elo 是兩套各自獨立的量表;比較 1,034 與 1,074 衡量的是排行榜,而不是模型。
我可以透過 API 呼叫 Qwen-Image-2.1 嗎?
榜單的兩列都記錄為無可用的 API。權重可從 Alibaba 的儲存庫下載,因此模型能運行——只是它並沒有被該榜單認定為其提供服務的託管端點。
如果你今天要的是數字而不是下載檔,那兩個排行榜的榜首都能透過各家廠商自家的 API 直接呼叫;而 GPT-Image 系列、Google 的 Imagen 各級方案,以及 xAI 的 Grok Imagine,都是 OrcaRouter 直接對外提供的圖像模型。權重檔留給實驗,端點留給截止期限。
