一張生成的 hero 主視覺標題卡,主標題為「Qwen-Image-2.1 稱霸兩大圖像競技場」,副標題為「#1 開源標籤所隱藏的事」,畫面顯示兩張排行榜卡片,分別標示為 Image Edit Arena,排名標籤寫著 56 之中的第 16 名,分數標籤寫著 1367;以及 Text-to-Image Arena,排名標籤寫著 79 之中的第 17 名,分數標籤寫著 1228,這兩張卡片位於一個寫著 qwen-research 授權的標籤上方。
Guides & Insights

Qwen-Image-2.1 稱霸兩大圖像競技場:第一名開源標籤背後隱藏了什麼

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Qwen-Image-2.1 背後的團隊感謝 Arena 的肯定,而這份肯定確實不假。Qwen-Image-2.1是兩個 Arena 圖像排行榜上得分最高、且未被榜方標為 Proprietary 的模型:在 2026 年 9 月 22 日的快照中,Image Edit 為 1,367 分,Text-to-Image 為 1,228 分。兩個榜上位於它之上的每一列都帶有 Proprietary 標籤。這則公告未提及的三項事實,與該主張本身同樣可查證——這些分數所換得的整體排名、初步兩列皆附帶的旗標,以及一段授權字串寫著qwen-research,而非其較早期圖像模型所採用的 Apache 2.0。這項主張在與排行榜對照後依然站得住腳。只是它所承載的資訊,比標題所暗示的要少。

並排閱讀這兩塊板

Arena 分數是根據盲測成對投票建立的 Elo 式評分:一個人會看到兩份輸出,不知道哪份輸出是哪個模型產生的,然後做出選擇。這與廠商基準測試是截然不同的證據類別,因此,倚賴它的說法值得驗證,而非只是重複。這兩個排行榜都是在 2026 年 9 月 22 日擷取的,而且都是逐列閱讀,而不是從排名圖表匆匆掃過。

A screenshot of the LMArena Image Edit Arena leaderboard, captured September 22 2026, showing the board header reading 29,902,508 votes and 56 models, with ranks 13 to 22 visible: gemini-3-pro-image-preview at 1385, reve-2.1 at 1375, gpt-image-1.5-high-fidelity at 1370, qwen-image-2.1 at rank 16 with 1367 and a confidence interval of plus or minus 9 and 4,841 votes marked Preliminary, reve-2.0 at 1358, uni-1.1-max at 1334, grok-imagine-image at 1329, uni-1.1 at 1315, gemini-3.1-flash-lite-image at 1314 and qwen-image-2.0-pro-2026-06-22 at 1304, with every row above qwen-image-2.1 labelled Proprietary.

圖像編輯排行榜列出 56 個模型與 29,902,508 票。Qwen-Image-2.1 以 1,367 的分數、±9 的信賴區間與 4,841 票位居第 16 名。它上方的十五列——從 1,526 的 gpt-image-2.5-sunburst 到 1,370 的 gpt-image-1.5-high-fidelity——全都是專有模型。緊接其下方的兩列也是如此,分別是 1,358 的 reve-2.0 與 1,334 的 uni-1.1-max。

A screenshot of the LMArena Text-to-Image Arena leaderboard, captured September 22 2026, showing the board header reading 6,258,152 votes and 79 models, with ranks 14 to 21 visible: gemini-3-pro-image-2k at 1246, gpt-image-1.5-high-fidelity at 1239, gemini-3-pro-image-preview at 1232, qwen-image-2.1 at rank 17 with 1228 and a confidence interval of plus or minus 11 and 2,843 votes marked Preliminary, ideogram-4.0-quality at 1204 labelled Ideogram Open Model, qwen-image-2.0-pro-2026-06-22 at 1191, uni-1.1-max at 1188 and mai-image-2 at 1183, with Proprietary labelling on every row above qwen-image-2.1.

當天的文生圖排行榜列出了 79 個模型與 6,258,152 票。Qwen-Image-2.1 排名第 17,分數為 1,228,信賴區間為 ±11,共獲得 2,843 票。模式相同:其上方十六列皆為專有模型,而下方的第一個非專有列是 ideogram-4.0-quality,1,204,標示為 Ideogram Open Model。

那些行裡的兩個細節值得特別點出,因為它們與這個說法通常被複述的方式相牴觸。

排名與分數各說各話——1,367 是影像編輯排行榜上非專有(non-Proprietary)模型的最佳成績,同時也是第十六名,落後領先者 159 分,距第十五名還差 3 分。
在某個排行榜上,阿里巴巴自家的閉源模型勝出——標記為 Proprietary 的 qwen-image-3.0-pro 在 Text-to-Image 以 1,254 分名列其上,比 qwen-image-2.1 的 1,228 分高出二十六分。在編輯排行榜上,開源模型則以 1,304 分擊敗較早的專有模型 qwen-image-2.0-pro-2026-06-22。自家冠軍在兩個排行榜上並不是同一個模型。
與下一個開源模型的差距,在一個排行榜上很大,在另一個上則很小——在 Image Edit 上,下一個非專有項目是 1,302 分的 hunyuan-image-3.0-instruct,落後六十五分;在 Text-to-Image 上則是 1,204 分的 ideogram-4.0-quality,落後二十四分。

授權字串承擔的工作比排名還多。

每一行 Arena 都帶有組織與授權標籤。Qwen-Image-2.1 的標示為Alibaba · qwen-research,在兩個排行榜上皆如此。這並非阿里巴巴較早圖像模型上的 Apache 2.0 標籤:編輯排行榜上 1,241 分的 qwen-image-edit 與 1,235 分的 qwen-image-edit-2511 都標示為 Apache 2.0,文字生成圖像排行榜上 1,125 分的 qwen-image-2512 與 1,057 分的 qwen-image 也是如此。該廠商的部落格文章也完成了同樣的閉環,依日期為 2026 年 9 月 20 日的 Qwen Research License Agreement 發布權重,該授權允許研究與評估,但不允許商業用途。

所以,對「#1 開源模型」這個說法最誠實的解讀,比它聽起來要狹隘得多。若依排行榜自身非黑即白的二分法——專有,或不是——Qwen-Image-2.1 確實排第一。但若依 OSI 對開源的定義,該定義不接受使用領域限制,那它根本算不上開源,而與它相比的多數模型也同樣不是:同一批排行榜上列著標示為flux-non-commercial-licensetencent-hunyuan-communitykrea-2-community-licenseIdeogram Open Model 的項目。Arena 的「Open Source」篩選器只是粗略的專有/非專有切換開關。它很好用。但它並不是授權審查。

這個區別在這裡比兩分的差距更重要,因為它是唯一不會因為再投一週票而改變的事。如果你今天想要這個系列中採用寬鬆授權的圖像模型,Apache 2.0 的列是 qwen-image-edit 和 qwen-image-edit-2511——兩者都較舊,而且在同一個編輯排行榜上都低了超過一百二十分(1,241 和 1,235,對比 1,367)。得分最高的開放標示 Qwen 圖像模型,與可商業使用的 Qwen 圖像模型,並不是同一個下載項目。

初步意味著這個數字仍可能變動

Qwen-Image-2.1 的兩個項目都帶有排行榜的初步標記,當某個項目尚未累積足夠票數、分數還無法被視為塵埃落定時,Arena 便會套用這個標記。票數正是原因所在:在 Image Edit 上為 4,841 票,而排行榜總票數為 29,902,508;在 Text-to-Image 上為 2,843 票,對比排行榜的 6,258,152。相較之下,其周遭項目的票數高出許多——gpt-image-1.5-high-fidelity 在編輯排行榜上有 589,013 票,而 qwen-image-2.0-pro-2026-06-22 在 Text-to-Image 排行榜上有 307,705 票。

一個才發布三天的模型出現 ±9 與 ±11 的信心區間並非警訊;那正是新版本發布時的模樣。但這確實意味著,隨著票數累積,開放層級頂端的具體排序可能會變動,尤其是在 Text-to-Image 上,其領先下一個開放項目的幅度為二十四點。

依廠商自家的規格表,這款型號究竟是什麼

阿里巴巴自家的說明文件描述了一個統一的文字生圖與編輯模型,其 7B 參數的視覺生成元件由 32 層 Single-Stream DiT 構成,能原生生成與編輯透明影像,支援最多 10 張參考圖,原生輸出上限為 2048×2048——整條流程的完整下載約 33 GB。透明影像支援是那份清單上最不常見的項目;Arena 的編輯排行榜顯然並未衡量這項能力,因此排行榜名次對這項特定功能並不構成任一方向的證據。

廠商主打的重點基準是 Qwen-Image-Bench,該模型在此被呈報為 60.28,領先 Nano Banana 2.0 的 59.82 與 GPT Image 1.5 的 59.65。這是廠商自行執行的評估,沒有第三方重現,而且差距不到一分——這樣的差距只要換一組提示詞就撐不住。值得直說的是:上述 Arena 的數字是其他人投的票,而 Qwen-Image-Bench 的數字則是阿里巴巴自家的。它們不是同一類證據,不應被平均成對該模型的單一印象。

部署支援在發佈時就到位,而不是等到發佈後才出現:該模型在 ComfyUI、SGLang、vLLM-Omni、LightX2V 與 Diffusers 函式庫中已有零日整合,這意味著對大多數團隊而言,實務上的問題不是模型能不能提供服務,而是服務成本是否划算。

如果你這週就需要圖像 API,這類說法會被如何看待

在這一點上,精確說明我們自己的立場很重要。OrcaRouter 並不提供 Qwen-Image-2.1 的路由,也不提供任何版本的任何 Qwen-Image 模型路由。如果是 Arena 分數說服了你,該模型可以透過供應商自家的 API 和幾個第三方平台取得,或以自行託管下載的方式取得——不是透過我們。我們沒有 Qwen 圖像路由可以賣給你,而排行榜名次也不是讓我們假裝相反的理由。

我們實際會路由到的,是那些排行榜所排名的圖像層級中其餘的部分,而 Qwen-Image-2.1 之上的好幾列都包含在內。OpenAIGPT-Image-2、GPT-Image-1.5 與 GPT-Image-1-mini 皆可使用,Google 的 Imagen 4 各層級、Gemini 圖像預覽端點,以及 xAI 的 Grok Imagine 圖像端點也一樣。這樣的組合,正是對這類主張的務實解答。如果 Arena 當初直接讓某個開源模型登上榜首,切換就只是在單一金鑰上改一行程式碼。但事實並非如此——兩個排行榜的榜首都是專有模型,而真正有意思的抉擇,在於研究授權的下載檔與你今天就能呼叫的託管端點之間。

這個平台有三項特性對這項決策至關重要。路由在單一 OpenAI 相容端點上運作,涵蓋 200 多個模型,因此將各代管模型互相比較,並不代表得再簽一份合約或再用一套 SDK。供應商的定價以零加成直接轉嫁,這意味著廠商的價格變動在公告當天就會反映到你的帳單上,而不是等到下一次合約續約時才調整。而跨供應商的自動容錯移轉,意味著一個嶄新、得票稀少的模型可以排在成熟模型之後、成為備援鏈中的一環,而不是在第三天就變成正式環境的依賴項目——而這大致正是 Qwen-Image-2.1 目前的處境。

這個主張是真的,而且比讀起來更單薄。

阿里巴巴發布的內容是可驗證的:在 2026 年 9 月 22 日兩個 Arena 圖像排行榜的快照中,Qwen-Image-2.1 是未被標記為 Proprietary 的模型中得分最高者。這則貼文所壓縮掉的,是一切限定該說法的條件——總排名第 16 與第 17、僅基於幾千票的初步分數,以及一個研究授權條款,替代了這句話令人聯想到的開源授權條款。

A generated scoreboard titled Qwen-Image-2.1 - the scoreboard, with rows reading Image Edit Arena score 1367 at rank 16 of 56, Text-to-Image Arena score 1228 at rank 17 of 79, row status Preliminary on both boards, licence qwen-research non-commercial, Apache 2.0 sibling qwen-image-edit at 1241, and vendor benchmark Qwen-Image-Bench 60.28 unreproduced, above a footer reading Arena figures per the LMArena boards captured September 22 2026; Qwen-Image-Bench figure vendor-reported, no third-party reproduction.

這些都不會讓這項成果顯得渺小。在發布後短短三天就成為兩份排行榜上第一個非專有模型,確實改變了開源層級所處的位置——在它之前、以寬鬆授權釋出的那些 Qwen 圖像模型,在同一份圖像編輯排行榜上落後超過一百二十分。但這並不等同於「開源界最強的圖像模型」這種說法,而兩者的差別不過是一行授權資訊和一個排名欄位,花大約一分鐘就能查證。