
Qwen-Image-2.1 稱霸兩大圖像競技場:第一名開源標籤背後隱藏了什麼
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen-Image-2.1 背後的團隊感謝 Arena 的肯定,而這份肯定確實不假。Qwen-Image-2.1是兩個 Arena 圖像排行榜上得分最高、且未被榜方標為 Proprietary 的模型:在 2026 年 9 月 22 日的快照中,Image Edit 為 1,367 分,Text-to-Image 為 1,228 分。兩個榜上位於它之上的每一列都帶有 Proprietary 標籤。這則公告未提及的三項事實,與該主張本身同樣可查證——這些分數所換得的整體排名、初步兩列皆附帶的旗標,以及一段授權字串寫著qwen-research,而非其較早期圖像模型所採用的 Apache 2.0。這項主張在與排行榜對照後依然站得住腳。只是它所承載的資訊,比標題所暗示的要少。
並排閱讀這兩塊板
Arena 分數是根據盲測成對投票建立的 Elo 式評分:一個人會看到兩份輸出,不知道哪份輸出是哪個模型產生的,然後做出選擇。這與廠商基準測試是截然不同的證據類別,因此,倚賴它的說法值得驗證,而非只是重複。這兩個排行榜都是在 2026 年 9 月 22 日擷取的,而且都是逐列閱讀,而不是從排名圖表匆匆掃過。

圖像編輯排行榜列出 56 個模型與 29,902,508 票。Qwen-Image-2.1 以 1,367 的分數、±9 的信賴區間與 4,841 票位居第 16 名。它上方的十五列——從 1,526 的 gpt-image-2.5-sunburst 到 1,370 的 gpt-image-1.5-high-fidelity——全都是專有模型。緊接其下方的兩列也是如此,分別是 1,358 的 reve-2.0 與 1,334 的 uni-1.1-max。

當天的文生圖排行榜列出了 79 個模型與 6,258,152 票。Qwen-Image-2.1 排名第 17,分數為 1,228,信賴區間為 ±11,共獲得 2,843 票。模式相同:其上方十六列皆為專有模型,而下方的第一個非專有列是 ideogram-4.0-quality,1,204,標示為 Ideogram Open Model。
那些行裡的兩個細節值得特別點出,因為它們與這個說法通常被複述的方式相牴觸。
• 排名與分數各說各話——1,367 是影像編輯排行榜上非專有(non-Proprietary)模型的最佳成績,同時也是第十六名,落後領先者 159 分,距第十五名還差 3 分。
• 在某個排行榜上,阿里巴巴自家的閉源模型勝出——標記為 Proprietary 的 qwen-image-3.0-pro 在 Text-to-Image 以 1,254 分名列其上,比 qwen-image-2.1 的 1,228 分高出二十六分。在編輯排行榜上,開源模型則以 1,304 分擊敗較早的專有模型 qwen-image-2.0-pro-2026-06-22。自家冠軍在兩個排行榜上並不是同一個模型。
• 與下一個開源模型的差距,在一個排行榜上很大,在另一個上則很小——在 Image Edit 上,下一個非專有項目是 1,302 分的 hunyuan-image-3.0-instruct,落後六十五分;在 Text-to-Image 上則是 1,204 分的 ideogram-4.0-quality,落後二十四分。
授權字串承擔的工作比排名還多。
每一行 Arena 都帶有組織與授權標籤。Qwen-Image-2.1 的標示為Alibaba · qwen-research,在兩個排行榜上皆如此。這並非阿里巴巴較早圖像模型上的 Apache 2.0 標籤:編輯排行榜上 1,241 分的 qwen-image-edit 與 1,235 分的 qwen-image-edit-2511 都標示為 Apache 2.0,文字生成圖像排行榜上 1,125 分的 qwen-image-2512 與 1,057 分的 qwen-image 也是如此。該廠商的部落格文章也完成了同樣的閉環,依日期為 2026 年 9 月 20 日的 Qwen Research License Agreement 發布權重,該授權允許研究與評估,但不允許商業用途。
所以,對「#1 開源模型」這個說法最誠實的解讀,比它聽起來要狹隘得多。若依排行榜自身非黑即白的二分法——專有,或不是——Qwen-Image-2.1 確實排第一。但若依 OSI 對開源的定義,該定義不接受使用領域限制,那它根本算不上開源,而與它相比的多數模型也同樣不是:同一批排行榜上列著標示為flux-non-commercial-license、tencent-hunyuan-community、krea-2-community-license 與 Ideogram Open Model 的項目。Arena 的「Open Source」篩選器只是粗略的專有/非專有切換開關。它很好用。但它並不是授權審查。
這個區別在這裡比兩分的差距更重要,因為它是唯一不會因為再投一週票而改變的事。如果你今天想要這個系列中採用寬鬆授權的圖像模型,Apache 2.0 的列是 qwen-image-edit 和 qwen-image-edit-2511——兩者都較舊,而且在同一個編輯排行榜上都低了超過一百二十分(1,241 和 1,235,對比 1,367)。得分最高的開放標示 Qwen 圖像模型,與可商業使用的 Qwen 圖像模型,並不是同一個下載項目。
初步意味著這個數字仍可能變動
Qwen-Image-2.1 的兩個項目都帶有排行榜的初步標記,當某個項目尚未累積足夠票數、分數還無法被視為塵埃落定時,Arena 便會套用這個標記。票數正是原因所在:在 Image Edit 上為 4,841 票,而排行榜總票數為 29,902,508;在 Text-to-Image 上為 2,843 票,對比排行榜的 6,258,152。相較之下,其周遭項目的票數高出許多——gpt-image-1.5-high-fidelity 在編輯排行榜上有 589,013 票,而 qwen-image-2.0-pro-2026-06-22 在 Text-to-Image 排行榜上有 307,705 票。
一個才發布三天的模型出現 ±9 與 ±11 的信心區間並非警訊;那正是新版本發布時的模樣。但這確實意味著,隨著票數累積,開放層級頂端的具體排序可能會變動,尤其是在 Text-to-Image 上,其領先下一個開放項目的幅度為二十四點。
依廠商自家的規格表,這款型號究竟是什麼
阿里巴巴自家的說明文件描述了一個統一的文字生圖與編輯模型,其 7B 參數的視覺生成元件由 32 層 Single-Stream DiT 構成,能原生生成與編輯透明影像,支援最多 10 張參考圖,原生輸出上限為 2048×2048——整條流程的完整下載約 33 GB。透明影像支援是那份清單上最不常見的項目;Arena 的編輯排行榜顯然並未衡量這項能力,因此排行榜名次對這項特定功能並不構成任一方向的證據。
廠商主打的重點基準是 Qwen-Image-Bench,該模型在此被呈報為 60.28,領先 Nano Banana 2.0 的 59.82 與 GPT Image 1.5 的 59.65。這是廠商自行執行的評估,沒有第三方重現,而且差距不到一分——這樣的差距只要換一組提示詞就撐不住。值得直說的是:上述 Arena 的數字是其他人投的票,而 Qwen-Image-Bench 的數字則是阿里巴巴自家的。它們不是同一類證據,不應被平均成對該模型的單一印象。
部署支援在發佈時就到位,而不是等到發佈後才出現:該模型在 ComfyUI、SGLang、vLLM-Omni、LightX2V 與 Diffusers 函式庫中已有零日整合,這意味著對大多數團隊而言,實務上的問題不是模型能不能提供服務,而是服務成本是否划算。
如果你這週就需要圖像 API,這類說法會被如何看待
在這一點上,精確說明我們自己的立場很重要。OrcaRouter 並不提供 Qwen-Image-2.1 的路由,也不提供任何版本的任何 Qwen-Image 模型路由。如果是 Arena 分數說服了你,該模型可以透過供應商自家的 API 和幾個第三方平台取得,或以自行託管下載的方式取得——不是透過我們。我們沒有 Qwen 圖像路由可以賣給你,而排行榜名次也不是讓我們假裝相反的理由。
我們實際會路由到的,是那些排行榜所排名的圖像層級中其餘的部分,而 Qwen-Image-2.1 之上的好幾列都包含在內。OpenAI 的 GPT-Image-2、GPT-Image-1.5 與 GPT-Image-1-mini 皆可使用,Google 的 Imagen 4 各層級、Gemini 圖像預覽端點,以及 xAI 的 Grok Imagine 圖像端點也一樣。這樣的組合,正是對這類主張的務實解答。如果 Arena 當初直接讓某個開源模型登上榜首,切換就只是在單一金鑰上改一行程式碼。但事實並非如此——兩個排行榜的榜首都是專有模型,而真正有意思的抉擇,在於研究授權的下載檔與你今天就能呼叫的託管端點之間。
這個平台有三項特性對這項決策至關重要。路由在單一 OpenAI 相容端點上運作,涵蓋 200 多個模型,因此將各代管模型互相比較,並不代表得再簽一份合約或再用一套 SDK。供應商的定價以零加成直接轉嫁,這意味著廠商的價格變動在公告當天就會反映到你的帳單上,而不是等到下一次合約續約時才調整。而跨供應商的自動容錯移轉,意味著一個嶄新、得票稀少的模型可以排在成熟模型之後、成為備援鏈中的一環,而不是在第三天就變成正式環境的依賴項目——而這大致正是 Qwen-Image-2.1 目前的處境。
這個主張是真的,而且比讀起來更單薄。
阿里巴巴發布的內容是可驗證的:在 2026 年 9 月 22 日兩個 Arena 圖像排行榜的快照中,Qwen-Image-2.1 是未被標記為 Proprietary 的模型中得分最高者。這則貼文所壓縮掉的,是一切限定該說法的條件——總排名第 16 與第 17、僅基於幾千票的初步分數,以及一個研究授權條款,替代了這句話令人聯想到的開源授權條款。

這些都不會讓這項成果顯得渺小。在發布後短短三天就成為兩份排行榜上第一個非專有模型,確實改變了開源層級所處的位置——在它之前、以寬鬆授權釋出的那些 Qwen 圖像模型,在同一份圖像編輯排行榜上落後超過一百二十分。但這並不等同於「開源界最強的圖像模型」這種說法,而兩者的差別不過是一行授權資訊和一個排名欄位,花大約一分鐘就能查證。
