用於比較 Qwen-Image 2.1 與 MAI-Image-2.5-Pro 的主視覺卡片:前者是無獨立評分的開放權重模型,後者則以 Elo 1,272 的成績穩居 Artificial Analysis 圖像編輯競技場的實測榜首
Guides & Insights

Qwen-Image 2.1 對上 MAI-Image-2.5-Pro:6,100 張盲投票對零

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這兩個模型当中,有一個已經經過約 6,100 次盲測人工比較的排名。另一個則沒有任何自家實驗室以外的人員替它排名。MAI-Image-2.5-Pro是 Microsoft 的頂級圖像模型,在 Artificial Analysis 圖像編輯競技場上以 1,272 的 Elo 位居第一——這是該類別中獲得最多投票的結果。Qwen-Image 2.1由 Qwen-Image 團隊於 2026 年 9 月 20 日開源,完全沒有獨立評分,而且在足夠多人在公開場合運行它以產生投票之前,也不會有任何評分。這個落差才是本次比較的真正主題,因為它是這兩個模型之間唯一不屬於廠商宣稱的差異。其他一切——架構、解析度、價格——都是可得知但未經證實的,而這兩個模型在紙面規格上又足夠接近,因此真正應該左右決定的,是這個量測上的落差。

這些投票實際上說明了什麼,以及它們沒有說明什麼

Artificial Analysis 進行盲測成對比較:兩個模型拿到相同提示,投票者選出較好的輸出,Elo 則由結果得出。它不是完美的工具,但它是這個類別最接近共用計分板的東西,而樣本數和分數本身一樣重要。

MAI-Image-2.5-Pro — 在約 6,100 次比較中,以 Elo 1,272 位居影像編輯第一。在文字轉圖像方面,它則以 Elo 1,292 排名第 7,落後於 GPT Image 2(high)的 1,369、Reve 2.1 的 1,322、Nano Banana 2 的 1,320、GPT Image 1.5(high)的 1,310,以及 MAI-Image-2.5 的 1,304。

Qwen-Image 2.1 — 兩個榜單上皆無紀錄。不是分數低,而是根本沒有分數。撰寫本文時,該版本才剛發布一天。

這些數字的樣貌值得仔細解讀,因為它並不是行銷所暗示的那種樣貌。微軟的模型在編輯方面確實排名第一,在生成方面也確實排名第七。這是一個具體、站得住腳的定位——一個領先其所屬類別的編輯專家——而這與成為最佳圖像模型是兩回事,而它並不是最佳圖像模型。同時,在文字轉圖像方面勝過它的是 GPT Image 2(high),而這也不是 OpenAI 在此領域最新的模型。獨立排行榜會獎勵被測量最多次的模型,而在這場對決中,那無疑是微軟的模型。

開源模型唯一徹底勝出的一項規格

這兩者之間有一個具體且非主觀的差異,那就是解析度。

Qwen-Image 2.1原生即可生成 2K 影像,官方文件記載的預設值為 2048×2048、40 個推論步數,並提供七種長寬比預設,以及具備真正 alpha 通道(而非合成用遮罩)的 RGBA 輸出。

MAI-Image-2.5-Pro 的輸出上限為 1,048,576 像素——約等於一百萬像素。它真正亮眼的規格數字在別處:32,000 個文字輸入 token、131k 的上下文視窗,以及 4,096 個輸出 token,這說明的是它能吸收多少指令,而非它能輸出多少影像。

對大多數社群與產品工作而言,一百萬像素的上限並不是限制。但對印刷、大尺寸合成,以及任何裁切後仍須經得起考驗的用途來說,它就是限制。這是整場比較中唯一一個你能指著某個數字說開源模型領先的面向——而且要注意,這是來自模型卡的架構事實,不是品質宣稱。Qwen-Image 2.1 都會以 2048×2048 渲染,無論它渲染出來的東西是否值得一看。

價格,這正是比較令人不自在的地方

MAI-Image-2.5-Pro 以高階模型定位來定價,而且價格數字毫不含糊:每百萬個文字輸入 token 為 $5、每百萬個圖片輸入 token 為 $8、每百萬個圖片輸出 token 為 $106。以 1024 像素輸出計算,換算下來約為每千張圖片 $108.50。作為對照,這大約是 MAI-Image-2.5 成本的 2.3 倍,也大約是 MAI-Image-2.5-Flash 的 5.4 倍,因此微軟是刻意區隔自家產品線,而非將 Pro 等級定價為小幅升級。

Qwen-Image 2.1 沒有託管價格,因為它沒有託管端點——它是在研究授權下提供下載的權重檔。它的成本是你的 GPU 時間,而它的限制在於你無法合法販售它產出的東西。拿每千張圖片 108.50 美元來和「免費權重」相比,等於是把一項服務拿來和一台機器相比,而這個比較誠實的版本是:按量計費的價格買到的是經實測、有支援、具商業授權的模型,而權重買到的是一個 33 GB 的下載檔,以及一份寫著僅限非商用的授權文件。

這種取捨正是路由層發揮價值的地方。OrcaRouter 以供應商定價、零加價的方式,將 200 多個模型置於單一 OpenAI 相容端點之後,並具備跨供應商的自動容錯移轉 ——因此想評估某個未經實測的開放模型的團隊,不必為了評估而把正式環境遷移到該模型上,而且由於定價是原樣轉嫁,被路由模型的任何供應商價格變動,當天就會落在我們這邊,而不是等到下一次合約續約。MAI-Image-2.5-Pro 與 Qwen-Image 2.1 目前都不在我們路由的模型之列,本文也不會暗示相反的情況。我們確實有代理的圖像產品線,是 OpenAI 的 GPT-Image 系列、Google 的 Imagen 4 各級版本與 Gemini 圖像預覽版,以及 xAI 的 Grok Imagine 圖像端點。

Two-column scoreboard for Qwen-Image 2.1 and MAI-Image-2.5-Pro: Qwen-Image 2.1 rows read Released 20 Sept 2026 / Licence research-only, non-commercial / Editing score none / Text-to-image score none / Output 2048x2048 native, RGBA / Price self-host, no hosted endpoint; MAI-Image-2.5-Pro rows read Announced 23 July 2026 / Licence commercial, via Microsoft / Editing score AA #1, Elo 1,272, about 6,100 votes / Text-to-image score AA #7, Elo 1,292 / Output capped at 1,048,576 pixels / Price about $108.50 per 1,000 images; footer reads 'MAI figures per Artificial Analysis; Qwen-Image 2.1 has no independent score yet.'

供應商宣稱的定位,以及應賦予它們多少權重

兩家廠商公布的數據都沒有第三方重現過,而無論哪一方,都應以同樣的懷疑態度看待。

微軟的說法——英文、中文、日文、韓文與西班牙文之間的文字渲染準確率達 96.8%;提示詞遵循度比 GPT-Image-1.5 高出 27%;多圖角色一致性達 94%;以及在特定微軟內部情境下,GPU 成本最多可降低 84–89%。最後一項得格外小心:它描述的是微軟自家的服務配置,而不是客戶能自行驗證的任何事。

阿里巴巴的說法——Qwen-Image 2.1 的部落格文章附有一張 Qwen-Image-Bench 比較圖表,而其中的數字是廠商自家提供的。第三方報導中還流傳著一個數字,稱該模型是 20 層的 transformer,這與模型卡所述的 32 層單流 DiT 相牴觸;模型卡是主要來源,應採用 32 層這個數字。

這兩種情況的差異不在於任何一家供應商是否誠實,而在於微軟的模型已經過獨立測量,阿里巴巴的模型則尚未如此,因此微軟的宣稱有某個東西可供核對,而阿里巴巴的宣稱目前則沒有任何東西可供核對。

每個的用途是什麼

放在一起看,這些並不是在爭奪同一個位置。

MAI-Image-2.5-Pro 就是那件編輯工具。 它在龐大的投票基礎上領先編輯排行榜,它接受長指令(32k 文字輸入 token、131k 上下文),它具備商業授權,而且現在已於 Microsoft Foundry 和 MAI Playground 上以公開預覽形式提供。如果你的工作是反覆迭代的影像修正,而你需要在投入之前就知道它是該項任務目前可用的最佳選擇,這就是經實測得出的答案,而它的費用約為每千張影像 $108.50。

Qwen-Image 2.1 是開放研究的產物。它的渲染規模更大,隨影像模型一併附上可檢視的提示改寫檢查點,最多可接受 10 張參考影像,並能透過圈選、塗繪標註或遮罩進行局部編輯,而且可免費下載,但用來販售則屬違法。如果你從事的是評估、基準測試,或是在可讀取的權重上進行開發,它是更有意思的對象——而且你做這些工作時,並沒有排行榜告訴你它到底好不好。

此外,還有一個值得點明的時間不對稱性。MAI-Image-2.6 於 2026 年 8 月 19 日進入私人預覽,這意味著編輯排行榜上位居榜首的模型,已經落後微軟準備推出的版本整整一個世代。相較之下,Qwen-Image 2.1 才剛起步,其早期存取計畫要求測試者於 9 月 29 日前發表成果。這項比較中的兩份排行榜,在一個月內都會變得截然不同。

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026, showing GPT Image 2 (high) first at Elo 1,178 with MAI-Image-2.5-Pro listed at No. 7 with Elo 1,292, and no Qwen-Image 2.1 entry anywhere on the boardScreenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

什麼能解決這件事?

還有一點:Qwen-Image 2.1 出現在某個排行榜上。這篇文章裡除了解析度上限和價格以外的一切,都只是某一方實驗室的主張;而 MAI-Image-2.5-Pro 之所以能被一本正經地推薦,理由完全在於有 6,100 位並非為 Microsoft 工作的人,把它的輸出跟另一樣東西擺在一起看,然後偏好它。那正是這個開放模型尚未達到的標準,也是它理應被要求的標準。

在那之前,實際的解讀很簡單。如果你今天就需要一個編輯模型,而且要採用商業授權、背後還有排行榜作為後盾,答案就是微軟的,價格約為每千張圖片 108.50 美元。如果你想弄清楚一個具備原生 2K 輸出與可檢查提示改寫器的 7B 開放權重模型是否更好,你得自己進行衡量——而你能對結果做的最有用的事,就是把它公開,因為整個類別目前正缺一個資料點。