
Qwen-Image 2.1 對上 MAI-Image-2.5-Pro:6,100 張盲投票對零
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
這兩個模型当中,有一個已經經過約 6,100 次盲測人工比較的排名。另一個則沒有任何自家實驗室以外的人員替它排名。MAI-Image-2.5-Pro是 Microsoft 的頂級圖像模型,在 Artificial Analysis 圖像編輯競技場上以 1,272 的 Elo 位居第一——這是該類別中獲得最多投票的結果。Qwen-Image 2.1由 Qwen-Image 團隊於 2026 年 9 月 20 日開源,完全沒有獨立評分,而且在足夠多人在公開場合運行它以產生投票之前,也不會有任何評分。這個落差才是本次比較的真正主題,因為它是這兩個模型之間唯一不屬於廠商宣稱的差異。其他一切——架構、解析度、價格——都是可得知但未經證實的,而這兩個模型在紙面規格上又足夠接近,因此真正應該左右決定的,是這個量測上的落差。
這些投票實際上說明了什麼,以及它們沒有說明什麼
Artificial Analysis 進行盲測成對比較:兩個模型拿到相同提示,投票者選出較好的輸出,Elo 則由結果得出。它不是完美的工具,但它是這個類別最接近共用計分板的東西,而樣本數和分數本身一樣重要。
• MAI-Image-2.5-Pro — 在約 6,100 次比較中,以 Elo 1,272 位居影像編輯第一。在文字轉圖像方面,它則以 Elo 1,292 排名第 7,落後於 GPT Image 2(high)的 1,369、Reve 2.1 的 1,322、Nano Banana 2 的 1,320、GPT Image 1.5(high)的 1,310,以及 MAI-Image-2.5 的 1,304。
• Qwen-Image 2.1 — 兩個榜單上皆無紀錄。不是分數低,而是根本沒有分數。撰寫本文時,該版本才剛發布一天。
這些數字的樣貌值得仔細解讀,因為它並不是行銷所暗示的那種樣貌。微軟的模型在編輯方面確實排名第一,在生成方面也確實排名第七。這是一個具體、站得住腳的定位——一個領先其所屬類別的編輯專家——而這與成為最佳圖像模型是兩回事,而它並不是最佳圖像模型。同時,在文字轉圖像方面勝過它的是 GPT Image 2(high),而這也不是 OpenAI 在此領域最新的模型。獨立排行榜會獎勵被測量最多次的模型,而在這場對決中,那無疑是微軟的模型。
開源模型唯一徹底勝出的一項規格
這兩者之間有一個具體且非主觀的差異,那就是解析度。
• Qwen-Image 2.1原生即可生成 2K 影像,官方文件記載的預設值為 2048×2048、40 個推論步數,並提供七種長寬比預設,以及具備真正 alpha 通道(而非合成用遮罩)的 RGBA 輸出。
• MAI-Image-2.5-Pro 的輸出上限為 1,048,576 像素——約等於一百萬像素。它真正亮眼的規格數字在別處:32,000 個文字輸入 token、131k 的上下文視窗,以及 4,096 個輸出 token,這說明的是它能吸收多少指令,而非它能輸出多少影像。
對大多數社群與產品工作而言,一百萬像素的上限並不是限制。但對印刷、大尺寸合成,以及任何裁切後仍須經得起考驗的用途來說,它就是限制。這是整場比較中唯一一個你能指著某個數字說開源模型領先的面向——而且要注意,這是來自模型卡的架構事實,不是品質宣稱。Qwen-Image 2.1 都會以 2048×2048 渲染,無論它渲染出來的東西是否值得一看。
價格,這正是比較令人不自在的地方
MAI-Image-2.5-Pro 以高階模型定位來定價,而且價格數字毫不含糊:每百萬個文字輸入 token 為 $5、每百萬個圖片輸入 token 為 $8、每百萬個圖片輸出 token 為 $106。以 1024 像素輸出計算,換算下來約為每千張圖片 $108.50。作為對照,這大約是 MAI-Image-2.5 成本的 2.3 倍,也大約是 MAI-Image-2.5-Flash 的 5.4 倍,因此微軟是刻意區隔自家產品線,而非將 Pro 等級定價為小幅升級。
Qwen-Image 2.1 沒有託管價格,因為它沒有託管端點——它是在研究授權下提供下載的權重檔。它的成本是你的 GPU 時間,而它的限制在於你無法合法販售它產出的東西。拿每千張圖片 108.50 美元來和「免費權重」相比,等於是把一項服務拿來和一台機器相比,而這個比較誠實的版本是:按量計費的價格買到的是經實測、有支援、具商業授權的模型,而權重買到的是一個 33 GB 的下載檔,以及一份寫著僅限非商用的授權文件。
這種取捨正是路由層發揮價值的地方。OrcaRouter 以供應商定價、零加價的方式,將 200 多個模型置於單一 OpenAI 相容端點之後,並具備跨供應商的自動容錯移轉 ——因此想評估某個未經實測的開放模型的團隊,不必為了評估而把正式環境遷移到該模型上,而且由於定價是原樣轉嫁,被路由模型的任何供應商價格變動,當天就會落在我們這邊,而不是等到下一次合約續約。MAI-Image-2.5-Pro 與 Qwen-Image 2.1 目前都不在我們路由的模型之列,本文也不會暗示相反的情況。我們確實有代理的圖像產品線,是 OpenAI 的 GPT-Image 系列、Google 的 Imagen 4 各級版本與 Gemini 圖像預覽版,以及 xAI 的 Grok Imagine 圖像端點。

供應商宣稱的定位,以及應賦予它們多少權重
兩家廠商公布的數據都沒有第三方重現過,而無論哪一方,都應以同樣的懷疑態度看待。
• 微軟的說法——英文、中文、日文、韓文與西班牙文之間的文字渲染準確率達 96.8%;提示詞遵循度比 GPT-Image-1.5 高出 27%;多圖角色一致性達 94%;以及在特定微軟內部情境下,GPU 成本最多可降低 84–89%。最後一項得格外小心:它描述的是微軟自家的服務配置,而不是客戶能自行驗證的任何事。
• 阿里巴巴的說法——Qwen-Image 2.1 的部落格文章附有一張 Qwen-Image-Bench 比較圖表,而其中的數字是廠商自家提供的。第三方報導中還流傳著一個數字,稱該模型是 20 層的 transformer,這與模型卡所述的 32 層單流 DiT 相牴觸;模型卡是主要來源,應採用 32 層這個數字。
這兩種情況的差異不在於任何一家供應商是否誠實,而在於微軟的模型已經過獨立測量,阿里巴巴的模型則尚未如此,因此微軟的宣稱有某個東西可供核對,而阿里巴巴的宣稱目前則沒有任何東西可供核對。
每個的用途是什麼
放在一起看,這些並不是在爭奪同一個位置。
• MAI-Image-2.5-Pro 就是那件編輯工具。 它在龐大的投票基礎上領先編輯排行榜,它接受長指令(32k 文字輸入 token、131k 上下文),它具備商業授權,而且現在已於 Microsoft Foundry 和 MAI Playground 上以公開預覽形式提供。如果你的工作是反覆迭代的影像修正,而你需要在投入之前就知道它是該項任務目前可用的最佳選擇,這就是經實測得出的答案,而它的費用約為每千張影像 $108.50。
• Qwen-Image 2.1 是開放研究的產物。它的渲染規模更大,隨影像模型一併附上可檢視的提示改寫檢查點,最多可接受 10 張參考影像,並能透過圈選、塗繪標註或遮罩進行局部編輯,而且可免費下載,但用來販售則屬違法。如果你從事的是評估、基準測試,或是在可讀取的權重上進行開發,它是更有意思的對象——而且你做這些工作時,並沒有排行榜告訴你它到底好不好。
此外,還有一個值得點明的時間不對稱性。MAI-Image-2.6 於 2026 年 8 月 19 日進入私人預覽,這意味著編輯排行榜上位居榜首的模型,已經落後微軟準備推出的版本整整一個世代。相較之下,Qwen-Image 2.1 才剛起步,其早期存取計畫要求測試者於 9 月 29 日前發表成果。這項比較中的兩份排行榜,在一個月內都會變得截然不同。


什麼能解決這件事?
還有一點:Qwen-Image 2.1 出現在某個排行榜上。這篇文章裡除了解析度上限和價格以外的一切,都只是某一方實驗室的主張;而 MAI-Image-2.5-Pro 之所以能被一本正經地推薦,理由完全在於有 6,100 位並非為 Microsoft 工作的人,把它的輸出跟另一樣東西擺在一起看,然後偏好它。那正是這個開放模型尚未達到的標準,也是它理應被要求的標準。
在那之前,實際的解讀很簡單。如果你今天就需要一個編輯模型,而且要採用商業授權、背後還有排行榜作為後盾,答案就是微軟的,價格約為每千張圖片 108.50 美元。如果你想弄清楚一個具備原生 2K 輸出與可檢查提示改寫器的 7B 開放權重模型是否更好,你得自己進行衡量——而你能對結果做的最有用的事,就是把它公開,因為整個類別目前正缺一個資料點。
