
MAI-Image-2.5-Pro 對比 Qwen-Image 3.0:四倍價格,不同類型的文字
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
把MAI-Image-2.5-Pro和Qwen-Image 3.0放在一起,首先注意到的就是價格:約每 1,000 張圖像 $108.50對應微軟高階方案,而約每 1,000 張 $25–30對應阿里巴巴 Qwen-Image 3.0 的價格——阿里巴巴自家報價約 $25,而 Artificial Analysis 的排行榜則列出 $30。無論哪個數字都貴了超過三倍。這份溢價實際買到的是不同類型的文字處理工作。Qwen-Image 3.0 由阿里巴巴 Qwen 團隊於 2026 年 7 月 21 日釋出,並於 8 月 4 日開放國際 API,其定價定位是大量文字渲染工具——在十二種語言中可讀至約 10px,並有 4,500 個 token 的提示詞視窗可容納內容密集的提示。MAI-Image-2.5-Pro 自 7 月 23 日起在 Microsoft Foundry 公開預覽,是獨立排行榜上評價最高的編輯器,具廠商宣稱的文字渲染準確度,但輸出上限硬性限制在約 1 百萬像素。兩者都是主打文字的 API 圖像模型;它們競爭的是每項工作的價格,而不是單一品質分數。
兩個文字故事,皆未完全證實
文本之爭是兩種模型並存的原因,也是證據最薄弱之處——本節中的所有數據皆由廠商自行報告,且未經任何獨立重現。
• Qwen-Image 3.0——阿里巴巴的發布資料宣稱可清晰渲染至約10px,原生支援12 種語言,具備 20+ 種字體與 100+ 種藝術風格、數學符號、下標、上標與多行公式,並熟悉常見的網頁、遊戲與軟體介面。提示詞視窗最高可接受4,500 tokens的輸入——比前一代提升 4.5 倍——因此能一口氣處理像是報紙頭版或九宮格知識圖表這類密集內容。
• MAI-Image-2.5-Pro — Microsoft 宣稱 文字渲染準確度達 96.8%,涵蓋中文、英文、日文、韓文和西班牙文;一項 27% 更好的提示遵循度,優於 GPT-Image-1.5 在內部評估中,以及 94% 的多圖角色一致性。輸入規格在紙面上更寬裕——最多 32,000 個文字輸入 token,上下文視窗 131k——輸出上限為 1,048,576 像素,相當於 1024×1024。
截至撰寫本文時,這兩項主張均未被重現。兩者的差異在於主張的形式:Qwen 的主張涉及跨文字系統的數量與可讀性,微軟的主張則涉及五種指定語言的準確性與一致性。兩家廠商均未發布可供其他實驗室運行與檢驗的基準測試。
編輯就是精髓所在
區分兩者的是編輯,而這正是唯一有獨立證據的軸線。MAI-Image-2.5-Pro 位居Artificial Analysis 影像編輯競技場第一名,Elo 1,272(約 6,100 張盲測投票),領先 Reve 2.1、MAI-Image-2.5 和 GPT Image 2。在同一排行榜上,較新的 Qwen-Image-3.0-Pro 則為1,249——一個頗具競爭力的分數,落後 23 Elo,而且對一款本月才進入國際 API 的模型來說相當引人注目。
在基礎模型之外,阿里巴巴的編輯組合與其說是一頂單一桂冠,不如說是一套專業技巧:古畫修復、全景生成、草圖轉PPT、多鏡頭分鏡。微軟的則是一場更狹窄、更深遠的賭注——精確且手術刀式的編輯,讓畫面其餘部分保持一致(物件替換、版面變更、圖像內文字更新、模糊清理),這類編輯正是舊模型會重新生成整個場景、失去主體的那一類。對於「拿現有素材,改一點,然後交付」這種工作流程,Pro 級別的獨立 #1 是更強的信號;而對於琳瑯滿目的創意編輯格式,Qwen 的清單則更廣泛。

規格對比
• 價格 — 每1千張圖片約108.50美元(1024×1024,AA換算)vs 每1千張約25–30美元(阿里巴巴報價 vs AA標示費率)br />• 發布 — 2026年7月23日(公開預覽版,Foundry)vs 2026年7月21日,國際API於8月4日br />• 文字輸入 — 32,000個token、131k上下文 vs 4,500個token的提示詞窗口br />• 輸出上限 — 約1,048,576像素(約1K)vs 最高2048×2048br />• 每次調用圖片數 — 每次請求單一輸出 vs 每次調用最多六張圖片br />• 編輯排名 — 第一名,Elo 1,272(AA)vs Qwen-Image-3.0-Pro在同一排行榜上的1,249br />• 來源 — 微軟「未從第三方模型蒸餾」的主張 vs 輸出上的AIGC來源標籤br />• 權重 — 封閉,僅API vs 封閉,僅API
輸出上限和每次呼叫的數量比表面上看起來更重要。Qwen-Image 3.0 可以渲染 2048×2048 的影像,且每次呼叫最多可回傳六張影像,這是一項批次經濟性的功能;Pro 等級的上限接近 1K,且每次請求只回傳單一輸出。如果你的需求是「給我六張產品照的系列」,阿里巴巴的模型就是為此設計的,而微軟的模型則不是。

當溢價能自我回本
決策規則關乎的是圖像的用途,而不是哪個模型「更好」。
• 為 MAI-Image-2.5-Pro 支付溢價,當輸出是關鍵資產——產品視覺、海報、關鍵幀,或是會投入行銷活動且不會被重新生成五十次的影像。編輯排名第一與角色一致性保證,在編輯必須一次到位時最為重要。
• 以 Qwen-Image 3.0 大量購買,當輸出是一次性使用或數量龐大時——本地化廣告變體、佔位圖、草圖轉 PPT 簡報、分鏡圖框,任何你會重新生成而非精修的情況。以每 1k $25–30 的價格,一次失敗的生成只是四捨五入的誤差;以每 1k $108.50 的價格,則不然。
值得提出一個中間立場:對於密集的多語言文字圖像工作——一個包含日文和西班牙文文案的登陸頁面模型、一張含公式的資訊圖表——Qwen 在紙面上是更合適的選擇,其 10px 字級清晰度與十二種語言支援,而且價格僅四分之一。微軟模型的論點是其在五種語言上 96.8% 準確率的宣稱,但該宣稱未經證實,而在兩個未經證實的文字宣稱之間做選擇的買家,或許應該以價格為重。

路由層(在適用時)
這兩個模型目前都還無法透過 OrcaRouter 存取——Qwen-Image 3.0 位於阿里巴巴自家的 API(阿里雲百煉和 Qwen 平台)以及數個第三方平台上,而 MAI-Image-2.5-Pro 則在 Microsoft Foundry 上——所以誠實的比較說得很清楚:兩者目前都不在我們這一邊。當任一方開始可透過可呼叫的託管供應商使用時,轉嫁經濟學便適用:在供應商定價之上加價 0%,因此你支付的就是廠商的價目表,而上市折扣或降價也會在宣布當天就反映在你的帳單上。故障轉移論點是另一半:Qwen-Image 3.0 是才推出幾週的國際 API,屬於你會將一部分流量路由過去、同時讓經過驗證的後備方案吸收邊緣情況的模型類型——這正是路由層的設計用途。
裁決
Qwen-Image 3.0 與 MAI-Image-2.5-Pro 並非同一產品的不同定價,而是恰好定價不同的兩種產品。微軟的模型奪下編輯桂冠,上下文視窗更大,並在五種語言上提出未經驗證的準確度宣稱——就主視覺素材與精準編輯而言,溢價有其道理。阿里巴巴的模型能清晰渲染更多文字系統,依照自身條件接受每次生成更密集的提示內容,輸出更大且一次六張,成本只需四分之一——就大量產出與多語言圖內文字工作而言,這是經濟上理性的選擇。在影像是產品的地方買高階版;在影像是庫存的地方買大量版。
