主視覺標題卡寫著「Ming-Image-0.1-Design 對決 MAI Image 2.5 Pro」,副標題為「2048 x 2048 對上 1,048,576 像素上限」,並有一張標示「2048 x 2048」的圖片圖示卡,以及一張標示「1,048,576 像素上限」的文件圖示卡。OrcaRouter 標誌疊合於右下角。
Guides & Insights

Ming-Image-0.1-Design 對決 MAI Image 2.5 Pro:百萬像素天花板決定勝負

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

在比較 Ming-Image-0.1-DesignMAI Image 2.5 Pro 時,最具關鍵影響力的數字並不是 Elo 分數,而是 1,048,576。這是 Microsoft 為 MAI Image 2.5 Pro 記載的輸出上限——大約 1024 x 1024——而 inclusionAI 的 Ming-Image-0.1-Design 建議採用 2048 x 2048,且完全不以中間尺寸進行渲染,會把請求直接吸附到 1024 或 2048 這兩個級距之一。這兩款模型都確實很擅長在圖像中呈現清晰易讀的文字,這也是它們不斷出現在同一批討論裡的原因。只是,只有其中一款能給你 4 百萬像素的版面配置,也只有其中一款是在超大規模雲端供應商的高階方案上按 token 計價。

Ming-Image-0.1-Design 是 inclusionAI 的 6B 文字轉圖像模型,採用 MIT 授權,權重於 2026 年 9 月 17 日發布。MAI Image 2.5 Pro 是 Microsoft AI 的品質等級,自 2026 年 7 月 23 日起在 Microsoft Foundry 公開預覽。關於兩者文字渲染能力的說法,都尚未在做出該主張的實驗室之外獲得重現——但其中一個已經過競技場的考驗,而這項區別貫穿了以下所有內容。

每一個是為了什麼而打造的

MAI Image 2.5 Pro 是 Microsoft MAI-Image-2.5 系列中的頂級型號,位階高於主打均衡作業的 MAI-Image-2.5 與針對大量處理的 MAI-Image-2.5-Flash;而 MAI-Image-2.6 截至 8 月 19 日已進入私人預覽階段。Microsoft 將其描述為迄今保真度最高的圖像模型,鎖定主視覺圖像、精細編輯與精準的圖像內文字呈現等用途。它圍繞多圖像輸入打造:廠商表示其在各次生成之間可達到 94% 的字元一致性,並將該模型定位於這樣的工作流程——你取用現有素材、更改其中一項,然後直接交付。

Ming-Image-0.1-Design 是從零開始的生成器,而非編輯器。輸入提示詞,輸出圖像,無需參考圖。其領域是文字密集的平面設計——UI 模擬圖、儀表板、資訊圖表、海報——而其與眾不同的機制特性在於:當提示詞以其中一個已記載的透明度片語開頭時,它會輸出原生 RGBA。搭檔模型 Ming-Image-0.1-Design-Layer 會將扁平化的設計分解為 2–9 個獨立的 RGBA PNG,這些圖層可重新組合成原始設計。

• 輸出上限 — Ming-Image-0.1-Design 建議 2048 x 2048,或 1024 x 1024,中間尺寸會吸附至這兩者之一;相較之下,MAI Image 2.5 Pro 上限為 1,048,576 像素,約等於 1024 x 1024

• 核心模式 — 僅以提示詞生成 vs 多圖編輯,並在多張參考素材間維持角色一致性

• 透明度 — 取樣器提供的原生 RGBA,加上透過配套模型進行 2–9 層分解,對比無任何相關記載

• 授權與存取 — 自行託管的 MIT 權重 vs Microsoft Foundry 上的商業預覽

• 計費單位 — 你自己的 GPU 時間,一張 80 GiB 的顯示卡,對比按 token 計費,於 Foundry 上計量

• 獨立文字生圖排名——Ming-Image-0.1-Design 位居第 45 名,Elo 995,21,342 個樣本;對比 MAI Image 2.5 Pro 位居第 12 名,Elo 1,098,13,521 個樣本

• 獨立編輯排名 — 未列入 vs MAI Image 2.5 Pro 位列第 10,Elo 1,106,13,581 個樣本

一起讀取這兩個競技場號碼

於2026年9月24日查閱的Artificial Analysis排行榜,所透露的訊息比「某個模型更好」更為具體。

在文字轉圖像排行榜上,MAI Image 2.5 Pro 以 1,098 的 Elo 與 ±8 的 95% 信賴區間、13,521 票位居第 12 名。Ming-Image-0.1-Design 則以 995 Elo、±8、21,342 票排名第 45。在這個榜單上,這是 103 Elo 的差距,而如此狹窄的區間意味著這並非雜訊。在圖像編輯排行榜上,MAI Image 2.5 Pro 以 13,581 票、1,106 Elo 位居第 10 名;Ming-Image-0.1-Design 則完全沒有上榜。

接著,在對設計團隊真正重要的那一個切片裡,局面翻轉了。在同一個排行榜的 UI/UX 設計切片中,MAI Image 2.5 Pro 排名第 10,在該切片的 1,241 票中拿下 1,131 Elo;而 Ming-Image-0.1-Design 排名第 16,在 2,100 票中拿下 1,084 Elo。差距從 103 Elo 縮小到 47,而那個從未針對編輯進行基準測試的模型,在提示詞變成設計提示詞的那一刻,就拉近了大部分的距離。

這就是這項選擇的樣貌。經實測,MAI Image 2.5 Pro 是更出色的通用圖像模型,也是更好用的編輯器。Ming-Image-0.1-Design 則是專才,當任務是版面編排時,它的表現遠超出其整體排名,而且它是兩者之中唯一具備透明背景途徑的。

關於這兩組數據,有一點必須提醒:這些都是切片數字,而切片是會變動的。MAI Image 2.5 Pro 在完整榜單上取得的 13,521 票計數夠大,因此其區間很窄;但一個背後只有一千多票的使用情境切片,數字就比較不那麼扎實,而且這兩個模型背後的廠商說法,都還沒有經過任何人驗證。

A rendered two-column scoreboard headed 'Six dimensions', titled 'Ming-Image-0.1-Design vs MAI Image 2.5 Pro'. The Ming-Image-0.1-Design column reads: output ceiling 2048 x 2048; mode prompt-only generation; transparency native RGBA plus layers; price basis own GPU time on an 80 GiB card; full board #45, Elo 995, 21,342 votes; UI/UX slice #16, Elo 1,084, 2,100 votes. The MAI Image 2.5 Pro column reads: output ceiling 1,048,576 pixels; mode multi-image editing with 94% consistency claimed; transparency none documented; price basis $106 per 1M image output tokens; full board #12, Elo 1,098, 13,521 votes; UI/UX slice #10, Elo 1,131, 1,241 votes.

微軟聲稱的是什麼,以及它要付出什麼代價

微軟自家針對 MAI Image 2.5 Pro 的數據,全數由廠商自行提報,無一經過獨立複現:

• 96.8% 的文字渲染準確率,並標示為涵蓋中文、英文、日文、韓文與西班牙文——不過同一份文件將輸出上限設在大約一百萬像素,因此該宣稱所附帶的「8K」說法,最好解讀為行銷話術

• 在 Microsoft 的內部評估中,提示詞遵循度比 GPT-Image-1.5 高出 27%。

• 跨世代生成維持 94% 多圖像角色一致性

• 在 PowerPoint 和 OneDrive 等特定 Microsoft 情境中,GPU 成本相較於 GPT 模型最多可降低 84–89%——此為特定情境的數據,並非一般性數據

這份有文件記載的規格表佐證了那些說法:文字輸入最多 32,000 個 token、131k 上下文視窗、4,096 個輸出 token、支援 JPEG 與 PNG 影像輸入,以及 1,048,576 像素的輸出上限。那個上限是買家的問題。一款無法超過百萬像素的高品質編輯器,是社群與網路素材工具,不是印刷工具;而文字渲染準確度再高,也改變不了像素數量。

Foundry 上的定價以 Token 計量:每百萬個文字輸入 Token 為 $5,每百萬個影像輸入 Token 為 $8,每百萬個影像輸出 Token 為 $106。Microsoft 並未公布每張影像的 Token 數,因此任何每張影像的數字都是算術推算,而非官方報價。採用 Artificial Analysis 的換算方式,一張 1024 x 1024 影像的價格接近每 1,000 張 $108.50——約為同系列 MAI-Image-2.5 的 2.3 倍(後者約為每 1,000 張 $48),也是 MAI-Image-2.5-Flash 的 5.4 倍(後者約為每 1,000 張 $20)。Pro 層級是刻意設計的付費升級。預覽版定價也不等同於 GA 定價,且價目表在正式推出前仍可能變動。

Ming-Image-0.1-Design 沒有可資比較的供應商價目表,因為它沒有託管的端點。Artificial Analysis 的排行榜將它列為每 1,000 張圖片 30.00 美元,這是排行榜推導出的欄位,而非供應商公布的價格——inclusionAI 交付的是權重與推論配方,而不是 API。它真正的成本是一張具備 80 GiB VRAM 的 CUDA GPU、BF16、在 CFG 1.0 下執行 12 個取樣步數,以及建議的 2048 像素輸出。在 guidance 1.0 下跑 12 步屬於蒸餾式或無 guidance 的取樣器,這正是讓 2048 像素渲染在那樣的步數下變得可負擔的原因;而該卡建議的配方還會在擴散模型之前先執行一個視覺語言模型,把簡短的提示改寫成結構化的 Figma 風格 JSON 版面,包含座標、階層、色彩規格與逐字文字。

我們自己這邊有兩件事值得精確說明。這兩個模型我們都不路由:OrcaRouter 目錄中既沒有 Microsoft 影像模型,也沒有 inclusionAI 模型,因此這兩者都意味著供應商自己的路由,或者你自己的硬體。路由層真正的用途,是比較中現有的一方——一個與 OpenAI 相容的端點,涵蓋 200 多個模型,供應商列表價格以 0% 加成直接傳遞,因此供應商價格變更當天即生效,並且跨供應商自動容錯移轉。將同一組提示詞分別對上你已信任的託管影像模型,以及對上這兩個中的任何一個,是一鍵即可完成的工作,而不是採購工作。

Screenshot of the Artificial Analysis Text to Image Leaderboard captured 24 September 2026, cropped to the rows around both models. MAI-Image-2.5-Pro appears at row 12, creator Microsoft AI, Elo 1,098, range 8-13, 13,521 samples, July 2026, $108.5 per 1k imgs. Nano Banana 2 Lite appears at row 13 with Elo 1,092. Ming-Image-0.1-Design appears at row 45, creator InclusionAI, Elo 995, range 39-50, 21,342 samples, September 2026, $30.0 per 1k imgs, with the Open Weights badge. The Open Weights badge also appears on Ideogram 4.0 (Quality) at row 34 and on FLUX.2 [dev] at row 40.

沒人問的尺寸問題

還有一個數字讓這個比較的下載層面變得複雜,而它值得說明,因為這款模型是以 6B 的名義行銷。Ming-Image-0.1-Design 的擴散 transformer 有 6.15B 個參數。整個套件大約是 52.88 GB,因為多模態文字編碼器有 17.01B,而連接器又加上 3.09B——以 BF16 計算總共約 26B 個參數。Layer companion 的 transformer 則是兩倍,達 12.31B,其套件更大,約 65.20 GB。80 GiB VRAM 的需求,是變壓器以外所有東西都常駐所導致的結果,而不是來自 6B 這個數字。

MAI Image 2.5 Pro 的概況則恰恰相反:沒東西可下載、沒東西要提供,而且用它所能產出的內容有硬性上限。這兩個問題哪個更糟,完全取決於你的團隊是否已經在操作 GPU。

A rendered summary card headed 'The arithmetic', titled 'What the two price tags are actually measuring', listing four rows: the MAI Image 2.5 Pro token rates of $5 per 1M text input, $8 per 1M image input and $106 per 1M image output; the per-image arithmetic of about $108.50 per 1,000 images at 1024 x 1024, roughly 2.3x MAI-Image-2.5 and 5.4x MAI-Image-2.5-Flash; that Ming-Image-0.1-Design has no vendor rate card and the board lists $30.00 per 1,000 images as a board-derived column; and the pixel ceiling of 1,048,576 for MAI Image 2.5 Pro against 2048 x 2048, four times the area, for Ming-Image-0.1-Design.

選擇一個

• 你正在以高品質編輯現有影像,並能在百萬像素之內游刃有餘——MAI Image 2.5 Pro。它在編輯排行榜上確有排名第十的位置,其生成分數背後有大量投票數支撐,還有一套有文件記載的多圖像處理流程,並附有廠商報告的一致性數據。價格正反映了這一切。

• 您正在生成文字密集的版面,且需要透明度或可編輯圖層——Ming-Image-0.1-Design。原生 RGBA 與 2–9 層分解並非 MAI Image 2.5 Pro 無論任何價格所提供的功能,而 2048 x 2048 輸出更是像素預算的四倍。

• 你需要印刷解析度的輸出——這兩者都不行。一款上限為一百萬像素,另一款最高只到 2048 平方。

• 你需要一個在評測中站得住腳的數字——完整榜單看 MAI Image 2.5 Pro,UI/UX 子項看 Ming-Image-0.1-Design,而文字渲染準確度上兩者都沒有;因為這兩組說法都是廠商自行報告且未經重現。

誠實的結論是,這兩個模型其實並非真正在競爭。MAI Image 2.5 Pro 是一款優質的託管編輯器,有解析度上限,價格也與之相稱;Ming-Image-0.1-Design 則是免費下載,在特定設計領域的競技場切片中領先開放權重陣營,但代價是要有一張 80 GiB 的顯卡。值得觀察的是,Microsoft 是否會在 GA 前解除百萬像素上限,以及 inclusionAI 是否會為這些權重附上端點——因為這兩者中任何一個舉動,都會讓這變成真正的正面對決,而不是兩種不同承諾方式之間的比較。