一張「Ming-Image-0.1-Design vs Meta Muse Image」的主視覺標題卡,副標題為「一個以檔案形式交付。一個以宣稱形式交付。」,對比 Ming-Image-0.1-Design(61.5 億參數、MIT 授權、71.5 GB 下載檔、沒有任何發布公告)與 Meta Muse Image(封閉的託管模型、每張圖片 0.01 美元、沒有權重、推出宣傳活動),右下角放上 OrcaRouter 標誌。
Guides & Insights

Ming-Image-0.1-Design 對比 Meta Muse Image:有論文紀錄可循的模型,與只有新聞稿的模型

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩款圖像模型在 2026 年以截然相反的方式問世。Ming-Image-0.1-Design是螞蟻集團旗下 inclusionAI 團隊推出的 61.5 億參數文字生成圖像模型,於 2026 年 9 月 17 日以 MIT 授權條款上傳至 Hugging Face,沒有發布公告、沒有部落格文章,也沒有基準測試表——一個 71.5 GB 的儲存庫,你可以逐檔閱讀。Meta Muse Image是 Meta Superintelligence Labs 首款自主研發的圖像模型,於 2026 年 7 月 7 日推出,伴隨一波媒體報導、廠商自報的基準測試宣稱,以及完全沒有任何可下載的權重。有趣的問題不在於哪一款能畫出更好的海報,而在於這些模型中有一款如今可以被審查,另一款只能憑信任接受,而可審查的那一款,正位居它唯一出現的獨立排行榜榜首。

一個以檔案形式交付。一個以宣稱形式交付。

先從每個版本實際上由什麼組成開始,因為差異並不細微。

Ming-Image-0.1-Design — 6,154,901,056 個參數、MIT 授權、一個 diffusers 管線,所有權重皆為 BF16 safetensors,六個元件資料夾合計約 71.5 GB:connector/(2 個分片)、mllm/(7 個分片)、mlp/(124.8 MB)、scheduler/transformer/(5 個分片)與 vae/(253.8 MB)。沒有 model_index.json,因此建議做法是對推論儲存庫執行 git clone,再執行 python infer.py,而不是單行的管線呼叫。

Meta Muse Image — 沒有權重、沒有公開的參數數量、沒有架構文件、沒有可閱讀的授權檔案。它可作為服務取用,且自 2026 年 8 月起,可透過 Meta 自家的 Model API,在與 OpenAI 相容的端點上,以每張圖片 0.01 美元的固定價格取用。你對其內部結構所知的一切,都來自 Meta 自身對這些內部結構的描述。

這種不對稱有一個與影像品質毫無關係的實際後果。有了 Ming 版本,你可以回答廠商從未處理的問題:文字編碼器是什麼、排程器預期多少個取樣步驟、VAE 輸出的是四個通道還是八個通道、MLP 連接器是否在做任何你可以替換的事。有了 Muse Image,你一個都答不出來,而且下一季度也同樣答不出來,因為沒有可供開啟的產物。

A two-column scoreboard titled "Ming-Image-0.1-Design vs Meta Muse Image - the scoreboard". Left column Ming-Image-0.1-Design: Weights downloadable; Licence MIT; Independent score Elo 1,082; Price self-host; Transparency output RGBA; Announced no. Right column Meta Muse Image: Weights none; Licence not published; Independent score Elo about 1,105; Price $0.01 per image; Transparency output not published; Announced yes, 7 July 2026. Footer reads "Ming score per the Artificial Analysis board on its model card; Meta figures vendor-reported.", with the OrcaRouter logo bottom-right.

唯一值得引用的那個數字,以及它的來源

Ming-Image-0.1-Design 在 Artificial Analysis 的 UI/UX 設計文字轉圖像排行榜中,於開放權重視圖下排名第一,Elo 為 1,082。其後的名單為:Ideogram 4.0(Quality)1,052、Ideogram 4.0 1,015、HunyuanImage 3.0 Instruct 1,005、FLUX.2 [dev] 1,000、FLUX.2 [dev] Flash 999,以及 FLUX.2 [dev] Turbo 994。

關於這點有三個必須誠實說明的重點,因為這是這項比較中最有力的證據,值得謹慎處理。第一,我們所讀取的那份排行榜副本,是發佈於該模型自家卡片上的版本,而且帶有 Artificial Analysis 的品牌標示——它是由供應商轉載的 Artificial Analysis 排行榜,並非我們自行產出的數據。第二,至今沒有人獨立重現過這個分數,而盲測偏好 Elo 排行榜是一種群體統計,並非針對單一提示詞的測試:它告訴你的是群眾平均偏好哪張圖片,而不是這個模型能否正確繪製你那張特定的資訊圖表。第三,而這正是能解釋許多疑問的關鍵:該排行榜經過篩選,只納入開放權重模型。Meta Muse Image 不可能出現在上面,因此它的缺席並不是一項結果。

就 Muse Image 而言,這些數字分別出自 Meta 自家與 Artificial Analysis,應該如實標明來源。Meta 公布的數據顯示,多圖角色一致性達 94%,支援最多 10 張參考圖,輸出長邊最高可達 1600 像素。Artificial Analysis 則將該模型列入文生圖前五名,並在其圖像編輯排行榜上以約 1,105 的 Elo 分數位居第三。前者是廠商自行公布的數字,後者是獨立測量所得,兩者性質並不相同。

The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.

Ming-Image-0.1-Design 是為了做什麼而打造

這份模型卡對目標說得很明確,它並非通用攝影用途,而是瞄準 UI、資訊圖表、海報與文字量大的設計工作——這類影像的難處在於清晰易讀的字型與乾淨的版面,而不是逼真的膚質。建議設定也反映了這一點:2048×2048 的輸出,想追求速度時用 1024、12 個取樣步數、無分類器引導(classifier-free guidance)為 1.0、BF16 精度,以及單一張 80 GiB 的 CUDA GPU。提示詞增強預期由另一個視覺語言模型提供——模型卡點名 Ling-3.0-flash-VLqwen3.8-27B——而部署則預期透過 vLLM-Omni 進行。

還有一個配套模型,Ming-Image-0.1-Design-Layer,它是獨立的儲存庫,具有不同的 pipeline 標籤(image-text-to-image)、6,154,908,736 個參數,以及相同的 MIT 授權條款。它的工作是圖層分解:你給它一張已合併的設計圖像加上一份圖層計畫,它就會回傳 RGBA 圖層。它在預設 bucket 下以 1024 執行,或為了速度使用 512,以 12 步、guidance 為 2.0,以及 flash_attention_2 執行。模型卡以圖像而非表格的形式展示在 Crello 測試集上的結果,如果你原本希望用數值方式與任何東西比較,這點值得注意。

什麼是真正尚不可知的

這裡必須把話說得直白。Ming-Image-0.1-Design 沒有發布說明、沒有公告、沒有列出限制的章節,而且在撰寫本文時也沒有第三方報導。該儲存庫的下載計數器顯示為零。供應商沒有提供託管端點。唯一獨立的量測結果就是那一個排行榜名次,其餘一切——吞吐量、對你的資料的提示詞遵循度、在參考圖數量超過少數幾張時的行為表現、RGBA 通道在邊緣處是否乾淨——都未在公開場合被量測過。

這能為你帶來的是簡短、定義明確的評估。你可以閱讀其架構、執行它,並在一天內自行做出判斷。它無法為你帶來一個能在採購文件中引用的基準測試。

A two-column card headed "Knowable today / Not knowable" separating what can be checked about Ming-Image-0.1-Design today (architecture and parameter count, licence terms, sampling settings, VAE and connector layout, one leaderboard position) from what cannot (third-party benchmarks, throughput on your hardware, prompt adherence on your data, stated limitations, vendor release date).

Meta Muse Image 則是鏡像般的對照。它已在兩個獨立榜單上受測,也公布了定價,但這兩者都無法讓你檢視哪怕一個權重。如果你的限制條件是一場合規審查,追問訓練資料從何而來、模型收到提示詞後會怎麼處理,那麼「Meta 說」就是你所能得到的全部答案。

路由器可據以採取行動的這項比較版本

這兩款模型都不是我們有提供路由的模型,本文也不會暗示相反的情況。Meta Muse Image 是封閉原始碼的,由 Meta 提供服務;Ming-Image-0.1-Design 則是權重下載,完全沒有託管路由。我們目前實際提供前端接取的圖像模型,是 OpenAI 的 GPT-Image 系列、Google 的 Imagen 4 各級版本與 Gemini 圖像預覽版,以及 xAI 的 Grok Imagine 圖像端點 ——全都置於一個與 OpenAI 相容的端點之後,以供應商定價提供、零加成,並具備跨供應商的自動容錯移轉,以及能把多個模型組合成單一呼叫的路由 DSL。

這一點在這裡之所以重要,有一個具體原因。一個未事先公告、只有單一排行榜名次的開放權重發布,正是團隊會想評估、卻不想把生產路徑押在它身上的那種模型。使用同一把金鑰,讓它與一個已量測模型並行運行,而不是放在該模型前面,這就是不必第二份合約、也不必修改程式碼就能完成評估的方法。

依你能驗證的來挑選

• 如果你需要一個可以檢查、修改、微調,或在你自己的硬體上執行的模型——Ming-Image-0.1-Design 是兩者中唯一的選擇,而且它的 MIT 授權對 2026 年的圖像發布來說異常寬鬆。

• 如果你需要一個有公開定價、且你能引用的獨立評分模型——這兩者中,Meta Muse Image 是唯一的選擇,而每張圖片 $0.01 是一個經得起預算審查的數字。

• 如果你需要將透明度作為輸出——Ming-Image-0.1-Design 的 RGBA 路徑及其 Layer 配套功能正是為此而生;Meta 的透明度方案則尚未公開。

• 如果你需要它今天下午就能運作——兩者都不行。一個沒有託管端點,另一個沒有下載。

那個懸而未決的問題比表面上看起來更狹窄,而且它是一個日期,而不是一項基準。Ming-Image-0.1-Design 於 2026 年 9 月 17 日上傳,而沒有人宣布過它。要嘛那個公告出現,排行榜位置得到第二次、獨立的解讀;要嘛它沒有出現,而這就仍是一個只有少數人跑過的儲存庫。對它的首次第三方評估才是值得關注的事,因為那一刻正是書面紀錄不再只是承諾、而開始成為證據的時候。