主標題卡寫著「Ming-Image-0.1-Design 登上開放權重 UI 設計排行榜榜首」,副標題為「在 Artificial Analysis 的 UI/UX 設計切片中評分最高的開放權重模型,Elo 為 1,084」,並有一張標示「評分最高的開放權重模型」的獎盃圖示卡,以及一張標示「在 UI/UX 設計居領先地位」的螢幕圖示卡。OrcaRouter 標誌合成於右下角。
Guides & Insights

Ming-Image-0.1-Design 登上開放權重 UI 設計排行榜榜首——而且數字經得起檢驗

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Ming-Image-0.1-Design 一同流傳的說法是,inclusionAI 的 6B 模型是從事 UI 與 UX 工作最強的開放權重文字生圖模型,在 Artificial Analysis UI/UX Design 排行榜的開放權重視圖中以 1,082 Elo 位居第一。廠商提供的排行榜截圖通常是最薄弱的證據類型,因此首要之務就是去讀即時榜單。截至 2026 年 9 月 24 日,這點依然站得住腳,但有一個截圖並未傳達的重要但書:1,082 只是某個使用情境的切片,而非整份榜單;在完整的 Text to Image 排行榜上,同一款模型排名第 45,Elo 為 995。

這兩個數字都是真實的,它們來自同一個競技場,並且描述的是同一組權重。它們之間的差別在於,這些票是在哪些提示上投下的。

即時看板實際上寫的是什麼

Artificial Analysis 會進行一場盲測的兩兩對決競技場,然後將同一投票池篩選成各種使用情境切片。UI/UX 設計切片對於一個為儀表板、應用程式畫面、海報和資訊圖表而打造的模型來說才是關鍵,而這正是 Ming-Image-0.1-Design 表現最出色的地方:

• 整體文字轉圖像排行榜 — Ming-Image-0.1-Design 位列第 45 名,Elo 995,95% 信賴區間 ±8,21,342 個樣本,於 2026 年 9 月上榜,每 1,000 張圖像 $30.00,標記為開放權重

• UI/UX 設計切片 — Ming-Image-0.1-Design 排名第 16,Elo 1,084,該切片中有 2,100 個樣本

• 該區間中排名最高的開放權重項目——Ming-Image-0.1-Design;緊隨其後的開放權重模型是第 22 名、1,047 分的 Ideogram 4.0(Quality),第 31 名、1,018 分的 Ideogram 4.0,以及第 40 名、1,005 分的 HunyuanImage 3.0 Instruct

• UI/UX 切片榜首 — GPT Image 2.5 Flare (max) 為 1,226 分,GPT Image 2.5 Sunburst (max) 為 1,215 分,GPT Image 2 (high) 為 1,204 分,Grok Imagine Image 2.0 為 1,183 分

• 對照廠商自家提供的截圖 — inclusionAI 公布 Ming 為 1,082,Ideogram 4.0(Quality)為 1,052,FLUX.2 [dev] 為 1,000;而目前的即時切片則分別顯示為 1,084、1,047 與 1,000

所以這個標題就其本身而言是準確的。Ming-Image-0.1-Design 是 UI/UX 設計類別中評分最高的開放權重模型,也是該類別前二十名中唯一的開放權重模型。它在該類別中落後領先者 142 Elo,而當提示詞不是設計提示詞時,它則處於中游。一個在儀表板上勝出、總體得分為 995 的模型是專才,不是通才,而這兩個數字只有在你把其中一個當成全部故事來讀時才會互相矛盾。

完整排行榜上的 21,342 個樣本,也值得就其「並非什麼」加以注意。那是很大的投票數,因此信賴區間才會緊縮在 ±8 Elo,但樣本數不等同於方法上的獨立性。這個競技場是盲測的人類偏好,所以 inclusionAI 沒有人寫出這個分數——那部分是真實的。這個分數衡量的是「投票者更偏好這兩張圖片中的哪一張」,而被要求評判 UI 螢幕截圖的投票者,往往會獎勵清晰易讀的文字與連貫的版面。那正是這個模型受訓所依據的軸線。

Screenshot of the Artificial Analysis Text to Image Leaderboard captured 24 September 2026, cropped to the lower rows. Ming-Image-0.1-Design is row 45, creator InclusionAI, with an Elo of 995, row range 39-50, 21,342 samples, a September 2026 release and $30.0 per 1k imgs, carrying the Open Weights badge. Neighbouring rows include P-Image-Ideogram (High) at 44 and 995, Cosmos3-Super-Text2Image (agentic) at 46 and 994, and Ideogram 4.0 at row 38 and 1,004, also Open Weights.

Ming-Image-0.1-Design 是什麼

Ming-Image-0.1-Design 是 inclusionAI 推出的文字生成圖像模型,該 AI 實驗室與螞蟻集團有關,以 MIT 授權條款發布,權重於 2026 年 9 月 17 日公布,完整發布套件則於 9 月 22 日上線。它只憑提示詞就能生成——無需參考圖像——而且它鎖定的是文字密集的平面設計,而非攝影:UI 模擬圖、儀表板、資訊圖表、海報,以及任何算繪文字必須在實際閱讀尺寸下保持清晰可辨的內容。

文件記載的推論組態很具體,而且每一步的開銷異常低廉:

• 解析度 — 建議使用 2048 x 2048,或使用 1024 x 1024 以加快生成速度;中間尺寸會對齊至這兩個級距之一

• 取樣步數 — 12

• 指引 — CFG 比例 1.0

• 精度 — BF16

• 硬體 — 一張具備 80 GiB VRAM 的 CUDA GPU,被描述為經驗證的組態

在引導尺度為 1.0 時只需十二步,是蒸餾式或無引導取樣器的招牌特徵。這正是讓 2048 像素輸出能在大多數擴散模型不會嘗試的步數下仍可負擔的原因,也是這個模型對任何大量執行圖像生成、而非一次只生成一張圖的人來說很有意思的主要理由。

另一個結構性特點是透明度。Ming-Image-0.1-Design 能輸出原生 RGBA,因此當提示詞以其中一個已記載的透明度片語開頭時,透明背景會直接來自取樣器,而非來自去背處理。搭配的模型 Ming-Image-0.1-Design-Layer 更進一步:它接收扁平化的設計加上圖層規劃,並回傳各自獨立的 RGBA PNG——文字、卡片、主體、背景——這些圖層可重新合成為原始設計。這就是設計模型與圖像模型之間的差異。扁平 PNG 是一張版面配置的圖片;獨立圖層則是仍可編輯的版面配置。

Screenshot of the inclusionAI/Ming-Image-0.1-Design model card on Hugging Face, captured 24 September 2026. The header shows 188 likes, 3,067 followers, tags including text-to-image, difusers, safetensors, image-generation, graphic-design, text-rendering and License: mit, and a safetensors panel reading Model size 6B params, Tensor type BF16. The card's UI/UX Design leaderboard image is embedded in the body, showing Ming-Image-0.1-Design first at 1,082 above Ideogram 4.0 (Quality) at 1,052 and FLUX.2 [dev] at 1,000. The right rail states 'This model isn't deployed by any Inference Provider', and the Quick Start block shows the infer.py command with --resolution 2048 and a note that prompt enhancement can use Ling-3.0-flash-VL or qwen3.8-27B.

6B 標籤與 26B 下載

「6B」對大多數人所指的部分是準確的,但對於決定你能不能運行它的部分則有誤導性。這個擴散 Transformer 有 6.15B 個參數。你實際下載的套件大約是 52.88 GB,因為多模態文字編碼器有 17.01B 個參數,而連接器又增加了 3.09B——在 BF16 下總共約 26B 個參數。Layer 模型的 Transformer 是基礎模型的兩倍,達到 12.31B,其套件又更大,約為 65.20 GB。

這在兩個實際層面上很重要。首先,80 GiB 的 VRAM 需求並不是關於 6B transformer;而是關於必須與它一同常駐的所有東西。其次,任何與被描述為「6B」的模型進行的比較,都需要確認指的是哪一個 6B。一個配備 20B 文字編碼器的 6B 擴散 transformer,與一個端到端都是 6B 的模型相比,是截然不同的部署問題。

提示處理是這張卡片明確揭示、而非藏起來的另一件事:建議的配方會先執行一個改寫步驟,用視覺語言模型把簡短的提示擴充成結構化、Figma 風格的 JSON 版面描述,包含座標、階層、色彩規格與逐字文字。模型卡點名由 Ling-3.0-flash-VL 或 Qwen3.8-27B 擔綱這項工作。換句話說,廠商拿來跑基準測試的管線是雙模型管線。如果你只用一行提示、不經改寫步驟就呼叫 Ming-Image-0.1-Design,那你跑的根本不是那個在 UI/UX 項目上產出 1,084 分的配置。

這讓設計流程處於何種境地

Ming-Image-0.1-Design 的誠實總結是:它解決了一個特定且昂貴的問題——生成經得起仔細檢視的文字密集版面——並且在衡量該問題的唯一排行榜上,位居開放權重領域之首。它並未領先整體圖像排行榜,並未消除在其前面放置 VLM 的需求,而且需要強大的 GPU。

它改變的是設計工作流程的中段。如果你的管線目前產生一張平面影像,然後付錢請人工或分割模型把它切開,那麼一個原生輸出 RGBA 的模型,加上一個能輸出 2–9 個具名圖層的配套工具,就能省去一個階段。那比一個 Elo 欄位更有價值,而且那是沒有任何排行榜會衡量的部分。

對於想在不必投入基礎架構的前提下先行測試的團隊,這個分野值得說得精確一點。Ming-Image-0.1-Design 是以 MIT 授權提供的下載項目,所以它只在你的硬體上執行,否則就完全跑不起來——OrcaRouter 不路由任何版本的 inclusionAI 模型,若有相反的說法,那是我們無法兌現的承諾。路由層真正能給你的,是周邊的那一層面向:一個相容 OpenAI 的端點,涵蓋 200 多個模型、跨供應商的自動容錯移轉,以及以 0% 加價直接傳遞的供應商定價,因此你所呼叫的任何模型若有廠商調價,我們這邊當天就會同步生效。如果你正著手建立設計流程,想將這個模型與你已經信任的託管模型做 A/B 比較,那麼這項比較只需要一把金鑰,而不是兩份合約。

A rendered summary card headed 'The two numbers' and titled 'One model, two readings', listing five figures: Overall Text to Image board #45, Elo 995, 95% CI 8, 21,342 samples; UI/UX Design slice #16, Elo 1,084, 2,100 samples in the slice; open-weights standing in that slice #1, next is Ideogram 4.0 (Quality) at #22 and 1,047; leader of the same slice GPT Image 2.5 Flare (max), Elo 1,226, a 142-point gap; board-listed API pricing $30.00 per 1,000 images, flagged Open Weights.

什麼會改變局面?

有三件事能讓 Ming-Image-0.1-Design 從一個強大的開放權重專門模型,變成預設選擇。首先是對 Layer 模型的 Crello 數據進行首次獨立復現——模型卡上記載在 1024 下 RGB L1 誤差為 0.0574、alpha soft IoU 為 0.8923,而目前沒有任何外部團隊跑過這些數據。一個能免除 80 GiB 需求的託管端點。以及第二個使用案例切片,讓模型在其中表現得跟在 UI/UX Design 中一樣好,因為只在一個排行榜的某個切片上勝出的模型,其通用性仍未獲得證明。

在那之前,準確的說法是那個狹義的句子:在 Artificial Analysis 的 UI/UX 設計切片上,讀取日期為 2026 年 9 月 24 日,inclusionAI 的 Ming-Image-0.1-Design 是評分最高的開放權重文生圖模型,在 2,100 票下取得 1,084 Elo——而在同一個競技場的完整榜單上,它則以 995 分名列第 45 名。這兩者都是這個模型。它們都不是發布宣稱,因為這個模型並沒有發布;它有的是一個儲存庫。