主視覺標題卡寫著「Ming-Image-0.1-Design」,副標題為「一個 6B 設計模型,在沒有任何公告、只有一個失效連結的情況下推出」,並有兩張卡片分別寫著「儲存庫中有:MIT 授權、2048 x 2048 輸出、12 個取樣步驟、一張 80 GiB GPU」以及「儲存庫中沒有:公告、API,或可用的快速入門」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Ming-Image-0.1-Design 悄然發布:一個只存在於儲存庫、別無他處的 6B 設計模型

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

有一個名為 Ming-Image-0.1-Design的 6B 文字轉圖像模型,座落於 inclusionAI 在 Hugging Face 上的組織中,而截至 2026 年 9 月 23 日,關於它幾乎沒有其他任何資訊存在。該儲存庫建立於 9 月 17 日,權重於同日上線,模型卡則於 9 月 22 日被改寫——五天內共三次提交,全部來自同一個帳號,沒有廠商部落格文章、沒有發布說明、在任何 API 平台上都沒有模型頁面,下載計數器仍顯示為零。這就是從外部看來的一次安靜發布:一個完整的產物,卻沒有任何公告。因此,本文是一份盤點,記錄該儲存庫說了什麼、它昨天有什麼變更,以及哪些部分仍無法驗證——不是評論,因為 inclusionAI 之外還沒有人發表過這個模型的任何數字。

儲存庫實際包含的內容

該卡片將 Ming-Image-0.1-Design 描述為一款 6B 的文字生成圖像模型,適用於 UI、資訊圖表、海報及其他文字密集的視覺設計,能生成完整的視覺構圖,並支援帶透明背景的 RGBA 輸出。對於如此新穎的模型而言,其中介資料的授權條件異常寬鬆:MIT 授權、diffuserssafetensors、pipeline 標籤 text-to-image,以及涵蓋圖像生成、平面設計、文字算繪與 RGBA 的標籤。

建議的推論設定夠具體,足以派上用場:

• 解析度 — 建議 2048 x 2048,或使用 1024 x 1024 以加快生成速度

• 取樣步數 — 12

• CFG 比例 — 一點零

• 精度 — BF16

• 硬體 — 一張具有 80 GiB VRAM 的 CUDA GPU,並被描述為已驗證的配置

在引導尺度為 1.0 的情況下執行十二步,是蒸餾式或無引導取樣器的典型特徵:每張影像的運算成本低廉,而這正是這張卡能在多數擴散模型不會嘗試的步數下提供 2048 像素輸出的原因。這張卡也指出,公開的推論程式碼會把文字生圖的解析度要求對應到所支援的 1024 或 2048 分桶,因此介於兩者之間的尺寸會被吸附到這兩者之一。

檔案樹比文字說明透露得更多一些。除了 vaescheduler 之外,還有一個 transformer 資料夾,內含五個權重分片,另外還有獨立的 mllmconnectormlp 元件——這是一個多階段管線的樣貌,以多模態語言模型作為文字編碼器,而非單一的整體式去噪器。這與卡片的說明一致:提示增強可由 Ling-3.0-flash-VL 或 qwen3.8-27B 處理,兩者都是同一組織的兄弟模型。

於 9 月 22 日合併的三個提交

這是這個故事中唯一帶有過去一週內時間戳的部分,也是這個模型值得現在、而非等到十月才來撰寫的原因。提交標題依序如下:

• 9月22日 11:25 UTC —「發布 Ming-Image-0.1-Design 發行套件」

• 9月22日 12:01 UTC —「更新 Ming-Image-0.1-Design 模型卡」

• 9月22日 15:17 UTC — 「新增 vLLM-Omni 部署連結」

前兩項是例行公事。第三項才是實質變更:一個並非廠商自家的框架採用了這個模型,而模型卡現在建議透過 vLLM-Omni 來部署它,並附上 recipe 與安裝指南的連結。這是標準訊號,代表模型已從「擺在架上的權重」變成「團隊真的能架設在端點後方來用的東西」,而這種變更從來不會產生新聞稿。

它也處於半完成狀態。安裝指南連結可以正常開啟。同一個 commit 中針對此模型的 recipe 路徑則不行——截至 9 月 23 日會傳回 404。因此 Ming-Image-0.1-Design 目前的部署情況是:通用框架確實存在,但其中針對這個模型的說明仍只是佔位符。如果你打算部署它,請預留時間自行閱讀 vLLM-Omni 快速入門,並自行釐清模型接線。

卡片中的排行榜,以及它不在的那個排行榜

此儲存庫隨附一張效能圖表:assets/uiux_leaderboard.webp,這是一張排行榜風格的圖片,標題為「文字轉圖像排行榜:UI/UX 設計」,底部標示著「來自我們 Image Arena 中盲選偏好投票的 Elo 分數」,並帶有「開放權重排行榜」徽章。在圖中,Ming-Image-0.1-Design 以 1,082 Elo 位居第一,領先 1,052 的 Ideogram 4.0 (Quality)、1,015 的 Ideogram 4.0、1,005 的 HunyuanImage 3.0 Instruct,以及介於 994 與 1,000 之間的 FLUX.2 dev 變體。

關於那張圖片,有三件事必須說,而且順序很重要。

首先,這是廠商在其自有儲存庫中發布的藝術作品。我們是在報導該檔案的內容,並非為其背書。

其次,我們在9月23日的 Artificial Analysis 即時排行榜上,到處都找不到 Ming-Image-0.1-Design——不論是文生圖排行榜、UI/UX 設計分類檢視、圖像編輯排行榜,還是開放權重檢視,都找不到。即時 UI/UX 設計分類的榜首是 GPT Image 2.5 Flare,Elo 為 1,227;而該卡片所列的 FLUX.2 項目在同一份即時排行榜上出現的數值卻不同:FLUX.2 [flex] 為 1,065、FLUX.2 [max] 為 1,053、FLUX.2 [dev] 為 1,000。因此,該卡片的排名是針對一個我們找不到的排行榜所提出的說法,而且其所用的量表比我們能找到的那個低了約 150 Elo。

第三,Elo 是依各排行榜分別計算的。即使是同一個模型,特定類別的 UI/UX 分數與一般文字轉圖像分數也是不同的量值,這就是為什麼同一個 FLUX.2 版本在一個 Artificial Analysis 排行榜上顯示為 1,026,在另一個上卻是 1,065。任何混合不同排行榜的比較都稱不上是比較。

總結立場:Ming-Image-0.1-Design 有一項效能宣稱,那是供應商自己的說法,且不存在任何獨立評估。這不是指控。這正是為什麼在任何人依據 1,082 編列預算之前,該模型需要一次外部實測。

你目前還不能用它做什麼

問題就出在快速入門。它指示你複製 github.com/inclusionAI/Ming-Image、安裝其相依套件,並 infer.py 以 Hugging Face 模型 ID 執行。該儲存庫不存在。該頁面傳回 404,原始 README 也傳回 404,而且沒有任何 Ming-Image 儲存庫出現在該組織的公開儲存庫清單中——清單中確實有 Ming、Ling、Ring、Ming-UniVision、Ming-UniAudio 以及其他十幾個,所以這是根本不存在的缺漏,而不是打錯的 URL。執行 Ming-Image-0.1-Design 的唯一有文件記載路徑,就是那條不存在的路徑。

其餘的存取情況同樣單薄。模型卡將 inference: false,而 Hugging Face 也回報該模型並未由任何推論服務供應商部署。既沒有公開定價,也沒有 API 識別碼,沒有 playground,除了權重本身採用的 MIT 授權外,也沒有任何商業條款。下載次數為零,按讚數為四。

所以,關於可用性的誠實總結是:權重是真實存在且以寬鬆授權釋出的,而圍繞它們的一切——程式碼、文件、託管、評估——要嘛付之闕如,要嘛只是空殼。

決定誰可以使用它的數字

八十 GB 的 VRAM 就是全部的論點所在。那是一張 H100 或 H200 等級的顯卡,或是一張 A100 80GB。它不是工作站 GPU,不是筆電,也不是你忘了終止的 spot instance。結合經過驗證的單 GPU 配置,這意味著 Ming-Image-0.1-Design 授權免費但運行昂貴,而這正是來自大規模訓練實驗室的開放權重發布的熟悉樣貌。

為求我們這邊的完整性:目前沒有任何 inclusionAI 模型可透過 OrcaRouter 路由。我們在 9 月 23 日查看時,目錄頁列出了 15 家供應商共 199 個模型,其中沒有任何 Ming 項目,也沒有任何形式的 inclusionAI 項目,所以這裡沒有東西可以透過我們呼叫。在這種情況下,路由層真正的價值在於第二步——當上游供應商採用該模型的那一天,試用它會變成在你已經持有的金鑰上改個模型 ID,而不是新合約和新 SDK。在那之前,要執行 Ming-Image-0.1-Design 的唯一方法,就是找到那個失蹤的儲存庫,以及一台還有 80 GiB 可用空間的 GPU。

The UI/UX Design leaderboard image published in the Ming-Image-0.1-Design repository. It is headed 'Text to Image Leaderboard: UI/UX Design' with the footer 'Elo scores from blind preference votes in our Image Arena' and an 'Open Weights Leaderboard' badge. Ming-Image-0.1-Design is listed first at 1,082 Elo, above Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005, FLUX.2 [dev] at 1,000, FLUX.2 [dev] Flash at 999, FLUX.2 [dev] Turbo at 994 and HiDream-O1-Image at 987.The commit history page of the Ming-Image-0.1-Design repository on Hugging Face, captured 23 September 2026, showing five commits: 'Add vLLM-Omni deployment links' and 'Refresh Ming-Image-0.1-Design model card' and 'Publish Ming-Image-0.1-Design release package' all dated 22 September, above 'Upload initial model' and 'initial commit' dated 17 September.

什麼能讓這變成一個故事?

四件事,依它們能告訴你多少資訊的程度由少到多排列。配套儲存庫出現,這會讓模型能如文件所述般運行。vLLM-Omni 的配方補齊,這會讓它無需猜測就能提供服務。有推論供應商將它上架,這會為它標上價格。還有一個獨立的 Elo,這會是關於這個模型、第一個不是來自訓練它的人的數字。

在至少其中一項落實之前,正確的姿態是狹窄且不光鮮的。如果你為 UI 與版面生成建置評估集,這些權重現在就值得拉取——MIT、6B、單一配置,以及低到足以讓數千個樣本可負擔的步數。如果你這一季需要在生產環境中使用圖像生成,Ming-Image-0.1-Design 不是候選者:沒有端點、沒有支援,也沒有第三方評分。而如果你正在關注 inclusionAI 這個組織,請注意它現在有了一個圖像模型,可與其語言和語音產品線並列;它是在沒有告知任何人的情況下發布這個模型的;而且從最初上傳到發布套件之間的兩週空檔,暗示那段靜默期是刻意為之。

The Artificial Analysis text-to-image leaderboard's UI/UX Design category view, captured 23 September 2026, showing GPT Image 2.5 Flare (max) first at 1,227 Elo with 1,287 samples and $210.7 per 1,000 images, GPT Image 2.5 Sunburst (max) second at 1,218, GPT Image 2 (high) third at 1,206, and Grok Imagine Image 2.0 fourth at 1,182. No Ming-Image-0.1-Design row appears anywhere on the board.