為「Ming-Image-0.1-Design 對決 Qwen-Image 3.0」製作的主視覺標題卡,副標題為「誰讓你看到文字是如何被繪製出來的。」,對比 Ming-Image-0.1-Design(6.15B 參數、MIT 授權、可讀取的權重,2026 年 9 月 17 日發布)與 Qwen-Image 3.0(封閉式託管模型、參數量未公開、無授權或報告,2026 年 8 月 5 日正式發布),並在右下角放置 OrcaRouter 標誌。
Guides & Insights

Ming-Image-0.1-Design 對上 Qwen-Image 3.0:誰能讓你看到文字是如何被繪製出來的

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

最有趣的地方在於Ming-Image-0.1-Design並不在它的模型卡上,而是在推論框架的一筆提交裡。大約在 2026 年 9 月 17 日該模型悄悄上傳至 Hugging Face 前後,vLLM-Omni 合併了一項名為feat: 為 Ming 新增 byte5 支援的變更,將 ByT5 字形編碼器接入一個全新的 ming_flash_omni 管線——這是一個專門元件,其全部工作就是檢視你要求渲染的字元,而不是你要求的圖片。這正是只能透過閱讀程式碼才能發現的那種細節,而這也正是Qwen-Image 3.0——該廠商的封閉式託管圖像模型,於 2026 年 7 月 21 日推出、8 月 5 日全面開放——完全不讓任何人讀到的細節。這兩款模型都瞄準設計工作,而清晰易讀的文字正是難點所在。只有其中一款會告訴你它是如何做到的。

它們各自對文字的說法

Qwen-Image 3.0 的文字渲染敘事完全是發表時的宣稱,而在紙面上這確實是個很漂亮的宣稱。阿里巴巴的資料描述提示詞可達約 4,500 個 token、文字在低至約 10 像素時仍清晰可辨、涵蓋 12 種語言與超過 20 種字體、輸出最高可達 2048×2048,且每次呼叫最多可產生六張影像,並透過單一託管 API 以 Pro 與 Standard 版本提供。目前沒有釋出權重、沒有載明授權、沒有模型卡、沒有技術報告,也沒有任何已發布的基準測試表可供對照查核這一切。被廣泛引述的約 200 億 MMDiT 參數數字是報導所述,而非已獲確認。

Ming-Image-0.1-Design 的故事是一個儲存庫。6,154,901,056 個參數,MIT 授權,一個diffusers 管道標籤,所有權重皆為 BF16 safetensors,總計約 71.5 GB,分佈於 connector/mllm/mlp/scheduler/transformer/vae/。建議推論為在單張 80 GiB CUDA GPU 上以 12 個取樣步驟、guidance 設為 1.0 執行 2048×2048,或使用 1024 以提升速度;部署指定使用 vLLM-Omni,提示增強則指定使用另一個視覺語言模型。模型卡將其描述為適用於 UI、資訊圖表、海報及其他文字密集型視覺設計的文字轉圖像模型,並具備 RGBA 輸出以支援透明背景。

那兩段文字並不是同一類陳述,而箇中原因值得直說。其中一段是販售產品的人所寫的產品描述。另一段則是任何人都能下載並查核的產物描述。

字形編碼器是解釋類別的部分。

圖像模型中的文字渲染通常會以一種特定的方式失敗:模型生成出某種看起來像文字、實際上卻不是文字的東西。字形看似合理,詞卻是錯的。這首先是架構上的問題,然後才輪到其他因素——多數圖像模型沒有任何能將字元視為字元的元件,因此字體是從視覺統計資料中重建出來的,就和草叢一樣。

vLLM-Omni 的那個 commit 之所以有意思,正是因為它指向了這一點。新增的檔案——byte5_encoder.pypipeline_ming.pyt5_block_mapper.py以及一個階段輸入處理器——描述了一條路徑:由 ByT5 位元組層級編碼器讀取應該出現在影像中的文字,分詞器詞彙表以字型與顏色標記加以擴充,而產生的特徵則沿著序列維度附加,負向那一側收到的是零。最後這個細節正是關鍵線索,說明這是真正的設計決策,而非單純的管線接線:如果負向分支帶有相同的字形特徵,無分類器引導就會被拉向渲染文字、而偏離提示詞,因此這些零的存在是為了避免這兩個目標相互衝突。編碼器只有在檢查點實際包含 byte5/ 子資料夾時才會載入。

兩點誠實的說明。這是第三方推論框架的提交,並非螞蟻集團的聲明,而對那些檔案含義的解讀是我們自己的,而非供應商的。而且它佐證的是設計意圖,而非結果:存在字形編碼器與良好的文字渲染相符,但這並非文字渲染良好的證據。唯一獨立的品質證據是單一的排行榜名次,將於下文討論。

A pipeline diagram titled "How the glyph encoder enters the pipeline", showing prompt text passing through a tokenizer extended with font and colour markers into a ByT5 glyph encoder whose features are appended along the sequence dimension, with the negative branch receiving zeros so guidance is not pulled away from rendered text, and the result emerging as an RGBA image.

與 Qwen-Image 3.0 的對比,並不在於 Alibaba 的模型把文字渲染得很糟——阿里巴巴以外沒有人能說它渲染文字的效果有多好,而這正是重點。重點在於,「這個模型如何描繪字母」這個問題,對其中一個模型而言有答案,對另一個而言則只是行銷宣稱;而答案與宣稱之間的落差,正是工程決策成形的地方。

那唯一的數字,以及它不在的那塊板子

Ming-Image-0.1-Design 在 Artificial Analysis 的 UI/UX 設計文字轉圖像排行榜(開放權重視圖)中排名第一,Elo 為 1,082——領先 Ideogram 4.0(Quality)的 1,052、Ideogram 4.0 的 1,015、HunyuanImage 3.0 Instruct 的 1,005、FLUX.2 [dev] 的 1,000、FLUX.2 [dev] Flash 的 999,以及 FLUX.2 [dev] Turbo 的 994。該排行榜的副本,正是重製於該模型自身卡片上的那一份,並且帶有 Artificial Analysis 的品牌標示;沒有人獨立重現過這個分數。

The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.

這是個開放權重排行榜,因此 Qwen-Image 3.0 沒有上榜,而它的缺席完全不代表其品質優劣。它真正反映的是結構性問題:盲測偏好排行榜只能為權重公開的模型排名。這讓開放式發布在推出產品前幾個月,就能取得可衡量的位置;而對封閉式發布,則只給了一個行銷數字,別無其他。Qwen-Image 3.0 的宣稱——10 像素可讀性、4,500 token 提示詞、20 多種字體——背後完全沒有獨立量測支持。

A two-column scoreboard titled "Ming-Image-0.1-Design vs Qwen-Image 3.0 - the scoreboard". Left column Ming-Image-0.1-Design: Weights downloadable, 6.15B; Licence MIT; Text rendering glyph encoder visible; Independent score Elo 1,082; Price self-host; Internals readable. Right column Qwen-Image 3.0: Weights none; Licence not published; Text rendering 10px claim, vendor-reported; Independent score none; Price about $0.04 per image; Internals black box. Footer reads "Qwen-Image 3.0 claims vendor-reported; Ming score per the Artificial Analysis board on its model card.", with the OrcaRouter logo bottom-right.

你會如何實際測試這個,以及嘗試它需要付出什麼成本

如果清晰易讀的字體是你讀這篇文章的原因,那麼這項測試就不是排行榜。它用的是你自己的字體、你自己的語言和你自己的字串,讓兩個候選模型各自跑過一遍,並由真人來閱讀。那項測試需要其中一個模型容易取用且便宜,另一個則要能下載,而它們的定價原則正好相反。

• Qwen-Image 3.0 — Pro 版本每張圖片約 $0.04,Standard 版本約 $0.03,國內消費者定價則從每張約 ¥0.18 起。這些是發布時的數字,尚未經過審計。你今天下午就能跑一組提示詞矩陣,並按次付費。

• Ming-Image-0.1-Design — 沒有公佈價格,因為沒有代管端點。代價是一次 71.5 GB 的下載、一張 80 GiB 的顯示卡,以及你自己的時間;好處則是你可以把同一個測試指向字形編碼器路徑,看看是不是這個元件在做實際工作。

這正是路由層存在的意義所在,而值得精確說明的是其中哪一部分適用。Qwen-Image 3.0 與 Ming-Image-0.1-Design 都不在我們的平台上,因此路由層今天無法把其中任何一個放到金鑰後面。它能做的是在你實際跑測試時,讓比較保持誠實:OrcaRouter 以供應商定價、零加成,透過單一 OpenAI 相容端點提供 200 多個模型,並具備跨供應商的自動容錯移轉,因此你已經信任的模型可以守住正式生產路徑——而它的成本緊貼供應商定價,供應商一調價,當天就會反映在我們這邊——同時,未經實測的設計模型是在它旁邊接受評估,而不是擋在它前面。

兩個開放版本發佈、一個封閉版本,還有一個模式

值得注意的是,Ming 的發布除了本身之外,還證明了什麼。螞蟻集團在未作任何公告的情況下,以 MIT 授權發布了一個 615 億參數的設計模型,同時還發布了第二個用於圖層分解的模型,同樣採用該授權。阿里巴巴則發布了一個封閉的託管模型,沒有授權、沒有模型卡,也沒有報告,針對的是同一類工作,並按每張圖像計價。

這兩者是對設計模型的價值究竟落在何處的兩種不同押注。一種主張,模型就是產品,而權重則是經銷通路。另一種主張,模型是一項服務,而權重才是你真正留住的東西。這兩種押注在同一個市場裡都可能成立,但對於評估時唯一要緊的那個問題,會給出截然不同的答案:我能不能在依賴它之前,弄清楚它是怎麼運作的?

• 如果你需要知道文字是如何被渲染的,以及為何有時並非如此——Ming-Image-0.1-Design 是兩者中唯一讓你能夠查看的,而 MIT 授權條款意味著你可以依據所發現的內容採取行動。

• 如果你今天就需要一個按每張圖片計價、且無須自建基礎架構的正式上線端點,那麼 Qwen-Image 3.0 是這兩者中唯一提供這種端點的,而且它的內部細節也是這個價格的一部分。

• 如果你在投入之前需要獨立證據——這兩者都沒有足夠的證據。一個只有單一、未經重現的排行榜名次;另一個則是一份沒有附上任何數字的廠商宣稱文件。

值得觀察的是這個模式是否持續。MIT 一項未經宣布的發布,裡面帶有字形編碼器,是在表明其作者預期模型會如何被使用——被檢視、在本機執行、修改。如果同一團隊的下一次發布有公告、經過基準測試並有代管,那就是一次性特例。如果那又是另一個悄無聲息的儲存庫,設計模型類別就多了一個開放競爭者,而市場的封閉那一半則有了它在七月還沒有的價格問題。