
Ming-Image-0.1-Design 對上 Qwen-Image 3.0:誰能讓你看到文字是如何被繪製出來的
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
最有趣的地方在於Ming-Image-0.1-Design並不在它的模型卡上,而是在推論框架的一筆提交裡。大約在 2026 年 9 月 17 日該模型悄悄上傳至 Hugging Face 前後,vLLM-Omni 合併了一項名為feat: 為 Ming 新增 byte5 支援的變更,將 ByT5 字形編碼器接入一個全新的 ming_flash_omni 管線——這是一個專門元件,其全部工作就是檢視你要求渲染的字元,而不是你要求的圖片。這正是只能透過閱讀程式碼才能發現的那種細節,而這也正是Qwen-Image 3.0——該廠商的封閉式託管圖像模型,於 2026 年 7 月 21 日推出、8 月 5 日全面開放——完全不讓任何人讀到的細節。這兩款模型都瞄準設計工作,而清晰易讀的文字正是難點所在。只有其中一款會告訴你它是如何做到的。
它們各自對文字的說法
Qwen-Image 3.0 的文字渲染敘事完全是發表時的宣稱,而在紙面上這確實是個很漂亮的宣稱。阿里巴巴的資料描述提示詞可達約 4,500 個 token、文字在低至約 10 像素時仍清晰可辨、涵蓋 12 種語言與超過 20 種字體、輸出最高可達 2048×2048,且每次呼叫最多可產生六張影像,並透過單一託管 API 以 Pro 與 Standard 版本提供。目前沒有釋出權重、沒有載明授權、沒有模型卡、沒有技術報告,也沒有任何已發布的基準測試表可供對照查核這一切。被廣泛引述的約 200 億 MMDiT 參數數字是報導所述,而非已獲確認。
Ming-Image-0.1-Design 的故事是一個儲存庫。6,154,901,056 個參數,MIT 授權,一個diffusers 管道標籤,所有權重皆為 BF16 safetensors,總計約 71.5 GB,分佈於 connector/、mllm/、mlp/、scheduler/、transformer/ 與 vae/。建議推論為在單張 80 GiB CUDA GPU 上以 12 個取樣步驟、guidance 設為 1.0 執行 2048×2048,或使用 1024 以提升速度;部署指定使用 vLLM-Omni,提示增強則指定使用另一個視覺語言模型。模型卡將其描述為適用於 UI、資訊圖表、海報及其他文字密集型視覺設計的文字轉圖像模型,並具備 RGBA 輸出以支援透明背景。
那兩段文字並不是同一類陳述,而箇中原因值得直說。其中一段是販售產品的人所寫的產品描述。另一段則是任何人都能下載並查核的產物描述。
字形編碼器是解釋類別的部分。
圖像模型中的文字渲染通常會以一種特定的方式失敗:模型生成出某種看起來像文字、實際上卻不是文字的東西。字形看似合理,詞卻是錯的。這首先是架構上的問題,然後才輪到其他因素——多數圖像模型沒有任何能將字元視為字元的元件,因此字體是從視覺統計資料中重建出來的,就和草叢一樣。
vLLM-Omni 的那個 commit 之所以有意思,正是因為它指向了這一點。新增的檔案——byte5_encoder.py、pipeline_ming.py、t5_block_mapper.py以及一個階段輸入處理器——描述了一條路徑:由 ByT5 位元組層級編碼器讀取應該出現在影像中的文字,分詞器詞彙表以字型與顏色標記加以擴充,而產生的特徵則沿著序列維度附加,負向那一側收到的是零。最後這個細節正是關鍵線索,說明這是真正的設計決策,而非單純的管線接線:如果負向分支帶有相同的字形特徵,無分類器引導就會被拉向渲染文字、而偏離提示詞,因此這些零的存在是為了避免這兩個目標相互衝突。編碼器只有在檢查點實際包含 byte5/ 子資料夾時才會載入。
兩點誠實的說明。這是第三方推論框架的提交,並非螞蟻集團的聲明,而對那些檔案含義的解讀是我們自己的,而非供應商的。而且它佐證的是設計意圖,而非結果:存在字形編碼器與良好的文字渲染相符,但這並非文字渲染良好的證據。唯一獨立的品質證據是單一的排行榜名次,將於下文討論。

與 Qwen-Image 3.0 的對比,並不在於 Alibaba 的模型把文字渲染得很糟——阿里巴巴以外沒有人能說它渲染文字的效果有多好,而這正是重點。重點在於,「這個模型如何描繪字母」這個問題,對其中一個模型而言有答案,對另一個而言則只是行銷宣稱;而答案與宣稱之間的落差,正是工程決策成形的地方。
那唯一的數字,以及它不在的那塊板子
Ming-Image-0.1-Design 在 Artificial Analysis 的 UI/UX 設計文字轉圖像排行榜(開放權重視圖)中排名第一,Elo 為 1,082——領先 Ideogram 4.0(Quality)的 1,052、Ideogram 4.0 的 1,015、HunyuanImage 3.0 Instruct 的 1,005、FLUX.2 [dev] 的 1,000、FLUX.2 [dev] Flash 的 999,以及 FLUX.2 [dev] Turbo 的 994。該排行榜的副本,正是重製於該模型自身卡片上的那一份,並且帶有 Artificial Analysis 的品牌標示;沒有人獨立重現過這個分數。
![The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.](https://cms.orcarouter.ai/api/media/file/3-1124.png)
這是個開放權重排行榜,因此 Qwen-Image 3.0 沒有上榜,而它的缺席完全不代表其品質優劣。它真正反映的是結構性問題:盲測偏好排行榜只能為權重公開的模型排名。這讓開放式發布在推出產品前幾個月,就能取得可衡量的位置;而對封閉式發布,則只給了一個行銷數字,別無其他。Qwen-Image 3.0 的宣稱——10 像素可讀性、4,500 token 提示詞、20 多種字體——背後完全沒有獨立量測支持。

你會如何實際測試這個,以及嘗試它需要付出什麼成本
如果清晰易讀的字體是你讀這篇文章的原因,那麼這項測試就不是排行榜。它用的是你自己的字體、你自己的語言和你自己的字串,讓兩個候選模型各自跑過一遍,並由真人來閱讀。那項測試需要其中一個模型容易取用且便宜,另一個則要能下載,而它們的定價原則正好相反。
• Qwen-Image 3.0 — Pro 版本每張圖片約 $0.04,Standard 版本約 $0.03,國內消費者定價則從每張約 ¥0.18 起。這些是發布時的數字,尚未經過審計。你今天下午就能跑一組提示詞矩陣,並按次付費。
• Ming-Image-0.1-Design — 沒有公佈價格,因為沒有代管端點。代價是一次 71.5 GB 的下載、一張 80 GiB 的顯示卡,以及你自己的時間;好處則是你可以把同一個測試指向字形編碼器路徑,看看是不是這個元件在做實際工作。
這正是路由層存在的意義所在,而值得精確說明的是其中哪一部分適用。Qwen-Image 3.0 與 Ming-Image-0.1-Design 都不在我們的平台上,因此路由層今天無法把其中任何一個放到金鑰後面。它能做的是在你實際跑測試時,讓比較保持誠實:OrcaRouter 以供應商定價、零加成,透過單一 OpenAI 相容端點提供 200 多個模型,並具備跨供應商的自動容錯移轉,因此你已經信任的模型可以守住正式生產路徑——而它的成本緊貼供應商定價,供應商一調價,當天就會反映在我們這邊——同時,未經實測的設計模型是在它旁邊接受評估,而不是擋在它前面。
兩個開放版本發佈、一個封閉版本,還有一個模式
值得注意的是,Ming 的發布除了本身之外,還證明了什麼。螞蟻集團在未作任何公告的情況下,以 MIT 授權發布了一個 615 億參數的設計模型,同時還發布了第二個用於圖層分解的模型,同樣採用該授權。阿里巴巴則發布了一個封閉的託管模型,沒有授權、沒有模型卡,也沒有報告,針對的是同一類工作,並按每張圖像計價。
這兩者是對設計模型的價值究竟落在何處的兩種不同押注。一種主張,模型就是產品,而權重則是經銷通路。另一種主張,模型是一項服務,而權重才是你真正留住的東西。這兩種押注在同一個市場裡都可能成立,但對於評估時唯一要緊的那個問題,會給出截然不同的答案:我能不能在依賴它之前,弄清楚它是怎麼運作的?
• 如果你需要知道文字是如何被渲染的,以及為何有時並非如此——Ming-Image-0.1-Design 是兩者中唯一讓你能夠查看的,而 MIT 授權條款意味著你可以依據所發現的內容採取行動。
• 如果你今天就需要一個按每張圖片計價、且無須自建基礎架構的正式上線端點,那麼 Qwen-Image 3.0 是這兩者中唯一提供這種端點的,而且它的內部細節也是這個價格的一部分。
• 如果你在投入之前需要獨立證據——這兩者都沒有足夠的證據。一個只有單一、未經重現的排行榜名次;另一個則是一份沒有附上任何數字的廠商宣稱文件。
值得觀察的是這個模式是否持續。MIT 一項未經宣布的發布,裡面帶有字形編碼器,是在表明其作者預期模型會如何被使用——被檢視、在本機執行、修改。如果同一團隊的下一次發布有公告、經過基準測試並有代管,那就是一次性特例。如果那又是另一個悄無聲息的儲存庫,設計模型類別就多了一個開放競爭者,而市場的封閉那一半則有了它在七月還沒有的價格問題。
