比較 Ming-Image-0.1-Design 與 Qwen-Image 2.1 的標題卡,副標題說明授權條款與硬體費用決定選擇,其中一張卡寫著較寬鬆的授權條款,另一張寫著較嚴格的授權條款。
Guides & Insights

Ming-Image-0.1-Design 對比 Qwen-Image 2.1:授權才是真正的差異

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩個開放圖像模型在 2026 年 9 月相隔三天推出,若只看規格表,它們看起來像是同一筆採購。 Ming-Image-0.1-Design由 Ant Group 的 inclusionAI 團隊打造,於 9 月 17 日在 MIT 授權條款下將其權重放上 Hugging Face。 Qwen-Image 2.1則來自 AlibabaQwen 團隊,於 9 月 20 日依 Qwen Research License Agreement 推出。兩者都原生輸出 RGBA、都宣稱 2K 輸出,且都鎖定同一種買家:一個希望能自行託管、檢查與修改其圖像生成的團隊。真正區分兩者的兩件事,正是規格表最不擅長呈現的兩件事——你依法能用生成結果做什麼,以及產出一張圖需要多少晶片算力。

這不是什麼修辭性的說法。對其中一個模型而言,授權是商業使用上的硬性阻礙;對另一個模型而言,這根本不成問題。而每家廠商印在盒上的參數量,都把實際下載規模低報成三分之一到四分之一。這兩項事實遠早於任何基準測試就決定了購買與否——而說來也巧,這些基準測試根本無法互相比較。

每個儲存庫實際上包含什麼

這兩個模型都不是單一網路。兩者都是管線,而規模正是存在於管線之中:

• 生成器 — Ming-Image-0.1-Design 推出了一款 6.15B 參數的設計 Transformer(BF16 格式下為 12.31 GB);Qwen-Image 2.1 推出了一款 7.1B 的單流 DiT,具有 32 層、區塊因果注意力,以及未公開的活躍參數數量(約 14.2 GB)。

• 文字端 — Ming-Image-0.1-Design 將其 transformer 搭配 17.01B 多模態 LLM(34.02 GB)與 3.09B 連接器(6.17 GB);Qwen-Image 2.1 則採用 Qwen3-VL 8B 文字編碼器(約 17.5 GB)。

• 總參數量 — Ming-Image-0.1-Design 為 26.44B,而 Qwen-Image 2.1 約為 15–16B。請注意,兩家廠商對外主打的那個數字都不是總參數量:「6B」和「7B」都只描述生成器。

• 儲存庫大小 — Ming-Image-0.1-Design 為 52.88 GB(其中 49.25 GiB 是權重);Qwen-Image 2.1 則約為 33 GB。

• 透明度 —— 兩者皆直接從模型輸出原生 RGBA,而非透過事後去背步驟。Ming-Image-0.1-Design 使用自家的 RGBA VAE;Qwen-Image 2.1 則使用具備 16× 空間壓縮的 64 通道 RGBA VAE。

• 預設生成 — Ming-Image-0.1-Design 已在 2048×2048、12 步、BF16、CFG 1.0 下驗證;Qwen-Image 2.1 預設為 2048×2048、40 步,並提供七種長寬比預設。

• 授權條款 — Ming-Image-0.1-Design 採用 MIT;Qwen-Image 2.1 則適用 Qwen 研究授權協議,非商業性。

「6B」這個標籤可謂身負重任

螞蟻集團的儲存庫以一個 60 億參數模型為題,而這個 transformer 確實有 6.15B。但你下載的權重是 49.25 GiB,儲存庫是 52.88 GB,而供應商驗證過的配置——在 BF16 下 2048×2048,且完整文字堆疊常駐——所指定的目標是一張 80 GiB 的 CUDA GPU。那不是 48 GB 顯示卡上的捨入誤差;那是一張你根本無法使用的卡。48 GB 加速器放不下這條管線,兩張也不行,除非使出供應商未記載的卸載花招。

Qwen-Image 2.1 是較寬容的下載選擇,但要注意 Alibaba 完全沒有公布 任何官方 VRAM 數據。模型卡上唯一的指引,是在較小的顯示卡上啟用 CPU 卸載。自推出以來實際測量到的數據,比已公布的資訊更有用:int8 管線總共約佔用 16 GiB,且能完整常駐於 24 GB 顯示卡;而完整 BF16 執行則有回報指出,從搭配 CPU 卸載時約 17 GB,到在 1024×1024 下峰值約 40 GiB,端看文字編碼器如何配置。回報的單張影像延遲,從 B200 上的幾秒到目前工作站顯示卡上的不到十秒不等。請把這些數字全都當成社群測量值,而非官方規格——它們因卸載策略而變動的幅度,比這些模型彼此之間的差異還大。

實用總結:如果你願意進行卸載(offload),Qwen-Image 2.1 是 3090 等級的模型;Ming-Image-0.1-Design 則是資料中心等級的模型,沒有更小的組態。

許可證就是這條路上的分岔口。

這是真正會讓專案停擺的部分,也是這兩個發行版處理方式差異最大的部分。

Ming-Image-0.1-Design 採用 MIT 授權。將它放進付費產品、對它進行微調、重新散布權重、讓你的變更保持閉源——這些都不需要與 Ant Group 進行任何對話。

Qwen-Image 2.1 則不是。它採用的是日期為 2026 年 9 月 20 日的 Qwen Research License Agreement(Qwen 研究授權協議),該協議僅授權將權重用於研究與評估。商業使用需另行與阿里巴巴簽訂協議,而該協議的價格並未公開。衍生作品與再散布必須附上授權條款、「Built with Qwen」或「Improved using Qwen」標示,以及杭州通義實驗室的著作權聲明,且「Qwen」不得作為衍生模型的主要名稱。本授權受中國法律管轄,並以杭州為管轄地。

供應商本身提供的後續說明中,有一點確實具有釐清作用:阿里巴巴已表明,生成的圖像不屬於授權的「Materials」的一部分,因此你仍保有模型所產出內容的權利。這項限制附著於權重與模型本身,而非你的輸出。這是一項有意義的除外條款,值得精確解讀,因為那個簡單的總結——「圖像是你的,模型不是」——正是正確的。

這也是一次方向轉變。較早的 Qwen-Image 發行版,包括最初的 Qwen-Image 以及 2511 和 2512 版本,仍維持 Apache 2.0 與商業寬鬆授權。一個去年因為其授權而選擇 Qwen-Image、並在本月升級到 2.1 的團隊,會繼承一項它從未同意的僅限研究用途限制。如果寬鬆條款是必要條件,Qwen-Image 2.1 就不是你原本所用版本的新版——而是一筆不同的交易。

每一個的設計用途是什麼

授權條款的分野反映的是意圖上的差異,而當兩者對你而言都是合法的選項時,正是這項差異應該主導你的選擇。

Ming-Image-0.1-Design 是一款設計工具。文字堆疊的存在,是為了把簡短的 brief 擴展成 8K 的結構化提示詞,而廠商圍繞它推出「技能」——一個能在約 15 秒內產出視覺草稿的 Design Skill,以及一個鎖定投影片形式輸出的 PPT Skill。它的配套儲存庫 Ming-Image-0.1-Design-Layer 能把扁平化的設計還原成一個個獨立圖層,這是這裡唯一一項開放領域中其他方案都提供不了的能力。inclusionAI 回報,Layer 模型在相同工作上跑起來約比一個 20B 開放圖層模型快 4.3 倍(183 秒對 795 秒)——此為廠商自行回報、未經重現,而且比較對象的指名不夠精確,無法查核。

Qwen-Image 2.1 是一款生成器兼編輯器。單一檢查點同時負責文字生圖與基於指令的編輯,單次編輯最多可接受 10 張參考圖片,並支援局部編輯,讓畫面其餘部分維持不變。它推出時即獲得 ComfyUI、Diffusers、vLLM-Omni、SGLang-Diffusion 與 LightX2V 的首日支援——這是 Ming-Image-0.1-Design 目前仍沒有的推論服務方案,因為它自家的服務指南指向的是 vLLM-Omni。

把這理解為分岔,而不是排名。如果任務是「從簡報產出分層、可編輯的設計資產」,Ming-Image-0.1-Design 是兩者中唯一能做到的。如果任務是「先生成,再依據參考素材反覆迭代編輯」,Qwen-Image 2.1 能在單一模型中完成,而 Ming-Image-0.1-Design 完全做不到。

這些基準測試無法比較,而這就是誠實的答案。

兩家供應商都有數字。這兩個數字不能彼此相鄰並列,任何這樣做的文章都是在捏造結果。

Ming-Image-0.1-Design 的證據來自一個 Artificial Analysis 排行榜:在 Text-to-Image Leaderboard 中篩選開放權重、針對 UI/UX Design 的榜單上排名第一,Elo 為 1,082,領先 Elo 1,052 的 Ideogram 4.0 Quality、1,015 的 Ideogram 4.0、1,005 的 HunyuanImage 3.0 Instruct,以及 1,000 的 FLUX.2 [dev]。該廠商也回報,在版面配置上勝率達 67.4%、複雜構圖達 67.0%、文字渲染達 66.7%,並在 Crello 的 12 項指標中全數排名第一。該排行榜是第三方工具,這使得 Elo 成為此處兩類證據中較強的一類;勝率與 Crello 的全面領先屬於廠商自行回報,應被解讀為宣稱。

Artificial Analysis Text-to-Image Leaderboard filtered to open weights on the UI/UX Design board, showing Ming-Image-0.1-Design first at Elo 1,082 above Ideogram 4.0 Quality at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and FLUX.2 dev at 1,000.

Qwen-Image 2.1 的證據是 Qwen-Image-Bench,這是由 Qwen 團隊打造的基準測試,而它在該測試中拿下 60.28 分,領先開源領域,超前於 59.82 分的 Nano Banana 2.0 與 59.65 分的 GPT Image 1.5。原始資料指出這項基準測試是由 Qwen 打造,而前三名彼此差距在 1 分以內——這個差距遠落在一個作者同時也是參賽者的基準測試的雜訊範圍內。

所以:一個針對 UI/UX 設計子集的第三方 Elo,對比廠商自建的通用分數。不同的衡量工具、不同的任務、不同的評審。沒有人發表過這兩個模型彼此正面對決的跑分結果,而且根據現有證據,也沒有人能做到。有用的解讀很狹窄,且值得直接講明——Ming-Image-0.1-Design 在設計工作方面有第三方佐證,Qwen-Image 2.1 在一般生成與編輯方面有廠商報告的優勢,而這兩種說法之間的重疊,比標題數字所暗示的更小。

將其中任一個放到端點上

目前 OrcaRouter 的型錄上還沒有這兩個模型。Ming-Image-0.1-Design 與 Qwen-Image 2.1 現階段都屬於自架方案:權重可供下載,部署指南也確實存在,但 GPU 得由你自己架起來,而 Ming 的情況還得動用 80 GiB 的 GPU。我們在此將它們列為開放權重發布,而非路由。

在你投入硬體之前,值得先知道的是:同樣的工作負載,改用呼叫方式會花你多少錢。我們的路由圖片模型包括 google/gemini-2.5-flash-imagegoogle/gemini-3-pro-image-previewgoogle/gemini-3.1-flash-image-preview、三個 Imagen 4.0 等級(fast、standard 與 ultra)、grok/grok-imagine-image,以及 GPT-Image 系列——openai/gpt-image-1、openai/gpt-image-1-mini、openai/gpt-image-1.5 與 openai/gpt-image-2。用為期一週的設計需求跑其中一個模型,就能讓你知道 Ming-Image-0.1-Design 的圖層輸出是否是你真正需要的功能,而成本僅是那張 80 GiB 顯示卡的一小部分;而且這會在你發現究竟會是授權還是 VRAM 成為阻礙之前就先讓你知道。當你真的要把自架模型移入正式環境時,同一個端點也正是路由所在之處——一把金鑰通行 200+ 個模型、供應商之間自動容錯移轉,以及 0% 加成,因此供應商一宣布降價,我們這邊當天就會同步生效。

The OrcaRouter model page for openai/gpt-image-2, one of the image models actually routable, showing the OpenAI-compatible base URL, the /v1/images/generations endpoint and per-million-token input and output pricing.

誰應該選哪個

選擇Ming-Image-0.1-Design,前提是交付物是設計資產而非圖片:圖層式輸出、結構化提示詞擴展、簡報版面形式的生成,以及可讓你販售用它做出任何東西的授權條款。為一張高階顯卡編列預算,並接受其周邊的服務生態系比 Qwen 陣營更單薄。如果你需要把數字攤在客戶面前,它也是兩者中較實用的一個,因為它最有力的證據是這項比較中唯一的第三方數據。

選擇 Qwen-Image 2.1,如果工作流程是先產生再編輯、如果你需要參考影像條件化,或者你想在已擁有的硬體上執行。它更小,在第一天就能獲得更好的支援,而且其授權條款適合大多數人實際上最先從事的 research 與評估工作。一旦產出涉及商業用途且法律審查是來真的,它就會變成錯誤的選擇,因為取得商業授權的唯一途徑是與 Alibaba 直接簽訂協議,而且沒有公開的價格可供規劃。

先兩者都別選——如果你這個月就需要在正式環境中做圖像生成的話。這兩者都是權重,而權重在成為一項能力之前,先是一筆硬體與法律上的承諾。設計問題——分層輸出是否會改變我的團隊能交付的東西——可以先在託管端點上取得答案,而該答案才應該決定那張 80 GiB 的顯示卡要不要買。

看什麼

有三件事會左右這場比較。Ming-Image-0.1-Design 能否取得自家 vLLM-Omni 指南以外的部署途徑,因為那正是它與 Qwen-Image 2.1 的五框架首日支援清單之間目前的落差。阿里巴巴是否會為商業版 Qwen 授權標上價格,因為未定價是這組配對中最大的單一未知數。以及是否有人——無論是實驗室、獨立評測機構,還是沒什麼好損失的廠商——會用相同的提示詞讓這兩者正面對決。在那之前,最接近公平比較的東西根本不是分數。而是授權條款那一行,而 Ming-Image-0.1-Design 在這一點上直接勝出。

Scoreboard comparing Ming-Image-0.1-Design and Qwen-Image 2.1 across weights release date, licence, generator size, total parameters, repository size, validated hardware, default generation, output format and headline benchmark, with a footer separating third-party from vendor-reported figures.