
Ming-Image-0.1-Design 對比 Nano Banana 2:你拿回的那一層
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
問問設計師,圖像生成之後哪裡出了問題,答案幾乎從來不是圖像本身,而是生成的圖像是扁平的。每個元素都跟其他元素焊死在一起,所以標題動不了、標誌換不了、背景改不了色,想改一個字就得從提示詞重新生成整張圖。 Ming-Image-0.1-Design由螞蟻集團 inclusionAI 團隊於 2026 年 9 月 17 日悄然以 MIT 授權條款發布,正是圍繞這個問題打造的:61.5 億個參數、原生 RGBA 輸出,以及一個能把扁平化設計還原成獨立圖層的配套儲存庫。 Nano Banana 2——廠商的 Gemini 3.1 Flash Image,自 2026 年 5 月 28 日起全面推出,如今可透過 google/gemini-3.1-flash-image-preview 進行路由——解決的是同一個問題的另一半,而這兩半之間的差異,決定了哪一個才該放進你的管線。
Nano Banana 2 真正擅長的是什麼,以及它的成本是多少
Google 的模型是那個有公開定價與實際上線實績的模型,而這兩點都值得明確指出,因為它們正是人們選擇它的原因。
• 價格 — 每張 1024×1024 圖片約 $0.067,2048×2048 為 $0.101,4K 則約 $0.151;批次模式約為這些數字的一半,而文字輸入則另計,每百萬個 token 為 $0.25。換算下來,每千張 2K 圖片約 $101,在你生成任何內容之前,就能精確預估到美元。
• 輸出 — 最高 4K,並提供比例預設,包括社群與橫幅格式所需的 1:4 和 1:8 等極端比例,且在五個角色與十四個物件之間具有 Google 回報的一致性。
• 來源溯源——每一項輸出都帶有 SynthID 浮水印,這是一項合規功能,而非品質功能,而且是法律審查會比設計審查更早提出詢問的那類事項。
• Grounding — 它可以在生成過程中搜尋網路,藉此處理依賴於它並未記住之事實的請求。
那些都不是什麼透明度的敘事。Nano Banana 2 回傳一張圖像,而圖像就是這項產出物的全部。

Ming-Image-0.1-Design 改為回傳的內容
這份模型卡對一個尚未公布的版本而言異常具體,而這些具體細節全都指向設計工作,而非攝影。建議的推論設定為 2048×2048——若想追求速度則用 1024——取樣步數為 12,無分類器引導(classifier-free guidance)為 1.0,全程採用 BF16,在單張 80 GiB 的 CUDA GPU 上運行。權重全為 BF16 safetensors,整個儲存庫約 71.5 GB,涵蓋 connector/, mllm/, mlp/, scheduler/, transformer/ 與 vae/,且沒有 model_index.json——文件記載的流程是 git clone 推論儲存庫並執行 python infer.py,部署方面指名 vLLM-Omni,而提示增強方面則指名另一個視覺語言模型(Ling-3.0-flash-VL 或 qwen3.8-27B)。
RGBA 輸出是平面圖像問題答案的前半部。後半部是 Ming-Image-0.1-Design-Layer,一個獨立的儲存庫,擁有自己的 pipeline 標籤(image-text-to-image)、6,154,908,736 個參數、相同的 MIT 授權,而且只負責一件事:接收一張平面化的設計圖像加上一份圖層計畫,然後回傳 N 個 RGBA 圖層。它在預設 bucket 中以 1024 執行,講求速度時用 512、12 步、guidance 為 2.0,並搭配 flash_attention_2。它的卡片以圖像而非表格呈現 Crello 測試集結果,因此沒有數字可引用——這正是證據的誠實狀態,值得直說。
把這兩個事實放在一起看,這項取捨的輪廓就很清楚了。Nano Banana 2 讓你用更少工作量得到更好的最終影像。Ming-Image-0.1-Design 則給你一張之後仍能拆解的影像,並把圖層分解當作第二個模型提供,讓你在需要時再執行。
看板,請仔細閱讀
Ming-Image-0.1-Design 在 Artificial Analysis 文字轉圖像排行榜的開放權重視圖中,於 UI/UX 設計項目名列第一,Elo 為 1,082,領先 Ideogram 4.0(Quality)的 1,052、Ideogram 4.0 的 1,015、HunyuanImage 3.0 Instruct 的 1,005、FLUX.2 [dev] 的 1,000、FLUX.2 [dev] Flash 的 999,以及 FLUX.2 [dev] Turbo 的 994。我們所閱讀的這段文案,是轉錄自該模型自身卡片上的版本,並且帶有 Artificial Analysis 的品牌標示。
有兩點但書,會影響這個結果該被賦予多少份量。它是一個以開放權重為篩選條件的排行榜,因此像 Nano Banana 2 這類託管模型並不符合資格,它的缺席並不算是落敗。再者,盲測偏好的 Elo 分數是一群人的平均結果,而不是針對你的提示詞所做的測試——它只說明有一組評審偏好這些輸出,並不代表這個模型會把你的標題排成正確的字體。
![The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.](https://cms.orcarouter.ai/api/media/file/3-1125.png)
Nano Banana 2 的排名是依據代管排行榜和 Google 自家公布的數字來衡量,而這兩者不應混為一談。它從春季起就已登上這些排行榜,這才是這裡更有用的事實:它已累積了數個月的獨立流量,而 Ming 版本則完全沒有。
金錢與風險實際上落在何處
定價差異不是程度上的差異。Nano Banana 2 是按用量計費,因此可預測:一千張 2K 圖片約 $101,而複雜度不太會改變帳單,因為影像輸出會以可預測的方式 token 化。Ming-Image-0.1-Design 則完全沒有託管價格,因為根本沒有託管端點——成本是你自己的 GPU 時間,還要面對在 80 GiB 顯卡上下載 71.5 GB 的負擔;而誠實的比較不是 $101 對免費,而是 $101 對一個你必須自己計算的攤銷數字。
這是本比較中唯一一處路由層做出具體而非空泛之舉的地方。供應 Nano Banana 2 的 Gemini 圖片預覽位於我們的端點上,而且是以供應商定價、零加價的方式提供——因此,若 Google 調整每張圖片的費率,我們這邊的數字會在同一天隨之變動,而非等到下一次合約續約時才調整。跨供應商的自動容錯移轉是這件事的另一半:一條路由可以讓生產流量跑在一個已有數月董事會紀錄的模型上,同時在旁邊評估一個未經宣布的開放權重發布,這意味著評估永遠不會落在關鍵路徑上,而且任一方某個糟糕的下午也不會演變成中斷。這是一套真實的安排,而這正是這對特定模型所要求的安排。

這兩個模型都不是安全的預設選項,原因各不相同。
Ming-Image-0.1-Design 於 2026 年 9 月 17 日上傳,沒有公告、沒有發行說明、沒有載明任何限制,而且在撰寫本文時,下載次數顯示為零。上方排行榜的名次是唯一存在的獨立量測結果。其餘一切——你顯示卡上的吞吐量、它在超過少數幾張參考圖片後的表現如何、去背邊緣的 alpha 通道是否乾淨——都沒有公開的量測數據,也沒有任何第三方寫過相關內容。
Nano Banana 2 則有完全相反的特性。它具備獨立評分、公開定價、商業授權與 SynthID,而且不會把圖層還給你。如果你的工作流程終點是「圖片看起來沒問題」,那這不算成本。如果你的工作流程還要繼續進入排版工具,那這就是全部的成本。
• 需要透明 PNG,或一個可讓你拆解的設計——Ming-Image-0.1-Design 是兩者中唯一符合的,而 Layer 這個配套工具,正是該關注它、而不是看它排行榜名次的原因。
• 需要可預測的每張圖片價格、4K 輸出、特殊長寬比與來源出處浮水印——Nano Banana 2,每 1K 張圖片約 $0.067,而且它與你呼叫的其他所有服務都位於同一個端點。
• 必須能夠販售其產出——Ming-Image-0.1-Design 的 MIT 授權允許這麼做,這對 2026 年的影像發布來說並不尋常,值得對照你自己的法律立場來確認,而不是自行假設。
• 在你投入之前,需要有其中一個是可驗證的——但兩者之中只有一個能做到,而那就是沒有事先公告的那一個。
值得關注的並非基準測試。而是 Layer 儲存庫最終是否會成為這次發布中有用的那一半。Layer 分解是生成式設計工作不再只是一張圖片、而開始成為一項資產的一步;如果那個模型真如其模型卡所暗示的那樣,那麼扁平影像問題就是這個比較中最快過時的部分。
