一張「Ming-Image-0.1-Design 對 Nano Banana 2」的主視覺標題卡,副標題為「你能取回的圖層。」,將 Ming-Image-0.1-Design(RGBA 輸出、6.15B 參數、圖層分解模型、MIT 授權)與 Nano Banana 2(平面影像輸出、最高 4K、每 1K 影像約 $0.067、SynthID 浮水印)對比,並在右下角放置 OrcaRouter 標誌。
Guides & Insights

Ming-Image-0.1-Design 對比 Nano Banana 2:你拿回的那一層

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

問問設計師,圖像生成之後哪裡出了問題,答案幾乎從來不是圖像本身,而是生成的圖像是扁平的。每個元素都跟其他元素焊死在一起,所以標題動不了、標誌換不了、背景改不了色,想改一個字就得從提示詞重新生成整張圖。 Ming-Image-0.1-Design由螞蟻集團 inclusionAI 團隊於 2026 年 9 月 17 日悄然以 MIT 授權條款發布,正是圍繞這個問題打造的:61.5 億個參數、原生 RGBA 輸出,以及一個能把扁平化設計還原成獨立圖層的配套儲存庫。 Nano Banana 2——廠商的 Gemini 3.1 Flash Image,自 2026 年 5 月 28 日起全面推出,如今可透過 google/gemini-3.1-flash-image-preview 進行路由——解決的是同一個問題的另一半,而這兩半之間的差異,決定了哪一個才該放進你的管線。

Nano Banana 2 真正擅長的是什麼,以及它的成本是多少

Google 的模型是那個有公開定價與實際上線實績的模型,而這兩點都值得明確指出,因為它們正是人們選擇它的原因。

• 價格 — 每張 1024×1024 圖片約 $0.067,2048×2048 為 $0.101,4K 則約 $0.151;批次模式約為這些數字的一半,而文字輸入則另計,每百萬個 token 為 $0.25。換算下來,每千張 2K 圖片約 $101,在你生成任何內容之前,就能精確預估到美元。

• 輸出 — 最高 4K,並提供比例預設,包括社群與橫幅格式所需的 1:4 和 1:8 等極端比例,且在五個角色與十四個物件之間具有 Google 回報的一致性。

• 來源溯源——每一項輸出都帶有 SynthID 浮水印,這是一項合規功能,而非品質功能,而且是法律審查會比設計審查更早提出詢問的那類事項。

• Grounding — 它可以在生成過程中搜尋網路,藉此處理依賴於它並未記住之事實的請求。

那些都不是什麼透明度的敘事。Nano Banana 2 回傳一張圖像,而圖像就是這項產出物的全部。

A two-column scoreboard titled "Ming-Image-0.1-Design vs Nano Banana 2 - the scoreboard". Left column Ming-Image-0.1-Design: Output format RGBA; Max resolution 2048x2048; Price self-host, no endpoint; Independent score Elo 1,082; Layer decomposition companion model; Routed no. Right column Nano Banana 2: Output format flat image; Max resolution up to 4K; Price about $0.067 per 1K image; Independent score on boards since spring; Layer decomposition no; Routed yes, Gemini image preview. Footer reads "Nano Banana 2 figures per Google and Artificial Analysis; Ming figures vendor-published, no independent reproduction.", with the OrcaRouter logo bottom-right.

Ming-Image-0.1-Design 改為回傳的內容

這份模型卡對一個尚未公布的版本而言異常具體,而這些具體細節全都指向設計工作,而非攝影。建議的推論設定為 2048×2048——若想追求速度則用 1024——取樣步數為 12,無分類器引導(classifier-free guidance)為 1.0,全程採用 BF16,在單張 80 GiB 的 CUDA GPU 上運行。權重全為 BF16 safetensors,整個儲存庫約 71.5 GB,涵蓋 connector/, mllm/, mlp/, scheduler/, transformer/vae/,且沒有 model_index.json——文件記載的流程是 git clone 推論儲存庫並執行 python infer.py,部署方面指名 vLLM-Omni,而提示增強方面則指名另一個視覺語言模型(Ling-3.0-flash-VLqwen3.8-27B)。

RGBA 輸出是平面圖像問題答案的前半部。後半部是 Ming-Image-0.1-Design-Layer,一個獨立的儲存庫,擁有自己的 pipeline 標籤(image-text-to-image)、6,154,908,736 個參數、相同的 MIT 授權,而且只負責一件事:接收一張平面化的設計圖像加上一份圖層計畫,然後回傳 N 個 RGBA 圖層。它在預設 bucket 中以 1024 執行,講求速度時用 512、12 步、guidance 為 2.0,並搭配 flash_attention_2。它的卡片以圖像而非表格呈現 Crello 測試集結果,因此沒有數字可引用——這正是證據的誠實狀態,值得直說。

把這兩個事實放在一起看,這項取捨的輪廓就很清楚了。Nano Banana 2 讓你用更少工作量得到更好的最終影像。Ming-Image-0.1-Design 則給你一張之後仍能拆解的影像,並把圖層分解當作第二個模型提供,讓你在需要時再執行。

看板,請仔細閱讀

Ming-Image-0.1-Design 在 Artificial Analysis 文字轉圖像排行榜的開放權重視圖中,於 UI/UX 設計項目名列第一,Elo 為 1,082,領先 Ideogram 4.0(Quality)的 1,052、Ideogram 4.0 的 1,015、HunyuanImage 3.0 Instruct 的 1,005、FLUX.2 [dev] 的 1,000、FLUX.2 [dev] Flash 的 999,以及 FLUX.2 [dev] Turbo 的 994。我們所閱讀的這段文案,是轉錄自該模型自身卡片上的版本,並且帶有 Artificial Analysis 的品牌標示。

有兩點但書,會影響這個結果該被賦予多少份量。它是一個以開放權重為篩選條件的排行榜,因此像 Nano Banana 2 這類託管模型並不符合資格,它的缺席並不算是落敗。再者,盲測偏好的 Elo 分數是一群人的平均結果,而不是針對你的提示詞所做的測試——它只說明有一組評審偏好這些輸出,並不代表這個模型會把你的標題排成正確的字體。

The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.

Nano Banana 2 的排名是依據代管排行榜和 Google 自家公布的數字來衡量,而這兩者不應混為一談。它從春季起就已登上這些排行榜,這才是這裡更有用的事實:它已累積了數個月的獨立流量,而 Ming 版本則完全沒有。

金錢與風險實際上落在何處

定價差異不是程度上的差異。Nano Banana 2 是按用量計費,因此可預測:一千張 2K 圖片約 $101,而複雜度不太會改變帳單,因為影像輸出會以可預測的方式 token 化。Ming-Image-0.1-Design 則完全沒有託管價格,因為根本沒有託管端點——成本是你自己的 GPU 時間,還要面對在 80 GiB 顯卡上下載 71.5 GB 的負擔;而誠實的比較不是 $101 對免費,而是 $101 對一個你必須自己計算的攤銷數字。

這是本比較中唯一一處路由層做出具體而非空泛之舉的地方。供應 Nano Banana 2 的 Gemini 圖片預覽位於我們的端點上,而且是以供應商定價、零加價的方式提供——因此,若 Google 調整每張圖片的費率,我們這邊的數字會在同一天隨之變動,而非等到下一次合約續約時才調整。跨供應商的自動容錯移轉是這件事的另一半:一條路由可以讓生產流量跑在一個已有數月董事會紀錄的模型上,同時在旁邊評估一個未經宣布的開放權重發布,這意味著評估永遠不會落在關鍵路徑上,而且任一方某個糟糕的下午也不會演變成中斷。這是一套真實的安排,而這正是這對特定模型所要求的安排。

The OrcaRouter model page for Nano Banana 2, listed as Google's Gemini 3.1 Flash Image Preview under the model id google/gemini-3.1-flash-image-preview, dated 2026-02-26, showing a price of $0.15 per request and a P95 time to first token of 1.00 seconds.

這兩個模型都不是安全的預設選項,原因各不相同。

Ming-Image-0.1-Design 於 2026 年 9 月 17 日上傳,沒有公告、沒有發行說明、沒有載明任何限制,而且在撰寫本文時,下載次數顯示為零。上方排行榜的名次是唯一存在的獨立量測結果。其餘一切——你顯示卡上的吞吐量、它在超過少數幾張參考圖片後的表現如何、去背邊緣的 alpha 通道是否乾淨——都沒有公開的量測數據,也沒有任何第三方寫過相關內容。

Nano Banana 2 則有完全相反的特性。它具備獨立評分、公開定價、商業授權與 SynthID,而且不會把圖層還給你。如果你的工作流程終點是「圖片看起來沒問題」,那這不算成本。如果你的工作流程還要繼續進入排版工具,那這就是全部的成本。

• 需要透明 PNG,或一個可讓你拆解的設計——Ming-Image-0.1-Design 是兩者中唯一符合的,而 Layer 這個配套工具,正是該關注它、而不是看它排行榜名次的原因。

• 需要可預測的每張圖片價格、4K 輸出、特殊長寬比與來源出處浮水印——Nano Banana 2,每 1K 張圖片約 $0.067,而且它與你呼叫的其他所有服務都位於同一個端點

• 必須能夠販售其產出——Ming-Image-0.1-Design 的 MIT 授權允許這麼做,這對 2026 年的影像發布來說並不尋常,值得對照你自己的法律立場來確認,而不是自行假設。

• 在你投入之前,需要有其中一個是可驗證的——但兩者之中只有一個能做到,而那就是沒有事先公告的那一個。

值得關注的並非基準測試。而是 Layer 儲存庫最終是否會成為這次發布中有用的那一半。Layer 分解是生成式設計工作不再只是一張圖片、而開始成為一項資產的一步;如果那個模型真如其模型卡所暗示的那樣,那麼扁平影像問題就是這個比較中最快過時的部分。