一张"{{Ming-Image-0.1-Design}} 对比 {{Nano Banana 2}}"的主视觉标题卡,副标题为"你拿回来的那一层。",将 Ming-Image-0.1-Design(RGBA 输出、61.5 亿参数、图层分解模型、MIT 许可)与 Nano Banana 2(扁平图像输出、最高 4K、每 1K 图像约 0.067 美元、SynthID 水印)进行对比,右下角放置 OrcaRouter 标志。
Guides & Insights

Ming-Image-0.1-Design 对比 Nano Banana 2:你找回的那一层

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

如果你问设计师,图像生成之后哪里会出问题,答案几乎从来不是图像本身,而是生成的图像是"压平"的。每个元素都与其他元素焊死在一起,标题挪不动,logo 换不了,背景改不了颜色,想改一个词就得拿提示词把整张图重新生成一遍。Ming-Image-0.1-Design正是围绕这个问题打造的:它由蚂蚁集团 inclusionAI 团队于 2026 年 9 月 17 日低调发布,采用 MIT 许可证,拥有 61.5 亿参数,原生输出 RGBA,并配有一个配套仓库,能把压平的设计稿还原成一个个独立图层。Nano Banana 2——即厂商的 Gemini 3.1 Flash Image,自 2026 年 5 月 28 日起全面可用,如今可通过 google/gemini-3.1-flash-image-preview调用——解决的则是同一问题的另一半,而这两半之间的差异,恰恰决定了哪一个该放进你的流水线。

Nano Banana 2 真正擅长什么,以及它的成本

谷歌的模型是那个既有公开定价又有生产实践记录的,而这两点值得明确指出,因为它们正是人们选择它的原因。

• 价格——每张 1024×1024 图像约 $0.067,2048×2048 时为 $0.101,4K 端约为 $0.151;批处理模式约为这些数字的一半,而文本输入则单独计费,每百万 token $0.25。换算下来,每千张 2K 图像约为 $101,在你生成任何内容之前就能精准预测到美元。

• 输出——最高 4K,提供比例预设,包括社交和横幅格式所需的 1:4 与 1:8 极端比例,以及 Google 报告的在五个角色和十四个对象上的一致性。

• 溯源 — 每项输出都带有 SynthID 水印,这是一项合规功能而非质量功能,而且这类问题是法律审查会比设计审查更早提出的。

• {{1}}Grounding{{/1}} — 它能在生成过程中搜索网络,这就是它处理依赖未记忆事实的请求的方式。

这一切都谈不上什么透明度的说法。Nano Banana 2 返回一张图像,而这张图像就是产物的全部。

A two-column scoreboard titled "Ming-Image-0.1-Design vs Nano Banana 2 - the scoreboard". Left column Ming-Image-0.1-Design: Output format RGBA; Max resolution 2048x2048; Price self-host, no endpoint; Independent score Elo 1,082; Layer decomposition companion model; Routed no. Right column Nano Banana 2: Output format flat image; Max resolution up to 4K; Price about $0.067 per 1K image; Independent score on boards since spring; Layer decomposition no; Routed yes, Gemini image preview. Footer reads "Nano Banana 2 figures per Google and Artificial Analysis; Ming figures vendor-published, no independent reproduction.", with the OrcaRouter logo bottom-right.

Ming-Image-0.1-Design 反而返回了什么

对于一次尚未公布的发布来说,这份模型卡异常具体,而且这些具体信息全都指向设计工作,而非摄影。推荐的推理分辨率为 2048×2048——若追求速度则用 1024——采样步数 12,无分类器引导为 1.0,全程使用 BF16,在单块 80 GiB CUDA GPU 上运行。权重全部为 BF16 safetensors,仓库总大小约 71.5 GB,包含 connector/mllm/mlp/scheduler/transformer/vae/ 目录,并且没有 model_index.json——文档所述的路径是先 git clone 推理仓库,再运行 python infer.py,其中 vLLM-Omni 被指定用于部署,另有一个单独的视觉语言模型(Ling-3.0-flash-VLqwen3.8-27B)被指定用于提示词增强。

RGBA 输出是扁平化图像问题的前半部分答案。后半部分是 Ming-Image-0.1-Design-Layer,一个独立的仓库,拥有自己的 pipeline 标签(image-text-to-image)、6,154,908,736 个参数、同样的 MIT 许可证,且只做一件事:接收一张扁平化的设计图像和一份图层规划,返回 N 个 RGBA 图层。它在默认桶尺寸 1024 下运行,为求速度可用 512,12 步,引导强度 2.0,并使用 flash_attention_2。它的模型卡以图片而非表格的形式展示 Crello 测试集结果,因此没有数字可引用——这恰恰是证据所处的诚实状态,值得直白地说出来。

把这两个事实放在一起,这笔取舍的轮廓就很清楚了。Nano Banana 2 用更少的功夫,给你一张更好的成品图。Ming-Image-0.1-Design 给你的图事后还能拆解开来,而且它把图层分解作为第二个模型交给你,需要时再运行。

董事会,仔细阅读

Ming-Image-0.1-Design 在 Artificial Analysis 面向 UI/UX 设计的文生图排行榜的开放权重视图中位列第一,Elo 为 1,082,领先于 Ideogram 4.0 (Quality) 的 1,052、Ideogram 4.0 的 1,015、HunyuanImage 3.0 Instruct 的 1,005、FLUX.2 [dev] 的 1,000、FLUX.2 [dev] Flash 的 999 以及 FLUX.2 [dev] Turbo 的 994。我们正在阅读的文案,是模型自身卡片上转载的那一份,并且带有 Artificial Analysis 的品牌标识。

有两点需要注意,它们会改变它有多大分量。这是一个经过开放权重筛选的榜单,因此像 Nano Banana 2 这样的托管模型没有参评资格,它的缺席并不等于落败。而且,盲偏好 Elo 是群体偏好的平均值,不是对你提示词的测试——它说明的是一个评审小组更偏爱这些输出,并不表示该模型会用正确的字体来排你的标题。

The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.

Nano Banana 2 的位次是根据托管榜单和 Google 自己公布的数据来衡量的,二者不应混为一谈。它自春季起就一直在榜单上,而这是这里更有用的事实:它已经积累了数月的独立流量,而 Ming 版本则完全没有。

资金与风险的实际落点

价格差异并非程度上的差异。Nano Banana 2 按量计费,因此成本可预测:一千张 2K 图像约为 101 美元,而且复杂度的变化不会让账单有明显波动,因为图像输出的标记化是可预测的。Ming-Image-0.1-Design 则根本没有托管价格,因为压根不存在托管端点——成本是你自己的 GPU 时间,用来应对在 80 GiB 显存卡上下载 71.5 GB 的模型;而诚实的比较并不是 101 美元对比免费,而是 101 美元对比一个你必须自己算出来的摊销数字。

在这次对比中,这是唯一一处路由层做的是具体实事、而非空谈的地方。为 Nano Banana 2 提供服务的 Gemini 图像预览就在我们的端点上,并且是以供应商标价、零加价的方式提供的——所以如果 Google 调整每张图片的价格,我们这边的数字当天就会随之变动,而不是等到下一次合同续签。跨供应商的自动故障转移是这件事的另一半:一条路由可以让生产流量跑在一个已有数月排行榜记录的模型上,同时在其旁边评估一个尚未公布的开源权重发布版本——这意味着评估永远不会落在关键路径上,任何一边的一个糟糕下午也不会演变成一次服务中断。这是一种真实可行的安排,也正是这对特定模型所需要的安排。

The OrcaRouter model page for Nano Banana 2, listed as Google's Gemini 3.1 Flash Image Preview under the model id google/gemini-3.1-flash-image-preview, dated 2026-02-26, showing a price of $0.15 per request and a P95 time to first token of 1.00 seconds.

两个模型都不是安全的默认选择,原因各不相同。

Ming-Image-0.1-Design 于 2026 年 9 月 17 日上传,既没有发布公告,也没有发布说明,没有说明任何限制,而在撰写本文时,其下载计数显示为零。上方所示的排行榜名次,是唯一存在的独立测评结果。除此之外的一切——在你的显卡上的吞吐表现、面对少量参考图以上数量时的行为如何、抠图边缘的 alpha 通道是否干净——在公开层面都没有被测量过,也没有任何第三方就此写过任何内容。

Nano Banana 2 则恰恰相反。它有独立评分、公开定价、商业许可和 SynthID,而且不会把图层还给你。如果你的工作流到“图像看起来没问题”就结束了,那这不算成本。如果你的工作流还要继续进入排版工具,那这就是全部成本。

• 需要一张透明 PNG,或一份可以拆解的设计?——两者之中,Ming-Image-0.1-Design 是唯一一个能做到的,而配套的 Layer 才是你该关注它、而非只盯着它排行榜名次的理由。

• 需要可预测的每张图片价格、4K 输出、非常规宽高比和来源水印——Nano Banana 2,每 1K 张图片约 $0.067,并且它与你调用的其他所有内容位于同一个端点

• 需要出售其产出——Ming-Image-0.1-Design 的 MIT 许可证允许这样做,这在 2026 年的图像发布中并不寻常,值得对照自己的法律立场进行核实,而不是想当然。

• 在你做出承诺之前,需要二者之一先变得可验证——但它们中只有一个能做到,而那就是那个没有发布任何公告的。

值得关注的不是某个基准测试,而是 Layer 仓库是否会成为这次发布中有用的那一半。Layer 分解是生成式设计工作从一张图片变成一项资产的步骤,而如果那个模型确实如其模型卡所暗示的那样,那么平面图像问题就是这次对比中最快过时的部分。