
Ming-Image-0.1-Design 对比 Nano Banana 2:你找回的那一层
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
如果你问设计师,图像生成之后哪里会出问题,答案几乎从来不是图像本身,而是生成的图像是"压平"的。每个元素都与其他元素焊死在一起,标题挪不动,logo 换不了,背景改不了颜色,想改一个词就得拿提示词把整张图重新生成一遍。Ming-Image-0.1-Design正是围绕这个问题打造的:它由蚂蚁集团 inclusionAI 团队于 2026 年 9 月 17 日低调发布,采用 MIT 许可证,拥有 61.5 亿参数,原生输出 RGBA,并配有一个配套仓库,能把压平的设计稿还原成一个个独立图层。Nano Banana 2——即厂商的 Gemini 3.1 Flash Image,自 2026 年 5 月 28 日起全面可用,如今可通过 google/gemini-3.1-flash-image-preview调用——解决的则是同一问题的另一半,而这两半之间的差异,恰恰决定了哪一个该放进你的流水线。
Nano Banana 2 真正擅长什么,以及它的成本
谷歌的模型是那个既有公开定价又有生产实践记录的,而这两点值得明确指出,因为它们正是人们选择它的原因。
• 价格——每张 1024×1024 图像约 $0.067,2048×2048 时为 $0.101,4K 端约为 $0.151;批处理模式约为这些数字的一半,而文本输入则单独计费,每百万 token $0.25。换算下来,每千张 2K 图像约为 $101,在你生成任何内容之前就能精准预测到美元。
• 输出——最高 4K,提供比例预设,包括社交和横幅格式所需的 1:4 与 1:8 极端比例,以及 Google 报告的在五个角色和十四个对象上的一致性。
• 溯源 — 每项输出都带有 SynthID 水印,这是一项合规功能而非质量功能,而且这类问题是法律审查会比设计审查更早提出的。
• {{1}}Grounding{{/1}} — 它能在生成过程中搜索网络,这就是它处理依赖未记忆事实的请求的方式。
这一切都谈不上什么透明度的说法。Nano Banana 2 返回一张图像,而这张图像就是产物的全部。

Ming-Image-0.1-Design 反而返回了什么
对于一次尚未公布的发布来说,这份模型卡异常具体,而且这些具体信息全都指向设计工作,而非摄影。推荐的推理分辨率为 2048×2048——若追求速度则用 1024——采样步数 12,无分类器引导为 1.0,全程使用 BF16,在单块 80 GiB CUDA GPU 上运行。权重全部为 BF16 safetensors,仓库总大小约 71.5 GB,包含 connector/、mllm/、mlp/、scheduler/、transformer/ 和 vae/ 目录,并且没有 model_index.json——文档所述的路径是先 git clone 推理仓库,再运行 python infer.py,其中 vLLM-Omni 被指定用于部署,另有一个单独的视觉语言模型(Ling-3.0-flash-VL 或 qwen3.8-27B)被指定用于提示词增强。
RGBA 输出是扁平化图像问题的前半部分答案。后半部分是 Ming-Image-0.1-Design-Layer,一个独立的仓库,拥有自己的 pipeline 标签(image-text-to-image)、6,154,908,736 个参数、同样的 MIT 许可证,且只做一件事:接收一张扁平化的设计图像和一份图层规划,返回 N 个 RGBA 图层。它在默认桶尺寸 1024 下运行,为求速度可用 512,12 步,引导强度 2.0,并使用 flash_attention_2。它的模型卡以图片而非表格的形式展示 Crello 测试集结果,因此没有数字可引用——这恰恰是证据所处的诚实状态,值得直白地说出来。
把这两个事实放在一起,这笔取舍的轮廓就很清楚了。Nano Banana 2 用更少的功夫,给你一张更好的成品图。Ming-Image-0.1-Design 给你的图事后还能拆解开来,而且它把图层分解作为第二个模型交给你,需要时再运行。
董事会,仔细阅读
Ming-Image-0.1-Design 在 Artificial Analysis 面向 UI/UX 设计的文生图排行榜的开放权重视图中位列第一,Elo 为 1,082,领先于 Ideogram 4.0 (Quality) 的 1,052、Ideogram 4.0 的 1,015、HunyuanImage 3.0 Instruct 的 1,005、FLUX.2 [dev] 的 1,000、FLUX.2 [dev] Flash 的 999 以及 FLUX.2 [dev] Turbo 的 994。我们正在阅读的文案,是模型自身卡片上转载的那一份,并且带有 Artificial Analysis 的品牌标识。
有两点需要注意,它们会改变它有多大分量。这是一个经过开放权重筛选的榜单,因此像 Nano Banana 2 这样的托管模型没有参评资格,它的缺席并不等于落败。而且,盲偏好 Elo 是群体偏好的平均值,不是对你提示词的测试——它说明的是一个评审小组更偏爱这些输出,并不表示该模型会用正确的字体来排你的标题。
![The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.](https://cms.orcarouter.ai/api/media/file/3-1125.png)
Nano Banana 2 的位次是根据托管榜单和 Google 自己公布的数据来衡量的,二者不应混为一谈。它自春季起就一直在榜单上,而这是这里更有用的事实:它已经积累了数月的独立流量,而 Ming 版本则完全没有。
资金与风险的实际落点
价格差异并非程度上的差异。Nano Banana 2 按量计费,因此成本可预测:一千张 2K 图像约为 101 美元,而且复杂度的变化不会让账单有明显波动,因为图像输出的标记化是可预测的。Ming-Image-0.1-Design 则根本没有托管价格,因为压根不存在托管端点——成本是你自己的 GPU 时间,用来应对在 80 GiB 显存卡上下载 71.5 GB 的模型;而诚实的比较并不是 101 美元对比免费,而是 101 美元对比一个你必须自己算出来的摊销数字。
在这次对比中,这是唯一一处路由层做的是具体实事、而非空谈的地方。为 Nano Banana 2 提供服务的 Gemini 图像预览就在我们的端点上,并且是以供应商标价、零加价的方式提供的——所以如果 Google 调整每张图片的价格,我们这边的数字当天就会随之变动,而不是等到下一次合同续签。跨供应商的自动故障转移是这件事的另一半:一条路由可以让生产流量跑在一个已有数月排行榜记录的模型上,同时在其旁边评估一个尚未公布的开源权重发布版本——这意味着评估永远不会落在关键路径上,任何一边的一个糟糕下午也不会演变成一次服务中断。这是一种真实可行的安排,也正是这对特定模型所需要的安排。

两个模型都不是安全的默认选择,原因各不相同。
Ming-Image-0.1-Design 于 2026 年 9 月 17 日上传,既没有发布公告,也没有发布说明,没有说明任何限制,而在撰写本文时,其下载计数显示为零。上方所示的排行榜名次,是唯一存在的独立测评结果。除此之外的一切——在你的显卡上的吞吐表现、面对少量参考图以上数量时的行为如何、抠图边缘的 alpha 通道是否干净——在公开层面都没有被测量过,也没有任何第三方就此写过任何内容。
Nano Banana 2 则恰恰相反。它有独立评分、公开定价、商业许可和 SynthID,而且不会把图层还给你。如果你的工作流到“图像看起来没问题”就结束了,那这不算成本。如果你的工作流还要继续进入排版工具,那这就是全部成本。
• 需要一张透明 PNG,或一份可以拆解的设计?——两者之中,Ming-Image-0.1-Design 是唯一一个能做到的,而配套的 Layer 才是你该关注它、而非只盯着它排行榜名次的理由。
• 需要可预测的每张图片价格、4K 输出、非常规宽高比和来源水印——Nano Banana 2,每 1K 张图片约 $0.067,并且它与你调用的其他所有内容位于同一个端点。
• 需要出售其产出——Ming-Image-0.1-Design 的 MIT 许可证允许这样做,这在 2026 年的图像发布中并不寻常,值得对照自己的法律立场进行核实,而不是想当然。
• 在你做出承诺之前,需要二者之一先变得可验证——但它们中只有一个能做到,而那就是那个没有发布任何公告的。
值得关注的不是某个基准测试,而是 Layer 仓库是否会成为这次发布中有用的那一半。Layer 分解是生成式设计工作从一张图片变成一项资产的步骤,而如果那个模型确实如其模型卡所暗示的那样,那么平面图像问题就是这次对比中最快过时的部分。
