主视觉标题卡显示“Ming-Image-0.1-Design 登顶开放权重 UI 设计排行榜”,副标题为“Artificial Analysis UI/UX 设计细分榜单中评分最高的开放权重模型,Elo 达 1,084”,并配有奖杯图标卡片,标注为“评分最高的开放权重模型”,以及屏幕图标卡片,标注为“在 UI/UX 设计中领先”。OrcaRouter 标志合成于右下角。
Guides & Insights

Ming-Image-0.1-Design 登顶 Open-Weights UI 设计排行榜——而且数据经得起检验

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Ming-Image-0.1-Design一同流传的说法是:inclusionAI 的 6B 模型是用于 UI 和 UX 工作的最佳开放权重文本到图像模型,在 Artificial Analysis UI/UX Design 排行榜的开放权重视图中以 1,082 Elo 位居第一。厂商的排行榜截图通常是最弱的一类证据,因此首先值得做的是查看实时榜单。截至 2026 年 9 月 24 日,这一说法仍然成立,但有一个截图并未体现的重要限定条件:1,082 只是一个用例切片,而不是整个榜单;在完整的 Text to Image 排行榜上,同一模型以 995 的 Elo 排在第 45 位。

这两个数字都是真实的,它们来自同一个竞技场,描述的是同一组权重。区别在于,这些投票是在哪些提示词上投出的。

实时看板上实际显示的内容

Artificial Analysis 运行一个盲测两两对战竞技场,然后将同一个投票池筛选成用例切片。对于为仪表盘、应用界面、海报和信息图而构建的模型来说,UI/UX Design 切片才是关键所在,而这正是 Ming-Image-0.1-Design 表现最出色的地方:

• 文本到图像综合榜 — Ming-Image-0.1-Design 位列第 45,Elo 995,95% 置信区间 ±8,21,342 个样本,2026 年 9 月上榜,每 1,000 张图像 30.00 美元,标记为开放权重

• UI/UX 设计切片 —— Ming-Image-0.1-Design 排名第 16,Elo 1,084,该切片包含 2,100 个样本

• 该细分领域中排名最高的开放权重条目——Ming-Image-0.1-Design;紧随其后的开放权重模型是 Ideogram 4.0(Quality),位列第22名,得分1,047;Ideogram 4.0 位列第31名,得分1,018;以及 HunyuanImage 3.0 Instruct 位列第40名,得分1,005

• UI/UX 切片榜首 — GPT Image 2.5 Flare (max) 为 1,226,GPT Image 2.5 Sunburst (max) 为 1,215,GPT Image 2 (high) 为 1,204,Grok Imagine Image 2.0 为 1,183

• 对照厂商自己提供的截图——inclusionAI 公布的 Ming 得分为 1,082,而 Ideogram 4.0(Quality)为 1,052、FLUX.2 [dev] 为 1,000;而当前实时切片显示的分数则分别为 1,084、1,047 和 1,000

所以,这个标题按它自身的标准来看是准确的。Ming-Image-0.1-Design 是 UI/UX 设计细分领域中评分最高的开放权重模型,也是该细分领域前二十名中唯一的开放权重模型。但它同时也落后该细分领域的领头者 142 Elo,而且当提示词不属于设计类时,它处于中游水平。一个能在仪表盘上胜出、总体却只到 995 的模型,是专才,不是全能选手;只有当你把其中一个数字当成全部真相时,这两个数字才互相矛盾。

完整榜单上的 21,342 个样本,也值得从其“不是什么”的角度来看待。这是一个很大的投票数,因此置信区间很窄,为 ±8 Elo,但样本数量并不等同于方法上的独立性。竞技场采用盲测的人类偏好,因此 inclusionAI 没有人写过这个分数——这部分是真实的。该分数衡量的是“投票者更偏好这两张图像中的哪一张”,而被要求评判 UI 截图的投票者往往会奖励清晰易读的文字和连贯的布局。而这恰恰是这个模型训练所依据的维度。

Screenshot of the Artificial Analysis Text to Image Leaderboard captured 24 September 2026, cropped to the lower rows. Ming-Image-0.1-Design is row 45, creator InclusionAI, with an Elo of 995, row range 39-50, 21,342 samples, a September 2026 release and $30.0 per 1k imgs, carrying the Open Weights badge. Neighbouring rows include P-Image-Ideogram (High) at 44 and 995, Cosmos3-Super-Text2Image (agentic) at 46 and 994, and Ideogram 4.0 at row 38 and 1,004, also Open Weights.

什么是Ming-Image-0.1-Design

Ming-Image-0.1-Design 是 inclusionAI 推出的文生图模型,inclusionAI 是蚂蚁集团旗下的 AI 实验室。该模型以 MIT 许可证发布,权重于 2026 年 9 月 17 日公布,完整发布包于 9 月 22 日上线。它仅凭提示词即可生成——无需参考图像——并且面向文字密集型平面设计而非摄影:UI 模型图、仪表盘、信息图、海报,以及任何需要在实际阅读尺寸下保持渲染文字清晰可读的场景。

文档中记录的推理配置很具体,而且每一步都异常便宜:

• 分辨率 — 推荐使用 2048 x 2048,或者使用 1024 x 1024 以实现更快的生成,中间尺寸则归入这两个档位之一

• 采样步数 — 12

• 引导 — CFG scale 1.0

• 精度 — BF16

• 硬件 — 一块配备 80 GiB 显存的 CUDA GPU,被称为经验证的配置

引导尺度为 1.0 时只需十二步,这是蒸馏采样器或无引导采样器的标志性特征。正是这一点,让 2048 像素的输出能在大多数扩散模型根本不会尝试的步数下变得可行;也正是这一点,让这款模型对以规模化方式运行图像生成、而非一次只生成一张图的人而言格外有吸引力。

另一个结构性特征是透明度。当提示词以某个已记录的透明短语开头时,Ming-Image-0.1-Design 可以直接输出原生 RGBA,因此透明背景来自采样器,而不是来自抠图处理。配套模型 Ming-Image-0.1-Design-Layer 更进一步:它接收一个扁平化的设计和一份图层规划,返回彼此独立的 RGBA PNG——文字、卡片、主体、背景——这些图层重新组合后即可还原原始设计。这正是设计模型与图像模型之间的区别。一张扁平 PNG 只是一张版面效果图;而彼此独立的图层,则是一个仍然可以继续编辑的版面。

Screenshot of the inclusionAI/Ming-Image-0.1-Design model card on Hugging Face, captured 24 September 2026. The header shows 188 likes, 3,067 followers, tags including text-to-image, difusers, safetensors, image-generation, graphic-design, text-rendering and License: mit, and a safetensors panel reading Model size 6B params, Tensor type BF16. The card's UI/UX Design leaderboard image is embedded in the body, showing Ming-Image-0.1-Design first at 1,082 above Ideogram 4.0 (Quality) at 1,052 and FLUX.2 [dev] at 1,000. The right rail states 'This model isn't deployed by any Inference Provider', and the Quick Start block shows the infer.py command with --resolution 2048 and a note that prompt enhancement can use Ling-3.0-flash-VL or qwen3.8-27B.

6B 标签和 26B 下载

“6B”在大多数人指的那个部分上是准确的,但在决定你能否运行它的那个部分上却具有误导性。扩散 Transformer 有 6.15B 参数。你实际下载的包大约为 52.88 GB,因为多模态文本编码器有 17.01B 参数,而连接器又增加了 3.09B——在 BF16 下总计约 26B 参数。Layer 模型的 Transformer 是基础模型的两倍,达到 12.31B,其包也更大,约为 65.20 GB。

这有两个实际原因。第一,80 GiB 的显存要求并不在于 6B 的 Transformer;而在于必须与它一同常驻的所有东西。第二,任何与被称为“6B”的模型进行的比较,都需要确认指的是哪一个 6B。一个带有 20B 文本编码器的 6B 扩散 Transformer,与一个端到端的 6B 模型,是完全不同的部署问题。

提示处理是这张模型卡明确说明而非隐藏的另一件事:推荐配方会先执行重写步骤,使用视觉语言模型把简短提示扩展为结构化的 Figma 风格 JSON 布局描述,其中包含坐标、层级、颜色规格和逐字文本。模型卡指定由 Ling-3.0-flash-VL 或 Qwen3.8-27B 完成这项工作。换句话说,供应商基准测试所用的流水线是一条双模型流水线。如果你用一句话提示调用 Ming-Image-0.1-Design,且没有重写步骤,那么你运行的就不是在 UI/UX 切片中产出 1,084 的那套配置。

这让设计流水线处于何种境地

对 Ming-Image-0.1-Design 的诚实总结是:它解决了一个具体且代价高昂的问题——生成经得起细看的文本密集型版式——并且在唯一衡量该问题的榜单上,它做到了开放权重领域的顶尖水平。它并未领跑整体图像榜单,也没有消除在其前面部署一个 VLM 的必要性,而且它需要一块高性能 GPU。

它改变的是设计工作流的中段。如果你的流水线目前先生成一张扁平图像,再花钱请人或用分割模型把它切开,那么一个原生输出 RGBA 的模型,外加一个能输出 2–9 个具名图层的配套模型,就省去了一道工序。这比一列 Elo 分数更有价值,而这恰恰是任何排行榜都不会衡量的部分。

对于希望在不投入基础设施的情况下进行测试的团队来说,这一区分值得精确说明。Ming-Image-0.1-Design 是一个 MIT 许可的下载项,因此它要么在你自己的硬件上运行,要么根本无法运行——OrcaRouter 不路由任何版本的 inclusionAI 模型,若声称相反,就是我们无法兑现的说法。路由层真正提供的是周边层面的能力:一个兼容 OpenAI 的端点,覆盖 200 多款模型、跨提供商自动故障转移,以及按 0% 加价透传的提供商目录价,因此你所调用的任何模型一旦供应商调整价格,我们这边当天就会同步生效。如果你正在搭建一条设计流水线,想将这个模型与你已经信任的托管模型做 A/B 对比,那么这一对比只需一个密钥,而非两份合同。

A rendered summary card headed 'The two numbers' and titled 'One model, two readings', listing five figures: Overall Text to Image board #45, Elo 995, 95% CI 8, 21,342 samples; UI/UX Design slice #16, Elo 1,084, 2,100 samples in the slice; open-weights standing in that slice #1, next is Ideogram 4.0 (Quality) at #22 and 1,047; leader of the same slice GPT Image 2.5 Flare (max), Elo 1,226, a 142-point gap; board-listed API pricing $30.00 per 1,000 images, flagged Open Weights.

什么会改变局面

有三件事将把 Ming-Image-0.1-Design 从一个强大的开放权重专用模型推向默认之选。首先是对 Layer 模型的 Crello 指标进行首次独立复现——模型卡报告称,在 1024 分辨率下 RGB L1 误差为 0.0574,alpha soft IoU 为 0.8923,而尚无外部团队运行过它们。其次是一个消除 80 GiB 要求的托管端点。第三是第二个用例切片:模型在该切片中的表现与在 UI/UX Design 中一样好,因为一个只在一个榜单的一个切片上胜出的模型,其通用性仍未得到证明。

在那之前,准确的说法是那个范围更窄的:在 Artificial Analysis 的 UI/UX Design 切片榜单上(数据读取于 2026 年 9 月 24 日),inclusionAI 的 Ming-Image-0.1-Design 是评分最高的开放权重文生图模型,在 2,100 张投票下获得 1,084 Elo——而在同一竞技场的完整榜单上,它以 995 分位列第 45 名。这两项说的都是这个模型本身。两者都不是发布声明,因为这个模型并没有发布;它只有一个代码仓库。