为“Ming-Image-0.1-Design vs Qwen-Image 3.0”制作的主视觉标题卡,副标题为“谁向你展示文字是如何被绘制的。”,将 Ming-Image-0.1-Design(61.5 亿参数、MIT 许可证、可读取的权重、发布于 2026 年 9 月 17 日)与 Qwen-Image 3.0(闭源托管模型、未公布参数规模、无许可证或报告、于 2026 年 8 月 5 日正式发布)进行对比,右下角带有 OrcaRouter 标志。
Guides & Insights

Ming-Image-0.1-Design vs Qwen-Image 3.0:谁向你展示文本是如何被绘制的

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

关于 Ming-Image-0.1-Design,最有趣的东西并不在它的模型卡上,而是在某推理框架的一次提交里。大约在 2026 年 9 月 17 日该模型悄悄上传到 Hugging Face 前后,vLLM-Omni 合并了一项题为 feat: 为 Ming 添加 byte5 支持的改动,将一个 ByT5 字形编码器接入了新的 ming_flash_omni 流水线——这是一个专门的组件,它唯一的职责就是查看你要求渲染的字符,而不是你要求生成的画面。这种细节只有读代码才能发现,而恰恰是这种细节,Qwen-Image 3.0——厂商那款闭源托管的图像模型,2026 年 7 月 21 日发布、8 月 5 日全面可用——根本不让任何人看到。两款模型都面向设计类工作,而其中清晰易读的文字正是最难的部分。但只有其中一款会告诉你它是怎么做到的。

他们每个人关于文本说了什么

Qwen-Image 3.0 的文本渲染表现完全是一句发布时的宣传,而在纸面上,这宣传确实漂亮。阿里巴巴的资料称,提示词最长可达约 4,500 个 token,文字小至约 10 像素仍清晰可读,覆盖 12 种语言、20 多种字体,输出最高 2048×2048,单次调用最多可生成六张图像,并通过一个托管 API 以 Pro 和 Standard 两个版本提供。但没有任何权重发布、没有说明许可证、没有模型卡、没有技术报告,也没有公开的基准测试表可供对上述任何一点进行核实。被广泛引用的约 20B MMDiT 参数量只是传闻,而非得到确认。

Ming-Image-0.1-Design 的故事就是一个仓库。6,154,901,056 个参数,MIT 许可证,一个 diffusers 流水线标签,所有权重均为 BF16 safetensors,分布于 connector/mllm/mlp/scheduler/transformer/vae/,总计约 71.5 GB。推荐推理为在单块 80 GiB CUDA GPU 上以 12 个采样步、guidance 为 1.0 运行 2048×2048,或使用 1024 以提升速度;部署指定使用 vLLM-Omni,提示增强指定使用单独的视觉语言模型。模型卡将其描述为面向 UI、信息图、海报及其他文本密集型视觉设计的文生图模型,并支持 RGBA 输出以实现透明背景。

那两段话并不是同一种陈述,原因值得直说。一段是售卖该产品的人所写的产品描述。另一段则是对任何人都能下载并核验的产物的描述。

字形编码器是解释类别的部分

图像模型中的文本渲染通常以一种特定的方式失败:模型生成的东西看起来像文字,却不是文字。字形看上去合理,单词却是错的。这个原因首先是架构层面的,然后才是其他因素——大多数图像模型没有任何组件能把字符当作字符来看待,所以文字是像草地一样从视觉统计中重建出来的。

这个 vLLM-Omni 提交之所以有意思,恰恰是因为它正指向这一点。新增的文件——byte5_encoder.pypipeline_ming.pyt5_block_mapper.py以及一个阶段输入处理器——描述的是一条路径:由 ByT5 字节级编码器读取应当出现在图像中的文本,分词器词表被扩展加入字体和颜色标记,而所得特征沿序列维度被追加,负样本一侧则接收零。最后这个细节恰恰暴露出这是真正的设计决策,而非单纯的管道铺设:如果负分支携带相同的字形特征,无分类器引导就会被拉向渲染文本、偏离提示词,因此这些零的存在正是为了让两个目标不至于互相打架。只有当检查点实际包含 byte5/子文件夹时,该编码器才会加载。

两点坦诚说明。这是第三方推理框架的提交,而非蚂蚁集团的声明;至于这些文件的含义,我们的解读并不代表厂商。而且它佐证的是设计意图,而非结果:存在字形编码器与良好的文本渲染相一致,但这并不能证明文本渲染就是好的。关于质量的唯一独立证据,是下文将要讨论的单一榜单名次。

A pipeline diagram titled "How the glyph encoder enters the pipeline", showing prompt text passing through a tokenizer extended with font and colour markers into a ByT5 glyph encoder whose features are appended along the sequence dimension, with the negative branch receiving zeros so guidance is not pulled away from rendered text, and the result emerging as an RGBA image.

与 Qwen-Image 3.0 的对比,重点并不在于阿里巴巴的模型把文字渲染得很糟——阿里巴巴之外没人能说它渲染文字的效果究竟如何,而这恰恰是关键所在。重点在于,“这个模型如何画出字母”这个问题,对其中一款模型来说有答案,对另一款来说却只是营销说辞,而答案与说辞之间的差距,正是工程决策得以做出的地方。

那一个数字,以及它不在的那块板

Ming-Image-0.1-Design 在 Artificial Analysis 面向 UI/UX 设计的文生图排行榜(开放权重视图)中排名第一,Elo 为 1,082——领先于 Ideogram 4.0(Quality)的 1,052、Ideogram 4.0 的 1,015、HunyuanImage 3.0 Instruct 的 1,005、FLUX.2 [dev] 的 1,000、FLUX.2 [dev] Flash 的 999 以及 FLUX.2 [dev] Turbo 的 994。该榜单的这一副本正是模型自身卡片上转载的那一份,并带有 Artificial Analysis 品牌标识;没有任何人独立复现过这一分数。

The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.

这是一个开放权重榜单,因此 Qwen-Image 3.0 没有上榜,而它的缺席并不能说明其质量如何。它真正说明的是结构性问题:盲测偏好榜单只能对权重公开的模型进行排名。这让一个开放发布的模型在产品问世前数月就获得一个可衡量的位置,而让一个闭源发布只得到一个营销数字,除此之外一无所有。Qwen-Image 3.0 的那些宣称——10 像素可读性、4,500 token 提示词、20 多种字体——背后完全没有独立测量支撑。

A two-column scoreboard titled "Ming-Image-0.1-Design vs Qwen-Image 3.0 - the scoreboard". Left column Ming-Image-0.1-Design: Weights downloadable, 6.15B; Licence MIT; Text rendering glyph encoder visible; Independent score Elo 1,082; Price self-host; Internals readable. Right column Qwen-Image 3.0: Weights none; Licence not published; Text rendering 10px claim, vendor-reported; Independent score none; Price about $0.04 per image; Internals black box. Footer reads "Qwen-Image 3.0 claims vendor-reported; Ming score per the Artificial Analysis board on its model card.", with the OrcaRouter logo bottom-right.

你会如何实际测试这个,以及尝试它需要付出什么代价

如果你读到这里是因为字体是否清晰易读,那么这项测试并不是一个排行榜。它是用你自己的字体、你自己的语言和你自己的字符串,把两个候选模型都跑一遍,再由人来阅读。那项测试需要其中一个模型易于获取且便宜,另一个可以下载,而二者的定价原则恰恰相反。

• Qwen-Image 3.0 — Pro 版每张图片约 $0.04,Standard 版约 $0.03,国内消费者定价从每张约 ¥0.18 起。这些是发布时的数字,尚未经过审计。你今天下午就能跑一个提示词矩阵,并按调用次数付费。

• Ming-Image-0.1-Design——没有公布价格,因为它没有托管端点。代价是 71.5 GB 的下载量、一块 80 GiB 的显卡,以及你自己的时间;好处则是你可以把同一个测试对准字形编码器路径,看看是不是这个组件在真正起作用。

这正是路由层存在的意义所在,而值得精确说明的是其中哪一部分适用。Qwen-Image 3.0 和 Ming-Image-0.1-Design 都不在我们的平台上,因此路由层今天无法把其中任何一个放到某个密钥之后。它能做的,是在你进行测试时保持比较的公允:OrcaRouter 将 200 多个模型汇聚在一个兼容 OpenAI 的端点之后,按提供商列表价、零加价提供,并支持跨提供商的自动故障转移,因此你已信任的模型可以守住生产路径——其成本始终与提供商的列表价挂钩,所以供应商的价格调整当天就会落到我们这边——而未经验证的设计模型则是在它旁边接受评估,而不是挡在它前面。

两个开放发布,一个封闭发布,以及一种模式

值得注意的是,Ming 的发布除了它本身之外,还证明了什么。蚂蚁集团在没有发布任何公告的情况下,以 MIT 许可证发布了一个 61.5 亿参数的设计模型,同时还以同一许可证发布了第二个用于图层分解的模型。阿里巴巴发布了一个闭源托管模型,没有许可证、没有模型卡,也没有报告,面向同类工作,并按每张图计价。

这是两种不同的押注,赌的是设计模型中的价值究竟在哪里。一种认为模型就是产品,而权重是分发渠道。另一种认为模型是一种服务,而权重是你自己保留的东西。在同一个市场里,这两种押注都可能成立,而它们会对评估时唯一重要的问题给出非常不同的答案:我能不能在依赖它之前弄清楚它是如何运作的?

• 如果你需要了解文本是如何渲染的,以及为什么有时并非如此——Ming-Image-0.1-Design 是两者中唯一能让你亲自查看的,而 MIT 许可证意味着你可以根据所见采取行动。

• 如果你今天就需要一个按每张图像计价、且无需自建基础设施的生产级端点——两者之中只有 Qwen-Image 3.0 提供了这样的端点,而它的内部实现也包含在价格之中。

• 如果你在下定决心之前需要独立证据——那么两者都拿不出足够的证据。一个只有一项未经复现的排行榜名次;另一个只有一份没有任何数字支撑的厂商声明材料。

值得关注的是,这一模式是否成立。一次未事先宣布的 MIT 发布,其中带有一个字形编码器,这说明了其作者期望模型被如何使用——被检查、在本地运行、被修改。如果同一团队的下一个发布是公开宣布、经过基准测试并托管上线的,那这次就只是一次性行为。如果它又是一个悄无声息的代码库,那么设计模型这一类别就多了一个开源竞争者,而市场的闭源那一半则面临一个它在七月还没有的价格问题。