
Ming-Image-0.1-Design 对比 GPT Image 2.5:一家实验室自家的数字,对上一群陌生人的投票
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
把 Ming-Image-0.1-Design 和 GPT Image 2.5 放在同一个句子里,最显而易见的比较就是质量。而有用的比较在于溯源。GPT Image 2.5 在实时更新的 Artificial Analysis UI/UX Design 榜单上占据第一和第二名,Elo 分别为 1,227 和 1,218,对应的盲测人类投票数分别为 1,287 和 1,303——也就是说,这个排名是由没有参与构建该模型、也不知道哪个输出属于谁的人产生的。Ming-Image-0.1-Design 正好只有一个与之关联的分数,1,082 Elo,而这个分数出现在 inclusionAI 自家 Hugging Face 仓库中随附的一张排行榜图里,位于一个我们在其他任何地方都找不到的榜单上,对应一个下载量为零的模型。这些数字中,一个是证据。另一个则是用字体包装起来的说法。这个差距,而不是两者之间 145 Elo 的差距,才应该左右你对这两个模型中任何一个的决策。
两个数字并列放在一起,以及比较它们时的陷阱
这些数字接近得足以显得可比,而在性质上的差异又大到使它们实际上并不可比。以下是这组数字,已精确列出。
• GPT Image 2.5 在实时榜单上——Flare(max)配置以 1,227.0 Elo 位列第一,Sunburst(max)以 1,218.1 位列第二,样本数分别为 1,287 和 1,303,追踪价格为每 1,000 张图像 $210.72。该模型在该榜单上标注的发布日期为 2026 年 9 月 8 日。
• Ming-Image-0.1-Design 独占一张卡片,以 1,082 Elo 位居第一,领先于得分 1,052 的 Ideogram 4.0(Quality),以及得分在 994 至 1,000 之间的 FLUX.2 dev 各变体;该图表标题为“Text to Image Leaderboard: UI/UX Design”,页脚写着“Elo scores from blind preference votes in our Image Arena”。图中未显示样本数量,也未公布任何方法论。就我们所能查到的而言,该榜单本身并不在公开网络上。
• 陷阱所在——Elo 是按榜单分别计算的。一个分数只有与同一榜单上的其他分数相比才有意义,这正是为什么同一个 FLUX.2 版本在通用文生图榜单上读作 1,026,而在 UI/UX 设计分类视图中却是 1,065。用 1,227 减去 1,082,你并没有测出两个模型之间的质量差距。你只是从一个数字里减去了另一个不相干的数字。

是什么让盲投成为盲投
Artificial Analysis 公布了足够多的方法细节,可供外界核查。其图像竞技场将两个匿名模型的生成结果配对,让投票者选出胜者,再把结果转换为 Elo 评分——榜单上的样本数,就是每个模型累计参与的此类对比次数。正是这种结构,使得评分不易被模型自己的作者所左右:训练 GPT Image 2.5 的人并不在评审环节之中,一个模型也无法因为它是其开发者偏爱的那个而排名第一。它不是一件完美的工具——投票者群体是自我选择的,提示词也不是一套受控的基准测试——但至少这件工具握在厂商之外的人手里。
Ming-Image-0.1-Design 仓库中的图表借用了那种格式,却缺少使其可验证的部分。“盲选偏好投票”是其所宣称的。“Our Image Arena”是运营方,而运营方是 inclusionAI。没有公布投票数,没有可见的提示词分布,也无法检查配对情况。那张图表背后的评估完全可能是诚实且严谨的——模型团队自己会知道。但它从外部也完全无法核查,而如果你正是那个决定是否要基于它来构建的人,这才是唯一重要的事。
值得补充一点,因为这跟那种顺理成章的叙事是相悖的:Ming-Image-0.1-Design 根本没有出现在 Artificial Analysis 的实时榜单上。不在 UI/UX 设计类别里,不在通用文生图榜单上,也不在开放权重视图里。它的缺席并不能证明它更差——一个下载量为零、也没有托管端点的模型,根本无从积累投票。它只能说明目前还不存在任何独立的数字,而这与前者是两回事。
价格是不含糊的部分
在成本方面,这两种模式相差甚远,没有什么可争论的。
• GPT Image 2.5 是一个商业端点。Artificial Analysis 在 UI/UX 类别中将其追踪为每 1,000 张图像 $210.72——约合每张图像 21 美分,这使其处于该领域价格区间的顶端。作为同一榜单上的参照,Grok Imagine Image 2.0 被追踪为每 1,000 张 $60,MAI-Image-2.6 为 $38.9,Muse Image 为 $10。
• Ming-Image-0.1-Design 没有价格,因为它没有端点。其权重以 MIT 许可证授权,可免费下载;运行它们的花费,等同于一张 80 GiB CUDA GPU 每小时的费用。模型卡中验证的配置是单张该级别显卡,分辨率为 2048 x 2048,采样步数为 12。
• 这两个数字都不稳定。两家供应商都会调整费率,而今天写下的单张图像对比,其有效期只能以周来衡量。这里正是值得把 OrcaRouter 的经济账说清楚的地方:我们以 0% 的加价率直接透传供应商的标价,因此供应商的价格变动当天就会在我们这边生效,而无需经过我们自己的重新定价周期——当两个候选方案的差价是每张图像 21 美分对 6 美分,而且两者都可能变动时,这一点就很重要了。
你今天实际可以调用什么,以及我们在这其中处于什么位置
可用性正是这一比较不再停留于空想的地方。
GPT Image 2.5 是一款真实的产品,背后有真实的 API,由 OpenAI 按其自身条款销售。它无法通过 OrcaRouter 路由——截至 2026 年 9 月 23 日,我们的目录中还没有 GPT Image 2.5 这一条目——我们也不会去描述一条我们并不拥有的路由。目录中同系列确实收录的是上一代产品,openai/gpt-image-2,每百万输入 token 8.00 美元、每百万输出 token 30.00 美元,同时还有openai/gpt-image-1.5,而这些与我们路由的其他所有内容一样,都置于同一个密钥之后。
Ming-Image-0.1-Design 在任何地方都无法路由。该仓库已禁用推理,Hugging Face 报告没有推理提供商部署,而快速入门指向一个返回 404 的配套 GitHub 仓库。我们的目录中没有任何类型的 inclusionAI 模型。运行它的唯一方式就是下载分片并自行提供服务。
所以这个选择的形态是:一个选项你今天就能以市场最高价买到,另一个选项你今天就能跑起来,代价是一块 GPU 加上你自己的工程时间,而且没有任何独立证据表明它的表现如何。任何告诉你 Ming-Image-0.1-Design 是 GPT Image 2.5 的便宜替代品的人,都没有把第二个选项的账算清楚。

如何同时持有两者而不押注任何一方
这里的实用建议比定论要狭窄,因为这两个模型目前还不能相互替代。
如果你需要在生产环境中做 UI 或设计品质的图像生成,GPT Image 2.5 就是站得住脚的选择,而价格才是你该跟自己谈判的东西,不是质量——它领先独立榜单的幅度足够大,排名毋庸置疑。如果你想知道 Ming-Image-0.1-Design 到底好不好,你有两个选项,而其中只有一个能免于猜测:把 MIT 权重拉到一张 80 GiB 的卡上,跑你自己的评测集,或者等别人来跑。在此期间,别把 1,082 当成结论。而如果你真正的需求是可选择性,而不是非这两个模型中的某一个不可,那么真正划算的纪律是:把生成调用放在单一接口之后——一个密钥打通 200 多个模型,改一个模型 ID 而不是重写代码,端点出问题时自动故障转移——这样,无论这两个里谁先拿出独立的数字,采用它对你来说都只是一行配置,而不是一个冲刺。
最后一点关于什么会改变这篇文章的说明。如果 Artificial Analysis UI/UX Design 榜单上出现一行 Ming-Image-0.1-Design,并在旁边标出样本数量,就会把该厂商的 1,082 从一项声明变成一个数据点——而这将是 inclusionAI 之外的人第一次就该模型发表任何可衡量的内容。这就是值得关注的事件,而且它比下载计数器更值得监测。

