
MAI-Image-2.5-Pro 登顶图像编辑榜首:微软的独立胜利究竟证明了什么
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
MAI-Image-2.5-Pro现在是Artificial Analysis排行榜上评分最高的图像编辑模型——该榜单是一个独立的盲测投票平台——但在纯文生图方面仅排名第七。这种差异正是关键:一款公开预览不到一个月、完全由Microsoft AI内部构建的模型,已经超越了GPT Image 2、Reve 2.1,以及其同门兄弟MAI-Image-2.5在编辑榜单上的排名,然而当提示是“从无到有给我画点什么”时,却落后于大多数同类模型。将两项排名放在一起看,就能清楚了解Microsoft推出的是什么:一个擅长修改现有图像的专家,而非通用生成器。
两个数字,并排
截至2026年8月的快照,Artificial Analysis的Image Editing Arena将MAI-Image-2.5-Pro列为第1名,Elo 1,272,该排名基于约6,100次盲测用户对比。紧随其后的竞争非常胶着:Reve 2.1为1,262,MAI-Image-2.5与GPT Image 2 (high)并列1,256,GPT Image 1.5 (high)为1,250,Qwen-Image-3.0-Pro为1,249,Google的Nano Banana 2为1,249。在Text-to-Image Arena中,它位列第7名,Elo 1,292,排在GPT Image 2 (high)(1,369)、Reve 2.1(1,322)、Nano Banana 2(1,320)、GPT Image 1.5 (high)(1,310)、MAI-Image-2.5(1,304)和Nano Banana Pro(1,296)之后。
• 编辑: 第 1 名 — 1,272 Elo,约 6,100 个样本
• 文生图: 第7名 — 1,292 Elo,约11,500个样本
• 与编辑类第二名的差距: 领先 Reve 2.1 10 Elo
• 与文生图第一名的差距:落后 GPT Image 2 77 Elo(高)
编辑排名之所以比虚荣数字更有价值,在于其机制。Artificial Analysis 竞技场采用盲测式人工偏好:投票者看到相同的输入图像和指令,获得两个编辑结果,然后选出更强的那个。没有厂商脚本编写分数。因此,那里的第一名是市场上最接近“人们最喜欢这个编辑器的输出”的指标——而且这是一次近期的攀升,而非发布当日的昙花一现。将趋势视为可靠,将精确的 Elo 数值视为暂时的;低投票数的榜单会变动。

同一天截取的文生图排行榜展现了同一款模型的不同面貌——它不再领先,但依然稳稳跻身于前十名,该榜单的Elo分数集中在1290至1370之间。

MAI-Image-2.5-Pro 实际上是什么
MAI-Image-2.5-Pro 是 Microsoft AI 在 MAI-Image-2.5 系列中的高品质层级,于 2026 年 7 月 23 日与 MAI-Voice-2-Flash 一同发布,并已在 Microsoft Foundry(Azure AI Foundry)和免费的 MAI Playground 上公开预览。微软称其为迄今为止保真度最高的图像模型,专为主视觉图像、精细编辑和精准的图内文字渲染而设计。该系列现已覆盖完整的成本曲线:MAI-Image-2.5 面向均衡型任务,MAI-Image-2.5-Flash 面向高吞吐量场景,Pro 层级则位于品质顶端——而更新的同门型号 MAI-Image-2.6 自 8 月 19 日起已进入私人预览。
微软自己对 Pro 档位的声明,全部来自供应商报告,且尚无独立复现:
• 96.8% 的文字渲染准确率——标注为覆盖中文、英文、日文、韩文和西班牙文,但同一份文档将输出上限设在大约一百万像素,因此该宣称中的“8K”表述最好视为营销话术。
• 提示词遵循度比 GPT-Image-1.5 高 27%。在 Microsoft 的内部评估中,
• 多图像角色一致性达94%。跨代
• 与GPT模型相比,GPU成本最高可降低84–89%,该数据针对特定Microsoft场景(PowerPoint、OneDrive),并非通用数字。
文档规格表是这些说法的依据:文本输入最高32,000个token,131k上下文窗口,4,096个输出token,支持JPEG/PNG图像输入,输出上限为1,048,576像素(相当于1024×1024)。最后一个数字对买家来说很重要:这是一个高质量的编辑器,而不是打印分辨率生成器。
品质彰显之处
排行榜所衡量的编辑能力与微软所强调的一致:精准、外科手术式的编辑,保持图像其余部分的一致性。针对性的物体替换、布局调整、图像内文字更新,以及清除运动模糊等伪影——这类编辑在旧模型中往往会重新生成整个场景并丢失主体。再结合94%的角色一致性宣称,你得到的就是一个为商业关键工作流而设计的模型:拿现有素材,改一处,交付。
文生图排名第7位是实打实的制衡。从空白提示词开始,MAI-Image-2.5-Pro 表现不错,但并非领先者——落后 GPT Image 2 (high) 77 Elo 分,在盲测榜单上是一个真实差距。微软目前并未宣称文生图的桂冠;它宣称的是编辑领域的桂冠,而数据对较窄的说法比对较宽泛的说法支撑得更充分。
费用是多少
MAI-Image-2.5-Pro 在 Foundry 上按 token 计量:每百万文本输入 token 5 美元,每百万图像输入 token 8 美元,每百万图像输出 token 106 美元。微软未公布每张图像的 token 数,因此每张图像的成本为算术估算,而非正式报价;按照 Artificial Analysis 的换算,一张 1024×1024 图像的价格接近每 1,000 张图像 108.50 美元。这大约是同系列 MAI-Image-2.5 的 2.3 倍(每 1k 约 48 美元),也是 MAI-Image-2.5-Flash 的 5.4 倍(每 1k 约 20 美元)——Pro 档位是刻意的高定价。
预览定价并非正式发布定价;预览价目表可能在正式发布前发生变动。一旦变动,透传路由层便是价格下调在当天体现在你账单上的方式:在 OrcaRouter 上,提供商标价以 0% 加价透传,因此一旦 MAI-Image-2.5-Pro 可通过可调用的第三方 API 访问,微软收取多少,你就支付多少——无需重新谈判,也无需第二份合同。

为什么第一名属于微软公司,而不只是模型本身
这一排行榜结果公布之际,微软正明显用自家图像模型取代第三方模型。MAI-Image-2.5 已成为 Bing Image Creator 的默认引擎,并运行于 PowerPoint、OneDrive 和 Dynamics 365 Contact Center;Pro 层属于同一系列,面向更高保真度的任务。微软表示,MAI 模型基于干净、可追溯的数据训练,“不涉及对第三方模型的蒸馏”——这是对 OpenAI 依赖问题的直接回应,而成本声明(由厂商报告,且针对特定场景,PowerPoint 中 GPU 成本最高可降低 84%)也是同一叙事的一部分:一款每任务成本比其所取代的模型更低的自研模型。
如果没有独立的排行榜,这一切都无法向持怀疑态度的买家证实,这正是第一名具有战略意义而非仅仅是一个分数的原因。它是首个独立证据,证明微软自研的图像产品线在其专属构建的特定任务上击败了所有对手。
接下来看什么
• 随着票数累积,编辑领先优势还能保持吗? 1,272 Elo(约6,100个样本)是领先,但并非定局;Reve 2.1 落后10分。
• 正式发布与最终价目表——预览价格并非正式发布价格。
• 分辨率上限。100万像素的限制使Pro无法胜任印刷工作;如果Microsoft移除这一限制,情况就会改变。
• MAI-Image-2.6(私有预览版,8月19日)——该系列的下一步,在另一个主要竞技场上排名第二的文生图模型。
• 对供应商声明的独立评估——文本渲染准确性和字符一致性在微软外部尚未得到验证。
从分项排行榜得出的结论并不是"微软现在拥有最好的图像模型"。这个结论更窄、也更有用:微软如今在独立排行榜上拥有口碑最好的图像编辑器——价格不菲、尚处预览阶段,并且设有硬性的分辨率上限。 如果你从事的是修改现有图像的工作——主视觉、产品图、图像内文字——那这正是值得关注的模型。如果你做的是从空白画布开始的生成,那么第7名的排名说明更优选择仍是GPT Image 2——这才是这两个数字如实告诉你的信息。
