MAI-Image-2.6 的主视觉标题卡片,它是微软在 Arena 上排名第 2 的文生图模型,展示 Arena 得分 1,336、排名第 2,以及相较 MAI-Image-2.5 提升 +79 Elo。
Guides & Insights

MAI-Image-2.6-Preview:图像编辑排名第1,文生图排名第2

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

微软的 MAI-Image-2.6-Preview 不再只是 Arena 排行榜上一个你无法触碰的条目——它如今已是一个独立榜单的榜首。8 月 25 日,独立基准测评机构 Artificial Analysis 将同一预览版本在其图像编辑排行榜上列为第一,在文本生成图像榜上列为第二。编辑榜第一的位置使它超越了微软自家的 MAI-Image-2.5-Pro(此前的榜首)、Reve 2.1,以及 OpenAI 的 GPT Image 2,让微软在该榜单上占据前两名。据微软公告,该模型于 8 月 19 日在 MAI Playground 和 Microsoft Foundry 上进入私密预览——需邀请才能使用,仍无公开 API,也仍无价格表。

引人注目的不只是名次,还有它的轨迹。在 Arena 文本到图像榜单上最高冲到第 2 名的那个条目,名字就叫“mai-image-2.6-preview”,在那份快照中获得了约 3,500 票,并且相比 MAI-Image-2.5 单步上升了八位,Elo 增加了 +79。此后,全貌迅速补全:私人预览访问已于 8 月 19 日在 MAI Playground 和 Microsoft Foundry 上开放,Arena 的图像编辑榜单将该版本提升至第 3 名,而如今 Artificial Analysis 将其列为图像编辑第 1 名、文本到图像第 2 名。这使它成为迄今最强的独立信号,表明微软自研图像工作已缩小与 OpenAI 的差距——而公共 API 仍未普遍可用。

关键数字

• Arena 文生图排名:第 2 名 — 得分 1,336±11,初步,约 3,488 票

• 与第一名(GPT Image 2 Medium)的差距: 45 Elo

• 领先第三名(Grok Imagine Image 2.0): 20 Elo

• 超越 MAI-Image-2.5:整体 Elo 提升 +79,文本渲染 Elo 提升 +91

• 前代排名: MAI-Image-2.5 位列第 10(1,256)

• 图像编辑排名:在 Arena 的“Single Image Edit”中排名第 3——1,420 分,较第 5 名上升

• Artificial Analysis 图像编辑排名:第 1 名——领先于 MAI-Image-2.5-Pro(此前的第 1 名)、Reve 2.1 和 GPT Image 2;微软占据前两名

• Artificial Analysis 文生图排名:第 2 名——仅次于 GPT Image 2;在 19 个类别榜单中的 5 个位居第一

• 私人预览:于 8 月 19 日在 MAI Playground 和 Microsoft Foundry 上发布——厂商声明,仅限受邀者,暂无定价表

Scoreboard for MAI-Image-2.6: Arena T2I rank No. 2 (1,336 Elo, preliminary), gap to GPT Image 2 Medium -45 Elo, gain vs MAI-Image-2.5 +79 Elo, text rendering +91 Elo, best category 3D and modeling No. 1, API status expected next week. Footer notes Arena figures as of Aug 10, 2026 and that vendor claims are unreproduced.

MAI-Image-2.6 是什么

MAI-Image-2.6 是微软自研图像生成系列中的最新模型,诞生于 Mustafa Suleyman 领导的 Microsoft AI 之下。该系列发展迅猛:MAI-Image-1 是奠基之作,MAI-Image-2(2026 年 3 月)实现了照片级真实感与文本渲染的跃升,MAI-Image-2.5(2026 年 6 月)新增了专业级输出与编辑能力,并成为 Bing Image Creator、PowerPoint 和 OneDrive 背后的引擎,MAI-Image-2.5-Pro(2026 年 7 月)新增了 8K 高级层级——而 2.6 如今在前代发布约六周后问世。

节奏与模型本身同样重要。微软正以六到八周的周期推送图像方面的改进,这更接近前沿实验室发布文本模型的节奏,而不是图像市场历来演进的步调。发布时便在 Arena 上首次亮相即拿下第二名,一周后编辑能力排名又升至第三——一旦形成累积效应,这种节奏带来的就是这样的成果。

排行榜结果,请仔细阅读

Arena(即更名后的 LMArena)依据盲测人类偏好对图像模型进行排名:投票者会看到由同一提示词生成的两张图像,然后选出更强的一张。Artificial Analysis 也运行着同类独立的盲测偏好竞技场,并拥有自己的 Elo 评分。两者都是衡量人们实际偏好的独立指标,而非厂商自行开展的基准测试——正因如此,首次登场便位列第二才真正有分量,也正因如此,两个各自独立的榜单对同一模型得出一致结论,其意义胜过其中任何单一数字。这也正是这些数字需要附加说明的原因:Arena 的 1,336 分是初步结果,基于约 3,500 票,而排名第一的模型获得了超过 70,000 票,且该条目被标注为 "preview"。早期投票阶段的 Elo 会变动;不妨把方向视为可靠,而把具体分数视为暂定。

The Arena text-to-image leaderboard as of August 10, 2026, showing MAI-Image-2.6 in second place at 1,336 Elo with 3,488 votes, behind gpt-image-2 (medium) at 1,381 and ahead of grok-imagine-image-2.0 at 1,316.

相比那个头条数字,提升集中在哪些方面更值得关注。Arena 将 MAI-Image-2.6 在 3D 成像与建模中排在第一位(从第六位上升),并在卡通/动漫/奇幻(从第八位上升)、产品与品牌及商业设计(从第七位上升)、文本渲染(从第八位上升,Elo 提升 +91)以及艺术(从第四位上升)中排在第二位。微软表示,它在所有被衡量的类别中都有提升。这种覆盖面——商业设计、3D、文本和艺术——是通用图像模型的特征,而不是只擅长单一领域的专精模型。

随后又出现了两个数据点。Arena的图像编辑榜单——“Single Image Edit”类别——将同一个mai-image-2.6-preview构建位列第3名,得分1,420分,较第5名上升,并领先MAI-Image-2.5达19分,其中文本渲染是最大的单项提升(+43分)。8月25日,Artificial Analysis更进一步:其Image Editing Leaderboard将预览构建列为第1名,从微软自家的MAI-Image-2.5-Pro(此前以1,272 Elo位居第1)手中夺下榜首,同时领先Reve 2.1和OpenAI的GPT Image 2——微软现在占据该榜单前两名编辑位置。微软AI主管Mustafa Suleyman称2.6是“AA上最好的图像编辑模型”,并表示微软占据前五名中的三个席位——这是供应商的说法;底层排名是Artificial Analysis自己的。预览构建本身的AA编辑得分尚未公布,而两个榜单都处于早期阶段且投票数较少,因此应把趋势视为可靠,具体数字则视为暂时。

实际新增了什么(厂商报告)

在能力方面,微软自己对 MAI-Image-2.6 的描述是:

• 更强大的文本渲染、人像和 3D 图像

• 在产品、品牌和电影级应用场景中,实现更精美的商业级和照片级写实输出

• 在单次生成中处理多张参考图像

• 更丰富的依据 —— 更好地遵循提示词中的具体细节

• 对推理、格式和分辨率的更强控制力

这些每一项都是供应商自报的,尚未被独立复现。独立证据来自这对排行榜:在 Arena 和 Artificial Analysis 的文本到图像榜单上均位列第 2,在 Arena 的编辑榜上位列第 3,在 Artificial Analysis 的编辑榜上位列第 1——这些都还是初步结果。在 MAI-Image-2.6 广泛可用、第三方能够运行受控评估之前,把能力清单视为微软的说法,把这两个排行榜视为当前可用的信号。

当你真正能用它的时候

MAI-Image-2.6 本周从“仅限 Arena”变成了“Arena 加上官方预览”。8 月 19 日,微软宣布该模型已在 MAI Playground 和 Microsoft Foundry 上提供私人预览。这是厂商自己的说法,而且预览访问采用邀请制,而非公开注册——因此仍然没有价格表,也没有按 token 计费的 API。值得留意的实际信号是:当 MAI-Image-2.5 成为 Bing Image Creator 的默认模型,并进入 PowerPoint 和 OneDrive 时,这意味着微软认为它已可安全投入生产。类似的 2.6 在这些界面上推广——或者“预览”标签被去掉——将是它已准备好用于生产工作负载的信号。

Microsoft's announcement that MAI-Image-2.6 launches at No. 2 on the Arena leaderboard ahead of Google, Meta and xAI, with category highlights for text rendering, 3D imaging and modeling, branding and commercial, portraits, and photorealistic and cinematic output.

可能的花费

尚未公布 2.6 的定价——私人预览版没有价目表。参照基准是该系列的其他产品,均为厂商报告:

• MAI-Image-2.5:每百万文本输入token 5美元,图像输入8美元,图像输出47美元

• MAI-Image-2.5-Flash:$1.75 / $1.75 / $19.50 — 高用量层级

• MAI-Image-2.5-Pro(2026年7月):$5 / $8 / $106 — 8K 输出,96.8% 文本渲染准确率

这是微软已经在售的最便宜与最贵图像输出费率之间五倍的价差,因此 2.6 的生产成本将取决于它落在哪一档。按 2.5 每百万输出 47 美元的费率,一张消耗大约一千个输出 token 的图像成本接近五美分——但微软并不公布每张图像的 token 数,所以应把这当作算术推算,而不是报价。

当模型进入公共 API 后,定价也是路由层体现自身价值的地方。在 OrcaRouter 上,Microsoft 收取多少就按 0% 加价透传——即提供商标价,分文不加——因此无论是发布折扣还是之后的降价,都会在公布当天落到你的账单上。无需重新谈判,也无需第二份合同;该模型会和其他所有模型一样,出现在同一个密钥下。

这让图像模型竞赛处于何种境地

目前 Arena 文生图榜单的头部:GPT Image 2(Medium)以 1,381 分居首,MAI-Image-2.6 为 1,336 分,Grok Imagine Image 2.0 为 1,316 分,Reve 2.1 为 1,302 分,Meta 的 Muse Image 为 1,282 分。前五名模型的 Elo 分差仅约 100 分。Artificial Analysis 给出的总体结论与之相同——在文生图领域位列第二,仅次于 GPT Image 2——并补充了类别细节:该预览版本在其 19 个文生图类别中的 5 个里拿下第一(Material、Knowledge、Frontier、Retail & Ecommerce 以及 Marketing & Advertising),其余类别则均由 GPT Image 2 领跑。两个独立的偏好类榜单指向同一方向,这是对一款如此年轻的模型所能获得的最强信号。曾经将领跑者与其余模型拉开的质量差距,如今已被压缩到这种程度:“最好的图像模型”已不再是一个有意义的问题——编辑、接地、速度和价格才是。

微软的赌注比任何单一排行榜冠军都更宏大:一套自研模型栈,横跨图像、语音、代码与推理,并通过 Copilot、Bing 和 Office 分发。Arena 排名是工作量证明;分发才是真正的产品。

如何在不拿生产环境冒险的情况下试用它

Arena 预览版是免费的——如果你想要第一手信号,今天就可以用它来生成。如果你有私有预览权限,MAI Playground 和 Microsoft Foundry 入口让你在正式投入之前就能跑真实工作负载。对于其他人来说,采用一个评分仍为“初步”的全新模型,明智的做法是把一部分流量路由到它上面,同时保留你已验证的模型作为兜底。这正是路由层专为解决的那种故障场景:在 OrcaRouter 上,一旦 MAI-Image-2.6 被上游提供商托管,你就可以把一个端点指向它,让自动故障转移来兜住那些票数稀少的排行榜评分无法看到的边缘情况。一个 API key,200+ 模型,提供商价格原样透传。

接下来看什么

• 随着投票不断累积,Artificial Analysis 的编辑排名第一和 Arena 的第三名能否保持——这两个榜单都尚处早期,且投票量很低

• 公开 API 的价格以及它归入哪个层级——私有预览仍没有费率卡

• Bing Image Creator 和 Copilot 是否将它们的默认版本从 2.5 切换到 2.6

• API 开放后的独立基准测试

• “预览”标签是否会消失——这一信号表明微软已有足够信心将其正式发售

常见问题

我什么时候才能真正使用 MAI-Image-2.6?

目前可以通过 Arena 使用,而且是免费的。自 8 月 19 日起,它还在 MAI Playground 和 Microsoft Foundry 上以私人预览形式提供——根据微软自己的公告,因此访问采用邀请制,而非公开注册。目前仍然没有公开的、按 token 计费的 API,也没有公布价格。

图像编辑的效果有多强?

在Artificial Analysis的图像编辑排行榜上,MAI-Image-2.6-Preview位列第一,领先于MAI-Image-2.5-Pro、Reve 2.1和GPT Image 2——微软占据了前两名。在Arena的“单图编辑”榜单上,它以1,420分位列第三,排名较此前的第五有所上升。两者都是独立盲测偏好结果,但样本尚早且投票量偏低,而且该预览版本的AA编辑评分尚未公布。

它离 GPT Image 2 Medium 有多近?

在当前文生图 Arena 快照上相差 45 Elo——差距小到第 2 名与第 1 名之间的差异都落在投票流量所能改变的范围内,而排名前五的模型彼此之间也都在大约 100 Elo 之内。

Arena 排名可靠吗?

它们是独立、盲测的人类偏好结果,这正是其意义所在——但两者都还是初步的(文生图榜单上大约 3,500 票),并且依附于一个预览版本。相信方向,而不是小数点。

说到底:MAI-Image-2.6-Preview 是首个真正有资格跻身前沿阵营的微软图像模型——而且它很快就做到了:首次亮相便位列 Arena 文生图榜单第 2 名,到 8 月 25 日已在 Artificial Analysis 的图像编辑排名中登顶第 1,并在任何公开 API 推出之前,率先在微软自家产品界面上开启私密预览。如今,两个独立榜单得出了相同的解读。如果最终定价落在 Flash 档位附近,它将成为今年图像生成领域最具吸引力的性价比之选之一。编辑排名和预览版回答了“这是真的吗”。公开 API 及其定价将回答“这是否值得在其之上构建”。