用于 Meta Muse Image 对比 GPT Image 2 的主视觉标题卡,显示“Meta Muse Image vs GPT Image 2”,副标题为“先思考再绘制的模型 vs 文本之王”,下方是两个扁平圆角卡片,分别标注为“智能体”和“文本优先”。
Guides & Insights

Meta Muse Image vs GPT Image 2:思考型新秀 vs 文字之王

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Meta Muse Image 的生成方式并不像图像模型本该那样。它于2026年7月7日发布,是Meta Superintelligence Labs首款自研图像模型,代号Mango。它作为一个智能体运行:可以搜索网络,以事实支撑提示词,编写并运行代码来正确排布图表和二维码,并且在你看到结果之前就修改自己的草稿——Meta表示,这种自我修正的习惯并非显式编程而成,而是在强化学习中涌现的。这套机制所瞄准的目标是OpenA​I的GPT Image 2,后者于2026年4月发布,至今仍位居所有公开图像排行榜的榜首。Muse Image发布一个月后,诚实的评价是:它是今年最有趣的图像模型发布——但显然仍排在第二。

这两款模型都不是什么爆炸性新闻,这正是这场对决值得冷静对比而非发布评测的原因。GPT Image 2 自春季以来一直是领跑者,刚刚又迎来第二波势头:OpenA​I 将于8月30日从 ChatGPT 中停用 DALL-E 工具,将所有生成功能并入由 GPT Image 2 驱动的 ChatGPT Images,而8月7日的最新基准测试再次确认了其领先地位。Muse Image 发布后的头两周登上头条,是因为一次隐私失误——Meta 此后已收回相关做法——而且它仍然没有开发者 API。在喧嚣背后,技术层面的故事是实打实的:Meta 构建了第一个能明显“思考”的图像模型,而 OpenA​I 构建了第一个能绘制出真正可读文字的模型。这场对比中的其他一切都源自这两个事实。

Two-column comparison scoreboard for Meta Muse Image and GPT Image 2: availability 'App-only; no developer API yet' vs 'API-first; OpenAI API + OrcaRouter'; working mode 'Agentic: web search + code + self-correction' vs 'Autoregressive; optional thinking mode'; Text-to-Image Arena 'Elo 1,281, #3 (Jul 31)' vs 'Elo 1,381, #1'; in-image text 'claimed, unverified' vs 'best-in-class, CJK Hindi Bengali'; price 'free tier in Meta apps' vs '~$0.05 to $0.21 per 1024x1024 image'; editing 'strong multi-image (Meta-reported)' vs 'leader on edit boards'. Footer reads 'Muse Image figures per arena.ai + Meta; GPT Image 2 per arena.ai + OpenAI — August 2026.'

记分牌

两边采用相同的六个维度,因此无需表格也能一目了然地对比。Muse Image 的 arena 数据来自第三方,其编辑能力由 Meta 报告;GPT Image 2 的数据则来自 arena.ai 和 OpenAI 自己的定价页面。所有供应商报告的数字均已标注。

• 可用性 — Muse Image 仅限应用内使用,在 Meta AI、Instagram 和 WhatsApp 中免费,目前尚无开发者 API;而 GPT Image 2 以 API 优先,可通过 OpenA​I 的 API 和 OrcaRouter 调用。

• 工作模式 — Muse Image 默认采用智能体模式:网页搜索、代码执行、自我修正;而 GPT Image 2 则是单次自回归生成,附带可选的“思考”模式。

文生图竞技场 — Muse Image Elo 1,281,截至7月31日排名第三,而 GPT Image 2 Elo 1,381,排名第一 — 差距100分,大约相当于64%的预期胜率。

• 图像内文字 — Muse Image 声称通过其代码与渲染路径可生成准确文字,虽未与 GPT Image 2 的最佳水平进行独立基准测试,但能清晰呈现日语、韩语、中文、印地语和孟加拉语。

{{1}}• 价格 — Muse Image 在 Meta 应用中提供免费套餐,重度使用需订阅 Meta One,每月 $7.99 或 $19.99;而 GPT Image 2 在 API 上每张 1024×1024 图像约 $0.05 至 $0.21。{{/1}}

• 编辑 —— 根据 Meta 自身的评估,Muse Image 在单图和多图编辑上表现强劲,而 GPT Image 2 则是公开图像编辑排行榜上的绝对领先者。

智能体循环才是真正的产品

Meta对Muse Image的定位不是"更逼真的像素"——而是一种不同的工作模式。面对知识密集型提示词,比如一张带有现任冠军名字的温布尔登奖杯图片,Muse Image会先搜索网络,将生成过程锚定在搜索到的信息上,然后才进行绘制。对于图表、信息图和二维码,它会编写并运行代码,渲染输出,并利用该渲染结果来校准最终图像。Meta发布后的材料描述了模型对自身输出的反思:小错误进行小幅修正,大错误则彻底重绘,不确定时再搜索一次。一个引人注目的说法是,这种修订行为并非被显式编程——它是在强化学习过程中涌现出来的,因为修订能带来更高的人类偏好奖励。Meta报告称,自我修正带来的胜率提升在文生图任务中约为57%,在两个编辑类别中均约为56%;这些是厂商数据,尚待独立复现验证。

推理过程中的思考也会改变你为了让模型变得更好而选择拉动的那根杠杆。Meta 表示,Muse Image 的质量会随着推理步骤的增多而呈对数级提升,并且将算力投入到更深入的推理上,胜过生成多个候选方案再从中挑选最佳方案——这一立场将测试时计算视为前沿。GPT Image 2 在其可选的思考模式中也有类似思路,该模式会规划布局、能够搜索网络,并在绘制之前检查自己的工作;在 API 上,它以低、中、高三档思考参数的形式暴露出来,并按额外 token 计费。区别在于默认设置:Muse Image 从构造上就是一个智能体,生来就为循环而设计;而 GPT Image 2 的默认路径是单次生成,推理则是付费升级项。如果你相信图像生成正朝着使用工具、自我纠正的流水线方向发展,那么 Muse Image 是第一个完全围绕这一假设构建的生产级模型——它与 Meta 的 Muse Spark 语言模型配对使用,后者在图像模型绘制的同时进行规划,这是迄今为止对那一未来最清晰的呈现。

文本是鸿沟最宽之处

GPT Image 2 最站得住脚的优势是图像内清晰可读的文字——这是生产环境图像生成中呼声最高的单一能力。GPT Image 2 是首个能可靠渲染菜单、海报、信息图和多面板布局而不会出现乱码文字的模型,包括历史上难倒所有先前模型的非拉丁文字。这也是它横扫图像编辑排行榜的原因:编辑后的布局只有在其内部文字保持正确时才算成功。Muse Image 的代码-渲染路径是对同一问题的一次真正巧妙的尝试——它并不试图绘制文字,而是排版文字并合成结果——但目前还没有独立的基准测试表明它在文字密集型图像上能媲美 GPT Image 2 的输出,而且 Meta 自己的资料也将它的优势定位在编辑与构图,而非文字排版。

其中之一是可调用的;另一个是应用

对于任何构建产品的人来说,实际的分歧比基准测试所显示的更为明显。GPT Image 2 是 API 优先的:你可以通过 OpenA​I 的 images API 按 token 费率调用它——图像输入每百万 token 8 美元,图像输出 30 美元,文本输入 5 美元,文本输出 10 美元,缓存输入半价——在中质量下每张 1024×1024 图像大约 0.05 美元,高质量下约 0.21 美元,这还不算思考设置带来的额外费用。Muse Image 根本没有开发者 API。它在 Meta AI 应用、Instagram Stories 和 WhatsApp 中免费使用,更重度使用则受限于每月 7.99 美元或 19.99 美元的 Meta One 订阅,Meta 表示仍在评估是否向外部开发者开放该模型。你今天下午就可以试用 Muse Image;但你无法在其基础上进行构建。

Screenshot of the Meta AI chat interface on meta.ai, showing the 'What can I do for you?' prompt box, a left rail with 'New chat' and 'Vibes', a 'Sign up' button, and suggested prompts such as 'Create a 3-in-3 arcade game' — the consumer app where Muse Image is free to use.

这种不对称性正是本页能够路由其中一个模型、却无法路由另一个的原因。GPT Image 2 现已上线 OrcaRouter,路径为 openai/gpt-image-2——它是 gpt-image-1 的即插即用升级版,API 形态完全一致,按 OpenAI 官方标价计费,无任何加价,因此你看到的每百万 token $8/$30 费率就是供应商的原价,而供应商的任何降价也会在宣布当天同步生效。一旦 Meta 开放 Muse Image 端点——而 Meta 自身推出付费 Muse Spark API 的动作也表明那一天即将到来——两者就会从非此即彼变成路由决策:一个密钥即可在你自己的提示词上,让新模型与现有模型进行 A/B 对比,并在全新模型仍在摸索自身优势之际,自动故障切换到经过验证的生成器。这正是路由层存在的意义——不必把生产路径押在它上面,就能尝试那个有意思的新模型。

Screenshot of the OrcaRouter model page for openai/gpt-image-2, showing the $8.00 per million input tokens and $30.00 per million output tokens pricing, the 'drop-in upgrade from gpt-image-1' description, the OpenAI-compatible endpoint api.orcarouter.ai/v1/images/generations, and a 7-day performance block.

几乎定义了这次发布的隐私失误

Muse Image 上线后的头两周里,主导话题的并非基准测试,而是一项功能:用户可以在提示词中 @ 提及一个公开的 Instagram 账号,模型就会从公开照片中提取该人物的形象,并将其融入生成的场景中——而公开账户默认参与其中。隐私组织和好莱坞工会数小时内便提出反对;Meta 于 7 月 10 日移除了该功能,距离上线不到一周,但保留了底层模型。这一事件对这场比较而言是一把双刃剑。它提醒人们 Meta 真正的优势——其分发能力能让一个图像模型在一夜之间触达数十亿用户——以及随之而来的审视。此外,路透社发现,Meta 的 Content Seal 水印检测器在图片被裁剪后,无法验证 55% 的含水印图片,因此其审计追踪能力比宣传的要弱。这些都不会改变质量方面的评判,但它们是该模型公开记录的一部分。

该用哪一个

对于任何需要准确文本的场合——包装、海报、UI 原型图、信息图,或涉及非拉丁文字的管线——GPT Image 2 都是不二之选,而且它是这两者中目前唯一可以通过代码调用的模型。Muse Image 则是更有趣的实验:它的智能体循环(agentic loop)指向了图像生成的发展方向,编辑能力确实很强,而且现在就可以在 Meta 的应用中免费试用。两者之间的差距真实存在,但并非结构性差距——一个学会修订自己作品的模型,是这个领域从未面对过的那种竞争对手;如果它的自我纠正能力能够泛化,这 100 个 Elo 分的差距不会稳定太久。生产环境采用 GPT Image 2,密切关注 Muse Image 的 API 状态,并在它可被调用的那天,把这位新来者放到路由器后面。