对比 Qwen-Image 2.1 与 Meta Muse Image 的主视觉卡片:前者是依据研究许可证可下载的开放权重,后者是可经由 Meta 自有 API 访问的智能体模型,每张图像统一收费 1 美分
Guides & Insights

Qwen-Image 2.1 vs Meta Muse Image:可调用的模型 vs 可拥有的模型

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

这种比较有一个版本关乎图像质量,而它现在还写不出来——至少没法诚实地写。Qwen-Image 2.1由 Qwen-Image 团队于 2026 年 9 月 20 日发布,目前没有任何形式的独立评分。Meta Muse Image则由 Meta Superintelligence Labs 于 2026 年 7 月 7 日推出,是 Meta 首个自研图像模型,并且已经过实测——它位列 Artificial Analysis 图像编辑榜单第三,Elo 约为 1,105,在文生图项目中跻身前五,并以每千张图像 10 美元的价格处于质量与价格的帕累托前沿之上。但关于这两者,更有用的问题并不是哪一个更好,而是你分别被允许用它们做什么——而这两个答案几乎完全相反。

访问和可检查性是两回事,而没有人能同时提供两者。

Meta Muse Image 是你可以调用的那个。自 2026 年 8 月起,它已经可以通过 Meta 自己的模型 API 访问,价格为每张图片固定 $0.01——大约每千张 $10——通过一个兼容 OpenAI 的端点提供,这与该模型在 7 月推出时的描述相比是一个真正的变化,当时根本没有面向开发者的访问途径。在一个几乎所有其他东西都按 token 计费的类别中,这种固定费率并不寻常,而且它让成本预测变得非常简单:一千张图片就是十美元,无论它们是简单还是复杂。

Qwen-Image 2.1 是你可以保留的那一款。它是一份权重下载——扩散 transformer、文本编码器和 VAE 合计约 33 GB——依据 2026 年 9 月 20 日的 Qwen Research License Agreement 发布,该协议授予的权利“仅限非商业用途”,商业使用则需要单独许可。没有托管端点。没有固定费率。也没有任何隐藏内容:你可以查看其架构,查看提示词重写系统提示词,对其做 diff、覆盖它,并在自己的硬件上运行整套东西。

所以这个取舍不是质量与质量的较量,而是你不拥有、按量计费、受到计量且商业授权的模型,与你完全拥有、免费、未经计量且非商业的模型之间的对比。很少有团队能在不做出某种牺牲的情况下选择其中任何一边。

为什么 Muse 并不完全是通常意义上的扩散模型

Meta Muse Image 的特别之处在于,它不仅能生成。它会运行一个循环:它可以搜索网络、编写并运行代码,并在返回图像之前审查自己的输出。这是 Meta 自己的描述,也正是这个模型之所以有趣、而不只是有竞争力的原因——正是在这些智能体步骤中,提示词的歧义得以解决,像“把今年的数据做成一张图表”这样的请求也才能被真正回答,而不是仅仅近似完成。

这也是为什么它的行为更难以推理。传统图像模型是从提示词到像素的函数。而智能体式模型则有一条轨迹,而这条轨迹并不是你能从模型卡上读到的东西。厂商报告的数字——94% 的多图像角色一致性、最多 10 张参考图像、长边输出最高 1600 像素——描述的是能力范围,而不是运行循环。

Qwen-Image 2.1 以相反的方式解决了同样的歧义问题:显式地、公开地解决。除了图像模型之外,该版本还附带两个提示词重写检查点——Qwen/Qwen-Image-2.1-PE-T2IQwen/Qwen-Image-2.1-PE-I2I,每个都是一个约 18.8 GB 的微调 Qwen3.5-VL 9B——它们会接收模糊的指令,并在扩散模型看到它之前将其重写成精确的指令。I2I 变体始终有输入图像,因此它始终是编辑任务。而关键的是,重写器的行为在仓库中附带的 system_prompt.txt 中指定,这意味着决定你的提示词含义的这一步,是你可以阅读和更改的。

Meta 的智能体循环和 Alibaba 的提示词改写器,都是对“模型不知道你的意思”的回答。一个是替你做决定的服务。另一个是你可以编辑的文件。

当只有一侧有这些数字时,数字看起来是什么样子

Meta Muse Image 同时出现在 Artificial Analysis 的两个图像榜单上。它在图像编辑中排名第三,Elo 约为 1,105,落后于 Elo 为 1,122 的 MAI-Image-2.6 和 Elo 为 1,117 的 GPT Image 2(高),并在文生图中位列前五,Elo 约为 1,116。以每千张图像 10 美元的价格,它处于质量与价格的帕累托前沿上,这正是有利的位置:不是榜单上最好的模型,但却是少数几个多花钱就能换来可量化提升的模型之一。

Qwen-Image 2.1 完全没有这些。它只有一篇厂商博客文章,配了一张 Qwen-Image-Bench 图表,而这张图表没有任何第三方复现过;此外还有一份上手报告——来自 Qwen 大使计划中一位提前试用的测试者,他把最终权重跑在一个 ModelScope Studio 界面上,报告文生图大约需要 10–15 秒,编辑则需要 18–23 秒,并且从大约三张输入图像开始,多参考一致性就会下降。一位评测者,没有计时器,没有提示词集。这是一个有用的信号,但它不是基准测试;诚实的态度是把它当作关于该模型可能达到何种水平的线索,而不是它当前所处水平的证据。

Qwen-Image 2.1 真正领先的地方不在于质量,而在于像素层面的能力:默认原生输出 2048×2048 的 2K 图像,40 个推理步,七种宽高比预设,最多 10 张参考图像,可通过圈选、涂鸦标注或单独蒙版进行局部编辑,并支持透明图层编辑和从 RGB 照片中提取主体的 RGBA 生成。Meta 的模型上限为 1600 像素,其透明度方案尚未公布。如果你需要开箱即用的真正 alpha 通道,那这个决定已经替你做好了。

Two-column scoreboard for Qwen-Image 2.1 and Meta Muse Image: Qwen-Image 2.1 rows read Access open weights download, self-host / Licence research-only, non-commercial / Editing score none / Output 2048x2048 native with RGBA / Prompt handling inspectable rewrite checkpoint / Price your own GPU time; Meta Muse Image rows read Access Meta Model API, OpenAI-compatible / Licence commercial, via Meta / Editing score AA #3, Elo about 1,105 / Output up to 1600px / Prompt handling agentic loop, searches and self-reviews / Price flat $0.01 per image; footer reads 'Meta figures per Artificial Analysis; Qwen-Image 2.1 has no independent score yet.'

统一费率才是值得考虑的部分。

每张图固定一美分是定价决策,而非技术决策,它改变了这个模型的用途。按 token 计费的图像定价会惩罚复杂性:一条附带多张参考图的长指令比一条短指令更贵,这意味着单张图像的成本与其难度绑定在了一起。在固定费率下,这种绑定消失了,理性行为也随之改变——你不再为了长度去优化提示词,而是开始以模型本来的设计方式使用它,让智能体循环和参考图各司其职。

这也是一种只有服务自家模型的公司才能提供的定价方式,在选择服务商时值得专门点明。 OrcaRouter 在一个兼容 OpenAI 的端点背后接入 200 多个模型,按提供商标价、零加价提供,支持跨提供商自动故障转移,并提供一套路由 DSL,可将多个模型组合成单次调用。这里的关键特性在于透传:因为我们收取的是提供商的标价,而非加价后的价格,厂商的定价变动——出现一口价、token 费率下调——当天就能在我们这边生效,而不必等待合同流程。目前我们路由的模型中既不包括 Meta Muse Image,也不包括 Qwen-Image 2.1,本文也不会做相反的暗示;我们确实接入的图像模型是 OpenAI 的 GPT-Image 系列、Google 的 Imagen 4 各档位和 Gemini 图像预览版,以及 xAI 的 Grok Imagine 图像端点。

这次对比中真正要命的反差在于:这两个模型里,有一个好歹是有标价的。Meta Muse Image 每张图 0.01 美元,价格公开,就挂在一个你今天下午就能调用的 API 上。而 Qwen-Image 2.1 的代价是:下载 33 GB、一台你本来就有的 GPU,外加对一份写着"仅限非商业用途"的许可证做一轮法务审查。

它们意外交汇之处

两个模型都最多接受 10 张参考图像。这与其说是巧合,不如说是整个行业给出了一个答案:十张足以用于角色设定图、产品组图或风格参考包,而超过这个数量,条件控制就不再有益,反而开始相互冲突。Meta 为其模型公布了 94% 的多图像角色一致性数据;Alibaba 没有公布对应数据,而唯一一份独立的实测报告显示,一致性大约从第三张参考图像开始下降。两个模型宣称相同的上限,背后证据却大相径庭——这正是整个对比的缩影。

它们也共同指向一个双方都未能解决的问题:两者都无法同时满足这两点。Meta Muse Image 无法下载、无法审查,也无法在你自己的硬件上运行,而且其智能体循环从设计上就是一个黑箱。Qwen-Image 2.1 不能售卖、不能调用,也尚无法与任何东西进行对比衡量。如果你的约束是截止日期,那么其中一个今天就能用。如果你的约束是合规审查,或者需要确切了解你的流水线到底在做什么,那么另一个才适用。

Screenshot of the Artificial Analysis image-editing leaderboard captured September 9 2026, showing Meta Muse Image ranked third at Elo 1,105 behind MAI-Image-2.6 and GPT Image 2 (high), listed at $10.0 per 1,000 images on the quality-versus-price Pareto frontier, with no Qwen-Image 2.1 entry on the boardScreenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

根据你接下来必须做什么来选择,而不是根据哪个更好

如果你需要在本季度以商业许可交付图像生成,并且背后有一个可衡量的模型,那么 Meta Muse Image 就是答案,而每张图 0.01 美元是一个你能写进预算的数字。如果你需要从头到尾理解一个图像模型——注意力掩码、提示词重写器、VAE、许可证——Qwen-Image 2.1 是两者中唯一能让你做到这一点的,而它离无法用于其他任何用途,也只差一份研究许可证。两个选择都不是在质量上的妥协,因为质量问题在其中一方那里仍然悬而未决。当有足够多的人公开运行 Qwen-Image 2.1、把它送上某个榜单时,这个问题就会尘埃落定,而抢先体验的测试者被要求在 9 月 29 日之前发布。那一天,才是这场比较真正成立的日子。