
Qwen-Image 2.1 vs Meta Muse Image:可调用的模型 vs 可拥有的模型
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
这种比较有一个版本关乎图像质量,而它现在还写不出来——至少没法诚实地写。Qwen-Image 2.1由 Qwen-Image 团队于 2026 年 9 月 20 日发布,目前没有任何形式的独立评分。Meta Muse Image则由 Meta Superintelligence Labs 于 2026 年 7 月 7 日推出,是 Meta 首个自研图像模型,并且已经过实测——它位列 Artificial Analysis 图像编辑榜单第三,Elo 约为 1,105,在文生图项目中跻身前五,并以每千张图像 10 美元的价格处于质量与价格的帕累托前沿之上。但关于这两者,更有用的问题并不是哪一个更好,而是你分别被允许用它们做什么——而这两个答案几乎完全相反。
访问和可检查性是两回事,而没有人能同时提供两者。
Meta Muse Image 是你可以调用的那个。自 2026 年 8 月起,它已经可以通过 Meta 自己的模型 API 访问,价格为每张图片固定 $0.01——大约每千张 $10——通过一个兼容 OpenAI 的端点提供,这与该模型在 7 月推出时的描述相比是一个真正的变化,当时根本没有面向开发者的访问途径。在一个几乎所有其他东西都按 token 计费的类别中,这种固定费率并不寻常,而且它让成本预测变得非常简单:一千张图片就是十美元,无论它们是简单还是复杂。
Qwen-Image 2.1 是你可以保留的那一款。它是一份权重下载——扩散 transformer、文本编码器和 VAE 合计约 33 GB——依据 2026 年 9 月 20 日的 Qwen Research License Agreement 发布,该协议授予的权利“仅限非商业用途”,商业使用则需要单独许可。没有托管端点。没有固定费率。也没有任何隐藏内容:你可以查看其架构,查看提示词重写系统提示词,对其做 diff、覆盖它,并在自己的硬件上运行整套东西。
所以这个取舍不是质量与质量的较量,而是你不拥有、按量计费、受到计量且商业授权的模型,与你完全拥有、免费、未经计量且非商业的模型之间的对比。很少有团队能在不做出某种牺牲的情况下选择其中任何一边。
为什么 Muse 并不完全是通常意义上的扩散模型
Meta Muse Image 的特别之处在于,它不仅能生成。它会运行一个循环:它可以搜索网络、编写并运行代码,并在返回图像之前审查自己的输出。这是 Meta 自己的描述,也正是这个模型之所以有趣、而不只是有竞争力的原因——正是在这些智能体步骤中,提示词的歧义得以解决,像“把今年的数据做成一张图表”这样的请求也才能被真正回答,而不是仅仅近似完成。
这也是为什么它的行为更难以推理。传统图像模型是从提示词到像素的函数。而智能体式模型则有一条轨迹,而这条轨迹并不是你能从模型卡上读到的东西。厂商报告的数字——94% 的多图像角色一致性、最多 10 张参考图像、长边输出最高 1600 像素——描述的是能力范围,而不是运行循环。
Qwen-Image 2.1 以相反的方式解决了同样的歧义问题:显式地、公开地解决。除了图像模型之外,该版本还附带两个提示词重写检查点——Qwen/Qwen-Image-2.1-PE-T2I 和 Qwen/Qwen-Image-2.1-PE-I2I,每个都是一个约 18.8 GB 的微调 Qwen3.5-VL 9B——它们会接收模糊的指令,并在扩散模型看到它之前将其重写成精确的指令。I2I 变体始终有输入图像,因此它始终是编辑任务。而关键的是,重写器的行为在仓库中附带的 system_prompt.txt 中指定,这意味着决定你的提示词含义的这一步,是你可以阅读和更改的。
Meta 的智能体循环和 Alibaba 的提示词改写器,都是对“模型不知道你的意思”的回答。一个是替你做决定的服务。另一个是你可以编辑的文件。
当只有一侧有这些数字时,数字看起来是什么样子
Meta Muse Image 同时出现在 Artificial Analysis 的两个图像榜单上。它在图像编辑中排名第三,Elo 约为 1,105,落后于 Elo 为 1,122 的 MAI-Image-2.6 和 Elo 为 1,117 的 GPT Image 2(高),并在文生图中位列前五,Elo 约为 1,116。以每千张图像 10 美元的价格,它处于质量与价格的帕累托前沿上,这正是有利的位置:不是榜单上最好的模型,但却是少数几个多花钱就能换来可量化提升的模型之一。
Qwen-Image 2.1 完全没有这些。它只有一篇厂商博客文章,配了一张 Qwen-Image-Bench 图表,而这张图表没有任何第三方复现过;此外还有一份上手报告——来自 Qwen 大使计划中一位提前试用的测试者,他把最终权重跑在一个 ModelScope Studio 界面上,报告文生图大约需要 10–15 秒,编辑则需要 18–23 秒,并且从大约三张输入图像开始,多参考一致性就会下降。一位评测者,没有计时器,没有提示词集。这是一个有用的信号,但它不是基准测试;诚实的态度是把它当作关于该模型可能达到何种水平的线索,而不是它当前所处水平的证据。
Qwen-Image 2.1 真正领先的地方不在于质量,而在于像素层面的能力:默认原生输出 2048×2048 的 2K 图像,40 个推理步,七种宽高比预设,最多 10 张参考图像,可通过圈选、涂鸦标注或单独蒙版进行局部编辑,并支持透明图层编辑和从 RGB 照片中提取主体的 RGBA 生成。Meta 的模型上限为 1600 像素,其透明度方案尚未公布。如果你需要开箱即用的真正 alpha 通道,那这个决定已经替你做好了。

统一费率才是值得考虑的部分。
每张图固定一美分是定价决策,而非技术决策,它改变了这个模型的用途。按 token 计费的图像定价会惩罚复杂性:一条附带多张参考图的长指令比一条短指令更贵,这意味着单张图像的成本与其难度绑定在了一起。在固定费率下,这种绑定消失了,理性行为也随之改变——你不再为了长度去优化提示词,而是开始以模型本来的设计方式使用它,让智能体循环和参考图各司其职。
这也是一种只有服务自家模型的公司才能提供的定价方式,在选择服务商时值得专门点明。 OrcaRouter 在一个兼容 OpenAI 的端点背后接入 200 多个模型,按提供商标价、零加价提供,支持跨提供商自动故障转移,并提供一套路由 DSL,可将多个模型组合成单次调用。这里的关键特性在于透传:因为我们收取的是提供商的标价,而非加价后的价格,厂商的定价变动——出现一口价、token 费率下调——当天就能在我们这边生效,而不必等待合同流程。目前我们路由的模型中既不包括 Meta Muse Image,也不包括 Qwen-Image 2.1,本文也不会做相反的暗示;我们确实接入的图像模型是 OpenAI 的 GPT-Image 系列、Google 的 Imagen 4 各档位和 Gemini 图像预览版,以及 xAI 的 Grok Imagine 图像端点。
这次对比中真正要命的反差在于:这两个模型里,有一个好歹是有标价的。Meta Muse Image 每张图 0.01 美元,价格公开,就挂在一个你今天下午就能调用的 API 上。而 Qwen-Image 2.1 的代价是:下载 33 GB、一台你本来就有的 GPU,外加对一份写着"仅限非商业用途"的许可证做一轮法务审查。
它们意外交汇之处
两个模型都最多接受 10 张参考图像。这与其说是巧合,不如说是整个行业给出了一个答案:十张足以用于角色设定图、产品组图或风格参考包,而超过这个数量,条件控制就不再有益,反而开始相互冲突。Meta 为其模型公布了 94% 的多图像角色一致性数据;Alibaba 没有公布对应数据,而唯一一份独立的实测报告显示,一致性大约从第三张参考图像开始下降。两个模型宣称相同的上限,背后证据却大相径庭——这正是整个对比的缩影。
它们也共同指向一个双方都未能解决的问题:两者都无法同时满足这两点。Meta Muse Image 无法下载、无法审查,也无法在你自己的硬件上运行,而且其智能体循环从设计上就是一个黑箱。Qwen-Image 2.1 不能售卖、不能调用,也尚无法与任何东西进行对比衡量。如果你的约束是截止日期,那么其中一个今天就能用。如果你的约束是合规审查,或者需要确切了解你的流水线到底在做什么,那么另一个才适用。


根据你接下来必须做什么来选择,而不是根据哪个更好
如果你需要在本季度以商业许可交付图像生成,并且背后有一个可衡量的模型,那么 Meta Muse Image 就是答案,而每张图 0.01 美元是一个你能写进预算的数字。如果你需要从头到尾理解一个图像模型——注意力掩码、提示词重写器、VAE、许可证——Qwen-Image 2.1 是两者中唯一能让你做到这一点的,而它离无法用于其他任何用途,也只差一份研究许可证。两个选择都不是在质量上的妥协,因为质量问题在其中一方那里仍然悬而未决。当有足够多的人公开运行 Qwen-Image 2.1、把它送上某个榜单时,这个问题就会尘埃落定,而抢先体验的测试者被要求在 9 月 29 日之前发布。那一天,才是这场比较真正成立的日子。
