
Meta Muse Image:模型、API,以及固定 $0.01 的图像
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 1008 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 194 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
如果你搜索了这个消歧义后的名称并找到了这里,简短的回答是:Meta Muse Image是 Meta 的代理式图像生成与编辑模型,它是专有模型,而非开放权重,你需要通过 Meta 自家的 Model API,在标识符 muse-image-1.0下以统一的 每张生成图像 $0.01的价格调用它,搜索接地功能已包含在该价格内。这就是搜索所问问题的全部答案,下面的所有内容都是它的参考说明——该模型能做什么、如何调用它、计费单位究竟是什么、Meta 关于溯源记录了哪些信息,以及文档到哪里为止。
关于本页面的收录依据,有两点值得直说,因为这个系列已经被宣布不止一次,再写一篇发布报道只会重复我们已有的内容。本页面是该名称的规范参考页:读者搜索该名称后最终到达的地方。它的收录依据是我们于2026年9月29日以第一方数据测得的持续需求——读者会以三种拼写输入该名称的消歧形式,带来数百次展示,而我们占据这个位置只是其他页面的偶然结果,并非因为我们写过一篇这种形态的页面,并且它的转化率几乎为零,因为我们发布的内容没有一个是参考页形态的。这项测量只是关于人们输入什么的事实,仅此而已;它丝毫不说明该模型在现实世界中的质量或受欢迎程度。而这里把可确定日期的锚点用作给模型定日期的依据,而非作为要报道的事件:Meta 为 Muse Image 和 Muse Video 发布的发布帖标注日期为2026年7月7日,并称该模型当日已在 Meta 各消费者界面上“即日起可用”,因此本页面采用的发布日期是2026年7月7日。下文每个数字均于2026年9月29日从 Meta 自己的页面上读取,除非句子另有说明。
Muse Image 实际上是什么
Meta 自己的一句话简介就是起点,因为它做的是实打实的事,而不是营销:Muse Image 是“一种智能体式图像生成,由搜索提供依据,并面向生产规模按每张图像 0.01 美元定价。”在 Meta 的模型页面上,能力范围被划分为四种工作模式——图像生成、精确编辑、锚定构图和多轮细化——而开发者文档将同一件事浓缩成一句话:“Muse Image 通过对话生成和编辑图像。”
用 Meta 的话说,其与众不同之处在于,Muse Image“是一个先推理、后渲染的图像模型”。Meta 的发布博文让这一点变得具体,而非仅停留在概念层面:“Muse Image 不是直接将提示词映射为图像,而是作为一个智能体来运作:它调用搜索和编程工具来提高准确性,对自身生成的结果进行自我精炼,并通过扩展测试时计算来不断改进。”在实践中,这意味着该模型在绘图之前先做规划;当提示词涉及现实世界的事实时,它会从网上获取实时参考资料;当精确性至关重要时,它会编写并运行代码——这正是 Meta 为实现精准图表和二维码所描述的路径——然后在返回结果之前对结果进行检查。
Meta 最先点名的三项能力,正是评估它的依据,而这三项能力就写在 Meta 自己的句子里:Muse Image“忠实遵循指令、精准编辑,并能基于多张参考图进行合成”。三项之中,编辑这项宣称最为犀利,因为它关乎克制,而非产出:Meta 的模型页面称,该模型“旨在只改变你明确指定的内容,其余一切原样不动”,并支持跨多轮迭代精修,而非一次性编辑。合成能力则对应“锚定合成”模式——将“一整系列生成结果锚定在一小组参考图上,使角色、风格与设定在逐张图像之间保持一致”;如果你要制作的是产品目录或广告集,而不是单张图片,这项能力就至关重要。合在一起看,这些正是区分“你会用来随手生成的图像模型”与“你会用来搭建流水线的图像模型”的宣称,而它们都是厂商的说法:Meta 并未针对该模型发布任何关于指令遵循或编辑保真度的独立基准测试。
智能体化的设计框架不仅仅关乎工具。Meta 在文档中说明,Muse Image 与 Muse Spark配对,后者是它的推理模型,从而使“两个模型共享工具并共同规划,实现强大的智能体式媒体生成”——文档给出的示例是多部分输出,例如动态 GIF、内嵌图像的页面,以及小型交互式游戏。如果你正在构建任何将生成图像与生成文本或代码混合在一起的东西,那么这种配对正是该设计中最值得理解的部分,也正是该模型与 Muse Spark 使用同一个 API 和同一套身份验证、而非置于拥有独立凭据的单独图像端点上的原因。
你怎么称呼它:API 表面
Muse Image is reached through Meta's Model API, and the developer documentation is specific about the shape of that call. The model identifier is muse-image-1.0, passed as the model field on every request. Requests go to the base URL https://api.meta.ai/v1 with a bearer token — the documentation notes that it uses the same base URL and auth as Muse Spark — and there are two image endpoints plus a conversational one:
• 生成 — POST /v1/images/generations,输入文本提示词,输出图像。
• 编辑 — POST /v1/images/edits,提示词加上输入图像,用于图生图任务。
• 跨轮次优化 — POST /v1/responses,即 Responses API,文档所述的多轮流程正是通过它实现的。
在图像端点上,文档中列出的参数很少,值得牢记,因为成本与输出格式正是在这里决定的。n 取值为 1 到 10,默认值为 1。size 接受形如 “WxH” 的字符串,例如 1792x1024,文档明确指出,在这些端点上它“仅设置宽高比,而非精确像素”——不要将其理解为分辨率保证。response_format 默认为 b64_json,或者 url,而 output_format 默认为 webp,同时 png 和 jpeg 也可用。智能体行为是可切换的:图像端点接受一个 tool_enablement 扩展,涵盖 enable_image_search、enable_web_search 和 enable_shell,以及一个 reasoning_strength,取值为 high(默认)或 low。调低推理强度是控制成本与延迟的杠杆,也是首先值得在自己的提示词上做 A/B 测试、而不是盲目相信的事情。
在 Responses API 上,相同的控制项位于一个 image_generation 工具对象内,该对象位于 tools 中,其中图像搜索、网页搜索和 shell 均默认启用,输出数组以固定顺序返回:先是一项推理项,概述模型规划并检索了什么,接着是一条消息项,然后每张图片对应一个 image_generation_call 项。图像本身以 base64 形式存放在该条目的 result 字段中,其 id 被文档说明为一个已签名句柄,你可以将其回传,以便在后续轮次中继续编辑同一张图像。这个句柄正是多轮细化背后的机制——它让你在修改图像某一处细节时无需重新上传整张图。两个图像端点也都接受 stream: true,生成时发出 image_generation.completed,编辑时则发出 image_edit.completed用于编辑。Model API 被文档说明为可与 OpenAI SDK、Anthropic SDK 以及兼容 OpenAI 的 agent CLI 直接替换兼容,因此现有的图像调用只需更改模型字符串,而无需重写。
有一条应当写进参考文档、而非放在脚注里的提醒:Meta 并未发布我们能够读到的 Muse Image 速率限制。Meta 自家开发者网站上的速率限制页面返回的只是一个空壳,上面没有任何数字,定价页面也是如此。如果吞吐量对你的设计至关重要,那这就是一个未知数——你只能通过 API 去发现,而无法从文档中获知。

价格,以及其计价单位
每张图像一美分。 这一数字读取自 Meta 自家为 Muse Image 设立的模型页面,该页面将该模型列在一张定价表中,其中搜索接地与推理均标注为已包含,价格则标为 $0.01/image;开发者文档也重申道:“Muse Image 按每张生成的图像固定收取 $0.01。”计价单位是图像,而非 token——文档直接这么写(“Muse Image 不按 token 计价”)——这一点很重要,因为以 token 报告用量的图像 API 通常就是按 token 计费的。Muse Image 会返回一个包含输入与输出 token 数量的 usage 块,而这些数量仅供参考。
这一计价单位带来三个计费细节。首先,n是一个乘数:一次返回十张图像的请求就按十张图像计费,因此1–10这个参数既是便利设置,也是支出控制。其次,失败不计费——生成失败或在返回之前被安全过滤移除的图像不计入。第三,搜索接地包含在单张图像价格之内,而不是单独的收费项;Meta 的文档称它"属于单张图像价格的一部分,因此不另行收取搜索接地费用"。最后这一点才真正让该费率对智能体工作具有实际意义:一个在渲染前先搜索网络的模型,可能在单次输出背后产生多次工具调用,而 Meta 表示这些工具调用不会与图像分开计费。
我们无法通过价目表核实这个数字,这一点值得说明,而不应略过。我们抓取的 Meta 开发者域名下的每个定价 URL 都只返回了一个页面空壳,里面没有任何美元金额,因此模型页面和图像生成文档是这个数字以可读陈述形式存在的两个地方。如果你在采购时需要第二个来源,如今 Meta 的网站上并没有。

实际上,一美分买到的是决策上的改变,而不是折扣。Meta 在模型页面上的说法是,该模型“让你能够运行此前因前沿定价而无法企及的工作负载”——广告变体生成、商品目录图像和按用户个性化——而按这个费率,十万张图像的标价约为 1,000 美元。如果你正在把这个费率与你可能已经在付费的高端图像模型进行权衡,有用的做法是,用你自己的提示词和你自己的评估把两者都跑一遍,而每张一美分正是让这种比较便宜到真正可行的原因。
溯源:Content Seal 能解决什么、不能解决什么
Meta 随此模型推出了一套隐形水印系统,并对其进行了足够精确的说明,值得引用:“Muse Image 包含 Content Seal,即我们的隐形水印系统。由 Muse Image 在 Meta AI 应用和 meta.ai 上创建的图像带有隐藏的来源信号,即使经过裁剪、压缩、调整尺寸或截图,该信号仍保持完整。”Meta 表示计划将 Content Seal 扩展到视频,并预览了一款检测工具,可让你检查图像是否带有该标记。
请仔细阅读这句话的适用范围,因为它比乍看之下要窄。文中所述溯源信号被描述为由在 Meta AI 应用和 meta.ai 上创建的图像所携带——也就是面向消费者的界面——而 Meta 的模型页面和 API 文档均未说明通过 Model API 生成的图像是否带有同样的标记。我们找不到任何一种说法,因此请将 Content Seal 视为一项面向消费者界面的溯源功能,在测试过你自己账户的输出之前,不要假定它会随 API 生成的文件一同出现。另外,我们所报道的唯一一次对该检测器的测试来自 Reuters,该测试发现它未能验证大多数经过裁剪的水印图像;这一发现及其数字载于我们关于该模型的解读文中,若要了解溯源方面的论证,应阅读那一页,而非本页。
运行位置
Meta 自己在发布帖中给出的可用性说明:Muse Image“即日起可在 Meta AI 应用和 meta.ai 上使用,在美国可在 Instagram Stories 中使用,在部分国家可在 WhatsApp 中使用,并将很快登陆 Facebook。”这些都是 Meta 的原话,而上述渠道也都是 Meta 自家的产品——它们均无需排队等候、无需邀请码,也无需单独注册。在开发者侧,该模型通过 Model API 提供服务,上文的标识符和端点正是为此而设。Meta 的模型页面在介绍运行该模型的方式时,也列出了第三方推理平台;我们在此不予点名,本页面中的任何内容都不应被解读为对 Meta 自家 API 之外任何渠道的条款或费率的说明。
Meta 尚未公布 Muse Image 登陆 Model API 的日期,Meta 的开发者文档中也未提及。本页唯一可依据的日期是模型本身的发布日期,即 2026 年 7 月 7 日,该日期取自 Meta 自己公告帖的日期栏。如果你要标注的是 API 层面的日期而非模型本身的日期,那就照 Meta 的说法——而 Meta 什么也没说。
开放权重还是专有?专有——而且该系列两者兼具
这是读者在这个系列中最常搞错的问题,所以值得直接回答。Muse Image 是专有模型。Meta 的开发者文档明确划出了界线:你通过 Model API 调用的那些模型——Muse Spark、Muse Image、Muse Voice Transcribe 和 SAM——都是以托管服务的形式提供的,而“Muse Glimmer 走的是另一条路:你下载开放权重,在自己的硬件上运行它,而不是通过 Model API 来调用它”,依据的是宽松的 Apache 2.0 许可。Muse Glimmer 是这个系列里的开放权重路线,而且它是一个不同的模型:一个从 Muse Spark 蒸馏而来的多模态模型,而不是 Muse Image 的开放版本。Meta 的 Muse Image 页面上没有任何地方声明许可或提供权重,因为根本没有权重可提供。如果自托管是硬性要求,那么 Muse Glimmer 才是值得评估的模型;如果你想用这里描述的图像模型,那就得调用 Meta 的 API,并按张付费。

Meta 声称其排名如何,标注为 Meta 的说法
Meta 的发布文章称:“Muse Image 在 Arena 的文本生成图像、单图编辑和多图编辑三个类别中位列第二,依据是截至撰写本文时基于人类偏好的 Elo 排名。”这句话有两点值得注意,而这两点都出自 Meta 自己的措辞。它是一份由厂商自行报告的排名,而非独立评分,而且它是一个基于人类偏好的 Elo排位,而不是在固定测试框架上跑出的基准结果——当排名前两位之间的差距小于一个基于有限票数构建的 Elo 评分的误差幅度时,这一区别就会带来实质性不同。Meta 与该说法一同发布的图表标注日期为“截至 2026 年 7 月 5 日”,而该说法本身也附带了“截至撰写本文时”的限定,因此它是由一个与之存在利益关系的一方所引用的实时排行榜快照,而非已成定局的排位。
同一篇帖子还包含一张 Meta 替你标注好的扩展图:展示质量随推理提升的图表配文为“来自内部消融的 Elo”。那是厂商内部的测量,无法与第三方榜单相提并论。Meta 的论点是,质量会随着测试时计算以近似对数线性的关系提升,并且推理与工具使用结合时会产生叠加效应——这是一次内部消融,而且被明确表述为内部消融。
针对该模型的独立排名确实存在,就在并非 Meta 的榜单上,而我们也已报道过:我们的解释文章载有 Artificial Analysis 的图像榜单和竞技场排名及其数据,两个对决页面则将这些数字与具名竞争对手并列呈现。如果你想要的是独立图景,而不是厂商的说法,那就去那里看。本页不会转载那些数字,而且无论如何,其中一个都必须仔细解读,因为 Artificial Analysis 只对提供可调用 API 的图像模型进行排名——因此,Muse Image 的独立排名是关于 Model API 的表述,而不是关于 Meta AI 应用的表述。
文档未能解答的问题
参考页面只有说明记录止于何处才有用,因此以下是我们在9月29日无法从 Meta 那里确认的内容。Muse Image 没有公开的速率限制。没有公开的延迟特征数据,没有成功率,也没有针对生产流量下智能体循环的独立评估——单张图像的价格有文档记录,但运行边界没有。没有任何独立第三方对指令遵循或编辑保真度的基准测试,Meta 自己也没有公布此类数字;Meta 模型页面上的基准图表不含任何可读的数字。没有许可声明,因为该模型未获授权下载。而且 Meta 的文档中任何地方都没有说明 Muse Image 在 Model API 上可调用的日期。这些缺失没有一项是回避该模型的理由——一张一美分、且包含搜索接地的图像,仅凭这一点就值得测试——但每一项都是理由:在让流水线依赖它之前,应当先测量而不是假设。
给开发者的裁决
如果你面临的是规模问题,Meta Muse Image 就值得评估:商品图库、广告素材变体、按用户个性化,凡是单张前沿模型价格曾让项目夭折的场景都算在内。单价有明文记录,计量单位没有歧义,失败不计费,而且搜索 grounding 包含在费率之内、而不是单独计费——这在本市场里足够少见,足以成为最大的卖点。但它不值得盲目录用,因为价格之外的一切——吞吐量、延迟、智能体循环在你的提示词上能否可靠收敛、来源标识信号是否随 API 输出一起传递——都没有文档说明,而厂商自家的排名主张只是某个时间点引用的人类偏好排名,并非经过实测的结果。在这里,诚实的决策形态是:用你手头已有的图像模型做一次一分钱的对照实验,在你自己的提示词上跑,背后有成本极低的失败模式和一层已被验证的兜底方案。至于这个模型是什么、如何调用、花费多少,本页就是参考;至于它该不该进入你的技术栈,只有你自己跑出来的数字才算数。
