一张生成的主视觉卡片,标题为“Muse Code”,副标题为“Meta 为 Muse Spark 打造的终端编码智能体”,并带有两个圆角信息标签,分别写着“终端 + CI”和“每月 5 美元起”。OrcaRouter 徽标合成在右下角。
Guides & Insights

Muse Code:谁开发的、费用是多少,以及当前是哪个版本

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Muse Code是 Meta 面向终端和 CI 的编码智能体,专为 Muse Spark 模型系列打造,而对来到这里的人来说,最重要的两个版本是 Muse Spark 1.3——当前代际,日期为 2026 年 9 月 2 日——以及 Muse Spark 1.2,后者是除非你另行指定,否则 CLI 仍会选用的版本。Muse Code 以原生 muse 二进制文件安装,可交互式或无头运行,并以三种方式销售:每月 $5.00、$15.00 和 $50.00 的三档月度套餐,以及在 Meta Model API 上按用量付费的 token 计费,Standard 层级每百万输入 token $1.25、每百万输出 token $4.25。再往前一代,Muse Spark 1.1,仍在同一层级以相同费率提供服务。

请将其作为参考页面阅读,而非新闻。Muse Code 本身并不是什么需要报道的新事物:Meta 于 2026 年 8 月 5 日以测试版形式发布,并于 2026 年 8 月 31 日结束测试,而本页面使用这些日期是为了将该模型置于时间线上,而非为了宣布它。本页面的依据是持续存在的搜索需求,我们于 2026 年 9 月 28 日亲自测量到,其中,裸查询“muse code”在过去 28 天内获得了 4,547 次展示,点击量为零,而同一意图的商业化拼写——“muse code free”、“muse code plan”、“muse code plans”、“muse code free tier”、“muse code 1.3”——又获得了 124 次展示,同样点击量为零。读者正在提出四个具体问题。本页面依据 Meta 自己的文档,按顺序回答这些问题,并明确说明某个数字是来自 Meta 而非独立评估者。

如果你真正需要的是对智能体行为的评测,或是与其他编码框架的正面较量,那这一页并不是你要找的内容。那些文章本博客上已经有了,值得你花时间的几篇链接在文末。

Muse Code 是什么,以及是谁制作的

厂商定义只有一句话:“Muse Code 是 Meta 面向终端和 CI 的编码代理,专为 Muse Spark 打造。”它不是库,不是聊天界面,也不是模型——它是一个运行框架。你在项目目录中运行它;它会制定计划、编辑文件并执行命令来完成任务,并且从第一次运行起就启用了审批机制和操作系统沙箱。

Meta 将 Muse Code 和 Meta Model API 定位为通往同一底层模型的两条路径:当你构建自己的智能体或应用时,直接调用 API;当你想要一个开箱即用的编码智能体,用于命令行或流水线中时,就运行 Muse Code。这一区别对定价很重要,因为订阅购买的是运行框架,而 API 密钥则按 token 单独计费。

安装只需一行命令,而两个厂商界面在这个字符串上并不完全一致:

• macOS 和 Linux — curl -fsSL https://dev.meta.ai/install.sh | sh,在文档页面上,以及同一命令,以| bash结尾,出现在营销页面和两篇研究博客文章中

• Windows — irm https://dev.meta.ai/install.ps1 | iex,仅发布于文档页面

• 验证 — muse --version,然后muse在项目目录中运行即可启动交互式会话

• 首次运行时——系统会要求你信任该工作区(只有信任后才会加载其中的技能、规则和钩子),并通过浏览器登录或 API 密钥进行身份验证;在 CI 中则改为设置 META_API_KEY 即可

• 两种界面 — muse 用于交互式终端 UI,muse exec "<prompt>" 用于单次非交互式运行直至完成

• 从你自己的程序中驱动它 — muse serve 运行版本化的会话协议,muse schema 打印其 JSON 架构,并且 npm install @muse-code/sdk 安装 TypeScript 封装

最后一点正是大多数总结会遗漏的部分。Muse Code 不仅仅是一个 CLI:会话协议是一个有文档记录、带版本的接口,而变更日志显示它正被有意扩展——会话可以通过该协议重命名,客户端可以读取每次编辑的结构化差异摘要,驱动程序还可以设置会话范围的推理强度默认值。

A screenshot of Meta's Muse Code product page at dev.meta.ai, showing the headline 'A coding agent for your most complex coding workstreams. Build, debug and ship with Muse Code', the install command curl https://dev.meta.ai/install.sh | bash, and the availability line 'Available for MacOS and Windows.'

Muse Code 的费用是多少,以及免费套餐问题的直白解答

没有免费套餐。这一点值得直截了当地说明,因为它是需求数据中被问及最多的单一商业查询,而答案明确无误:Muse Code 的产品页、订阅页和更新日志中均不含免费方案、不含试用、不含免费额度分配,也不含限速的免费访问。

关于那项核查,有一点需要提醒。Meta 的定价文档确实有一次使用了“platform free-tier credits”这个说法——在 Muse Voice Transcribe 的说明中,其中写道,零数据保留转写的定价与 Standard 层级持平,并且适用平台免费层级额度。Muse Voice Transcribe 是 Meta Model API 上一个独立的产品,有自己的按小时计费;那句话完全没有提到 Muse Code。如果你发现这行被引作 Muse Code 存在免费层级的证据,那它就是被断章取义了。

Meta 确实公布的是三种订阅层级,均按月计费;此外,对于超出套餐提示词额度的任何用量,还提供按量付费的 token 计费:

• 日常使用 — $5.00/月;可使用最新的 Muse 模型;每 5 小时 10–50 次提示,包括图像和视频上传;语音模式;网页搜索

• High Usage — $15.00/月;包含 Everyday 套餐中的所有内容;用量是 Everyday 的 5 倍;更多提示词;更多多模态输入

• Power Usage — $50.00/月;包含 High Usage 套餐的全部内容;Everyday 用量额度的 20 倍;扩展提示词;抢先体验新功能;更高的文件上传量

• 标准 token 费率——每百万输入 token 1.25 美元,每百万输出 token 4.25 美元,每百万缓存输入 token 0.15 美元,对muse-spark-1.3、muse-spark-1.2 和 muse-spark-1.1均适用

• 贡献者 token 费率——每百万输入、输出和缓存输入 $0.10 / $0.20 / $0.002,适用于 muse-spark-1.3-contributor 和 muse-spark-1.2-contributor

Standard 与 Contributor 两个层级的实质性差异只有一处,Meta 在模型页面和价目表上都明确说明了这一点:在 Standard 上,你的提示词和补全结果不会被用于训练 Meta 模型;在 Contributor 上则会。产品页面将 Contributor 的各行标注为“用于改进我们的产品”,将 Standard 的各行标注为“不用于改进我们的产品”。Contributor 的输入价格约为十二分之一,输出价格约为二十一分之一,这一差距之大,使它首先是一个数据治理决策,其次才是预算决策。

在确定工作负载规模之前,有三个定价细节很容易被忽略,但都值得了解:

• 无长上下文溢价——Meta 的费率卡明确说明了这一点:无论上下文窗口大部分为空还是几乎占满,你都支付相同的费率,这很不寻常,并且会实质性改变长时间智能体运行的经济性

• 网页搜索依据(grounding)单独计费——每 1,000 次搜索查询收费 2.50 美元,并需在请求的 token 费用之外额外支付,适用于 Muse Spark 等文本模型

• 速率限制按团队而非按密钥计算——Standard 上为每分钟 3,000 次请求和 4,000,000 个 token,Contributor 上为每分钟 100 次请求和 3,000,000 个 token;在一个团队内使用多个密钥不会使配额倍增

订阅机制记录在 Meta 的订阅页面上,且属于常规做法:升级按比例计费并立即生效,降级在下一个计费周期生效,取消需在账单日至少提前 24 小时,已取消的订阅不予退款,除非法律要求退款。订阅仅涵盖 Muse Code CLI 凭据;额外的 API 密钥按使用量计费。

A generated scoreboard card titled 'Muse Code — the scoreboard', listing six vendor-published figures: Vendor Meta; current model Muse Spark 1.3; CLI release 1.2.1; Standard price $1.25 in / $4.25 out per 1M; Contributor price $0.10 in / $0.20 out per 1M; free tier none. The footer reads 'All figures vendor-published on dev.meta.ai, checked 2026-09-28.'

哪个版本是当前版本:1.2.1、Muse Spark 1.3,以及那个两者都不是的默认版本?

这是需求数据呼声最高的一个问题——光是 "muse code 1.3" 这个查询词本身的存在就说明了这点——而它确实令人困惑,因为"版本"可以指三种不同的东西,而 Muse Code 这三种全都发布。

• CLI 版本——1.2.1 是当前版本。Meta 的更新日志将其各版本列为 1.2.1、1.1.1、0.2.1 和 0.1.0,其中最后一个被标注为“发布版本”。

• 模型代次——Muse Spark 1.3,于 2026 年 9 月 2 日发布,Meta 的模型页面将其描述为“最新版本……推荐用于新工作”

• CLI 的默认模型 — muse-spark-1.2,在文档的首次运行部分中说明,并在配置页面的模型选择下再次说明

因此,全新安装 Muse Code 1.2.1 后会运行 Muse Spark 1.2,除非你传入 --model muse-spark-1.3,或者在会话中途使用 /models 切换。Meta 自己的快速入门页面在每个 API 示例中都使用 muse-spark-1.3,这让这种差异比它本应呈现的更容易被误读:如今 API 示例和 CLI 默认值指向的并不是同一个模型。

1.2.1 更新日志描述的是测试框架中的变化,而不是模型中的变化,重点条目如下:

• 在 macOS 上默认开启语音输入,绑定为 Option+V,管理命令为/voice

• 一个 /rewind 命令,可将对话回退到较早的输入,并复用双击 Esc 所用的选择器

• [Image #N] 标签会标注在粘贴和拖放的图片上,这样就能按编号向模型询问某一张具体的图片,而且标签和源路径在恢复、回退和分叉后依然保留

• 内置的 migrate 技能,可将记忆笔记和 MCP 服务器定义从 Claude Code 或 Codex 导入到 Muse Code 中

• /mcp 用于查看已连接的 MCP 服务器及其工具的实时清单

• 新会话将在“自动审核”权限配置文件中打开,它授予与“询问我”相同的访问权限,但会将符合条件的审批请求路由到自动审核器,当审核器不可用时则回退为询问你

• 安全修复,其中三项是行为性的而非表面性的:通过诸如 env 和 setsid 之类的包装器启动的命令,现在会按它们实际启动的命令进行审查;会话中途更改权限模式会在已运行工具的下一次操作时生效;并且“不受限制”权限配置文件现在的行为与 --yolo

在模型方面,9月2日的公告明确表示,Muse Spark 1.3 是在多种不同的运行框架上训练而成的,并且 Meta 推广的是推理档位——“启用最大推理的 Muse Spark 1.3 现已在 Muse Code 和 Meta Model API 上提供”——而不是仅基础模型。8月5日的 Muse Spark 1.2 发布文章则补全了这件事的另一半:Muse Spark 1.2 是与 Muse Code 本身共同训练的,使用了拒绝采样的运行框架轨迹,以及在目标、压缩和子代理方面的配方工作,并整合了 Muse Code 工具集以最大化运行框架兼容性。模型与运行框架是相互针对彼此开发的。

包络:上下文、模态、平台

Muse Spark 1.3、Muse Spark 1.2 和 Muse Spark 1.1 共用同一套规格,Meta 只用一行表格就把它说清楚了:上下文长度 1,048,576 个 token,输入支持文本、图像、视频、音频和 PDF,输出仅有文本,且所有版本、所有层级皆然。

模态对等性伴随着一个注意事项,Meta 将其作为脚注发布,值得重复而不是埋没:Muse Spark 1.3 中的音频理解并未得到完全支持,包含音频内容的请求的响应质量可能会下降;Meta 自己的建议是音频使用 Muse Spark 1.2,或使用 Muse Voice Transcribe 进行专用语音转文字。在 CLI 中这是可操作的——--model muse-spark-1.2是一个有文档记录的覆盖选项,而且默认值已经指向那里。

推理努力程度是 harness 层面的一项设置,共有八个等级,Meta 的配置页面按顺序列出了它们:none、minimal、low、medium、high(默认值)、xhigh、max 和 ultra。该列表中有三个细节至关重要:

• max是最深层的推理级别,被描述为超越 xhigh的扩展推理,而 Muse Code 在 Standard 和 Contributor 两个层级上均提供该功能

• ultra 是一个客户端设置,而非模型层级:它会映射到每个提供商所支持的最高推理层级,并可能让 Muse Code 更激进地委派;如果某个提供商不支持该设置,则 ultra 请求会运行在 xhigh

• 提供程序不接受 none,因此最低级别只能通过测试框架中配置的其他提供程序使用

平台支持正是 Meta 这两个页面说法不一致的地方,分歧虽小却真实存在。文档页面称 Muse Code 基于同一套代码库即可在 macOS、Linux 和 Windows 上运行,并列出了三项 Windows 特有的行为:PowerShell 取代 Bash,因此代理执行的命令使用 PowerShell 语法和 Windows 命令行工具;沙箱可能会请求管理员批准,Windows 在沙箱首次初始化时可能弹出用户账户控制提示,不过正常使用并不需要以管理员身份运行;另有两项功能在 Windows 上不可用——语音输入和会话消息传递,而这两项在 macOS 和 Linux 上均可正常使用。相比之下,产品页面只写着“适用于 MacOS 和 Windows”。这两种表述如今都出自 Meta 自己的网站;合起来读,它们意味着 Windows 虽受支持但存在有据可查的缺口,而 Linux 同样受支持,尽管营销页面并未提及。

还有一个关于可用性的细节来自文档而非营销文案:Workflows——即并行与分阶段的智能体编排——只有在已安装的构建版本包含工作流引擎、且该功能已启用发布时,才能协调工作;Meta 明确表示,它们“并非在每个构建版本或平台上都可用”。如果你安装的原因正是某个工作流功能,那就去确认你的构建版本确实包含它,而不要想当然。

Meta 声称的内容,并指明了所用的测试框架和投入力度

Meta 发布基准测试材料,所以这里诚实的表述不是“没有厂商基准测试”——而是“这些是厂商基准测试,比较条件在 Meta 说明它们的地方写明。”

Meta 在文字叙述中提出的唯一量化说法出现在 Muse Spark 1.3 公告中,而且它被归因于内部比较,而不是第三方评估:“在 Meta 工程师进行的比较中,它被证明明显更快、更高效,所用工具调用少约 20%,token 少约 25%。”基线已经说明——相对于 Muse Spark 1.2——而投入程度则来自公告自身的表述,因为该发布版本的标题围绕的是 Muse Spark 1.3 搭配最大推理(max reasoning)。未说明的是任务集、运行次数,或除它使用 Muse Code 这一事实之外的评测框架配置。请把这两个百分比视为厂商报告的趋势方向,而不是实测基准结果。

另一个已公布的结果是一项案例研究,而非评分,而且是两者中更有意思的那个。Meta 报告称,其测试了 Muse Spark 1.2 在 1,000+ 次工具调用和长达 24 小时内迭代优化 GPU 内核的能力,使用 Muse Code 的智能体编程环境来编写、编译、分析,并相对于给定基线逐步提升内核性能。工作负载有明确名称——NVIDIA Hopper GPU 上的 KDA 和 MLA 内核——约束条件也同样明确:禁止使用 FLA 等第三方内核库,而基线则是 Triton FLA KDA 实现。一次持续 24 小时、上千次工具调用的运行,与基准测试百分比是不同种类的证据。它在一定程度上说明了在长时程目标下的耐力,却几乎无法说明相对质量。

Muse Spark 1.2 和 Muse Spark 1.3 的发布图表将这些模型与一小部分具名竞品进行对比,涵盖智能体、编程、指令遵循和长上下文评估——DeepSWE v1.1、SWE-Atlas-QnA、Terminal-Bench 2.1 和 4.0、tau2-bench、GDPval、SciCode、IFBench、MultiChallenge 以及 AA-LCR v1.1 都出现在坐标轴中。这些图表由厂商制作并由厂商绘制,其中的竞品配置是 Meta 的选择,而非中立的评审组合。出于这一原因,我们在此不复制柱状图数值:把厂商图表当作排行榜来解读,正是本页旨在避免的失败模式。

有两处真实的缺口值得明确指出,而非含糊带过:

• Meta 并未发布 Muse Code 在具名任务集上以匹配投入与 Muse Spark 1.2 进行正面对比的结果;~20%/~25% 这个数字是最接近的东西,而且它是一项内部比较,给出的是明确的效率差异,而不是分数

• Meta 并未发布 CLI 的实时延迟评估,而已公布的任何数字都无法描述真实编辑负载下使用会话是什么感受

Artificial Analysis 独立衡量什么

Artificial Analysis 是独立评估机构,目前发布了一项涵盖 Muse Code 的编码智能体测量结果,而它与上文的任何数字都不是同一种:表中的行是 harness 与模型的配对,由 AA 而非供应商进行评估。

在 Artificial Analysis Coding Agent Index 上——该页面在其自身的结构化数据中标识自己为 v1.5——Muse Code 各行显示为:

• Muse Code Spark 1.3 在最大推理强度下 — 54.3

• Muse Code 以 xhigh 推理运行 Muse Spark 1.3 — 48.3

• 同一榜单的榜首 —— Claude Code 运行着 Claude Opus 5.5,推理强度拉满,得分 66.0

关于这些数字,有两点比数字本身更重要。第一,max 行与 xhigh 行之间 5.0 分的差距,是同一个模型、同一套测试框架、只改动了一个设置,这恰好提醒我们:如果不说明 effort level(投入档位),所谓“Muse Code 得分”就是定义不清的。第二,这个榜单与我们自己九月对 Muse Spark 1.3 的报道所引用的并非同一种测量:那篇较早的文章给出的数据是 Muse Spark 1.3 在 max 下为 68、在 xhigh 下为 64,Claude Opus 5 在 xhigh 下为 68。这些数字已不再出现在现行榜单上——当前榜首是 Claude Opus 5.5 在 max 下以 66.0 位居第一,而 Muse Code 各行分别为 54.3 和 48.3。该指数已经过修订,评测对象的构成也发生了变化。如果你还在沿用那些旧数字,它们已被取代,而且这两组数据绝不应被并排引用,仿佛它们是同一种测量做了两次。

Muse Spark 1.3 的 AA 模型页面又是一个独立的界面,其数据也由 AA 自行测量,而非厂商报告:智能指数为 48.09,Terminal-Bench 2.1 为 84.3%,GPQA Diamond 为 93.5%,HLE 为 48.7%,SciCode 为 58.8%,长上下文召回率为 83%,发布日期为 2026-09-02,上下文窗口为 1,000,000 个 token,并被归类为专有、闭权重。请注意,这只是某个模型页面上的一个指数修订版本——AA 按模型发布指数,并按各自的节奏进行修订,因此将本页面的数据与另一个模型页面的数据混在一起,并不能得到同一快照下的比较。

所有这些都没有提供给你的,是一项匹配对照。AA 的编程评测行从构造上就跨 harness——Muse Code 对 Codex、对 Claude Code、对 Grok Build、对 Kimi Code CLI——因此逐行解读是在把一个 harness-模型组合与另一个 harness-模型组合相比较,而不是在同一个 harness 下比较两个模型。在 Meta 尚未进行匹配对照、且 AA 的榜单并非为回答该问题而构建的情况下,诚实的立场是:在匹配的 effort 和 harness 下,这种正面对决并不存在,而不是从相邻数字中构造出一个来。

OrcaRouter 会路由哪些内容,以及不会路由哪些内容

OrcaRouter 是一个覆盖 200+ 模型的单一端点,按各提供商的标价计费、零加价,这意味着该系列模型的可用性是可核查的,而并非取决于政策。今天我们已对照实时公开的模型列表进行了核查:

• meta/muse-code——不在目录中。Muse Code 是一个测试框架,不是可路由的模型,我们不对其提供服务

• meta/muse-spark-1.3——不在目录中

• meta/muse-spark-1.2 — 可路由,上下文窗口为 1,048,576 个 token,定价为每百万输入 token 1.25 美元、每百万输出 token 4.25 美元、每百万缓存读取 0.15 美元,与 Meta 公布的价格一致

• meta/meta-spark-1 — 同样可路由,按相同的三档费率

所以在 OrcaRouter 上,实际情形是:你可以通过与用于其他一切内容的相同端点访问已发布的 Muse Spark 各代模型,而无法通过它访问 Muse Code 或当前的 1.3 代。请只把这当作对当前目录的描述,仅此而已;可用性会变化,模型列表才是查看它的地方。

A screenshot of the OrcaRouter model page for Meta: Muse Spark 1.2, showing the model slug meta/muse-spark-1.2, a 1,048,576-token context window, text, image, video, file and audio inputs with text output, pricing of $1.25 per million input tokens and $4.25 per million output tokens, and the OrcaRouter navigation in English.

对于这类工作负载,路由器真正证明自己价值的地方,在于订阅制给不了你的两件事。第一,单个 API 密钥本身就是一个路由层,当某个提供商性能下降时,它会自动将请求故障转移——当一次 agent 运行已经深入到数千次工具调用时,这一点至关重要,你不会希望它因为某个上游服务恰好状态不佳而前功尽弃。第二,请求是被描述出来的,而不是硬编码的——你可以把 Muse Spark 1.2 放在与其他任何模型相同的路由 DSL 之后,并改变由谁来提供服务,而无需改动客户端。

常见问题

CLI 的默认模型是当前模型吗?不是。Muse Code 的默认模型是 muse-spark-1.2;当前一代是 Muse Spark 1.3,于 2026 年 9 月 2 日发布,你可以通过 --model muse-spark-1.3 或 /models 命令来使用它。

哪种措辞是正确的——“Muse Code 1.3”还是“Muse Spark 1.3”?Muse Spark 1.3。Muse Code 的版本是 harness 发布版本,当前版本是 1.2.1;这两条版本线互不相关,这正是查询“muse code 1.3”会返回不相关结果的原因。

如果我只需要音频输入,应该配置哪个模型?Muse Spark 1.2。Meta 自己的脚注指出,1.3 中的音频理解并未得到完全支持,可能会降低响应质量,并建议将音频相关工作交给 1.2 或 Muse Voice Transcribe。

贡献者层级是免费层级还是试用层级?都不是,而且它也不是你能自动获得的折扣。从 1.2 起,Muse Spark 的每个版本都有这一价格更低的变体,代价是允许其使用你的提示词和补全内容进行训练;1.1 代没有贡献者变体。

底线

Muse Code 是 Meta 的终端和 CI 编码智能体,由 Meta 为其 Muse Spark 模型打造,以三档月度套餐出售,价格分别为 5.00 美元、15.00 美元和 50.00 美元,无免费层级;其背后是按量付费的 Standard 费率:每百万 token 输入 1.25 美元、输出 4.25 美元,以及 Contributor 费率:相同 token 输入 0.10 美元、输出 0.20 美元,前提是你允许 Meta 用这些数据训练。当前 CLI 版本为 1.2.1,当前模型世代为 Muse Spark 1.3,而 CLI 仍默认使用 Muse Spark 1.2——每当引用分数时,都要注明版本和推理强度,因为 Muse Code 让 Muse Spark 1.3 在 max 和 xhigh 下运行并不是同一种测量,而且厂商主打的效率声称是内部对比,而非独立结果。

如需亲身体验该框架本身,请参阅我们对 Muse Code 终端编程智能体的详细演示。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新