Muse Code
Guides & Insights

Muse Code:Meta 发布的编码智能体,在自己基准测试上落败

作者

Jim Song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

厂商通常不会发布自己排名第二的图表。Meta 却发布了三张。在 Muse Code 的发布演示中——Meta Superintelligence Labs 于 2026 年 8 月 5 日发布的终端编码智能体,基于同日发布的 Muse Spark 1.2——Claude Opus 5 在 Meta 选择展示的每一项指标上都领先,包括 Meta 自己构建并控制的那个。在 Terminal-Bench 2.1 上差距为 3.8 个百分点。在 DeepSWE 1.1 上为 5.7,GPT-5.6 Terra 也同样领先。在 Meta 自己的内部编码基准上为 8.8。这一发布中广为流传的说法——"在 DeepSWE 1.1 上达到 59%,超越 Grok 4.5Gemini 3.6 Flash"——是真实的,而且这是现有最保守的真实说法。

这反而让这次发布更有趣,而不是更无聊。Meta 发布了一份自己并不占优的基准测试报告,却仍然发布了,因为它要卖的不是分数。它卖的是一个能撑过 24 小时任务的运行时,以及一个比同行低一个多数量级的价格——只要你愿意让 Meta 读取你的仓库。下面每一个基准数字都来自 Meta 自己的图表,这些图表发布时未附带方法论;如果有独立的测量结果,文中会注明。

Meta 实际发布了什么

同一天发生的两件事,被刻意地联系在一起。

Muse Code — 一个终端编码代理,公开测试版,一行命令安装:curl -fsSL https://dev.meta.ai/install.sh | bash。仅支持 macOS 和 Linux;没有原生 Windows 版本,也没有 GUI 或 IDE 扩展。Meta 将其工作描述为应对大型代码库中的复杂软件工程——规划更改、编写代码、验证结果。

Muse Spark 1.2——Meta 推理模型的一个编码专注修订版,拥有 1,048,576-token 上下文,可在 Muse Code 中及通过 Meta Model API 公开预览使用。Meta 表示,它在编码任务上扩展了训练计算量,并拓宽了训练环境的多样性,目标是面向长期任务:整个代码库的生成、多文件重构、扩展调试。

耦合即主张。Meta表示两者经过共同训练,因此这种配对能产生“比围绕外部模型的通用包装器更好的工具使用、更少的重试和更高质量的输出”。这是Meta的措辞,也是Meta的断言;尚无第三方在竞争对手的测试框架中对该模型进行过测试,以检验共同训练的额外优势是否真实,还是Muse Spark 1.2无论置于何处都只是表现得像一个称职的编码模型。

代理内置了三项技能,它们比营销文案更能说明预期的工作方式:/plan会在编写任何内容之前生成一份需审批的计划,/grill会对该计划进行压力测试,/goal则推动既定目标的达成。规划、攻击计划、然后执行——这正是Claude Code和Codex资深用户手动摸索出的模式,如今作为一等命令提供。

基准牌组,如实解读

Muse Code

Meta 发布了在 Terminal-Bench 2.1、DeepSWE 1.1、其自家的 Meta Internal Coding Bench 及 GDPval 上的对比结果。以下是 Meta 报告的数据:

Terminal-Bench 2.1——在 Claude Code 中,Claude Opus 5 以最大努力取得 86.7%;Muse Code 中 Muse Spark 1.2 取得 82.9%;Codex 中 GPT-5.6 Terra 取得 81.8%;Grok Build 中 Grok 4.5 取得 81.6%。排名第二,且第二名到第四名之间仅相差 1.3 个百分点。

DeepSWE 1.1——Claude Opus 5 65.0%,GPT-5.6 Terra 64.8%,Muse Spark 1.2 59.3%。排名第三,也是唯一一个差距是决定性而非表面性的榜单。

Meta Internal Coding Bench — Claude Opus 5 79.4%,Muse Spark 1.2 70.6%。这是 Meta 的主场,也是 Meta 输得最惨的一次。

一代胜于一代 — Meta 报告称,与 Muse Spark 1.1 相比,Terminal-Bench 上提升 +6.7 分,DeepSWE 上提升 +6.3 分。这些是演示文稿中最大的数字,也是 Muse Spark 1.1 用户真正应该关注的。

有一个算术上的小问题值得一提,因为它是把上述所有内容都视为方向性指标的原因。剔除Meta的+6.7之后,Muse Spark 1.1在Terminal-Bench 2.1上的成绩约为76%——但公开的tbench.ai排行榜自7月底以来一直为Muse Spark 1.1显示一个经过验证的80.0%。这两个数字可以都真实无误,却仍然彼此矛盾,因为Terminal-Bench上的一行并不是模型分数。它是某个测试框架(harness)加上某个模型再加上某种努力程度设置(effort setting)的分数,而Meta为1.1使用的内部测试框架并非tbench所运行的那个。仅这一事实对跨厂商基准比较造成的损害,就超过任何单个有争议的数字,并直接引向下一节。

运行时是产品

Muse Code

去掉分数,剩下的就是关于不死的工程宣传。两个机制支撑着它。

首先是事件日志。Muse Code 会将每次模型调用、每次工具运行、每次审批和每次编辑都追加到本地日志中。Meta 称这能让会话做到回放精确、重启安全:无论是终止进程、系统崩溃还是丢失机器,代理都能从停止的地方精确恢复,而无需从头重新推导上下文。竞争对手的崩溃恢复能力参差不齐,但没有任何一家将其作为主打卖点。附带一提,它也是一份审计工件——完整记录了自主过程对工作树所做的一切,这正是安全审查所需的文档,而大多数代理 CLI 无法提供。

第二种是Meta所称的异步后台代理。与普通子代理的区别在于,它们不会为每个子任务生成然后销毁;它们在整个会话中保持存活,自行执行后续步骤,并自行决定何时向主循环汇报。这样宣称的好处是延迟更低,因为编排器不必在每次委派时都支付启动成本。

Meta 的支持证据是一个案例研究:Muse Code 运行了24小时,跨越超过1000次工具调用,在 NVIDIA Hopper 硬件上自主优化 GPU 内核,Meta 称其相对于所提供的基线实现有显著改进。没有公布加速比数据,因此有趣的量不是结果而是持续时间。一千次工具调用而无需人工干预,与五十次调用的重构相比,是截然不同的故障面;而且在这种工作负载下,3.8分的基准差距远不如进程在第九小时是否仍然存活来得重要。

价格就是武器——而其中一部分是以源代码支付的

没有 Muse Code 订阅。计费方式是按代币(tokens)计费,分为两个层级之一,而两者之间的差距是本次发布中最激进的举措:

标准 — 每百万输入 Token 1.25 美元,每百万缓存输入 0.15 美元,每百万输出 4.25 美元。此层级的提示不会用于改进 Meta 的产品。

贡献者 — 每百万输入 0.10 美元,每百万缓存输入 0.002 美元,每百万输出 0.20 美元。作为交换,Meta 可能会使用这些数据来改进其模型。

这在输入上便宜12.5倍,输出上便宜21倍,缓存输入上便宜75倍。将其放入一个真实的智能体步骤中——输入60,000个令牌的仓库上下文,输出3,000个令牌的计划与补丁——定价网格的四个角令人震惊。标准层级,冷提示:每步8.8美分,每千步87.75美元。标准层级,仓库上下文命中缓存:每步2.2美分,每千步21.75美元。贡献者层级冷启动:每步0.66美分,每千步6.60美元。贡献者层级热缓存:同一千步只需0.72美元。

同样的工作,成本为122倍或1/122,取决于两个选择。Meta自己的24小时、1000次调用内核运行,在保护你数据的层级上,token花费约九十美元,而在不保护数据的层级上不到一美元。

这才是这次发布真正摆在团队面前的决策,而不是定价决策。一个终端编码智能体会读取你的代码库——这正是它的全部功能——所以贡献者层级的提示词中包含你的源代码、内部 API、你对变通方案为何存在的注释,以及你的仓库中碰巧拥有的任何测试夹具。对于副业项目或开源代码树来说,贡献者层级几乎是白赚的钱。对于专有代码库,或任何能触达客户数据的仓库,这是一个穿着折扣外衣的许可决策,应该交给负责审批数据处理的人,而不是盯着云账单的人。Meta 以 12 倍折扣为其定价,因为对 Meta 来说,这些数据的价值至少值这个数。

你无法通过API获取的内容

Muse Code

82.9%这个成绩属于Muse Spark 1.2(在Muse Code中)。如果你从自己的Agent框架调用该模型,那么你只是买到了这个组合中的模型部分,而框架部分则一点也没有——没有事件日志,没有持久运行的后台Agent,而且如果Meta的联合训练说法真有意义的话,也没有经过调优的工具调用行为。所以这里有两个独立的评估,把它们混为一谈是本周最容易犯的错误:Muse Code是否胜过你已经在使用的Agent,以及Muse Spark 1.2是否比你当前调用的模型更好?

第二个问题回答起来的成本更低,因为它只需要保持测试框架不变,并替换底层的模型。关于可用性,值得说清楚:Muse Spark 1.2 由 Meta 直接提供,不在 OrcaRouter 目录中。Muse Spark 1.1的价格为 1.25 美元和 4.25 美元——与 Meta 的标价完全一致,因为 OrcaRouter 不加价,直接把提供商的定价透传过来,这也是为什么供应商的价格变动会在发生当天就反映在我们这边,而不是在一个合同周期之后。我们对 1.1 的七天生产遥测数据显示,p50 首令牌时间(time-to-first-token)为 1.84 秒,p95 为 6.00 秒,这比任何基准测试框架给出的延迟预期都更有参考价值。

在这样的一周里,单一网关的实际价值在于:比较集——Claude Opus 5、GPT-5.6 Terra、Grok 4.5、Gemini 3.6 Flash 和 Muse Spark 1.1——全都放在一个按目录价购买的密钥后面,因此做A/B测试只是改一下字符串,而不是走一遍采购流程。它还覆盖了Meta方案中的结构性风险:Muse Spark 1.2只有一家提供商,这使其在构造上就成了单点故障。跨提供商的自动故障转移,决定了Meta倒霉的那个下午是否会变成你的智能体的倒霉下午。

这也是为什么1.2发布得悄无声息且缓慢。

Muse Spark 1.2 于8月5日出现在Meta的API上,没有公告,也没有数字变化——与Muse Spark 1.1相同的1M上下文,相同的1.25美元和4.25美元,相同的五级推理拨盘。唯一变化的是从外部测得的:Artificial Analysis 测得的首令牌时间(time-to-first-token)在最大推理努力下为26.12秒,而1.1为2.90秒,换来了智力指数(Intelligence Index)三分提升,从51到54。如果将其视为通用模型的发布,那这是一笔奇怪的交易——等待时间增加九倍,却只换来三分。

作为协同训练智能体的模型半部分,这是显而易见的权衡。等待十二个文件重构的人不会注意到二十六秒的规划时间;而等待聊天完成的人则会完整感受到它。Meta 并不是悄悄发布一个聊天模型,寄希望于没人测量延迟。它是在造车之前先交付引擎,公告则随车一同到来。Meta 的 Muse Spark 开发者页面现在也显示为 1.2。

这一推论对任何因其广度而采用该系列的人来说都是一个警告。Muse Spark 1.1 曾作为多模态推理模型出售——支持文本、图像、视频、音频和 PDF,适用于混合媒体研究。1.2 版本的定位是软件工作,其发布材料是一个编码代理。多模态表面并未被移除,但它已不再是 Meta 优化或广告宣传的重点,而且 Meta 之外没有人发布过 1.2 的视频或音频结果。

Muse Code 仍然薄弱的地方

它是测试版,并已明确标注。关于事件日志保证的任何内容均未经Meta以外任何人验证。

仅支持 macOS 和 Linux。 Windows 开发者要么使用 WSL,要么完全无法使用,这对企业设备群来说是一个真正的限制,而非仅仅是不便。

仅限终端。无图形界面,无 IDE 集成,也没有 Codex 已提供的云托管并行代理。Meta 的发布材料未提及 MCP 支持。

没有任何已发布的方法论为这些基准图表提供支撑,也还没有对智能体或 Muse Spark 1.2 的编码子分数进行独立评估。Artificial Analysis 为 1.2 提供了综合指数,但并未提供其针对 1.1 发布的逐基准编码与智能体能力细分——而 1.1 的智能体评分以极大差距成为其最弱维度,这恰恰就是能为此次发布定论的那个数字。

Meta 来晚了。Claude Code 和 Codex 已有一年的使用习惯,围绕它们构建了插件生态系统和团队工作流。崩溃安全的事件日志是尝试新事物的好理由,但它本身并不是迁移团队的理由。

人们真正在问的问题

Muse Code是免费的吗?

不,但也没有订阅——与其竞争的 Claude Code 和 Codex 方案不同,Muse Code 完全通过 Meta Model API 按 token 计费。因此,成本取决于你的会话推送多少仓库上下文,而不是人数,这有利于偶尔重度使用的用户,而不利于始终在线的代理。贡献者层级已接近免费,价格并不是尝试它的真正障碍。

贡献者层级会用我的私有代码进行训练吗?

Meta 对该层级的使用条款是:数据可能被用于改进其模型,而编程代理(coding agent)的提示词中包含你的代码。Meta 声明,标准层级的提示词不会用于改进其产品;处理任何专有内容时都应使用该层级。应将这一选择视为一项附带折扣的数据处理决策,而非计费偏好——并注意折扣是按 token 计算的,因此悄悄降级的诱因会随着你的使用量同步增长。

我可以在 Claude Code 或我自己的智能体中使用 Muse Spark 1.2 吗?

该模型可通过Meta Model API独立于Muse Code使用,因此是的,适用于任何接受自定义端点的场景。你不会得到的是Meta归功于其基准测试结果的联合训练配对,而诚实的预期是,在它调优所用的测试框架之外运行的模型,得分会低于图表上的数字。如果目标是评估模型而非智能体,就在你自己的测试框架中将其与Claude Opus 5和GPT-5.6 Terra进行对比,并完全忽略那张演示文稿。

这周谁应该安装它?

如果你运行长周期自主任务——迁移、跨 monorepo 的依赖升级,以及任何你目前因为 agent 会迷失方向而需要全程盯着的任务——Muse Code 值得在一个临时克隆仓库上花一个下午。事件日志和常驻后台代理正是针对这种失败模式设计的,而且在任务持续时间最长的地方,基准测试差距最小。

如果你在开源或非敏感代码库上工作,而且成本是你的硬性约束,那么 contributor 层级是目前编程代理市场上最值得关注的数字,每步 0.66 美分并不是笔误。

如果你在 Claude Code 或 Codex 上针对专有代码库带领团队,目前这里还没有什么能迫使你迁移的理由。Muse Code 在自家供应商选定的每一个榜单上都只排第二或第三,标准档定价与同类产品持平而非更低,而其差异化卖点是一种除 Meta 以外没人测试过的可靠性特性。值得关注的不是下一个基准测试,而是当一位非 Meta 员工通过它运行一千次工具调用时,事件日志是否扛得住。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube