Muse Spark 1.2 和 Muse Code-1
Guides & Insights

Muse Spark 1.2和Muse Code:Meta四个月内的第三款模型与Grok 4.5打成平手

作者

Jim Song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Meta 发布了Muse Spark 1.2,于2026年8月5日,即Muse Spark 1.1发布四周后、首款Muse Spark发布约四个月后。这一版本带来了前两个版本所没有的东西:Meta自家的一款编码代理,Muse Code,以测试版发布,并与它所运行的模型共同训练。而且,在一个Meta及其竞争对手都无法控制的排行榜上,这次发布让Meta与SpaceXAI打成平手——Muse Spark 1.2和Grok 4.5如今在Artificial Analysis Intelligence Index上均获得54分。

在理解以下任何数字之前,有两件事需要区分开来。智能指数得分、延迟数据和token数量来自Artificial Analysis,该公司自行运行评估并自担费用——这些是独立的。Meta在公告中率先展示的编码结果——Terminal-Bench 2.1、DeepSWE v1.1以及一个内部基准——由Meta在其自己的测试框架上运行,每个参赛模型都配有其专属的智能体产品。这两类数字都有用。但它们并不是同一种证据,本文会将它们区分开来看待。

Meta 实际发布了什么

Muse Spark 1.2 and Muse Code-2

这份发布于Meta AI研究博客、日期为8月5日的公告,同时涵盖了两款产品。

Muse Spark 1.2——Muse Spark 系列的一次聚焦编码的更新。Meta 表示,它在编码任务上扩大了训练算力,并拓宽了训练环境的多样性,同时保持了 1.1 版本所宣传的通用智能体能力。官方公布的训练目标着眼于长周期任务:整个代码库的生成、大型端到端项目,以及 Meta 所称的“auto-research(自动研究)”,包括对工作进行排序的规划能力、在多个步骤中保持方向的目标条件设定,以及在会话长时间运行期间维持相关状态存活的上下文压缩。

Muse Code——一款处于测试阶段的终端编码代理,可通过 Meta 开发者域名上的单行 Shell 脚本安装。它运行可跨会话存活的持久异步后台代理,基于 Meta 所称“重放精确、重启安全”的本地事件日志运行时,并在隔离的工作树中为每个任务协调多个子代理。它内置了三个技能:/plan用于需审批的规划,/grill用于对已完成的工作进行压力测试,/goal用于推动任务直至完成。

这种配对并非偶然。Meta表示,两者是协同训练的——模型基于来自harness的拒绝采样轨迹进行调优,并针对目标、压缩和子代理进行了配方优化。这正是催生Claude Code和Codex的同一套协同训练打法。对于任何阅读基准测试分数的人来说,它有一个直接后果:该模型的招牌编程成绩,是在它训练时所对抗的那个harness内部取得的。这不是作弊,而是智能体评估如今的工作方式。但这确实意味着,通过其他某种scaffold获得的1.2分,是一个悬而未决的问题,而非一个可靠的假设。

规格其余部分与1.1版本保持一致,而1.1本身就是参考性的。上下文长度保持在1,048,576个token。推理在五个努力级别——minimal、low、medium、high、xhigh——中仍然强制要求,默认级别为medium;没有任何配置能让你在不为某种思考付出代价的情况下获得权重。权重是封闭的,没有Hugging Face仓库,Meta自己的Model API依然是调用它的唯一第一方途径。

43,然后51,然后54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis 在 xhigh 推理设置下,将 Muse Spark 1.2 的智能指数评为 54,使其在 185 个模型中排名第 13,而类别中位数为 32。该指数是九项评估的加权综合——GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR——均匀覆盖智能体、编码、通用能力和科学推理。

与其说是快照,不如说是序列,Meta的发展轨迹才是真正的故事。最初的Muse Spark在四月份得了43分。Muse Spark 1.1在7月9日达到51分,一个季度内上升了8分。Muse Spark 1.2在不到一个月内又增加了3分。Meta在四个月内移动了11个指数点,其发布速度已经超过了评测生态系统的跟进速度——目前仍没有1.2的按基准细分结果发布,也没有任何Design Arena记录,而1.1两者都有。

54分使Meta与Grok 4.5持平——后者是SpaceXAI在Muse Spark 1.1发布前一天推出的模型——同时也使Meta落后于一个竞争胶着的前沿阵营:Claude Opus 5为61分,Claude Fable 5为60分,GPT-5.6 Sol为59分。与榜首的差距为六到七分。相比Meta年初的起点,已提升了十一分。这一差距能否缩小,取决于发布节奏能否保持,而Meta目前正按照四周一版的节奏发布。

不过,综合指数上的并列并不意味着工作上的并列,而且有必要说明54分能定论什么、不能定论什么。它能定论的是:在综合能力上,Muse Spark 1.2 与 Grok 4.5 属于同一水平的讨论范畴。它无法告诉你哪一个能写出更好的补丁,因为能够回答这一问题的编码子指数尚未针对1.2发布。

Meta的编码数字,请仔细阅读

Meta的公告在三个图表中领先。在其自身的运行中,以pass@1报告,基于五次尝试,每个竞争模型与其自身的代理产品配对:

Terminal-Bench 2.1 — Muse Spark 1.2 达到 82.9%,高于 1.1 的 76.2%。Claude Opus 5 以 86.7% 领先。

DeepSWE v1.1 — 59.3%,较53.0%有所上升。

Meta 的内部编程基准测试——70.6%,高于此前的68.3%。

增量是可信的部分。由同一团队在同一评测框架上、以相同方式测量、前后相隔一个月的 Terminal-Bench 6.7 分和 DeepSWE 6.3 分提升,可以合理地反映 1.2 相比 1.1 在 Meta 所优化的目标上提升了多少。需要放宽心态看待的是跨厂商排名:评测框架的搭配是一个很大的自由变量,一个实验室在调优自家模型的同时也在调优自己的框架,它并没有能力把其他所有人的框架也调得同样好。Meta 在自己发布的幻灯片上排名第二,这至少不像厂商基准测试的典型形态,但截至本文写作时,还没有任何第三方复现过其中的任何结果。

第二份价格表

本次发布中最具深远影响的事情并不在基准测试图表上。Muse Spark 1.2 附带两份价格表。

标准层级 — 每百万输入token 1.25美元,缓存命中时每百万token 0.15美元,每百万输出token 4.25美元。与1.1相比分毫不差。速率上限约为每分钟3,000次请求。网络搜索接地按每千次查询2.50美元单独计费。

贡献者层级——$0.10 输入,$0.002 缓存输入,$0.20 输出。这意味着输入费用便宜 12.5 倍,输出费用便宜 21.25 倍。入场的代价是允许 Meta 使用你的流量训练未来模型,以及每分钟 60 次请求的速率上限——仅为标准额度的 2%。

在0.10美元和0.20美元的价格点上,Muse Spark 1.2将在价格上低于市场上几乎所有接近前沿的模型,包括那些在价格上原本胜过它的开放权重预算档位。这才是这次发布中有趣的数字,而它实际上并不是一个定价决策。每分钟60次请求本身就排除了大多数生产环境中的扇出模式,因此这一档位面向的是实验和小团队工作,而非生产服务。而“我们可能会用你的流量进行训练”这个问题,该问的是贵组织里负责数据治理审批的人,而不是负责挑选模型的人。把它当作附带折扣的法律审查,而不是更便宜的SKU。

生产54的成本是多少

Muse Spark 1.2 and Muse Code-4

Artificial Analysis 会公布其自身评估运行的费用,而那一栏正是 Muse Spark 1.2 显现其形态之处。完成九项基准测试套件花费了 637.85 美元,消耗了 9500 万输出 token;相比之下,Muse Spark 1.1 在相同的每 token 定价下为 548.07 美元和 9400 万 token。多出的 16% 纯粹是推理开销。

延迟数据的变化趋势相同。在xhigh下测量时,1.2的首令牌时间为26.12秒,而1.1为2.90秒;输出速度从每秒213.5个令牌降至165.0个。Meta用思考时间换取了三个指数点,而强制推理设计意味着你无法拒绝这项购买——只能选择付出多少。

那个26秒的数字会被错误引用,所以我提前给出更正:它是在模型所暴露的最高推理力度级别下测得的,而API默认使用中等力度。作为来自真实流量而非基准测试框架的参考点,经过OrcaRouter服务的Muse Spark 1.1——无论调用者实际请求的是何种推理力度——其7天p50首Token时间为1.84秒,p95为6.00秒,每秒处理519个Token,错误率为零。最大力度下的基准延迟与默认力度下的生产延迟是两个不同的量,两者通常相差一个数量级。请把26.12秒理解为深度推理的上限,而不是一次请求的实际体感。

你今天可以在哪里打电话

Muse Spark 1.2 由 Meta 自己的 Model API 提供服务,并且在撰写本文时,没有其他地方——它在发布时没有在 OpenRouter 上路由,没有 Hugging Face 仓库,也不在 OrcaRouter 目录中。Muse Spark 1.1 的价格为 1.25 美元和 4.25 美元——与 Meta 收取的费用相同,因为 OrcaRouter 不收取任何加价,直接按提供商的列表价格传递。

这对比较而言比模型本身更重要。如果你正在为这个版本构建成本模型,你要用来做基准对比的模型——Claude Opus 5、Claude Fable 5、GPT-5.6 Sol、Grok 4.5、DeepSeek V4 Flash——都在同一个 API 密钥后面、按标价计费,因此你电子表格中的数字就是发票上的数字,而且供应商降价当天就会生效,而不是等到续约之后。具体到 Muse Spark 1.2,目前的答案是 Meta 的端点、第二份合同和一张独立的账单。

公告未回答的问题

没有独立的编码分数。Artificial Analysis 为 1.2 发布了综合指数,但尚未发布它为 1.1 发布的编码和智能体子指数(分别为 71.3 和 37.5)。由于智能体工作是 1.1 最薄弱的维度,且差距明显,而智能体编码正是 1.2 声称已修复的部分,因此这个数字将决定这次发布的结论。

基准测试结果尚未被复现。 公告中的每项编码成绩均为 Meta 自行运行得出,尚未有人基于中立脚手架发布 Muse Spark 1.2 的得分。

无多模态验证。Muse Spark 的产品页面宣称支持文本、图像、视频、音频和 PDF 输入,但独立评估仅涵盖文本和图像。Meta 的 1.2 消息传递功能已几乎完全转向软件实现,而 1.1 当初明确主打的混合媒体用例,如今既没有营销支持,也没有测量数据。

无吞吐量历史记录。端点上的流量仍然过低,无法填充常规滚动延迟统计数据。

未来四周看点

有三件事将决定这次发布是否真的如 Meta 所说。第一是{{1}}1.2 的独立智能体评分——如果 1.1 上为 37.5 的分项指数出现大幅变动,那么编程能力的说法就属实{{/1}}。第二是{{2}}是否有人能在 Muse Code 之外复现 Terminal-Bench 的结果;一个只在自己评测框架内表现出色的模型,是产品而非能力{{/2}}。第三是{{3}}贡献者层级会发生什么变化:如果 60 次请求的上限放宽,一个接近前沿的模型以 $0.10 输入、$0.20 输出的定价,将改变预算层级的成本算术,其影响远非三分的指数增益可比{{/3}}。

如果这个节奏保持不变,Muse Spark 1.3 将于九月初发布。从这一迹象来看,它发布时值得关注的数字不是指数得分,而是 Meta 能否在增加功能的同时,不为每个请求前端再增加二十秒的思考时间。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube