
Muse Spark 1.2和Muse Code:Meta四个月内的第三款模型与Grok 4.5打成平手
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Meta 发布了 Muse Spark 1.2,发布日期为2026年8月5日,在 Muse Spark 1.1 发布四周后,也是首个 Muse Spark 发布约四个月后。这一版本带来了前两个版本没有的东西:Meta 自家的编码代理,Muse Code,以测试版形式推出,并与其运行的模型协同训练。而在 Meta 及其竞争对手都无法掌控的排行榜上,此次发布让 Meta 与 SpaceXAI 打成平手——Muse Spark 1.2 和 Grok 4.5 目前在 Artificial Analysis Intelligence Index 上均得54分。五天后出现了更大的进展:8月10日,Meta 表示将开放 Muse Spark 1.2 的权重——这一声明如果落实,将使该模型成为当前美国开源权重模型中与中国模型竞争的最强对手。
在理解以下任何数字之前,有两件事需要区分开来。智能指数得分、延迟数据和token数量来自Artificial Analysis,该公司自行运行评估并自担费用——这些是独立的。Meta在公告中率先展示的编码结果——Terminal-Bench 2.1、DeepSWE v1.1以及一个内部基准——由Meta在其自己的测试框架上运行,每个参赛模型都配有其专属的智能体产品。这两类数字都有用。但它们并不是同一种证据,本文会将它们区分开来看待。
Meta 实际发布了什么

这份发布于Meta AI研究博客、日期为8月5日的公告,同时涵盖了两款产品。
• Muse Spark 1.2——Muse Spark 系列的一次聚焦编码的更新。Meta 表示,它在编码任务上扩大了训练算力,并拓宽了训练环境的多样性,同时保持了 1.1 版本所宣传的通用智能体能力。官方公布的训练目标着眼于长周期任务:整个代码库的生成、大型端到端项目,以及 Meta 所称的“auto-research(自动研究)”,包括对工作进行排序的规划能力、在多个步骤中保持方向的目标条件设定,以及在会话长时间运行期间维持相关状态存活的上下文压缩。
• Muse Code——一款处于测试阶段的终端编码代理,可通过 Meta 开发者域名上的单行 Shell 脚本安装。它运行可跨会话存活的持久异步后台代理,基于 Meta 所称“重放精确、重启安全”的本地事件日志运行时,并在隔离的工作树中为每个任务协调多个子代理。它内置了三个技能:/plan用于需审批的规划,/grill用于对已完成的工作进行压力测试,/goal用于推动任务直至完成。
这种配对并非偶然。Meta表示,两者是协同训练的——模型基于来自harness的拒绝采样轨迹进行调优,并针对目标、压缩和子代理进行了配方优化。这正是催生Claude Code和Codex的同一套协同训练打法。对于任何阅读基准测试分数的人来说,它有一个直接后果:该模型的招牌编程成绩,是在它训练时所对抗的那个harness内部取得的。这不是作弊,而是智能体评估如今的工作方式。但这确实意味着,通过其他某种scaffold获得的1.2分,是一个悬而未决的问题,而非一个可靠的假设。
规范的其余部分与 1.1 版没有变化,而 1.1 版本身就是参考性的。上下文长度仍保持为 1,048,576 个 token。推理在五个努力等级中仍然是强制性的——minimal、low、medium、high、xhigh——其中 medium 为默认值;没有任何配置能让你在不付出一定思考代价的情况下获得权重。发布之初,权重并未开放:没有 Hugging Face 仓库,Meta 自己的 Model API 是唯一可以调用它的第一方渠道。这一情况现已计划改变:8 月 10 日,Meta 宣布将开放权重,从而推翻了此前适用于前三个 Muse Spark 版本的闭源权重政策。
43,然后51,然后54

Artificial Analysis 在 xhigh 推理设置下,将 Muse Spark 1.2 的智能指数评为 54,使其在 185 个模型中排名第 13,而类别中位数为 32。该指数是九项评估的加权综合——GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR——均匀覆盖智能体、编码、通用能力和科学推理。
与其说是快照,不如说是序列,Meta的发展轨迹才是真正的故事。最初的Muse Spark在四月份得了43分。Muse Spark 1.1在7月9日达到51分,一个季度内上升了8分。Muse Spark 1.2在不到一个月内又增加了3分。Meta在四个月内移动了11个指数点,其发布速度已经超过了评测生态系统的跟进速度——目前仍没有1.2的按基准细分结果发布,也没有任何Design Arena记录,而1.1两者都有。
54分使Meta与Grok 4.5持平——后者是SpaceXAI在Muse Spark 1.1发布前一天推出的模型——同时也使Meta落后于一个竞争胶着的前沿阵营:Claude Opus 5为61分,Claude Fable 5为60分,GPT-5.6 Sol为59分。与榜首的差距为六到七分。相比Meta年初的起点,已提升了十一分。这一差距能否缩小,取决于发布节奏能否保持,而Meta目前正按照四周一版的节奏发布。
不过,综合指数上的并列并不意味着工作上的并列,而且有必要说明54分能定论什么、不能定论什么。它能定论的是:在综合能力上,Muse Spark 1.2 与 Grok 4.5 属于同一水平的讨论范畴。它无法告诉你哪一个能写出更好的补丁,因为能够回答这一问题的编码子指数尚未针对1.2发布。
Meta的编码数字,请仔细阅读
Meta的公告在三个图表中领先。在其自身的运行中,以pass@1报告,基于五次尝试,每个竞争模型与其自身的代理产品配对:
• Terminal-Bench 2.1 — Muse Spark 1.2 达到 82.9%,高于 1.1 的 76.2%。Claude Opus 5 以 86.7% 领先。
• DeepSWE v1.1 — 59.3%,较53.0%有所上升。
• Meta 的内部编程基准测试——70.6%,高于此前的68.3%。
增量是可信的部分。由同一团队在同一评测框架上、以相同方式测量、前后相隔一个月的 Terminal-Bench 6.7 分和 DeepSWE 6.3 分提升,可以合理地反映 1.2 相比 1.1 在 Meta 所优化的目标上提升了多少。需要放宽心态看待的是跨厂商排名:评测框架的搭配是一个很大的自由变量,一个实验室在调优自家模型的同时也在调优自己的框架,它并没有能力把其他所有人的框架也调得同样好。Meta 在自己发布的幻灯片上排名第二,这至少不像厂商基准测试的典型形态,但截至本文写作时,还没有任何第三方复现过其中的任何结果。
第二份价格表
本次发布中最具深远影响的事情并不在基准测试图表上。Muse Spark 1.2 附带两份价格表。
• 标准层级 — 每百万输入token 1.25美元,缓存命中时每百万token 0.15美元,每百万输出token 4.25美元。与1.1相比分毫不差。速率上限约为每分钟3,000次请求。网络搜索接地按每千次查询2.50美元单独计费。
• 贡献者层级——$0.10 输入,$0.002 缓存输入,$0.20 输出。这意味着输入费用便宜 12.5 倍,输出费用便宜 21.25 倍。入场的代价是允许 Meta 使用你的流量训练未来模型,以及每分钟 60 次请求的速率上限——仅为标准额度的 2%。
在0.10美元和0.20美元的价格点上,Muse Spark 1.2将在价格上低于市场上几乎所有接近前沿的模型,包括那些在价格上原本胜过它的开放权重预算档位。这才是这次发布中有趣的数字,而它实际上并不是一个定价决策。每分钟60次请求本身就排除了大多数生产环境中的扇出模式,因此这一档位面向的是实验和小团队工作,而非生产服务。而“我们可能会用你的流量进行训练”这个问题,该问的是贵组织里负责数据治理审批的人,而不是负责挑选模型的人。把它当作附带折扣的法律审查,而不是更便宜的SKU。
生产54的成本是多少

Artificial Analysis 会公布其自身评估运行的费用,而那一栏正是 Muse Spark 1.2 显现其形态之处。完成九项基准测试套件花费了 637.85 美元,消耗了 9500 万输出 token;相比之下,Muse Spark 1.1 在相同的每 token 定价下为 548.07 美元和 9400 万 token。多出的 16% 纯粹是推理开销。
延迟数据的变化趋势相同。在xhigh下测量时,1.2的首令牌时间为26.12秒,而1.1为2.90秒;输出速度从每秒213.5个令牌降至165.0个。Meta用思考时间换取了三个指数点,而强制推理设计意味着你无法拒绝这项购买——只能选择付出多少。
那个26秒的数字会被错误引用,所以我提前给出更正:它是在模型所暴露的最高推理力度级别下测得的,而API默认使用中等力度。作为来自真实流量而非基准测试框架的参考点,经过OrcaRouter服务的Muse Spark 1.1——无论调用者实际请求的是何种推理力度——其7天p50首Token时间为1.84秒,p95为6.00秒,每秒处理519个Token,错误率为零。最大力度下的基准延迟与默认力度下的生产延迟是两个不同的量,两者通常相差一个数量级。请把26.12秒理解为深度推理的上限,而不是一次请求的实际体感。
你今天可以在哪里打电话
Muse Spark 1.2 目前由 Meta 自家的 Model API 提供服务,并且在撰写本文时,没有其他任何地方提供——仍然没有 Hugging Face 仓库,也不在 OrcaRouter 目录中。这正是 8 月 10 日公告将要改变的:Meta 表示权重将在“未来几周内”开放,一旦开放,可用性问题就从“在哪里提供服务?”转变为“哪些权重、在何种许可证下、以及在哪些运行时中”。Muse Spark 1.1 已在 OrcaRouter 目录中,价格为 1.25 美元和 4.25 美元——与 Meta 收取的价格相同,因为 OrcaRouter 不收取任何加价,直接按提供商的标价原样转售。
这对比较本身的影响大于对模型本身的影响。如果你正在为这次发布构建成本模型,你用来做基准对比的模型——Claude Opus 5、Claude Fable 5、GPT-5.6 Sol、Grok 4.5、DeepSeek V4 Flash——都位于同一个密钥后面,按标价计费,因此你电子表格中的数字就是发票上的数字,而提供商降价会在当天生效,而不是等到续约之后。具体到 Muse Spark 1.2,目前答案是 Meta 的端点、第二份合同和单独的账单——一旦权重发布,自托管安装将成为第三种选择。
8月10日发生了什么变化?
发布五天后,Meta 对其自家旗舰产品的态度发生了转变。在 8 月 10 日的一份公告中,Meta 表示将在“未来几周”开放 Muse Spark 1.2 的权重,这使其成为首个团队可以自行运行的 Muse Spark 版本。这一声明只是高管表态,尚未真正落地:目前还没有 Hugging Face 代码库,具体日期、参数数量和许可证均未确认。
关键在于前沿权重竞赛。Muse Spark 1.2 在 Artificial Analysis Intelligence Index 上得分54——高于目前所有可下载的美国开放权重模型——因此,如果权重如期放出,它将成为美国开放权重模型中最强大的中国实验室竞争对手。扎克伯格在8月10日一篇6500字的文章中详细阐述了这个框架,指责美国对训练数据的限制将开放权重的领先地位拱手让给了外国实验室。这一转向已经有了第一个成果:Muse Glimmer,一个300亿参数的模型,于同一天以 Apache 2.0 许可证发布,由 Muse Spark 蒸馏而来,专为本地智能体工作负载而构建。Meta 自己的基准测试将其在智能体任务上排在 Google 的 Gemma4-31B 和 Qwen3.6-27B 之前;但这些数字是供应商自己运行的,至今尚未被复现。
公告未回答的问题
• 没有独立的编码分数。Artificial Analysis 为 1.2 发布了综合指数,但尚未发布它为 1.1 发布的编码和智能体子指数(分别为 71.3 和 37.5)。由于智能体工作是 1.1 最薄弱的维度,且差距明显,而智能体编码正是 1.2 声称已修复的部分,因此这个数字将决定这次发布的结论。
• 基准测试结果尚未被复现。 公告中的每项编码成绩均为 Meta 自行运行得出,尚未有人基于中立脚手架发布 Muse Spark 1.2 的得分。
• 无多模态验证。Muse Spark 的产品页面宣称支持文本、图像、视频、音频和 PDF 输入,但独立评估仅涵盖文本和图像。Meta 的 1.2 消息传递功能已几乎完全转向软件实现,而 1.1 当初明确主打的混合媒体用例,如今既没有营销支持,也没有测量数据。
• 无吞吐量历史记录。端点上的流量仍然过低,无法填充常规滚动延迟统计数据。
未来四周看点
有四件事将决定这次发布是否如 Meta 所言。第一是 1.2 的独立智能体评分——如果 1.1 上为 37.5 的子指数大幅变动,那么编码方面的宣传就属实。第二是是否有人在 Muse Code 之外复现 Terminal-Bench 的结果;一个只在自己的测试框架内表现良好的模型是产品,而非能力。第三是贡献者层级会发生什么:如果 60 次请求的上限放宽,一个以 $0.10 输入、$0.20 输出的前沿邻近模型将改变预算层级的算盘,其影响远非三个点的指数增长可比。第四是权重承诺:Meta 表示 Muse Spark 1.2 的权重将在“未来几周内”开放,而仓库能否按该时间表落地——采用何种许可证,以及本地运行时多快采用——将决定开放权重转向是否属实。
如果这一节奏保持不变,Muse Spark 1.3 将于 9 月初发布。从这一迹象来看,它落地时值得关注的数字不是指数得分,而是 Meta 能否在不给每次请求前端额外增加二十秒思考时间的情况下增强能力。这一转向的首个成果已经亮相:Muse Glimmer——一个 300 亿参数的开源权重模型,Meta 于 8 月 10 日在 Apache 2.0 许可下发布,专为在本地运行智能体而构建,是迄今最接近开源 Muse Spark 1.2 模样的预览。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
