Meta Muse Spark 1.1 评测
Guides & Insights

Meta Muse Spark 1.1 评测:依然很快,但不再便宜

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

四个星期以来,Meta Muse Spark 1.1 的吸引力就是一道算术题:输入每百万 token 1.25 美元,输出 4.25 美元,就能得到一个原生多模态模型,其工具运行能力几乎胜过同价位的任何产品。然而到了 2026 年 8 月 5 日,Meta 在发布 Muse Spark 1.2 的同时,还推出了 Muse Code——其首个终端编码智能体——并为新模型附加了一个 1.1 从未获得的东西:贡献者层级,输入 0.10 美元、输出 0.20 美元。输入便宜 12 倍,输出便宜 21 倍,代价是允许 Meta 使用你的提示词进行训练。Muse Spark 1.1 的价格一分未动,但其定位却变了。

这就是现在审视这款模型的诚实框架。Muse Spark 1.1 没有被弃用,也没有被重新定价,它仍然是 Meta 两个推理检查点中更快、文档也更完善的那个——但它已不再是租用 Meta 模型最便宜的方式,而且 Meta 正在全力主推的那个智能体并不运行在它上面。这篇评测涵盖:1.1 是什么、它在哪些方面有可衡量的优势、八月发布改变了什么,以及在哪些范围更窄的任务中它仍然是正确的选择。数字若来自 Meta 自己的评估,文中会加以说明;若来自 Artificial Analysis 或生产流量,同样也会注明。

快速结论

• 它是什么——一个原生多模态推理模型(输入文本、图像、视频、PDF 和音频,输出文本),具有可配置的推理强度,专为运行工具和操作计算机而打造。权重不公开,由 Meta 提供。

• 价格 — 每百万 token 输入 $1.25 / 输出 $4.25,缓存命中 $0.15。自发布以来未变,仍约为 GPT-5.6 Sol 输出价格($5/$30)的四分之一,以及 Claude Opus 4.8($5/$25)的六分之一。

• 智能——在 Artificial Analysis Intelligence Index 上得分 51,在同类 185 个模型中排名第 22,而同类中位数为 32。这是独立测量结果,并非 Meta 的说法。

• 优势——工具使用与智能体推理,外加真正的速度:每秒 213.5 个输出 token,在 Artificial Analysis 评测的 185 款模型中位列第 2。

• 缺点 — 纯推理和原始编码处于中游水平,长上下文召回并非前沿水平,而且输出冗长:完成 Intelligence Index 需 94M 输出 token,而中位数为 65M。

• 新的注意事项 — Muse Spark 1.2 现在得分高出三分,而且在贡献者层级上,价格仅为二十分之一。1.1 剩下的优势是延迟,而且这是一个很大的优势。

Meta在8月5日发布了什么——以及它对1.1做了什么

Muse Code 是一个终端编程代理,目前处于测试阶段,可通过一行 Shell 脚本在 macOS 和 Linux 上安装(无 Windows 版本),并以 muse 二进制文件的形式运行。它能够处理大型代码库中的完整软件工程任务:规划变更、编写代码、验证结果。Meta 的卖点是架构内聚性——代理与模型是共同训练的,而非简单拼凑而成——其功能列表直指 Claude Code 和 Codex:关闭终端后仍继续工作的后台代理、事件日志恢复、并行子代理工作树,以及默认启用审批的 OS 沙箱。Meta 发布的演示是一个 GPU 内核优化循环,在 NVIDIA Hopper 硬件上运行时间长达 24 小时,执行了超过 1,000 次工具调用。

Muse Code 运行的是 Muse Spark 1.2,而非 1.1。这是任何阅读这篇评测的人面临的第一个实际后果:如果你想要 Meta 的智能体,那你用的就是新的检查点。

第二个后果是定价,而这也是更有趣的一点。Meta 在发布 1.2 时使用了两个不同的模型 ID,而非一个:

• 标准(muse-spark-1.2)——每百万 token 输入 $1.25,缓存输入 $0.15,输出 $4.25。与 Muse Spark 1.1 完全相同。Meta 承诺该层级的提示词和补全内容不会被用于改进其产品。

• 贡献者(muse-spark-1.2-contributor)——输入 $0.10,缓存输入 $0.002,输出 $0.20。作为交换,您允许 Meta 使用您的提示和补全内容训练未来的模型。

• Muse Spark 1.1—不存在贡献者档位。它保持标准定价,且 Meta 未宣布弃用。

Meta自己对贡献者层级的定位是,它“比按需付费层级便宜10倍以上”,但这其实还低估了它:实际的倍数是输入12.5倍、输出21.25倍,而缓存输入几乎免费,只需0.002美元。这就是这次发布所制造出的“低价”头条,而这个低价仅属于1.2版本。

Meta Muse Spark 1.1 Review

价格故事,重新改写

在您围绕 $0.20 的输出 token 定价重写预算之前,请先阅读贡献者层级的其余条款,因为正是这些条款让它变得便宜。速率限制从标准层级文档记载的每分钟 3,000 个请求降至贡献者层级的 60 个——这一上限允许开发者在笔记本电脑上做实验,却禁止生产级代理集群。而且数据交易并非走过场:您的提示词和模型的输出会成为训练材料。对于任何处理客户数据、专有源代码或任何受保密义务约束的内容的人,贡献者层级不是同一产品的更便宜版本,而是不同的产品。Meta 在发布时也承认了这一点,在付费路径上为企业客户增加了零数据保留选项。

因此,诚实的比较不是“1.1 每 4.25 美元对比 1.2 每 0.20 美元”。而是:按照标准定价,这两种模型的价格完全相同,而 1.2 是得分更高的那个。0.20 美元这一档是一个真实且激进的报价,但它针对的是个人和实验,而且仅适用于较新的模型。

真正决定两种模型账单的是缓存,而不是标价。以一个典型的智能体步骤为例:输入 60,000 个 token 的仓库或文档上下文,输出 3,000 个 token 的计划与回答。冷启动时,输入成本为 0.075 美元,输出成本为 0.013 美元——合计约 8.8 美分,即一千步约 88 美元。保持上下文前缀稳定,使其命中缓存(每百万 token 0.15 美元),输入成本就会骤降到 0.009 美元,单步成本约为 2.2 美分,一千步运行成本为 22 美元。这是 75% 的差距,完全取决于你的智能体框架是复用稳定的前缀,还是每轮都重建提示词。如果你读完这篇评测后只采取一项工程措施,那就是缓存键的稳定性,而不是模型选择。

关于你在哪里租用它,有一个结构性的说明。Muse Spark 1.1在OrcaRouter目录中的价格为1.25美元和4.25美元,缓存读取价格为0.15美元——这与Meta收取的数字相同,因为OrcaRouter实行0%加价,直接将提供商的标价传递过去,因此供应商的价格变动在那边生效的当天就会在这里生效。Muse Spark 1.2尚未列入目录,由Meta直接提供。这对你很可能即将进行的比较很重要:GPT-5.6 Sol、Claude Opus 4.8、Grok 4.5和Gemini 3.1 Pro都位于同一个密钥后面,按标价收费,因此你可以在同一个评估集上对它们与Muse Spark 1.1进行基准测试,而无需签订第二份合同;你电子表格中的数字就是发票上的数字。

Muse Spark 1.1 实际上是什么

Muse Spark 是 Meta 超级智能实验室的旗舰推理产品线,该实验室由马克·扎克伯格设立,由 Alexandr Wang 领导。这标志着一个战略转向:Meta 的 Llama 模型此前采用开放权重,而 Muse 系列——包括 Spark 以及图像和视频生成器——则是封闭的,以产品和 API 的形式交付。Spark 1.0 于 2026 年 4 月 8 日发布;1.1 于 7 月 9 日紧随其后推出,同时 Meta Model API 开始公开预览。对开发者而言,实际的变化在于 Meta 现在成为了一方 API 供应商,与现有的两家 API 供应商直接竞争,而不再只是权重发布方——8 月 5 日推出的编程智能体则是迄今为止最明确的印证。

1.1版是一次实质性的升级,而非小版本更新。在Artificial Analysis上,它在三个月内将Intelligence Index提升了8分,从43分升至51分。其编码指数上升12点至71,SciCode提升至58%,Humanity's Last Exam提升至45%。Meta表示,最大的进步在于工具使用、计算机使用、编码和多模态理解——这与一个被调优为行动而非仅仅回答的模型相一致。

关于上下文,此前的困惑已尘埃落定:Artificial Analysis 和 OrcaRouter 都将窗口列为 1,048,576 个 token,而 Meta 则将窗口描述为模型会主动压缩的窗口。不过,持有百万 token 并不等于能从中召回信息;1.1 的长上下文检索得分约为 54.1,说明其召回表现平平。应将窗口视为一种容量,而非一种保证。

推理努力:即时、深思,以及下方的调节旋钮。

在 Meta 面向消费者的界面上,Muse Spark 提供两种命名模式:Instant(即时)模式无需扩展推理即可立即回答,类似于标准聊天回合;Contemplating(沉思)模式使用一种借鉴自强化学习的“思想压缩”技术并行运行多个代理,Meta 将其定位为在艰巨的科学和分析工作中对标 DeepMind Deep Think 和 GPT-5.4 Pro。通过 API,同样的能力以可配置的推理努力参数的形式出现——Artificial Analysis 在该模型的 xhigh 设置(其公开的最昂贵设置)下发布其分数。

把那个旋钮当作成本杠杆,而不是质量滑块。并行智能体推理比单次传递消耗的 token 多得多,你读到的基准测试数字是在最大努力下产生的。常规调用默认使用低档,把高努力留给首次答错代价高昂的情况。

评分情况:使用工具时表现出色,不使用工具时处于中等水平。

解读 Muse Spark 1.1 最清晰的方式是开启工具与关闭工具的对比。在开启工具的情况下,它在代理测试中领先:MCP Atlas 88.1 对比 Claude Opus 4.8 的 82.2,JobBench 54.7 对比 48.4,Legal Agent Bench 20.0 对比 Grok 4.5 的 12.9,以及 Humanity's Last Exam(开启工具)62.1 对比 57.9。而在关闭工具的情况下,它的表现平平——仅 Humanity's Last Exam 得分约 45,远落后于 Gemini 3.1 Pro 在同一测试中约 77 的成绩。

在执行精度方面也落后于领先者:OSWorld-Verified 计算机使用 80.8,低于 Opus 4.8 的 83.4;SWE-Bench Pro 编码 61.5,低于 69.2;DeepSWE 1.1 长周期编码 53.3,低于 GPT-5.5 的 67.0;BabyVision 视觉推理 76.3,低于 83.6。其中许多数字由厂商报告,部分来自 Meta 自身的评估,且运行在不同的测试框架上——请将其视为方向性参考,并在你自己的任务上重新测试。

Meta Muse Spark 1.1 Review

来自 Artificial Analysis 的独立视角更简洁也更有用。智能指数 51,在 185 个模型中排名第 22,同类中位数为 32。速度:每秒 213.5 个输出 token,在 185 个模型中排名第 2——这是一个真正快速的模型。价格排名第 31,缓存命中价格 0.15 美元,相当于 88% 的折扣。冗长度:跑完整个指数需要 9400 万个输出 token,而中位数是 6500 万,实际账单中很大一部分开销就来自这里。在整个测试套件上评估它的总花费:548.07 美元。

有一点值得注意:Meta 宣传支持文本、图像、视频、音频和 PDF 输入,但 Artificial Analysis 的 1.1 技术规格卡仅记录文本和图像作为已评估项。这两种情况都可能成立——API 接受的内容多于基准测试工具实际测试的内容——但除 Meta 之外,没有人发布过视频或音频工作负载的结果。如果你是为了多模态分析而来,请预留时间自行验证。

你应该升级到 1.2 吗?延迟的答案

在编码方面,Meta 的答案是肯定的,而且其数据彼此一致:{{1}}Terminal-Bench 2.1 从 76.2% 升至 82.9%{{/1}}、{{2}}DeepSWE v1.1 从 53.0% 升至 59.3%{{/2}}、{{3}}其内部编码基准从 68.3% 升至 70.6%{{/3}}。这些都是 Meta 自行运行的评估,在 {{6}}Meta 自己的测试框架{{/6}} 中以 {{4}}pass@1{{/4}} 评分进行了 {{5}}五次尝试{{/5}}——标准的注意事项依然适用,即竞争对手的模型在厂商的测试框架中往往未得到充分调优。独立来看,{{7}}Artificial Analysis{{/7}} 将 {{8}}Muse Spark 1.2{{/8}} 在 {{10}}Intelligence Index{{/10}} 上的得分调整至 {{9}}54{{/9}},排名 {{11}}185 个模型中的第 13 位{{/11}},比 1.1 版本高出 3 分。

Meta是用深思熟虑换来这些分数的,这一点体现在每一项计时指标上。Artificial Analysis测得1.2版本的首个令牌生成时间为26.12秒,而1.1版本为2.90秒——两者均在各模型最高推理强度下测试。输出速度从每秒213.5个令牌降至165个。冗长程度略有上升,9500万令牌对比9400万令牌,而在完全相同的按令牌定价下,运行同一基准测试套件的成本从548.07美元升至637.85美元。最后一个数字最能说明这笔交易的代价:同样的价格表,多消耗16%的令牌,换来三个指数点的提升。

请仔细阅读26秒这个数值,因为它很容易被误读。这是最大努力级别下的基准测试测量结果,而API默认使用中间设置。作为真实流量的参考点,OrcaRouter上的Muse Spark 1.1——无论调用方实际请求哪种努力级别——在一周的生产流量中,首令牌时间p50为1.84秒,p95为6.00秒,错误率为零。最大努力下的基准延迟与默认努力下的生产延迟是不同的量,两者之间的差距通常超过一个数量级。

因此,决策可以清晰地根据工作负载形态来判定。如果你运行的是长周期编码代理,它们把整个代码库保存在上下文中,一次任务持续数分钟,那么 1.2 是更好的模型,延迟代价分摊在一个本就永远不可能感觉即时的任务上。如果你提供的是任何交互式服务——聊天界面、有真人等待的工具调用循环、以秒计量的延迟 SLO——Muse Spark 1.1 仍然是该系列中形态更优的模型,它的速度排名绝非舍入误差。八月发布的内容不会改变这一点。

开发者体验和限制

Meta Model API 仍处于公开预览阶段,不过8月的发布扩大了全球访问范围,并增加了企业级零数据保留选项。Meta 提供 OpenAI 风格的接口和 SDK 访问,Spark 已在 Meta AI 的“思考”模式中对消费者上线。速率限制现已公布而非猜测——标准层级记录为每分钟 3,000 次请求——但预览状态终究是预览状态,因此在容量受限的日子里要保留一条备用路由。跨提供商的自动故障转移正是预览级端点所需要的这类基础设施,也是为什么通过网关路由预览模型不费成本却能获得第二条路径的原因。

Meta Muse Spark 1.1 Review

通过OrcaRouter,模型ID为meta/muse-spark-1.1,并且/v1/chat/completions和/v1/responses都可用,因此现有的兼容OpenAI的客户端只需要一个基础URL和一个模型字符串,其他什么都不需要:

import openai as openai_client

client = openai_client.Client(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_API_KEY")

response = client.chat.completions.create(model="meta/muse-spark-1.1", messages=[{"role": "user", "content": "规划并运行工具以修复此问题。"}])

print(response.choices[0].message.content)

适用之处——以及不适用之处

适用场景:工具运行和计算机使用自动化,其中响应时间对人可见;在无法交给训练集的数据上进行大规模成本敏感推理;将文本与图像、视频、PDF 或音频混合的工作流,并在媒体路径上自行验证;以及希望以快速、廉价的默认方案为主,同时保留高级模型用于最困难步骤的团队。

弱项:排行榜顶级的编码准确率和最难的绿地工程,这些仍然属于 Claude Opus 4.8 和 GPT-5.6 Sol;没有工具参与的纯推理问题;视觉精度任务(Gemini 3.1 Pro 领先);长期仓库工作,现在明确由 1.2 和 Muse Code 负责;以及任何需要 Meta 最便宜 token 的场景,因为该层级在此模型上不存在。

常见问题

既然 1.2 已经发布了,Muse Spark 1.1 仍然可用吗?

是的。Meta在8月5日的发布中宣布不会弃用,也不会重新定价——1.1仍保留在Meta Model API上,定价为每百万token 1.25美元和4.25美元,OrcaRouter目录中的价格也相同。关于此次发布的报道一致将其描述为延续现有的API定价。话虽如此,Meta的工程关注点已明显转移:编码代理、新基准测试和廉价层级都归属于1.2。

我能在 $0.10 贡献者层级获得 Muse Spark 1.1 吗?

不。贡献者层级是较新检查点 muse-spark-1.2-contributor 上的一个独立模型 ID。没有 1.1 的对应版本,因此,最便宜的 Meta 推理令牌需要升级版本——并且要接受每分钟 60 次请求的上限,以及允许 Meta 使用你的提示词和补全内容进行训练。

我应该升级到 Muse Spark 1.2 吗?

如果你的工作负载是长期运行的编码或仓库级智能体工作,那么可以:在相同的标准价格下,它在Meta自己的编码评估和Artificial Analysis的独立指数上得分都更高。如果你的工作负载是交互式的或对延迟敏感,那么不行:1.2大约要付出九倍的首令牌时间和23%的输出速度,换来三个指数点,而且它的推理功能无法关闭。两者都在同一个API上,所以切换无论如何都只是改一个模型字符串——这是最便宜的A/B测试,值得在决定之前用你自己的流量跑一跑。

Muse Spark 1.1 是开源的吗?

不,这正是这条产品线的要点。与Meta的Llama模型不同,Muse系列采用封闭权重,以产品和API的形式交付。Hugging Face上没有权重文件,没有自托管路径,也没有第三方提供商——Meta是唯一提供该模型的厂商,这使得带有故障转移的路由层成为应对单一提供商风险的实际解决方案,而非依赖第二家供应商。

一个版本之后的定论

Muse Spark 1.1 是一款快速、廉价、真正多模态的智能体模型,在工具使用方面表现出色,但在纯编码和推理方面坦率地说只是中等水平。八月测得的各项指标都没有变差。变化的是围绕它的产品家族形态:Meta 现在在同样的标准价格下有一款得分更高的模型,为愿意用数据交换的开发者提供了一个价格大幅降低的层级,还有一个智能体产品,它既不能运行在 1.1 上,也不能运行在你可以指向 1.1 的任何东西上。

留下的是一条范围更窄但依然切实的建议。如果你需要以人类可感知的速度获得 Meta 的推理质量——生产环境中首个 token 只需一秒,之后每秒 213 个 token——那么 1.1 仍然是你该调用的版本;1.2 多出的三个指数点,不值得九倍的等待。如果你不需要那种速度,那就没有太多理由继续停留在 1.1。无论哪种情况,它都只是一个模型字符串,所以诚实的建议是:在你自己的评估集上把两个版本各跑一天,然后让你的延迟预算来做决定。

本文中的对比4

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新