一则关于 Muse Spark 1.3 最高推理模式现已上线的新闻主视觉标题卡片。眉题:“Meta Superintelligence Labs — 2026年9月4日”;主标题:“Muse Spark 1.3 最高推理模式现已上线”;副标题注明 Meta 在发布两天后通过安全测试,并以相同价格开放了支撑其在 Muse Code 和 Meta Model API 中领先分数的推理模式;徽章:“reasoning effort: max”、“相同 $1.25 / $4.25 标价”和“DeepSWE 75.4 背后的配置”;页脚:“现在可在 muse-spark-1.3 上选择——推理 token 按输出计费”;OrcaRouter 徽标合成于右下角。
Guides & Insights

Muse Spark 1.3 Max 推理已正式上线:支撑 Meta 顶级评分的配置现已向所有人提供

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Muse Spark 1.3——Meta超级智能实验室于9月2日发布的前沿推理模型——刚刚获得了其自身评分榜所基于的模式。9月4日,在经历两天的额外安全测试后,Meta在Meta Model API及其终端编码智能体Muse Code中向开发者开放了该模型计算强度最高的“max”推理设置。首席AI官Alexandr Wang在X上宣布了这一上线消息,公司的@AIatMeta账号予以确认;此前该配置在发布时仅限Meta内部及合作伙伴预览使用,如今已成为任何开发者均可选择的推理级别。

这个顺序之所以重要,是因为主导了 Muse Spark 1.3 发布报道的几个数字——DeepSWE v1.1 上的 75.4、OSWorld 2.0 上的 66.9、GDPval-AA v2 上的 1,754——都来自 max 配置,而开发者实际可以调用的模型,其推理努力上限被设为了“xhigh”。Meta 在发布时明确表示,max 仍处于安全测试中,但这种拆分意味着,在两天里,头版排行榜和可调用模型是两回事。周四的发布弥合了这一差距,而且没有触及每 token 的价格。该列表中的基准数字是 Meta 自家的,尚未由独立测试工具复现;本文中所有供应商报告的内容均已如此标注。

什么被隐瞒了——以及9月4日发生了什么变化

自该系列付费 API 开放以来,Muse Spark 1.3 的推理阶梯形态一直未变:推理始终开启,模型在 Meta Model API 上的 effort 参数可取值 minimal、low、medium、high 和 xhigh,等级越高,模型将越多的输出预算用于思考。Max 位于 xhigh 之上——计算量更大、推理 token 更多,按照 Meta 的说法,在长时程智能体任务上表现显著更强。在 9 月 2 日的发布中,Meta 提供了直至 xhigh 的所有等级,但将 max 排除在公共 API 之外,以待其所谓的额外安全测试,仅与有限的合作伙伴共享——足以运行独立评估,却不足以支撑生产工作负载。

9月4日,Wang表示测试已完成。Max现在是Muse Code中的可选设置——安装脚本位于dev.meta.ai/install.sh——并且通过Meta Model API的muse-spark-1.3模型ID也可用,其中effort参数现在接受max。Wang将这两天的错开描述为Meta在“配置层面”进行访问控制的方式,并告诉Axios,Meta不必因安全问题暂停其更广泛的工作。这个窗口很短,但这是一个真正的先例:Meta现在愿意将特定的推理模式置于安全审查之后,同时立即发布检查点的其余部分。

对于通过网关而非 Meta 自身端点调用该模型的人来说,有一个实际的注意事项:一些第三方文档页面和聚合器列表是在发布当天编写的,仍然只将推理努力值列举到 xhigh。最大值是 Meta 方面的推出,因此在假设 max 可达之前,请检查你调用的路由是否已更新其参数面——一个在 9 月 2 日验证过其接受值的代理可能会拒绝 "max",直到其维护人员赶上。

Max 实际能买到什么——以及它在哪些方面帮不上忙

Meta周四发布的材料中,对其运行的基准测试明确区分了“max”与“xhigh”两种设置,这是迄今为止该公司发布的关于该模型的最有用信息。所有数据均由供应商报告,生成于Meta自家的Muse Code测试框架内,Meta表示,其对Claude Opus 5和GPT-5.6 Sol的对比是在这些竞争对手自身的最高设置下进行的“尽力而为”运行,可能无法反映供应商优化后的性能。有了这一说明,这种区分清晰地指示了方向:

• OSWorld 2.0(计算机使用智能体任务)— 66.9(max)对比 57.2(xhigh)

• GDPval-AA v2(知识工作智能体 Elo)— max 下 1,754,对比 xhigh 下 1,709

• JobBench(长时程专业任务)— max 下 64.9 vs xhigh 下 61.2

• DeepSearchQA — 并列89.4

• Terminal-Bench 2.1(终端代理编码)——89.2(xhigh)对比 88.8(max),这是唯一一个 9 月 2 日发布的配置胜出的测试套件。

A comparison scoreboard titled 'Muse Spark 1.3 — max vs xhigh, the split'. Left column Max (released Sept 4, 2026): OSWorld 2.0 66.9, Terminal-Bench 2.1 88.8, GDPval-AA v2 (Elo) 1,754, JobBench 64.9, DeepSearchQA 89.4, Available to all developers. Right column Xhigh (released Sept 2, 2026): OSWorld 2.0 57.2, Terminal-Bench 2.1 89.2, GDPval-AA v2 (Elo) 1,709, JobBench 61.2, DeepSearchQA 89.4, Available to all developers. Footer: 'Benchmark splits per Meta's Sept 4 release materials — vendor-reported, not independently reproduced. Xhigh wins Terminal-Bench 2.1.' OrcaRouter logo bottom-right.

这个规律值得仔细读一遍。Max 在长程智能体循环中帮助最大——操作电脑、处理知识工作简报、像 JobBench 那样维护子任务时间表。在单轮终端基准上,它毫无增益,还略有成本:Terminal-Bench 提醒我们,“更多推理”并不是一种单调的提升,也正因如此,你应该在自己负载上把 max 与 xhigh 做 A/B 对比,而不是假定更高设置在哪儿都更好。Meta 还指出,DeepSWE v1.1 的 75.4 分——这个发布首日的头条数字,高于 Meta 六周前报告的 Muse Spark 1.2 的 59.3——是一个 max 配置下的结果。独立评估者会最先重跑这个数字。

独立读数开始追赶上来

发布时缺少的是任何独立的测量数据,而这一空白正在以恰好与 max 版本推出时间同步的进度逐步得到填补。Artificial Analysis 的 Coding Agent Index 在每个模型的原生编码智能体框架内进行评分,并综合 DeepSWE、Terminal-Bench 和 SWE-Atlas 任务。该指数本周将 Muse Code 框架中的 Muse Spark 1.3 (max) 评为 68 分,位居榜单第二,仅次于 Claude Code 中的 Claude Opus 5 (xhigh),领先于 67 分的 Claude Fable 5 (max) 和 65 分的 GPT-5.6 Sol (max)。同一榜单将已发布的 xhigh 配置在同一 Muse Code 框架中评为 64 分——这是在独立任务集上,对 max 究竟带来多大提升的最直观同类对比读数,差额约为四个指数点。该榜单数据发布时,max 仍处于合作伙伴预览阶段;其中描述的配置已于 9 月 4 日正式全面可用。

人工智能分析(Artificial Analysis)自发布以来也更新了其针对最大配置的模型卡片。在预览期间,卡片未列出提供商和价格;现在的正式卡片将Meta列为标准价格,即每百万输入令牌1.25美元、每百万输出令牌4.25美元——与Muse Spark 1.2的标价相同——同时添加了一条冗长性说明:AA的评估运行消耗了约1.3亿个令牌,而中位数为7900万,总费用约为1335美元,按AA的每任务估算,每个任务接近0.95美元,输出速度约为每秒190个令牌。

早前报道中的一个数字值得进行版本核查。本周,Artificial Analysis 将其 Intelligence Index 更新至 v4.2 —— 恰逢 max 发布的同一周 —— 重新对领域进行评分,并调整了中位数。在当前卡片上,max 配置的得分为 53,而可比模型的中位数为 29;发布周报道中流传的 62 是根据该指数旧版本测得的,两者不可比。Meta 自己上述的 xhigh 与 max 对比划分独立于 AA 的指数,不受此次更新影响。

A screenshot of the Artificial Analysis model page for Muse Spark 1.3 (max), showing a score of 53 on the Artificial Analysis Intelligence Index against a comparable-model median of 29, input pricing of $1.25 and output pricing of $4.25 per 1M tokens with an 88% cache discount, a per-task cost estimate near $0.95, about 190 output tokens per second, a 1M-token context window, and a note that the configuration is 'somewhat verbose' after generating roughly 130M tokens against a 79M median.

最大的成本是什么——账单是按代币计算的,不是按价目表

Meta没有为max配置单独定价,也没有专门的延迟分析。每token价格与Muse Spark 1.2以及Muse Spark 1.3上所有其他推理力度级别相同:标准层每百万输入token为1.25美元,每百万输出token为4.25美元,缓存输入为0.15美元。推理token按输出token计费并计入输出预算,因此选择max并非单列项目的价格上涨,而是承诺在回答前将更多预算用于思考。

这使得真正的成本问题变成了 token 用量问题,而早期数据表明,max 恰恰在 xhigh 精简的地方烧钱。AA 的插桩运行在单次配置评估中消耗了约 1.3 亿个 token。对于已经在 xhigh 上运行长时智能体循环的开发者而言,真正重要的 A/B 测试不是“max 是否通过更多任务”,而是“max 多通过的任务是否足以值回同一工作负载下明显更大的 token 账单”。

Meta 的 Contributor 层级——每百万 token 输入收取 0.10 美元、输出收取 0.20 美元,作为交换,Meta 可以在你的提示词和补全内容上进行训练——适用于同一个检查点。Meta 表示,有相当可观(两位数百分比)的开发者选择了这一方案。Contributor 的条款规定每一条提交都会成为训练数据,且速率限制非常严格,因此它并非生产环境扇出场景的合适默认选项;但如果你能接受数据交换,它倒是一种以低成本运行昂贵 max 实验的正当途径。

这一切的定价锚点无需只凭 Meta 的说法,也能轻松核实,因为检查点 Muse Spark 1.3 的定价与 OrcaRouter 上已按 Meta 官方标价列出的版本完全相同:Muse Spark 1.2 在 OrcaRouter 上的价格为每百万 tokens 输入 $1.25、输出 $4.25,零加价,因此“价格不变”的说法可以通过一个实时页面来核实,该页面显示的数字恰好就是这些。Muse Spark 1.3 本身还没有出现在 OrcaRouter 上。当我们所代理的提供商开始以 max 模式提供服务时,我们这边显示的价格将是 Meta 的官方标价原样直通——我们不对提供商的价格加价——而且任何供应商分成都会在 Meta 作出调整的当天同步生效。对于像这次这样的发布,其经济上的看点在于 token 用量而非标价,正是这种直通模式让你实际支付的金额与 Meta 公布的金额保持一致。

A screenshot of the OrcaRouter model page for Muse Spark 1.2, the checkpoint Muse Spark 1.3 is priced identically to, showing header stats $1.25 input and $4.25 output per million tokens, p50 time-to-first-token 7.84 s, p50 total 10.00 s and 48.9M, the description 'Muse Spark 1.2 is Meta's reasoning model for complex agentic tasks... a drop-in upgrade rather than a new tier', and the 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.

谁应该切换到max

这个决定明确地一分为二:

• 针对长时程代理工作负载切换此开关——计算机操作、知识工作简报、Muse Code 中的多步骤工具循环——在这类场景下,Meta 自身的数据拆分与 AA 的编码代理面板都显示出最大的增益上限。先在部分真实任务样本上将其与 xhigh 进行 A/B 测试,因为输出冗长是实际存在的。

• 对于高流量、对延迟敏感或短单轮调用,请保持使用 xhigh,因为在这些场景下 max 主要只是增加 token。Terminal-Bench 证明它并不总能提升能力。

• 从这里关注三件事:扎克伯格承诺但尚未给出日期的开源权重发布;Muse Spark 1.3 在未来几周内向 Instagram、Facebook 和 Meta AI 的消费者推出;以及既然该配置已全面可用,Artificial Analysis 的编程智能体排行榜是否会开始对最大行定价。

{{1}}为期两天的窗口期虽短,却留下了一个比发布本身更长久的观点:Meta最强的Muse Spark 1.3数据从来就不是海市蜃楼——它们只是在等待一次安全审查。{{/1}}自9月4日起,开发者能调用的模型与榜单上的模型终于合二为一。max是否值得其token消耗,如今是一个任何开发者都能在Meta的API上,或通过他们通往Muse Spark系列的任何既有路径来回答的经验性问题。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新