
Muse Spark 1.3 Max 推理已正式上线:支撑 Meta 顶级评分的配置现已向所有人提供
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Muse Spark 1.3——Meta超级智能实验室于9月2日发布的前沿推理模型——刚刚获得了其自身评分榜所基于的模式。9月4日,在经历两天的额外安全测试后,Meta在Meta Model API及其终端编码智能体Muse Code中向开发者开放了该模型计算强度最高的“max”推理设置。首席AI官Alexandr Wang在X上宣布了这一上线消息,公司的@AIatMeta账号予以确认;此前该配置在发布时仅限Meta内部及合作伙伴预览使用,如今已成为任何开发者均可选择的推理级别。
这个顺序之所以重要,是因为主导了 Muse Spark 1.3 发布报道的几个数字——DeepSWE v1.1 上的 75.4、OSWorld 2.0 上的 66.9、GDPval-AA v2 上的 1,754——都来自 max 配置,而开发者实际可以调用的模型,其推理努力上限被设为了“xhigh”。Meta 在发布时明确表示,max 仍处于安全测试中,但这种拆分意味着,在两天里,头版排行榜和可调用模型是两回事。周四的发布弥合了这一差距,而且没有触及每 token 的价格。该列表中的基准数字是 Meta 自家的,尚未由独立测试工具复现;本文中所有供应商报告的内容均已如此标注。
什么被隐瞒了——以及9月4日发生了什么变化
自该系列付费 API 开放以来,Muse Spark 1.3 的推理阶梯形态一直未变:推理始终开启,模型在 Meta Model API 上的 effort 参数可取值 minimal、low、medium、high 和 xhigh,等级越高,模型将越多的输出预算用于思考。Max 位于 xhigh 之上——计算量更大、推理 token 更多,按照 Meta 的说法,在长时程智能体任务上表现显著更强。在 9 月 2 日的发布中,Meta 提供了直至 xhigh 的所有等级,但将 max 排除在公共 API 之外,以待其所谓的额外安全测试,仅与有限的合作伙伴共享——足以运行独立评估,却不足以支撑生产工作负载。
9月4日,Wang表示测试已完成。Max现在是Muse Code中的可选设置——安装脚本位于dev.meta.ai/install.sh——并且通过Meta Model API的muse-spark-1.3模型ID也可用,其中effort参数现在接受max。Wang将这两天的错开描述为Meta在“配置层面”进行访问控制的方式,并告诉Axios,Meta不必因安全问题暂停其更广泛的工作。这个窗口很短,但这是一个真正的先例:Meta现在愿意将特定的推理模式置于安全审查之后,同时立即发布检查点的其余部分。
对于通过网关而非 Meta 自身端点调用该模型的人来说,有一个实际的注意事项:一些第三方文档页面和聚合器列表是在发布当天编写的,仍然只将推理努力值列举到 xhigh。最大值是 Meta 方面的推出,因此在假设 max 可达之前,请检查你调用的路由是否已更新其参数面——一个在 9 月 2 日验证过其接受值的代理可能会拒绝 "max",直到其维护人员赶上。
Max 实际能买到什么——以及它在哪些方面帮不上忙
Meta周四发布的材料中,对其运行的基准测试明确区分了“max”与“xhigh”两种设置,这是迄今为止该公司发布的关于该模型的最有用信息。所有数据均由供应商报告,生成于Meta自家的Muse Code测试框架内,Meta表示,其对Claude Opus 5和GPT-5.6 Sol的对比是在这些竞争对手自身的最高设置下进行的“尽力而为”运行,可能无法反映供应商优化后的性能。有了这一说明,这种区分清晰地指示了方向:
• OSWorld 2.0(计算机使用智能体任务)— 66.9(max)对比 57.2(xhigh)
• GDPval-AA v2(知识工作智能体 Elo)— max 下 1,754,对比 xhigh 下 1,709
• JobBench(长时程专业任务)— max 下 64.9 vs xhigh 下 61.2
• DeepSearchQA — 并列89.4
• Terminal-Bench 2.1(终端代理编码)——89.2(xhigh)对比 88.8(max),这是唯一一个 9 月 2 日发布的配置胜出的测试套件。

这个规律值得仔细读一遍。Max 在长程智能体循环中帮助最大——操作电脑、处理知识工作简报、像 JobBench 那样维护子任务时间表。在单轮终端基准上,它毫无增益,还略有成本:Terminal-Bench 提醒我们,“更多推理”并不是一种单调的提升,也正因如此,你应该在自己负载上把 max 与 xhigh 做 A/B 对比,而不是假定更高设置在哪儿都更好。Meta 还指出,DeepSWE v1.1 的 75.4 分——这个发布首日的头条数字,高于 Meta 六周前报告的 Muse Spark 1.2 的 59.3——是一个 max 配置下的结果。独立评估者会最先重跑这个数字。
独立读数开始追赶上来
发布时缺少的是任何独立的测量数据,而这一空白正在以恰好与 max 版本推出时间同步的进度逐步得到填补。Artificial Analysis 的 Coding Agent Index 在每个模型的原生编码智能体框架内进行评分,并综合 DeepSWE、Terminal-Bench 和 SWE-Atlas 任务。该指数本周将 Muse Code 框架中的 Muse Spark 1.3 (max) 评为 68 分,位居榜单第二,仅次于 Claude Code 中的 Claude Opus 5 (xhigh),领先于 67 分的 Claude Fable 5 (max) 和 65 分的 GPT-5.6 Sol (max)。同一榜单将已发布的 xhigh 配置在同一 Muse Code 框架中评为 64 分——这是在独立任务集上,对 max 究竟带来多大提升的最直观同类对比读数,差额约为四个指数点。该榜单数据发布时,max 仍处于合作伙伴预览阶段;其中描述的配置已于 9 月 4 日正式全面可用。
人工智能分析(Artificial Analysis)自发布以来也更新了其针对最大配置的模型卡片。在预览期间,卡片未列出提供商和价格;现在的正式卡片将Meta列为标准价格,即每百万输入令牌1.25美元、每百万输出令牌4.25美元——与Muse Spark 1.2的标价相同——同时添加了一条冗长性说明:AA的评估运行消耗了约1.3亿个令牌,而中位数为7900万,总费用约为1335美元,按AA的每任务估算,每个任务接近0.95美元,输出速度约为每秒190个令牌。
早前报道中的一个数字值得进行版本核查。本周,Artificial Analysis 将其 Intelligence Index 更新至 v4.2 —— 恰逢 max 发布的同一周 —— 重新对领域进行评分,并调整了中位数。在当前卡片上,max 配置的得分为 53,而可比模型的中位数为 29;发布周报道中流传的 62 是根据该指数旧版本测得的,两者不可比。Meta 自己上述的 xhigh 与 max 对比划分独立于 AA 的指数,不受此次更新影响。

最大的成本是什么——账单是按代币计算的,不是按价目表
Meta没有为max配置单独定价,也没有专门的延迟分析。每token价格与Muse Spark 1.2以及Muse Spark 1.3上所有其他推理力度级别相同:标准层每百万输入token为1.25美元,每百万输出token为4.25美元,缓存输入为0.15美元。推理token按输出token计费并计入输出预算,因此选择max并非单列项目的价格上涨,而是承诺在回答前将更多预算用于思考。
这使得真正的成本问题变成了 token 用量问题,而早期数据表明,max 恰恰在 xhigh 精简的地方烧钱。AA 的插桩运行在单次配置评估中消耗了约 1.3 亿个 token。对于已经在 xhigh 上运行长时智能体循环的开发者而言,真正重要的 A/B 测试不是“max 是否通过更多任务”,而是“max 多通过的任务是否足以值回同一工作负载下明显更大的 token 账单”。
Meta 的 Contributor 层级——每百万 token 输入收取 0.10 美元、输出收取 0.20 美元,作为交换,Meta 可以在你的提示词和补全内容上进行训练——适用于同一个检查点。Meta 表示,有相当可观(两位数百分比)的开发者选择了这一方案。Contributor 的条款规定每一条提交都会成为训练数据,且速率限制非常严格,因此它并非生产环境扇出场景的合适默认选项;但如果你能接受数据交换,它倒是一种以低成本运行昂贵 max 实验的正当途径。
这一切的定价锚点无需只凭 Meta 的说法,也能轻松核实,因为检查点 Muse Spark 1.3 的定价与 OrcaRouter 上已按 Meta 官方标价列出的版本完全相同:Muse Spark 1.2 在 OrcaRouter 上的价格为每百万 tokens 输入 $1.25、输出 $4.25,零加价,因此“价格不变”的说法可以通过一个实时页面来核实,该页面显示的数字恰好就是这些。Muse Spark 1.3 本身还没有出现在 OrcaRouter 上。当我们所代理的提供商开始以 max 模式提供服务时,我们这边显示的价格将是 Meta 的官方标价原样直通——我们不对提供商的价格加价——而且任何供应商分成都会在 Meta 作出调整的当天同步生效。对于像这次这样的发布,其经济上的看点在于 token 用量而非标价,正是这种直通模式让你实际支付的金额与 Meta 公布的金额保持一致。

谁应该切换到max
这个决定明确地一分为二:
• 针对长时程代理工作负载切换此开关——计算机操作、知识工作简报、Muse Code 中的多步骤工具循环——在这类场景下,Meta 自身的数据拆分与 AA 的编码代理面板都显示出最大的增益上限。先在部分真实任务样本上将其与 xhigh 进行 A/B 测试,因为输出冗长是实际存在的。
• 对于高流量、对延迟敏感或短单轮调用,请保持使用 xhigh,因为在这些场景下 max 主要只是增加 token。Terminal-Bench 证明它并不总能提升能力。
• 从这里关注三件事:扎克伯格承诺但尚未给出日期的开源权重发布;Muse Spark 1.3 在未来几周内向 Instagram、Facebook 和 Meta AI 的消费者推出;以及既然该配置已全面可用,Artificial Analysis 的编程智能体排行榜是否会开始对最大行定价。
{{1}}为期两天的窗口期虽短,却留下了一个比发布本身更长久的观点:Meta最强的Muse Spark 1.3数据从来就不是海市蜃楼——它们只是在等待一次安全审查。{{/1}}自9月4日起,开发者能调用的模型与榜单上的模型终于合二为一。max是否值得其token消耗,如今是一个任何开发者都能在Meta的API上,或通过他们通往Muse Spark系列的任何既有路径来回答的经验性问题。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
