
Muse Spark 1.2 对比 Muse Spark 1.1:你该升级吗?
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3055智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
- z-aiZ.ai: GLM 5.22026-06-1653智能69代码60数学
Meta 于 Muse Spark 1.1 替换为 Muse Spark 1.2,2026年8月5日,且未改变价格、上下文窗口、模态列表、支持的参数或推理档位。因此,这次迁移看起来是免费的——相同的模型字符串家族、相同的计费方式,无需重新谈判。但并非免费。独立测量显示,新版本的首令牌时间为26.12秒,而旧版本为2.90秒;持续输出为每秒165个令牌,而旧版本为213.5个。你买到了三个实测智能点数,却要等大约九倍的时间才能收到任何返回内容。
这件事是否值得做,几乎完全取决于你的任务运行时长。以下是实际不同的地方、保持不变的地方,以及还没有人能告诉你的内容。
四行内的决定
• 智能指数:51 → 54,该数据由 Artificial Analysis 在各版本的 xhigh 设置下独立测量得出。
• 首个 token 生成时间:2.90s → 26.12s,相同来源,相同条件。
• 运行相同基准测试套件的成本:$548.07 → $637.85,按相同的token单价计费。额外的16%纯粹是浪费token。
• 采购表格所询问的一切内容:保持不变。

什么才是真正相同的
这一点值得详细说明,因为它正是迁移在纸面上看似轻而易举的原因,也因为一个不存在的差异正是你无需测试的差异。
• 价格 — 每百万输入 tokens 1.25 美元,每百万输出 4.25 美元,缓存命中时每百万 0.15 美元,每千次内置网络搜索 2.50 美元。这些数字在两个版本上都是一样的。
• 上下文 — 两者均支持 1,048,576 个 token,且均无长上下文额外收费。
• 模态 — 文本、图像、视频、音频和PDF输入;文本输出。两个列表都宣称支持相同的五种输入类型。
• 推理旋钮 — 两者均强制要求,五个级别(最低、低、中、高、最高),两者默认均为中。两个版本都没有关闭思考的设置。
• 参数 — tools、tool_choice、structured_outputs、response_format、reasoning_effort、include_reasoning、max_tokens、temperature、top_p、top_k、repetition_penalty。列表完全相同。
• 服务——两边均为同一提供商 Meta 本身。没有第三方主机,没有量化变体。
• 混合价格——Artificial Analysis 按综合加权计算,两者均为每百万个 token 0.78 美元,鉴于费率卡完全相同,这一结果符合预期。
如果你原本指望这次升级会带来更大的上下文窗口、完成长度保障,或者更便宜的缓存,那么并没有。这只是一次权重和后训练层面的发布,价格表是从上一版直接复制粘贴过来的。
到底是什么移动了
Artificial Analysis 目前是唯一对这两个版本都进行了评估的独立机构,而且对两者进行评估时均采用了最高推理强度,因此这一比较是同类对等的。
• 智能指数 — 从 1.1 的 51 分(185 个中排名第 22)到 1.2 的 54 分(排名第 13)。在同类中位数为 32 的榜单上提升了 9 个名次,因此这一提升带来的是实际排位,而不只是一个小数变化。
• 首个token生成时间—— 从2.90秒到26.12秒。这是首要的性能回退,而且幅度不小。
• 输出速度 — 每秒 213.5 至 165.0 个 token。在 185 个模型中仍排名第 16,仍被 Artificial Analysis 描述为“显著快速”,但比它所取代的模型慢 23%。
• 冗长度 — 完成索引需要 94M 个输出 token,而 95M 个。实际上没有变化,两者均比 65M 中位数高约 45%。
• 评估总支出 — 548.07美元至637.85美元。由于冗长程度几乎没有变化,价格也完全没有变动,这16%的增长来自可见输出之外的其他地方:更长的内部推理轨迹、更多的重试,或每个任务更多的工具调用轮次。
这个模式是连贯的。Meta并没有让模型变得更便宜、更快或更大。它只是让模型在最终确定答案之前花更长时间斟酌,而这种额外的斟酌表现为延迟增加、流式输出略微变慢,以及相同工作量下高出16%的账单。而这一切所换来的,只有三个指数点。
延迟到底有多糟糕
26.12秒这个数字会被断章取义地引用,所以请正确看待:它是在xhigh(五个努力级别中费用最高的一个)下,用一套特意设计得很难的基准测试套件测得的。API默认值为medium。
为了了解默认设置的实际体验,OrcaRouter 上的 Muse Spark 1.1——以用户请求的任何努力水平服务真实调用者——显示了一个 p50 首 token 时间为 1.84 秒,p95 为 6.00 秒,这是滚动一周内的数据。这是生产环境努力水平下的生产数据,比基准数字低了一个数量级以上。版本 1.2 还没有生产遥测数据。

所以,诚实的解读不是“1.2 用 26 秒来响应。”而是:在 1.2 赢得其额外三分的设置下,第一个 token 要花费你 26 秒,而在同一设置下,旧模型只花费你三秒。如果你本来就在以 xhigh 运行——这正是智能提升存在的配置——那么你继承的就是这个数字。如果你在 medium 或更低档位运行,你会看到短得多的时间,同时也会看到改进也少一些。
这种耦合才是这次升级中真正的陷阱。你无法只拿走智慧而不要深思,因为智慧正是源于深思。
数字背后的重新定位
Meta 没有为 1.2 发布启动文章——Muse Spark 的公告页面仍描述 1.1——但它重写了产品描述,而这次重写解释了其中的取舍。
Muse Spark 1.1 作为一款多模态推理模型推出,输入面异常广泛,旨在支持"多模态智能体、跨混合媒体的深度研究和长上下文分析":长报告、媒体库、录音和视频,以及文本。
Muse Spark 1.2 的描述几乎完全摒弃了这些内容,转而强调软件工程——多文件重构、扩展调试会话、整个代码库生成——并且增加了一个明确的多智能体声明:该模型既可以充当主智能体,负责收集上下文、制定计划并委派任务,也可以充当在其下方并行执行的子智能体。它还声称,提示缓存可将有效成本降低60–80%,具体取决于调用之间上下文重复的程度。最后那个数字是Meta的估计,而非实测结果,不过0.15美元的缓存费率使其在计算上可信。
将延迟回归与那次重新定位对照来看,这就不像是一个错误。没有谁会为了重构十几个文件而在意26秒的规划时间。Meta选择了一个客户,但并不是1.1当初售出的那个客户。
1.1 仍具备 1.2 所没有的
四个星期的存在时间不足以积累可查证的成绩记录,而且在三个具体方面,旧型号目前是文档记载更完善的产品。
• 一项竞技场记录。Muse Spark 1.1 在设计竞技场拥有丰富的历史:游戏开发领域以 1334 Elo 位列第 5,UI 组件以 1334 位列第 7,ASCII 艺术以 1320 位列第 3,数据可视化 1318,通用代码类别 1309;此外还有完整的智能体竞技场阶梯,涵盖 Web 应用、HTML 幻灯片和 Godot 游戏开发。Muse Spark 1.2 则完全没有条目。在 Meta 目前最着力营销的维度上,新模型没有任何正面对比数据。
• 分项指数得分。Artificial Analysis 发布了1.1的编码指数为71.3,智能体指数为37.5。1.2没有对应的已发布数据。由于智能体得分是1.1最弱的维度,且差距明显,而智能体能力恰恰是1.2声称要改进的方面,因此这个数字本可一锤定音地解决是否升级的问题——但它目前尚不存在。
• 生产环境遥测。 1.1 已有一周的真实 p50 和 p95 延迟数据,以及 OrcaRouter 上 4.4M token 的实时流量。1.2 两者都没有;由于流量过低而无法采样,其端点目前完全没有报告延迟或吞吐量统计。
• 除 Meta 之外的租赁渠道。Muse Spark 1.1 已列入 OrcaRouter 目录,价格分别为 $1.25 和 $4.25 —— 即 Meta 自己的标价,以 0% 加价直接传递。Muse Spark 1.2 尚未列入目录,因此目前只能通过单一提供商直接集成 Meta,且没有故障转移路径。

这些都不意味着1.2更差。它意味着支持1.2的证据来自单一评估者的一项综合评分,而支持1.1的证据则是一个月的竞技场数据、子指数和实际流量。这种不对称性应该影响你如何分阶段进行迁移,而不应影响你是否尝试迁移。
一份真正简短的迁移清单
由于费率卡和参数面完全相同,因此交换只是模型字符串变更。工作重点在于验证确实发生变动的三个方面。
• 按照你自己的努力设置,测量你自己的首个 token 生成时间。不要接受 2.90 秒或 26.12 秒这两个数字。以任何 reasoning_effort(即你实际传入的值)运行你的真实提示词,并直接比较。这是唯一能直接终结迁移的数字。
• 检查你的超时和流式配置。在高强度下,首令牌延迟增加9倍将突破针对1.1调优的客户端超时,并使任何非流式集成看起来像挂起。
• 根据实测的 Token 数量重新计算成本,而不是依据费率卡。 价格相同,因此任何成本变化都是行为性的。Artificial Analysis 发现同样的工作花费增加了 16%;你是否看到这一点取决于你的任务组合。
• 首先验证缓存键的稳定性。在拥有稳定的 60,000 token 前缀时,无论哪个版本,典型的代理步骤成本都会从约 8.8 美分降至约 2.2 美分。这 75% 的降幅比版本变更带来的任何影响都更大,而且完全由您掌控。
• 明确重新测试音频和视频路径。两份列表都宣称相同的五种输入模态,但 Artificial Analysis 的 1.2 规格卡仅将文本和图像记录为已评估项。Meta 将宣传语改写为不再强调混合媒体工作。目前尚无独立方核实该能力是否仍然具备。
• 保持 1.1 可访问,作为回退方案。让两者共用一个 key 运行,回滚就只是配置变更,而不是一次事故;同时你还能在真实流量上对两者进行 A/B 测试,而不是为基准测试的结果争论不休。
谁现在行动,谁等待
立即行动,如果你以高推理强度运行长周期编码智能体。这类任务本就耗时数分钟,延迟惩罚完全被吸收;智能增益由第三方评估,而非Meta单方面宣称;而在这个梯队,三个指数点就是一次实质性的跨越——在185个模型的排行榜上跃升九个名次。
等等,如果你提供的任何内容是交互式的。没有任何配置能让 1.2 比 1.1 响应更快,强制推理意味着你无法通过禁用思考来换回响应速度。1.1 在每种努力水平下都仍然是更快的模型,而且成本完全相同。
等等如果你的工作负载是混合媒体分析——即 1.1 当初明确构建并推向市场的长报告、视频和音频用例。Meta 已停止宣传它,而对 1.2 的唯一独立评估只涵盖文本和图像。该能力很可能仍然完好;只是无论哪方面都没有证据,而 1.1 已有一个月的实际验证。
等等如果你需要 Arena 数据。一个以全仓库生成为卖点、在 Design Arena 没有任何条目、也未发布任何智能体子指数的模型,却要求你相信 Meta 对自己改动之事的说辞。等上三到四周,这种说法就不再成立——届时,做这个决定就容易得多,可以依据证据,而非单一的综合数字。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
