
Muse Spark 1.2 对比 Claude Haiku 4.5:混合价格相同,对思考的理念截然相反
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 477 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 186 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
Artificial Analysis 对 Muse Spark 1.2 的混合定价为每百万 token 0.78 美元,而Claude Haiku 4.5 则为 0.77 美元。两者仅相差一分钱,出自两个在其他方面毫无共识的实验室。Meta 的模型无法停止推理;Claude Haiku 4.5 只在你要求时才会推理。Meta 提供 1,048,576 个 token 的上下文,Claude Haiku 4.5 提供 200,000 个。Meta 于 2026 年 8 月 5 日发布了这一款,定位为附带终端代理的编码模型;Claude Haiku 4.5 则于 2025 年 10 月发布,是那种由更大模型发号施令的快速廉价执行者。每个 token 价格相同,却是完全不同的机器。
这种巧合是比较的有用起点,因为它排除了人们通常据以决策的变量,迫使问题转而聚焦于形态本身。下文在存在独立数据之处采用独立数据——Artificial Analysis 的指数得分与实验室延迟,OrcaRouter 自身七天生产遥测所反映的真实流量延迟——并如实标注供应商自报的数字,包括该供应商一项尚无第三方对应数据的基准测试头条。
规格对比,一次一个维度
• 价格 — Muse Spark 1.2 每百万输入 $1.25 / 输出 $4.25;Claude Haiku 4.5 每百万输入 $1.00 / 输出 $5.00。Meta 在输入上更便宜,Claude Haiku 4.5 在输出上更便宜。
• Cache — Muse Spark 1.2 缓存命中:每百万次 $0.15(88% 折扣);Claude Haiku 4.5 缓存读取:每百万次 $0.10(90% 折扣);缓存写入按 $1.25 计费。
• 上下文—— 1,048,576 tokens 对比 200,000。差距为 5.2 倍,是两者之间最大的差距。
• 最大输出 — Claude Haiku 4.5 声明了 64,000 token 的上限;而 Muse Spark 1.2 端点则完全没有声明最大完成长度,这种情况很不寻常,值得测试而非臆断。
• 推理——在 Muse Spark 1.2 上为强制功能,具有五个努力级别(从 minimal 到 xhigh),默认级别为 medium;在 Claude Haiku 4.5 上为可选功能,该模型本身不具备推理能力,除非你开启扩展思维并为其设置思维预算。
• 输入 — Meta 支持文本、图片、视频、音频和 PDF;Claude Haiku 4.5 接受文本和图片。两者均返回文本。
• 权重与提供商 — 两者均未开放。Muse Spark 1.2 仅由 Meta 自家的 Model API 提供服务;Claude Haiku 4.5 可从厂商处获取,也可通过常规的云转售商和聚合商获取。
• 发布时间——Muse Spark 1.2 才发布几天。Claude Haiku 4.5 自 2025 年 10 月 15 日起就已投入生产,知识截止日期为 2025 年 7 月,背后积累了九个月的实战经验。
指数差距是真实存在的。但每个人都会引用的那个数字却不是。

Artificial Analysis 在 Intelligence Index 智能指数上给 Muse Spark 1.2 打出 54 分,在 185 个模型中排名第 13。其对 Claude Haiku 4.5 的当前评分是 24。把这两个数字放在一起,就是一个头条新闻;但仔细看看这些评分实际代表什么,这个头条就站不住脚了。
54 是 Muse Spark 1.2 在 xhigh 下的评估结果,这是它最昂贵的推理设置。24 是 Claude Haiku 4.5 作为非推理模型(关闭思考)评估的结果,并且 Artificial Analysis 将其标记为估计值而非已完成运行。在同一个指数的更早版本中,也就是 v4.1 重新加权之前,Artificial Analysis 将启用推理的 Claude Haiku 4.5 评为 55,而关闭推理评为 42。那些旧数字也不能与 54 进行比较,因为指数版本会重新缩放,v3 时代的分数并不等同于 v4.1 的分数。
因此,诚实的说法比排行榜所显示的更为有限:Muse Spark 1.2 在最大努力下于当前指数上得分为 54;目前尚无 Claude Haiku 4.5 开启扩展思维的已发布 v4.1 分数,因此这两者在全力状态下尚不存在同口径对比。 任何向你展示 54 对 24 的人,都是在拿一个全力深思的模型与一个被要求不要深思的模型作比较。
当供应商公布了某个数字时,这是一个具体的数字:Claude Haiku 4.5 在 SWE-bench Verified 上得分为 73.3%,这是在对 50 次试验取平均、思维预算为 128K 的情况下得出的。这是供应商的数据,而且对于一个以速度为卖点的模型来说,这样的思维预算相当惊人——但这也是行业在引用前沿模型时所采用的同一项评估,它让 Haiku 进入了一个其价格并不暗示的档次。Meta 对 Muse Spark 1.2 的对应说法是 Terminal-Bench 2.1 得分 82.9%,DeepSWE v1.1 得分 59.3%,同样由供应商自行运行,使用的是 Meta 自己的测试框架,每个竞争对手都搭配其各自的智能体产品。两家供应商,两套基准,毫无重叠。目前没有任何一项评估能让这两个模型在同一评估方处都有已公布的得分。
四个延迟数字,两个不同的故事

延迟是“同价”框架从好奇变为决策的关键所在,也是测量来源最为重要的环节。
在基准测试工具中,Artificial Analysis 记录到 Muse Spark 1.2 在 xhigh 设置下的首 token 时间为 26.12 秒,而 Claude Haiku 4.5 为 1.00 秒。26 倍的差距,如果仅凭这一点,比较就已经结束了。
在生产环境中,情况发生了逆转。在OrcaRouter上七天的真实流量中——调用方使用他们实际想要的任何努力程度——Claude Haiku 4.5的p50首token延迟为3.84秒,p95为10.00秒,每秒输出214个token,错误率为1.0%。目录中所收录的Meta模型版本Muse Spark 1.1的p50为1.84秒,p95为6.00秒,每秒输出519个token,且未记录到任何错误。在线上流量中,Meta模型反而更快。
两组数字都是真实的,但衡量的对象不同。实验室数据是每个模型在冷缓存(cold cache)下进行最大程度深思熟虑的结果,适合测试性能上限,却不适合衡量聊天场景。生产环境数据包含缓存命中、短提示、低推理强度以及真实应用会做的所有其他事情,适合衡量中位数,但完全无法反映最坏情况。陷阱在于引用其中一组数字,却用另一组的逻辑来推理。如果你在确定面向用户的超时时间,p95 才是你要用的数字。如果你想知道深度智能体步骤在墙钟时间上的成本,基准测试数字更接近真相——但诚实的告诫是,Muse Spark 1.2 本身还没有这样的生产环境数据,因为它太新了,尚未被广泛路由。
两家实验室都向你推销了一个子代理,但它们所指的并不相同。
供应商对 Claude Haiku 4.5 的宣传明确提到了层级关系:Sonnet 级别的模型负责规划和编排,Haiku 实例在底层并行执行。便宜、快速、可随时丢弃,且能同时运行多个。产品设计也遵循这一理念——20万token的上下文窗口对于范围明确的小任务来说绰绰有余,但有意设计为不足以容纳整个代码库;思考功能默认关闭,因为一个会深思熟虑的工人意味着编排者要付出更高的成本;而供应商自己的市场宣传也将实时聊天、客户服务和结对编程列为目标场景。
Meta对Muse Spark 1.2的宣传声称其兼顾同一层级的两端。Meta的文案称,该模型既可以作为收集上下文、制定计划并委派任务的主代理,也可以作为在主代理之下并行执行的子代理。与其一同发布的终端代理Muse Code,在可精确重放的事件日志运行时上,于隔离的工作树中为每个任务协调多个持久子代理。百万token的窗口和始终开启的推理能力是规划者所需要的;而它们恰恰是你不会为扇出型工作节点所选择的,因为每个并行实例都在为你不想要的深思熟虑付费。
从架构而非营销的角度来读,这才是真正的区别:这家厂商构建了一个执行者,指望你自带编排者;Meta 构建了一个编排者,并声称它也能干活。如果你已经在运行一套层级体系,有趣的实验并不是在两者之间二选一——而是用 Muse Spark 1.2 做规划、Claude Haiku 4.5 来执行,这种形态没有任何一家厂商会打包卖给你。
每一步实际花费多少
对于推理模型,按每百万令牌计费说明不了什么,因为模型自己决定消耗多少令牌。应该按步骤定价。
以一个限定范围的代码任务为例:输入 60,000 个仓库上下文 token,输出 3,000 个补丁 token。客观来说,Claude Haiku 4.5 的输入成本为 $0.060,输出成本为 $0.015 — 7.5 美分。Muse Spark 1.2 的成本为 $0.075 加上 $0.013 — 8.8 美分。差距小到可以忽略,正如混合费率所承诺的那样。
现在加上混合费率所掩盖的部分。Muse Spark 1.2 无法关闭推理,在其默认的中等设置下,这样的步骤在补丁之前很可能会产生数千个推理token——它们都会按输出计费。加上 3,000 后,同样的步骤就是 $0.075 + $0.026 = 10.1 美分,在相同输入下比 Haiku 高出约 35%。Claude Haiku 4.5 在关闭思考时无需为推理支付任何费用,仍为 7.5 美分;而在较大的思考预算下,它将超过 Muse Spark 1.2,因为 Claude Haiku 4.5 的每百万输出收费为 $5.00,而 Meta 是 $4.25。
缓存再次改变了重点。保持仓库上下文稳定以命中缓存后,Haiku 的输入成本降至 $0.006,Muse Spark 1.2 的降至 $0.009——输入侧完全不再重要,整个比较变成了一场围绕输出 token 的较量,拼的是每个模型的思考量。在上下文重复的工作负载上,缓存键的稳定性比模型选择更有价值,这两个模型皆是如此。
1M 窗口是唯一在数字上说不过去的地方。任何真正需要在单次调用中消耗超过 200,000 个 token 的任务,无论花多少钱都无法在 Claude Haiku 4.5 上运行。你要么分块并编排——这正是供应商的本意——要么就使用一个有足够余量的模型。
尝试两者而无需第二份合同。

Claude Haiku 4.5 已列入 OrcaRouter 目录,价格为 1.00 美元和 5.00 美元——即厂商标价,因为 OrcaRouter 实行 0% 加价,原样传递供应商定价,这也意味着供应商价格变动会在当天同步生效,而不是等到下一个合同周期。上述生产环境延迟数据即来自同一路由层。
Muse Spark 1.2不在目录中。Meta的Model API目前是唯一可以调用它的地方,所以如今要进行真正的正面比较,意味着一个集成通过我们,另一个直接与Meta。Muse Spark 1.1是托管的,价格与Meta对1.2收取的$1.25和$4.25完全相同,这使它成为该系列成本和延迟形态的合理替代,但并不能替代1.2所宣传的编码增益。当1.2变得可路由时,比较就变成了对同一个密钥的一行模型字符串更改——而对于上述编排器加工作器的实验,路由DSL是您将规划器和扇出工作器连接成单个调用、而不是自己构建交接的方式。
按作品的形态来挑选,而不是按分数。
选择 Claude Haiku 4.5,当工作范围明确且用户等待时。支持代理、分类、提取、聊天、结对编程补全,以及代理层次结构中的并行工人层级。它是一款已知产品,拥有九个月的现场历史;思考是可选的,因此你只需在需要时支付推理费用;200K 对于几乎任何有范围的子任务来说都足够了。其已发布的 SWE-bench Verified 结果表明,它远比价格所暗示的更强大,前提是你愿意花费该结果所使用的思考预算。
选择Muse Spark 1.2当工作单元是仓库而非请求时。多文件重构、长时间调试、整个项目生成、长时间跨度的智能体循环——这些场景下没有人盯着加载指示器。百万词元的上下文窗口消除了一个 Haiku 无论付出何种代价都无法解决的分块问题;而那种会毁掉聊天体验的强制性推理,在错误计划比缓慢计划代价更高时,恰恰是正确的默认设置。
决定因素不应该是索引编号。不妨问两个问题:单次调用是否需要看到超过200,000个令牌?是否有人在等待第一个令牌?第一个问题答案为是,指向Meta;第二个问题答案为是,指向供应商。两者都为是,意味着你需要两个模型——这个诚实的答案,比任何一家供应商的营销所愿意承认的都要常见。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
