
Muse Spark 1.2 对比 Claude Fable 5:六个指数点的实际代价
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 197 tok/s
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3055智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
- z-aiZ.ai: GLM 5.22026-06-1653智能69代码60数学
Artificial Analysis 发布了大多数基准测试表不会包含的内容:它的花费。运行其九项评估的 Intelligence Index 成本为 $637.85(在 Muse Spark 1.2 上)和 $5,630.52(在 Claude Fable 5 上)。相同的基准测试套件,相同的测试框架,一份账单是另一份的 8.8 倍。Fable 5 得分 60,而 Muse Spark 1.2 为 54。
将差值相除,你就得到了这个比较真正关心的数字:在该工作负载下,最后六个智能点数大约花费每点832美元。你是否应该为此付费并不是一个基准测试问题,而是关于你的流量中究竟有多大比例真正需要这些点数。对大多数团队而言,答案是占比很小且可明确识别的一部分。
边际指数点是有价格的,而且价格高昂。
这两个数字来自同一位独立评估者,运行相同的综合基准——GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience和AA-LCR。两者都不是厂商声称。Fable 5在185个模型中排名第3;Muse Spark 1.2排名第13,而同类中位数为32。两者都远高于平均水平;只有一款处于前沿。

标价在很大程度上解释了这一差距,但也低估了余下的部分:
• 输入 — Muse Spark 1.2 每百万 $1.25,Claude Fable 5 $10.00。八倍。
• 产出 — $4.25 对比 $50.00。接近十二倍。
• 缓存输入 — 0.15美元对1.00美元。约为七倍,并且Fable 5还额外收取每百万次12.50美元的缓存写入费用,或一小时TTL收费20.00美元,而Muse Spark 1.2则完全不单独收取缓存写入费用。
• 混合费率 — Artificial Analysis 称,Muse Spark 1.2 的价格为每百万 tokens 0.78 美元,而 Fable 5 为 7.70 美元。两者相差不到十倍。
Fable 5 发布时是 Artificial Analysis 有史以来基准测试过的最昂贵的模型,并且一直保持着这一地位。有必要精确说明原因:该模型在完成索引时消耗了更少的输出令牌(8700万,对比 Muse Spark 1.2 的 9500万),因此整个成本差异在于费率,而非冗长程度。Fable 5 并不浪费。它只是被定价为前沿产品。
折合为智能体的一步操作——读取 60,000 个令牌的仓库上下文、编写 3,000 个令牌的补丁——成本约为8.8 美分(Muse Spark 1.2)、约 75 美分(Claude Fable 5)。每天一千步就是 88 美元对 750 美元;一年下来则是 32,000 美元对 274,000 美元。
Claude Fable 5 不可替代之处
如果这六点就是全部差异,那么成本方面的结论将是一边倒的。但事实并非如此,而差距扩大的地方恰恰是 Meta 重新定位 Muse Spark 1.2 以参与竞争之处。
Fable 5 在 Design Arena 广泛的对决阶梯中位居榜首:游戏开发 1399 Elo、排名第 1,ASCII 艺术 1367、排名第 1,SVG 生成 1353、排名第 1,此外在 agents arena 中 Godot 游戏开发(1344)、Android 原生(1318)、智能体游戏开发(1300)和 HTML 幻灯片(1260)均排名第 1,在 Web 应用和全栈工作中排名第 2。Muse Spark 1.2 没有任何 Design Arena 参赛记录——其前代产品积累了可观的中游战绩(游戏开发 1334,排名第 5;通用代码类别 1309,排名第 9),但新版本一次都未被评级。
各维度的指数指向相同。Artificial Analysis 将 Claude Fable 5 评为编码指数 76.5、智能体指数 52.8。Muse Spark 1.1 则分别为 71.3 和 37.5——编码落后 5 分,智能体任务落后 15 分。1.2 的分维度数据尚未公布,因此诚实的说法是:我们知道综合差距缩小了 3 分,但不知道其中有多少落在了智能体维度上。

Fable 5 自身的产品定位声称,其领先优势会随任务长度和复杂度的增加而扩大。这属于厂商声明,按其表述未经证实,但与独立数据的形态一致:Fable 5 的最大优势出现在智能体(agents)领域——模型必须在多轮交互中维持计划的连贯性,而非在单次生成中体现。
当 Muse Spark 1.2 正是正确答案时
有三点使它成为正确的选择,无论那六点如何。
• 音频和视频输入。Meta 的列表宣传支持文本、图像、视频、音频和 PDF。Claude Fable 5 支持文本、图像和文件——不支持音频,也不支持视频。对于任何涉及录音或影像素材的流程而言,这不是取舍,而是硬性门槛。一个坦诚的说明:Artificial Analysis 对 Muse Spark 1.2 的规格卡仅记录了文本和图像作为评估项,因此更广的功能面只是宣传,而非独立验证。
• 速度。速度为每秒 165.0 个 token,而对照为 71.7。Muse Spark 1.2 的流式输出速度快两倍以上,在速度方面于 185 款中排名第 16,而同类中位数为 71——Fable 5 正好处于中位数。
• 按量成本。 上一节中的所有内容。
为请求量确实巨大的人再补充第四种情况:两款模型都宣称提供约一百万个 token 的上下文——Muse Spark 1.2 为 1,048,576,Fable 5 为 1,000,000——但 Muse Spark 1.2 对所有上下文统一收取固定费用,而 Fable 5 的缓存写入定价意味着,在开始为你省钱之前,维持一个大型稳定前缀就要先付出一笔真金白银。
这两个都不是快速模型。
这是大多数正面对比都会跳过的部分,它改变的是架构,而非账单。
在最高推理强度下,Artificial Analysis 测得 Muse Spark 1.2 的首 Token 延迟为 26.12 秒,Claude Fable 5 为 141.26 秒,Fable 5 的端到端响应时间为 148.24 秒。在这些设置下,两者都不适合直接面向用户使用。
生产数据要友好得多,也更值得了解。在 OrcaRouter 上,Claude Fable 5 的p50 首次令牌生成时间为 7.04 秒,p95 为 10.00 秒,这是滚动一周的真实流量,按调用方请求的 effort 级别进行处理,而非最大负荷下的基准测试。作为参考,Muse Spark 1.1 的 p50 为 1.84 秒。Muse Spark 1.2 还没有生产环境遥测数据。

结构上的要点:两款模型都具备强制推理。Fable 5 的努力档位从低到最高,默认为高;Muse Spark 1.2 的从极低到超高,默认为中。两者都不允许关闭思考模式。如果你需要亚秒级响应,这整个对比就摆错了货架——那是 Luna 或 Flash-Lite 级别模型该做的事。
两种模型的组合,因价格而被排除在外
将这个问题视为赢家通吃的选择是一个错误,因为任务流并非同质。几乎每个生产级智能体都有大量的常规步骤——读取文件、总结diff、格式化补丁、决定下一步调用哪个工具——而真正困难的任务则很少,这些任务中一个错误的答案就会耗费一个小时。
每天执行同样的一千次智能体步骤。全部使用Claude Fable 5:约750美元。全部使用Muse Spark 1.2:约88美元。将900个常规步骤分给便宜模型,100个困难步骤分给昂贵模型:约79美元加75美元,即每天154美元。这相当于全部使用Fable费用的五分之一,同时在真正需要它的十分之一的调用上保持了前沿能力——仅一个智能体循环每年就相差约22万美元。
这种拆分值得构建而不只是描述,原因在于它过去需要两个供应商关系、两套 SDK 和两套凭据。现在则不需要了。Claude Fable 5 已收录在 OrcaRouter 目录中,价格为 10.00 美元和 50.00 美元——这是供应商标价,以 0% 加价转售——Muse Spark 1.1 也同样以 1.25 美元和 4.25 美元的价格出现在那里,位于同一个 OpenAI 兼容端点之后。路由 DSL 让您可以把“先使用廉价模型,在置信度低或测试运行失败时升级”表达为一次调用,而不是需要维护的编排代码;模型融合则让您把真正存在歧义的步骤一次性发送给一组模型并比较结果。Muse Spark 1.2 本身尚未出现在目录中——Meta 作为其唯一提供商直接提供它——因此目前您能构建的最接近这套技术栈的方案,是在廉价侧使用 1.1。
这个单一供应商的细节值得在风险评估中单独列一行。Claude Fable 5 有多条服务路由,并在它们之间自动故障转移。Muse Spark 1.2 只有一个端点,由 Meta 运营。如果它宕机,就没有同型号的备选方案。
成本模型,而非定论
这次比较的有用输出不是“哪个模型获胜”,而是一个你可以为自己的工作负载计算出的阈值。
估算一下,有多少比例的调用会出现 Muse Spark 1.2 级别的回答失败、而 Fable 5 级别的回答成功的情况。将这个比例乘以失败造成的代价——工程师的分钟数、一次糟糕的合并、一次重试循环、一个客户。再把它与每步 66 美分进行比较,这正是上面 60K 输入 / 3K 输出示例中,将单次调用从 Muse Spark 1.2 升级到 Claude Fable 5 所需的成本。如果错误答案带来的预期损失超过 66 美分,就将该步骤路由到 Fable 5;如果没有超过,就不要。
对大多数团队来说,这种计算将 Fable 5 用于代码审查、最终补丁生成、架构规划以及任何涉及生产数据的工作,而将 Muse Spark 1.2 用于其他一切——文件读取、摘要生成、测试分类、工具选择,以及智能体循环中高吞吐量的中间环节,这些环节成本真实,但每次调用的风险并不高。
值得继续关注的一点:Design Arena 的阶梯排名以及 Muse Spark 1.2 的各个维度指数,目前这两者都还不存在。Fable 5 最有力的证据恰恰出现在正面交锋的竞技场中,而 Meta 的新模型在那里完全没有记录。当这一记录出现时,这个阈值将会移动——而且可能会移动很大。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
