Muse Spark 1.2 对比 GPT-5.6 Luna-1
Guides & Insights

Muse Spark 1.2 对比 GPT-5.6 Luna:对应4.6倍Token价格的三个指标点

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Artificial Analysis 让这两个模型都跑完了同一套九项基准测试,并把账单留了下来。Muse Spark 1.2跑完这套测试花费了 637.85 美元。GPT-5.6 Luna跑完这套测试,则花费了 174.06 美元。尽管花费相差 3.7 倍,Meta 的模型仍然领先了三分——在智能指数上以 54 比 51 胜出。这笔交易是否划算,正是问题的全部所在,而答案在很大程度上与其说取决于基准测试,不如说取决于几乎没有人会去写到的两件事:你的智能体框架如何处理提示缓存,以及你的工作负载是否需要收听或观看任何内容。

下面的每个数据要么是独立的 Artificial Analysis 测量结果,要么是实时 API 列表,要么是 OrcaRouter 自身的生产遥测数据——最后这一类值得一开始就指出,因为它以一种富有启发性的方式与基准测试数字相矛盾。这里没有任何东西是伪装成结果的供应商声明;如果供应商是唯一来源,文中会明确说明。

比分比价格标签所暗示的更为接近

Muse Spark 1.2 在其 xhigh 推理设置下,在 Artificial Analysis Intelligence Index 上取得 54 分,在 185 个模型中排名第 13,而类别中位数为 32。GPT-5.6 Luna 在最大努力设置下取得 51 分。在由 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR 组成的综合基准上,两者相差三分。

三分之差是真实的,但幅度很小;上一代已有的分项得分能揭示其来源。Artificial Analysis的分维度数据显示,Muse Spark 1.1的编码指数为71.3、智能体指数为37.5;GPT-5.6 Luna则为71.4和45.6。编码方面两者打成平手,而Luna在智能体任务上领先八分——这正是Meta改写1.2产品描述时所宣称的那个维度。综合得分向Meta方向移动了三分。目前还没有人公布1.2的分维度细分,因此智能体能力差距是否真的缩小,仍未得到证实。

Muse Spark 1.2 vs GPT-5.6 Luna-2

在混合令牌价格上,差距并不微小。Artificial Analysis 的混合费率将 Muse Spark 1.2 定为每百万令牌 0.78 美元,而 GPT-5.6 Luna 为 0.17 美元。标价:Muse Spark 1.2 输入 1.25 美元、输出 4.25 美元;Luna 输入 0.20 美元、输出 1.20 美元。

按工作单元而非按令牌计费,一个编码代理步骤读取 60,000 个令牌的上下文并输出 3,000 个令牌,在 Muse Spark 1.2 上大约花费 8.8 美分,在 GPT-5.6 Luna 上大约花费 1.6 美分。每天执行一千个步骤,就是 88 美元对比 16 美元——单个代理循环每年大约相差 26,000 美元。

缓存是差距要么缩小、要么加倍的关键所在。

这两个模型都提供极具竞争力的缓存输入价格,但两者之间的比例与它们标价之间的比例并不相同。Muse Spark 1.2 的缓存输入读取价格为每百万次 0.15 美元,较其 1.25 美元的费率享受 88% 的折扣。GPT-5.6 Luna 的缓存输入读取价格为每百万次 0.01 美元,较 0.20 美元享受 95% 的折扣。

用 60,000 token 的前缀热缓存重新运行同一个代理步骤:Muse Spark 1.2 从 8.8 美分降到约 2.2 美分。Luna 从 1.6 美分降到约 0.4 美分。绝对差距从每步 7.2 美分缩小到 1.8 美分,但倍数大致不变——缓存并不能拯救更贵的模型,只是让两者以相近的系数变得更便宜。它真正改变的是哪项成本占主导:在缓存情况下,Muse Spark 1.2 的成本中 59% 是输出 token,而不是 85% 的输入 token,因此模型的冗长程度开始比其上下文大小更重要。

这并非假设性的问题。Muse Spark 1.2 在 Intelligence Index 中生成了 95M 个输出令牌,而中位数是 65M。Artificial Analysis 自己的摘要称其“略显冗长”。Luna 消耗了 130M,听起来更糟,但按 1.20 美元而不是 4.25 美元计算后,情况就不同了。

Meta 的产品文案声称,提示缓存(prompt caching)可以将有效成本降低 60–80%,具体取决于上下文重复的程度。这是供应商的估算,而非实测数据,但上述计算落在这个范围之内。

延迟:基准测试颠倒真相的维度

只看 Artificial Analysis 的延迟数据,你会得出结论:Muse Spark 1.2 才是响应快的那一个。首个令牌时间:Muse Spark 1.2 为 26.12 秒,GPT-5.6 Luna 为 126.99 秒。快了近五倍。

上述两项数值均是在各模型成本最高的推理设置下测得的——Muse Spark 为 xhigh,Luna 为 max。两者都不是你实际会看到的结果。在 OrcaRouter 上,根据一周真实流量中调用方实际请求的各种推理强度,GPT-5.6 Luna 显示的p50 首令牌时间为 1.84 秒,p95 为 9.68 秒。Muse Spark 1.1 显示的 p50 同样为 1.84 秒,p95 则更紧凑,为 6.00 秒。目前还没有 1.2 的生产遥测数据,因为它太新了。

Muse Spark 1.2 vs GPT-5.6 Luna-3

结构差异比这两个数字都更有用。GPT-5.6 Luna 的推理是可选的——努力程度拨盘从一直到低、中、高、超高、最高,而且你可以真正关闭思考,用于分类、路由或提取。Muse Spark 1.2 的推理是强制性的。拨盘的最低档是最低限度,而且没有任何设置能让你在不付出深思代价的情况下获得权重。对于任何高吞吐量和对延迟敏感的场景来说,这是一个设计约束,而不是一个调优参数。

持续吞吐量接近:Muse Spark 1.2 达到每秒 165.0 个 token,Luna 为 177.9 个 token,两者均远高于 71 的同类中位数。

{{1}}每个人都会在定价脚注上栽跟头{{/1}}

GPT-5.6 Luna 的价格目前在不同地方显示不同,如果你正在构建成本模型,你应该在引用数字之前了解这一点。Artificial Analysis 和 OrcaRouter 的目录均显示每百万输入 $0.20 和每百万输出 $1.20——这是 7 月 GPT-5.6 降价后的费率,也是 Artificial Analysis 用于计算上述 $174.06 评估账单的费率。一些市场列表目前显示 $0.10 和 $0.60,并有一个在超过 272,000 个提示词令牌时生效的独立更高档位。稳妥的做法是,在你实际调用的端点上检查价格,而不是查看对比文章中的价格。

无论适用哪种基础费率,分层定价的细节都是真实存在的,而且确实未被充分讨论:当单个请求超过约 272,000 个提示词 token 时,Luna 的价格就会上调。输入价格大约翻倍,输出价格上涨一半,缓存读取也随之按比例上调。如果你关注 Luna 是因为它 1.05M-token 的上下文窗口,请注意你大约在用到四分之一时就会脱离标称费率。Muse Spark 1.2 在其完整的 1,048,576 个 token 范围内采用统一费率,没有长上下文附加费——对于真正长的单个请求,两者之间的实际差距会显著缩小。

Luna 无论如何都无法做到的事情

模态差异是选择其中一个而非另一个的最直接理由,而它不会出现在任何排行榜上。

输入——Muse Spark 1.2 根据 Meta 的列表,支持文本、图像、视频、音频和 PDF 文档。GPT-5.6 Luna 支持文本、图像和文件。不支持音频和视频。如果您的流程涉及录音或视频素材,Luna 完全不适合。

最大输出—— Luna 声明补全上限为 128,000 token。Muse Spark 1.2 的端点未声明最大补全长度,这很不寻常,你应该实际测试它,而不是围绕它做规划。

知识截止日期 — Luna's 的知识截止日期公布为 2026 年 2 月 16 日。Meta 未发布 Muse Spark 1.2 的截止日期,因此无论如何都要为检索做好预算。

服务 — Luna 在全球范围内普遍可用,可通过多种途径访问。Muse Spark 1.2 恰好由一个提供商提供服务:Meta。一个端点、一种区域策略、一个故障点。

审核 —— 两者都是经过审核的端点。

关于多模态优势的一个坦诚提醒:Artificial Analysis 为 Muse Spark 1.2 发布的技术规格卡列出的评估范围仅包括文本和图像输入,而非 Meta 宣传的完整五模态能力。该 API 实际接受的内容比任何独立方测试过的都要多。

Muse Spark 1.2 vs GPT-5.6 Luna-4

采纳,因为它恰好是可衡量的

基准测试告诉你一个模型能做什么;流量告诉你人们信任它处理什么。在OrcaRouter上滚动的一周内,GPT-5.6 Luna 处理了46.794亿 tokens。Muse Spark 1.1 —— 同样拥有1M上下文,指数得分不相上下,在目录中早上线四周 —— 处理了440万。这大约是千倍的差距。

其中一部分是分发因素:Luna 在更多工具中是默认选项,且在全球正式发布(GA)的时间更久,而 Muse Spark 系列仅在美国推出。但在路由器上,两者之间仅相隔一个模型字符串,却存在千比一的差距,这不只是分发能解释的。这正是 Luna 是更安全的默认选择、而 Muse Spark 1.2 需要你仔细评估的实际原因。

值得一提的是,今天你能租到什么、不能租到什么:GPT-5.6 Luna 已出现在 OrcaRouter 目录中,价格分别为 $0.20 和 $1.20,与提供商自己价目表上的数字一致,因为我们实行 0% 加价,按提供商标价原样转售。Muse Spark 1.1 也以同样的方式上架,价格为 $1.25 和 $4.25。Muse Spark 1.2 尚未进入目录——它由 Meta 直接提供。因此,如今要诚实地进行这项对比,最省钱的方式是在同一个密钥上运行 Luna 与 Muse Spark 1.1,在两次运行之间更改一个字符串,等 1.2 上线后再对 1.2 重新测试。

选择一个

选择 GPT-5.6 Luna 如果工作负载是高容量且以文本为主:聊天、分类、抽取、路由、轻量级工具调用。它的价格是混合价格的四分之一,它可以让你完全关闭推理,其 1.84秒的 p50 是实际测得的生产数据而非基准测试产物,而且它的背后有千倍的实时流量。三个指数点经不起这样的计算。

选择 Muse Spark 1.2如果工作负载是长周期智能体编码——多文件重构、长时间调试、整个代码仓库的工作——或者涉及音频或视频输入,在这些方面 Luna 根本无法匹敌。对于真正庞大的单个请求,它也是更好的选择,因为它的费率在整个百万 token 范围内是恒定的,而 Luna 的费率在超过 272K 后会阶梯式上涨。

两者都要——前提是你愿意诚实面对代理系统实际上是怎么构建出来的。持续胜出的模式永远是:廉价模型处理绝大多数常规调用,昂贵模型留给质量能自我回报的步骤。两个模型位于同一个 OpenAI 兼容端点之后,所以这种分流只是一个路由规则,而非第二家供应商关系——而且一旦昂贵端在运行中途宕机,自动故障转移会确保你的评估不会拿着半份数据集悄悄毒害自己。

接下来一个月需要关注的是分维度的细分情况。Muse Spark 1.2 的整个卖点就是智能体能力,而在上一代产品中,这正是 Luna 领先八点的维度。除非有人为 1.2 发布一份智能体指数,否则那三点的综合增益就是 Meta 已缩小差距的唯一现有证据。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube