Muse Spark 1.2 对比 DeepSeek V4 Flash:四项指标,九倍账单
Guides & Insights

Muse Spark 1.2 对比 DeepSeek V4 Flash:四项指标,九倍账单

作者

Jim Song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

72.02美元和637.85美元——这是Artificial Analysis让DeepSeek V4 FlashMuse Spark 1.2运行同样的九个基准测试所花费的金额。两个模型在智能指数上相差四分(50比54)。Meta的模型更好,但完成相同工作的成本高出8.9倍,采用封闭权重,仅由一家提供商提供服务,而且比DeepSeek V4 Flash晚发布五天。这四分是否物有所值,完全取决于你在构建什么,而本次对比的意义主要在于让这个问题能够得到回答。

这两个模型在一个星期内相继发布——DeepSeek V4 Flash(构建版本 0731)于 2026 年 7 月 31 日发布,Muse Spark 1.2 于 8 月 5 日发布——两者都以长周期智能体任务为卖点。以下所有指数得分、延迟数据和评估成本均来自 Artificial Analysis,该机构自行运行基准测试并公开费用账目。如果某个数字来自 Meta 或供应商自己的文档,而非独立运行的结果,相应句子会注明出处。

决定这一点的四个数字

智能指数 — Muse Spark 1.2 得分 54(在 185 个中排名第 13),DeepSeek V4 Flash 得分 50(在同类 101 个中排名第 3,同类中位数为 25)。

每百万 token 的综合价格—— $0.78 对比 $0.06,相差十三倍。

同一九项基准测试套件的成本 — $637.85 对比 $72.02。

在哪里运行——一个闭源权重的提供商,对比六个 API 提供商加上可自行托管的 MIT 许可权重。

同一套件,两张截然不同的发票

评估成本列是两种模型最诚实的成本对比,因为这是相同的工作,按每个模型自身的费率定价,且每个模型花费的 token 数量由其自行决定。Muse Spark 1.2 完成智能指数需花费 637.85 美元。DeepSeek V4 Flash 只需 72.02 美元——比 Artificial Analysis 所评测过的所有其他知名模型都要便宜,这一发现在八月初引发了一轮专门的媒体报道。

这一差距之所以有趣,是因为它发生了尽管 DeepSeek V4 Flash 模型更加冗长,却并非因为这一点。运行测试套件时,DeepSeek V4 Flash 输出了2.1亿个输出token,而Muse Spark 1.2 只有9500万个——前者是后者的两倍多。Meta的模型在相同任务上的token效率明显更高,但这完全无关紧要,因为DeepSeek V4 Flash每百万输出token收费0.28美元,而Meta收费4.25美元。15倍的价格优势毫不费力地吞掉了2.2倍的冗长劣势。

这是你在构建自己的成本模型时需要牢记的事情。Token效率是一个真实的属性,推理模型在此属性上差异可达数倍,但在当前市场价差下,它是一个二阶因素。定价表起决定作用,只有当两个模型的价格在约3倍以内时,情况才会发生变化。

四个点的位置——以及无人发表的内容

这场对决中令人不安的部分在于:智能指数是九项评估的综合指标,涵盖智能体、编码、通用能力和科学推理,而 Artificial Analysis 尚未发布 Muse Spark 1.2 的逐基准测试细分结果。所以“54 对 50”目前只是一个没有分解数据的标题。四分的差距可能是编码差距、长上下文差距、抗幻觉差距,或者四个小差距在你的工作负载上恰好相互抵消为零。

每个供应商自己的数据填补了部分空白,但彼此之间无法相互核验。Meta 报告称,Muse Spark 1.2 在 Terminal-Bench 2.1 上为 82.9%(高于 1.1 的 76.2%),DeepSWE v1.1 为 59.3%(高于 53.0%)。该测试在 Meta 的测试框架上运行,采用五次尝试中的 pass@1 指标,且每个参测模型都搭配了各自的智能体产品。V4 Flash 版本将该模型定位为一次后训练升级,针对智能体和终端任务进行了调优,采用总参数 284B、活跃参数 13B 的混合专家架构。目前没有任何一个基准测试是两家实验室都发布了可比数据的,也没有第三方复现过其中任何一组结果。

独立确立的事实范围很窄,但值得直言:在一项由单一评估方执行的综合指数上,Muse Spark 1.2 领先四分,而成本是其 8.9 倍。除此之外任何更精细的结论,仍不过是厂商自述材料。

Muse Spark 1.2 有三种付费方式,DeepSeek 有一种半

这里的价格比较之所以异常难以捉摸,是因为Meta提供两张费率表,而重量数据则由供应商自行提供。

Meta 标准层级 — 每百万次输入 $1.25,每百万次缓存输入 $0.15,每百万次输出 $4.25,请求速率上限约为每分钟 3,000 次。

Meta 贡献者层级输入 $0.10,缓存输入 $0.002,输出 $0.20,换取 Meta 使用你的流量训练未来模型的许可,速率上限为每分钟 60 次请求。

DeepSeek V4 Flash 列表——输入 $0.14,输出 $0.28,缓存命中 $0.003(享受 98% 折扣,是该价位区间内所有模型中缓存费率最具竞争力的),来自六家相互竞争的 API 提供商。

DeepSeek V4 Flash 自托管 — 采用 MIT 许可的开源权重,因此代价是你自己的硬件,上限是你自己的能力。

将第二行和第三行放在一起看,排名就会反转:在贡献者档位上,Muse Spark 1.2 每个 token 的价格比 DeepSeek V4 Flash 更低,$0.10/$0.20 对比 $0.14/$0.28,同时得分高出4分。这是整个对比中最为激进的定价,几乎没有人能真正用上它,因为每分钟60次请求仅为标准配额的2%,基本上排除了任何生产级扇出场景。它的定价面向评估和小团队工作,而它收取的货币就是你的提示词。这笔交易是否对你适用,是一个属于法务部门的数据治理决策,而不是你在配置文件中替换的一个配置项。

开放权重这边则正好相反。MIT权重意味着价格下限完全不由供应商决定——如果你的用量足以支撑GPU成本,没有人能提高你的费率、弃用你的模型或更改条款。这种选择权,在Meta那边任何层级都不存在等价物。

一家提供商对比六家

Muse Spark 1.2 仅由 Meta 的 Model API 提供服务,别无其他渠道。没有第三方托管,没有量化选项,没有回退路径,而且——在撰写本文时——没有 OpenRouter 收录,没有 Hugging Face 仓库,也没有 OrcaRouter 目录条目。单一提供方的封闭模型本质上就是单点故障,而一个问世仅五天的模型,没有任何运行记录可以让你放心。

DeepSeek V4 Flash 则是相反的情况。目前有六家 API 提供商在提供服务,模型权重采用 MIT 许可证,并且它已收录在 OrcaRouter 目录中,输入 $0.15、输出 $0.29——这是提供商列表价格,以 0% 加价转售——并在提供商之间自动故障转移,因此单个主机降级不会让工作负载随之宕机。这正是更便宜模型的实际论据,与它的得分毫无关系:你可以迁移它、镜像它,或者完全离开,而这些选项都不需要新的集成。

对于今天的 Muse Spark 1.2,一次评估意味着第二份合同、第二张账单和第二条 SDK 路径。Meta 的模型值得根据其自身价值进行测试,但要清楚,运行它的运营成本不仅仅是 token 价格。

延迟,基于真实流量测得

在基准测试框架中,Artificial Analysis测得DeepSeek V4 Flash的首token延迟为1.33秒,而Muse Spark 1.2在xhigh推理设置下的首token延迟为26.12秒,两者的输出速度分别为每秒103.3个和165.0个token。Meta的模型一旦开始生成,速度更快,但启动耗时极长——这正是强制以最高强度进行深思的表现。

生产数据讲述了同一个故事的一个更温和的版本。在OrcaRouter上为期七天的实时路由中,DeepSeek V4 Flash的首令牌时间p50为439毫秒,p95为1.96秒,吞吐量为每秒111个令牌,错误率为1.6%。Muse Spark 1.2没有相应的生产数据,因为它尚未在任何地方进行路由;最接近的可用替代指标Muse Spark 1.1的p50为1.84秒,p95为6.00秒。亚秒级中位响应是DeepSeek V4 Flash所属的类别,而任何Muse Spark版本都未达到这一水平。

两款模型都宣称拥有约一百万个 token 的上下文——两者均为 1,048,576 个 token,其中 DeepSeek V4 Flash 将补全输出上限设为 384,000 个 token,而 Muse Spark 端点则宣称没有任何补全上限。就上下文而言,这场对决在纸面上打成平手,且两者的实际表现都未经验证。

切换前值得问的三个问题

自托管 DeepSeek V4 Flash 实际上比每百万 $0.15 更便宜吗?

通常不会,而这正是关键所在。一个284B参数的专家混合模型,活跃参数为13B,需要强大的多GPU算力才能以合理的延迟提供服务;而每百万输入token仅0.15美元的价格,除非用量极高且非常稳定,否则很难有托管服务能与之匹敌。对大多数团队来说,MIT许可证的价值不在于他们会自行托管——而在于他们确实有可能这样做,这既能限制任何供应商的定价,也消除了弃用风险。把它当作保险,购买托管token即可。

贡献者等级是否让 Muse Spark 1.2 成为更便宜的型号?

在费率表上,是的;但在实践中,只有对于每分钟60次请求以下、且你有权捐赠其数据的工作负载才如此。如果这两个条件都成立——比如研究峰值、内部工具、基于合成输入的基准测试框架——那么一个每token价格更低、且领先四个指数点的模型,确实是更划算的选择,你应该选它。如果任一条件不满足,标准层级才是真实价格,而标准层级是V4 Flash模型混合费率的13倍。

四个指数点听起来很小。这在什么时候才算重要呢?

当错误不断累积时。在单次分类或摘要调用中,四点的综合差距往往看不出来,为此多付9倍的价格是站不住脚的。在五十步的智能体循环中,每一步的成功率差异看似微小,却会放大为整个运行需要重启的频率上的巨大差异——而一次重启损失的是整个轨迹,而不只是一步。这种情况才让Meta的价格有了争议的余地。同样在这种情况下,你应该在自己的任务上进行衡量,而不是相信综合指标,因为还没有人公布能够为1.2解决这一问题的智能体子指数。

判决及其附带条件

对于几乎所有成本都是实际约束的工作负载,DeepSeek V4 Flash 都是正确的默认选择:在一个综合指数上落后四分,混合成本便宜十三倍,生产环境中位数延迟低于一秒,六个提供商,MIT 权重,而且没有任何供应商能单方面更改条款。它目前是运行完整基准测试套件的最便宜的知名模型,而它达到这一地位并非因为性能不佳。

Muse Spark 1.2 的定价合理性体现在一种特定的工作形态中:长周期智能体编码——在这种场景下,失败的轨迹代价高昂,额外的深思熟虑分摊在数分钟的工作中,而非由等待中的用户来承受;同时,你也能接受单一供应商,以及没有对这四点构成进行独立拆解。Meta 在四个月内发布了三款模型,并使指数在此期间上升了十一个点,因此这一论点可能很快就会更加有力——但就目前而言,它仍建立在供应商自行运行的编码基准和一项综合评分之上。

如果你这周要做出选择,用你自己的代理循环把两者各跑五十步,比较每美元完成的轨迹数,而不是每美元的token数。这一项测量比其中每一个已发布的基准都更能解答这个对比。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube