MiniMax M3 与 Muse Spark 1.2 对比的主视觉标题卡,副标题为“每 token 价格、上下文、吞吐量,以及基准测试结果出现差异之处”,展示两张抽象圆角卡片隔着一条细长的垂直分隔线相对而立,左侧卡片以蓝色点缀,右侧卡片以青色点缀,右下角有 OrcaRouter 标志。
Guides & Insights

MiniMax M3 对比 Muse Spark 1.2:4 倍价格差距对决基准测试的全面横扫

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

MiniMax M3在我们目录中每百万输入 token 的价格为 0.30 美元。Muse Spark 1.2的价格是 1.25 美元。输入侧相差 4.2 倍,输出侧相差 3.5 倍,而这是关于这对组合最有用的一个事实,因为在同一批目录页面上,两款模型共享的每一行基准测试中,Muse Spark 1.2 都领先于 MiniMax M3。一个是廉价的开放权重选项,拥有供应商保证的 512K 可用上下文和 512K 输出上限。另一个是 Meta 的推理模型检查点,如今已落后于其自身家族整整一代,却仍在几乎所有方面得分更高。本页余下的内容讨论的是:这两个事实中究竟哪一个才真正决定了一个工作负载——而答案并非对每个工作负载都一样。

这些模型各自实际上究竟是什么

这两款产品都是今年推出的,而且都不是新品。这一点很重要,因为一篇对比页面如果写得好像其中任何一款才刚刚发布,那它不出一个月就会显得过时。

A screenshot of MiniMax's own launch blog post for MiniMax M3, dated 2026-06-01, headlined 'MiniMax M3: Frontier Coding, 1M Context, Native Multimodality — All in One Model', opening with the line 'MiniMax M3 is officially released today.' and showing the MSA architecture note and two rows of benchmark bar charts including SWE-Bench Pro, Terminal-Bench 2.1, BrowseComp and OSWorld-verified.

MiniMax M3 是 MiniMax 自家发布的模型,于 2026-06-01 在该厂商的博客上公布,标题为“MiniMax M3:前沿级编程、1M 上下文、原生多模态——集于一个模型”。文章开头直截了当地写道:“MiniMax M3 今日正式发布。”MiniMax 对它的三项主张是:它在编程和智能体任务上达到前沿级性能;它采用了 MSA(MiniMax Sparse Attention),这是该公司提出的一种全新注意力架构;以及它原生支持多模态——可接受图像和视频输入,并且用 MiniMax 的话说,“能够操作桌面计算机”。MiniMax 还补充说,这三项能力对闭源前沿模型而言已是基本门槛,而 M3 是“首个也是唯一一个将这三点集于一身的开放权重模型”。我们的目录将该模型列为自 2026-05-31 起可用,比博客发布日期早一天。

Muse Spark 1.2 是 Meta 的。我们的目录将其日期标注为 2026-08-05。它并非新的层级——而是在 Muse Spark 1.1 基础上更新的检查点,性能略有提升,并以相同价格在同一 Standard 层级上提供服务,因此它是一次可直接替换的升级,而非独立产品。其显著特征在于输入形式:文本、图像、视频、音频和 PDF。输出为文本。

有一条背景信息应当放在这里,而不是埋在后面。Meta 已于 2026-09-02 将 Muse Spark 系列推进到 1.3 检查点,这使得 1.2 成为该系列自身的上一代。这件事发生在三周前,所以算不上新闻,本页也不把它当作新闻——但今天在这两者之间做选择的人应当知道,他们是在拿一个当前的 MiniMax 模型与一个已被取代的 Meta 模型作比较。

每百万词元的价格,以及一个工作负载的实际成本

A screenshot of the OrcaRouter model page for Muse Spark 1.2 (meta/muse-spark-1.2), showing the breadcrumb Home > Models > Meta > Muse Spark 1.2, the model title with a FEATURED badge, the line 'by Meta · 2026-08-05', capability chips reading Vision, Audio, Tools, JSON and Reasoning, the model description, and the stat strip reading INPUT $1.25 per 1M tokens, OUTPUT $4.25 per 1M tokens, P50 TTFT 4.82 s, P95 TTFT 10.00 s and TRAFFIC 79.6M tokens over 7 days.

公布的费率取自我们自有目录中每个模型的页面,该目录直接采用提供商的标价,未添加任何加价:

• 输入 — MiniMax M3 每 100 万 tokens 0.30 美元 vs Muse Spark 1.2 每 100 万 tokens 1.25 美元

• 输出 — MiniMax M3 每 1M $1.20,对比 Muse Spark 1.2 每 1M $4.25

• 缓存读取 — MiniMax M3 每 100 万 $0.060,对比 Muse Spark 1.2 每 100 万 $0.150

• 比率 — Muse Spark 1.2 在输入上为 4.2 倍,在输出上为 3.5 倍,在缓存读取上为 2.5 倍

那些抽象比率会在每个页面的成本计算器中变得具体。把两者都设为每月 1000 万 token、输入占比 70%——这对摘要或抽取任务来说是一种合理的负载形态,也是该估算器默认自带的设置——MiniMax M3 算出来是每月 $5.70。Muse Spark 1.2 算出来是每月 $11.30。开启提示缓存后,同一工作负载则分别约为 $4.86 和 $9.63。计算器将两者都标注为基于标价的估算值,这是恰当的提醒:实际 token 数取决于提供商的分词器。

对于廉价的工作负载,这点差距不过是咖啡钱。关键在曲线的形状,而不在绝对值:每月一亿个以输出为主的 token 的工作负载,仅在 Muse Spark 这一侧就会从三位数跨到四位数。如果成本正是促使你关注这种搭配的约束条件,那么这就是你应该根据自己的流量去建模的数字。

由于我们原样传递供应商的标价、不添加任何加价,供应商一宣布降价,当天就会反映在我们这边;而这两个型号都路由到此处——一个密钥即可覆盖两者,因此为它们相互定价无需第二份合同,也无需修改代码。

上下文窗口,以及它实际能容纳什么

这一节正是两者在规格表上最为相似、在实际使用中却最不相似的部分。

• 上下文窗口 — MiniMax M3 1,048,576 个词元 对比 Muse Spark 1.2 1,048,576 个词元

• 最大输出 — MiniMax M3 512,000 tokens 对比 Muse Spark 1.2 131,072 tokens

• 输入类型 — MiniMax M3 支持文本、图像和视频,而 Muse Spark 1.2 支持文本、图像、视频、音频和 PDF

• 输出层面 — 两者均仅输出文本

• 结构化参数 — MiniMax M3 提供 tools 和 tool_choice;Muse Spark 1.2 提供 reasoning_effort 和 structured_outputs

两个窗口都是相同的百万 token,所以“谁的上下文更多”这个问题没有赢家。最大输出那一行才是它们拉开差距的地方:MiniMax M3 的响应可达 512,000 token,大约是 Muse Spark 1.2 的 131,072 上限的四倍。如果你的工作是长文本生成——整文件重写、长篇报告、转录级别的输出——这种差异是结构性的,而不是增量式的。如果你的工作是在长输入上给出简短回答,那它无关紧要。

输入面这一行的情况恰恰相反。Muse Spark 1.2 直接接受音频和 PDF;MiniMax M3 文档中记载的输入面仅支持图像和视频。对于摄取通话录音或扫描文档的流水线而言,这两者各自需要进行的预处理量并不相同。

在 MiniMax 方面,这项上下文声明附带一条架构说明,值得明确标注为厂商自己的说法。MiniMax 将 M3 的长上下文行为归因于 MSA(MiniMax Sparse Attention),我们的目录将其描述为支持最高 100 万 token 的上下文,“并保证最低 512K”。这种最低保证的表述来自 MiniMax;我们无法指出针对它的独立测量结果,因此应将 512K 的下限视为厂商声明,而非经过测试的数字。

我们自己的网关上的延迟和吞吐量

这些是我们最能直接说明的数据,因为它们是我们自己的数字。它们涵盖截至2026-09-23的七天,描述的是我们网关上的流量,而不是供应商基准测试。

• p50 首 token 时间 — MiniMax M3 4.28 秒 对比 Muse Spark 1.2 4.82 秒

• p95 首 token 时间 — MiniMax M3 10.00 秒 vs Muse Spark 1.2 10.00 秒

• 输出速度 — MiniMax M3 289 tok/s vs Muse Spark 1.2 507 tok/s

• 错误率 — MiniMax M3 0.12% 对比 Muse Spark 1.2 0.15%

• 流量,最近 7 天 —— MiniMax M3 153.8M tokens,对比 Muse Spark 1.2 79.6M tokens

如实解读的话,情况是分裂的。在首 token 时间上,两者很接近——中位数分别为 4.28 秒和 4.82 秒,而 p95 精确到百分位都相同,为 10.00 秒,这是两者都逼近同一上限所造成的舍入假象,而非真正的持平。在输出速度上,两者则完全不在一个量级:Muse Spark 1.2 的流式输出速率约为 MiniMax M3 的 1.75 倍,这会改变用户观看长文本生成时的感受,即便总成本更高。两者的错误率差异在舍入误差范围内,且都处于低位。

流量那一行值得当作信号来读,而不是记分牌:在同样的七天里,MiniMax M3 在我们网关上的 token 吞吐量约为 Muse Spark 1.2 的两倍。这才是市场正在做出的选择,而不是基准测试所宣称的结果;而在这组对比上,两者并不一致。

将两者都路由到同一个端点之下,也是一种低成本的方式,用来弄清你的工作负载更偏好哪一个,因为故障转移意味着任一模型在提供商侧出现性能下降时,会落到一条可用路径上,而不是直接报错。

工具调用与长时程智能体工作

这是两者在测量结果上差距最大的地方,也是各种限定条件最为关键的地方。

• Terminal-Bench v2.1 — MiniMax M3 52.4 对比 Muse Spark 1.2 80.1

• tau_banking(工具使用)— MiniMax M3 12.3 对比 Muse Spark 1.2 34.8

• MCP Atlas — MiniMax M3 74.2(厂商报告)对比 Muse Spark 1.2 未测量

• BrowseComp — MiniMax M3 83.5(厂商报告)对比 Muse Spark 1.2 未测量

• OSWorld-Verified — MiniMax M3 70.0(厂商自报)对比 Muse Spark 1.2 未测量

前两行来自我们自己产品目录页面上的基准测试面板,也是两个模型唯一都填写的智能体行。二者差距不小:Muse Spark 1.2 在 tau_banking 上的成绩是 MiniMax M3 的两倍多,并在 Terminal-Bench v2.1 上领先近 28 分。如果你的工作负载是带有工具面的长时程智能体,这就是本页上最大的单项差距。

接下来的三行是 MiniMax 自己公布的数字,出自其发布博文。它们与前两行并不具备可比性——测试框架不同,也没有经过独立审计——但它们是 MiniMax M3 在这些任务上唯一公开的数据,因此若将其略去,就会低估该模型。把它们当作厂商自报数据来看即可,仅此而已。

有一处分歧值得单独用一段来说明,因为这类事情通常是对比页面会一笔带过的地方。MiniMax 的发布文章中把 M3 的 Terminal-Bench 2.1 成绩标为 66.0,且只放在一张图表图片里,没有附带数值表格。而我们目录页上独立收录的 Terminal-Bench v2.1 一行,同一模型的成绩是 52.4。两处任务名称足够接近,读者会把它们并排来看,而这两个数字相差超过 13 分。我们不打算判定其中哪一个错了:最可能的解释是测试框架或运行配置不同,而诚实的说法是,厂商自报的数字与经审核的数字并不一致,且厂商的数字更高。

参数列表讲述的是一个更小、也更实际的故事。MiniMax M3 暴露了 tools 和 tool_choice,因此工具选择可以从请求端进行引导。Muse Spark 1.2 则暴露了 reasoning_effort,因此可引导的反而是推理深度。两者都没有暴露对方的调节旋钮。如果你的应用的控制问题是“让它调用正确的函数”,那指向的是一种选择;如果问题是“让它在困难案例上思考更久”,那指向的则是另一种。

编码

编程是 MiniMax M3 的主打卖点,也是其实测差距最尴尬的地方。

• AA 编码指数 — MiniMax M3 38.7 对比 Muse Spark 1.2 72.2

• SciCode — MiniMax M3 43.1 对比 Muse Spark 1.2 57.4

• SWE-Bench Pro — MiniMax M3 59.0(厂商自报),而 Muse Spark 1.2 未测试

• KernelBench Hard — MiniMax M3 28.8(厂商报告)对比 Muse Spark 1.2 未测量

MiniMax 对 M3 的定位以编程为先——发布标题将“前沿编程”置于百万级 token 上下文和多模态之前。其自报的 SWE-Bench Pro 成绩 59.0,在厂商自家测试框架上是个相当亮眼的数字。不过,在双方都已填写的独立 Coding Index 和 SciCode 两项上,Muse Spark 1.2 以大幅优势领先,而 Coding Index 上 33 分的差距是本页第二大的,仅次于 tau_banking。

凭现有证据,没有任何诚实的方式能把 MiniMax M3 呈现为更优秀的编程模型。可以说的是,厂商自己的编程分数很高,而独立评测的分数则不高,这与上文 Terminal-Bench 的分歧如出一辙。任何以编程能力为决策依据的人,都应比发布博文中的图表更看重经过审计的数据行,并且应在自己的代码仓库上测试,而不是依赖这两者中的任何一个。

在它们真正接近的地方

三行都拒绝产生赢家,而承认这一点比硬造一个赢家更有用。

• GPQA Diamond — MiniMax M3 89.9 对 Muse Spark 1.2 90.4,0.5 分的差距,就任何实际用途而言都算平局

• p95 首 token 时间 — 过去七天里,我们网关上的两者均为 10.00 秒

• 上下文窗口与输出模态——在1,048,576个输入token和纯文本输出下相同

在研究生水平的科学推理上,这两者实际上无法区分,而这是 MiniMax M3 那个便宜得多的模型能与更昂贵模型抗衡的唯一一个推理行。在阅读综合指数时值得记住:这些模型之间的差距在不同能力上并不均匀,它集中在智能体与编程工作上,而在知识密集型多项选择上大致为零。

A self-built two-column scoreboard for MiniMax M3 vs Muse Spark 1.2: left column MiniMax M3 with Price in/out $0.30 / $1.20, Context window 1M tokens, Max output 512K tokens, AA Coding Index 38.7, tau_banking 12.3 and Output speed 289 tok/s; right column Muse Spark 1.2 with Price in/out $1.25 / $4.25, Context window 1M tokens, Max output 131K tokens, AA Coding Index 72.2, tau_banking 34.8 and Output speed 507 tok/s; footer 'Prices and speed from OrcaRouter gateway data; benchmark figures per Artificial Analysis.'

如果选 MiniMax M3,如果选 Muse Spark 1.2

开头段落里的两个事实会因你正在构建的东西不同而有不同的结论,所以这里给出不加含糊的区分。

• 如果每个 token 的成本是硬性约束,如果你需要超过 131,072 个 token 的长篇输出,如果你需要开放权重,如果你想无需单独流水线即可输入视频,或者如果你想以大约四分之一的输入价格进行推理密集型知识工作,那就选择 MiniMax M3——GPQA Diamond 上两者不分伯仲,而正是这一项让廉价模型有了用武之地。

• 如果你的工作负载是配备工具的长时程智能体,如果你需要经过审计的最高编码得分,如果你想要一个显式的 reasoning_effort 档位,如果你需要直接摄取音频或 PDF,或者如果你需要快速的流式输出,那就选择 Muse Spark 1.2——507 tok/s 对 289 tok/s 是肉眼可见的差异,而不是基准测试上的差异。

• 如果您还不知道该选哪一个,那么决定性的证据并不在本页面上。请将两个模型分别放到您自己的流量样本上进行测试和衡量;每个模型页面上的价格计算器会在一分钟内告诉您成本方面的情况,而上面的七日延迟数据则是性能方面最接近预览的东西。

两者都运行在同一个 API 上,价格不高于提供商标价,因此试用只是更改模型 ID,而非迁移,而且自动故障转移意味着任一提供商出现问题时,只会退化为更慢的回答,而不是服务中断

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新