生成的标题卡上写着 GPT-6 Sol 对比 Muse Spark 1.2,其中一个有耳朵;统计卡显示输入模态为文本、图像、文件 对比 文本、图像、视频、文件、音频,输出价格为每百万 $10.00 对比每百万 $4.25,以及第三方 GPQA Diamond 96.1 对比 90.4;页脚写着 Muse Spark 1.2 的费率依据 Meta,GPT-6 Sol 的费率依据 OpenAI 的费率表;基准数据依据 Artificial Analysis。
Guides & Insights

GPT-6 Sol 对比 Muse Spark 1.2:其中一个有耳朵

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

将GPT-6 Sol和Muse Spark 1.2并排对比,价格栏只是有所不同,而模态栏则完全不在一个量级。Muse Spark 1.2 接受文本、图像、视频、文件和音频。GPT-6 Sol 接受文本、图像和文件。音频和视频就是差异所在,而且它们并非无关紧要的细节:它们区分了一个可以直接接收会议录音的模型和一个必须接收会议转录文本的模型。GPT-6 Sol 是该代的中端层级,于 2026 年 9 月 22 日发布;Muse Spark 1.2 是 Meta 在 Muse Spark 系列中的当前检查点,于 2026 年 8 月 5 日发布,作为 Muse Spark 1.1 在同一 Standard 层级、相同定价下的直接替换更新。

最后一点对于本页应如何解读很重要。Muse Spark 1.2 不是新一代,也不应被写成新一代——Meta 自己的描述是:一个性能略有提升的更新检查点,并以不变的费率提供服务。因此,有趣的问题不是 1.2 相比 1.1 增加了什么,而是 Muse Spark 家族有哪些 GPT-6 家族没有的东西,以及你是否需要它。

两份规格表,关于不同的尺寸

• 输入模态 — GPT-6 Sol 支持文本、图像和文件,而 Muse Spark 1.2 支持文本、图像、视频、文件和音频

• 输出——两者均仅为纯文本

• 输入价格 — GPT-6 Sol 每百万 $2.00,而 Muse Spark 1.2 每百万 $1.25

• 输出价格 — GPT-6 Sol 每百万 $10.00,对比 Muse Spark 1.2 每百万 $4.25

• 缓存输入 — GPT-6 Sol 每百万 $0.20,而 Muse Spark 1.2 每百万 $0.15

• 上下文窗口——1,050,000 token 对比 1,048,576 token,实际上相同

• 长请求阶梯——GPT-6 Sol 将输入 token 超过 272,000 的整个请求重新定价为 $4.00 / $15.00,而 Muse Spark 1.2 的价格卡上没有阶梯

• GPQA Diamond — GPT-6 Sol 96.1 对比 Muse Spark 1.2 90.4

• 人类最后的考试 — GPT-6 Sol 47.9 对比 Muse Spark 1.2 45.5

• 长上下文召回——GPT-6 Sol 83.7 对 Muse Spark 1.2 79.0

• tau-banking — GPT-6 Sol 未在此修订版中发布,对比 Muse Spark 1.2 34.8

• 权重 — 两者均为闭源,仅提供 API

长请求这一行在那份清单里默默发挥着作用。Muse Spark 1.2 的公开价目卡上没有长上下文重新定价条款,因此其 $1.25 / $4.25 在整个窗口内都保持不变。GPT-6 Sol 的标价则不然:一旦输入 token 超过 272,000,整个请求就转为 $4.00 / $15.00。所以在满上下文的提示下,输出端的对比并非 10 美元对 $4.25,而是 15 美元对 $4.25——是三倍半,而非两倍又三分之一。

而基准测试的差距比价格差距所暗示的要小。GPQA Diamond 上,96.1 对 90.4,大致相当于你会预期来自两种不同推理投入设置的差距,而不是能力差异;而在 Humanity's Last Exam 上,两者分别为 47.9 和 45.5,在百分制上相差 2.4 分。Muse Spark 1.2 是更便宜的模型,也是整体能力更全面的阅读者;GPT-6 Sol 在推理数据上领先,但领先幅度并不像价格所暗示的那么大。两列都不占绝对优势,这正是让这个选择值得慎重做出的原因。

Generated comparison scoreboard titled GPT-6 Sol vs Muse Spark 1.2, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, modalities text image file, GPQA Diamond 96.1, long-context recall 83.7, reprices above 272K input tokens. Muse Spark 1.2: input $1.25 per million, output $4.25 per million, modalities text image video file audio, GPQA Diamond 90.4, long-context recall 79.0, no long-request step. A footer reads Muse Spark 1.2 figures per Artificial Analysis and Meta; GPT-6 Sol figures per Artificial Analysis and OpenAI.

音频和视频输入实际上会改变什么

一个能接收音频的模型可以直接拿到录音,而不是转录文本。这听起来像是一种便利,但实际上改变了可能性的边界:转录是一个有损步骤,会丢弃语气、重叠、笑声,以及仅从文本中读取时问句与陈述句之间的差别。直接听到文件的模型能看到这一切。同样的论证也适用于视频:逐帧描述会丢失时间节奏,而直接摄取视频片段的模型则不会。

GPT-6 Sol 的答案是一条流水线,而非一种模态——先转写或生成字幕,再传入文本。这是一种完全可行的架构,而且对许多工作负载来说,它更为可取,因为转写文本可检查、可缓存,存储成本也低。它恰恰在音频或动作本身就是信号时更差:呼叫中心质量审核、媒体记录,以及任何说话者的犹豫承载意义的情形。

Meta 在这一问题上的立场值得仔细一读,因为音频标签并非装饰。Muse Spark 1.2 的能力列表中包含音频,与视觉、工具、JSON 和推理并列,而 Meta 已将这一系列作为其多模态产品线发布,较小的 Muse Glimmer 则是从 Muse Spark 教师模型蒸馏而来。如果你要根据输入层面在这两者之间做选择,那么选择并不是在略宽和略窄的规格表之间进行,而是在拥有该模态与构建一条近似实现它的流水线之间进行。

两者真正分离之处

最清晰的区分在于针对模拟服务的代理式工具使用,而这是数字差距足够大、足以据此采取行动的唯一领域。Muse Spark 1.2 在 tau-banking 上录得 34.8,而在较新的 Terminal-Bench 4.0 修订版上仅为 7.1——两者均为第三方测量,且从两个方向描述了同一弱点。一个能很好地理解会议内容、却在被要求调用 API 时数错客户余额的模型,并不是一个糟糕的模型;而是一个职责边界清晰的模型。

对 GPT-6 Sol 运行同样的检查,情况一致,但更单薄。其长上下文召回率为 83.7,SciCode 为 57.6,Terminal-Bench 4.0 为 43.9,均为第三方数据。其在 v2.1 修订版上的编码和终端智能体数据则完全缺失,而缺失数字并不等于低数字——任何用估计值填补该单元格的人都是在编造。

在数字被过于急切地相互比较之前,有一个不对称之处值得点明。Muse Spark 1.2 除了第三方测试集之外,还带有来自 Meta 的一整套厂商基准测试套件,而 Artificial Analysis 自己的发布分析在其 xhigh 推理设置下将其置于 Intelligence Index 上 54 分,比 Muse Spark 1.1 高三分。GPT-6 Sol 在我们目录中的同一指数上得分为 47.6。这两个数字不能相减:它们来自不同时间测量的不同配置,而在这两者之间经过修订的指数并不是同一把量具。诚实的比较性说法是上面那些单一基准的结果,因为两个模型都有来自同一评估者的数字。当一个模型有更多已公布的数字时,它看起来总会比数字更少的模型更有据可查,而在这对模型上,这种差异在很大程度上取决于谁来报告,而不是模型能做什么。

OrcaRouter model page for Muse Spark 1.2 (meta/muse-spark-1.2) by Meta, dated 2026-08-05, tagged Vision, Audio, Tools, JSON and Reasoning, showing text, image, video, file and audio input with text output, a list price of $1.25 per million input and $4.25 per million output, and page copy describing it as Meta's reasoning model for complex agentic tasks and the current checkpoint of the Muse Spark family.

为两个在负载下表现不同的模型提供服务

两者都在 OrcaRouter 上,只需一个密钥,而且这一组合是一种自然的路由分流,而非二选一。把多模态流量——录音、视频片段、带扫描附件的文档包——发送给 Muse Spark 1.2,价格为 $1.25 / $4.25,且没有长上下文断崖。把推理密集型和智能体式流量发送给 GPT-6 Sol,并为那些答案必须经得起推敲的请求接受更高的费率。通过一个端点,这种分流就是一条路由规则,而不是两个集成。

服务端有一项数据与价格逻辑相悖。在我们的滚动七天窗口内,Muse Spark 1.2 实测每秒输出约 420 个 token,而 GPT-6 Sol 约为 244——在我们的路由上,Meta 的模型既更便宜也更快。首 token 延迟则相反:同一窗口内,Muse Spark 1.2 的 p50 首 token 时间约为 5.2 秒,GPT-6 Sol 约为 6.8 秒,因此更便宜的那个模型反而更早开始作答。两者都是在共享基础设施上进行的滚动测量,而非受控基准测试,且每次读取的数值都会变化。

在这样一条混合流水线上,自动故障转移自有其价值。当一个请求可以通过一条路由以音频进入、以文本离开,而通过另一条路由则必须经过一个强制转录步骤时,你真正关心的故障模式是:某个提供商接受了请求,却在媒体上传环节卡住——第二条已配置的路由会把这种情况变成一次重试,而不是一个必须有人注意到并重新运行的任务。我们的目录会原样传递提供商的标价,因此,如果 Meta 调整了 4.25 美元这一档,或者像其他供应商已经做的那样,在 Muse Spark 卡片中加入长上下文条款,这一变化会在发生当天就传达给你,而不是等到某个经销商注意到之后。

Artificial Analysis launch analysis for Muse Spark 1.2 dated August 5, 2026, titled Muse Spark 1.2: Improved Agentic Performance at Higher Cost per Task, reporting that Muse Spark 1.2 scores 54 on the Artificial Analysis Intelligence Index, up 3 points from Muse Spark 1.1 at 51 and 11 points from Muse Spark 1.0 at 43, and describing it as Meta's third release in four months, tying with SpaceXAI for third place among US labs.

这个决定,说白了

如果你的输入是录音或片段,且时间节奏或语气本身就是含义的一部分,那就用 Muse Spark 1.2。GPT-6 Sol 无论怎么配置,都无法通过 API 达到这种能力;替代流水线无论定什么价格,也都无法与之等价。如果你的输入是文本和图像,而输出将被人实际执行,那么 GPT-6 Sol 的推理数据更为领先,其工具使用表现也更稳妥——Muse Spark 1.2 的 tau-banking 和 Terminal-Bench 4.0 分数是两份榜单上最响亮的信号,而它们恰恰指向它不适合智能体类工作。

还要注意 Muse Spark 1.2 不是什么:它不是新一代。它是 Meta 现有模型家族的一个当前检查点,是 1.1 在价格不变情况下的直接替代品,这让升级决定无需额外成本,而与 GPT-6 Sol 的比较则是另一个问题。另一方面,GPT-6 Sol 已经被 GPT-6.1 Sol 取代,短上下文费率相同,缓存输入价格从 $0.20 减半至 $0.10,OpenAI 自己的模型页面现在也引导读者去看它。如果你权衡 Sol 而非 Muse Spark 的原因是那个已有八天的集成,那么这个理由仍然成立。如果是能力,先看看后继版本。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新