生成了标题为 Claude Sonnet 5.5 vs Muse Glimmer 的主视觉卡片,副标题为一个 30B 笔记本模型对比新的 Sonnet,包含三张统计卡片:智能指数 56 对 17、上下文窗口 1M 对 131K tokens、权重闭源对 Apache 2.0,页脚文字为指数依据 Artificial Analysis v4.3.2;Muse Glimmer 规格依据 Meta。
Guides & Insights

Claude Sonnet 5.5 对比 Muse Glimmer:一款 30B 笔记本端模型迎战新版 Sonnet

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

本页要探讨的核心问题是:这种比较究竟是否成立;而诚实的答案是,Claude Sonnet 5.5与Muse Glimmer并非通常意义上的竞争对手。在 Artificial Analysis 的 Intelligence Index(v4.3.2 修订版)上,Claude Sonnet 5.5 得 56 分,Muse Glimmer 得 17 分,这一差距并非噪声——它大致相当于前沿通用模型与一款非常优秀的小模型之间的距离。不过,这一组合之所以仍值得一读,是因为 Muse Glimmer 拥有一个对方无论花多少钱都买不到的特性:它是一个 300 亿参数的开放权重模型,由 M​eta 于 2026 年 8 月 10 日以 Apache 2.0 许可发布,量化至 4 位,因此可装入 20 GB 以内的显存,并且专为断网运行而设计。Claude Sonnet 5.5 于 2026 年 9 月 28 日面世,是该厂商最快、最聪明的 Sonnet,定价为每百万输入 token 2.00 美元、每百万输出 token 10.00 美元,且只能通过网络访问。真正的抉择不在于哪个模型更好,而在于你希望 token 在哪里运行。

两种模式,两种职责定义

Muse Glimmer 出自 Meta Superintelligence Labs,是一个 300 亿参数的模型,通过从 Meta 更大的 Muse Spark 教师模型进行 logit 蒸馏训练而来,随后又在长上下文智能体数据上微调,并针对工具使用进行了强化。Meta 发布它时已完成量化:4 比特将内存占用从全精度下的 55 GB 以上降至 20 GB 以下,这正是它能落入 24 GB 或 32 GB 消费级 GPU 范围的原因。Meta 在 Nvidia RTX 5090 以及 Apple M4 Max 和 M5 Max 芯片上对它进行了测试。它接受文本和图像输入,返回文本,运行 131,072 token 的上下文窗口——Meta 称可扩展至 262,144——并且知识截止日期为 2026 年 1 月。

Artificial Analysis model page for Muse Glimmer (high), an open-weights model released August 2026, showing an Intelligence Index of 17, an output speed of 143.8 tokens per second, $0.325 per million input tokens and $1.35 per million output tokens, $0.06 per Intelligence Index task, 59M output tokens generated during the Index evaluation, a 131K-token context window and a January 2026 knowledge cutoff.

Claude Sonnet 5.5 是 A​nthropic 5.5 代中的第二个模型,也是该公司在其产品阵容中定位为速度与智能最佳结合的模型。它运行 1,000,000 token 的上下文窗口,同步最多 128,000 个输出 token,而在 Message Batches API 上,可输出 300,000 个 token,通过 output-300k-2026-03-24 请求头实现,接受文本、图像和文件,提供自适应思考,支持可选 effort,知识截止日期为 2026 年 6 月,并且自发布起支持零数据保留。存储费用为:缓存读取每百万 token 0.20 美元,缓存写入每百万 token 2.50 美元。A​nthropic 表示,它比 Claude Sonnet 5 运行快 30%,在费率不变的情况下,每项任务成本最多降低 30%——这些是供应商的说法,尚未经独立复现。

这种规格上的对比值得一口气看完,因为几乎每一行都是不同类别的东西,而不是更好或更差的东西:

• 权重 — Muse Glimmer Apache 2.0,可下载,量化为 4 位,对比 Claude Sonnet 5.5 闭源

• 运行位置 — Muse Glimmer 在你自己 GPU 上离线运行,对比 A​nthropic 基础设施上的 Claude Sonnet 5.5

• 参数 — Muse Glimmer 总计 30B,4-bit 下不足 20 GB;Claude Sonnet 5.5 未披露

• 上下文 — Muse Glimmer 为 131,072 个 token,可扩展至 262,144,而 Claude Sonnet 5.5 为 1,000,000 个 token

• 每百万 token 价格 — Muse Glimmer 不按 token 收费,你的硬件对比 Claude Sonnet 5。输入 $2.00 / 输出 $10.00

• 智能指数 v4.3.2 — Muse Glimmer 17 对比 Claude Sonnet 5.5 56

• 每次 Index 任务的实测成本 — Muse Glimmer $0.06,而 Claude Sonnet 5.5 为 $7.60

那份清单上有两个数字值得拆解,因为两者都是陷阱。第一个是每任务 0.06 美元这个数字:这是 Artificial Analysis 通过托管端点调用 Muse Glimmer(high)的花费,输入每百万 token 0.325 美元、输出每百万 token 1.35 美元,因此它衡量的是租用这个模型的经济性,而不是运行它的经济性。自行托管时,每 token 的边际成本就消失了,取而代之的是你已经拥有或必须购买的 GPU。第二个是 Index 差距本身——一个被量化到 20 GB 的 30B 模型,正在用与前沿模型相同的标尺打分,而榜单也说明了这一点:它将 Muse Glimmer 列入少数顶尖开放权重模型之列,同时指出它就其规模而言很昂贵。

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Muse Glimmer, the scoreboard, contrasting weights closed vs Apache 2.0, where it runs Anthropic infrastructure vs your own GPU offline, parameters undisclosed vs 30B at 4-bit, context window 1,000,000 vs 131,072 tokens, AA Index 56 vs 17, and output speed 138.7 vs 143.8 tokens per second, with a footer reading AA Index and speed per Artificial Analysis v4.3.2; Muse Glimmer specifications per Meta.

Muse Glimmer 真正出彩的地方,以及它在哪些地方掉了链子

综合评分过于笼统,无法成为全部答案,因为 Muse Glimmer 并非 uniformly 十七。它很快——Artificial Analysis 测得每秒输出 143.8 个 token,领先于 Claude Sonnet 5.5 的 138.7——而且它很简洁,在 Index 评估中总共生成 5900 万 token,而 Claude Sonnet 5.5 为 4.1 亿。并且在某一项评估上,它接近前沿:长上下文召回,它得分 83.3%,而 Claude Sonnet 5.5 为 82.7%。一个 30B 模型在长上下文检索上匹配全新的前沿 Sonnet,是这一页上最令人惊讶的一行,而这与 M​eta 训练它的方式一致——长上下文 agentic 数据,从一个大得多的教师模型进行蒸馏。

智能体类结果才真正暴露出该模型的能力上限,排名也就不再好看。在 Terminal-Bench 4.0 上,Muse Glimmer 得分 0.5%,而 Claude Sonnet 5.5 为 63.6%。其自动化基准测试得分为 0.068,对手为 0.713。Humanity's Last Exam:22.0% 对 55.0%。在执行类基准测试中,如此之小的产出规模意味着该模型根本无法完成任务;而无论本地托管能省下多少,一个永远跑不完的任务都不会因此变得更便宜。

研究文献对此也直言不讳,而且这一点值得明说,而不是被掩盖过去:一项经过同行评审的多智能体编排研究——Muse-Glimmer-30B 是受测模型之一——发现它未能恢复其中任何一个候选方案。M​eta 自己为该模型制作的基准表是一份厂商文件,本文也按此标注;上文的 Artificial Analysis 数据是独立测量结果,而本文倚重的正是这些数据。

所以这个分界是清楚可辨的。Muse Glimmer 在读取长输入并据此作答方面,就同尺寸模型而言表现强劲,速度快,运行成本低,还能装进笔记本级 GPU。但它不是那种你交给它一个多步骤软件任务就能撒手不管的模型。这就是诚实的边界,而只围绕综合评分写出的对比会把它掩盖掉。

在前沿费率下,你实际买到的究竟是什么

Claude Sonnet 5.5 的溢价首先买到的是能力,而 Index 上十七个点的差距正是这一点的标志性体现。但伴随 $10.00 输出价格而来的还有另外三样东西,它们不会出现在任何排行榜上。

第一点是窗口。一百万个 token 大约是 Muse Glimmer 的 131,072 的七倍半,而 Anthropic 对全部这些 token 都按标准费率收费,缓存读取价格仅为输入价格的十分之一,因此跨多次调用携带大上下文是可负担的,而不是理论上的。仓库规模的提示完全放不进较小的窗口,所以这是能力差异,而不是偏好。

第二点是工具保真度。Claude Sonnet 5 与 Claude Sonnet 5.5 之间有五项行为发生了变化,而这五项全都与工具使用和推理有关:非默认采样参数现在会返回 400,thinking: {"type": "disabled"}现在会返回 400,并变为between_tools;强制选择"any"或指定具名工具会被拒绝,因此循环必须改用auto并配合严格工具使用;较旧的computer_20251124工具在 Claude API 和 Google Cloud 上会被拒绝;思考块现在会绑定到生成它的模型和账户。第六项变化不会导致任何失败,但会悄然失效:工具调用之间的文本会返回到思考块内部,因此流式应用会停止显示输出,直到它设置显示值或关闭前置思考。对于任何使用 Sonnet 5 的人来说,这是一天的迁移工作量,也是换取上文基准测试行所衡量的智能体可靠性的入场代价。

第三点是来源与数据处理。自发布之日起即可提供零数据保留,Anthropic 公布了 2027 年 9 月 28 日的退役下限,且该模型可在 Claude API、Bedrock、Google Cloud 和 Microsoft Foundry 上使用。对受监管的买家而言,这些采购事实在基准测试之前就已决定了是否购买。

离线是硬性要求,而不是为了节省成本。

这组搭配之所以应归于同一页面,原因在于:对于某一类特定部署而言,Muse Glimmer 并不是更便宜的选择——它是唯一的选择。一个不能离开设备的请求,一座没有网络连接的工厂车间或野外现场,一个调用 API 即构成合规违规的气隙隔离环境,或者一个往返一次就已经超出预算的延迟约束:这些问题没有一个能靠网络另一端更强大的模型来解决。不到 20 GB、可离线运行的 Apache 2.0 权重就是全部答案,而无论价格如何,Claude Sonnet 5.5 都不参与这个问题。

M​eta 在 RTX 5090、Apple M4 Max 和 M5 Max 芯片上公布的测试,是这里“能在本地运行”意味着什么的实用参考,而 4 位量化才使这些目标真正可达——全精度占用超过 55 GB。任何计划部署的人都应将这些硬件数据视为 M​eta 的数据,而非在此处实测所得。

对于其他所有人而言,这两个模型是互补而非替代关系,而操作上尴尬的一点是,同时持有一个 Anthropic API 模型和一个自托管的 Meta 模型通常意味着两套完全独立的栈。OrcaRouter 将 200 多个模型置于同一个兼容 OpenAI 的端点之后,按提供商标价透传、不额外加价,在上游提供商之间自动故障转移,并提供用于组合调用的路由 DSL——这覆盖了该方案中托管的那一半,而 Meta 更大的 Muse Spark 1.2 教师模型可在此路由为 meta/muse-spark-1.2,价格为每百万 token 输入 $1.25、输出 $4.25,上下文窗口为 1,048,576 个 token,缓存读取为 $0.15。它每周通过该模型目录承载 4280 万个 token 的流量,而这正是该方案有用之处:托管的教师模型与其他所有内容共用同一把密钥,而你本地运行的模型则完全无需接触网络。

三点诚实说明,因为它们很容易弄错。Muse Glimmer 本身并不是我们的路由之一——模型卡并不存在于我们的目录中,而本页如实说明这一点,而不是暗示相反。下面的截图是确实存在的模型 Muse Spark 1.2 的页面,它是 Muse Glimmer 蒸馏所依据的检查点,而不是 Muse Glimmer 本身。Claude Sonnet 5.5 在发布一天后也不在我们的目录中;通往它的路由是 Anthropic 自己的 API,而 Claude Sonnet 5 自 6 月 30 日起已可在此路由,价格为 $2.00 和 $10.00,供任何想要该暂存目标的人使用。

OrcaRouter model page for meta/muse-spark-1.2, dated 2026-08-05, showing $1.25 input and $4.25 output per million tokens, a p50 time to first token of 2.05 s, a 1,048,576-token context window, and 42.8M tokens of recent traffic.

如何决定

要从约束条件出发,而不是从分数出发。如果请求不能离开某台机器或某个网络,那么 Muse Glimmer 就是答案,Index 差距也就无关紧要——一个能离线运行、并在长上下文召回上与前沿模型匹敌的 30B Apache 2.0 模型,对于那项任务来说,就是现有最好的选择。如果请求必须完成一项多步骤软件任务,那么一个在 Terminal-Bench 上得分只有半个百分点的 30B 模型,无论你已拥有什么硬件,都不在考虑之列。

在这两极之间,决定胜负的是测量而非观点:在你自己的实际工作负载上,每个已完成任务所消耗的 token 数,并按两种方式定价——一种按 Claude Sonnet 5.5 的 $2.00 和 $10.00,另一种按 GPU 的摊销成本。真正让整个对比改观的,是那个数字——每个 Index 任务 $0.06 对 $7.60——但它是一个托管租用价格,对应的却是大多数人都会自行运行的模型;把它当成同等口径下的节省来引用,恰恰是本页力图避免的那种最容易犯的错误。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新