
Claude Sonnet 5.5 对比 Muse Glimmer:一款 30B 笔记本端模型迎战新版 Sonnet
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 931 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 192 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
本页要探讨的核心问题是:这种比较究竟是否成立;而诚实的答案是,Claude Sonnet 5.5与Muse Glimmer并非通常意义上的竞争对手。在 Artificial Analysis 的 Intelligence Index(v4.3.2 修订版)上,Claude Sonnet 5.5 得 56 分,Muse Glimmer 得 17 分,这一差距并非噪声——它大致相当于前沿通用模型与一款非常优秀的小模型之间的距离。不过,这一组合之所以仍值得一读,是因为 Muse Glimmer 拥有一个对方无论花多少钱都买不到的特性:它是一个 300 亿参数的开放权重模型,由 Meta 于 2026 年 8 月 10 日以 Apache 2.0 许可发布,量化至 4 位,因此可装入 20 GB 以内的显存,并且专为断网运行而设计。Claude Sonnet 5.5 于 2026 年 9 月 28 日面世,是该厂商最快、最聪明的 Sonnet,定价为每百万输入 token 2.00 美元、每百万输出 token 10.00 美元,且只能通过网络访问。真正的抉择不在于哪个模型更好,而在于你希望 token 在哪里运行。
两种模式,两种职责定义
Muse Glimmer 出自 Meta Superintelligence Labs,是一个 300 亿参数的模型,通过从 Meta 更大的 Muse Spark 教师模型进行 logit 蒸馏训练而来,随后又在长上下文智能体数据上微调,并针对工具使用进行了强化。Meta 发布它时已完成量化:4 比特将内存占用从全精度下的 55 GB 以上降至 20 GB 以下,这正是它能落入 24 GB 或 32 GB 消费级 GPU 范围的原因。Meta 在 Nvidia RTX 5090 以及 Apple M4 Max 和 M5 Max 芯片上对它进行了测试。它接受文本和图像输入,返回文本,运行 131,072 token 的上下文窗口——Meta 称可扩展至 262,144——并且知识截止日期为 2026 年 1 月。

Claude Sonnet 5.5 是 Anthropic 5.5 代中的第二个模型,也是该公司在其产品阵容中定位为速度与智能最佳结合的模型。它运行 1,000,000 token 的上下文窗口,同步最多 128,000 个输出 token,而在 Message Batches API 上,可输出 300,000 个 token,通过 output-300k-2026-03-24 请求头实现,接受文本、图像和文件,提供自适应思考,支持可选 effort,知识截止日期为 2026 年 6 月,并且自发布起支持零数据保留。存储费用为:缓存读取每百万 token 0.20 美元,缓存写入每百万 token 2.50 美元。Anthropic 表示,它比 Claude Sonnet 5 运行快 30%,在费率不变的情况下,每项任务成本最多降低 30%——这些是供应商的说法,尚未经独立复现。
这种规格上的对比值得一口气看完,因为几乎每一行都是不同类别的东西,而不是更好或更差的东西:
• 权重 — Muse Glimmer Apache 2.0,可下载,量化为 4 位,对比 Claude Sonnet 5.5 闭源
• 运行位置 — Muse Glimmer 在你自己 GPU 上离线运行,对比 Anthropic 基础设施上的 Claude Sonnet 5.5
• 参数 — Muse Glimmer 总计 30B,4-bit 下不足 20 GB;Claude Sonnet 5.5 未披露
• 上下文 — Muse Glimmer 为 131,072 个 token,可扩展至 262,144,而 Claude Sonnet 5.5 为 1,000,000 个 token
• 每百万 token 价格 — Muse Glimmer 不按 token 收费,你的硬件对比 Claude Sonnet 5。输入 $2.00 / 输出 $10.00
• 智能指数 v4.3.2 — Muse Glimmer 17 对比 Claude Sonnet 5.5 56
• 每次 Index 任务的实测成本 — Muse Glimmer $0.06,而 Claude Sonnet 5.5 为 $7.60
那份清单上有两个数字值得拆解,因为两者都是陷阱。第一个是每任务 0.06 美元这个数字:这是 Artificial Analysis 通过托管端点调用 Muse Glimmer(high)的花费,输入每百万 token 0.325 美元、输出每百万 token 1.35 美元,因此它衡量的是租用这个模型的经济性,而不是运行它的经济性。自行托管时,每 token 的边际成本就消失了,取而代之的是你已经拥有或必须购买的 GPU。第二个是 Index 差距本身——一个被量化到 20 GB 的 30B 模型,正在用与前沿模型相同的标尺打分,而榜单也说明了这一点:它将 Muse Glimmer 列入少数顶尖开放权重模型之列,同时指出它就其规模而言很昂贵。

Muse Glimmer 真正出彩的地方,以及它在哪些地方掉了链子
综合评分过于笼统,无法成为全部答案,因为 Muse Glimmer 并非 uniformly 十七。它很快——Artificial Analysis 测得每秒输出 143.8 个 token,领先于 Claude Sonnet 5.5 的 138.7——而且它很简洁,在 Index 评估中总共生成 5900 万 token,而 Claude Sonnet 5.5 为 4.1 亿。并且在某一项评估上,它接近前沿:长上下文召回,它得分 83.3%,而 Claude Sonnet 5.5 为 82.7%。一个 30B 模型在长上下文检索上匹配全新的前沿 Sonnet,是这一页上最令人惊讶的一行,而这与 Meta 训练它的方式一致——长上下文 agentic 数据,从一个大得多的教师模型进行蒸馏。
智能体类结果才真正暴露出该模型的能力上限,排名也就不再好看。在 Terminal-Bench 4.0 上,Muse Glimmer 得分 0.5%,而 Claude Sonnet 5.5 为 63.6%。其自动化基准测试得分为 0.068,对手为 0.713。Humanity's Last Exam:22.0% 对 55.0%。在执行类基准测试中,如此之小的产出规模意味着该模型根本无法完成任务;而无论本地托管能省下多少,一个永远跑不完的任务都不会因此变得更便宜。
研究文献对此也直言不讳,而且这一点值得明说,而不是被掩盖过去:一项经过同行评审的多智能体编排研究——Muse-Glimmer-30B 是受测模型之一——发现它未能恢复其中任何一个候选方案。Meta 自己为该模型制作的基准表是一份厂商文件,本文也按此标注;上文的 Artificial Analysis 数据是独立测量结果,而本文倚重的正是这些数据。
所以这个分界是清楚可辨的。Muse Glimmer 在读取长输入并据此作答方面,就同尺寸模型而言表现强劲,速度快,运行成本低,还能装进笔记本级 GPU。但它不是那种你交给它一个多步骤软件任务就能撒手不管的模型。这就是诚实的边界,而只围绕综合评分写出的对比会把它掩盖掉。
在前沿费率下,你实际买到的究竟是什么
Claude Sonnet 5.5 的溢价首先买到的是能力,而 Index 上十七个点的差距正是这一点的标志性体现。但伴随 $10.00 输出价格而来的还有另外三样东西,它们不会出现在任何排行榜上。
第一点是窗口。一百万个 token 大约是 Muse Glimmer 的 131,072 的七倍半,而 Anthropic 对全部这些 token 都按标准费率收费,缓存读取价格仅为输入价格的十分之一,因此跨多次调用携带大上下文是可负担的,而不是理论上的。仓库规模的提示完全放不进较小的窗口,所以这是能力差异,而不是偏好。
第二点是工具保真度。Claude Sonnet 5 与 Claude Sonnet 5.5 之间有五项行为发生了变化,而这五项全都与工具使用和推理有关:非默认采样参数现在会返回 400,thinking: {"type": "disabled"}现在会返回 400,并变为between_tools;强制选择"any"或指定具名工具会被拒绝,因此循环必须改用auto并配合严格工具使用;较旧的computer_20251124工具在 Claude API 和 Google Cloud 上会被拒绝;思考块现在会绑定到生成它的模型和账户。第六项变化不会导致任何失败,但会悄然失效:工具调用之间的文本会返回到思考块内部,因此流式应用会停止显示输出,直到它设置显示值或关闭前置思考。对于任何使用 Sonnet 5 的人来说,这是一天的迁移工作量,也是换取上文基准测试行所衡量的智能体可靠性的入场代价。
第三点是来源与数据处理。自发布之日起即可提供零数据保留,Anthropic 公布了 2027 年 9 月 28 日的退役下限,且该模型可在 Claude API、Bedrock、Google Cloud 和 Microsoft Foundry 上使用。对受监管的买家而言,这些采购事实在基准测试之前就已决定了是否购买。
离线是硬性要求,而不是为了节省成本。
这组搭配之所以应归于同一页面,原因在于:对于某一类特定部署而言,Muse Glimmer 并不是更便宜的选择——它是唯一的选择。一个不能离开设备的请求,一座没有网络连接的工厂车间或野外现场,一个调用 API 即构成合规违规的气隙隔离环境,或者一个往返一次就已经超出预算的延迟约束:这些问题没有一个能靠网络另一端更强大的模型来解决。不到 20 GB、可离线运行的 Apache 2.0 权重就是全部答案,而无论价格如何,Claude Sonnet 5.5 都不参与这个问题。
Meta 在 RTX 5090、Apple M4 Max 和 M5 Max 芯片上公布的测试,是这里“能在本地运行”意味着什么的实用参考,而 4 位量化才使这些目标真正可达——全精度占用超过 55 GB。任何计划部署的人都应将这些硬件数据视为 Meta 的数据,而非在此处实测所得。
对于其他所有人而言,这两个模型是互补而非替代关系,而操作上尴尬的一点是,同时持有一个 Anthropic API 模型和一个自托管的 Meta 模型通常意味着两套完全独立的栈。OrcaRouter 将 200 多个模型置于同一个兼容 OpenAI 的端点之后,按提供商标价透传、不额外加价,在上游提供商之间自动故障转移,并提供用于组合调用的路由 DSL——这覆盖了该方案中托管的那一半,而 Meta 更大的 Muse Spark 1.2 教师模型可在此路由为 meta/muse-spark-1.2,价格为每百万 token 输入 $1.25、输出 $4.25,上下文窗口为 1,048,576 个 token,缓存读取为 $0.15。它每周通过该模型目录承载 4280 万个 token 的流量,而这正是该方案有用之处:托管的教师模型与其他所有内容共用同一把密钥,而你本地运行的模型则完全无需接触网络。
三点诚实说明,因为它们很容易弄错。Muse Glimmer 本身并不是我们的路由之一——模型卡并不存在于我们的目录中,而本页如实说明这一点,而不是暗示相反。下面的截图是确实存在的模型 Muse Spark 1.2 的页面,它是 Muse Glimmer 蒸馏所依据的检查点,而不是 Muse Glimmer 本身。Claude Sonnet 5.5 在发布一天后也不在我们的目录中;通往它的路由是 Anthropic 自己的 API,而 Claude Sonnet 5 自 6 月 30 日起已可在此路由,价格为 $2.00 和 $10.00,供任何想要该暂存目标的人使用。

如何决定
要从约束条件出发,而不是从分数出发。如果请求不能离开某台机器或某个网络,那么 Muse Glimmer 就是答案,Index 差距也就无关紧要——一个能离线运行、并在长上下文召回上与前沿模型匹敌的 30B Apache 2.0 模型,对于那项任务来说,就是现有最好的选择。如果请求必须完成一项多步骤软件任务,那么一个在 Terminal-Bench 上得分只有半个百分点的 30B 模型,无论你已拥有什么硬件,都不在考虑之列。
在这两极之间,决定胜负的是测量而非观点:在你自己的实际工作负载上,每个已完成任务所消耗的 token 数,并按两种方式定价——一种按 Claude Sonnet 5.5 的 $2.00 和 $10.00,另一种按 GPU 的摊销成本。真正让整个对比改观的,是那个数字——每个 Index 任务 $0.06 对 $7.60——但它是一个托管租用价格,对应的却是大多数人都会自行运行的模型;把它当成同等口径下的节省来引用,恰恰是本页力图避免的那种最容易犯的错误。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
