Muse Glimmer 标题卡:Meta 的 30B 开放权重智能体模型,适用于本地 GPU,带有标签,写着 Apache 2.0、可运行于 24-32 GB GPU、由 Muse Spark 1.2 蒸馏而来。
Guides & Insights

Muse Glimmer:Meta 的 300 亿参数开源权重智能体模型声称击败 Gemma4-31B 和 Qwen3.6-27B

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年8月10日上午的一条X帖子比任何新闻稿都说得更直白:“神圣的Meta回来了。”那条帖子所回应的发布——Muse Glimmer,Meta自Llama 4以来首个开放权重模型——于同一天上线,而Meta自己的公告也几乎和那条推文一样激进。这个300亿参数的模型在基准测试表中声称,24项中有19项击败Google的Gemma4-31B,24项中有14项击败阿里巴巴的Qwen3.6-27B,其中以智能体基准MCP-Atlas最为突出,Meta报告75.5,而两者分别为54.2和62.5。

在“碾压”成为你脑中的事实之前,先弄清楚这些数字出自谁手。Meta 表格中的每一个分数都由 Meta 自行跑出,而对比的竞品模型,其配置连 Meta 自己也承认并未调优。Muse Glimmer 尚未出现在 Artificial Analysis 上——这个独立排行榜恰恰追踪这一精确尺寸级别,目前 Qwen3.6-27B 的智能指数为 46,Gemma4-31B 为 39。因此,这同时是两条故事线:Meta 一次真正具有影响力的开源权重发布,以及一项需要数周才能验证的基准测试声明。本文会将两者分开来看。

Muse Glimmer 实际上是什么

Muse Glimmer 是一个 30B 稠密多模态模型——通过专用感知编码器实现文本和图像输入——在超过 100 种语言上训练,并以宽松的 Apache 2.0 许可证发布。其权重托管于 Hugging Face 上的 meta-models/Muse-Glimmer-30B。它是 Meta 更大规模专有旗舰模型 Muse Spark 1.2 的蒸馏版本,训练方案也印证了这点:预训练阶段从教师模型进行 logit 蒸馏,中期训练使用长上下文、智能体密集型数据,随后进行监督微调,并结合在策略蒸馏与强化学习。

产品简报与技术本身一样具体。Meta 为“常驻本地代理工作流”打造了 Glimmer——一个驻留在你机器上的代理,可以调用工具、遵循多步计划、在工具调用失败时恢复而不是停止,并能调高或调低推理投入程度。预期的应用场景都是那些不起眼的工作:本地编码、函数调用、日程管理、文件整理、LLM 作为评审。它与 OpenClaw 等代理编排框架兼容,这也是许多人实际运行它的方式。

硬件故事是另一半卖点。在全精度下,30B模型需要超过55GB内存;Meta的约4位量化将其降至大约17–20GB,可装入24GB或32GB的消费级显卡(以RTX 5090为参考)以及配备统一内存的高端Mac。投机解码草稿模型——Meta称之为DFlash的小型伴生模型——可加速生成:Meta报告在RTX 5090上约3.1倍(在llama.cpp中从74.9提升到233 tokens/秒),在M5 Max上1.8倍,在M4 Max上1.5倍,后者的统一内存已较少受带宽限制。

为什么这次发布的意义超越规格表

那条推文准确概括了形势。自2025年春季Llama 4发布以来,Meta在开放权重方面一直保持沉默,退回到Meta超级智能实验室和首席AI官Alexandr Wang主导的专有前沿路线。Muse Glimmer标志着公开回归开放权重战略——正是这一战略使Llama成为AI领域下载量最高的模型家族——而此次发布还附带了迄今最强烈的意图信号:扎克伯格在发布之际发表了一篇14页的文章《未来属于每个人》,认为真正的AI风险在于权力集中,而开放权重是美国保持与中国开源模型实验室竞争力的关键。他呼吁美国放松对开源AI的监管,Meta同时宣布设立10亿美元的“未来属于每个人基金”。Meta还表示,计划“在未来几周内”发布规模更大的Muse Spark 1.2的权重。

这一背景会改变你阅读基准测试表的方式。这不是实验室里悄悄发布的新奇玩意儿;它是一个附带了模型的战略宣言。Glimmer 是 Meta 产品线中“廉价本地代理”的定位,刻意削弱“严肃的智能体工作必须依赖云端 API”这一论点。它是否真的做到了这一点,正是验证环节要回答的问题。

Three-way scoreboard comparing Muse Glimmer, Gemma4-31B and Qwen3.6-27B: MCP-Atlas 75.5/54.2/62.5, DeepSearch QA 74.6/61.7/71.1, GAIA2 43.3/36.4/40.0, SWE-Bench Pro 51.2/36.9/50.2, TerminalBench 2.1 51.7/--/60.7, and AA Intelligence Index --/39/46. Footer: rows 1-5 vendor-reported by Meta; AA Index per Artificial Analysis (no Muse Glimmer entry yet).

“烟熏”说法,逐行审视

Meta的表格将Muse Glimmer与Gemma4-31B和Qwen3.6-27B在24个基准测试行中进行了对比。在其声称优势最大的地方,规律是一致的:通用智能体推理与搜索。

• MCP-Atlas(代理工具使用)——Muse Glimmer 75.5、Gemma4-31B 54.2、Qwen3.6-27B 62.5。这是标题行,也是该组中差距最大的一项。

• DeepSearch QA — 74.6,对比61.7和71.1。

• GAIA2(通用助手)— 43.3 对比 36.4 和 40.0。

• WildClawBench(智能体套件)— 47.6 对比 37.6 和 43.2。

• SWE-Bench Pro — 51.2 对比 36.9 和 50.2。注意第三个数字:50.2 是 Meta 自己对 Qwen3.6-27B 的测量值,而阿里巴巴自己公布的数字是 53.5。同一个模型,评分却因测试者不同而有差异。

• AIME 2026 — 94.7,IFBench 77.0,AA-LCR 80.0,而 Gemma 为 68.3。

这一行战绩相当亮眼。不过,整张表并非全面横扫,Muse Glimmer 落败的项目与它获胜的项目同样具有参考价值。Qwen3.6-27B 在动手操作电脑和重度终端类任务上保持领先:SWE-Bench Verified 77.2 对 Glimmer 的 76.0,OSWorld-Verified 75.6 对 65.9,TerminalBench 2.1 60.7 对 51.7;此外在 ScreenSpot Pro、OmniDocBench、MMMU-Pro 等多模态测试上也持续占优。Gemma4-31B 则在 Meta 报告的两项指标上取得了更好的安全记录——CI Memories 上违规率最低,Siren AgentDojo 上攻击成功率最低——并在范围较窄的推理测试(GPQA Diamond、Humanity's Last Exam)中略胜一筹。

直白地说,Meta 声称“在大多数智能体基准测试上优于其他两家”,而就它自己的表格而言,这大致属实。关键在于那些保留意见。Meta 自己运行了每一行,并承认其对竞品模型的测试配置并未像对自己模型那样进行调优。这并非欺诈指控——在行业中,竞品配置未调优是常见甚至意料之中的“原罪”——但这恰恰是厂商自营表格需要独立确认的原因。上文提到的 Qwen SWE-Bench Pro 差异就是整个问题的缩影。

独立记分牌显示的内容

Artificial Analysis 尚未收录 Muse Glimmer——该模型问世仅数天,而 AA 的指数基于其自身的测试运行构建,这需要时间。不过,AA 确实追踪了这两款竞品,让你得以看清这位新来者声称要进入的实测领域。根据当前指数,Qwen3.6-27B 的智能指数为 46,AA 称其为 150B 参数以下最智能的开放权重模型;Gemma4-31B 则为 39。这些都是独立数据,而非厂商宣称。

独立的图景还揭示了一个头条数字所掩盖的成本问题。AA的效率数据显示,Qwen3.6-27B每秒约生成54.6个token,而Gemma4-31B为34.8,Gemma的首token延迟更快——但Qwen运行完整索引所需的输出token约多3.7倍,这使得其端到端评估成本高出约21倍。消耗token较多的模型即使在基准测试中得分更高,在现实世界中也会更昂贵,而这是一个没有任何供应商表格会主动提供的决策参考信息。

因此,截至撰写本文时,诚实的现状是:有一个强有力的厂商报告结果,对 Muse Glimmer 还没有任何独立结果,而竞争阵营则是独立测量并按任务划分的。“Smoked Ge​mma and Q​wen”是一个站得住脚的说法;但还不是一个已证实的结果。值得关注的验证标记包括 AA 索引条目、LMArena Elo 和社区复现——这些通常在类似发布后的几周内就会出现。

Screenshot of Artificial Analysis' Small Open Source Models comparison page, showing the 4B-40B open-weight class with Openness and Intelligence index columns and the header noting that Qwen3.6-27B and Qwen3.5-27B are the highest-intelligence small open-source models.

实际运行成本

Muse Glimmer 是免费的——采用 Apache 2.0 许可,不按 token 收费,也无需向 Meta 付费。成本在于你为它配置的硬件。一个 30B 模型以 4-bit 量化运行需要大约 17–20GB 的驻留内存,还要为 KV 缓存、感知编码器和 DFlash 草稿模型留出空间,因此 Meta 官方的建议是使用 24GB 或 32GB 显存的显卡,或者一台高端的 Mac。如果你已经拥有这样的硬件,那么运行一个常驻本地代理的边际成本基本上只是电费。如果没有,那么一块 24GB 显存的 GPU 或一台顶配的 M 系列 Mac 就是一笔实打实的开销——而且自 8 月 9 日起,有了第三种选择:租用。截至该日期上线的首批托管 API 列表中,Muse Glimmer 的定价为:在 131K 上下文窗口下,每百万输入 token 0.35 美元,每百万输出 token 1.50 美元。这是提供商在市场上列出的价格,而非 Meta 的官方定价,但如果你不想购买硬件,这就是你今天实际需要支付的数字。

这才是值得认真做的对比,因为“开放权重、零价格”与“托管 API、按 token 计费”是在完全不同的条件下相遇的。当你细算账目时,双方都要诚实地定价。在我们 OrcaRouter 这边,你在 200 多个托管模型中看到的任何价格,都是提供商所列价格以 0% 加价直接传递的,所以供应商降价当天就会在这里生效,而不用等重新计算利润率——这让本地部署与托管对比变得直接明了。Muse Glimmer 本身目前还不在这 200 多个模型之列,所以这种价格直传今天并不适用于它。但关键在于这一原则:为一个尚未被验证的开放权重模型定价,应该依据你自己的流量,而不是供应商的价格表;而路由 DSL 的存在,正是为了在某个模型接入可调用的 API 之后,立刻运行这样的对比。

本周你实际会如何使用它

因为它以开放权重形式发布,"访问"不是注册——而是下载。基础仓库是 Hugging Face 上的 meta-models/Muse-Glimmer-30B,已有 GGUF 变体发布,量化变体也正由第三方陆续推出。发布当天的运行时支持包括 llama.cpp、MLX 和 ExecuTorch,Ollama、LM Studio、vLLM 和 SGLang 的集成在发布后数日内落地,AMD、Arm、Dell、Intel 和 Nvidia 的硬件优化工作也已列入计划。对大多数人来说,实际路径是:拉取 GGUF,在 llama.cpp 或本地运行器中加载,再接入 agent 脚手架。Meta 没有为 Glimmer 本身托管公共 API,本地路径正是该模型围绕其构建的方式——但托管路径已不再是假设:第三方平台于 8 月 9 日开始提供服务,因此"下载并运行"和"调用 API"现在都是可行的选项。

关于我们的一点坦诚说明:Muse Glimmer 目前仍无法通过 OrcaRouter 使用。我们路由托管 API,截至本次更新,该模型尚未进入我们的目录——0% 加价和一键访问全部模型的方案适用于我们确实路由的 200 多个模型,而它尚不在此列。一旦它进入目录,同一个密钥即可像访问目录中其他模型一样访问它,无需签订新合约;自动故障转移这一机制让我们可以安全地将真实流量指向一个全新的、由供应商报告的模型,即使它还没有独立的运行记录。这也是路由 DSL 存在的原因:一个未经证实的模型应当凭借你的数据赢得生产路径,而不是靠它自己的新闻稿。

下面的截图是发布当天 Hugging Face 卡片的样子——其中“未由任何推理提供商部署”这一行指的是 Hugging Face 自家的第一方推理服务,这与 8 月 9 日上线的第三方托管 API 列表是两回事。

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the line that the model is not deployed by any inference provider.

看什么

三件事将决定这个故事的结局,{{1}}大致按发生速度排序{{/1}}。{{2}}首先,承诺的Muse Spark 1.2开放权重发布——如果教师模型在“未来几周”内如期上线,Glimmer就不再是孤例,而会成为完整开放权重产品线的开端,这正是对“Meta回来了”的真正战略解读。{{/2}}{{3}}其次,独立测评:Artificial Analysis指数收录、LMArena榜单排名以及社区的复现实验,将告诉你“24项中19项”的说法在非Meta的第三方检验下是否依然成立。{{/3}}{{4}}第三,托管浪潮——这一波已经开始。{{/4}}服务商已于8月9日开始提供Glimmer服务,因此本地部署与托管之争如今已成为一个用API密钥就能实际做出的选择;接下来值得关注的是托管覆盖范围能铺多广,以及发布首周的新鲜感消退后每token价格会如何变化。

那条推文对新闻的报道是正确的。至于它对判决的判断是否正确——那是一个需要数周才能回答的问题,目前诚实的立场是,Meta之外还没有人运行过足够的测试来得出结论。已经确定的事实是,一个30B的Apache-2.0智能体模型,能够在消费级GPU上运行,并有全力战略推动作为后盾,无论其独立评测分数最终如何,都是一个值得围绕其规划发布的版本。

真正值得回答的问题

Muse Glimmer 真的是开源的吗?

它以宽松的 Apache 2.0 许可证发布开放权重——任何人都可以下载、修改、微调并将其商业化部署,而无需向 Meta 付费。这里刻意使用“开放权重”而非 OSI 意义上的完全开源,因为训练数据、Muse Spark 教师模型的权重以及部分工具并未包含在内。就实际目的而言——你可以运行它、分发它,并在此基础上销售产品——这与当初让 Llama 成为 AI 领域部署最广泛的开源模型家族的模式如出一辙。

Muse Glimmer 真的能击败 Gemma4-31B 和 Qwen3.6-27B 吗?

在Meta自己的榜单上,是的,在大多数智能体和搜索基准测试中都是如此,但需要注意的是,Meta是自行进行的对比,并未调整竞争对手的配置。更准确的全貌是:Meta在智能体推理类别中胜出,Qwen3.6-27B在实操计算机使用、终端工作以及大多数多模态测试中领先,而Gemma4-31B则拥有更好的安全记录。截至发布日,Muse Glimmer根本没有独立的索引条目,因此在其他人运行测试之前,应将24项中19项的说法视为供应商自报数据。

我能在笔记本电脑上运行它吗?

只有“笔记本电脑”指配备24GB或32GB独立GPU的机型,或拥有足够统一内存的高端M系列Mac时,这条才成立——4-bit Muse Glimmer大约需要17–20GB,还要为KV缓存、感知编码器和DFlash起草器预留余量。对大多数人来说这是一笔实打实的开销,也是“免费”模型背后的隐性成本。在集成显卡或16GB内存的机器上,你得到的只会是重度量化和缓慢的输出,而非这次发布所围绕构建的常驻智能体。

我从哪里获取它——是在API上吗?

模型权重托管在 Hugging Face 上的 meta-models/Muse-Glimmer-30B(提供 GGUF 变体),你可以通过 llama.cpp、MLX、ExecuTorch 或目前正在集成它的本地运行器在本地运行。托管 API 访问也已上线,自 8 月 9 日起可通过第三方平台使用,定价为每百万输入 token 0.35 美元、每百万输出 token 1.50 美元——因此你不再需要拥有一块 24GB 的 GPU 就能调用它。Meta 本身仍未为 Glimmer 提供公共 API,它也还未上线 OrcaRouter。当它进入我们的目录时,访问目录其余部分所用的同一个密钥也能访问它;在此之前,两条切实可行的路径是本地推理或第三方托管平台。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube