
Qwen3.8-27B vs Meta Muse Glimmer:本地智能体竞赛,一方已经就位
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
Meta Muse Glimmer 已于 2026 年 8 月 10 日发布——采用 Apache 2.0 协议,参数量约 300 亿,明确瞄准本地智能体工作负载——而几乎可以肯定将成为其最强劲对手的模型尚未发布。阿里巴巴于 8 月 3 日宣布 Qwen3.8-27B 作为 Qwen3.8 世代中可自托管的成员,承诺在 8 月 10 日那一周开放权重,但截至撰写本文时,官方仓库仍未出现。这使得本次对比刻意带有偏差:一边是真实存在、今天即可下载的模型,另一边则仍未经证实。而这正是现在值得撰写的理由——Meta 在构建 Glimmer 自己的基准测试表时,对标的是 27B 的前代产品,因此在 27B 问世之前,这场较量就已经被框定好了。
对阵一览
两款模型瞄准的是同一个买家:希望在自己拥有的硬件上获得接近旗舰级的智能体与编码能力、而非通过 API 的人。各维度对比如下,Qwen 一方在仓库尚未确认之处均标注为未验证:
• 状态 — Meta Muse Glimmer 现已可用,而 Qwen3.8-27B 已公布,权重待发布。
• 大小 — Glimmer 总参数约 29.6B(27.9B 文本解码器 + 1.9B 视觉编码器),而 27B 版本约为 27B,架构尚未确认。
• 许可证 — Apache 2.0,涵盖权重、量化、草稿模型和编码器;抑或尚未公布,且很可能包含通义千问 1亿 MAU 条款。
• 上下文 — Glimmer 支持 128K token 的上下文窗口,而 27B 的上下文窗口大小尚未确认。
• 模态 — Glimmer 通过感知编码器接受文本和图像输入,而 27B 则可能以文本优先,尚未确认。
• 本地占用空间 — Glimmer 在 4-bit K-Quant-17GB 设置下运行约需 17 GB,而 27B 在 Q4_K_M 下的预计占用也约为 17 GB。
• 速度技术 — Glimmer 搭载 DFlash 推测解码(Meta 报告在 RTX 5090 上为 74.9 至 233.4 tokens/s,提升 3.1 倍),而 27B 尚无此类说法。
为什么Meta瞄准了这里
Muse Glimmer 是 Meta 闭源旗舰模型 Muse Spark 1.2 的蒸馏与量化版本,由 Meta Superintelligence Labs 发布,并针对常驻在端侧设备上的智能体进行了专门调优:工具调用、多步推理、失败恢复与重试、交错的文本与图像理解,以及 100 多种语言。Meta 自己的数据称,它在多项智能体测试上领先 Gemma 4 系列和 Qwen3.6-27B——MCP Atlas 75.5、DeepSearch QA 74.6、SWE-Bench Pro 51.2——而在另一些测试上则略逊一筹。所有这些都来自厂商自报、未经独立复现,而且值得直说:在 Meta 选定的智能体基准上,Glimmer 领先前代 Qwen;而在它未选定的基准上,Qwen 依然领先。
有两件事让 Glimmer 在分数之外尤为值得注意。第一是许可证:Apache 2.0,没有 MAU 条款,没有商业讨论门槛——这是 Meta 长期以来发布的最宽松许可以及扎克伯格随附的文章,让这一战略押注变得明确。第二是首发工具链:llama.cpp、Hugging Face Transformers、Ollama、LM Studio 和 SGLang 都在发布时或接近发布时提供了支持,这正是本地模型要可用而不仅仅是可下载所需要的。

Meta 已经选定了对手
对于这次对比,Glimmer发布中最有用的事实是Meta的基准测试对象:Qwen3.6-27B,也就是Qwen3.8-27B的直接前身。在Meta自己的表格中,Glimmer在SWE-Bench Pro上以51.2对50.2略胜Qwen 27B,在SWE-Bench Verified上以76.0对77.2落后于它,而Qwen在OSWorld-Verified、Terminal-Bench 2.1以及大多数多模态基准测试中领先。换句话说,这两个系列在27–30B的本地规模上互有胜负,而Qwen这边的3.8代恰恰就是Meta用作参照点的那个模型的续作。这才是这场对决真正的重点:27B并不是Glimmer假想中的竞争对手,它是在位者的下一代版本,而Meta已经告诉了我们基线有多接近。
Qwen 方面仍未验证的是什么?
在代码仓库正式落地之前,Qwen3.8-27B 这一列大多只能打上问号:它是密集模型还是 MoE、上下文窗口多大、是否支持多模态,以及最关键的许可证问题。许可证问题本身就可能单独决定这场对比的走向——采用通义千问许可证的模型与采用 Apache 2.0 许可证的模型,在采购决策上是截然不同的,尤其是对于超过 MAU 阈值的商业产品而言。27B 的基准测试成绩目前一项都没有,而厂商报告的整个 3.8 系列数据属于 Max,并非 27B。

该选哪一个
如果你今天就需要一个能用的本地智能体模型,答案不言自明:Meta Muse Glimmer 已经存在,可在 24 GB 显存显卡上运行,发布第一天就有运行时支持,并且是 Apache 2.0 许可证。Qwen3.8-27B 还只是一个承诺。如果你已经标准化在 Qwen 生态上,或者你的需求正好是 3.8 这一代预期会提升的某个特定基准测试,那么 27B 值得等待——但等待有实际的机会成本,而且它发布后,许可证条款可能会改变你的答案。
既不想等待、也不想被锁定的团队,有一条中间路线。OrcaRouter 通过一个 API 路由 200 多个模型,按提供商目录价格计费、零加价,并具备自动故障转移——Qwen3.8 Max 今日已上线,每百万 token 定价 $2.00/$6.00,Meta 自家的封闭式 Muse Spark 系列也可通过同一个密钥访问。当 27B 发布并在独立基准测试中赢得信任后,故障转移就是在生产工作负载中试用它的方式,不必把整条路径押在一个未经证实的模型上:将一部分流量路由给它,其余流量继续留在现有模型上,让真实使用情况来做最终决定。

双方都还没有经过独立审计——Glimmer 的数据来自 Meta,而 27B 根本没有任何数据。第一周过后的诚实评价是:Glimmer 是你真正能跑起来的模型,27B 则是你一个月后会拿来和它对比的那一个,而最可能左右团队决策的,是许可文件,而不是基准测试表。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
