
Qwen3.8-27B 對決 Meta Muse Glimmer:本地代理競賽,一方已就位
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
Meta Muse Glimmer 已於 2026 年 8 月 10 日推出 — 採用 Apache 2.0 授權、約 300 億個參數、明確鎖定本機代理型工作負載 — 而那個幾乎肯定會成為其最強勁對手的模型,至今仍未發布。Alibaba 在 8 月 3 日宣布 Qwen3.8-27B 為 Qwen3.8 世代中可自行託管的成員,並承諾於 8 月 10 日當週開放其權重;但截至本文撰寫之時,官方儲存庫尚未出現。這使得這場比較刻意地不對等:一方是真實存在、今天即可下載的模型,另一方則仍未經驗證。而這正是現在值得撰寫的原因 — Meta 在建立 Glimmer 自己的基準測試表時,是以 27B 的前代為比較對象,因此在 27B 問世之前,戰局早已定調。
對戰一覽
這兩個模型都在追逐同一個買家:一個想要在自有的硬體上獲得接近旗艦等級的代理(agentic)與編碼能力,而不是透過 API 的人。各項維度對比如下,其中 Qwen 一方在儲存庫尚未確認之處標記為未驗證:
• 狀態 — Meta Muse Glimmer 現已推出,而 Qwen3.8-27B 已公布,權重尚未發布。
• 尺寸 — Glimmer 總計約 29.6B(27.9B 文字解碼器 + 1.9B 視覺編碼器),相較於 27B 的約 27B,架構尚未確認。
• 授權 — Apache 2.0,涵蓋權重、量化、草稿模型與編碼器;另一選項尚未公布,且很有可能帶有通義千問 100M-MAU 條款。
• 上下文 — Glimmer 支援 128K token 視窗,對比 27B 的上下文,尚未證實。
• 模態 — Glimmer 透過感知編碼器接收文字和圖像輸入,相對於 27B,可能以文字優先,尚未確認。
• 本機佔用空間 — Glimmer 在 4-bit K-Quant-17GB 設定下約佔用 17 GB,而 27B 在 Q4_K_M 下預估約為 17 GB。
• 速度技術 — Glimmer 搭載 DFlash 推測解碼(Meta 報告在 RTX 5090 上達到每秒 74.9 至 233.4 tokens,提升 3.1 倍),而 27B 尚未有這類宣稱。
為什麼 Meta 瞄準這裡
Muse Glimmer 是 Meta 封閉式旗艦模型 Muse Spark 1.2 的蒸餾與量化版本,由 Meta Superintelligence Labs 發布,並專門針對常駐開啟的裝置端代理(agent)進行調校:工具呼叫、多步驟推理、失敗恢復與重試、文字與圖像交錯理解,以及超過 100 種語言。Meta 自家的數據顯示,它在多項代理測試上領先 Gemma 4 系列與 Qwen3.6-27B——MCP Atlas 75.5、DeepSearch QA 74.6、SWE-Bench Pro 51.2——在另外幾項則僅略遜一籌。這些全為廠商自行宣稱之數據,未經獨立重現。值得直說:在 Meta 所挑選的代理基準上,Glimmer 領先先前的 Qwen 世代;而在 Meta 未挑選的基準上,Qwen 仍然領先。
有兩件事讓 Glimmer 除了分數之外格外引人注目。第一是授權:Apache 2.0,沒有 MAU 條款,沒有商業洽談門檻——這是 Meta 長期以來推出過最寬鬆的授權,而祖克柏隨附的文章也明確點出了這項戰略賭注。第二是首日工具鏈:llama.cpp、Hugging Face Transformers、Ollama、LM Studio 和 SGLang 都在發布當天或接近發布時就提供了支援,這正是本地模型要「可用」而非只是「可下載」所需要的。

Meta 已經選定了對手。
在Glimmer的發布中,這次比較最有用的資訊是Meta拿來對標的對象:Qwen3.6-27B,也就是Qwen3.8-27B的直接前代。在Meta自己的表格上,Glimmer在SWE-Bench Pro(51.2 對 50.2)略勝Qwen 27B,在SWE-Bench Verified(76.0 對 77.2)則落後,而Qwen在OSWorld-Verified、Terminal-Bench 2.1以及大部分多模態基準測試上領先。換言之,這兩個系列在27–30B的本地端規模上互有勝負,而Qwen這一方3.8世代正是Meta作為參考基準的那個模型的下一代。這才是這場對決真正的重點:27B並不是Glimmer假想中的競爭對手,而是現任領先者的下一版,而且Meta已經告訴我們基線有多接近。
Qwen 方面還有什麼尚未驗證?
在儲存庫上線之前,Qwen3.8-27B 那一欄大多是問號:它是密集(dense)還是 MoE 模型、其上下文視窗大小、是否為多模態,以及最關鍵的授權條款。授權問題本身就足以左右這項比較的結果——採用 Tongyi Qianwen 授權的模型,與採用 Apache 2.0 授權的模型,是截然不同的採購決策,尤其是對於月活躍用戶數(MAU)超過門檻的商業產品。27B 的基準測試分數目前一項都還不存在,而供應商公布的 3.8 系列整體數據,屬於 Max 版本,而非 27B。

該選哪一個
如果你今天就需要一個可用的本機代理模型,這個決定不言自明:Meta Muse Glimmer 已經存在,可在 24 GB 顯示卡上運行,具備首日執行階段支援,而且採用 Apache 2.0 授權。Qwen3.8-27B 則是一個承諾。如果你已經標準化在 Qwen 生態系上,或者你的需求是某個 3.8 世代預期會推進的特定基準測試,那麼 27B 值得等待——但等待有實際的機會成本,而且授權條款可能在它推出後改變你的答案。
既不想等待、也不想被鎖定的團隊,有一條中間路線。OrcaRouter 透過單一 API 路由 200 多個模型,按供應商定價收費、零加成,並具備自動容錯移轉——Qwen3.8 Max 現已上線,每百萬 tokens 收取 2.00/6.00 美元,而 Meta 自己的封閉式 Muse Spark 系列也可透過同一個金鑰存取。當 27B 推出並在獨立基準測試中贏得信任後,容錯移轉就是在不把整條路徑賭在未經驗證模型的前提下,讓它面對生產工作負載的最佳方式:將一部分流量路由給它,其餘繼續留在現行模型上,讓真實使用情況來決定。

雙方都尚未經過獨立審計——Glimmer 的數據是 Meta 的,而 27B 根本沒有任何數據。第一週後的誠實評價:Glimmer 是你可以實際執行的模型,27B 是你一個月後會拿來比較的對象,而最可能讓團隊改變決定的,是授權檔案,而不是基準測試表。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
