
Muse Glimmer:Meta 的 30B 開源權重代理模型聲稱擊敗 Gemma4-31B 和 Qwen3.6-27B
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 每百萬 tokens · 23 tok/s
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1348 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 283 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
2026年8月10日上午的一篇X貼文比任何新聞稿都更直白地說道:「神聖的Meta回來了。」該貼文所回應的發布——Muse Glimmer,Meta自Llama 4以來首個開放權重模型——於同一天推出,而Meta自己的公告也幾乎與那則推文一樣強勢。這個300億參數模型的基準測試表聲稱,它在24項中有19項擊敗Google的Gemma4-31B,在24項中有14項擊敗阿里巴巴的Qwen3.6-27B,其中以代理式基準MCP-Atlas最為突出,Meta報告的分數為75.5,而另外兩者分別為54.2和62.5。
在「smoked(碾壓)」成為你腦中的既定事實之前,先注意這些數字是誰產出的。Meta 表格中的每一項分數,都是 Meta 自己跑出來的;而那些對手模型的設定,Meta 自己也承認並未加以調校。Muse Glimmer 在 Artificial Analysis 上尚無任何紀錄;Artificial Analysis 是獨立排行榜,專門追蹤這個精確的尺寸級別——目前 Qwen3.6-27B 的智能指數為 46,Gemma4-31B 則為 39。因此,這裡其實同時有兩個故事:Meta 一次真正舉足輕重的開放權重釋出,以及一項需要數週才能驗證的基準測試宣稱。本文將兩者分開處理。
Muse Glimmer 實際上是什麼
Muse Glimmer 是一個 30B 稠密多模態模型——透過專用感知編碼器同時處理文字與影像輸入——在超過 100 種語言上訓練,並以寬鬆的 Apache 2.0 授權釋出。其權重可在 Hugging Face 的 meta-models/Muse-Glimmer-30B 取得。它是 Meta 更大型專有旗艦模型 Muse Spark 1.2 的蒸餾版本,訓練配方也印證了這點:在預訓練階段從教師模型進行 logit 蒸餾,在中期訓練使用較長上下文與代理密集型資料,隨後進行監督式微調,並結合 on-policy 蒸餾與強化學習。
這份產品簡報與其技術本身一樣具體。Meta 打造 Glimmer 是為了「常駐式本地代理工作流程」——一個駐留在你機器上的代理,可以呼叫工具、遵循多步驟計畫、在工具呼叫失敗時恢復而不是就此停止,並可調高或調低推理強度。其目標工作是那些不起眼的任務:本地編碼、函式呼叫、行程管理、檔案整理、以 LLM 作為評審的評估。它相容於 OpenClaw 等代理編排框架,許多人實際上就是透過這種方式來運行它。
硬體部分是這套論述的另一半。在全精度下,30B 模型需要超過 55GB 的記憶體;Meta 的約 4-bit 量化將其降至大約 17–20GB,這適合 24GB 或 32GB 的消費級顯示卡(以 RTX 5090 為參考),也適合配備統一記憶體的高階 Mac。一個推測解碼輔助模型——Meta 稱之為 DFlash 的小型伴隨模型——能加速生成:Meta 報告在 RTX 5090 上約為 3.1 倍(在 llama.cpp 中從每秒 74.9 個 token 提升至 233 個),在 M5 Max 上為 1.8 倍,在 M4 Max 上為 1.5 倍,而後者的統一記憶體已較不受頻寬限制。
為什麼這個版本的意義超越了規格表
那則推文大致說對了。自 2025 年春季推出 Llama 4 以來,Meta 在開放權重方面一直保持沉默,{{1}}退回由 Meta Superintelligence Labs 與首席人工智慧官 Alexandr Wang 主導的專有前沿路線{{/1}}。Muse Glimmer 是對開放權重策略的公開回歸——正是這項策略讓 Llama 成為 AI 領域下載量最高的模型家族——而且這次回歸伴隨迄今最強烈的意圖信號:{{2}}祖克柏在發布之際同步發表了一篇 14 頁的文章《未來屬於每個人》,主張真正的 AI 風險在於權力集中,而開放權重正是美國與中國開源模型實驗室保持競爭力的關鍵{{/2}}。他呼籲美國放寬對開源 AI 的監管,Meta 也宣布成立 10 億美元的「未來屬於每個人基金」。{{3}}Meta 並表示計畫在「未來幾週內」發布規模更大的 Muse Spark 1.2 的權重{{/3}}。
That context changes how you should read the benchmark table. This is not a research-lab curiosity shipping quietly; it is a strategy statement with a model attached. Glimmer is the "cheap local agent" position in Meta's lineup, deliberately undercutting the argument that serious agentic work requires a cloud API. Whether it actually delivers that is exactly what the verification question is about.

「煙燻」標示,逐列檢視
Meta的表格將Muse Glimmer與Gemma4-31B和Qwen3.6-27B在24行基準測試中進行比較。在其宣稱最大勝出的地方,模式一致:通用智能體推理與搜尋。
• MCP-Atlas(代理工具使用)— Muse Glimmer 75.5、Gemma4-31B 54.2、Qwen3.6-27B 62.5。這是標題行,也是該組中差距最大的一項。
• DeepSearch QA — 74.6 對比 61.7 和 71.1。
• GAIA2(通用助理)— 43.3 對比 36.4 和 40.0。
• WildClawBench(代理套件)— 47.6 對比 37.6 和 43.2。
• SWE-Bench Pro — 51.2 對比 36.9 和 50.2。注意第三個數字:50.2 是 Meta 自己對 Qwen3.6-27B 的測量結果,而阿里巴巴自己公布的數字是 53.5。同一個模型,兩個不同的分數,取決於誰來運行。
• AIME 2026 — 94.7,IFBench 77.0,以及 AA-LCR 80.0,對比 Gemma 的 68.3。
那是一列強勁的數據。但這張表格並非全盤皆贏,Muse Glimmer 落敗的列與其勝出的列一樣具有參考價值。Qwen3.6-27B 在實際電腦操作與高度依賴終端機的工作上佔據主導地位:SWE-Bench Verified 以 77.2 比 Glimmer 的 76.0,OSWorld-Verified 以 75.6 比 65.9,TerminalBench 2.1 以 60.7 比 51.7,此外在多模態測試如 ScreenSpot Pro、OmniDocBench 和 MMMU-Pro 上也持續保有優勢。至於 Gemma4-31B,則在 Meta 報告的兩項安全指標上取得較佳紀錄——在 CI Memories 上違規率最低,在 Siren AgentDojo 上攻擊成功率也最低——並在狹義的推理測試(GPQA Diamond、Humanity's Last Exam)中略勝一籌。
直白地說,Meta 的說法是「在大多數智能體基準測試上擊敗其他兩者」,而在它自己的表格上,這大致屬實。關鍵在於那些附帶條件。Meta 自己跑了每一行,並承認它對競爭對手模型的測試設定並未像對自己的一樣進行調校。這並非詐欺指控——未經調校的對手設定在業界是常見甚至可預期的缺失——但這正是廠商自製比較表需要獨立確認的原因。上述 Qwen SWE-Bench Pro 的差異正是整個問題的縮影。
獨立記分板顯示的內容
Artificial Analysis 尚未列出 Muse Glimmer——該模型才推出數天,而 AA 的指數是基於其自身運行所建立,這需要時間。但 AA 確實有追蹤兩款競爭對手,這為你呈現了這名新進者所聲稱要進入的實測領域。截至目前的指數,Qwen3.6-27B 的智能指數為 46,AA 描述其為 150B 參數以下最智能的開放權重模型;Gemma4-31B 則為 39。這些是獨立數據,而非廠商宣稱。
這份獨立分析也揭示了標題數字所隱藏的成本問題。AA的效率數據顯示,Qwen3.6-27B每秒約生成54.6個token,而Gemma4-31B為34.8個;其中Gemma的time-to-first-token更快——但Qwen運行完整索引所需的輸出token量約為Gemma的3.7倍,這使得端到端評估成本約高出21倍。在真實世界中,即使基準測試分數更優,消耗更多token的模型實際上更昂貴,而這是任何廠商表格都不會主動提供的決策參考。
因此,截至撰寫本文時,世界的真實狀況是:一個強而有力的廠商報告結果,尚未有針對 Muse Glimmer 的獨立結果,以及一個獨立衡量並按任務劃分的競爭領域。「碾壓 Gemma 和 Qwen」是一個站得住腳的說法;它尚未成為經證實的結果。值得關注的驗證指標是 AA 索引條目、LMArena Elo 以及社群重現——這些通常會在此類發布後的幾週內出現。

實際營運要花多少錢
Muse Glimmer 是免費的——採用 Apache 2.0 授權,不收取每個 token 的費用,也無需向 Meta 付費。真正的成本在於你投入的硬體。一個 4 位元 30B 模型需要約 17–20GB 的常駐記憶體,還需要空間容納 KV 快取、感知編碼器和 DFlash 草稿模型,這正是 Meta 官方建議配備 24GB 或 32GB 顯示卡、或高階 Mac 的原因。如果你擁有這類硬體,運行一個常駐的本機端代理的邊際成本基本上就是電費。如果沒有,一塊 24GB GPU 或一台頂規 M 系列 Mac 就是一筆不小的開支——而自 8 月 9 日起,出現了第三個選項:租用。首批託管 API 清單已於當日上線,Muse Glimmer 的市場定價為每百萬輸入 tokens 0.35 美元、每百萬輸出 tokens 1.50 美元,上下文視窗為 131K。這是供應商在市場上列的費率,而非 Meta 的定價,但如果你不想購買硬體,這正是你今天實際需要支付的金額。
那是一場值得仔細進行的比較,因為「開放權重、零價格」與「託管 API、按 token 計價」是以非常不同的條件交鋒。當你把數字算出來時,雙方都要誠實計價。在我們 OrcaRouter 這邊,你看到的 200+ 託管模型中任何一個的價格,都是供應商列表價格以 0% 加成直接轉傳,因此供應商的降價當天就會在此生效,而不是經過利潤率重新計算之後——這使得本機與託管之間的比較成為一個直接的比較。Muse Glimmer 本身還不在那 200+ 個模型之中,所以該轉傳機制今天還不適用於它。但重點在於這套紀律:為一個未經驗證的開放權重模型定價的方式,是你自己的流量,而不是供應商的價格表,而路由 DSL 的存在,正是為了在模型被放到你可呼叫的 API 背後時,執行那樣的比較。
你本週實際上會如何使用它
由於它以開放權重形式發布,「存取」不是註冊——而是下載。基礎儲存庫是 Hugging Face 上的 meta-models/Muse-Glimmer-30B,已有 GGUF 變體發布,量化變體也正由第三方陸續推出。首日運行時支援包括 llama.cpp、MLX 和 ExecuTorch,發布後數日內也相繼整合了 Ollama、LM Studio、vLLM 和 SGLang,並列出了針對 AMD、Arm、Dell、Intel 和 Nvidia 的硬體最佳化工作。對大多數人來說,實際的做法是:拉取 GGUF,在 llama.cpp 或本機執行器中載入,然後將代理程式骨架指向它。Meta 本身沒有為 Glimmer 提供公開 API,而本機路徑正是該模型圍繞設計的核心——但託管路徑已不再是假設:第三方平台已於 8 月 9 日開始提供服務,因此「下載並執行」和「呼叫 API」現在都是可行的選項。
關於我們,有一點誠實的說明:Muse Glimmer 目前仍無法透過 OrcaRouter 使用。我們路由的是託管 API,而截至本次更新,該模型尚未進入我們的目錄——零加成與一把金鑰搞定一切的優惠,適用於我們確實路由的 200 多個模型,而這一個還不在其中。一旦它加入,能存取目錄其餘模型的那把金鑰,無需新合約就能存取它;而自動故障轉移機制,正是讓我們能安全地將真實流量導向一個全新、由供應商回報、還沒有獨立實績紀錄的模型的原因。這也是路由 DSL 存在的同一個理由:一個未經驗證的模型,應該靠你的資料贏得進入生產環境的路徑,而不是靠它自己的新聞稿。
下方的截圖是 Hugging Face 卡片在發布當天的內容——其中「未由任何推論供應商部署」這行字指的是 Hugging Face 自身的第一方推論,這與 8 月 9 日上線的第三方託管 API 列表是兩回事。

看什麼
有三件事會為這個故事定案,依速度粗略排序。首先,是承諾中的 Muse Spark 1.2 開放權重版本釋出——如果這個教師模型在「未來幾週內」如期推出,Glimmer 就不再只是曇花一現,而是完整開放權重產品線的開端;這才是「Meta 回來了」的真正戰略意涵。其次,是獨立評測:Artificial Analysis 指數條目、LMArena 榜單位次,以及社群的重現實驗,會告訴你「24 項中勝出 19 項」的說法,在與非 Meta 人士的檢驗接觸後是否依然成立。第三,是託管浪潮——這波已經開始了。各家服務商已於 8 月 9 日開始提供 Glimmer,所以「本機 vs. 託管」的問題,如今已成為你靠一組 API 金鑰就能實際做出的選擇;接下來要觀察的是,託管服務的普及範圍會擴大到什麼程度,以及上市首週的新鮮感退去之後,每 token 的價格會如何變化。
這則推文對新聞的判斷是對的。至於它對判決的判斷是否正確——那是需要數週才能回答的問題,而目前誠實的立場是,Meta 以外還沒有任何人跑過足夠的測試來得知答案。已經確定的是,一個 30B 參數、採用 Apache-2.0 授權、能跑在消費級 GPU 上、並獲得完整戰略推力的代理模型,無論其獨立評分最終如何,都是一個值得圍繞它規劃的發佈。
真正值得回答的問題
Muse Glimmer 真的是開放原始碼的嗎?
它在寬鬆的 Apache 2.0 授權下開放權重——任何人都可以下載、修改、微調並商業化部署,無需向 Meta 付費。這裡刻意使用「開放權重」而非 OSI 意義上的完全開源,因為訓練資料、Muse Spark 教師模型的權重,以及部分工具並未包含在內。就實際用途而言——你可以執行它、發布它,並在其之上銷售產品——這正是讓 Llama 成為 AI 領域中部署最廣泛的開放模型家族的那套模式。
Muse Glimmer 真的能擊敗 Gemma4-31B 和 Qwen3.6-27B 嗎?
{{1}}在Meta自家的榜單上{{/1}},{{2}}在多數智能體與搜尋基準上確實如此,但前提是Meta自己執行了比較,且未針對對手的配置進行調校{{/2}}。{{3}}更誠實的圖景其實更為具體:{{/3}}{{4}}Meta在智能體推理類別勝出,Qwen3.6-27B在實際電腦操作、終端任務及多數多模態測試中領先,而Gemma4-31B則交出更好的安全紀錄{{/4}}。{{5}}截至發布當日,Muse Glimmer完全沒有任何獨立指數條目,因此在其他人實際執行之前,請將「24項中19項」的宣稱視為廠商自報數據{{/5}}。
我可以在筆記型電腦上執行它嗎?
唯有當「laptop」指的是配備 24GB 或 32GB 獨立 GPU 的筆電,或是擁有足夠統一記憶體的高階 M 系列 Mac 時才成立——4-bit 的 Muse Glimmer 大約需要 17–20GB,再加上 KV cache、感知編碼器與 DFlash drafter 所需的餘裕空間。對大多數人來說,這是一筆實實在在的開銷,也是「免費」模型背後隱藏的成本。若使用內建顯示晶片或 16GB 的機器,你面對的會是重度量化與緩慢的輸出,而非該版本以之為核心打造的常駐代理。
我在哪裡可以取得它——它在API上嗎?
權重已上傳至 Hugging Face 的 meta-models/Muse-Glimmer-30B(附 GGUF 變體),你可以透過 llama.cpp、MLX、ExecuTorch,或目前正在整合它的本地執行器在本機執行。自 8 月 9 日起,第三方平台也已提供託管 API 存取,定價為每百萬輸入 token 0.35 美元、每百萬輸出 token 1.50 美元——因此你不再需要擁有 24GB 的 GPU 才能呼叫它。Meta 本身仍未為 Glimmer 提供公開 API,它也尚未登上 OrcaRouter。當它進入我們目錄時,用於存取目錄其餘部分的同一把金鑰也能夠存取它;在此之前,兩條誠實可行的路徑是本地推理或第三方託管平台。
