Muse Glimmer 標題卡片:Meta 的 30B 開放權重代理模型,專為本地 GPU 設計,帶有顯示 Apache 2.0 的標籤、適用於 24-32 GB GPU,以及從 Muse Spark 1.2 蒸餾而來。
Guides & Insights

Muse Glimmer:Meta 的 30B 開源權重代理模型聲稱擊敗 Gemma4-31B 和 Qwen3.6-27B

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年8月10日上午的一篇X貼文比任何新聞稿都更直白地說道:「神聖的Meta回來了。」該貼文所回應的發布——Muse Glimmer,Meta自Llama 4以來首個開放權重模型——於同一天推出,而Meta自己的公告也幾乎與那則推文一樣強勢。這個300億參數模型的基準測試表聲稱,它在24項中有19項擊敗Go​ogle的Gemma4-31B,在24項中有14項擊敗阿里巴巴的Qwen3.6-27B,其中以代理式基準MCP-Atlas最為突出,Meta報告的分數為75.5,而另外兩者分別為54.2和62.5。

在「smoked(碾壓)」成為你腦中的既定事實之前,先注意這些數字是誰產出的。Meta 表格中的每一項分數,都是 Meta 自己跑出來的;而那些對手模型的設定,Meta 自己也承認並未加以調校。Muse Glimmer 在 Artificial Analysis 上尚無任何紀錄;Artificial Analysis 是獨立排行榜,專門追蹤這個精確的尺寸級別——目前 Qwen3.6-27B 的智能指數為 46,Gemma4-31B 則為 39。因此,這裡其實同時有兩個故事:Meta 一次真正舉足輕重的開放權重釋出,以及一項需要數週才能驗證的基準測試宣稱。本文將兩者分開處理。

Muse Glimmer 實際上是什麼

Muse Glimmer 是一個 30B 稠密多模態模型——透過專用感知編碼器同時處理文字與影像輸入——在超過 100 種語言上訓練,並以寬鬆的 Apache 2.0 授權釋出。其權重可在 Hugging Face 的 meta-models/Muse-Glimmer-30B 取得。它是 Meta 更大型專有旗艦模型 Muse Spark 1.2 的蒸餾版本,訓練配方也印證了這點:在預訓練階段從教師模型進行 logit 蒸餾,在中期訓練使用較長上下文與代理密集型資料,隨後進行監督式微調,並結合 on-policy 蒸餾與強化學習。

這份產品簡報與其技術本身一樣具體。Meta 打造 Glimmer 是為了「常駐式本地代理工作流程」——一個駐留在你機器上的代理,可以呼叫工具、遵循多步驟計畫、在工具呼叫失敗時恢復而不是就此停止,並可調高或調低推理強度。其目標工作是那些不起眼的任務:本地編碼、函式呼叫、行程管理、檔案整理、以 LLM 作為評審的評估。它相容於 OpenClaw 等代理編排框架,許多人實際上就是透過這種方式來運行它。

硬體部分是這套論述的另一半。在全精度下,30B 模型需要超過 55GB 的記憶體;Meta 的約 4-bit 量化將其降至大約 17–20GB,這適合 24GB 或 32GB 的消費級顯示卡(以 RTX 5090 為參考),也適合配備統一記憶體的高階 Mac。一個推測解碼輔助模型——Meta 稱之為 DFlash 的小型伴隨模型——能加速生成:Meta 報告在 RTX 5090 上約為 3.1 倍(在 llama.cpp 中從每秒 74.9 個 token 提升至 233 個),在 M5 Max 上為 1.8 倍,在 M4 Max 上為 1.5 倍,而後者的統一記憶體已較不受頻寬限制。

為什麼這個版本的意義超越了規格表

那則推文大致說對了。自 2025 年春季推出 Llama 4 以來,Meta 在開放權重方面一直保持沉默,{{1}}退回由 Meta Superintelligence Labs 與首席人工智慧官 Alexandr Wang 主導的專有前沿路線{{/1}}。Muse Glimmer 是對開放權重策略的公開回歸——正是這項策略讓 Llama 成為 AI 領域下載量最高的模型家族——而且這次回歸伴隨迄今最強烈的意圖信號:{{2}}祖克柏在發布之際同步發表了一篇 14 頁的文章《未來屬於每個人》,主張真正的 AI 風險在於權力集中,而開放權重正是美國與中國開源模型實驗室保持競爭力的關鍵{{/2}}。他呼籲美國放寬對開源 AI 的監管,Meta 也宣布成立 10 億美元的「未來屬於每個人基金」。{{3}}Meta 並表示計畫在「未來幾週內」發布規模更大的 Muse Spark 1.2 的權重{{/3}}。

That context changes how you should read the benchmark table. This is not a research-lab curiosity shipping quietly; it is a strategy statement with a model attached. Glimmer is the "cheap local agent" position in Meta's lineup, deliberately undercutting the argument that serious agentic work requires a cloud API. Whether it actually delivers that is exactly what the verification question is about.

Three-way scoreboard comparing Muse Glimmer, Gemma4-31B and Qwen3.6-27B: MCP-Atlas 75.5/54.2/62.5, DeepSearch QA 74.6/61.7/71.1, GAIA2 43.3/36.4/40.0, SWE-Bench Pro 51.2/36.9/50.2, TerminalBench 2.1 51.7/--/60.7, and AA Intelligence Index --/39/46. Footer: rows 1-5 vendor-reported by Meta; AA Index per Artificial Analysis (no Muse Glimmer entry yet).

「煙燻」標示,逐列檢視

Meta的表格將Muse Glimmer與Gemma4-31B和Qwen3.6-27B在24行基準測試中進行比較。在其宣稱最大勝出的地方,模式一致:通用智能體推理與搜尋。

• MCP-Atlas(代理工具使用)— Muse Glimmer 75.5、Gemma4-31B 54.2、Qwen3.6-27B 62.5。這是標題行,也是該組中差距最大的一項。

• DeepSearch QA — 74.6 對比 61.7 和 71.1。

• GAIA2(通用助理)— 43.3 對比 36.4 和 40.0。

• WildClawBench(代理套件)— 47.6 對比 37.6 和 43.2。

• SWE-Bench Pro — 51.2 對比 36.9 和 50.2。注意第三個數字:50.2 是 Meta 自己對 Qwen3.6-27B 的測量結果,而阿里巴巴自己公布的數字是 53.5。同一個模型,兩個不同的分數,取決於誰來運行。

• AIME 2026 — 94.7,IFBench 77.0,以及 AA-LCR 80.0,對比 Gemma 的 68.3。

那是一列強勁的數據。但這張表格並非全盤皆贏,Muse Glimmer 落敗的列與其勝出的列一樣具有參考價值。Qwen3.6-27B 在實際電腦操作與高度依賴終端機的工作上佔據主導地位:SWE-Bench Verified 以 77.2 比 Glimmer 的 76.0,OSWorld-Verified 以 75.6 比 65.9,TerminalBench 2.1 以 60.7 比 51.7,此外在多模態測試如 ScreenSpot Pro、OmniDocBench 和 MMMU-Pro 上也持續保有優勢。至於 Gemma4-31B,則在 Meta 報告的兩項安全指標上取得較佳紀錄——在 CI Memories 上違規率最低,在 Siren AgentDojo 上攻擊成功率也最低——並在狹義的推理測試(GPQA Diamond、Humanity's Last Exam)中略勝一籌。

直白地說,Meta 的說法是「在大多數智能體基準測試上擊敗其他兩者」,而在它自己的表格上,這大致屬實。關鍵在於那些附帶條件。Meta 自己跑了每一行,並承認它對競爭對手模型的測試設定並未像對自己的一樣進行調校。這並非詐欺指控——未經調校的對手設定在業界是常見甚至可預期的缺失——但這正是廠商自製比較表需要獨立確認的原因。上述 Q​wen SWE-Bench Pro 的差異正是整個問題的縮影。

獨立記分板顯示的內容

Artificial Analysis 尚未列出 Muse Glimmer——該模型才推出數天,而 AA 的指數是基於其自身運行所建立,這需要時間。但 AA 確實有追蹤兩款競爭對手,這為你呈現了這名新進者所聲稱要進入的實測領域。截至目前的指數,Qwen3.6-27B 的智能指數為 46,AA 描述其為 150B 參數以下最智能的開放權重模型;Gemma4-31B 則為 39。這些是獨立數據,而非廠商宣稱。

這份獨立分析也揭示了標題數字所隱藏的成本問題。AA的效率數據顯示,Qwen3.6-27B每秒約生成54.6個token,而Gemma4-31B為34.8個;其中Ge​mma的time-to-first-token更快——但Q​wen運行完整索引所需的輸出token量約為Ge​mma的3.7倍,這使得端到端評估成本約高出21倍。在真實世界中,即使基準測試分數更優,消耗更多token的模型實際上更昂貴,而這是任何廠商表格都不會主動提供的決策參考。

因此,截至撰寫本文時,世界的真實狀況是:一個強而有力的廠商報告結果,尚未有針對 Muse Glimmer 的獨立結果,以及一個獨立衡量並按任務劃分的競爭領域。「碾壓 Ge​mma 和 Q​wen」是一個站得住腳的說法;它尚未成為經證實的結果。值得關注的驗證指標是 AA 索引條目、LMArena Elo 以及社群重現——這些通常會在此類發布後的幾週內出現。

Screenshot of Artificial Analysis' Small Open Source Models comparison page, showing the 4B-40B open-weight class with Openness and Intelligence index columns and the header noting that Qwen3.6-27B and Qwen3.5-27B are the highest-intelligence small open-source models.

實際營運要花多少錢

Muse Glimmer 是免費的——採用 Apache 2.0 授權,不收取每個 token 的費用,也無需向 Meta 付費。真正的成本在於你投入的硬體。一個 4 位元 30B 模型需要約 17–20GB 的常駐記憶體,還需要空間容納 KV 快取、感知編碼器和 DFlash 草稿模型,這正是 Meta 官方建議配備 24GB 或 32GB 顯示卡、或高階 Mac 的原因。如果你擁有這類硬體,運行一個常駐的本機端代理的邊際成本基本上就是電費。如果沒有,一塊 24GB GPU 或一台頂規 M 系列 Mac 就是一筆不小的開支——而自 8 月 9 日起,出現了第三個選項:租用。首批託管 API 清單已於當日上線,Muse Glimmer 的市場定價為每百萬輸入 tokens 0.35 美元、每百萬輸出 tokens 1.50 美元,上下文視窗為 131K。這是供應商在市場上列的費率,而非 Meta 的定價,但如果你不想購買硬體,這正是你今天實際需要支付的金額。

那是一場值得仔細進行的比較,因為「開放權重、零價格」與「託管 API、按 token 計價」是以非常不同的條件交鋒。當你把數字算出來時,雙方都要誠實計價。在我們 OrcaRouter 這邊,你看到的 200+ 託管模型中任何一個的價格,都是供應商列表價格以 0% 加成直接轉傳,因此供應商的降價當天就會在此生效,而不是經過利潤率重新計算之後——這使得本機與託管之間的比較成為一個直接的比較。Muse Glimmer 本身還不在那 200+ 個模型之中,所以該轉傳機制今天還不適用於它。但重點在於這套紀律:為一個未經驗證的開放權重模型定價的方式,是你自己的流量,而不是供應商的價格表,而路由 DSL 的存在,正是為了在模型被放到你可呼叫的 API 背後時,執行那樣的比較。

你本週實際上會如何使用它

由於它以開放權重形式發布,「存取」不是註冊——而是下載。基礎儲存庫是 Hugging Face 上的 meta-models/Muse-Glimmer-30B,已有 GGUF 變體發布,量化變體也正由第三方陸續推出。首日運行時支援包括 llama.cpp、MLX 和 ExecuTorch,發布後數日內也相繼整合了 Ollama、LM Studio、vLLM 和 SGLang,並列出了針對 AMD、Arm、Dell、Intel 和 Nvidia 的硬體最佳化工作。對大多數人來說,實際的做法是:拉取 GGUF,在 llama.cpp 或本機執行器中載入,然後將代理程式骨架指向它。Meta 本身沒有為 Glimmer 提供公開 API,而本機路徑正是該模型圍繞設計的核心——但託管路徑已不再是假設:第三方平台已於 8 月 9 日開始提供服務,因此「下載並執行」和「呼叫 API」現在都是可行的選項。

關於我們,有一點誠實的說明:Muse Glimmer 目前仍無法透過 OrcaRouter 使用。我們路由的是託管 API,而截至本次更新,該模型尚未進入我們的目錄——零加成與一把金鑰搞定一切的優惠,適用於我們確實路由的 200 多個模型,而這一個還不在其中。一旦它加入,能存取目錄其餘模型的那把金鑰,無需新合約就能存取它;而自動故障轉移機制,正是讓我們能安全地將真實流量導向一個全新、由供應商回報、還沒有獨立實績紀錄的模型的原因。這也是路由 DSL 存在的同一個理由:一個未經驗證的模型,應該靠你的資料贏得進入生產環境的路徑,而不是靠它自己的新聞稿。

下方的截圖是 Hugging Face 卡片在發布當天的內容——其中「未由任何推論供應商部署」這行字指的是 Hugging Face 自身的第一方推論,這與 8 月 9 日上線的第三方託管 API 列表是兩回事。

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the line that the model is not deployed by any inference provider.

看什麼

有三件事會為這個故事定案,依速度粗略排序。首先,是承諾中的 Muse Spark 1.2 開放權重版本釋出——如果這個教師模型在「未來幾週內」如期推出,Glimmer 就不再只是曇花一現,而是完整開放權重產品線的開端;這才是「Meta 回來了」的真正戰略意涵。其次,是獨立評測:Artificial Analysis 指數條目、LMArena 榜單位次,以及社群的重現實驗,會告訴你「24 項中勝出 19 項」的說法,在與非 Meta 人士的檢驗接觸後是否依然成立。第三,是託管浪潮——這波已經開始了。各家服務商已於 8 月 9 日開始提供 Glimmer,所以「本機 vs. 託管」的問題,如今已成為你靠一組 API 金鑰就能實際做出的選擇;接下來要觀察的是,託管服務的普及範圍會擴大到什麼程度,以及上市首週的新鮮感退去之後,每 token 的價格會如何變化。

這則推文對新聞的判斷是對的。至於它對判決的判斷是否正確——那是需要數週才能回答的問題,而目前誠實的立場是,Meta 以外還沒有任何人跑過足夠的測試來得知答案。已經確定的是,一個 30B 參數、採用 Apache-2.0 授權、能跑在消費級 GPU 上、並獲得完整戰略推力的代理模型,無論其獨立評分最終如何,都是一個值得圍繞它規劃的發佈。

真正值得回答的問題

Muse Glimmer 真的是開放原始碼的嗎?

它在寬鬆的 Apache 2.0 授權下開放權重——任何人都可以下載、修改、微調並商業化部署,無需向 Meta 付費。這裡刻意使用「開放權重」而非 OSI 意義上的完全開源,因為訓練資料、Muse Spark 教師模型的權重,以及部分工具並未包含在內。就實際用途而言——你可以執行它、發布它,並在其之上銷售產品——這正是讓 Llama 成為 AI 領域中部署最廣泛的開放模型家族的那套模式。

Muse Glimmer 真的能擊敗 Gemma4-31B 和 Qwen3.6-27B 嗎?

{{1}}在Meta自家的榜單上{{/1}},{{2}}在多數智能體與搜尋基準上確實如此,但前提是Meta自己執行了比較,且未針對對手的配置進行調校{{/2}}。{{3}}更誠實的圖景其實更為具體:{{/3}}{{4}}Meta在智能體推理類別勝出,Qwen3.6-27B在實際電腦操作、終端任務及多數多模態測試中領先,而Gemma4-31B則交出更好的安全紀錄{{/4}}。{{5}}截至發布當日,Muse Glimmer完全沒有任何獨立指數條目,因此在其他人實際執行之前,請將「24項中19項」的宣稱視為廠商自報數據{{/5}}。

我可以在筆記型電腦上執行它嗎?

唯有當「laptop」指的是配備 24GB 或 32GB 獨立 GPU 的筆電,或是擁有足夠統一記憶體的高階 M 系列 Mac 時才成立——4-bit 的 Muse Glimmer 大約需要 17–20GB,再加上 KV cache、感知編碼器與 DFlash drafter 所需的餘裕空間。對大多數人來說,這是一筆實實在在的開銷,也是「免費」模型背後隱藏的成本。若使用內建顯示晶片或 16GB 的機器,你面對的會是重度量化與緩慢的輸出,而非該版本以之為核心打造的常駐代理。

我在哪裡可以取得它——它在API上嗎?

權重已上傳至 Hugging Face 的 meta-models/Muse-Glimmer-30B(附 GGUF 變體),你可以透過 llama.cpp、MLX、ExecuTorch,或目前正在整合它的本地執行器在本機執行。自 8 月 9 日起,第三方平台也已提供託管 API 存取,定價為每百萬輸入 token 0.35 美元、每百萬輸出 token 1.50 美元——因此你不再需要擁有 24GB 的 GPU 才能呼叫它。Meta 本身仍未為 Glimmer 提供公開 API,它也尚未登上 OrcaRouter。當它進入我們目錄時,用於存取目錄其餘部分的同一把金鑰也能夠存取它;在此之前,兩條誠實可行的路徑是本地推理或第三方託管平台。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube