生成的主視覺卡片,標題為 Claude Sonnet 5.5 對決 Muse Glimmer,副標題為一款 30B 筆電模型對上新版 Sonnet,並有三張數據卡:智慧指數 56 對 17、上下文視窗 1M 對 131K tokens,以及權重封閉對 Apache 2.0,頁尾寫著「指數依據 Artificial Analysis v4.3.2;Muse Glimmer 規格依據 Meta」。
Guides & Insights

Claude Sonnet 5.5 對決 Muse Glimmer:一款 30B 筆電模型迎戰新版 Sonnet

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

本頁的框架問題在於:這樣的比較究竟是否成立;而誠實的答案是,Claude Sonnet 5.5與Muse Glimmer並非一般意義上的競爭對手。在 Artificial Analysis 的 Intelligence Index(修訂版 v4.3.2)上,Claude Sonnet 5.5 得分 56,Muse Glimmer 得分 17,而這道差距並非雜訊——它大致相當於一個前沿通用模型與一個非常優秀的小型模型之間的距離。不過,這個組合之所以仍值得一讀,是因為 Muse Glimmer 具備一項對方無論出多少錢都買不到的特性:它是個 300 億參數的開放權重模型,由 Meta 於 2026 年 8 月 10 日在 Apache 2.0 授權下發布,量化至 4 位元後可塞進 20 GB 以下的 VRAM,並且設計成在拔掉網路的情況下也能運行。Claude Sonnet 5.5 則於 2026 年 9 月 28 日登場,是該廠商最快也最聰明的 Sonnet,定價為每百萬輸入權杖 2.00 美元、每百萬輸出權杖 10.00 美元,且只能透過網路存取。真正的決定不在於哪個模型更好,而在於你想讓這些權杖在哪裡運行。

兩種模式,兩種職責定義

Muse Glimmer 出自 Meta Superintelligence Labs,是一款 300 億參數的模型,透過從 Meta 更大的 Muse Spark 教師模型進行 logit 蒸餾訓練而成,接著以長上下文代理式資料進行微調,並針對工具使用進行強化訓練。Meta 出貨時便已將其量化:4 位元把記憶體佔用量從全精度下的逾 55 GB 降至 20 GB 以下,這正是讓它能納入 24 GB 或 32 GB 消費級 GPU 範圍的原因。Meta 在 Nvidia RTX 5090 以及 Apple M4 Max 與 M5 Max 晶片上對其進行測試。它接受文字與圖像輸入、回傳文字,執行 131,072 個 token 的上下文視窗(Meta 表示可延伸至 262,144),並帶有 2026 年 1 月的知識截止時間。

Artificial Analysis model page for Muse Glimmer (high), an open-weights model released August 2026, showing an Intelligence Index of 17, an output speed of 143.8 tokens per second, $0.325 per million input tokens and $1.35 per million output tokens, $0.06 per Intelligence Index task, 59M output tokens generated during the Index evaluation, a 131K-token context window and a January 2026 knowledge cutoff.

Claude Sonnet 5.5 是 Anthropic 5.5 世代中的第二款模型,也是該公司定位為其產品陣容中速度與智慧兼具的最佳組合。它具備 1,000,000 個 token 的上下文窗口,同步輸出最高可達 128,000 個 token,而在 Message Batches API 上則可達 300,000 個,須帶上 output-300k-2026-03-24 標頭,可接受文字、圖像與檔案,提供可選擇投入程度的自適應思考,知識截止點為 2026 年 6 月,且自推出起即提供零資料保留。快取讀取的儲存費用為每百萬 token 0.20 美元,快取寫入則為每百萬 token 2.50 美元。Anthropic 表示,它比 Claude Sonnet 5 快 30%,且在費率不變的情況下,每項任務的成本最多可降低 30%——此為供應商說法,未經獨立驗證。

規格對比值得一口氣看完,因為幾乎每一行都是不同類型的東西,而不是誰比誰更好或更壞:

• 權重 — Muse Glimmer Apache 2.0,可下載,量化為 4-bit,相較於 Claude Sonnet 5.5 封閉

• 執行位置 —— Muse Glimmer 在你自己的 GPU 上離線執行,對比 Claude Sonnet 5.5 在 A​nthropic 基礎設施上運行

• 參數量 — Muse Glimmer 共 30B,4 位元下不到 20 GB,相較於 Claude Sonnet 5.5 則未公開

• 上下文 — Muse Glimmer 131,072 詞元,可擴展至 262,144,對比 Claude Sonnet 5.5 的 1,000,000 詞元

• 每百萬價格 — Muse Glimmer 不按 token 收費,你的硬體 vs Claude Sonnet 5.5 每百萬 $2.00 輸入/$10.00 輸出

• 智慧指數 v4.3.2 — Muse Glimmer 17 對 Claude Sonnet 5.5 56

• 依實測,每項 Index 任務的成本 — Muse Glimmer $0.06 對比 Claude Sonnet 5.5 $7.60

那份清單上有兩個數字值得拆解,因為兩者都是陷阱。第一個是每項任務 $0.06 的數字:這是 Artificial Analysis 透過託管端點呼叫 Muse Glimmer (high) 所花費的金額,輸入每百萬 token 為 $0.325、輸出每百萬 token 為 $1.35,因此它衡量的是租用這個模型的經濟效益,而不是運行它的經濟效益。若是自行託管,每個 token 的邊際成本便不復存在,取而代之的是你已經擁有、或必須購買的 GPU。第二個是 Index 落差本身——一個被量化進 20 GB 的 30B 模型,正被用與前沿模型相同的尺規評分,而排行榜也表明了這一點:它把 Muse Glimmer 排在頂尖少數開放權重模型之中,同時指出就其規模而言它很昂貴。

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Muse Glimmer, the scoreboard, contrasting weights closed vs Apache 2.0, where it runs Anthropic infrastructure vs your own GPU offline, parameters undisclosed vs 30B at 4-bit, context window 1,000,000 vs 131,072 tokens, AA Index 56 vs 17, and output speed 138.7 vs 143.8 tokens per second, with a footer reading AA Index and speed per Artificial Analysis v4.3.2; Muse Glimmer specifications per Meta.

Muse Glimmer 真正出色的地方,以及它會在哪些地方翻車

綜合分數實在太過粗略,不足以作為完整答案,因為 Muse Glimmer 並非每一項都只有十七分。它很快——Artificial Analysis 測得每秒 143.8 個輸出 token,領先 Claude Sonnet 5.5 的 138.7——而且簡潔,在 Index 評估中總共產生 59M 個 token,相較之下 Claude Sonnet 5.5 為 410M。而在某一項評估上,它已逼近前沿:長上下文回憶,得分 83.3%,對比 Claude Sonnet 5.5 的 82.7%。一個 30B 模型能在長上下文檢索上與全新的前沿 Sonnet 匹敵,是這一頁最令人驚訝的一行,而這也與 Meta 訓練它的方式一致——長上下文代理式資料,以及從規模大得多的教師模型進行蒸餾。

代理式任務的結果,正是模型能力上限顯露之處,也是排名不再好看的時候。在 Terminal-Bench 4.0 上,Muse Glimmer 得分 0.5%,而 Claude Sonnet 5.5 為 63.6%。其自動化基準測試得分為 0.068,相較之下對手為 0.713。Humanity's Last Exam:22.0% 對上 55.0%。在執行導向基準測試中,如此微小的產出規模意味著該模型並未完成任務,而再怎麼節省本地託管成本,也無法讓一個永遠無法完成的任務變得更便宜。

研究文獻對這件事也直言不諱,而這點值得明說,而不是把它掩蓋起來:一篇經過同儕審查的多代理協作研究——Muse-Glimmer-30B 是受測模型之一——發現它未能找回任何候選項。Meta 自家針對該模型的基準表是廠商文件,在此也如此標示;上方的 Artificial Analysis 數據是獨立量測,而本文所倚重的正是這些數據。

所以這個分野是清晰可辨的。Muse Glimmer 就其規模而言,在閱讀長輸入並針對其回答方面表現強勁,速度快、執行成本低,而且能裝進筆電級 GPU。它不是那種你交給它一項多步驟軟體任務然後就可以撒手不管的模型。這就是誠實的界線,而僅圍繞綜合分數撰寫的比較會掩蓋這一點。

你在前沿費率下實際買到的究竟是什麼

Claude Sonnet 5.5 的溢價首先換來的是能力,而十七點的 Index 差距正是最顯眼的體現。但伴隨 $10.00 輸出費率而來的,還有三件不會出現在任何排行榜上的事。

第一項是視窗。一百萬個 token 大約是 Muse Glimmer 的 131,072 的七倍半,而 Anthropic 對這全部收取標準費率,其中快取讀取的價格是輸入價格的十分之一,因此要在多次呼叫之間帶著大型上下文是負擔得起的,而不只是理論上可行。儲存庫規模的提示詞根本塞不進較小的視窗,所以這是能力上的差異,而不是偏好問題。

第二項是工具保真度。Claude Sonnet 5 與 Claude Sonnet 5.5 之間有五項行為改變,而這五項全都與工具使用和推理有關:非預設的取樣參數現在會回傳 400,thinking: {"type": "disabled"} 現在會回傳 400 並變成 between_tools,強制工具選擇 "any" 或指定具名工具會被拒絕,因此迴圈必須改用 auto 搭配嚴格工具使用,較舊的 computer_20251124 工具在 Claude API 與 Goo​gle Cloud 上會被拒用,而 thinking 區塊現在會綁定到產生它們的模型與帳號。第六項改變不會導致任何失敗,只是變得悄然無聲:工具呼叫之間的文字現在會改在 thinking 區塊內回傳,因此串流應用程式會停止顯示輸出,直到它設定顯示值或關閉預先 thinking 為止。對於任何使用 Sonnet 5 的人來說,這是一天的遷移工作,而這正是換取上方基準測試列所衡量的代理可靠性所必須付出的代價。

第三點是來源與資料處理。自推出起即可提供零資料保留,Anthropic 公布資料保留期限下限為 2027 年 9 月 28 日,而該模型可在 Claude API、Bedrock、Google Cloud 和 Microsoft Foundry 上使用。對受監管的買方而言,這些採購事實會在基準測試之前就決定是否購買。

離線是必要條件,而非節省成本的手段

這個組合之所以該放在同一頁,是因為對某一類特定的部署情境而言,Muse Glimmer 不是更便宜的選項——而是唯一的選項。一個無法離開裝置的請求、一座沒有連線的工廠廠區或野外現場、一個只要呼叫 API 就構成違規的氣隙環境,或是來回一趟就已超出負荷的延遲預算:這些問題都不是靠網路後端更強大的模型就能解決。能塞進 20 GB 以下、離線執行的 Apache 2.0 權重就是全部的答案,而無論價格高低,Claude Sonnet 5.5 都不在這道問題的討論範圍內。

M​eta 針對 RTX 5090 與 Apple M4 Max 及 M5 Max 晶片所公布的測試,是判斷此處「在本機執行」實際含義的實用參考;而 4 位元量化正是讓這些目標得以達成的原因——全精度版本佔用空間超過 55 GB。任何規劃部署的人,都應將這些硬體數據視為 M​eta 公布的數字,而非在本地實測的結果。

對其他人來說,這兩個模型是互補而非替代關係,而實務上最棘手的一點是,同時持有 Anthropic API 模型與自架 Meta 模型,通常意味著兩套完全獨立的技術堆疊。OrcaRouter 把 200 多個模型放在同一個 OpenAI 相容端點後面,以供應商定價原價轉出、不加任何加成,在上游供應商之間自動容錯切換,並提供一套用於組合呼叫的路由 DSL——這涵蓋了那種安排中託管的那一半,而Meta 較大型的 Muse Spark 1.2 teacher 在這裡可以透過 meta/muse-spark-1.2 進行路由,價格為每百萬 token 輸入 $1.25、輸出 $4.25,具備 1,048,576-token 的視窗,快取讀取為 $0.15。它每週透過這份目錄承載 4,280 萬 token 的流量,而這正是這個安排中有用的部分:託管的 teacher 與其他一切共用同一把金鑰,而你在地端執行的模型則完全不必碰觸網路。

三點誠實說明,因為這些很容易弄錯。Muse Glimmer 本身並不是我們的路由之一——我們的目錄中沒有它的模型卡,而本頁如實說明這一點,而不是暗示相反。下方的截圖是確實存在的模型 Muse Spark 1.2 的頁面,它是 Muse Glimmer 蒸餾來源的檢查點,而非 Muse Glimmer 本身。Claude Sonnet 5.5 也不在我們的目錄中,即使發布才過一天;通往它的途徑是 Anthropic 自家的 API,而 自 6 月 30 日起,Claude Sonnet 5 已可在此以 $2.00 和 $10.00 進行路由,供任何想要這個預備目標的人使用。

OrcaRouter model page for meta/muse-spark-1.2, dated 2026-08-05, showing $1.25 input and $4.25 output per million tokens, a p50 time to first token of 2.05 s, a 1,048,576-token context window, and 42.8M tokens of recent traffic.

如何決定

從限制條件出發,而不是從分數出發。如果某個請求不能離開某台機器或某個網路,Muse Glimmer 就是答案,而 Index 差距無關緊要——一個可離線執行、並在長上下文召回上媲美前沿模型的 30B Apache 2.0 模型,對那項工作而言,就是現有最佳選擇。如果某個請求必須完成多步驟軟體任務,那麼一個在 Terminal-Bench 上只拿到半個百分點的 30B 模型,無論你已經擁有什麼硬體,都不在考慮之列。

在這兩個極端之間,決定勝負的是量測而非意見:以你自己工作負載中每完成一項任務所耗用的 token 數來衡量,並計算兩種價格——一種是 Claude Sonnet 5.5 的 $2.00 與 $10.00,另一種是 GPU 的攤銷成本。真正讓整個比較改觀的那個數字——每項 Index 任務 $0.06 對比 $7.60——其實是託管租用方案的數字,而大多數人會自行運行這個模型;若把它當成同類比較下的節省來引用,就會是這頁存在的目的所要避免的輕率錯誤。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新