
Muse Glimmer 在單張 RTX 5090 上達到 230 Tokens/s:SGLang 首日支援才是真正的發布重點
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
每秒兩百三十個 token,對任何模型來說都是很快的數字。對於 Muse Glimmer —— Meta Superintelligence Labs 釋出的 30B 密集、開放權重模型,於 2026 年 8 月 10 日以 Apache 2.0 授權發布 —— 這個數字正是區分「能跑在我的 GPU 上」與「足以服務真正的代理程式」的關鍵門檻。SGLang 在權重上線當天就宣布對 Muse Glimmer 的 day-0 支援,其公佈的數據顯示,在單張 GeForce RTX 5090 上,啟用 NVFP4 量化與 Meta 的 DFlash 推測解碼草稿模型時,batch 1 情境下每位使用者可達每秒 236.4 個 token。
那一張圖表就承載了這次發佈的大部分敘事,但其餘內容也值得放慢腳步細看,因為有趣之處不在於主打的速度。有趣的是,這個模型在 RTX PRO 6000、NVIDIA DGX Spark 上,以及透過 MLX 在 Apple silicon 上都能開箱即用——而且 SGLang 稱這項工作是與 Meta Superintelligence Labs 的合作成果,而非社群事後補上的附加品。這是 Meta 許久以來第一個以伺服堆疊為中心設計、而不只是圍繞權重設計的接近前沿等級的模型。
「day-0 support」在這裡的真正含義是什麼
SGLang v0.5.17 的 Day-0 支援意味著該模型並非事後才硬補上去的:運行時的工作與權重在相同的發布週期內一起落地,並為 Meta 實際鎖定的硬體打造了專用路徑。SGLang 的 SM120 後端涵蓋 Blackwell 桌面與工作站產品線——RTX 5090、RTX PRO 6000 與 DGX Spark 皆執行同一條優化路徑——而 Apple 矽晶片則獲得原生 MLX 後端,而非緩慢的移植版本。
SGLang 和 Meta 所調校的技術棧是特定的。模型以 18GB NVFP4 檢查點的形式運行,搭配一個 5GB BF16 DFlash 草稿模型,這是 Meta 為 Muse Glimmer 訓練的推測解碼伴隨模型。這個組合可以輕鬆放入 32GB 顯示卡內,還有餘裕,而整個 NVFP4 加上 MXFP8 的混合量化路徑,常駐記憶體約為 19.5GB。在 SGLang 方面,發行說明中提到了三種可靠性機制,作為同一敘事的一部分:DFlash 推測解碼、用於前綴快取的 RadixAttention,以及可中斷的 CUDA graphs。
這個數字,以及它是什麼、不是什麼
SGLang 所發布的 RTX 5090 數據,全部採用 NVFP4 和 SM120 路徑,細分如下:
• 單用戶解碼(批次 1)— 標準 63.9 tokens/s,搭配 DFlash 推測解碼可達 236.4 tokens/s。這 3.7 倍的提升是互動體驗的關鍵數字,它決定了本地代理感覺像是一場對話,還是像在排隊。
• 聚合輸出(批次 8)— 標準模式 501 tokens/s,使用 DFlash 時 1,452 tokens/s。這是本地伺服器同時服務多個請求時的吞吐量數字。
作為對比,在同一張 GPU 上使用 GGUF q4_k_m——這是大多數人在 llama.cpp 風格執行環境中會採用的路徑——標準速度可達 72.6 tokens/s,搭配 DFlash 則可達 140.7 tokens/s。NVFP4 路徑明顯領先。
這些是SGLang與Meta在發布當天公布的數據,並非獨立重現的結果——誠實來說,應標註為「供應商與框架回報」,社群的驗證則需在未來數週內陸續展開。不過,這兩個宣佈數字的技術棧所呈現出的趨勢是一致的。在llama.cpp中,Meta回報在RTX 5090上搭配DFlash可達到每秒74.9至233.4個token,效能提升3.1倍;M5 Max則從26.6提升至50.2;M4 Max從23.7提升至37.8。兩個不同的執行環境、兩種不同的量測方式,結果卻落在同一區間:一個30B模型在單一張消費級GPU上以每秒超過200個token的速度解碼,而DFlash在每一組已公布數字的Nvidia配置上,都約略讓吞吐量成長為三倍。
為何「serves」比「runs」更重要
Meta 的硬體部落格提出了比桌面級數據更強烈的說法。在 NVIDIA Blackwell Ultra——資料中心世代,而非桌面顯示卡——上,該部落格宣稱每顆 GPU 每秒可處理超過 20,000 個 token(BF16/NVF4),並點名 SGLang 和 vLLM 皆為受支援的開源堆疊。這完全是另一個等級,也透露了 Meta 實際上在打造什麼:同一組權重的設計目標是從筆電到 GPU 伺服器機架都能執行,而服務框架從第一天起就被視為一級公民,而非事後才撰寫的移植。
可靠性的那一半,其重要性不亞於速度。一個因為服務層卡頓而在任務中途失效的本機代理程式,在實質意義上並不比一個遭到速率限制的雲端代理程式更好。day-0 技術堆疊中的那些機制——可中斷的推測解碼、能讓長代理程式上下文以低成本重新進入的前綴快取,以及針對基礎模型調校的草稿模型——正是讓常駐本機代理程式得以存活的關鍵所在。這就是這次發布始終指向的「速度與可靠性」,而且這是一個真實的工程立場,不是行銷口號。

你實際上可以用它做什麼
Muse Glimmer 是一個 30B 稠密多模態模型——透過凍結的感知編碼器接受文字和圖像輸入,輸出文字——在超過 100 種語言上訓練,具備 131,072 個 token 的上下文窗口,知識截止日期為 2026 年 1 月 4 日。它的職責是那些樸實無華的智能體工作:函式呼叫、工具使用、行程與檔案管理、LLM 作為評判的評估,以及具備失敗恢復能力的多步驟任務——當工具呼叫失敗時,模型被訓練去診斷並重試,而不是停止。它提供推理努力等級(從低到極高),你可以在系統提示中設定,這就是在相同權重下以延遲換取深度的方式。
每秒230個token的數據,是讓這一切能在單一機器上順暢運作的關鍵。低於每秒約50個token時,互動式代理程式用起來就像在進行遠端除錯;超過200個token時,則感覺像是本機工具。這正是用一個數字來陳述此模型全部價值所在,也是為何這份硬體清單——RTX 5090、RTX PRO 6000、DGX Spark、MLX Macs——讀起來像本地代理程式時代的購物指南,而非相容性附註。
費用是多少
Muse Glimmer 本身是免費的——Apache 2.0 權重位於 Hugging Face 上的 meta-models/Muse-Glimmer-30B,同時也已發布適用於 llama.cpp 風格執行環境的 GGUF 量化版本,且沒有公開的 Meta API。真正的成本在於其底層硬體:18GB 的 NVFP4 checkpoint 加上 5GB 的 drafter,表示你需要一張 24GB 或 32GB 的顯示卡,或是一台高階的 M 系列 Mac。如果你已經擁有這些配備,常駐本地代理的邊際成本就只是電費;如果沒有,GPU 就是那筆主要開銷。這才是誠實地比較「免費模型」與託管 API 的方式。
當你確實進行那樣的比較時,請直接為雙方定價。在 OrcaRouter 上,你看到的任何一個超過 200 個託管模型的價格,都是供應商的標價以 0% 加價直接轉傳,因此供應商的降價當天就會在此生效——這讓本地與託管的算帳保持誠實。Muse Glimmer 本身目前並不在 OrcaRouter 上,因為還沒有任何推論供應商提供它;它以下載形式提供。一旦有供應商開始提供它,能觸及其餘目錄的同一把金鑰也會觸及它,而自動容錯移轉正是讓你把生產流量指向一個全新、由供應商回報的模型、在其尚未建立獨立追蹤紀錄之前也安全無虞的機制。

速度背後的更大故事
將 day-0 的 SGLang 支援視為一個訊號,這次發布就不再只是單一模型。Muse Glimmer 是 Meta 專有旗艦模型 Muse Spark 1.2 的蒸餾版本,而 Meta 已表示教師模型的權重「在未來幾週內」釋出。一個搭載調校後服務堆疊的 30B 本地代理、一個即將開源的教師模型,以及一個同時宣布的 10 億美元社群基金——這不是一次小版本更新。這是瞄準本地代理市場的開放權重產品線的開端,而首日就支援的框架,正說明 Meta 希望人們真的去執行它,而不只是下載。
持續存在的警告是:{{1}}目前為止所有與此次發布相關的速度與基準測試數據,都是供應商或框架自行報告的{{/1}}。{{2}}吞吐量數據在兩個獨立的技術棧之間表現一致,這令人感到安心{{/2}},{{3}}但唯有獨立基準測試、Artificial Analysis 的評測條目,以及真實世界的重現測試,才能證實每秒 230 個 token 的效能表現{{/3}}——{{4}}而這些通常會在類似發布後的幾週內出現{{/4}}。
按速度粗略排序,值得關注的重點:Muse Spark 1.2 開放權重版本的發布(對{{1}}「Meta 回來了」{{/1}}的戰略判斷取決於此);在非 Nvidia 硬體上的首次獨立吞吐量再現測試,其中 MLX 路線最值得關注;以及第一家建立 Glimmer 端點的推理服務商——屆時{{2}}「免費本地模型」{{/2}}與{{3}}「託管 API」{{/3}}的爭論將不再只是理論,而是你一鍵就能做出的選擇。

