主視覺標題卡:「Muse Glimmer — 在單張 RTX 5090 上達到 230 Tokens/s — SGLang Day-0」,統計標籤顯示 30B 密集開放權重、Apache 2.0 及 SGLang Day-0 支援。
Guides & Insights

Muse Glimmer 在單張 RTX 5090 上達到 230 Tokens/s:SGLang 首日支援才是真正的發布重點

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

每秒兩百三十個 token,對任何模型來說都是很快的數字。對於 Muse Glimmer —— Meta Superintelligence Labs 釋出的 30B 密集、開放權重模型,於 2026 年 8 月 10 日以 Apache 2.0 授權發布 —— 這個數字正是區分「能跑在我的 GPU 上」與「足以服務真正的代理程式」的關鍵門檻。SGLang 在權重上線當天就宣布對 Muse Glimmer 的 day-0 支援,其公佈的數據顯示,在單張 GeForce RTX 5090 上,啟用 NVFP4 量化與 Meta 的 DFlash 推測解碼草稿模型時,batch 1 情境下每位使用者可達每秒 236.4 個 token。

那一張圖表就承載了這次發佈的大部分敘事,但其餘內容也值得放慢腳步細看,因為有趣之處不在於主打的速度。有趣的是,這個模型在 RTX PRO 6000、NVIDIA DGX Spark 上,以及透過 MLX 在 Apple silicon 上都能開箱即用——而且 SGLang 稱這項工作是與 Meta Superintelligence Labs 的合作成果,而非社群事後補上的附加品。這是 Meta 許久以來第一個以伺服堆疊為中心設計、而不只是圍繞權重設計的接近前沿等級的模型。

「day-0 support」在這裡的真正含義是什麼

SGLang v0.5.17 的 Day-0 支援意味著該模型並非事後才硬補上去的:運行時的工作與權重在相同的發布週期內一起落地,並為 Meta 實際鎖定的硬體打造了專用路徑。SGLang 的 SM120 後端涵蓋 Blackwell 桌面與工作站產品線——RTX 5090、RTX PRO 6000 與 DGX Spark 皆執行同一條優化路徑——而 Apple 矽晶片則獲得原生 MLX 後端,而非緩慢的移植版本。

SGLang 和 Meta 所調校的技術棧是特定的。模型以 18GB NVFP4 檢查點的形式運行,搭配一個 5GB BF16 DFlash 草稿模型,這是 Meta 為 Muse Glimmer 訓練的推測解碼伴隨模型。這個組合可以輕鬆放入 32GB 顯示卡內,還有餘裕,而整個 NVFP4 加上 MXFP8 的混合量化路徑,常駐記憶體約為 19.5GB。在 SGLang 方面,發行說明中提到了三種可靠性機制,作為同一敘事的一部分:DFlash 推測解碼、用於前綴快取的 RadixAttention,以及可中斷的 CUDA graphs。

這個數字,以及它是什麼、不是什麼

SGLang 所發布的 RTX 5090 數據,全部採用 NVFP4 和 SM120 路徑,細分如下:

• 單用戶解碼(批次 1)— 標準 63.9 tokens/s,搭配 DFlash 推測解碼可達 236.4 tokens/s。這 3.7 倍的提升是互動體驗的關鍵數字,它決定了本地代理感覺像是一場對話,還是像在排隊。

• 聚合輸出(批次 8)— 標準模式 501 tokens/s,使用 DFlash 時 1,452 tokens/s。這是本地伺服器同時服務多個請求時的吞吐量數字。

作為對比,在同一張 GPU 上使用 GGUF q4_k_m——這是大多數人在 llama.cpp 風格執行環境中會採用的路徑——標準速度可達 72.6 tokens/s,搭配 DFlash 則可達 140.7 tokens/s。NVFP4 路徑明顯領先。

這些是SGLang與Meta在發布當天公布的數據,並非獨立重現的結果——誠實來說,應標註為「供應商與框架回報」,社群的驗證則需在未來數週內陸續展開。不過,這兩個宣佈數字的技術棧所呈現出的趨勢是一致的。在llama.cpp中,Meta回報在RTX 5090上搭配DFlash可達到每秒74.9至233.4個token,效能提升3.1倍;M5 Max則從26.6提升至50.2;M4 Max從23.7提升至37.8。兩個不同的執行環境、兩種不同的量測方式,結果卻落在同一區間:一個30B模型在單一張消費級GPU上以每秒超過200個token的速度解碼,而DFlash在每一組已公布數字的Nvidia配置上,都約略讓吞吐量成長為三倍。

為何「serves」比「runs」更重要

Meta 的硬體部落格提出了比桌面級數據更強烈的說法。在 NVIDIA Blackwell Ultra——資料中心世代,而非桌面顯示卡——上,該部落格宣稱每顆 GPU 每秒可處理超過 20,000 個 token(BF16/NVF4),並點名 SGLang 和 vLLM 皆為受支援的開源堆疊。這完全是另一個等級,也透露了 Meta 實際上在打造什麼:同一組權重的設計目標是從筆電到 GPU 伺服器機架都能執行,而服務框架從第一天起就被視為一級公民,而非事後才撰寫的移植。

可靠性的那一半,其重要性不亞於速度。一個因為服務層卡頓而在任務中途失效的本機代理程式,在實質意義上並不比一個遭到速率限制的雲端代理程式更好。day-0 技術堆疊中的那些機制——可中斷的推測解碼、能讓長代理程式上下文以低成本重新進入的前綴快取,以及針對基礎模型調校的草稿模型——正是讓常駐本機代理程式得以存活的關鍵所在。這就是這次發布始終指向的「速度與可靠性」,而且這是一個真實的工程立場,不是行銷口號。

A single-model speed board for Muse Glimmer: batch-1 decode 63.9 to 236.4 tok/s with DFlash, batch-8 output 501 to 1,452 tok/s, GGUF q4_k_m 72.6 to 140.7 tok/s, 128K context window, 18GB checkpoint plus 5GB drafter, runs on RTX 5090, RTX PRO 6000, DGX Spark and Mac. Footer: SGLang/NVIDIA-reported, launch day.

你實際上可以用它做什麼

Muse Glimmer 是一個 30B 稠密多模態模型——透過凍結的感知編碼器接受文字和圖像輸入,輸出文字——在超過 100 種語言上訓練,具備 131,072 個 token 的上下文窗口,知識截止日期為 2026 年 1 月 4 日。它的職責是那些樸實無華的智能體工作:函式呼叫、工具使用、行程與檔案管理、LLM 作為評判的評估,以及具備失敗恢復能力的多步驟任務——當工具呼叫失敗時,模型被訓練去診斷並重試,而不是停止。它提供推理努力等級(從低到極高),你可以在系統提示中設定,這就是在相同權重下以延遲換取深度的方式。

每秒230個token的數據,是讓這一切能在單一機器上順暢運作的關鍵。低於每秒約50個token時,互動式代理程式用起來就像在進行遠端除錯;超過200個token時,則感覺像是本機工具。這正是用一個數字來陳述此模型全部價值所在,也是為何這份硬體清單——RTX 5090、RTX PRO 6000、DGX Spark、MLX Macs——讀起來像本地代理程式時代的購物指南,而非相容性附註。

費用是多少

Muse Glimmer 本身是免費的——Apache 2.0 權重位於 Hugging Face 上的 meta-models/Muse-Glimmer-30B,同時也已發布適用於 llama.cpp 風格執行環境的 GGUF 量化版本,且沒有公開的 Meta API。真正的成本在於其底層硬體:18GB 的 NVFP4 checkpoint 加上 5GB 的 drafter,表示你需要一張 24GB 或 32GB 的顯示卡,或是一台高階的 M 系列 Mac。如果你已經擁有這些配備,常駐本地代理的邊際成本就只是電費;如果沒有,GPU 就是那筆主要開銷。這才是誠實地比較「免費模型」與託管 API 的方式。

當你確實進行那樣的比較時,請直接為雙方定價。在 OrcaRouter 上,你看到的任何一個超過 200 個託管模型的價格,都是供應商的標價以 0% 加價直接轉傳,因此供應商的降價當天就會在此生效——這讓本地與託管的算帳保持誠實。Muse Glimmer 本身目前並不在 OrcaRouter 上,因為還沒有任何推論供應商提供它;它以下載形式提供。一旦有供應商開始提供它,能觸及其餘目錄的同一把金鑰也會觸及它,而自動容錯移轉正是讓你把生產流量指向一個全新、由供應商回報的模型、在其尚未建立獨立追蹤紀錄之前也安全無虞的機制。

Screenshot of the NVIDIA Developer blog 'Run Local AI Agentic Workflows with Meta's Muse Glimmer', describing the 30B open-weight dense model with a 120K+ context window and quoting 20K tokens/sec on a single GPU for always-on local agents.

速度背後的更大故事

將 day-0 的 SGLang 支援視為一個訊號,這次發布就不再只是單一模型。Muse Glimmer 是 Meta 專有旗艦模型 Muse Spark 1.2 的蒸餾版本,而 Meta 已表示教師模型的權重「在未來幾週內」釋出。一個搭載調校後服務堆疊的 30B 本地代理、一個即將開源的教師模型,以及一個同時宣布的 10 億美元社群基金——這不是一次小版本更新。這是瞄準本地代理市場的開放權重產品線的開端,而首日就支援的框架,正說明 Meta 希望人們真的去執行它,而不只是下載。

持續存在的警告是:{{1}}目前為止所有與此次發布相關的速度與基準測試數據,都是供應商或框架自行報告的{{/1}}。{{2}}吞吐量數據在兩個獨立的技術棧之間表現一致,這令人感到安心{{/2}},{{3}}但唯有獨立基準測試、Artificial Analysis 的評測條目,以及真實世界的重現測試,才能證實每秒 230 個 token 的效能表現{{/3}}——{{4}}而這些通常會在類似發布後的幾週內出現{{/4}}。

按速度粗略排序,值得關注的重點:Muse Spark 1.2 開放權重版本的發布(對{{1}}「Meta 回來了」{{/1}}的戰略判斷取決於此);在非 Nvidia 硬體上的首次獨立吞吐量再現測試,其中 MLX 路線最值得關注;以及第一家建立 Glimmer 端點的推理服務商——屆時{{2}}「免費本地模型」{{/2}}與{{3}}「託管 API」{{/3}}的爭論將不再只是理論,而是你一鍵就能做出的選擇。

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the model's purpose-built local-agentic description.
© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube