ヒーロータイトルカード: 「Muse Glimmer — 単一RTX 5090で230 Tokens/秒 — SGLang Day-0」、ステータスチップには30B高密度オープンウェイト、Apache 2.0、SGLang day-0サポートと表示されています。
Guides & Insights

Muse Glimmer、RTX 5090 1枚で230 Tokens/sを達成:SGLangのDay-0サポートこそが真のローンチストーリー

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

毎秒230トークンは、どのモデルにとっても速い数字だ。Muse Glimmer(Meta Superintelligence LabsによるMetaの30B高密度・オープンウェイトリリースで、2026年8月10日にApache 2.0の下で公開)にとって、これは「自分のGPUで動く」モデルと「本物のエージェントを支える」モデルを分ける数字だ。SGLangは、ウェイトが公開された当日にMuse Glimmerのデイゼロサポートを発表し、GeForce RTX 5090単体での公表測定値は、NVFP4量子化とMetaのDFlash投機的復号ドラフターを両方有効にした状態で、バッチ1においてユーザーあたり毎秒236.4トークンである。

その1つの数字がこのリリースの大部分を物語っているが、残りの部分にもじっくり目を通す価値はある。なぜなら、興味深い点は見出しになるような速度ではないからだ。興味深いのは、このモデルがRTX PRO 6000やNVIDIA DGX Spark、そしてMLX経由のAppleシリコンでもそのまま動作すること——そしてSGLangがこの成果をコミュニティの後付けではなく、Meta Superintelligence Labsとのコラボレーションと呼んでいることだ。これは、長い間で初めて、フロンティアに近いMetaのモデルであり、単に重みだけでなくサービングスタックを中心に設計されている。

ここで「day-0 support」が実際に意味するもの

SGLang v0.5.17におけるDay-0サポートは、モデルが後付けで追加されたわけではないことを意味します。つまり、ランタイムの実装はウェイトと同じリリース期間内に完了し、Metaが実際にターゲットとするハードウェア向けに専用設計されたパスが用意されています。SGLangのSM120バックエンドはBlackwellデスクトップおよびワークステーションラインをカバーしており、RTX 5090、RTX PRO 6000、DGX Sparkはすべて同じ最適化パスで動作します。一方、Appleシリコンには低速なポートではなくネイティブのMLXバックエンドが提供されます。

SGLangとMetaがチューニングしたスタックは特定のものです。モデルは18GBのNVFP4チェックポイントとして動作し、それに5GBのBF16 DFlashドラフターが組み合わされています。これは、MetaがMuse Glimmer向けにトレーニングした投機的デコーディング用のコンパニオンモデルです。その組み合わせは32GBのカードに余裕を持って収まり、NVFP4とMXFP8の混合量子化パス全体の常駐メモリはおよそ19.5GBになります。SGLang側では、リリースノートが同じストーリーの一部として3つの信頼性メカニズムを挙げています:DFlash投機的デコーディング、プレフィックスキャッシュのためのRadixAttention、そして割り込み可能なCUDAグラフです。

その数字、そしてそれが何であり何でないか

SGLangが公開したRTX 5090の数値は、すべてNVFP4とSM120パスを使用したもので、次のように内訳されます:

• シングルユーザーデコード(バッチ1)— 標準時63.9トークン/秒、DFlash投機的デコード時236.4トークン/秒。この3.7倍の向上こそがインタラクティブ性を左右する数値であり、ローカルエージェントが会話のように感じられるか、待ち行列のように感じられるかを決めるものだ。

• 総出力(バッチ8)— 標準で501トークン/秒、DFlashで1,452トークン/秒。これは、ローカルサーバーが複数のリクエストを同時に処理する場合のスループット数値です。

• 比較用に、同じGPU上のGGUF q4_k_m — llama.cppスタイルのランタイムで多くの人が使うであろう経路 — は、標準で72.6トークン/秒、DFlashで140.7トークン/秒に達する。NVFP4の経路は有意に先行している。

これらはSGLangとMetaが発表当日に公表した数値であり、独立した再現実験によるものではありません。正直に言えば、ベンダーおよびフレームワーク報告の値であり、コミュニティによる検証は今後数週間で行われるでしょう。しかし、数値を発表した2つのスタックにわたる傾向は一貫しています。llama.cppでは、MetaはRTX 5090でDFlashを使用して74.9〜233.4トークン/秒を報告しており、3.1倍の向上です。M5 Maxは26.6から50.2、M4 Maxは23.7から37.8です。異なる2つのランタイム、異なる2つの測定スタイルですが、同じ程度の結果です。単一のコンシューマーGPU上で30Bモデルが毎秒200トークン以上でデコードされ、DFlashは数値を発表したすべてのNvidia構成でスループットを約3倍にしています。

なぜ「serves」が「runs」よりも重要なのか

Metaのハードウェアブログは、デスクトップ向けの数値よりも踏み込んだ主張をしている。NVIDIA Blackwell Ultra(デスクトップ向けカードではなく、データセンター向け世代)について、ブログではBF16/NVF4でGPUあたり毎秒20,000トークン以上とされており、SGLangとvLLMの両方がサポートされるオープンソーススタックとして挙げられている。これは別次元の話であり、Metaが実際に何を構築しているかを示す手がかりだ。同じウェイトがラップトップからGPUサーバーラックまでどこでも動作することを意図しており、サービングフレームワークは後から移植するものとしてではなく、初日から第一級のものとして扱われている。

信頼性の側面は、速度と同じくらい重要です。推論層が途切れたためにタスクの途中で死んでしまうローカルエージェントは、レート制限を受けたクラウドエージェントと比べて、本質的に優れているわけではありません。day-0スタックにおける仕組み—割り込み可能な投機的復号、長いエージェントコンテキストへの再突入を低コストに保つプレフィックスキャッシュ、そしてベースモデルにチューニングされたドラフター—こそが、常時稼働のローカルエージェントを生存可能にするまさにその部分です。これこそが、ローンチが指し示してきた「速度と信頼性」であり、それはマーケティングの言葉ではなく、現実のエンジニアリング上の立場です。

A single-model speed board for Muse Glimmer: batch-1 decode 63.9 to 236.4 tok/s with DFlash, batch-8 output 501 to 1,452 tok/s, GGUF q4_k_m 72.6 to 140.7 tok/s, 128K context window, 18GB checkpoint plus 5GB drafter, runs on RTX 5090, RTX PRO 6000, DGX Spark and Mac. Footer: SGLang/NVIDIA-reported, launch day.

それで実際に何ができるか

Muse Glimmerは、30Bパラメータの高密度マルチモーダルモデルです。凍結された知覚エンコーダーを通じてテキストと画像を入力し、テキストを出力します。100以上の言語でトレーニングされ、131,072トークンのコンテキストウィンドウと2026年1月4日時点の知識カットオフを備えています。その役割は、華やかさのないエージェント業務です。関数呼び出し、ツール使用、スケジュールおよびファイル管理、LLM-as-a-judge評価、そして障害回復を伴うマルチステップタスク。ツール呼び出しが失敗した場合、モデルは停止するのではなく、診断して再試行するようにトレーニングされています。また、システムプロンプトで設定する推論努力レベル(lowからxhighまで)を提供し、同じウェイト上でレイテンシと深さをトレードオフできます。

毎秒230トークンという数字こそが、これらすべてを1台のマシンで実用可能にするものだ。毎秒およそ50トークン未満では、インタラクティブエージェントはリモートデバッグセッションのように感じられる。しかし毎秒200以上なら、ローカルツールのように感じられる。このモデルの存在意義を1つの数字で表すならこれであり、RTX 5090、RTX PRO 6000、DGX Spark、MLX Macというハードウェアリストが、互換性の脚注ではなくローカルエージェント時代のショッピングガイドのように読める理由もそこにある。

料金

Muse Glimmer自体は無料です。Apache 2.0のウェイトがHugging Faceのmeta-models/Muse-Glimmer-30Bにあり、llama.cpp系ランタイム向けのGGUF量子化もすでに公開されており、公開されたMeta APIはありません。実際のコストはその基盤となるハードウェアです。18GBのNVFP4チェックポイントと5GBのドラフターを合わせると、24GBまたは32GBのGPUカードか、ハイエンドのMシリーズMacが必要になります。すでにそれを持っている場合、常時稼働するローカルエージェントの限界費用は電気代だけです。持っていない場合、GPUが費用項目となり、それが「無料モデル」をホスト型APIと比較する正直な方法です。

その比較を行う際には、両者をストレートに価格設定してください。OrcaRouterでは、200以上のホスト型モデルで表示される価格は、プロバイダーのリスト価格を0%のマークアップでそのまま通したものです。そのため、ベンダーの値下げは当日中にここで反映され、ローカル対ホスト型の計算を正直に保ちます。Muse Glimmer自体は、現在OrcaRouterにはありません。というのも、まだどの推論プロバイダーもそれを提供しておらず、ダウンロードとして提供されているからです。プロバイダーがそれを提供し始めた瞬間、カタログの他の部分に届くのと同じキーがそこにも届き、自動フェイルオーバーは、独立した実績ができる前に、ベンダー報告の真新しいモデルに本番トラフィックを向けることを安全にするメカニズムです。

Screenshot of the NVIDIA Developer blog 'Run Local AI Agentic Workflows with Meta's Muse Glimmer', describing the 30B open-weight dense model with a 120K+ context window and quoting 20K tokens/sec on a single GPU for always-on local agents.

速度の背後にあるより大きな物語

SGLangのデイゼロ対応を先行シグナルとして読めば、このリリースは単なる1モデルの発表ではない。Muse Glimmerは、Metaの独自フラッグシップモデルMuse Spark 1.2の蒸留版であり、Metaは教師モデルの重みを「数週間以内に」公開すると明言している。チューニング済みのサービングスタックを備えた30Bのローカルエージェント、オープン化目前の教師モデル、そして同時に発表された10億ドルのコミュニティファンド——これはポイントリリースではない。これはローカルエージェント市場を明確に狙ったオープンウェイトラインナップの入り口にすぎず、デイゼロでのフレームワークサポートこそが、Metaが単にダウンロードさせるだけでなく、実際にユーザーに実行させる意図があることを示している。

留意すべき点は、今回の発表に付随する速度やベンチマークの数値はすべて、現時点ではベンダーまたはフレームワークによる報告だということだ。スループットの数値は2つの独立したスタック間で一貫しており、それは心強い。しかし、独立したベンチマーク、Artificial Analysisのエントリー、そして実世界での再現が、毎秒230トークンという数字を裏付けることになるだろう。そうした確認は通常、この種のリリースから数週間以内にもたらされる。

見るべきものを、速さの大まかな順に並べると:Muse Spark 1.2のオープンウェイト版リリース(「Meta復活」という戦略的読みはこれ次第);Nvidia以外のハードウェアでの初の独立スループット再現(要注目はMLX経路);そして最初の推論プロバイダーがGlimmerエンドポイントを立ち上げること——それが、「無料のローカルモデル」と「ホステッドAPI」の議論が仮説でなくなり、キーひとつで選べる選択肢になる瞬間だ。

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the model's purpose-built local-agentic description.
© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube