「Muse Glimmerタイトルカード: ローカルGPU向けMetaの30Bオープンウェイトエージェントモデル。チップには「Apache 2.0」「24〜32GB GPU対応」「Muse Spark 1.2から蒸留」と記載」
Guides & Insights

Muse Glimmer:Metaの30BオープンウェイトエージェントモデルがGemma4-31BとQwen3.6-27Bを上回ると主張

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年8月10日朝のXの投稿は、どんなプレスリリースよりも率直に言い放った。「聖なるメタが帰ってきた」。その投稿が反応したリリース—Llama 4以来となるMeta初のオープンウェイトモデル「Muse Glimmer」—は同日に発表され、Meta自身の発表もそのツイートに負けず劣らず過激だ。この300億パラメータのモデルのベンチマーク表は、24項目中19項目でGo​ogleのGemma4-31Bを、24項目中14項目でAlibabaのQwen3.6-27Bを上回ると主張しており、特にエージェント向けベンチマークMCP-Atlasでは、Metaは75.5を報告し、比較対象はそれぞれ54.2と62.5である。

{{1}}「smoked(圧勝)」という事実が頭の中に定着する前に、その数字を出したのが誰かに注目しよう。{{/1}} Metaの表にあるすべてのスコアはMeta自身が実行したものであり、競合モデルのセットアップについては、Meta自身がチューニングしていないと認めていた。Muse Glimmerは、まさにこのサイズクラスを追跡している独立系リーダーボードであるArtificial Analysisにはまだエントリーがない。そこではQwen3.6-27Bが現在Intelligence Index 46を保持し、Gemma4-31Bは39に位置している。したがって、これは同時に2つの物語である。Metaによる真に重要なオープンウェイト公開と、検証に数週間を要するベンチマークの主張である。本稿ではこの2つを分けて扱う。

Muse Glimmer が実際に何なのか

Muse Glimmerは、専用の知覚エンコーダーを介してテキストと画像の入力を受け取る30Bのdenseマルチモーダルモデルであり、100以上の言語でトレーニングされ、寛容なApache 2.0ライセンスの下でリリースされています。その重みはHugging Faceのmeta-models/Muse-Glimmer-30Bにあります。これはMetaのより大規模なプロプライエタリなフラッグシップモデルであるMuse Spark 1.2の蒸留版であり、トレーニングレシピにはそれが表れています。事前トレーニングでは教師からのロジット蒸留、長いコンテキストのエージェント中心のデータでの中期トレーニング、その後の教師ありファインチューニングとオンポリシー蒸留と強化学習の組み合わせが含まれます。

製品概要は技術と同様に具体的だ。MetaはGlimmerを{{1}}「常時稼働するローカルエージェントワークフロー」{{/1}}のために構築した。これはマシン上に常駐し、ツールを呼び出し、複数ステップの計画を実行し、ツール呼び出しが失敗した場合も停止せずに回復し、推論の労力を調整できるエージェントだ。想定される用途は、ローカルコーディング、関数呼び出し、スケジュール管理、ファイル整理、LLM-as-a-judge評価といった、地味だが重要なものだ。{{2}}OpenClaw{{/2}}のようなエージェントオーケストレーションフレームワークと互換性があり、多くの人が実際にこの方法で実行することになるだろう。

ハードウェアの話は、この売り込みのもう半分を占める。フル精度では30Bモデルに55GB以上のメモリが必要だが、Metaの約4ビット量子化により、それはおよそ17〜20GBに抑えられる。これは24GBまたは32GBのコンシューマ向けカード(基準はRTX 5090)や、ユニファイドメモリを搭載したハイエンドMacに収まるサイズだ。投機的デコード用のドラフター――MetaがDFlashと呼ぶ小型のコンパニオンモデル――が生成を高速化する。Metaの報告によると、RTX 5090では約3.1倍(llama.cppで毎秒74.9トークンから233トークンへ)、M5 Maxでは1.8倍、M4 Maxでは1.5倍となる。MシリーズMaxでは、ユニファイドメモリがすでに帯域幅の制約を受けにくいためだ。

このリリースがスペックシートを超えて重要な理由

そのツイートは本質を正確に捉えていた。2025年春のLlama 4以来、Metaはオープンウェイトに関して沈黙し、Meta Superintelligence Labsと最高AI責任者Alexandr Wangの下でプロプライエタリなフロンティア路線に後退していた。Muse Glimmerは、LlamaをAIで最もダウンロードされたファミリーにしたオープンウェイト戦略への公的な復帰だ——そして、これまでで最も強い意思表明を伴って登場した。ザッカーバーグは発表に合わせて14ページのエッセイ「The Future is for Everyone」を公開し、真のAIリスクは集中管理であり、オープンウェイトこそがアメリカが中国のオープンモデル研究所と競争力を保つ方法だと論じた。彼は米国のオープンソースAI規制の緩和を求め、Metaは10億ドルの「Future is for Everyone Fund」を発表した。Metaはまた、はるかに大規模なMuse Spark 1.2のウェイトを「数週間以内に」公開する計画だと述べている。

その文脈によって、ベンチマーク表の読み方は変わります。これは研究室の珍品が静かに出荷されるような話ではなく、モデルを伴った戦略声明です。GlimmerはMetaのラインナップにおける「安価なローカルエージェント」というポジションであり、本格的なエージェント業務にはクラウドAPIが必要だという主張を意図的に切り崩しています。それが実際に実現しているかどうかこそが、まさに検証の問いが問うている点です。

Three-way scoreboard comparing Muse Glimmer, Gemma4-31B and Qwen3.6-27B: MCP-Atlas 75.5/54.2/62.5, DeepSearch QA 74.6/61.7/71.1, GAIA2 43.3/36.4/40.0, SWE-Bench Pro 51.2/36.9/50.2, TerminalBench 2.1 51.7/--/60.7, and AA Intelligence Index --/39/46. Footer: rows 1-5 vendor-reported by Meta; AA Index per Artificial Analysis (no Muse Glimmer entry yet).

「スモーク」という表示、行ごとに

メタの表は、Muse Glimmer を Gemma4-31B および Qwen3.6-27B と、24のベンチマーク項目にわたって比較している。最大の勝利を主張しているところでは、そのパターンは一貫している。すなわち、一般的なエージェンティック推論と検索である。

• MCP-Atlas(エージェンティックツール使用)— Muse Glimmer 75.5、Gemma4-31B 54.2、Qwen3.6-27B 62.5。これは見出し行であり、セットの中で最大の差です。

• DeepSearch QA — 74.6(61.7および71.1に対して)。

• GAIA2(汎用アシスタント)— 36.4および40.0に対して43.3

• WildClawBench(エージェンティックスイート)— 47.6(対37.6、43.2)

• SWE-Bench Pro — 36.9および50.2に対して51.2。3番目の数字に注目してほしい: 50.2はMeta自身によるQwen3.6-27Bの測定値であり、Alibaba自身が公表した数値は53.5である。同じモデルなのに、誰が実行したかによって2つの異なるスコアになる。

• AIME 2026 — 94.7、IFBench 77.0、およびAA-LCR 80.0(Ge​mmaの68.3に対して)

それは強力な行です。しかし、この表は完全な制圧ではなく、Muse Glimmerが負けている行も、勝っている行と同じくらい示唆に富んでいます。Qwen3.6-27Bは、実践的なコンピュータ操作とターミナル中心の作業で優位を保っています。SWE-Bench Verifiedは77.2対Glimmerの76.0、OSWorld-Verifiedは75.6対65.9、TerminalBench 2.1は60.7対51.7で、さらにScreenSpot Pro、OmniDocBench、MMMU-Proなどのマルチモーダルテストでも一貫した優位性を示しています。一方、Gemma4-31Bは、Metaが報告する2つの指標でより良い安全性の記録を残しています。CI Memoriesで最も低い違反率、Siren AgentDojoで最も低い攻撃成功率を記録し、また限定的な推論テスト(GPQA Diamond、Humanity's Last Exam)でも僅差で勝っています。

素直に読めば、Metaの主張は「ほとんどのエージェントベンチマークで他の2社を上回る」というもので、同社の表に関して言えばそれはおおむね正しい。注意点こそが重要だ。Metaはすべての行を自社で実行し、競合モデルのテスト設定が自社モデルほどチューニングされていなかったことを認めている。これは不正の告発ではない。競合他社の設定をチューニングしないのは、この業界では日常的で、むしろ当然視されている罪だ。しかし、まさにそのために、ベンダーが作成した表は独立した確認が必要になるのだ。上記のQ​wen SWE-Bench Proの不一致は、問題全体を縮図にしたものだ。

独立したスコアボードが示すもの

Artificial AnalysisはまだMuse Glimmerをリストに載せていない。このモデルは登場からわずか数日であり、AAの指数は独自の実行結果に基づいて構築されるため、時間がかかるのだ。しかしAAは競合する両モデルを追跡しており、新規参入者が参入すると主張する分野の実測値を示している。現在の指数では、Qwen3.6-27Bはインテリジェンス指数46を記録し、AAによれば150Bパラメータ未満のオープンウェイトモデルの中で最も知的であるとされている。一方、Gemma4-31Bは39となっている。これらは独立した数値であり、ベンダーの主張ではない。

独立した評価は、見出しの数字が隠すコスト上の落とし穴も示している。AAの効率データによると、Qwen3.6-27Bは約54.6トークン/秒を生成するのに対し、Gemma4-31Bは34.8トークン/秒で、Ge​mmaの方がtime-to-first-token(最初のトークンまでの時間)は速い。しかしQ​wenはフルインデックスの実行に約3.7倍の出力トークンを使用するため、エンドツーエンドの評価コストは約21倍高くなる。トークンを大量に消費するモデルは、ベンチマークスコアが優れていても現実世界ではコストがかさみ、これはどのベンダーの表にも記載されない重要な判断材料となる。

正直なところ、本稿執筆時点での現状はこうだ:ベンダー報告による有力な結果はあるが、Muse Glimmerについては独立した結果はまだ皆無であり、競合分野はタスクごとに独立して測定され、評価が分かれている。「GemmaQwenを打ち負かした」という主張は有力な主張ではあるが、まだ検証済みの結果ではない。注目すべき検証指標は、AAインデックスへのエントリ、LMArena Elo、そしてコミュニティによる再現である——これらは通常、今回のようなリリースから数週間以内に発表されるものだ。

Screenshot of Artificial Analysis' Small Open Source Models comparison page, showing the 4B-40B open-weight class with Openness and Intelligence index columns and the header noting that Qwen3.6-27B and Qwen3.5-27B are the highest-intelligence small open-source models.

実際にかかるランニングコスト

Muse Glimmerは無料です — Apache 2.0、トークンごとの料金もなく、Metaへの支払いもありません。コストは、その下に置くハードウェアです。4ビットの30Bモデルは、KVキャッシュ、知覚エンコーダー、DFlashドラフター用の領域に加えて、約17〜20GBの常駐メモリを必要とします。そのため、Meta自身のガイダンスでは24GBまたは32GBのカード、あるいはハイエンドMacが推奨されています。そのハードウェアを所有していれば、常時稼働のローカルエージェントを実行する限界コストは実質的に電気代だけです。所有していなければ、24GBのGPUや最大構成のMシリーズMacは大きな出費項目です。そして8月9日以降、第三の選択肢があります。レンタルです。その日付時点で公開された最初のホステッドAPIリストでは、Muse Glimmerは131Kコンテキストウィンドウで、入力トークン100万個あたり0.35ドル、出力トークン100万個あたり1.50ドルと価格設定されています。これはプロバイダーが掲載するマーケットプレイス価格であり、Metaの価格ではありません。しかし、ハードウェアを購入したくない場合に今日実際に支払えるのは、この数字です。

それこそが注意深く行う価値のある比較です。「オープンウェイト、ゼロ価格」と「ホステッドAPI、トークン単位課金」が出会う条件は、非常に異なるものだからです。数字を弾くときは、両者の価格を正直につけましょう。OrcaRouter側では、200以上のホステッドモデルのいずれについても、表示される価格はプロバイダーのリスト価格を0%マークアップでそのまま通したものです。そのため、ベンダーの値下げはマージンの再計算を待つのではなく、即日反映されます。これにより、ローカルとホステッドの比較が単純明快になります。Muse Glimmer自体はまだその200以上のモデルには含まれていないため、このパススルーは本日時点では適用されません。しかし、重要なのはその規律です。実証されていないオープンウェイトモデルを価格設定する方法は、ベンダーの価格表ではなく、自社のトラフィックに基づくべきであり、ルーティングDSLは、モデルがAPI経由で呼び出し可能になった時点で、まさにその比較を実行するために存在しています。

今週、実際にどう使うか

オープンウェイトのモデルとして提供されているため、{{1}}「アクセス」はサインアップではなく、ダウンロードです{{/1}}。ベースリポジトリはHugging Face上のmeta-models/Muse-Glimmer-30Bで、GGUF版はすでに公開されており、量子化版もサードパーティから提供されつつあります。リリース初日からllama.cpp、MLX、ExecuTorchがサポートされ、リリース直後にはOllama、LM Studio、vLLM、SGLangの統合も追加されました。また、AMD、Arm、Dell、Intel、Nvidia向けのハードウェア最適化も予定されています。ほとんどの人にとっての実用的な手順は、GGUFを取得し、llama.cppまたはローカルランナーに読み込み、エージェントスキャフォールドをそれに接続することです。MetaはGlimmer自体のパブリックAPIを提供しておらず、ローカル実行こそがこのモデルの設計思想に沿った利用経路です。しかし、ホスト型の利用ももはや仮定の話ではありません。サードパーティのプラットフォームが8月9日に提供を開始したため、{{2}}「ダウンロードして実行」と「API呼び出し」{{/2}}はどちらも現在利用可能な選択肢となっています。

私たち自身について正直に申し上げるなら、Muse Glimmerは現在OrcaRouterではまだご利用いただけません。当社はホスト型APIをルーティングしており、本アップデート時点でこのモデルはカタログに未搭載です。0%マークアップとワンキーですべてを実現する契約は、当社がルーティングする200以上のモデルに適用されるものであり、このモデルはまだその対象ではありません。カタログに追加された際は、他のカタログにアクセスできるのと同じキーで、新しい契約なしにアクセス可能となり、自動フェイルオーバーこそが、独立した実績がないベンダー報告済みの新モデルに本番トラフィックを安全に向けられるようにする仕組みです。これはルーティングDSLが存在するのと同じ理由です。実証されていないモデルは、自社のプレスリリースではなく、お客様のデータ上で本番パスを獲得すべきなのです。

以下のスクリーンショットは、リリース当日のHugging Faceカードの内容です。その「not deployed by any inference provider」という行は、Hugging Face自身のファーストパーティ推論を指しており、8月9日に公開されたサードパーティのホスト型APIリストとは別のものです。

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the line that the model is not deployed by any inference provider.

何を見るべきか

この物語の帰趨を決めるのは、おおよそ速い順に次の3つだ。第一に、約束されたMuse Spark 1.2のオープンウェイト公開——もしそのティーチャーモデルが「数週間以内」にリリースされれば、Glimmerは一回限りの存在ではなくなり、フルオープンウェイト製品群のほんの入口となる。それが「Metaの復活」の真の戦略的読み方だ。第二に、独立した測定。Artificial Analysisのインデックス掲載、LMArenaでの順位、そしてコミュニティによる再現実験が、24件中19件という主張がMeta以外の者の検証に耐えるかどうかを教えてくれる。第三に、ホスティングの波——これはすでに始まっている。プロバイダー各社は8月9日からGlimmerの提供を開始しており、ローカルかホスト型かという問いは、今やひとつのAPIキーで実際に選べるものとなった。今後注目すべきは、ホスティングの広がりがどこまで及ぶか、そしてリリース初週の目新しさが薄れた後にトークン単価がどう動くかだ。

そのツイートはニュースについて正しかった。評決について正しかったかどうかは、数週間かけて答えが出る問いであり、現時点で正直な立場としては、Metaの外部でそれを知るのに十分な検証を実行した人間は誰もいない。すでに確かなことは、コンシューマーGPUに収まり、全面的な戦略的後押しを受けた30BのApache-2.0エージェントモデルが、独立したスコアが最終的にどうなろうと、計画を立てる上での基準となるリリースだということだ。

実際に答える価値のある質問

Muse Glimmer は本当にオープンソースですか?

これは寛容なApache 2.0ライセンスの下でのオープンウェイトであり、誰でもダウンロード、改変、ファインチューニング、商用展開をMetaに支払うことなく行えます。OSIの意味での完全なオープンソースではなく「オープンウェイト」という慎重な表現が使われているのは、トレーニングデータ、Muse Sparkの教師モデルの重み、そして一部のツールが含まれていないためです。実用上は、実行、出荷、その上に製品を販売することが可能であり、LlamaをAIで最も展開されているオープンファミリーにしたのと同じ条件です。

Muse Glimmerは実際にGemma4-31BとQwen3.6-27Bに勝てるのか?

Meta自身の比較表では、ほとんどのエージェント型および検索ベンチマークでその通りだ。ただし、この比較はMeta自身が実施したものであり、競合のセットアップを調整していないという留保が付く。正直なところ、より詳細に見ると次のようになる。Metaはエージェント型推論の項目で勝利し、Qwen3.6-27Bは実践的なコンピュータ操作とターミナル作業、さらにほとんどのマルチモーダルテストで勝利している。Gemma4-31Bはより優れた安全性記録を示している。リリース日時点では、Muse Glimmerに関する独立したインデックスエントリは存在しないため、19/24という主張は他者が評価を実施するまでベンダー報告として扱うべきだ。

ノートパソコンで実行できますか?

「ラップトップ」が24GBまたは32GBのディスクリートGPU、あるいは十分なユニファイドメモリを備えたハイエンドのMシリーズMacを意味する場合に限る——4ビットのMuse Glimmerには、KVキャッシュ、知覚エンコーダ、DFlashドラフター用のヘッドルームに加えて、およそ17〜20GBが必要だ。それはほとんどの人にとって本格的な出費であり、「無料」モデルに隠されたコストである。統合グラフィックスや16GBのマシンでは、このリリースが中心に据えている常時稼働エージェントではなく、大幅な量子化と低速な出力に直面することになる。

それはどこで入手できますか — API上にあるのですか?

Hugging Face の meta-models/Muse-Glimmer-30B(GGUF 版もあります)にウェイトが置かれており、llama.cpp、MLX、ExecuTorch、または現在統合が進んでいるローカルランナーを通じてローカルで実行できます。ホスト型APIアクセスも、8月9日時点で、サードパーティのプラットフォームを通じて利用可能です。価格は、入力トークン100万個あたり0.35ドル、出力トークン100万個あたり1.50ドルです。そのため、これを呼び出すのに24GBのGPUを所有する必要はもうありません。Meta自身は今もGlimmer向けの公開APIをホストしておらず、OrcaRouterにもまだ載っていません。それが当社のカタログに追加されれば、カタログの他の部分にアクセスできる同じキーでアクセスできます。それまでは、正直な方法は2つだけです。ローカル推論か、サードパーティのホスト型プラットフォームを使うことです。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube