「Claude Sonnet 5.5 vs Muse Glimmer」というタイトルの生成されたヒーローカード。サブタイトルは、30Bのラップトップモデルと新しいSonnetの対比。3枚の統計カードは、インテリジェンス指数 56 対 17、コンテキストウィンドウ 1M 対 131Kトークン、重みはクローズド 対 Apache 2.0。フッターには、IndexはArtificial Analysis v4.3.2によるもの、Muse Glimmerの仕様はMetaによるものと記載されている。
Guides & Insights

Claude Sonnet 5.5 vs Muse Glimmer:新型Sonnetに挑む30BノートPCモデル

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

このページの根本的な問いは、そもそもこの比較が妥当なのかどうかであり、正直に言えば、Claude Sonnet 5.5とMuse Glimmerは通常の意味での競合相手ではない。Artificial Analysis の Intelligence Index(リビジョン v4.3.2)では、Claude Sonnet 5.5 が 56、Muse Glimmer が 17 で、この差はノイズではない——フロンティアの汎用モデルと、非常に優れた小型モデルとの間の距離にほぼ等しい。それでもこの組み合わせに読み応えがあるのは、Muse Glimmer が、もう一方にはいくら積んでも手に入らない特性を一つ備えているからだ。つまり、300億パラメータのオープンウェイトモデルであり、2026年8月10日に M​eta が Apache 2.0 の下で公開し、4ビットに量子化されているため 20 GB 未満の VRAM に収まり、ネットワークを切断した状態で動作するように設計されている。Claude Sonnet 5.5 は、2026年9月28日に同社最速かつ最も賢い Sonnet として登場し、価格は入力100万トークンあたり 2.00 ドル、出力100万トークンあたり 10.00 ドルで、ネットワーク経由でしか利用できない。本当の判断は、どちらのモデルが優れているかではない。トークンをどこで走らせたいか、だ。

二つのモデル、二つの職務定義

Muse Glimmerは、Meta Superintelligence Labsから登場した30Bパラメータのモデルで、Metaのより大規模なMuse Spark教師からのロジット蒸留によって訓練され、その後、長コンテキストのエージェントデータでファインチューニングされ、ツール使用向けに強化学習されています。Metaはすでに量子化した状態でリリースしています。4ビットでは、メモリフットプリントがフル精度時の55 GB超から20 GB未満になり、これにより24 GBまたは32 GBのコンシューマー向けGPUの範囲に収まります。MetaはNvidia RTX 5090と、Apple M4 MaxおよびM5 Maxシリコン上でテストしています。テキストと画像の入力を受け取り、テキストを返し、131,072トークンのコンテキストウィンドウで動作します。Metaによればこれは262,144まで拡張可能で、2026年1月の知識カットオフを備えています。

Artificial Analysis model page for Muse Glimmer (high), an open-weights model released August 2026, showing an Intelligence Index of 17, an output speed of 143.8 tokens per second, $0.325 per million input tokens and $1.35 per million output tokens, $0.06 per Intelligence Index task, 59M output tokens generated during the Index evaluation, a 131K-token context window and a January 2026 knowledge cutoff.

Claude Sonnet 5.5は、A​nthropicの5.5世代における2番目のモデルであり、同社のラインナップの中でスピードと知能の最良の組み合わせと位置づけられているモデルです。1,000,000トークンのウィンドウを持ち、同期的に最大128,000出力トークン、Message Batches APIではoutput-300k-2026-03-24ヘッダーの背後で最大300,000トークンを処理し、テキスト、画像、ファイルを受け付け、2026年6月のカットオフを備えた、選択可能なエフォートによる適応型思考を提供し、ローンチ時からゼロデータ保持で利用できます。ストレージはキャッシュ読み取りが100万トークンあたり$0.20、キャッシュ書き込みが100万トークンあたり$2.50です。A​nthropicは、Claude Sonnet 5より30%高速に動作し、料金を据え置いたままタスクあたり最大30%低コストになると述べています——これはベンダーの主張であり、独立に再現されたものではありません。

仕様の対比は一度に眺めてみる価値がある。というのも、ほとんどすべての行が、優劣ではなく別種のものだからだ:

• ウェイト — Muse Glimmer Apache 2.0、ダウンロード可能、4ビットに量子化、対して Claude Sonnet 5.5 はクローズド

• 実行場所 — 自分のGPU上でオフライン動作するMuse Glimmer 対 A​nthropicのインフラ上で動作するClaude Sonnet 5.5

• パラメータ — Muse Glimmer 30B(合計)、4ビットで 20 GB 未満 対 Claude Sonnet 5.5 は非公開

• コンテキスト — Muse Glimmer 131,072トークン、262,144まで拡張可能 対 Claude Sonnet 5.5 1,000,000トークン

• 100万あたりの価格 — {{1}}Muse Glimmer{{/1}}はトークン課金なし、お客様のハードウェア 対 Claude Sonnet 5.5 $2.00 入力 / $10.00 出力

• インテリジェンス指数 v4.3.2 — Muse Glimmer 17 対 Claude Sonnet 5.5 56

・Indexタスクあたりの実測コスト — Muse Glimmer $0.06 対 Claude Sonnet 5.5 $7.60

そのリストにある2つの数字は詳しく見る価値がある。どちらも罠だからだ。1つ目はタスクあたり0.06ドルという数字だ。これはArtificial AnalysisがMuse Glimmer(high)をホスト型エンドポイント経由で呼び出すのに、入力100万あたり0.325ドル、出力100万あたり1.35ドルを費やしたというもので、このモデルを実行する経済性ではなく、レンタルする経済性を測ったものだ。セルフホストすれば、トークンあたりの限界費用は消え、すでに所有しているか購入しなければならないGPUに置き換わる。2つ目はIndexの差そのものだ。20GBに量子化された30Bモデルが、フロンティアモデルと同じ物差しで採点されている。そして、Muse Glimmerをオープンウェイトモデルの上位いくつかに入れつつ、サイズの割に高価だと指摘していることが、そのことを物語っている。

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Muse Glimmer, the scoreboard, contrasting weights closed vs Apache 2.0, where it runs Anthropic infrastructure vs your own GPU offline, parameters undisclosed vs 30B at 4-bit, context window 1,000,000 vs 131,072 tokens, AA Index 56 vs 17, and output speed 138.7 vs 143.8 tokens per second, with a footer reading AA Index and speed per Artificial Analysis v4.3.2; Muse Glimmer specifications per Meta.

Muse Gladiatorが真に優れている点と、どこで歯車が狂うのか

総合スコアはあまりに大雑把で、それだけが答えにはならない。なぜなら Muse Glimmer は一律に17というわけではないからだ。高速であり——Artificial Analysis の測定では毎秒143.8出力トークンで、Claude Sonnet 5.5 の138.7を上回る——そして簡潔で、Index評価全体で5900万トークンを生成するのに対し、Claude Sonnet 5.5 は4億1000万トークンだ。そしてある評価ではフロンティアに近い。長文コンテキスト想起で、83.3%を記録し、Claude Sonnet 5.5 の82.7%を上回る。30Bモデルが長文コンテキスト検索で最新のフロンティアSonnetに匹敵するのは、このページで最も驚くべき記述であり、Meta がそれを訓練した方法——長文コンテキストのエージェントデータ、はるかに大きな教師からの蒸留——と一致している。

エージェント的タスクの結果こそ、モデルの限界が露呈し、ランキングが手放しで褒められたものではなくなる場面だ。Terminal-Bench 4.0では、Muse Glimmerは0.5%で、Claude Sonnet 5.5の63.6%と対照的だ。自動化ベンチマークのスコアは0.068対0.713。Humanity's Last Examでは22.0%対55.0%。実行ベンチマークでこれほど小さな数値は、モデルがタスクを完了できていないことを意味し、決して終わらないタスクを安くしてくれるようなローカルホスティングの節約など存在しない。

研究文献もこの点については率直であり、埋もれさせるよりも明言する価値がある。査読済みのマルチエージェント・オーケストレーション研究では、Muse-Glimmer-30Bがテスト対象モデルの1つだったが、その候補を1つも回復できなかったことがわかった。M​eta自身によるこのモデル向けのベンチマーク表はベンダー文書であり、ここではそのように表示されている。上記のArtificial Analysisの数値は独立した測定値であり、本稿が依拠しているのはそれらである。

つまり、その線引きは明確だ。Muse Glimmer は、その規模にしては長い入力を読んでそれについて答えるのが得意で、高速かつ実行コストが低く、ラップトップクラスの GPU に収まる。複数ステップのソフトウェアタスクを渡して、そのまま離れていられるようなモデルではない。これが正直な境界であり、総合スコアだけに基づいて書かれた比較では、この点が覆い隠されてしまうだろう。

フロンティア価格で、あなたが実際に買っているもの

Claude Sonnet 5.5 のプレミアムは、まず能力を買うものであり、17ポイントの Index ギャップはその最も目を引く形だ。だが、10.00ドルの出力料金には、どのリーダーボードにも現れない3つの別のものが伴う。

一つ目はウィンドウです。100万トークンは Muse Glimmer の 131,072 のおよそ7.5倍で、A​nthropic はそのすべてに標準料金を適用し、キャッシュ読み取りは入力価格の10分の1なので、多数の呼び出しにまたがって大きなコンテキストを保持することは理論上の話ではなく、手頃に実現できます。リポジトリ規模のプロンプトは小さい方のウィンドウにはまったく収まらないため、これは好みの違いではなく能力の違いです。

2つ目はツールの忠実性です。Claude Sonnet 5 と Claude Sonnet 5.5 の間で5つの挙動が変わり、その5つはすべてツール使用と推論に関するものです。非デフォルトのサンプリングパラメータは400を返すようになり、thinking: {"type": "disabled"} は400を返すようになり、between_tools になります。強制ツール選択の"any" または名前付きツールは拒否されるため、ループは auto に strict tool use 付きで移行する必要があります。古い computer_20251124 ツールは Claude API と Google Cloud では拒否され、thinking ブロックは生成元のモデルとアカウントに紐付けられるようになりました。6つ目の変更は何も失敗させませんが、静かになります。ツール呼び出し間のテキストは thinking ブロック内に返されるため、ストリーミングアプリケーションは表示値を設定するか、事前の thinking をオフにするまで出力を表示しなくなります。これは Sonnet 5 を使っている人にとって1日分の移行作業であり、上のベンチマーク行が測定しているエージェント的信頼性を手に入れるための参入コストです。

第三は来歴とデータの取り扱いです。ゼロデータ保持はローンチ時から利用可能で、A​nthropicは2027年9月28日という廃止の下限を公表しており、このモデルはClaude API、Bedrock、Goo​gle Cloud、Microsoft Foundryで利用できます。規制下の買い手にとって、これらはベンチマークよりも先に購買を左右する調達上の事実です。

オフライン対応はコスト削減策ではなく、必須要件である

この組み合わせが同じページに属する理由は、特定のクラスのデプロイメントにおいて、Muse Glimmer がより安価な選択肢ではないからだ — それが唯一の選択肢なのだ。デバイスから出せないリクエスト、接続性のない工場の現場やフィールドサイト、API 呼び出しがコンプライアンス違反となるエアギャップ環境、あるいは往復だけで既に遅延予算を超えてしまう場合:それらのいずれも、ネットワークの向こう側にあるより優れたモデルでは解決されない。20 GB 未満に収まりオフラインで動作する Apache 2.0 の重みが答えのすべてであり、どんな価格であれ Claude Sonnet 5.5 はその問いに関与しない。

M​etaが公開したRTX 5090、Apple M4 Max、M5 Maxシリコンでのテストは、ここで「ローカルで動作する」とは何を意味するかの実用的な基準であり、4ビット量子化があってこそ、それらのターゲットはそもそも到達可能になる——フル精度のフットプリントは55 GBを超える。導入を計画している人は、ハードウェアの数値をここで測定したものではなくM​etaのものとして扱うべきだ。

その他の人々にとって、この2つのモデルは代替品ではなく補完関係にあり、運用上厄介なのは、Anthropic APIモデルとセルフホストのMetaモデルを保持するには通常、まったく別々のスタックが必要になることです。OrcaRouterは、200以上のモデルを1つのOpenAI互換エンドポイントの背後に集め、プロバイダーの定価をそのまま渡し、マークアップを追加しません、上流プロバイダー間の自動フェイルオーバー、および呼び出しを構成するためのルーティングDSL — これでその構成のホスト側半分をカバーし、Metaのより大規模なMuse Spark 1.2教師はここで meta/muse-spark-1.2としてルーティング可能です。料金は100万トークンあたり入力$1.25、出力$4.25で、1,048,576トークンのウィンドウ全体に対応し、キャッシュ読み取りは$0.15です。これは週に4,280万トークンのトラフィックをこのカタログを通じて処理しており、これがこの構成の有用な点です。ホストされた教師モデルは他のすべてと同じキー上にあり、ローカルで実行するモデルはネットワークに一切触れる必要がありません。

正直な注記を3つ。いずれも間違えやすい点です。Muse Glimmer自体は当社のルートの一つではありません——モデルカードは当社のカタログに存在せず、このページはそうではないとほのめかすのではなく、そのとおりに述べています。以下のキャプチャは、実在するモデルMuse Spark 1.2のページであり、これはMuse Glimmerそのものではなく、Muse Glimmerの蒸留元となったチェックポイントです。Claude Sonnet 5.5もまた、リリースから一日後にして当社のカタログにはありません。そこへのルートはA​nthropic自身のAPIであり、Claude Sonnet 5は6月30日からここで$2.00と$10.00でルーティング可能です、ステージングターゲットを求める方のために。

OrcaRouter model page for meta/muse-spark-1.2, dated 2026-08-05, showing $1.25 input and $4.25 output per million tokens, a p50 time to first token of 2.05 s, a 1,048,576-token context window, and 42.8M tokens of recent traffic.

どうやって決めるか

スコアではなく、制約から始めよう。リクエストがマシンやネットワークの外に出られないなら、Muse Glimmer が答えであり、Index のギャップは無関係だ — オフラインで動作し、長文コンテキストの想起でフロンティアモデルに匹敵する 30B Apache 2.0 モデルは、その仕事にとって利用可能な最善のものだ。リクエストが複数ステップのソフトウェアタスクを完了しなければならないなら、Terminal-Bench で 0.5 パーセントを獲得する 30B モデルは、すでに所有しているハードウェアが何であれ、選択肢にすら入らない。

その2つの極の間で、決め手となるのは意見ではなく計測だ。自分のワークロードにおける完了タスクあたりのトークン数を、2通りの価格で評価する——1つは Claude Sonnet 5.5 の $2.00 と $10.00、もう1つは GPU の償却コストだ。比較全体を一変させる唯一の数字、Index タスクあたり $0.06 対 $7.60 は、ほとんどの人が自分で動かすことになるモデルについてのホステッド・レンタル価格であり、それを同条件の節約であるかのように引用するのは、このページが避けるために存在する安易な誤りだろう。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新