『Muse Spark 1.2 vs GLM-5.2 — クローズドなコーダー vs オープンなゼネラリスト』のタイトルカード。{{1}}Muse Spark 1.2 は閉じた南京錠アイコンの下に表示され{{/1}}、{{2}}GLM-5.2 は開いた箱アイコンの下に表示されています{{/2}}。
Guides & Insights

Muse Spark 1.2 vs GLM 5.2:クローズドコーダー vs オープンジェネラリスト

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

コンテキスト長100万トークンの2つのモデル。100万トークンあたりの価格差は15セント以内で、どちらもコーディング中心のエージェント業務を想定している——だが、それ以外に共通点はほとんどない。Muse Spark 1.2は、Metaが2026年8月5日に、共学習されたターミナルエージェント「Muse Code」とともにリリースしたモデルで、クローズドウェイトであり、トークンあたりのコストはより安く、現在のArtificial Analysis Intelligence Indexでは57点を獲得しており、推論を先に行わなければ返答できない。GLM 5.2は、Z.aiが6月中旬にリリースしたフラッグシップのオープンウェイトモデルで、MITライセンス、セルフホスト可能、最初のトークンまでの速度はおよそ5倍速く、それでも当社ゲートウェイを通過する実トラフィックは4.5倍多い——過去7日間で2億1,300万トークンに対し、Muse Spark 1.2は4,600万トークンだ。スコアが高く、トークンあたりのコストが安いモデルのほうがトラフィックは少ない。実際に人々がルーティングしているのは、オープンなほうだ。

この記事が扱うのは、その事実の正直なバージョンである。スコアリングと価格設定は、モデルがパイプラインにどのように適合するかよりも決定力が低く、この2つは適合性を決定するあらゆる軸において正反対の選択をする。独立した数値が存在する場合、それらはArtificial Analysisによるものである。MetaまたはZ.aiによる数値は、ベンダー報告と表示されている。レイテンシーとトラフィックの数値は、OrcaRouter自身の7日間の本番テレメトリである。

仕様の対比、一度に一つの次元ずつ

価格 — Muse Spark 1.2は100万トークンあたり入力$1.25 / 出力$4.25、キャッシュヒット時は$0.15。GLM 5.2は入力$1.40 / 出力$4.40、キャッシュ時は$0.26。Metaはどの行でも安価です。

コンテキスト — 両方とも1,048,576トークン。最大出力: MetaはMuse Spark 1.2について131,072トークンの上限を明記しており、GLM 5.2は128,000としている。

推論 — Muse Spark 1.2では推論が必須で、5段階の努力レベル(minimal〜xhigh、デフォルトはmedium)があります。GLM 5.2はreasoning_effortをhighまたはmaxで制御するハイブリッド推論を実行し、ディープ推論はデフォルトでオンになっています。

入力 — Muse Spark 1.2はテキスト、画像、動画、音声、PDFの入力をサポートしています。GLM 5.2はテキスト入力・テキスト出力です。

重み — Muse Spark 1.2はクローズドで、リポジトリもセルフホストの手段もありません。一方GLM 5.2はMITライセンスのオープンウェイトを提供しており、トークンあたり約40Bがアクティブな753BパラメータのMixture-of-Expertsです。

年齢 — Muse Spark 1.2 はこれを書いている時点で生後3日です。GLM 5.2 は6月13日から本番運用されており、8週間の現場経験と、その周りに構築されたホストやツールのエコシステム全体があります。

インデックスギャップは4ポイントです。バージョンの罠は現実です。

Artificial Analysisの現在のIntelligence Index(v4.1.1)では、Muse Spark 1.2が57点で185モデル中12位、GLM 5.2が53点となっています。GLM 5.2はオープンウェイトモデルとして最高スコアですが、Muse Spark 1.2には4点及びません。Muse Spark 1.2については、発表当日の評価で54と報告されたため、今でも多くの報道が54と引用しています。v4.1.1の再スコアリングではこれに2.7点が加算され、今回のアップデートで全モデル中最大の上昇幅となりました。どこかで「54 vs 51」や「54 vs 53」という表記を見かけた場合は、その差を実際のものとして扱う前に、それぞれの数値がどのバージョンのインデックスに基づくものかを確認してください。

4ポイント差が何を意味し、何を意味しないのかを述べておく価値はある。つまり、9つのベンチマークの複合指標では、同等の労力で、MetaのクローズドモデルがZ.aiのオープンモデルを上回るということだ。それは、Muse Spark 1.2がGLM 5.2をあらゆる面で上回ることを意味しない。両モデルは異なる経路でスコアに到達しているからだ。GLM 5.2は数学と推論の分野で突出しており(AIME 2026で99.2)、しかし有名なほど冗長で、弱点は大規模リポジトリ規模の深い作業だ。Muse Spark 1.2はその逆の形をしている。ターミナルでのコーディングや複数ファイルにわたるタスクに強く、思考時に消費するトークンがはるかに少ないため、タスクあたりの評価コストも劇的に低い。

A two-column scoreboard for Muse Spark 1.2 and GLM-5.2. AA Index (v4.1.1): 57 vs 53. Terminal-Bench 2.1: 80.1 vs 77.9. DeepSWE 1.1: 59.3 (Meta) vs 46.2. Weights: closed vs MIT open. Price in/out: $1.25/$4.25 vs $1.40/$4.40. p50 TTFT: 8.13 s vs 1.55 s.

ベンチマークが実際に分岐する箇所

{{1}}Terminal-Bench 2.1{{/1}}では、{{2}}両者の差はインデックス差が示唆するよりも小さい{{/2}}。そして{{3}}出所が通常以上に重要になる{{/3}}。同じ{{4}}Artificial Analysisハーネス{{/4}}では、{{5}}Muse Spark 1.2は80.1{{/5}}、{{6}}GLM 5.2は77.9{{/6}}を記録した。{{7}}Metaは独自ハーネスでMuse Spark 1.2が82.9だと主張する{{/7}}。{{8}}Z.aiが報告したGLM 5.2の最高値は82.7で{{/8}}、{{9}}同ベンチマークで80を超えた初のオープンウェイトモデルとなった{{/9}}。同じベンチマークで4つの異なる数値が出ている。{{10}}ハーネスの組み合わせでスコアは両方向に数ポイント動く{{/10}}ため、{{11}}単一のTerminal-Benchスコアの主張はレンジとして扱うべきだ{{/11}}。

注目すべき差異はDeepSWE 1.1、つまり長いエージェントループにわたって深いマルチファイル・リポジトリ規模の推論に重点を置いたベンチマークです。MetaはMuse Spark 1.2について59.3を報告していますが、これはベンダー提供の数値であり、まだ第三者による再現はされていません。GLM 5.2の公表されているDeepSWEは46.2で、その前身であるGLM-5.1は18.0でした。つまり、これはZ.aiが最も改善した一方で、依然として遅れを取っている領域です。もしあなたのワークロードが「50個のファイルを一貫して変更する」というものであれば、そのギャップがすべてを物語ります。ターミナルコマンドやスキャフォールディングが中心のワークロードであれば、それはほとんど意味を持ちません。

明白な枠組みを覆すもう一つの発見。ドメインごとにエージェントワークロードを実行する独立系のVals AIスイートは、Muse Spark 1.2を全体で5位(71.88%)に位置づけ、さらにFinance Agentで1位、TaxEvalで1位、HarveyのLegal Agentベンチマークで1位を獲得しました(それぞれ44、136、31モデルとの比較)。一方、Terminal-Bench 2.1は50ドメイン中14番目に過ぎません。Metaはこのモデルをコーダーとして売り出しましたが、独立した評価者は、金融・税務・法務文書エージェントで最も強力であると結論づけました。あなたのチームが契約書を作成したり、台帳を照合したりするなら、それがこの記事で最も有用な数字です。

オープンウェイト問題こそが真の分岐点だ

上記のすべては能力に関するものである。決定は主に所有権をめぐるものであり、この点において両者はこれ以上ないほどかけ離れている。

GLM 5.2はMITライセンスのオープンウェイトです。これは単に請求額だけでなく、交渉そのものを変えます。ワークロードが機密性が高い場合やボリュームが多い場合は、セルフホストできます。ウェイトは自分たちのものなので、再統合なしでプロバイダー間を移動できます。そして、それをルーティングするホストは価格とレイテンシで競争する必要があり、それがオープンウェイトの製品ラインが時間とともに安くなる理由です。753B MoEはラップトップ向けのモデルではありません。ほとんどのチームはそれを実行するよりもレンタルするでしょう。しかし、離れる選択肢、あるいは同じウェイトを固定費用で社内で実行する選択肢があることで、誰かが請求できる価格には下限が設けられます。

Muse Spark 1.2 は、その逆のバンドルを選びます。重みはクローズドで、ファーストパーティの唯一のルートは Meta の Model API ですが、それも現在は私たちがルーティングしています。その代わりに得られるのは、共訓練された製品、Muse Code です。モデルとともに出荷されたターミナルエージェントであり、リジェクションサンプリングされたハーネストラジェクトリでチューニングされ、リプレイ完全一致のイベントログランタイム上で、永続的で再起動しても安全なサブエージェントを実行し、バンドルされた /plan/grill/goal スキルを備えています。これは、「自分のハーネスに組み込む優れたモデル」とはまったく異なるものです。つまり、届いた時点で動作するエージェントなのです。トレードオフは、Meta の流儀で、Meta のツールで、macOS または Linux 上でのみ動作し、Windows クライアントも MCP も IDE プラグインもまだないということです。

Screenshot of the Meta AI Research announcement 'Introducing Muse Code and Muse Spark 1.2', dated August 5 2026.

トークンあたりの価格、タスクあたりの価格

トークン単位では、Muse Spark 1.2は入力・出力ともにより安価で、しかも応答が簡潔なモデルであるため、タスク単位でもコストが低く抑えられます。Artificial Analysisの測定によると、GLM 5.2はローンチ時にIntelligence Indexを実行するだけで出力トークンを1億4,100万消費し、その95%が推論トークンでした。これは主要モデルの中で最も冗長なモデルです。Muse Spark 1.2は同じタスクで9,500万トークンを消費し、タスクあたりのコストは$0.40でした。より多くのトークンをより高いレートで消費するということは、GLM 5.2のタスクあたりコストが、定価からは見えない形で膨らむことを意味します。推論モデルを比較する正しい方法は、100万トークンあたりの価格ではなく、完了したタスクあたりの価格で評価することです。

これらのモデルのうち1つだけに存在する3つ目の価格がある。Muse Spark 1.2には、入力$0.10/出力$0.20のコントリビューター層が搭載されており、標準層より1桁、GLM 5.2の定価と比べても同様の差で下回る。参入の代償は、Metaが将来のモデルをあなたのトラフィックでトレーニングすることを許可し、さらに毎分60リクエストという上限を受け入れることだ。この上限により本番環境でのファンアウトは不可能だ。これは割引の付いた法務レビューとして捉えるべきで、より安いSKUではない。資格を満たし、上限内で運用できるチームにとっては、価格比較が拮抗しなくなる。

レイテンシ: 2つのモデルは逆転する

インデックスギャップがMetaに有利なら、体感でのレイテンシープロファイルはGLM 5.2が断然勝る。OrcaRouter上の過去7日間の実際のトラフィックでは、Muse Spark 1.2は最初のトークンまでのp50が8.13秒、p95が10.00秒で、その後毎秒576トークンの出力という速度を誇り、エラー率は0%である。一方、GLM 5.2はp50が1.55秒で、最初のトークンまで5倍以上速いが、出力は毎秒78.5トークンとわずかで、エラー率は0.16%である。最大負荷のラボ環境では格差はさらに広がる。Artificial Analysisは、Muse Spark 1.2の最も高コストな推論設定であるxhighにおいて、最初のトークンまでの時間を26秒と測定した。

あるモデルは待たせてから速く返し、もう一方はすぐに始めて時間をかける。人間が注視しているもの——チャットのターンや対話型ターミナルセッション——には、GLM 5.2の方が体感が良く、だからこそ当ゲートウェイの対話トラフィックで優勢なのです。長い生成、大きなパッチ、ドキュメントの草稿では、Muse Spark 1.2は開始さえすれば最初に完了します。出力レートがGLM 5.2の7倍だからです。間違った数値を測定すれば、間違った理由で間違ったモデルを選ぶことになります。

2つ目の契約なしで両方を試す

両モデルは、OrcaRouterがプロバイダー料金を0%マークアップでそのまま通すため、OrcaRouterカタログではプロバイダー希望価格のままで提供されています。すなわち、Muse Spark 1.2は$1.25と$4.25、GLM 5.2は$1.40と$4.40です。つまり、上記の価格表示はステッカー価格ではなくインボイス価格であり、2つのモデル間の切り替えは、新しいインテグレーションを組むのではなく、同じキーに対するモデル文字列の1行変更で済みます。ベンダーが価格を引き下げた場合は、その値下げは当日中にこちら側にも反映されます。

ルーティングレイヤーがその存在価値を発揮するのは、まさにこの2つのモデルが補完関係にあるからだ。Muse Spark 1.2の弱点は、最初のトークンが遅いことと、スケール時の価格が高いことだ。GLM 5.2の弱点は、冗長さとディープリポジトリ推論だ。プランニングパスをMuse Spark 1.2に送り、並列ワーカーファンアウトをGLM 5.2に送るルーティングルール — あるいはMuse Codeのエンドポイントが遅い場合にGLM 5.2へフェイルオーバーするルール — は、両者が1つのエンドポイントの背後にあるため、構築に追加コストはかからない。そして、誕生から3日しか経っていないモデルにとって、自動フェイルオーバーは、本番パスを賭けずに試す方法なのだ。

Screenshot of the OrcaRouter model page for GLM-5.2 (z-ai/glm-5.2), showing $1.40 per million input tokens, a 1M-token context window, 128K max output and an OpenAI-compatible endpoint.

誰がどれを選ぶべきか

選択肢としてMuse Spark 1.2を選ぶのは、作業単位が大きく一貫性のある成果物であり、起動まで数秒待てる場合です:複数ファイルにまたがるリファクタリング、リポジトリ全体の生成、長時間のエージェントループ、そしてVals AIによれば金融・税務・法務文書の処理です。DeepSWEのリード、高い出力率、コントリビューターティアはすべて同じ方向を指しています。クローズドな重み、Metaのツール群、そして遅い最初のトークンを受け入れることになり、Metaの82.9と59.3は事実ではなく主張として読むべきです。

選びましょうGLM 5.2所有権とフィーリングが複合スコアよりも重要なら、セルフホストまたは移行できるオープンウェイト、インタラクティブな作業のための高速なファーストトークン、すでに連携して動作するハーネスとツールのエコシステム、そして利用可能な最強のオープンウェイト汎用能力を備えています。冗長さ、46.2 DeepSWE、そしてトークン数の差を考慮する前からトークンあたりのリスト価格が高いことも受け入れてください。

ほとんどのチームは、正直な答えはどちらか一方だけではないことに気づくでしょう。オープンな方は、ほとんどのトラフィックを流す主力であり、クローズドな方は、深いタスクや機密文書を担当する専門家です。複合指標では4ポイント差しかなくても、重みを誰が持つかは天と地ほどの差がある——それが選択であり、スコアよりもはるかに明確です。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube