Muse Code vs Muse Spark 1.1:Metaの6.7ポイントのアップグレードが実際に測定しているもの
Guides & Insights

Muse Code vs Muse Spark 1.1:Metaの6.7ポイントのアップグレードが実際に測定しているもの

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

まず引き算から始めよう。Metaが2026年8月5日にリリースしたターミナルコーディングエージェントMuse Codeの発表資料では、Terminal-Bench 2.1で82.9%を記録し、それをMuse Spark 1.1(この記事を読んでいる大半の人がすでに料金を払っているモデル)に対する6.7ポイントの向上としている。82.9から6.7を引くと76.2になる。これはMetaが公表した数字ではないが、公開Terminal-Bench 2.1リーダーボードでxhigh effortのMuse Spark 1.1として掲載されているスコア(7月に提出され、プリンストン大学のmini-SWE-agentハーネスで実行されたもの)と正確に一致する。

その偶然の一致は、この比較において最も有用な事実である。なぜなら、mini-SWE-agent は意図的に最小限のスキャフォールドだからだ — 数百行、永続的なサブエージェントなし、イベントログなし、プランニングスキルなし。Meta の 82.9% はMuse Spark 1.2が、Meta がモデルとともに共同トレーニングした専用設計のエージェント内で動作した結果である。もしその2つの行が6.7ポイントの差に相当するなら、見出しとなる世代間の向上は、モデルアップグレードハーネスアップグレードが1つの数値にまとめられたものであり、Meta はそれらを分離するものを何も公表していない。

Metaは1.1ベースラインにどのハーネスを使用したかを明らかにしていないため、この比較は証明されたというより示唆的なものにすぎない。しかし、これは現在APIを通じてMuse Spark 1.1を呼び出しているすべての人にとって、選択肢を組み替えるものであり、この対戦の正直な見方を示している。すなわち、あなたが選んでいるのは2つのモデルの間ではない。あなたが選んでいるのは、自分で動かすモデルと、あなたに代わってより新しいモデルを動かすエージェントの間であり、その2つのうちどちらか一方だけがMeta以外の誰かによって測定されている。

これらは同じカテゴリーではなく、仕様書にもそう記載されています。

このペアリングをめぐる混乱の半分は、Muse Codeをモデルリリースとして扱っていることに起因する。実際はそうではない。Muse CodeはCLIであり、Muse Spark 1.2は、そのCLIが呼び出すものだ。

これは何か — Muse Code は、1行でインストールできるターミナルエージェントです(curl -fsSL https://dev.meta.ai/install.sh | bash)。Muse Spark 1.1 は、独自のコード、独自のエージェントフレームワーク、またはカスタムベースURLを受け付ける任意のCLIから呼び出すモデルエンドポイントです。

基盤モデル — Muse CodeはMuse Spark 1.2を実行します。これはエージェントと共同でトレーニングされています。Muse Spark 1.1は7月の世代で、今も提供され、リストにも記載されています。

動作環境 — Muse CodeはmacOSとLinuxのみ、ターミナルのみ、GUIなし、IDE拡張機能なし。Muse Spark 1.1は、HTTPSが動作する場所ならWindowsを含めどこでも動作します。

入力 — Muse Code はリポジトリとプロンプトを受け取り、Muse Spark 1.1 は単一の 1,048,576 トークンコンテキスト内でテキスト、画像、動画、音声、PDF ドキュメントを受け付け、テキストを返します。

ステータス — Muse Code はパブリックベータであり、その旨が明示されています。Muse Spark 1.1 は2026年7月から一般提供されており、実際の本番トラフィックを処理しています。

定価 — どちらもMeta Model APIを通じて課金され、標準ティアでは入力トークン100万個あたり$1.25、キャッシュ入力は$0.15、出力は$4.25です。料金表は同じ料金表です。

最後の行は人々を驚かせるものであり、当然の前提を打ち壊す。Muse Codeの採用は、既に実行中のものよりトークンあたりのコストが高くなるわけではない。かかるコストは別の通貨で測られる——プラットフォームサポート、レイテンシ、モダリティ、そして低価格ティアではソースコードだ。それが議論に値する4つの軸である。

それらが分岐するベンチマーク、ハーネスを取り付けた状態で読み取る

MetaはMuse Spark 1.1に対する2つの世代間デルタを公表した:Terminal-Bench 2.1で+6.7ポイントおよびDeepSWE 1.1で+6.3。どちらもベンダー報告であり、どちらも方法論の説明なしに画像として公開されたチャートに基づいており、第三者による再現は行われていない。これらを差し引くと、Metaが暗に示す1.1ベースラインはおよそ76.2%および53.0%になる。

さて、Metaの82.9%を、引用されなかったボードの隣に置いてみよう。本稿執筆時点の公開Terminal-Bench 2.1リーダーボードでは、Claude Codeがペアを組んでいるのはClaude Fable 5で、83.8% ± 1.2%、Codexがペアを組んでいるのはGPT-5.5で、83.1% ± 1.1%、Terminus 2はClaude Fable 5とペアで80.4%、Cursor CLIがペアを組んでいるのはGrok 4.5で、79.3%、そしてmini-SWE-agentはMuse Spark 1.1とペアで76.2%で8位だ。Muse Codeの自己申告の82.9%は3位に入るだろう。Metaのスライドには登場しない2つのエージェント・モデルペアの下である。そのスライドが代わりに比較しているのはClaude Opus 5で86.7%、GPT-5.6 Terraで81.8%、そしてGrok 4.5は81.6%で、いずれも最大努力の個別実行だった。

2つのボード、1つのベンチマーク、一致しない数字——そしてArtificial Analysisを見れば、まったく別のスケールが現れる。同社の独立したTerminal-Bench v2.1評価では、GPT-5.6 Solが89.5%近くで最高となり、公開リーダーボードの上限は83.8%である。これらの当事者のいずれも嘘をついていない。Terminal-Benchの1行は、ハーネス、モデル、努力設定、計算許容量のスコアであり、そのいずれかを変更するだけで、Metaが世代として主張する全差よりも結果が動く。

だからこそ、公開ボード上の興味深い数値は精度の列ではなく、コストの列です。Muse Spark 1.1が76.2%のランを終えるのにかかった費用は$198.05です。Claude Code with Claude Fable 5は83.8%を$552.67で得て、Codex with GPT-5.5は83.1%を得るために$2,059.19を支払いました。つまり、最初のケースでは2.8倍の費用で7.6ポイントの精度を得たことになり、2番目のケースではおよそ10倍の費用で得たことになります。これは、同じオペレーターが同じタスクを同じルールの下で計測したものであり、まさにMetaのチャートが提供してくれない同条件比較(apples-to-apples)です。また、ボードは環境を悪用して解かれたタスクに対して減点を行います。Muse Spark 1.1の提出にはそのような減点はありませんが、Cursor CLIのGrok 4.5のランには9ポイントの減点があります。

Metaはその82.9%の費用額を公表しなかった。

Muse Spark 1.1 がすでにできることで、Muse Code にはできないこと

Muse Code の売りは、共訓練されたエージェントが「外部モデルを包む汎用ラッパー」よりも優れているという点だ——これは Meta の表現であり、Meta の主張であり、他の誰にも検証されていない。それは合理的な主張だ。また、Muse Spark 1.1 がまさに埋めるために作られたギャップを狙ったものでもある。

Muse Spark 1.1は、Model Context Protocolをネイティブに話し、外部フレームワークなしで独自のMCP接続を処理し、プライマリエージェントとサブエージェントの役割を内部でオーケストレーションし、新しいツールやカスタムスキルに対してゼロショットで汎化します。Meta自身が発表した1.1の数値は、ツール使用の数値でした:MCP Atlasでの88.1はスケールしたツール使用のスコアで、Claude Opus 4.8で報告された82.2やGPT-5.5の75.3を上回り、JobBenchでは54.7でした。すべてベンダー報告によるもので、すべて7月のもので、独立して再現されたものはありません。それでも論点は有効です:1.1は、誰かがエージェントを後付けしたチャットモデルではありません。OpenCode、Cline、またはカスタムエンドポイントを受け付ける任意のCLIに1.1を組み込めば、今日からエージェントを利用できます。

そして、Muse Codeが構造的に触れることのできないものすべてがある。Muse Spark 1.1は、画像、動画、音声、PDFを1つのコンテキストウィンドウで推論できる。ターミナル型コーディングエージェントには、そのような面は使い道がなく、公開する手段もない。もしワークロードが、デザインモックをコンポーネントに変換すること、サポートコールを文字起こししてトリアージすること、または400ページの仕様書を実装と相互参照することであれば、新しい方の製品の方が能力が低い——そして、Metaの1.2世代のポジショニングは「混合メディアを対象としたマルチモーダルな深層調査」から、複数ファイルのリファクタリングやリポジトリ全体の生成へと移行しており、1.2での動画や音声に関する公表された成果は誰からも出ていない。

本当の非対称性は逆方向にあり、それは能力ではなく実行時の性質です。Muse Codeは、すべてのモデル呼び出し、ツール実行、承認、編集をローカルイベントログに追記します。Metaによれば、これによりセッションはリプレイ正確かつ再起動安全になります。クラッシュしても、エージェントはコンテキストを再導出するのではなく、停止した場所から再開します。そのバックグラウンドエージェントは、サブタスクごとに生成・破棄されるのではなく、セッション全体にわたって持続します。Metaの根拠は単一のケーススタディ、つまりNVIDIA Hopperハードウェア上でGPUカーネルを最適化する、24時間・1000回以上のツール呼び出しを含む実行です。高速化の数値は公表されておらず、所要時間が主張の根拠となっています。もしも、ハーネスがステップ300で何をしていたかを忘れてしまい、9時間のマイグレーションを失った経験があるなら、それは本当に欲しい機能です。そして、モデルにどれだけMCPサポートを追加しても、それは得られません。

同じ定価、セカンドティアを読むまでは。

標準ティアは両側で同一であるため、この比較における価格論点は、MetaがMuse Codeとともに導入したティアに完全にあります。コントリビューターティアは、入力トークン100万件あたり0.10ドル、キャッシュ入力0.002ドル、出力0.20ドルで、入力では12.5倍、出力では21倍、キャッシュ入力では75倍安くなります。その代わりに、将来のMetaモデルのトレーニングにあなたのプロンプトと生成結果を使用する明示的な許可が必要です。標準ティアのトラフィックは、Metaによると、そのようには使用されません。

現実的なエージェントのステップをそれで実行すると――リポジトリコンテキストとして60,000トークンが入力され、計画とパッチ適用として3,000トークンが出力される――そして1,000ステップのコストは、標準ティアのコールドで87.75ドル、リポジトリコンテキストがキャッシュにヒットした場合で21.75ドル、コントリビューターのコールドで6.60ドル、コントリビューターでウォームキャッシュの場合で0.72ドルです。Meta自身の24時間カーネル実行は、コードを保護するティアでは90ドル近くになり、保護しないティアでは1ドル未満になります。

これは請求上の選択ではありません。コーディングエージェントのプロンプトとは、あなたのコードベース — 内部API、回避策が存在する理由を説明するコメント、フィクスチャがたまたま含むものなど — のことです。オープンソースのツリーでは、コントリビューター層はほぼタダ同然のお金のようなものです。プロプライエタリなリポジトリでは、それは割引の服を着たデータライセンスの決定であり、クラウド請求書を監視する人ではなく、データ取り扱いを承認する人の前に置かれるべきものです。Metaは、データが少なくともそれだけの価値があるため、割引を12倍に設定しました。

Muse Spark 1.1 を使い続けることは、その問題を完全に回避することであり、そのコストが正確にいくらで、どこに発生するのかを知っておく価値があります。Muse Spark 1.1 は OrcaRouter カタログに $1.25 と $4.25 で掲載されています — Meta のリストプライスと1セント単位で一致しています。当社はマークアップ 0% でプロバイダー価格をそのままパススルーしているため、Meta が料金を変更した日には、契約サイクルを待たずに当社側にも反映されます。当社の7日間の本番テレメトリによると、time-to-first-token の p50 は 1.84 秒、p95 は 6.00 秒であり、これはどのベンチマークハーネスが提示するものよりもはるかに有用な目安です。Muse Spark 1.2 は当社のカタログにはなく、Meta が直接提供しており、他では入手できません。したがって、この比較の新しい側には、現時点では構造上、プロバイダーが1つしかなく、フェイルオーバーパスもありません。これを評価する場合、その単一サプライヤーへのエクスポージャーも評価対象の一部です。

打ち上げ報道で誰も言及しないレイテンシーのトレードオフ

Artificial Analysisは、各モデルの最大推論努力において独立に測定し、Muse Spark 1.1の最初のトークンまでの時間は2.90秒、Muse Spark 1.2のそれは26.12秒でした。出力速度は毎秒213.5トークンから165トークンに低下しました。その見返りは、Intelligence Indexが51から54へと3ポイント向上し、185モデル中で22位から13位に躍進したことです。

汎用モデルのリリースとして読むと、これは悪い取引だ。待ち時間が9倍になるのに、得られるのは3ポイントだけだからだ。しかし、コーディングエージェントのエンジンとして読むと、明らかに正しいものだ。なぜなら、12ファイルのリファクタリングを待っている人にとって、26秒のプランニングは気にならないが、チャットの完了を待っている人にとっては、そのすべてが気になるからだ。これこそが、この比較のそれぞれの側が誰に向けられているかを最も明確に示しており、Metaによる主張ではなく、第三者による測定結果である。

また、コードだけを気にしている場合でも、切り替えは無料ではないことを意味する。Muse Spark 1.1 に向けていた対話的なものすべて——インライン補完、レビューボット、ドキュメント上のチャットサーフェス——は、多大な労力をかけて1.2世代に移行したとしても、実質的に悪化する。アップグレードは対象を絞ったものであり、対象を絞ることには方向性がある。

実際に実行すべきものはどれか

作業がリポジトリでない場合は、Muse Spark 1.1 を使い続けてください。 マルチモーダルパイプライン、ロングコンテキスト分析、ミックスメディア研究、インタラクティブなもの、Windows 上のもの、MCP 経由で接続済みで動作しているもの。Muse Code のローンチにはこれらを改善するものは何もなく、レイテンシ測定は少なくともそのうちの1つを悪化させます。

失敗モードが所要時間なら、Muse Code を試してください。 モノレポ移行、依存関係のアップグレード、一週間かかるリファクタリング — エージェントが筋道を見失うため、現在あなたが付きっきりで見守っている仕事です。イベントログと永続的なバックグラウンドエージェントはまさにそのような仕事を対象としており、数ポイントのベンチマーク差は、実行時間が最長のケースで最も影響が小さくなります。ベータ版で、スクラッチクローンで、失っても構わないリポジトリで試してください。

モデルを選ぼうとしているなら、正直な実験をしてください。ハーネスを一定に保ち、その下でMuse Spark 1.1をMuse Spark 1.2に交換してください。これは、Metaのチャートがまとめてしまっている唯一の変数を分離し、共学習プレミアムが本物か、それとも1.2がどこに置いても単に有能なコーディングモデルなのかを確かめる唯一の方法です。単一のゲートウェイにより、これは調達作業ではなく文字列の変更で済みます。Muse Spark 1.1、Claude Opus 5、GPT-5.6 Terra、Grok 4.5、Claude Fable 5はすべて、単一のOrcaRouterキーの背後にリスト価格で並び、プロバイダー間の自動フェイルオーバーが備わっているため、比較セットを維持しておくコストはかかりません。Muse Spark 1.2は例外で、Metaから入手する必要があります。

何かをインストールする前に尋ねる価値のある質問

Muse Code を Muse Spark 1.2 の代わりに 1.1 に向けることはできますか?

Metaの発表資料にはそのことは書かれておらず、またこの2つが共同トレーニングされたペアとして出荷されたことは、それがサポートされている、または有用であるという主張に反対する論拠です。ただし、逆方向は十分に文書化されています。Muse Spark 1.1はカスタムエンドポイントを受け入れる任意のエージェントで動作し、今日ほとんどの人がそれをエージェントとして実行しているのはその方法です。もしあなたの目的が統制された比較であるなら、1.1と1.2をあなたのハーネスで実行し、Metaのものを曲げようとはしないでください。

Muse Spark 1.1にもコントリビューター層は適用されますか?

MetaはMuse CodeとMuse Spark 1.2のリリースに合わせて2段階構造を導入し、公開された料金表ではコントリビューター価格がそのリリースに紐付けられています。Metaが別段の発表をするまで、12倍のディスカウントは1.2世代のオファーと見なしてください。また、1.1のワークロードは$1.25と$4.25で価格設定してください。OrcaRouterをご利用の場合、定義上リスト価格での契約となるため、オプトインまたはオプトアウトするデータ共有ティアはありません。

では、6.7ポイントという主張は間違っているのでしょうか?

いいえ — それは未監査で、仕様が不十分です。それは別問題です。Metaは、Muse Codeのものと同等のハーネスで1.1ベースラインを実行した可能性が十分にあります。その場合、その向上はクリーンなモデル対モデルの結果です。しかし、方法論は公表されておらず、暗に示されたベースラインは最小限のサードパーティ製スキャフォールドのスコアに正確に一致し、同じベンチマークは実行する者によって3つの異なるスケールを生み出します。+6.7は方向性の指標として扱い、それを前提に計画を立てる前に、自分自身の数値を取得してください。

これを解決してくれるものは何だろうか

1つの提出。もしMetaがMuse Codeを、他の全員が提出したのと同じルールで公開のTerminal-Bench 2.1リーダーボードに載せたなら——タイムアウトやリソースを変更せず、コスト欄を記入し、ハックによる減点を適用して——82.9%は、Muse Spark 1.1の名前の隣にある76.2%や、最上位の83.8%と比較可能になり、この議論全体は半日で決着する。それまでの間、この比較において独立に検証された唯一の数値は古いモデルのものであり、それによるとMuse Spark 1.1は、一度に読み切れるほど小さなスキャフォールド内で、200ドル未満の費用でTerminal-Bench 2.1の4分の3を解決した。

注目すべき2つ目の点は、より範囲が絞られ、より早くやってくる。すなわち、Artificial Analysisが1.1世代向けにすでに公開しているコーディングとエージェンティックのサブスコアを、1.2世代についても公開するかどうかだ。エージェンティック性能は、1.1世代の公開指標の中で大差で最弱だった。それはまさに、Metaが修正したと主張する数字であり、そしてまさに、Metaの外部ではまだ誰も測定していない数字である。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube