
Muse Code: Meta、自社ベンチマークで負けるコーディングエージェントをリリース
- metaNEWMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenNEWQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 191 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEWAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
- grokxAI: Grok 4.52026-07-0856知能72コーディング
- tencentTencent: Hy32026-07-0642知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3055知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
- z-aiZ.ai: GLM 5.22026-06-1653知能69コーディング60数学
ベンダーは通常、自分たちが2位になるチャートを公開しない。Metaはそのうちの3つを公開した。Muse Code——Meta Superintelligence Labsが2026年8月5日にリリースしたターミナルコーディングエージェントであり、同日リリースのMuse Spark 1.2上で動作する——のローンチデッキでは、Claude Opus 5は、Metaが表示対象に選んだすべてのボードで先行している。その中にはMetaが自ら構築し管理しているものも含まれる。Terminal-Bench 2.1では差は3.8ポイント。DeepSWE 1.1では5.7で、GPT-5.6 Terraも先行している。Meta自身の内部コーディングベンチマークでは8.8である。このローンチのバイラル版——「DeepSWE 1.1で59%、Grok 4.5とGemini 3.6 Flashを上回る」——は真実であり、これは利用できる中で最も控えめな真実の記述である。
それが今回の発表をより興味深いものにしている。決して魅力を減らしてはいない。Metaは、自分たちが勝てないベンチマーク資料を公開しておきながら、それでも公開した。スコアは彼らの売りではないからだ。彼らが売りにしているのは、24時間のジョブに耐えるランタイムと、競合他社を一桁以上下回る価格だ。ただし、Metaに自分のリポジトリを読ませても構わないという条件付きだが。以下のすべてのベンチマーク数値は、Meta自身のチャートに基づくものであり、それらは方法論を伴わずに公開された。独立した測定が存在する場合には、その文にその旨が明記される。
Metaが実際にリリースしたもの
同じ日に、二つのことが意図的に結びつけられた。
• Muse Code — ターミナルコーディングエージェント、パブリックベータ版、1行でインストール: curl -fsSL https://dev.meta.ai/install.sh | bash。macOSとLinuxのみ対応。ネイティブWindowsビルドはなく、GUIもIDE拡張もありません。Metaは、その役割を、大規模リポジトリにわたる複雑なソフトウェアエンジニアリング、つまり変更の計画、コードの記述、結果の検証を担当することと説明しています。
• Muse Spark 1.2は、Meta の推論モデルをコーディング向けに改訂したバージョンで、1,048,576 トークンのコンテキストを備え、Muse Code 内および Meta Model API 経由でパブリックプレビューとして利用できます。Meta は、コーディングタスク向けのトレーニング計算を拡大し、トレーニング環境の多様性を広げたとしています。対象としているのは長期的な作業、すなわちリポジトリ全体の生成、複数ファイルにわたるリファクタリング、長時間に及ぶデバッグです。
結合こそが主張だ。Metaは、この2つが共同でトレーニングされたと述べており、その組み合わせによって「外部モデルを包む汎用ラッパーよりも優れたツール使用、より少ない再試行、より高品質な出力」が生み出されるとしている。それがMetaの表現であり、Metaの主張だ。共同トレーニングによる優位性が本物なのか、それともMuse Spark 1.2はどこに置いても単に有能なコーディングモデルとして振る舞うだけなのかを確かめるために、競合ハーネス内でこのモデルをテストした第三者はいない。
エージェントには3つのバンドルスキルが同梱されており、それらはマーケティングコピーよりも意図された働き方をよく表しています:/planは何かを書く前に承認ゲート付きのプランを生成し、/grillはそのプランをストレステストし、/goalは明示された目標の達成に向けて推し進めます。プランを立て、プランを攻撃し、そして実行する——これは、経験豊富なClaude CodeやCodexユーザーが手動でたどり着いたパターンであり、現在は第一級のコマンドとして提供されています。
ベンチマークデッキ、正直に読む

Metaは、Terminal-Bench 2.1、DeepSWE 1.1、自社のMeta Internal Coding Bench、そしてGDPvalに関する比較結果を公開しました。Metaが報告した数値は以下の通りです。
• Terminal-Bench 2.1 — Claude Code で最大努力の Claude Opus 5 は86.7%、Muse Code での Muse Spark 1.2 は82.9%、Codex での GPT-5.6 Terra は81.8%、Grok Build での Grok 4.5 は81.6%。2位であり、2位から4位までは1.3ポイント差です。
• DeepSWE 1.1 — Claude Opus 5 65.0%、GPT-5.6 Terra 64.8%、Muse Spark 1.2 59.3%。3位であり、しかもその差が表面的ではなく決定的である唯一のボード。
• Meta Internal Coding Bench — Claude Opus 5 79.4%、Muse Spark 1.2 70.6%。メタのホームグラウンドとも言えるベンチマークであり、メタにとって最大の敗北となった。
• 世代を重ねるごとに — Metaは、Muse Spark 1.1に対してTerminal-Benchで+6.7ポイント、DeepSWEで+6.3ポイントを報告しています。これらはデッキの中で最大の数字であり、Muse Spark 1.1ユーザーが実際に注目すべき数字です。
ひとつの計算上の難点を挙げる価値はある。それが、上記のすべてを方向性のものとして扱う理由だからだ。Meta の +6.7 を差し引くと、Muse Spark 1.1 は Terminal-Bench 2.1 で 76% 付近に落ち着く。だが、公開されている tbench.ai のリーダーボードには、7月下旬以降、Muse Spark 1.1 の検証済みスコアとして 80.0% が載っている。両方の数値は正直でありながら、それでも食い違うことがあり得る。なぜなら、Terminal-Bench の1行はモデルのスコアではないからだ。それは、ハーネス+モデル+努力設定に対するスコアであり、Meta が 1.1 用に使った内部ハーネスは、tbench が実行したものではなかった。この単一の事実は、個々の論争中の数値よりも、ベンダー間のベンチマーク比較に対して大きな損害を与える。そして、それは次のセクションへと直接つながる。
ランタイムが製品です。

スコアを剥がせば、残るのは「死なないこと」についてのエンジニアリング的な売り込みだ。それを支えるのは2つのメカニズムである。
最初はイベントログです。Muse Codeは、すべてのモデル呼び出し、すべてのツール実行、すべての承認、そしてすべての編集をローカルログに追記します。Metaによれば、これによりセッションはリプレイ完全一致かつ再起動安全になります。つまり、killしても、クラッシュしても、マシンを失っても、エージェントはコンテキストをゼロから再導出するのではなく、停止した正確な位置から再開します。競合他社にも品質にばらつきのあるクラッシュリカバリ機能はありますが、それを目玉にしているところはどこにもありません。また、これは偶然にも監査証跡でもあります。自律プロセスが作業ツリーに対して行ったすべてのことを記録した完全なローカル記録であり、セキュリティレビューが求めるまさにその文書で、ほとんどのエージェントCLIには生成できないものです。
2つ目は、Metaが非同期バックグラウンドエージェントと呼ぶものです。通常のサブエージェントとの違いは、サブタスクごとに生成されて破棄されるのではなく、セッション中ずっと生存し続け、自ら次のステップを実行し、メインループに報告するタイミングを選択することです。その利点と主張されているのは、オーケストレーターが委任のたびに起動コストを支払う必要がないため、レイテンシが低くなることです。
メタの裏付け証拠は1件のケーススタディである。Muse Codeが24時間にわたって1,000回以上のツール呼び出しを実行し、NVIDIA Hopperハードウェア上でGPUカーネルを自律的に最適化し、メタが提供されたベースライン実装に対する大幅な改善と呼ぶ成果を達成したというものだ。速度向上の数値は公表されていないため、注目すべき量は結果ではなく持続時間にある。人間の介入なしでの1,000回のツール呼び出しは、50回の呼び出しによるリファクタリングとは異なる障害面を呈する。また、3.8ポイントのベンチマーク差よりも、9時間目にプロセスが生存しているかどうかの方がはるかに重要となるワークロードである。
価格は武器である——そしてその一部はソースコードで支払われる
Muse Code のサブスクリプションはありません。課金はトークン制で、2つのティアのいずれかに基づきます。そして、そのティア間の差が、今回のローンチで最も攻撃的な点です。
• Standard — 入力トークン100万個あたり$1.25、キャッシュ入力100万個あたり$0.15、出力100万個あたり$4.25。このティアのプロンプトは、Metaの製品の改善には使用されません。
• コントリビューター — 入力100万トークンあたり$0.10、キャッシュされた入力100万トークンあたり$0.002、出力100万トークンあたり$0.20。その代わりに、Metaはデータをモデルの改善に使用する場合があります。
これは入力で12.5倍安く、出力で21倍安く、キャッシュ入力で75倍安い。これを現実的なエージェントステップに当てはめてみると——リポジトリコンテキストの入力60,000トークン、プラン・アンド・パッチの出力3,000トークン——価格グリッドの四隅は驚くべきものになる。コールドプロンプトのスタンダードティア:1ステップあたり8.8セント、1,000ステップあたり87.75ドル。リポジトリコンテキストがキャッシュにヒットするスタンダードティア:1ステップあたり2.2セント、1,000ステップあたり21.75ドル。コールドのコントリビューターティア:1ステップあたり0.66セント、1,000ステップあたり6.60ドル。ウォームキャッシュのコントリビューターティア:同じ1,000ステップで0.72ドル。
同じ作業でも、2つの選択次第で、コストは122倍にもなれば、その122分の1にもなる。Meta自身による24時間・1,000コールのカーネル実行では、データを保護するティアではトークン代が約90ドルかかるのに対し、保護しないティアでは1ドル未満だ。
これは、このローンチがチームの前に突きつける実際の決定事項であり、価格決定ではない。ターミナルコーディングエージェントはコードベースを読み取る——それがこのエージェントの全機能だ——したがって、コントリビューターティアのプロンプトには、あなたのソース、内部API、回避策が存在する理由についてのコメント、そしてリポジトリがたまたま保持しているテストフィクスチャが含まれる。サイドプロジェクトやオープンソースのツリーにとって、コントリビューターティアはほぼ無料の金のようなものだ。しかし、プロプライエタリなコードベース、あるいは顧客データに触れ得るあらゆるリポジトリにとって、これは値引きという衣をまとったライセンス決定であり、クラウドの請求額を見ている人の前ではなく、データ取り扱いを承認する人の前に出すべきものだ。メタが12分の1の価格に設定したのは、そのデータがメタにとって少なくともそれだけの価値があるからだ。
API経由では取得できないもの

82.9% は Muse Spark 1.2 に帰属しますMuse Code 内では、。独自のエージェントフレームワークからモデルを呼び出す場合、あなたが購入したのは、その組み合わせのうちモデル側の半分だけであり、ハーネス側の半分は一切ありません — イベントログも、永続的なバックグラウンドエージェントも、Meta の共トレーニングの主張が何らかの意味を持つなら、調整されたツール使用の挙動もありません。つまり、ここには2つの別々の評価があり、それらを混同することが今週最も犯しやすいミスです:Muse Code はあなたがすでに実行しているエージェントに勝るのか、そして Muse Spark 1.2 はあなたが現在呼び出しているモデルより優れているのか。
2つ目の質問の方が低コストで答えられます。ハーネスを一定に保ったまま、その下のモデルを入れ替えるだけで済むからです。可用性について正確に述べておくと、Muse Spark 1.2 は Meta が直接提供しており、OrcaRouter のカタログには含まれていません。Muse Spark 1.1は、$1.25 と $4.25 で提供されており、これは Meta の定価とまったく同じです。というのも、OrcaRouter はマークアップ 0% でプロバイダーの価格をそのまま通しているためであり、だからこそベンダーの価格変更は契約サイクル後ではなく発生当日にこちら側に反映されます。1.1 の 7 日間の本番テレメトリでは、p50 time-to-first-token が 1.84 秒、p95 が 6.00 秒で、これはどのベンチマークハーネスが示す値よりも実用的なレイテンシーの目安です。
今週のような一週間における単一ゲートウェイの実用的価値は、比較対象セット(Claude Opus 5、GPT-5.6 Terra、Grok 4.5、Gemini 3.6 Flash、Muse Spark 1.1)が一つのキーの背後に定価で収まることにある。つまり、A/Bテストは調達作業ではなく文字列の変更で済むのである。また、これはMetaのオファーにおける構造的リスクもカバーする。Muse Spark 1.2にはプロバイダーがちょうど一つしかなく、設計上、単一障害点となるからだ。プロバイダー間の自動フェイルオーバーは、Metaにとっての悪い午後があなたのエージェントにとっても悪い午後になるかどうかの分かれ目である。
これも、1.2がひっそりと、しかも遅いままリリースされた理由です。
Muse Spark 1.2 は、8月5日に発表もなく、数字の変更もなくMetaのAPIに登場しました。1Mのコンテキスト、$1.25と$4.25、Muse Spark 1.1と同じ5段階の推論ダイヤルはすべて同じです。変化した唯一の点は外部から測定されたものでした。Artificial Analysis は、最大推論努力時のファーストトークンまでの時間を、1.1の2.90秒に対して26.12秒と計測し、Intelligence Indexの3ポイント(51から54)を獲得したのです。汎用モデルのリリースとして見ると、これは奇妙な取引です。3ポイントのために待ち時間が9倍になるのです。
共同トレーニングされたエージェントのモデル側として解釈すると、これは明らかなトレードオフです。12ファイルのリファクタリングを待っている人は、26秒のプランニングに気づきません。しかし、チャットの完了を待っている人は、そのすべてに気づきます。Metaは、チャットモデルを静かに出荷して、誰もレイテンシーを測定しないことを願っていたわけではありません。それは、車の前にエンジンを出荷していたのであり、発表は車が届いたときに行われました。MetaのMuse Sparkデベロッパーページも、現在は1.2と表示されています。
この結論は、このファミリーをその広範さゆえに採用した人々への警告でもある。Muse Spark 1.1は、テキスト、画像、動画、音声、PDFを扱えるマルチモーダル推論モデルとして販売され、複合メディアのリサーチに適しているとされていた。バージョン1.2の位置付けはソフトウェア業務であり、その発表資料はコーディングエージェントである。マルチモーダル機能は削除されてはいないが、もはやMetaが最適化や宣伝を行う対象ではなくなっている。また、Meta以外の誰も1.2の動画や音声の結果を公開していない。
Muse Codeがまだ薄いところ
• ベータ版です、そのように明記されています。イベントログの保証については、Meta以外の誰によっても検証されていません。
• macOSとLinuxのみ。Windows開発者はWSLを使うか、全く使えないかのどちらかであり、これは企業のフリートにとって単なる不便ではなく、実際の制約です。
• ターミナルのみ。GUIもなく、IDE統合もなく、Codexがすでに提供しているようなクラウド上でホストされる並列エージェントもありません。Metaの発表資料にはMCPサポートへの言及はありません。
• 公開された方法論はどのベンチマークチャートの背後にも存在せず、エージェントまたはMuse Spark 1.2のコーディングサブスコアの独立した評価もまだない。Artificial Analysisは1.2の複合インデックスを持っているが、1.1について公開しているベンチマーク別のコーディングとエージェントの内訳は持っていない。そして、1.1のエージェントスコアは他のどの側面よりも大幅に低く、それがまさにこのリリースを決着させる数字である。
• Metaは出遅れている。Claude CodeとCodexには、1年の習慣、プラグインエコシステム、そしてそれらを中心に構築されたチームワークフローがある。クラッシュセーフなイベントログは何かを試す良い理由にはなるが、それだけでチームを移行する理由にはならない。
人々が実際に尋ねている質問
Muse Codeは無料ですか?
いいえ、しかしサブスクリプションもありません。競合するClaude CodeやCodexのプランとは異なり、Muse CodeはMeta Model APIを通じて純粋にトークン単位で課金されます。したがって、コストはセッションが送信するリポジトリコンテキストの量に応じてスケールし、従業員数には依存しません。これは、たまに大量に使うユーザーに有利で、常時稼働のエージェントには不利です。コントリビューターティアは無料に近いため、価格は試用への実質的な障壁にはなりません。
コントリビューターティアは、私のプライベートコードを学習に使用しますか?
その層に関するMetaの規約では、データがモデルの改善に使用される可能性があり、コーディングエージェントのプロンプトにはあなたのコードが含まれます。Metaは、標準層のプロンプトが製品の改善に使用されることはないと述べており、それが専有情報を扱う際に使用すべき層です。この選択は、割引が付随するデータ処理の決定として扱い、請求上の好みとしては扱わないでください。また、割引はトークンごとに適用されるため、静かにグレードを下げる動機は、使用量が増えるのに正確に比例して大きくなることに注意してください。
Muse Spark 1.2 を Claude Code や自分のエージェントで使用できますか?
このモデルはMuse Codeとは独立にMeta Model APIを通じて利用可能です。つまり、カスタムエンドポイントを受け付けるものであれば、何でも使用できます。ただし得られないのは、Metaがベンチマーク結果の功績とする共学習ペアリングです。正直な見込みとして、チューニングに使用されたハーネスの外で実行されたモデルは、グラフ上の数値よりも低いスコアになります。エージェントではなくモデルを評価することが目的であれば、独自のハーネスでClaude Opus 5およびGPT-5.6 Terraと比較して実行し、デッキは完全に無視してください。
今週は誰がそれをインストールすべきですか
長時間にわたる自律ジョブを実行するなら——マイグレーション、モノレポ全体の依存関係アップグレード、エージェントが現在地を見失うために今は付きっきりで見守る必要があるようなあらゆる作業——Muse Code はスクラッチクローンで半日試す価値があります。イベントログと永続的なバックグラウンドエージェントはまさにその障害モードを対象としており、ベンチマークの遅れはタスクの所要時間が最も長い場合に最も小さくなります。
オープンソースまたは非機密のコードベースを扱っていて、コストが制約条件であるなら、コントリビューターティアは現在のコーディングエージェント市場で最も注目すべき数字です。そして、1ステップあたり0.66セントというのはタイプミスではありません。
Claude CodeやCodexでプロプライエタリなリポジトリに対してチームを運用している場合、現時点で移行を強制する要素はここには何もない。Muse Codeは、そのベンダー自身が選定したあらゆるボードで2番手か3番手に位置し、標準ティアの価格は他社を下回るのではなく同等であり、差別化要因はMeta社外では誰もテストしていない信頼性の特性だ。注目すべきは次のベンチマークではない。Metaに勤めていない誰かが、そのイベントログに千回のツール呼び出しを通したときに、それが持ちこたえるかどうかである。
この記事で比較したモデル3
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
