Muse Spark 1.2 と Muse Code-1
Guides & Insights

Muse Spark 1.2とMuse Code:Metaの4ヶ月で3つ目のモデルがGrok 4.5とタイに持ち込む

著者

Jim Song

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

MetaがリリースしたのはMuse Spark 1.2で、2026年8月5日、Muse Spark 1.1の4週間後、最初のMuse Sparkからおよそ4ヶ月後のことでした。今回のリリースには、これまでの2回にはなかったものが含まれていました。Meta自身のコーディングエージェント、Muse Codeが、ベータ版としてリリースされ、それが動作するモデルと共にトレーニングされました。そして、Metaもその競合他社も制御できない唯一のスコアボードでは、このリリースによりMetaはSpaceXAIと五分五分になります。Muse Spark 1.2とGrok 4.5は現在、Artificial Analysis Intelligence Indexで両方とも54点を獲得しています。

以下の数字に意味が出る前に、分けておくべきことが2つある。Intelligence Indexのスコア、レイテンシー数値、トークン数はArtificial Analysisによるもので、同社は独自の評価を実施し、その費用も負担している。これらは独立している。Metaが発表の冒頭で示したコーディング結果(Terminal-Bench 2.1、DeepSWE v1.1、および内部ベンチマーク)は、Metaが自社のハーネス上で実行し、各競合モデルをそれぞれ独自のエージェント製品と組み合わせたものだ。どちらの種類の数字も有用である。しかし、それらは同じ種類の証拠ではなく、本記事では両者を区別して扱う。

Metaが実際にリリースしたもの

Muse Spark 1.2 and Muse Code-2

8月5日付でメタのAI研究ブログに投稿されたこの発表は、2つの製品を同時に取り上げている。

Muse Spark 1.2 — Muse Spark ファミリー向けのコーディング特化型アップデート。Meta は、コーディングタスク向けのトレーニング計算を拡大し、トレーニング環境の多様性を広げつつ、1.1 リリースの売りだった汎用エージェント能力を維持したとしています。掲げられたトレーニング目標は長期的なものです。リポジトリ全体の生成、大規模なエンドツーエンドプロジェクト、そして Meta が「auto-research」と呼ぶもの。さらに、作業を順序付けるプランニング、多数のステップにわたって方向性を維持するゴールコンディショニング、セッションが長く続く間に関連状態を保ち続けるコンテキスト圧縮が含まれます。

Muse Codeは、Metaの開発者ドメインからワンライナーシェルスクリプトでインストールできるベータ版のターミナルコーディングエージェントです。セッションをまたいで存続する永続的な非同期バックグラウンドエージェントを、Metaが「リプレイ完全一致で再起動安全」と説明するローカルイベントログランタイム上で実行し、隔離されたワークツリー内でタスクごとに複数のサブエージェントを調整します。同梱されているスキルは3つです:/plan(承認ゲート付きプランニング用)、/grill(完了済みの作業をストレステストする用)、そして/goal(タスクを完了まで導く用)。

この組み合わせは偶然ではない。Metaによると、この2つは共同トレーニングされた——モデルはハーネスからの拒否サンプリング軌道を用いてチューニングされ、ゴール、圧縮、サブエージェント向けのレシピ最適化が施された。これはClaude CodeとCodexを生んだのと同じ共同トレーニング手法であり、ベンチマークの数値を読む人にとって重要な意味を持つ。モデルの代表的なコーディングスコアは、トレーニングで使用されたハーネス内で生成されたものだ。これは不正ではない。エージェント型評価の現在の標準的な仕組みである。つまり、別のスキャフォールドで得られた1.2というスコアは、安全な前提ではなく未解決の課題であることを意味する。

仕様の残りの部分は1.1から変更されておらず、1.1自体が参考情報です。コンテキストは1,048,576トークンのままです。推論は、minimal、low、medium、high、xhighの5つの努力レベルすべてで必須のままであり、デフォルトはmediumです。何らかの熟考を伴わずに重みを取得できる構成はありません。重みはクローズドであり、Hugging Faceリポジトリは存在せず、Meta自身のModel APIがそれを呼び出す唯一のファーストパーティの場所であり続けます。

43、それから51、それから54

Muse Spark 1.2 and Muse Code-3

{{1}}Artificial Analysis は、Muse Spark 1.2 を xhigh 推論設定の Intelligence Index で 54 と評価し{{/1}}、クラス中央値 32 に対して {{2}}185 モデル中 13 位{{/2}}にランク付けしています。このインデックスは、{{3}}9つの評価{{/3}} — {{4}}GDPval-AA v2{{/4}}、{{5}}τ³-Banking{{/5}}、{{6}}Terminal-Bench v2.1{{/6}}、{{7}}SciCode{{/7}}、{{8}}Humanity's Last Exam{{/8}}、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR — の重み付け合成であり、{{9}}エージェント、コーディング、一般的な能力、科学的推論{{/9}}に均等に配分されています。

スナップショットとしてではなく一連の流れとして見ると、Metaの軌跡こそが実際の物語だ。最初のMuse Sparkは4月に43点を記録した。Muse Spark 1.1は7月9日に51点に達し、四半期で8ポイントの上昇となった。Muse Spark 1.2は1か月足らずでさらに3ポイントを上乗せした。Metaは4か月でインデックスを11ポイント押し上げ、今では評価エコシステムが追いつけないほどの速さでリリースを続けている。1.2についてはベンチマーク別の内訳がまだ公開されておらず、Design Arenaの記録もまったくないが、1.1にはその両方がある。

54というスコアで、MetaはGrok 4.5と同水準だ。Grok 4.5はSpaceXAIがMuse Spark 1.1の前日にリリースしたモデルである。そして、Metaは僅差のフロンティアグループ(Claude Opus 5が61、Claude Fable 5が60、GPT-5.6 Solが59)の後ろに位置している。トップとの差は6〜7ポイント。Metaが年初にいた位置からの差は11ポイント。その差が縮まるかどうかはリリースのペースが維持されるかにかかっており、Metaは現在4週間周期のリリースサイクルにある。

とはいえ、複合インデックスでの同点は、仕事における同点ではありません。また、54が何を確定し、何を確定しないのかを述べておく価値はあります。54が確定させるのは、Muse Spark 1.2が総合能力においてGrok 4.5と同じ土俵に立つということです。しかし、どちらがより良いパッチを書くかについては教えてくれません。なぜなら、その問いに答えるはずのコーディング副指数が、1.2についてはまだ公開されていないからです。

Metaのコーディング数値を注意深く読んでください。

Metaの発表は3つのチャートでリードしている。自身のランでは、各競合モデルがそれぞれのエージェント製品とペアを組み、5回の試行におけるpass@1として報告されている:

Terminal-Bench 2.1 — Muse Spark 1.2 は 82.9% で、1.1 の 76.2% から上昇。Claude Opus 5 は 86.7% で先行しています。

DeepSWE v1.1 — 59.3%、53.0%から上昇。

Metaの内部コーディングベンチマーク — 70.6%、前回の68.3%から上昇。

差分こそが信頼に足る部分だ。同じチームが同じハーネスで同じ方法で1か月の間隔を空けて測定したTerminal-Benchでの6.7ポイント、DeepSWEでの6.3ポイントの向上は、Metaが最適化していた対象において1.2が1.1からどれだけ改善したかを示す妥当な読み取り方である。一方、ベンダー間の順位は軽く受け止めるべき部分だ。ハーネスの組み合わせは大きな自由変数であり、自社モデルと並行して自社ハーネスを調整するラボが、他社のハーネスを同じようにうまく調整できるわけではない。Metaは自社のスライドで2位だったが、これは少なくともベンダーベンチマークにありがちな形ではない。ただし、本稿執筆時点で、これを再現した第三者はいない。

2番目の価格表

このリリースで最も重要な点は、ベンチマークチャートには現れていません。Muse Spark 1.2には2つの価格表が同梱されています。

スタンダードティア — 入力トークン100万あたり$1.25、キャッシュヒット時は100万あたり$0.15、出力トークン100万あたり$4.25。1.1からセント単位まで変わりません。レート上限は毎分約3,000リクエストです。ウェブ検索グラウンディングは別途、クエリ1,000件あたり$2.50で請求されます。

コントリビューター層 — 入力は$0.10、キャッシュ入力は$0.002、出力は$0.20。これは入力で12.5倍、出力で21.25倍安いことになります。利用条件は、Metaが将来のモデルをあなたのトラフィックで学習させることを許可し、レート上限が毎分60リクエスト(標準予算の2%)に制限されることです。

0.10ドルと0.20ドルという価格設定では、Muse Spark 1.2は、市場のほぼすべてのフロンティアに近いモデルを下回る。その中には、価格面では通常負けるオープンウェイトの低価格帯も含まれる。これが今回のローンチで興味深い数字であり、実際には価格決定ではない。毎分60リクエストという制限は、それだけで本番環境でのほとんどのファンアウトパターンを排除する。そのため、このティアは本番配信ではなく、実験や小規模チームの作業を対象としている。そして「あなたのトラフィックで学習する可能性があります」というのは、モデルを選ぶ人ではなく、組織のデータガバナンスを承認する人が検討すべき問題だ。これは、より安いSKUではなく、割引が付いた法務レビューとして扱うべきである。

54の製造コストはいくらか

Muse Spark 1.2 and Muse Code-4

Artificial Analysisは、自社の評価実行にかかるコストを公開しており、その欄にMuse Spark 1.2の姿が表れている。9つのベンチマーク一式を完了させるのに637.85ドルかかり、9,500万の出力トークンを消費した。一方、Muse Spark 1.1は548.07ドルと9,400万トークンで、トークン単価は同一だ。その余分な16%は純粋に熟考によるものだ。

レイテンシーの数値も同じように動く。xhighで測定したところ、ファーストトークンまでの時間は、1.1の2.90秒に対して1.2では26.12秒であり、出力速度は毎秒213.5トークンから165.0トークンへと低下する。Metaは思考時間と引き換えに3つのインデックスポイントを獲得したが、必須推論という設計により、その購入を拒否することはできない。選べるのは、どれだけの量を実行するかだけだ。

{{1}}その26秒という数字は誤って引用されるでしょう。そこで先に訂正しておきます:{{/1}} {{2}}これは、モデルが公開している最も高コストなeffortレベルでの測定値であり、{{/2}} {{3}}APIのデフォルトはmediumです。{{/3}} {{4}}ベンチマーク環境ではなく、実際のトラフィックからの参考値として、{{/4}} {{5}}OrcaRouter経由で提供されたMuse Spark 1.1(呼び出し元が実際に要求するeffortが何であれ)は、{{/5}} {{6}}7日間のtime to first tokenのp50が1.84秒、p95が6.00秒、スループットが519トークン/秒、エラー率がゼロでした。{{/6}} {{7}}最大effortでのベンチマークレイテンシと、デフォルトeffortでの本番レイテンシは異なる量であり、通常は一桁違います。{{/7}} {{8}}26.12秒は、深い推論の上限として捉えるべきであり、リクエストの体感値として捉えるべきではありません。{{/8}}

今日電話をかけられる場所

Muse Spark 1.2は、Meta自身のModel APIによって提供されており、本稿執筆時点では、それ以外の経路では利用できません。ローンチ時にOpenRouterにはルーティングされておらず、Hugging Faceのリポジトリもなく、OrcaRouterのカタログにも載っていません。Muse Spark 1.1は、$1.25と$4.25で提供されています。これはMetaが請求するのと同じ数字です。なぜなら、OrcaRouterはマークアップを0%とし、プロバイダーの定価をそのまま渡すからです。

それはモデル自体よりも比較において重要です。このリリース向けのコストモデルを組むなら、比較対象となるモデル——Claude Opus 5、Claude Fable 5、GPT-5.6 Sol、Grok 4.5、DeepSeek V4 Flash——はすべて単一のキーで定価提供されているので、スプレッドシートの数字はそのまま請求書の数字になります。また、プロバイダーの値下げは更新後ではなく当日に反映されます。Muse Spark 1.2に関して言えば、現時点での答えはMetaのエンドポイント、2つ目の契約、そして別々の請求書です。

発表が答えなかったこと

独立したコーディング番号は存在しない。 Artificial Analysis は1.2向けの複合指標を公開しているが、1.1向けに公開したコーディングとエージェンティックのサブ指標(それぞれ71.3と37.5)はまだ公開していない。エージェンティックな作業は1.1のなかで大差で最も弱い側面であり、エージェンティックコーディングこそ1.2が修正したと主張する点であるため、この数字がリリースの評価を確定させるだろう。

ハーネス結果の再現はされていません。 発表にあるコーディングの数値はすべてMetaによる実行です。中立なスキャフォールドからのMuse Spark 1.2スコアを公表した人はまだいません。

マルチモーダル検証なし。 Muse Spark のリストは、テキスト、画像、動画、音声、PDF 入力を宣伝している。独立した評価はテキストと画像を対象としている。Meta の1.2メッセージングはほぼ完全にソフトウェア作業に移行しており、混合メディアのユースケース1.1は今のところ明確に販売されているが、その背後にはマーケティングも測定もない。

スループット履歴がありません。エンドポイントのボリュームがまだ低すぎるため、通常のローリングレイテンシ統計が生成されません。

今後4週間の注目ポイント

このリリースがMetaの言う通りのものかどうかを決めるのは、3つの点だ。第一は、1.2に対する独立したエージェントスコアだ。1.1で37.5だったサブインデックスが大幅に動いていれば、コーディングの売り込みは本物だ。第二は、Muse Codeの外でTerminal-Benchの結果を再現できる者がいるかどうかだ。自社のハーネスの中でのみ性能を発揮するモデルは、製品であって能力ではない。第三は、コントリビューター層に何が起こるかだ。60リクエストの上限が緩められれば、入力$0.10・出力$0.20のフロンティアに近いモデルは、予算層の計算を、3ポイントのインデックス上昇では決して変わらないような形で変える。

そして、そのリズムが維持されれば、Muse Spark 1.3 は9月上旬にリリースされる見込みだ。今回の状況からすると、リリース時に注目すべき数字はインデックススコアではない。注目すべきは、Meta がすべてのリクエストの先頭にさらに20秒の思考時間を追加することなく、機能を追加できるかどうかだ。

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube