「max reasoning対応のMuse Spark 1.3が正式に利用可能になったことを伝えるニュースのヒーロータイトルカード。オーバーライン:「Meta Superintelligence Labs — 2026年9月4日」。見出し:「max reasoning対応のMuse Spark 1.3が正式に利用可能に」。サブタイトル:Metaはローンチ2日後に安全性テストを通過し、Muse CodeとMeta Model APIで見出し級のスコアを記録した推論モードを、従来と同じ価格で開放したことを記載。バッジ:「推論努力: max」「従来と同じ$1.25 / $4.25の定価」「DeepSWE 75.4を支える構成」。フッター:「muse-spark-1.3で選択可能に — 推論トークンは出力として課金」。OrcaRouterのロゴが右下に合成されている。」
Guides & Insights

Muse Spark 1.3 Max Reasoning が公開: Meta のトップスコアを支える設定が、今度はすべてのユーザーに提供されます

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Muse Spark 1.3 — Meta Superintelligence Labs が9月2日にリリースしたフロンティア推論モデル — は、自身のスコアボードが基盤としていたモードを手に入れた。9月4日、2日間の追加安全性テストを経て、Meta はモデルで最も計算集約的な「max」推論設定を、Meta Model API と、ターミナルコーディングエージェントである Muse Code の開発者向けに開放した。最高AI責任者の Alexandr Wang 氏は X でこの展開を発表し、同社の @AIatMeta アカウントも確認した。ローンチ時には Meta とパートナープレビューに限定されていた設定は、今やどの開発者も選択できる推論レベルとなっている。

その順序が重要なのは、Muse Spark 1.3の発表を報じた記事を席巻した数値のいくつか — DeepSWE v1.1での75.4、OSWorld 2.0での66.9、GDPval-AA v2での1,754 — がmax構成によるものだった一方で、開発者が実際に呼び出すことができたモデルは、推論努力が"xhigh"に上限設定された状態で出荷されたからだ。Metaは発表時点で、maxはまだ安全性テスト中であると明確に述べていた。しかし、この分離により、目玉のスコアボードと実際に呼び出せるモデルは2日間、別物になっていた。木曜日のリリースでこのギャップは解消されるが、トークンあたりの価格には変更がない。リスト内のベンチマーク数値はMeta自身によるものであり、独立したハーネスによる再現は依然として行われていない。本記事でベンダー報告として示されている数値はすべて、そのように明記されている。

何が伏せられていたのか — そして9月4日に何が変わったのか

Muse Spark 1.3の推論ラダーは、このファミリーの有料APIが公開されて以来、同じ形状を保っています。すなわち、推論は常にオンになっており、Meta Model APIにおけるモデルのeffortパラメータはminimal、low、medium、high、xhighの値を取り、レベルが上がるにつれてモデルは出力バジェットのより多くを思考に費やします。Maxはxhighの上に位置し、より多くの計算リソースと推論トークンを使用し、Metaの説明によれば、長期的なエージェントワークにおいて有意に強力です。9月2日のローンチ時、Metaはxhighまでのすべてのレベルを出荷しましたが、maxは公開APIから除外され、同社が「追加の安全性テスト」と呼ぶものを待つ間、限られたパートナーにのみ共有されました。これは、独立した評価を実施するには十分であるものの、本番ワークロードを支えるには不十分な規模でした。

9月4日、Wang氏はテストが完了したと述べた。Maxは現在Muse Codeで選択可能な設定となっており、インストールスクリプトはdev.meta.ai/install.shに置かれている。また、Meta Model APIのmuse-spark-1.3モデルIDでも利用でき、そこではeffortパラメータがmaxを受け付けるようになった。Wang氏はこの2日間のずれについて、Metaが「設定レベル」でアクセスを制限する方法だと説明し、Axiosに対し、Metaは安全性への懸念から広範な作業を一時停止する必要はなかったと語った。この期間は短かったが、確かな前例となる。Metaは現在、チェックポイントの残りの部分を直ちにリリースする一方で、特定の推論モードは安全性レビューを通過するまで保持する構えだ。

Meta自身のエンドポイントではなくゲートウェイ経由でモデルを呼び出す場合の実用的な注意点:いくつかのサードパーティ製ドキュメントページやアグリゲータ一覧はリリース当日に作成されたもので、いまだにreasoning effortの値としてxhighまでしか列挙していません。max値はMeta側のロールアウトによるものです。そのため、maxが使えると決めつける前に、呼び出しが経由するルートがパラメータの受付範囲を更新しているか確認してください。たとえば、9月2日に受け付け値を検証したプロキシは、その保守担当者が追いつくまで"max"を拒否する可能性があります。

maxが実際に買えるもの——そして役に立たない場面

Metaが木曜日に公開した資料には、同社が実行するベンチマークにおける「max」対「xhigh」の明確な分割が含まれており、これはモデルについてこれまで公開された中で最も有用なものだ。そのすべてはベンダー報告によるもので、Meta自身のMuse Codeハーネス内で生成され、Metaによると、Claude Opus 5とGPT-5.6 Solとの比較は、それらの競合製品の最大設定での「ベストエフォート」による実行であり、「プロバイダー最適化されたパフォーマンスを反映していない可能性がある」という。その注意点を踏まえると、この分割は明確な方向性を示している:

• OSWorld 2.0(コンピューター操作エージェントタスク)— 最大時66.9、xhigh時57.2

• GDPval-AA v2(知識ワークエージェントのElo)— max設定時 1,754 vs xhigh設定時 1,709

• JobBench(長期的な専門職タスク)— max設定時は64.9、xhigh設定時は61.2

• DeepSearchQA — 89.4で同点

• Terminal-Bench 2.1(ターミナルエージェントコーディング)— xhighでは89.2、maxでは88.8。9月2日に出荷された構成が勝利した唯一のスイート

A comparison scoreboard titled 'Muse Spark 1.3 — max vs xhigh, the split'. Left column Max (released Sept 4, 2026): OSWorld 2.0 66.9, Terminal-Bench 2.1 88.8, GDPval-AA v2 (Elo) 1,754, JobBench 64.9, DeepSearchQA 89.4, Available to all developers. Right column Xhigh (released Sept 2, 2026): OSWorld 2.0 57.2, Terminal-Bench 2.1 89.2, GDPval-AA v2 (Elo) 1,709, JobBench 61.2, DeepSearchQA 89.4, Available to all developers. Footer: 'Benchmark splits per Meta's Sept 4 release materials — vendor-reported, not independently reproduced. Xhigh wins Terminal-Bench 2.1.' OrcaRouter logo bottom-right.

このパターンは、注意深く読む価値がある。Maxが最も効果を発揮するのは、タスクが長いエージェント型ループである場合だ。たとえば、コンピューターを操作する、ナレッジワークのブリーフに取り組む、JobBenchと同じようにサブタスクのスケジュールを保持する、といったタスクである。一方で、単一ターンのターミナルベンチマークでは、Maxは何の向上ももたらさず、わずかにコストがかかっただけだった。Terminal-Benchは、「より多くの推論」が単調な性能向上ではないことを思い出させてくれる。そしてそのことは、より高い設定がどこでも優れていると想定するのではなく、自分のワークロードでmaxとxhighをA/B比較すべき理由でもある。Metaはまた、DeepSWE v1.1の75.4という結果——その6週間前にMetaがMuse Spark 1.2について報告した59.3から上昇し、発表初日のヘッドラインとなった数字——を、max設定での数値として指摘している。独立した評価者が最初に再実行するのは、この数値だ。

独立した読み取りが追いつき始めている

発売当初に欠けていたのは独立した計測であり、そのギャップは、maxのロールアウトとちょうど一致するスケジュールで埋まりつつある。Artificial AnalysisのCoding Agent Index(各モデルをネイティブのコーディングエージェント・ハーネス内で採点し、DeepSWE、Terminal-Bench、SWE-Atlasのタスクを統合する指標)は、今週、Muse Codeハーネス内のMuse Spark 1.3(max)を68と位置づけ、Claude Code内のClaude Opus 5(xhigh)に次ぐ2位、67のClaude Fable 5(max)と65のGPT-5.6 Sol(max)を上回った。同じボード上では、出荷中のxhigh構成が同じMuse Codeハーネスで64と評価されており、これは独立したタスクセットにおいてmaxが追加するもの——およそ4インデックス・ポイント——を巡る、これまでで最もクリーンな同条件比較となる。このボードの行は、maxがまだパートナープレビュー中に公開されたもので、そこに記載された構成が9月4日に一般提供されたものと同じである。

Artificial Analysisはまた、ロールアウト以降、最大構成向けの自社モデルカードも更新している。プレビュー期間中、カードにはプロバイダーも価格も記載されていなかったが、現在のライブカードには、Metaが標準価格として入力100万トークンあたり1.25ドル、出力100万トークンあたり4.25ドルでリストされている(これはMuse Spark 1.2と同じ定価である)。その上で、冗長性に関する注意書きも追加されている。AAの評価実行では、中央値が7900万トークンであるのに対し、約1億3000万トークンを消費し、総コストは約1335ドル、AAのタスクあたりの推定ではタスクあたり約0.95ドル、毎秒約190出力トークンとなっている。

以前の報道にあった数字の1つは、バージョンの確認が必要だ。Artificial Analysisは今週、Intelligence Indexをv4.2に更新した — maxが出荷されたのと同じ週である — これにより評価対象を再採点し、中央値にも変化が生じた。現在のカードでは、max構成のスコアは53で、同等モデルの中央値は29である。発表週の報道で出回った62は、以前のバージョンのインデックスで測定されたものであり、両者は比較できない。Meta自身の上記のxhigh対maxの分割は、AAのインデックスとは独立しており、この更新の影響を受けない。

A screenshot of the Artificial Analysis model page for Muse Spark 1.3 (max), showing a score of 53 on the Artificial Analysis Intelligence Index against a comparable-model median of 29, input pricing of $1.25 and output pricing of $4.25 per 1M tokens with an 88% cache discount, a per-task cost estimate near $0.95, about 190 output tokens per second, a 1M-token context window, and a note that the configuration is 'somewhat verbose' after generating roughly 130M tokens against a 79M median.

最もコストがかかるのは何か — 請求は価格表ではなくトークン単位で発生する

Metaはmax構成の個別価格を公開しておらず、専用のレイテンシー解析も提供していない。トークンあたりの価格はMuse Spark 1.2およびMuse Spark 1.3の他のすべての努力レベルと同一で、標準ティアでは入力トークン100万個あたり1.25ドル、出力トークン100万個あたり4.25ドル、キャッシュ済み入力100万個あたり0.15ドルである。推論トークンは出力トークンとして課金され、出力予算にカウントされる。したがって、maxを選択しても明細上の価格上昇にはならない——それは、回答前にその予算の多くを思考に費やすという約束なのだ。

これにより、実際のコストの論点はトークン量に移る。初期データによれば、max が割高なのは、xhigh がリーンなまさにその領域だ。AA の計測付き実行は、その構成を1回評価するだけで約1億3000万トークンを消費した。すでに xhigh で長いエージェントループを運用している開発者にとって、意味のある A/B テストは「max はより多くのタスクを達成するか」ではなく、「max は同じワークロードで大幅に膨らむトークン請求額に見合うだけの追加タスクを達成するか」である。

MetaのContributorティアは、プロンプトと完了結果をMetaのトレーニングに使わせる代わりに、トークン100万個あたり入力0.10ドル・出力0.20ドルという料金設定で、同じチェックポイントに適用される。Metaによると、かなりの割合(二桁台のパーセント)の開発者がこれを選択しているという。Contributorの利用規約では、すべての送信がトレーニングデータとなり、レート制限も厳しいため、本番環境でのファンアウトには不向きなデフォルトだが、データのトレードオフを受け入れられるのであれば、高額な最大規模の実験を安価に実行する正当な方法でもある。

このすべての価格アンカーは、Meta の言うことを鵜呑みにしなくても簡単に確認できます。checkpoint Muse Spark 1.3 は、OrcaRouter にすでに Meta の定価で掲載されているモデルと同一価格です:Muse Spark 1.2 は OrcaRouter で、100万トークンあたり入力 $1.25、出力 $4.25、マークアップなしで提供されています。つまり「価格は変わらない」という主張は、その数字がそのまま表示されているライブページで確認できます。Muse Spark 1.3 自体はまだ OrcaRouter にありません。当社が取り扱うプロバイダーが max 対応で提供を開始した場合、当社側に表示される価格は、Meta の定価をそのまま通したものになります。当社はプロバイダー価格にマークアップを上乗せせず、また、ベンダーによる値下げは Meta が実施した当日に反映されます。今回のようなリリースでは、注目すべき経済性は表向きの価格ではなくトークン量にあります。このパススルー方式により、実際に請求される金額は Meta が公表する金額と等しくなります。

A screenshot of the OrcaRouter model page for Muse Spark 1.2, the checkpoint Muse Spark 1.3 is priced identically to, showing header stats $1.25 input and $4.25 output per million tokens, p50 time-to-first-token 7.84 s, p50 total 10.00 s and 48.9M, the description 'Muse Spark 1.2 is Meta's reasoning model for complex agentic tasks... a drop-in upgrade rather than a new tier', and the 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.

誰がmaxに切り替えるべきですか

その決定はきれいに二分される:

{{1}}• 長期的なエージェント型ワークロード(コンピューター操作、ナレッジワークのブリーフ、Muse Code でのマルチステップツールループなど)には、切り替えてください。こうしたワークロードでは、Meta自身のスプリットとAAのコーディングエージェント向けリーダーボードの両方で最大のゲインが示されています。実際のタスクのサンプルで、まずはxhighとこの切り替えをA/B比較してください。というのも、冗長性は実際に存在するからです。{{/2}}{{/1}}

• 高ボリューム、レイテンシー重視、または短い単一ターンの呼び出しでは、xhighのままにしてください。その場合、maxは主にトークンを追加するだけです。Terminal-Benchは、それが常に機能を追加するわけではないという証明です。

• 今後注目すべき3つの点:ザッカーバーグが日付を示さずに約束しているオープンウェイトのリリース、今後数週間でInstagram・Facebook・Meta AIに展開されるMuse Spark 1.3の消費者向けロールアウト、そしてArtificial Analysisのコーディングエージェントボードが、この構成が一般提供された今、max行の価格設定を始めるかどうか。

2日間というゲートは短く終わったが、そこで示された点はロールアウト自体よりも長く残るものだった:Meta最強のMuse Spark 1.3の数字は決して幻ではなかった——ただ安全性レビューを待っていただけなのだ。9月4日時点で、開発者が呼び出せるモデルとスコアボード上のモデルは、ついに同じモデルになった。「max」がトークンに見合うかどうかは、今やどの開発者でも答えられる実証的な問いである。MetaのAPIでも、Muse Sparkファミリーに到達するためにすでに使っているどの経路でも、それを確かめることができる。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新