
Meta Muse Spark 1.1 レビュー:相変わらず速いが、もはや安くはない
- metaNEWMeta: Muse Spark 1.22026-08-05$1.25 / $4.25 100万トークンあたり · 705 tok/s
- qwenNEWQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 100万トークンあたり · 57 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3150知能69コーディング
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 201 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEWAnthropic: Claude Opus 52026-07-2461知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2150知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1651知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1557知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0951知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0955知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0959知能77コーディング
- grokxAI: Grok 4.52026-07-0854知能72コーディング
- tencentTencent: Hy32026-07-0641知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3053知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
- z-aiZ.ai: GLM 5.22026-06-1651知能69コーディング60数学
4週の間、Meta Muse Spark 1.1の根拠は算術的なものだった。入力100万トークンあたり1.25ドル、出力4.25ドル——価格帯のほぼすべてのものを上回るツール実行性能を持つ、ネイティブなマルチモーダルモデルとしては。そして2026年8月5日、Metaは初のターミナルコーディングエージェントであるMuse CodeとともにMuse Spark 1.2を発表し、1.1には決して与えられなかったものを新モデルに添付した。入力0.10ドル、出力0.20ドルからのコントリビューター層だ。入力は12倍安く、出力は21倍安い。その代わりに、Metaがあなたのプロンプトでトレーニングすることを許可する。Muse Spark 1.1の価格は1セントも動かなかった。だが、その立ち位置は動いた。
それが今このモデルをレビューするための正直な枠組みです。Muse Spark 1.1は非推奨になっておらず、値上げもされておらず、Metaの2つの推論チェックポイントの中では今も高速でドキュメントも充実しています——しかし、もはやMetaモデルをレンタルする最も安価な方法ではなく、Metaが最も強く推しているエージェントはこのモデルでは動作しません。このレビューでは、1.1が何であるか、測定可能な形で何に優れているか、8月のリリースで何が変わったか、そしてそれでもなお最適な選択である狭い用途群について説明します。数値がMeta自身の評価に由来する場合はその旨が明記され、Artificial Analysisや本番トラフィックに由来する場合も同様に明記されます。
簡潔な評決
• 概要 — ネイティブなマルチモーダル推論モデル(テキスト、画像、動画、PDF、音声を入力し、テキストを出力)で、推論強度を設定可能。ツールの実行やコンピューター操作を行うために構築されています。重みは非公開で、Metaが提供しています。
• 価格 — 100万トークンあたり入力$1.25 / 出力$4.25、キャッシュヒット時は$0.15。ローンチ以来変わっておらず、依然としてGPT-5.6 Solの出力価格($5/$30)の約4分の1、Claude Opus 4.8の出力価格($5/$25)の約6分の1です。
• インテリジェンス — Artificial Analysis Intelligence Index で 51、クラス内順位は185件中22位(クラス中央値は32)。独立した測定であり、Metaによる主張ではありません。
• 強み — ツール使用とエージェント的推論、そして真の速度:毎秒213.5出力トークンを実現し、Artificial Analysisの185モデル中2位にランクインしています。
• 弱点 — 純粋な推論と生のコーディングは中程度で、長文コンテキストの想起は最先端ではなく、冗長です。Intelligence Indexを完了するために、中央値の65Mに対して94Mの出力トークンを消費します。
• 新たな注意点 — Muse Spark 1.2 のスコアは現在3ポイント高く、コントリビューターティアでは費用が20分の1です。1.1 に残された優位点はレイテンシであり、それは大きな優位点です。
Metaが8月5日にリリースしたもの — そしてそれが1.1に与えた影響
Muse Codeは、現在ベータ版のターミナル向けコーディングエージェントで、macOSとLinuxではワンライナーのシェルスクリプトからインストールされ(Windowsビルドはありません)、museというバイナリとして実行されます。大規模なリポジトリにわたって、変更計画、コード作成、結果検証といったソフトウェアエンジニアリングタスク全体を処理します。Metaの売りはアーキテクチャの一貫性です。エージェントとモデルは後付けで組み合わされたのではなく、一緒にトレーニングされています。また、その機能リストはまさにClaude CodeとCodexを狙ったものです。ターミナルを閉じた後も動き続けるバックグラウンドエージェント、イベントログからの再開、並列サブエージェントのワークツリー、デフォルトで承認が有効なOSサンドボックスなどです。Metaが公開したデモは、NVIDIA Hopperハードウェア上で最大24時間にわたって1,000回以上のツールコールを実行するGPUカーネル最適化ループです。
Muse CodeはMuse Spark 1.1ではなく1.2を実行します。これはこのレビューを読む人にとって最初の実際的な結果です。Metaのエージェントを利用したいなら、あなたは新しいチェックポイント上にいることになります。
2つ目の結果は価格設定であり、より興味深い方です。Metaは1.2を、1つではなく2つの異なるモデルIDで出荷しました:
• Standard (muse-spark-1.2) — 入力 $1.25、キャッシュ入力 $0.15、出力 $4.25(100万トークンあたり)。Muse Spark 1.1 と同一です。Meta は、このティアのプロンプトと応答が自社製品の改善に使用されないことを確約しています。
• コントリビューター (muse-spark-1.2-contributor) — 入力 $0.10、キャッシュ入力 $0.002、出力 $0.20。その代わりに、Meta が将来のモデルをあなたのプロンプトと完了結果で学習することを許可することになります。
• Muse Spark 1.1 — コントリビューターティアは存在しません。標準価格のままであり、Metaは非推奨化を発表していません。
Meta自身の説明では、contributorティアは「従量課金ティアよりも10倍以上安い」とされていますが、これは控えめな表現です。実際の倍率は入力で12.5倍、出力で21.25倍であり、キャッシュされた入力はほぼ無料の$0.002です。これが今回のローンチが生み出した「低価格」という見出しであり、それは1.2だけに帰属します。

価格ストーリー、書き換え
出力トークンあたり$0.20という価格を前提に予算を組み直す前に、コントリビューター層の規約の残りを読んでほしい。安さの理由はまさにそこにある。レート制限は、標準層で明文化されている毎分3,000リクエストから、コントリビューター層では毎分60リクエストに低下する。この上限は、ノートパソコンで試す開発者は許容するが、本番運用のエージェント群は認めない。そして、データ提供は形式的なものではない。あなたのプロンプトとモデルの出力は、訓練データとなる。顧客データ、独自ソース、守秘義務の対象となるものを扱う者にとって、コントリビューター層は同じ製品の安価版ではなく、別の製品だ。Metaは同じ発表の場で、有料プランのエンタープライズ顧客向けにゼロデータ保持オプションを追加し、その点を認めている。
正直な比較とは、「1.1が4.25ドル、1.2が0.20ドル」ということではありません。標準価格では、2つのモデルはまったく同じ費用であり、1.2の方がスコアが高いのです。0.20ドルのティアは現実的でアグレッシブなオファーですが、個人や実験を対象としており、新しいモデルでのみ利用可能です。
実際にどちらのモデルでも請求額を左右するのは、表示上の料金ではなくキャッシングです。代表的なエージェントのステップを考えてみましょう。60,000トークンのリポジトリまたはドキュメントコンテキストを入力し、3,000トークンの計画と回答を出力します。キャッシュなしの場合、入力が$0.075、出力が$0.013で、合計約8.8セント。1,000ステップなら$88です。コンテキストプレフィックスを安定させてキャッシュにヒットさせれば、100万トークンあたり$0.15で入力コストが$0.009まで下がり、1ステップは約2.2セント、1,000ステップでは$22になります。これは75%もの差であり、エージェントフレームワークが安定したプレフィックスを再利用するか、毎ターンでプロンプトを再構築するかによって完全に決まります。このレビューを読んだ後にひとつだけエンジニアリング上の対策を取るとすれば、モデル選定ではなくキャッシュキーの安定性にしてください。
レンタル先に関する構造上の注意点が1つあります。Muse Spark 1.1 は OrcaRouter のカタログにあり、$1.25 と $4.25 で、キャッシュ読み取りは $0.15 です。これは Meta が請求するのと同じ数字です。OrcaRouter はマークアップ 0% で、プロバイダーの定価をそのまま渡すため、ベンダーの価格変更は、先方に反映されたその日にこちらにも反映されます。Muse Spark 1.2 はまだカタログに載っておらず、Meta から直接提供されます。これは、おそらく実行しようとしている比較にとって重要です。GPT-5.6 Sol、Claude Opus 4.8、Grok 4.5、Gemini 3.1 Pro はすべて、単一のキーで定価にて利用できます。そのため、追加の契約なしに、単一の評価セットで Muse Spark 1.1 とベンチマーク比較でき、スプレッドシートの数字がそのまま請求書の数字になります。
Muse Spark 1.1 が実際に何であるか
Muse Sparkは、Meta Superintelligence Labsが手がける旗艦推論モデルシリーズです。同研究所は、Mark ZuckerbergがAlexandr Wangの指揮下で立ち上げたグループです。これは戦略的な転換を示しています。MetaのLlamaモデルがオープンウェイトだったのに対し、Museファミリー(Spark、および画像・動画ジェネレーター)はクローズドで、製品およびAPIとして提供されます。Spark 1.0は2026年4月8日に登場し、1.1は7月9日にMeta Model APIのパブリックプレビューとともにリリースされました。開発者にとっての実質的な変化は、Metaが単なるウェイト公開企業ではなく、OpenAIやAnthropicと直接競合するファーストパーティのAPIベンダーになったことです。そして8月5日のコーディングエージェントのリリースは、その最も明確な裏付けとなっています。
バージョン1.1はポイントリリースではなく、実質的なステップアップでした。Artificial Analysisでは、3か月でIntelligence Indexが43から51へと8ポイント上昇しました。コーディング指数は12ポイント上昇して71に達し、SciCodeは58%に改善、Humanity's Last Examは45%に上昇しました。Metaによると、最大の伸びはツール使用、コンピュータ使用、コーディング、マルチモーダル理解において見られ、これは単に回答するのではなく行動するように調整されたモデルと一致しています。
文脈に関して言えば、以前の混乱は解消された。Artificial AnalysisとOrcaRouterはどちらもウィンドウを1,048,576トークンと記載しており、Metaはモデルが積極的に圧縮するウィンドウについて説明している。ただし、100万トークンを保持することは、それらから想起することとは同じではない。1.1の長文脈検索スコアは約54.1であり、想起が平凡であることを示している。ウィンドウは保証ではなく容量として捉えるべきだ。
推論努力: インスタント、熟考、そしてその下のダイヤル
Metaの消費者向けサーフェスにおいて、Muse Sparkは2つの名前付きモードを公開している。標準的なチャットターンのように、拡張推論なしで即座に回答するInstant answersと、強化学習から借用した「思考圧縮」技術を用いて複数のエージェントを並列実行するContemplatingである。Metaは、要求の厳しい科学的・分析的作業において、ContemplatingをDeepMind Deep ThinkやGPT-5.4 Proと対抗させている。APIを通じて、同じ機能は構成可能な推論努力パラメータとして提供される。Artificial Analysisは、モデルが公開している最も高価な設定であるxhigh設定でスコアを公表している。
そのダイヤルは品質スライダーではなくコストレバーとして扱ってください。並列エージェント推論はシングルパスよりもはるかに多くのトークンを消費します。また、読んだベンチマーク数値は最大努力で生成されたものです。日常的な呼び出しでは低い設定をデフォルトにし、最初の回答を間違えると高くつくケースにのみ高い設定を取っておきましょう。
スコア:ツールありで強力、なしで中位
Muse Spark 1.1を最も明確に読み解く方法は、ツールありとツールなしの比較です。ツールありの場合、エージェント系テストをリードします。MCP Atlas 88.1に対してClaude Opus 4.8の82.2、JobBench 54.7に対して48.4、Legal Agent Bench 20.0に対してGrok 4.5の12.9、そしてツールありのHumanity's Last Exam 62.1に対して57.9です。ツールなしでは普通です。素のHumanity's Last Examは45前後で、同じテストでのGemini 3.1 Proの約77を大きく下回ります。
実行精度でも、リーダー勢には遅れを取っている。OSWorld-Verifiedのコンピュータ操作は80.8に対しOpus 4.8は83.4、SWE-Bench Proのコーディングは61.5対69.2、DeepSWE 1.1の長期的なコーディングは53.3に対しGPT-5.5は67.0、BabyVisionの視覚推論は76.3対83.6となっている。これらの数値の多くはベンダーによる報告であり、いくつかはMeta自身の評価に基づく。また、実行ハーネスも異なるため、方向性を示す参考値として捉え、各自のタスクで再テストしてほしい。

Artificial Analysisによる独立した評価は、より簡潔でより実用的です。インテリジェンス指数は51、185モデル中22位(クラス中央値は32)。速度は毎秒213.5出力トークンで、185モデル中2位——これは本当に高速なモデルです。価格ランクは31位、キャッシュヒット価格は0.15ドルで88%割引です。冗長性は、インデックスを完了するのに9400万出力トークン(中央値は6500万)を要し、実際のコストのかなりの部分はここから生じます。スイート全体での評価にかかった総費用は548.07ドルです。
心に留めておくべき注意点が一つある:Metaはテキスト、画像、ビデオ、オーディオ、PDFの入力に対応すると宣伝しているが、Artificial Analysisの1.1に関する技術仕様カードには、評価済みとしてテキストと画像のみが記載されている。両方とも真実であり得る——APIはベンチマークハーネスが試したよりも多くの入力を受け付けるということだ。しかし、Meta以外の誰もビデオやオーディオのワークロードに関する結果を公開していない。もしマルチメディア分析が目的でここに来たのなら、自分で検証する時間を確保しよう。
1.2に移行すべきか?レイテンシが答える
コーディングに関して、Metaはイエスと言い、その数字は内部的に一貫している:Terminal-Bench 2.1は76.2%から82.9%へ上昇、DeepSWE v1.1は53.0%から59.3%へ、また内部コーディングベンチマークは68.3%から70.6%へ。これらはMetaが実施した評価であり、Meta独自のハーネスで5回の試行におけるpass@1でスコアリングされている—標準的な注意点が当てはまる。つまり、ベンダーのハーネスにおける競合モデルはしばしばチューニング不足であるということだ。独立に、Artificial AnalysisはMuse Spark 1.2をIntelligence Indexで54に移動し、185件中ランク13位で、1.1より3ポイント上回った。
{{1}}メタがそれらのスコアを獲得したのは熟考によるものであり、それはあらゆるタイミング測定に表れている。{{/1}} {{2}}Artificial Analysisの計測では、各モデルの最高推論努力レベルにおいて、1.2の最初のトークンまでの時間は26.12秒、1.1は2.90秒である。{{/2}} {{3}}出力速度は毎秒213.5トークンから165トークンに低下した。{{/3}} {{4}}冗長性はわずかに上昇し、トークン数は94Mから95Mとなった。また、同一のベンチマークスイートを実行するコストは、同一のトークン単価で$548.07から$637.85に上昇した。{{/4}} {{5}}最後の数字はこのトレードオフを最も明確に示している。同じ価格体系で、トークン消費が16%増加し、インデックススコアが3ポイント向上した。{{/5}}
{{1}}26秒という数字{{/1}}は誤読しやすいので、注意深く確認してください。これは最大努力でのベンチマーク計測値であり、APIのデフォルトは中間設定です。実際のトラフィックの参考値として、OrcaRouter上のMuse Spark 1.1(呼び出し元が実際に要求する努力レベルで処理する)では、1週間の本番トラフィック全体で、最初のトークンまでの時間のp50が1.84秒、p95が6.00秒、エラー率はゼロでした。最大努力でのベンチマークレイテンシとデフォルト努力での本番レイテンシは異なる量であり、その差は通常一桁以上です。
つまり、この判断はワークロードの形状によって明確に決まります。リポジトリをコンテキストに保持し、一度に数分間動作する長期的なコーディングエージェントを実行している場合、1.2の方が優れたモデルであり、レイテンシのペナルティは、そもそも即時性を感じることのないタスク全体にわたって償却されます。一方、チャットサーフェスや、人間が待機するツール呼び出しループ、秒単位で測定されるレイテンシSLOなど、インタラクティブなものを提供している場合には、Muse Spark 1.1がファミリー内で最も適したモデルであり続け、その速度順位は誤差ではありません。8月のリリースによっても、その状況は変わりません。
開発者体験と制限
Meta Model APIは引き続きパブリックプレビューですが、8月のリリースでグローバルアクセスが拡大され、エンタープライズ向けゼロデータ保持オプションが追加されました。MetaはOpenAIスタイルのインターフェースとSDKアクセスを提供しており、SparkはMeta AIの「Thinking」モードで消費者向けに公開されています。レート制限は推測ではなく正式に公開されるようになりました(標準ティアでは毎分3,000リクエストと記載)。しかし、プレビューはあくまでプレビューであり、キャパシティが制約される日に備えてフォールバックルートを確保しておくべきです。プロバイダー間の自動フェイルオーバーは、まさにプレビュー段階のエンドポイントが求める類のインフラであり、プレビューモデルをゲートウェイ経由でルーティングすることがコストゼロで第二の経路を得られる理由でもあります。

OrcaRouterを介すると、モデルIDはmeta/muse-spark-1.1となり、/v1/chat/completionsと/v1/responsesの両方が利用可能です。したがって、既存のOpenAIクライアントに必要なのはベースURLとモデル文字列だけで、それ以外は不要です:
from openai import OpenAI
client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_API_KEY")
= client.chat.completions.create(model="meta/muse-spark-1.1", messages=[{"role": "user", "content": "この問題を修正するために、ツールを計画して実行してください。"}])
print(response.choices[0].message.content)
合う場所 — そして合わない場所
適している用途: 応答時間が人に直接見えるツール実行・コンピューター操作の自動化。トレーニングセットに渡せないデータに対するコスト重視の大規模推論。テキストと画像・動画・PDF・音声を組み合わせ、メディアパス上で自社検証を行うワークフロー。そして、最難関のステップにはプレミアムモデルを温存しつつ、高速で低コストなデフォルトを求めるチーム。
不向きな用途:リーダーボード最上位のコーディング精度と最難関のグリーンフィールド開発(これらは依然としてClaude Opus 4.8とGPT-5.6 Solの領域);ツールなしの純粋な推論問題;Gemini 3.1 Proがリードする視覚精度を要するタスク;長期的なリポジトリ作業(これは今や明確に1.2とMuse Codeの役割);そしてMetaの最も安価なトークンが必要なあらゆる用途。なぜなら、このモデルにはそのティアが存在しないからです。
よくある質問
Muse Spark 1.2がリリースされた今、Muse Spark 1.1はまだ利用可能ですか?
はい。Metaは8月5日のローンチで廃止も値上げも発表しませんでした。1.1はMeta Model APIに引き続きトークン100万件あたり1.25ドルおよび4.25ドルで提供され、OrcaRouterカタログにも同じ価格で掲載されています。このローンチに関する報道は一貫して、既存のAPI価格での継続として説明しています。とはいえ、Metaのエンジニアリング上の注力は目に見えて移っています。コーディングエージェント、新しいベンチマーク、低価格帯はすべて1.2に紐づいています。
Muse Spark 1.1は、0.10ドルのコントリビューターティアで入手できますか?
いいえ。contributor ティアは、新しいチェックポイント muse-spark-1.2-contributor 上の独立したモデル ID です。1.1 相当は存在しないため、最も安価な Meta 推論トークンを利用するにはバージョンを移行し、毎分 60 リクエストの上限を受け入れ、さらに Meta があなたのプロンプトと応答をトレーニングに使用することを許可する必要があります。
Muse Spark 1.2 にアップグレードすべきですか?
ワークロードが長時間実行のコーディングやリポジトリ規模のエージェント作業であれば、答えはイエスです。同じ標準価格のまま、Meta自身のコーディング評価とArtificial Analysisの独立インデックスの両方でより高いスコアを獲得しています。ワークロードが対話的またはレイテンシーに敏感なものであれば、答えはノーです。1.2は、3つのインデックスポイントと引き換えに、最初のトークンまでの時間を約9倍にし、出力速度を23%に低下させ、しかも推論をオフにすることができません。両者は同じAPI上にあるため、切り替えはどちらにせよモデル文字列の変更だけで済みます。これは可能な限り最も安価なA/Bテストであり、判断を下す前に自分のトラフィックで試す価値があります。
Muse Spark 1.1 はオープンソースですか?
いいえ、そしてそれがこのラインの要点です。MetaのLlamaモデルとは異なり、Museファミリーはクローズドウェイトであり、製品およびAPIとして提供されています。Hugging Faceにはウェイトはなく、セルフホスティングの手段もなく、サードパーティのプロバイダーもいません。このモデルを提供しているのはMetaだけであり、そのため、セカンドベンダーではなく、フェイルオーバーを備えたルーティングレイヤーが、単一プロバイダーリスクへの実用的な答えとなります。
評決、1バージョン後
Muse Spark 1.1は、高速で安価、真にマルチモーダルなエージェント型モデルであり、ツール使用に優れる一方、純粋なコーディングと推論に関しては正直なところ中位の性能です。8月に測定された項目で悪化したものはありません。変わったのは、その周辺のファミリーの構成です。Metaは現在、同じ標準価格でより高スコアのモデル、データを提供してもよい開発者向けの格段に安いティア、そして1.1でも1.1を指定して使えるどのモデルでも動作しないエージェント製品を擁しています。
残るのは、より狭いながらも現実的な推奨事項です。Metaの推論品質を人間が知覚できる速度——本番環境で最初のトークンまで1秒、その後は毎秒213トークン——で必要とするなら、1.1が依然として選ぶべきバージョンであり、1.2が追加する3つの指標ポイントは、9倍の待ち時間に見合う価値はありません。その速度が必要ないのであれば、留まる理由はもはやほとんどありません。いずれにせよ、これは1つのモデル文字列に過ぎないので、正直なアドバイスとしては、両方を自分の評価セットで1日実行し、レイテンシー予算に判断を任せることです。
この記事で比較したモデル4
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
