
Muse Spark 1.2 vs Muse Spark 1.1:アップグレードすべき?
- metaNEWMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenNEWQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
- grokxAI: Grok 4.52026-07-0856知能72コーディング
- tencentTencent: Hy32026-07-0642知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3055知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
- z-aiZ.ai: GLM 5.22026-06-1653知能69コーディング60数学
MetaはMuse Spark 1.1をMuse Spark 1.2に、2026年8月5日に置き換えました。価格、コンテキストウィンドウ、モダリティ一覧、対応パラメータ、推論ダイヤルは変更されていません。したがって、移行は無料のように見えます — 同じモデル文字列ファミリー、同じ課金、再交渉の必要なし。しかし、実際は無料ではありません。独立した測定によると、新しいバージョンの最初のトークンまでの時間は26.12秒(旧バージョンは2.90秒)であり、持続出力は毎秒165トークン(旧バージョンは毎秒213.5トークン)です。あなたは、測定された知能の3ポイントを、何かが返ってくるまでのおおよそ9倍の待ち時間とともに購入しているのです。
それを実行する価値があるかどうかは、タスクの実行時間にほぼ完全に依存します。ここでは、実際に異なる点、同じままの点、そして誰もまだ教えられない点を示します。
4行での決断
• Intelligence Index: 51 → 54(各バージョンのxhigh設定でArtificial Analysisが独立に測定)
• 最初のトークンまでの時間: 2.90s → 26.12s、同じソース、同じ条件。
• 同一のベンチマークスイートを実行するコスト: $548.07 → $637.85、同一のトークン単価で計算した場合の数字です。余分な16%は純粋なトークンの消費です。
• 調達フォームが尋ねるすべての項目:変更なし。

真に同一であるとは何か
これを列挙しておく価値があるのは、それが移行を紙上では些細に見せる理由であり、かつ存在しない差異はテストする必要がない差異だからである。
• 価格 — 入力トークン100万件あたり$1.25、出力100万件あたり$4.25、キャッシュヒット時は100万件あたり$0.15、組み込みウェブ検索1,000件あたり$2.50。これらの数字はすべて、両バージョンで同じです。
• コンテキスト — 両方とも1,048,576トークンで、どちらにもロングコンテキストの追加料金層はありません。
• モダリティ — テキスト、画像、動画、音声、PDFの入力、テキストの出力。両方のリストは同じ5つの入力タイプを宣伝しています。
• 推論ダイヤル — 両方で必須、5段階(minimal、low、medium、high、xhigh)、デフォルトは両方ともmedium。どちらのバージョンにも思考をオフにする設定はありません。
• パラメータ — tools、tool_choice、structured_outputs、response_format、reasoning_effort、include_reasoning、max_tokens、temperature、top_p、top_k、repetition_penalty。同一のリストです。
• 提供 — 両方ともプロバイダはMeta自身の1社のみ。サードパーティのホストも量子化バリアントもありません。
• ブレンド価格 — Artificial Analysisは、そのブレンド加重で両方を100万トークンあたり0.78ドルとしており、これは同一の料金表から期待される結果です。
より多くのコンテキスト、完了長の保証、あるいはより安価なキャッシュがこのアップグレードに含まれることを期待していたなら、それはありませんでした。これは、以前のものからコピー&ペーストされた料金表を備えた、重みとポストトレーニングのみのリリースです。
実際に動いたもの
Artificial Analysisは現在、両バージョンを評価した唯一の独立機関であり、両方を最高の推論努力レベルで評価したため、比較は同条件での対等なものとなっています。
• Intelligence Index — 1.1では51(185位中22位)、1.2では54(13位)。クラスの中央値が32のボード上で9位の上昇は、単なる小数点以下の変化ではなく、実際の順位を勝ち取るものだ。
• 最初のトークンまでの時間 — 2.90秒から26.12秒。これは主要なリグレッションであり、僅差ではありません。
• 出力速度 — 毎秒213.5〜165.0トークン。185モデル中16位を維持し、Artificial Analysisから「著しく高速」と評され続けているが、置き換え前のモデルより23%遅い。
• 冗長性 — インデックスを通過するのに必要な出力トークンは、95Mに対して94Mである。実質的に変化はなく、両方とも65Mの中央値を約45%上回っている。
• 総評価支出 — $548.07〜$637.85。冗長性はほとんど動かず、価格もまったく動かなかったため、その16%の増加は目に見える出力以外のどこか、すなわち内部推論トレースの長期化、再試行の増加、またはタスクごとのツールターンの増加に起因している。
このパターンは一貫している。Metaはモデルをより安く、より速く、より大きくしたわけではない。モデルが決定を下す前により長く熟考するようにしたのだ。そして、その余分な熟考は、レイテンシとして、わずかに遅いストリーミングとして、そして同じ作業に対して16%高い請求として現れる。それがもたらしたのは、指数3ポイント分だ。
レイテンシーが実際にどれほど悪いか
26.12秒という数値は文脈を無視して引用されるでしょう。ですから正しく扱ってください。これは、5つの労力レベルのうち最も高コストなxhighで、難しくなるように設計されたベンチマークスイート上で測定されたものです。APIのデフォルトはmedium。
デフォルトの実際の体感を知るために、OrcaRouter上のMuse Spark 1.1 — 実際の呼び出し元に対し、リクエストされた任意の努力レベルでサービスを提供している — は、最初のトークンまでの時間のp50が1.84秒、p95が6.00秒という値を直近1週間にわたって示しています。これは本番の努力レベルにおける本番データであり、ベンチマーク値より一桁以上低い値です。バージョン1.2にはまだ本番テレメトリがありません。

つまり、正直な解釈は「1.2は26秒で応答する」ではありません。本当のところはこうです。1.2が追加の3ポイントを獲得する設定では、最初のトークンには26秒かかり、同じ設定だと旧モデルは3秒しかかかりませんでした。すでにxhighで実行していたなら——それはまさに知能向上が得られる設定ですが——その数字を引き継ぐことになります。medium以下なら、かなり短い時間になり、改善も小さくなります。
その結合は、このアップグレードの真の罠だ。熟考なしに知性を得ることはできない。なぜなら、知性は熟考から生まれるのだから。
数字の背後にある再ポジショニング
Metaは1.2のローンチ投稿を公開していない。Muse Sparkのアナウンスページは今も1.1のままだが、製品説明は書き直されており、その書き直しがトレードオフを説明している。
Muse Spark 1.1 は、異例に広い入力面を持つマルチモーダル推論モデルとして販売され、「マルチモーダルエージェント、混合メディアにわたる深い調査、長文コンテキスト分析」を目的としていました。すなわち、長いレポート、メディアライブラリ、録音、映像をテキストと並行して扱うことです。
Muse Spark 1.2の説明では、そのほとんどを省き、代わりにソフトウェアエンジニアリングを挙げている。つまり、複数ファイルにわたるリファクタリング、長時間のデバッグセッション、リポジトリ全体の生成などだ。さらに、明示的なマルチエージェントの主張も加えている。すなわち、このモデルは、コンテキストを収集して計画を立て、委任するプライマリエージェントとして動作することも、その下で並列に実行するサブエージェントとして動作することもできるというものだ。また、プロンプトキャッシングにより、呼び出し間でコンテキストがどれだけ繰り返されるかに応じて、実効コストを60〜80%削減できるとも主張している。この最後の数字は、測定結果ではなくMetaの見積もりだが、0.15ドルのキャッシュレートを考えれば、算数的にはもっともらしい。
このリポジショニングに対するレイテンシの回帰を見れば、それはもはやミスのようには見えなくなります。十数個のファイルをリファクタリングしている人間が、26秒の計画を気にするはずがありません。Metaはある顧客を選んだのです。それは、1.1が売られた相手ではありません。
1.1にはまだあって1.2にはないもの
4週間の存在期間では実績を積むには不十分であり、具体的に3つの点で、旧モデルの方が現在ではより文書化が進んだ製品である。
• アリーナの記録。Muse Spark 1.1には、Design Arenaにおける豊富な実績があります:ゲーム開発では1334 Elo(ランク5)、UIコンポーネントでは1334(ランク7)、ASCIIアートでは1320(ランク3)、データ可視化では1318、一般的なコードカテゴリでは1309、さらにWebアプリ、HTMLスライド、Godotゲーム開発を網羅する完全なAgents Arenaラダーがあります。Muse Spark 1.2にはエントリが一切ありません。Metaが現在最も注力してマーケティングしている領域において、新モデルのヘッドツーヘッド(直接比較)のデータはゼロです。
• サブインデックススコア。 Artificial Analysisは、1.1についてコーディング指数71.3とエージェント指数37.5を公開している。1.2について公開された対応指標はない。エージェントスコアは1.1の最も弱い側面であり、その差は大きい。そして、エージェント能力こそが1.2が改善すると主張する点である。この数値がアップグレードの判断を決めるはずだが、それはまだ存在しない。
• 本番テレメトリ。1.1には、実測のp50およびp95レイテンシが1週間分蓄積されており、OrcaRouter上のライブトラフィックは440万トークンにのぼります。1.2にはそのどちらもありません。現在、そのエンドポイントはレイテンシやスループットの統計をまったく報告していません。トラフィック量が少なすぎてサンプリングできないためです。
• Meta以外のレンタル先。 Muse Spark 1.1 は OrcaRouter カタログに $1.25 と $4.25 で掲載されています — Meta自身のリスト価格を、0%のマークアップでそのまま提供しています。Muse Spark 1.2 はまだそこにはないため、現時点では単一プロバイダーによる直接のMeta統合であり、フェイルオーバーパスはありません。

このことは、決して1.2が劣っていることを意味しません。1.2の根拠は1人の評価者による1つの複合スコアですが、1.1の根拠は1か月分のアリーナ、サブインデックス、ライブトラフィックです。その非対称性は、移行を試みるかどうかではなく、移行をどのように段階的に進めるかに影響を与えるべきです。
実際に短い移行チェックリスト
レートカードとパラメータサーフェスが同一であるため、スワップはモデル文字列の変更です。実際の作業は、移動した3つの項目を検証することにあります。
• 自分の effort 設定で、最初のトークンまでの時間を自分で測定してください。2.90秒も26.12秒も鵜呑みにしないでください。実際のプロンプトは、どんな reasoning_effort を実際に渡しても実行して、直接比較してください。これこそが、移行を完全に頓挫させかねない唯一の数値です。
• タイムアウトとストリーミング設定を確認してください。高エフォート設定時のファーストトークンレイテンシが9倍に増加すると、1.1に合わせて調整されたクライアントのタイムアウトを超過し、非ストリーミング統合はすべてハングアップしたように見えます。
• コストはレートカードではなく、測定されたトークン数から再計算してください。 価格は同一なので、コストの変化はすべて挙動によるものです。Artificial Analysisでは、同じ作業に対して16%多くの支出が見られました。それが発生するかどうかは、タスクの構成によります。
• まずキャッシュキーの安定性を検証してください。 安定した60,000トークンのプレフィックスがあれば、典型的なエージェントステップのコストは、どちらのバージョンでも約8.8セントから約2.2セントに下がります。この75%の変動幅は、バージョン変更による影響よりも大きく、完全にあなたのコントロール下にあります。
• 音声とビデオのパスを明示的に再テストする。両方のリストは同じ5つの入力モダリティを謳っているが、Artificial Analysisの1.2の仕様カードには、評価済みとしてテキストと画像のみが記録されている。Metaは売り文句を複合メディア作業から遠ざけて書き換えた。独立した誰も、その機能が維持されているか確認していない。
• 1.1 をフォールバックとして利用可能にしておく。 両方を1つのキーの背後で稼働させておけば、ロールバックはインシデントではなく設定変更で済み、ベンチマークを巡って議論する代わりに、本番トラフィックで両者をA/Bテストできます。
今、誰が動き、誰が待つのか
今すぐ移行しよう、長時間稼働するコーディングエージェントを高い推論強度で実行しているなら。タスクはすでに数分かかるので、レイテンシーのペナルティはその数分に埋もれてしまう。知能の向上はMetaが主張するのではなく第三者によって測定されており、この層では3インデックスポイントの上昇は意味のある飛躍だ——185モデルのリーダーボードで9つ順位が上がる。
ちょっと待ってもしあなたが提供するものがインタラクティブなら。1.2が1.1より応答性が高い構成はなく、必須の推論によって思考を無効にしても応答性を取り戻すことはできません。バージョン1.1は、あらゆる努力レベルで依然として高速なモデルであり、コストもまったく同じです。
待ってもしあなたのワークロードが複合メディア分析、つまり1.1が明示的に構築され販売されてきた長文レポート・動画・音声のユースケースであるなら。Metaはその宣伝を止めており、1.2に関する唯一の独立評価はテキストと画像のみを対象としています。その能力は無傷かもしれません。ただ、どちらの方向にも証拠がないだけです。そして1.1には1ヶ月分の実績があります。
待ってください、もしアリーナデータが必要なら。Design Arenaへのエントリーも、公開されたエージェント系サブインデックスもなく、ホールリポジトリ生成を売り物にするモデルが、Metaが変更したことについてMetaの言葉を信じるよう求めている。三、四週間待てば、それはもはや当てはまらなくなる。その時点で、この判断は単一の複合数値に基づくのではなく、証拠に基づいて下すのがずっと容易になる。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
