Muse Spark 1.2 vs Gemini 3.5 Flash-Lite
Guides & Insights

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite: 2つのラボ、2つのサブエージェントの定義

著者

Jim Song

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

互いに2週間以内に、2つの研究所が相次いでモデルをリリースし、それを同じ言葉で説明した。そのモデルカードによると、Gemini 3.5 Flash-Liteは「複雑なマルチエージェントワークフロー内で、焦点を絞ったタスクを実行するサブエージェントに適しています」とある。MetaはMuse Spark 1.2は「計画と委任のためのプライマリエージェントとして、または並行して実行するサブエージェントとして機能することができる」と述べている。同じ語彙でありながら、Artificial Analysisが両モデルをIntelligence Indexで実行して初めて、その意味がどれほど異なるかが示された。Flash-Liteはスイートを4300万出力トークンで完了し、Muse Spark 1.2は9500万トークンを必要とした。一方のモデルは短く頻繁に考え、もう一方は深く長く考える。両者ともその結果をサブエージェントと呼ぶ。

そのトークン比率は、比較において最も意思決定に関わる数字です。サブエージェント層はファンアウトさせるもの——一度に20、一度に100——であり、ファンアウトはモデルの呼び出しごとの癖を増幅するからです。以下では、各ラボが実際に何を作ったのか、実際の価格でファンアウトの計算がどうなるのか、そして安いほうが結局は高い選択になるケースを検証します。

各ラボがその言葉で意味すること

Flash-Liteバージョンは、サイズによる役割定義です。Gemini 3.5 Flash-Liteは、そのファミリーの中で最も安価なティアであり、この位置づけは、思考レベルをマルチステップのサブエージェントワークロードに直接結び付ける点で注目に値します。これは、そのファミリーのティアが、サイズや速度ではなくエージェントの役割によって説明された初めてのケースです。推論は必須ですが、デフォルトの労力は最小限で、ダイヤルの上限は「高」であり、モデルは大量にスパウンされ、高速に応答するように構築されています。ベンダーは、SWE-Bench Proで54.2%(Gemini 3 Flashの49.6%に対して)、OSWorld-Verifiedで74.0%(65.1%に対して)を報告しています。どちらもベンダー報告の数値であり、独立に再現されたものではなく、どちらも生の知能の向上ではなくエージェント能力の向上として位置づけられています。

Metaのバージョンは、トポロジーによる役割定義です。Muse Spark 1.2の製品説明では、コンテキストを収集し、計画を立て、並列サブエージェントに実行を委任できるモデル——あるいは、それ自体がそうしたサブエージェントの1つにもなれるモデル——が説明されています。その推論ダイヤルは、minimalからxhighまでで、デフォルトはmediumです。そしてMetaは、対象ワークロードを明示的に挙げています:複数ファイルのリファクタリング、長時間のデバッグセッション、リポジトリ全体の生成。これは、オーケストレーターでありながら実際の作業もこなせるように設計されたモデルであり、一度に20個スポーンされるように設計されたモデルとは異なる製品です。

どちらの研究所も、その特定の主張に対するベンチマークは公開していない。Metaは8月5日に1.2をリリースしたが、ローンチに関する投稿は皆無で、Muse Spark 1.1の発表ページには今もなお旧バージョンの説明が載ったままである。

指数が実際に測定するギャップ

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

Artificial Analysisが両方に対して同じ9評価複合を実行した独立スコア:

知能指数 — Muse Spark 1.2 (xhigh) は54点で185件中13位、Gemini 3.5 Flash-Lite は36点で163件中20位。18ポイント差で、クラス中央値は32です。

出力速度 — 毎秒165.0トークンに対し343.6。Flash-Liteは2倍以上の速さでストリーミング出力します。

ファーストトークンまでの時間 — 26.12秒に対し10.30秒、どちらも最大努力時の値です。Artificial Analysisは、Flash-Liteの10.30秒はその価格帯の推論モデルの中でも遅い部類であると指摘しています。

冗長性 — 同じスイートでは43Mに対し95Mの出力トークン、全モデルの中央値は65M。Muse Spark 1.2は中央値を46%上回り、Flash-Liteは34%下回る。

インデックスの運用コスト — $637.85 対 $153.08。

次元別 — Artificial Analysis のサブインデックスは、Gemini 3.5 Flash-Lite をコーディング 49.3、エージェンティック 26.8 としています。Muse Spark 1.2 の内訳はまだ公表されておらず、その前身は 71.3 と 37.5 を記録しました。

18インデックスポイントは丸め誤差ではありません。これらは同じスロットの2つの候補ではありません。

ファンアウトの算術

サブエージェント層にとって、トークン単価は間違った指標です。この層の本質は、多数のサブエージェントを実行することにあるからです。リスト価格で例を計算してみましょう——Gemini 3.5 Flash-Liteは入力$0.30・出力$2.50、Muse Spark 1.2は入力$1.25・出力$4.25です。

オーケストレーターは20のサブエージェントを起動する。各サブエージェントは、スコープされたコンテキスト25,000トークンを読み取り、1,500トークンを書き戻す。

Gemini 3.5 Flash-Lite — 20 × ($0.0075 + $0.00375) = 約22.5セント /ファンアウト。

Muse Spark 1.2 — 20 × ($0.03125 + $0.006375) = 約75セント(ファンアウトあたり)。

3と1/3倍、それは管理可能に聞こえる。次に、測定された冗長性の差を当てはめてみよう。Muse Spark 1.2がインデックス上で見せたのと同じようにFlash-Liteよりも比例して多く書き出すならば——同じ作業に対して約2.2倍の出力トークン——1,500トークンの応答は約3,300トークンになり、ファンアウトは約91セントに上昇する。4倍であり、3倍ではない。多忙なエージェントシステムで1時間に100回のファンアウトが発生する場合、それは1時間あたり22ドルと91ドルの差であり、つまり連続負荷では年間およそ60万ドルの差になる。

2つの価格設定の詳細が、実際の格差を一方の方向にはさらに広げ、もう一方の方向には狭める:

Flash-Liteは内部推論を出力レートで請求します。内部推論トークンの表示価格は100万トークンあたり2.50ドルで、可視出力と同じです。思考は無料ではなく、応答上で見えないだけです。サブエージェントが回答前に2,000トークンを熟考する場合、呼び出しごとに0.5セント、ファンアウト全体では10セントの追加になります。

キャッシュは比率の観点ではMuse Spark 1.2に有利です。 キャッシュされた入力の読み取りは、リスト価格$1.25に対して100万件あたり$0.15で、88%の割引です。Flash-Liteはキャッシュされた入力の読み取りが$0.30に対して$0.03で、90%の割引ですが、キャッシュの書き込みには100万件あたり約$0.083を請求します。一方、Muse Spark 1.2はキャッシュ書き込みの個別料金を公表していません。すべてのサブエージェントが同じ大きなプレフィックスを共有するファンアウトの場合、その差は有意に縮まります。

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

本番レイテンシこそ、Flash-Lite が最も大きく差をつける領域であり、ベンチマークの数値はその実態を隠しています。OrcaRouter 上で、実トラフィックの直近1週間にわたる計測では、Gemini 3.5 Flash-Lite の値は以下のとおりです:ファーストトークンまでの p50 が 816 ミリ秒、p95 が 4.57 秒。Muse Spark 1.1 は — 1.2 にはまだテレメトリがないため、現時点で最も近い代替指標だが — p50 が 1.84 秒、p95 が 6.00 秒です。20 のサブエージェントを並列実行する場合、全体の経過時間は最も遅いサブエージェントに左右されるため、ファンアウトのレイテンシを支配するのは p50 ではなく p95 です。

安い方が間違いであるケース

Gemini 3.5 Flash-Liteに関する4つの制約は、価格比較には現れず、インシデントレビューには現れるものです。

65,536トークンの出力上限。このクラスのほとんどのモデルが許容する量の半分であり、大きなファイルを生成したり長い構造化ドキュメントを返したりするよう求められたサブエージェントにとっては、厳しい壁です。Muse Spark 1.2のエンドポイントは最大完了長を一切宣言しておらず、信頼するよりもテストする価値があるほど異例ですが、文書化された上限ではありません。

これはモデレーションなしのエンドポイントです。 Flash-Liteのリストにはモデレーションフラグが付いていませんが、MetaのMuse Spark 1.2用のリストには付いています。これは一部のワークロードにとっては真の利点であり、他のワークロードにとってはコンプライアンス上の問題です。そして、それは後から気づくものではなく、意図的な選択であるべきです。

高価な組み込み検索。Flash-Liteのウェブ検索ツールは、1,000回の呼び出しあたり約14ドル。一方、Muse Spark 1.2は2.50ドルです。サブエージェントが単に読むだけでなく調査を行う場合、安価なモデルが高価なものになります——5.5倍も——そしてファンアウトアーキテクチャでは、検索量はファンアウトに比例して増加します。

その価格は上がったのであって、下がったわけではない。 Gemini 3.5 Flash-Lite のリスト価格は $0.30 と $2.50 で、以前の Gemini 3.1 Flash-Lite は $0.25 と $1.50 でした。出力は、それが置き換えるティアより 67% 高価です。以前のモデルに基づいてサブエージェントの予算を設定した場合は、その予算を調整してください。

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

はっきり述べる価値のあるもう一つの非対称性:Muse Spark 1.2は、サードパーティのホストもフォールバックもなく、唯一のプロバイダーであるMetaによってのみ提供される。Gemini 3.5 Flash-Liteは、通常のファーストパーティによるマルチリージョン配信フットプリントを持つ。オーケストレーターにとって、これはエージェントツリー全体の単一障害点であり、ワーカーティアにとっては、ファンアウトの単一障害点である。

ほとんどのチームが最終的にたどり着く組み合わせ

これら2つのモデルを照らし合わせて読むと、両者は競合関係というより、むしろ1つのアーキテクチャを成す2つの半分であることがわかる。Meta自身のプロダクトコピーも、プライマリーエージェントの役割とサブエージェントの役割を別々に説明する際に、まさにそのことを述べている。

数字から導き出される形:オーケストレーターとしてMuse Spark 1.2、ワーカーとしてGemini 3.5 Flash-Lite。リポジトリを読み込み、計画を保持し、何を委任するかを判断する、1回の高価で慎重な呼び出し — 26秒の思考と95Mトークン規模の冗長さが、実行に値する計画をもたらす — に続くのは、安価で高速でスコープの狭い20回の呼び出しであり、各呼び出しは単一のスコープに絞られた仕事を実行し、p50で1秒未満に応答する。タスクごとに1回フロンティア級のレートを支払い、作業単位ごとにバジェット級のレートを支払う。これはまさにファンアウトアーキテクチャが求めるコスト曲線である。

逆にすると、経済は崩壊する。ファンアウト1回91セントのMuse Spark 1.2サブエージェント20体は、18ポイント弱いモデルが3分の1の時間で完了させる作業に対して4倍の請求額になる。そして、インデックス36のFlash-Liteオーケストレーターは、ワーカーたちが救済できない計画を生み出すだろう。

2つのベンダーにまたがる構築は、かつて厄介な部分でした。Gemini 3.5 Flash-LiteはOrcaRouterカタログに$0.30と$2.50で掲載されています(ベンダー定価を0%マークアップでそのまま通すため、価格変更は契約サイクル後ではなく当日中にこちら側に反映されます)。Muse Spark 1.1も同じ条件で$1.25と$4.25で掲載されており、両モデルとも1つのOpenAI互換エンドポイント経由で利用できます。つまり、オーケストレーター・ワーカーパターンは、2つのSDK、2つのキー、2つの請求書ではなく、1つのコードベース内の2つのモデル文字列で実現でき、ファンアウトの途中で一方のベンダーに障害が発生しても自動フェイルオーバーが対応します。何が利用可能かを正確に言うと:Muse Spark 1.2自体はまだカタログにありません。Metaが唯一のプロバイダーとして直接提供しているため、現在このスタックに最も近いバージョンはオーケストレータースロットで1.1を実行します。

スコアではなく、役割で選ぶ

ワーカーティアを選ぶ場合——ドキュメント解析、データ抽出、スコープ指定されたファイル編集、分類、エージェントツリーの中間的な狭い反復作業——Gemini 3.5 Flash-Lite の方が優れたツールであり、18ポイントのインデックス差は、推論を求めていないため、ほとんど無関係です。出力上限と検索価格に注意してください。

作業員が何をするかを決めるモデルを選ぶのであれば、Muse Spark 1.2 は2つの候補のうちでより有力です。ただし、独立した次元別エージェントスコアがなく、いかなる種類のアリーナ記録もなく、本番テレメトリもなく、プロバイダーが1つだけであるという注意点があります。これらは、本番計画を保持する前に埋めるべきギャップです。

そして、もし1つのモデルが両方の仕事をこなしてくれると期待していたなら、測定結果から正直に言える答えは、どちらもできないということだ。Flash-Liteはインデックス36での計画ができず、Muse Spark 1.2はファンアウトあたり91セントで一度に20個を生成することはできません。両方の製品説明に「サブエージェント」という言葉が登場するのはマーケティング上の偶然であり、それらが同じ枠に属していることを示すものではありません。

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube