生成されたタイトルカードには「GPT-6 Sol vs Muse Spark 1.2」と書かれ、そのうちの1つには耳があり、統計カードには入力モダリティがテキスト・画像・ファイル vs テキスト・画像・動画・ファイル・音声、出力価格が100万あたり $10.00 vs $4.25、サードパーティの GPQA Diamond が 96.1 vs 90.4 と書かれ、フッターには Muse Spark 1.2 の料金は Meta によるもので、GPT-6 Sol の料金は OpenAI の料金表によるもので、ベンチマーク数値は Artificial Analysis によるものと書かれている。
Guides & Insights

GPT-6 Sol vs Muse Spark 1.2:どちらか一方には耳がある

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

では、GPT-6 SolとMuse Spark 1.2を並べてみると、価格の列は単に異なるだけだが、モダリティの列は全く似ていない。Muse Spark 1.2はテキスト、画像、動画、ファイル、音声を受け付ける。GPT-6 Solはテキスト、画像、ファイルを受け付ける。音声と動画が違いであり、それは取るに足らない詳細ではない。会議の録音を渡せるモデルと、その文字起こしを渡さなければならないモデルを分けるのだ。GPT-6 Solは、その世代の中間ティアで、2026年9月22日に出荷された。Muse Spark 1.2は、Muse SparkファミリーにおけるMetaの現在のチェックポイントで、同一価格の同じStandardティアでMuse Spark 1.1へのドロップイン更新として2026年8月5日に出荷された。

最後の点は、このページをどう読むべきかを考えるうえで重要です。Muse Spark 1.2 は新世代ではなく、新世代として記事にすべきではありません — Meta 自身の説明では、わずかに性能が向上した更新済みチェックポイントであり、料金は据え置きで提供されています。つまり、興味深い問いは 1.2 が 1.1 に何を追加するかではありません。Muse Spark ファミリーにあって GPT-6 ファミリーにないものは何か、そしてあなたにそれが必要かどうかです。

異なる寸法に関する2つの仕様書

• 入力モダリティ — GPT-6 Sol:テキスト、画像、ファイル vs Muse Spark 1.2:テキスト、画像、動画、ファイル、音声

• 出力 — 両方ともテキストのみ

• 入力価格 — GPT-6 Sol は100万あたり$2.00 対 Muse Spark 1.2 は100万あたり$1.25

• 出力価格 — GPT-6 Sol は100万あたり$10.00、Muse Spark 1.2 は100万あたり$4.25

• キャッシュ入力 — GPT-6 Sol 100万あたり$0.20 対 Muse Spark 1.2 100万あたり$0.15

・コンテキストウィンドウ — 1,050,000トークン 対 1,048,576トークン、実質的に同じ

• 長文リクエスト段階 — GPT-6 Sol は入力トークン272,000超のリクエスト全体を $4.00 / $15.00 に再価格設定、一方 Muse Spark 1.2 はそのカードに段階なし

• GPQA Diamond — GPT-6 Sol 96.1 対 Muse Spark 1.2 90.4

• Humanity's Last Exam — GPT-6 Sol 47.9 対 Muse Spark 1.2 45.5

• 長文脈での想起 — GPT-6 Sol 83.7 対 Muse Spark 1.2 79.0

• tau-banking — GPT-6 Sol はこのリビジョンでは公開されていません 対 Muse Spark 1.2 34.8

• 重み — 両方とも非公開、APIのみ

長いリクエストの行は、そのリストの中で静かに効いている。Muse Spark 1.2 の公開カードには長コンテキスト再価格設定条項がないため、その $1.25 / $4.25 はウィンドウ全体で維持される。GPT-6 Sol の見出し価格はそうではない。入力トークンが 272,000 を超えると、リクエスト全体が $4.00 / $15.00 に移行する。したがって、フルコンテキストのプロンプトでは、出力の比較は 10 ドル対 $4.25 ではなく、15 ドル対 $4.25 である。つまり 3.5 倍であり、2 と 3 分の 1 倍ではない。

そして、ベンチマークの差は価格差が示唆するよりも狭い。GPQA Diamondでは96.1対90.4で、これは能力差というより、2つの異なる推論エフォート設定から予想されるばらつきとほぼ同じだ。Humanity's Last Examでは両者は47.9と45.5で、100点満点で2.4ポイントの差にすぎない。Muse Spark 1.2はより安価なモデルであり、より幅広い能力を持つ読み手だ。GPT-6 Solは推論の数値では先行しているが、価格が示唆するほどの差ではない。どちらの列も他方を圧倒していない。だからこそ、この選択は意識的に行う価値がある。

Generated comparison scoreboard titled GPT-6 Sol vs Muse Spark 1.2, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, modalities text image file, GPQA Diamond 96.1, long-context recall 83.7, reprices above 272K input tokens. Muse Spark 1.2: input $1.25 per million, output $4.25 per million, modalities text image video file audio, GPQA Diamond 90.4, long-context recall 79.0, no long-request step. A footer reads Muse Spark 1.2 figures per Artificial Analysis and Meta; GPT-6 Sol figures per Artificial Analysis and OpenAI.

音声・映像入力が実際に変えるもの

音声を受け付けるモデルには、文字起こしの代わりに録音を渡すことができる。それは便利さのように聞こえるが、実際には可能なことの変化である。文字起こしは非可逆な段階であり、声色、重なり、笑い、そしてテキストだけから読んだ場合の疑問文と平叙文の違いを捨ててしまう。ファイルを直接聞くモデルは、そのすべてを捉える。同じ論法は動画にも当てはまる。フレームごとの記述ではタイミングが失われ、クリップを直接取り込むモデルでは失われない。

GPT-6 Sol の答えは、モダリティではなくパイプラインだ。まず文字起こしやキャプションを生成し、それからテキストを渡す。これは完全に実用的なアーキテクチャであり、多くのワークロードにとってはむしろ優れた選択だ。文字起こしは検査可能で、キャッシュでき、保存コストも安いからだ。逆に劣るのは、まさに音声や動きそのものがシグナルである場合だ。コールセンターの品質レビュー、メディアのログ記録、話者のためらいが意味を担うあらゆる場面などがそれにあたる。

これに対するMetaの立場は注意深く読む価値がある。なぜなら、audioタグは飾りではないからだ。Muse Spark 1.2は、ビジョン、ツール、JSON、推論と並んで、その能力の中に音声が挙げられており、Metaはこのファミリーをマルチモーダルラインとして提供してきた。一方、より小型のMuse GlimmerはMuse Sparkの教師から蒸留された。入力サーフェスに関してこの2つを選ぶなら、その選択は、わずかに広いスペックシートとわずかに狭いものの間の選択ではない。それは、そのモダリティを持つことと、それを近似するパイプラインを構築することの間の選択だ。

二つが本当に分かれるところ

最も明確な分離は、シミュレートされたサービスに対するエージェント的ツール使用であり、数値が行動に移せるほど十分に離れている唯一の箇所である。Muse Spark 1.2はtau-bankingで34.8、より新しいTerminal-Bench 4.0改訂版ではわずか7.1を記録している — どちらも第三者による測定であり、どちらも同じ弱点を二つの方向から説明している。会議をうまく読めても、APIを呼ぶよう求められたときに顧客の残高を数え間違えるモデルは、悪いモデルではない。明確に境界づけられた職務を持つモデルなのだ。

GPT-6 Sol に対して同じチェックを実行すると、全体像は一貫しているが、より薄い。そのロングコンテキスト想起は83.7、SciCodeは57.6、Terminal-Bench 4.0は43.9で、いずれもサードパーティによるものだ。v2.1リビジョンにおけるコーディングおよびターミナルエージェントの数値は単に存在せず、数値がないことは低い数値ではない——そのセルを推定値で埋める者は、でっち上げているのだ。

数字を性急に比べ始める前に、名付けておく価値のある非対称性がひとつある。Muse Spark 1.2 は Meta による完全なベンダー・ベンチマーク・スイートをサードパーティのセットと並んで備えており、Artificial Analysis 自身のローンチ分析では、その xhigh 推論設定で Intelligence Index は 54 とされ、Muse Spark 1.1 より 3 ポイント上だった。GPT-6 Sol は、当社のカタログでは同じ指数で 47.6 に位置する。この二つの数値は引き算できない。それらは異なる時期に測定された異なる構成から来ており、両者の間で改訂された指数は同じ計器ではない。誠実な比較的主張は、上記の単一ベンチマークに関するものであり、そこでは両モデルが同じ評価者による数値を持っている。あるモデルがより多くの公表数値を持てば、少ないモデルよりも常によりよく文書化されているように見える。そしてこのペアでは、その差の多くは、モデルに何ができるかではなく、誰が報告するかに関わるものだ。

OrcaRouter model page for Muse Spark 1.2 (meta/muse-spark-1.2) by Meta, dated 2026-08-05, tagged Vision, Audio, Tools, JSON and Reasoning, showing text, image, video, file and audio input with text output, a list price of $1.25 per million input and $4.25 per million output, and page copy describing it as Meta's reasoning model for complex agentic tasks and the current checkpoint of the Muse Spark family.

負荷がかかった状態で動作する2つのモデルを提供する

どちらもOrcaRouter上にあり、キーは1つで、このペアは二者択一ではなく自然なルーティング分割です。マルチモーダルのトラフィック — 録音、クリップ、スキャンした添付ファイル付きのドキュメントバンドル — は、ロングコンテキストの崖がない $1.25 / $4.25 の Muse Spark 1.2 に送ってください。推論負荷の高いトラフィックとエージェント的なトラフィックは GPT-6 Sol に送り、回答が厳しい精査に耐える必要があるリクエストについては、より高い料金を受け入れてください。1つのエンドポイントを通せば、その分割は2つの統合ではなく、ルーティングルールです。

サービング側のひとつの数字は、価格の論理に反している。Muse Spark 1.2 は、当社のローリング7日間ウィンドウで毎秒約420出力トークンと測定されており、GPT-6 Sol の約244と対照的だ。Metaのモデルは当社のルート上で、より安価かつ高速である。初回トークンのレイテンシは逆方向に動く。p50の初回トークンまでの時間は、同じウィンドウで Muse Spark 1.2 が約5.2秒、GPT-6 Sol が約6.8秒であり、より安価なモデルの方が応答を早く開始する。どちらも制御されたベンチマークではなく、共有インフラストラクチャ上でのローリング測定であり、読み取りごとに変動する。

このような混在パイプラインでは、自動フェイルオーバーがその真価を発揮します。リクエストが一方のルートでは音声として届いてテキストとして出ていき、もう一方のルートでは必須の文字起こしステップを経る場合、気にすべき障害モードは、リクエストを受け付けたもののメディアのアップロードで止まってしまうプロバイダーです。2つ目のルートを設定しておけば、それは誰かが気づいて再実行しなければならないジョブではなく、リトライになります。当社のカタログはプロバイダーの定価をそのまま反映しているため、Meta が $4.25 のラインを変更したり、他のベンダーがすでにそうしているように Muse Spark のカードに長文コンテキスト条項を追加したりした場合、その変更はリセラーが気づいた後ではなく、発生した当日にあなたのもとに届きます。

Artificial Analysis launch analysis for Muse Spark 1.2 dated August 5, 2026, titled Muse Spark 1.2: Improved Agentic Performance at Higher Cost per Task, reporting that Muse Spark 1.2 scores 54 on the Artificial Analysis Intelligence Index, up 3 points from Muse Spark 1.1 at 51 and 11 points from Muse Spark 1.0 at 43, and describing it as Meta's third release in four months, tying with SpaceXAI for third place among US labs.

決定を、平たく言えば

もし入力が録音またはクリップで、タイミングやトーンが意味の一部であるなら、Muse Spark 1.2を使いなさい。GPT-6 Solのどの設定もAPIを通じてその能力に到達することはなく、代替パイプラインが同等になる価格も存在しない。もし入力がテキストと画像で、出力が実際に行動に移されるなら、GPT-6 Solの推論数値は上回っており、そのツール使用プロファイルはより安全なものである — Muse Spark 1.2のtau-bankingとTerminal-Bench 4.0のスコアはどちらの表でも最も目立つシグナルであり、それらはエージェント的作業から遠ざかる方向を指している。

そして、Muse Spark 1.2 が何ではないかに注意してください。新しい世代ではありません。それは Meta による既存ファミリーの現行チェックポイントであり、価格を据え置いたまま 1.1 をそのまま置き換えるもので、そのためアップグレードの判断は無償になり、GPT-6 Sol との比較は別問題になります。一方、GPT-6 Sol はすでに GPT-6.1 Sol に取って代わられており、ショートコンテキスト料金は同一で、キャッシュ済み入力は $0.20 から $0.10 へ半減しており、OpenAI 自身のモデルページも現在、読者をそちらへ誘導しています。Sol を Muse Spark ではなく検討している理由が8日前の統合にあるなら、それはそのまま当てはまります。理由が能力なら、まず後継を確認してください。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新