
Muse Spark 1.2 vs GPT-5.6 Luna: トークン価格の4.6倍に見合う3つの指標ポイント
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
Artificial Analysisは、同じ9つのベンチマークスイートをこれら両方のモデルに対して実行し、その証拠を残している。実行は、Muse Spark 1.2を通すのに637.85ドルかかった。実行は、GPT-5.6 Lunaを通すのに174.06ドルかかった。その3.7倍という費用差に対して、MetaのモデルはIntelligence Indexで54対51と3ポイント上回った。それが良い取引であるかどうかがすべての問いであり、その答えはベンチマークよりも、ほとんど誰も書かない2つのこと、すなわちエージェントフレームワークがプロンプトキャッシュをどう処理するか、そしてワークロードが音声や映像を聞いたり見たりする必要があるかどうかに、はるかに依存している。
以下に示すすべての数値は、独立したArtificial Analysisの測定、実際のAPI一覧、またはOrcaRouter自身の本番テレメトリのいずれかです。最後のものは、ベンチマークの数値と対照的で教訓的な矛盾を示すため、最初に注意しておく価値があります。ここにあるものは、ベンダーの主張を結果のように装ったものは一切ありません。ベンダーだけが情報源である場合は、その旨が明記されています。
スコアボードは値札が示すよりも近い
Muse Spark 1.2は、xhigh推論設定においてArtificial Analysis Intelligence Indexで54点を獲得し、185モデル中13位(クラス中央値は32)にランクインしました。GPT-5.6 Lunaは最大努力設定で51点を獲得しています。GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCRの複合指標では3ポイント差です。
3ポイントの差は実在するが小さいものであり、前世代について存在するサブスコアは、その差がどこから来るのかを示唆している。Artificial Analysisの次元別数値では、Muse Spark 1.1はコーディング指数71.3、エージェント指数37.5であり、GPT-5.6 Lunaは71.4と45.6となっている。コーディングは互角で、エージェント作業ではLunaが8ポイントリードしており、これはMetaが1.2の製品説明を書き換えて主張したまさにその次元である。総合スコアはMeta有利に3ポイント動いた。1.2の次元別内訳はまだ誰も公表しておらず、エージェントの差が実際に縮まったかどうかは未検証である。

ブレンドトークン価格における差は決して小さいものではありません。Artificial Analysisのブレンドレートでは、Muse Spark 1.2は100万トークンあたり0.78ドル、GPT-5.6 Lunaは0.17ドルとなっています。リスト価格は、Muse Spark 1.2が入力1.25ドル・出力4.25ドル、Lunaが入力0.20ドル・出力1.20ドルです。
トークン単位ではなく作業単位で価格設定されているため、1回のコーディングエージェントのステップで60,000トークンのコンテキストを読み取り、3,000トークンの出力を書く場合、Muse Spark 1.2では約8.8セント、GPT-5.6 Lunaでは約1.6セントかかる。1日1,000ステップの場合、$88対$16となり、単一のエージェントループでは年間およそ26,000ドルの差になる。
キャッシングは、そのギャップが縮まるか、あるいは倍になるかを左右する。
両モデルとも積極的なキャッシュ入力レートを提供しており、両者の比率はリスト価格の比率とは一致しません。Muse Spark 1.2はキャッシュ入力を100万件あたり0.15ドルで読み取り、1.25ドルのレートから88%の割引となります。GPT-5.6 Lunaはキャッシュ入力を100万件あたり0.01ドルで読み取り、0.20ドルから95%の割引となります。
同じエージェントステップを、60,000トークンのプレフィックスをウォームキャッシュで提供して再実行する:Muse Spark 1.2 は 8.8 セントから約 2.2 セントに下がる。Luna は 1.6 セントから約 0.4 セントに下がる。絶対的な差はステップあたり 7.2 セントから 1.8 セントに縮まるが、倍率はほぼ同じままだ——キャッシングは高価なモデルを救うわけではなく、両方を似たような割合で安くするだけだ。実際に変わるのは、どの内訳項目が支配的になるかだ:キャッシュ時、Muse Spark 1.2 のコストは入力トークン 85% ではなく出力トークン 59% になる。つまり、モデルの冗長性がコンテキストサイズよりも重要になり始める。
これはここでは仮想的な懸念ではありません。Muse Spark 1.2は、Intelligence Indexを通過する際に95Mの出力トークンを生成し、中央値は65Mでした。Artificial Analysis自身の要約では、それを「やや冗長」と呼んでいます。Lunaは130Mを消費しましたが、これは$4.25ではなく$1.20を掛けるまでは、より悪く聞こえます。
Metaの製品説明は、コンテキストがどれだけ繰り返されるかに応じて、プロンプトキャッシュが実効コストを60〜80%削減できると主張している。それはベンダーの見積もりであり、実測値ではないが、上記の計算はその範囲内に収まる。
レイテンシ:ベンチマークが真実を逆転させる軸
Artificial Analysisのレイテンシー数値だけを見れば、Muse Spark 1.2の方が応答性が高いと結論づけるでしょう。最初のトークンまでの時間は、Muse Spark 1.2が26.12秒であるのに対し、GPT-5.6 Lunaは126.99秒です。約5倍の速さです。
これらはどちらも、各モデルの最も高コストな推論設定(Muse Spark では xhigh、Luna では max)で測定された値です。実際に目にする値はどちらでもありません。OrcaRouter では、呼び出し元が実際にリクエストするあらゆる努力レベルにわたる1週間の実トラフィックにおいて、GPT-5.6 Luna は次の値を示しています:最初のトークンまでの時間の p50 が 1.84 秒、p95 が 9.68 秒。Muse Spark 1.1 は、同じ 1.84 秒の p50 と、より狭い 6.00 秒の p95 を示しています。1.2 については、まだ新しすぎるため本番テレメトリはありません。

構造的な違いはどちらの数値よりも有用です。GPT-5.6 Luna の推論は任意です。努力量ダイヤルはなしから低、中、高、最高、最大まであり、分類、ルーティング、抽出では本当に思考をオフにできます。Muse Spark 1.2 の推論は必須です。ダイヤルは最低でも最小限まで下がり、熟考にコストを払わずに重みを得られる設定はありません。高ボリュームでレイテンシに敏感な用途にとって、これはチューニングパラメータではなく設計上の制約です。
持続スループットはほぼ同等で、Muse Spark 1.2 が毎秒165.0トークン、Luna が毎秒177.9トークンであり、いずれもクラス中央値の71を大幅に上回っています。
誰もが引っかかる価格の注釈
GPT-5.6 Lunaの価格は現在、場所によって異なる表示になっています。コストモデルを構築しているなら、数値を引用する前にこの点を把握しておくべきです。Artificial AnalysisとOrcaRouterのカタログはどちらも、入力100万トークンあたり0.20ドル、出力100万トークンあたり1.20ドルと表示しています。これは7月のGPT-5.6値下げ後のレートであり、Artificial Analysisが上記の174.06ドルの評価請求額を計算するために使用したレートでもあります。一部のマーケットプレイスのリストでは現在、0.10ドルと0.60ドルが表示されており、272,000プロンプトトークンを超えると別の上位ティアが適用されます。安全な方法は、比較記事に記載されているものではなく、実際に呼び出しているエンドポイントの価格を確認することです。
どの基本レートが適用されるかにかかわらず、ティアリングの詳細は現実に存在し、それは本当に十分に取り上げられていません:Lunaの価格は、単一のリクエストが約272,000プロンプトトークンを超えると段階的に上昇します。入力はおよそ2倍になり、出力は1.5倍になり、キャッシュ読み取りもそれに応じてスケールします。Lunaを検討する理由が1.05Mトークンのコンテキストウィンドウであるなら、ヘッドラインレートが適用されなくなるのは、その約4分の1の時点であることに注意してください。Muse Spark 1.2は、その全1,048,576トークンにわたって一律料金で、長文コンテキストの追加料金はありません。そのため、本当に長い単一リクエストの場合、両者の実質的な差はかなり縮まります。
ルナがどうしてもできないこと
モダリティの違いは、一方を他方より選ぶ最も明確な理由であり、それはどのリーダーボードにも載っていません。
• 入力: Muse Spark 1.2 は、Meta のリストによると、テキスト、画像、動画、音声、PDF文書を受け付けます。GPT-5.6 Luna はテキスト、画像、ファイルを受け付けます。音声も動画も受け付けません。パイプラインが録音や映像を扱う場合、Luna はまったく候補になりません。
• 最大出力 — Lunaは128,000トークンの完了上限を明示しています。Muse Spark 1.2のエンドポイントは最大完了長を明示しておらず、これはかなり異例なことなので、事前に想定して計画するのではなく、テストで確認すべきです。
• 知識カットオフ — Luna's は2026年2月16日時点のものとして公開されています。Meta は Muse Spark 1.2 のカットオフを公開していないため、いずれにしても検索用の予算を確保してください。
• 提供状況 — Luna は世界中で複数のルートを通じてご利用いただけます。Muse Spark 1.2 は、Meta という単一のプロバイダーによってのみ提供されます。エンドポイントは1つ、リージョンポリシーは1つ、そして障害の対象も1つです。
• モデレーション — 両方ともモデレートされたエンドポイントです。
マルチモーダル優位性に関する正直な注意点:Artificial Analysis の Muse Spark 1.2 技術仕様カードには、評価対象としてテキストと画像入力のみが記載されており、Meta が宣伝する5つのモダリティすべては含まれていません。API は、独立系テスターが検証した範囲を超える入力を受け付けます。

採用は、たまたま測定可能であるからです。
ベンチマークはモデルが何をできるかを示すが、トラフィックは人々が何を信頼して任せているかを示す。OrcaRouter上の直近1週間で、GPT-5.6 Lunaが処理したのは46億7940万トークンだ。Muse Spark 1.1 — 同じ1Mコンテキストで、同等のインデックススコア、カタログ上では4週間古い — 処理したのは440万だ。これはおよそ1000倍の差だ。
その一部は流通の問題です。Lunaはより多くのツールでデフォルトとして採用され、より長くワールドワイドでGA(一般提供)されてきました。一方、Muse Sparkファミリーは米国限定でローンチされました。しかし、両者がモデル文字列1つ分しか違わないルーター上での1000対1の差は、純粋に流通だけの問題ではありません。それが、Lunaがより安全なデフォルトであり、Muse Spark 1.2が意図的に評価すべきものであるという現実的な理由です。
今日レンタルできるものとできないものについて、ここに記しておく価値があります。GPT-5.6 Luna は OrcaRouter カタログに $0.20 と $1.20 で掲載されており、これはプロバイダー自身の価格表と同じ数字です。当社はマークアップ 0% で運営し、プロバイダーのリストプライスをそのまま通しているからです。Muse Spark 1.1 も同じ条件で $1.25 と $4.25 で掲載されています。Muse Spark 1.2 はまだカタログにはありません — Meta が直接提供しています。したがって、今日この比較を正直に行う最も安価な方法は、Luna と Muse Spark 1.1 を1つのキーで比較し、実行の合間に1つの文字列を変更し、1.2 が登場したらそれに対して再テストすることです。
一つ選んでください。
GPT-5.6 Lunaを例に挙げましょうワークロードが大量かつテキスト中心の場合です。チャット、分類、抽出、ルーティング、軽量なツール使用などです。ブレンド価格の4分の1で、推論を完全にオフにでき、その1.84秒というp50はベンチマークの産物ではなく実測された本番環境の数値であり、そして1000倍の実トラフィックを背後に持つモデルです。3つの指標ポイントは、その計算を生き残れません。
Muse Spark 1.2 を選んでください。ワークロードが長期的なエージェント型コーディング(複数ファイルのリファクタリング、長時間のデバッグ、リポジトリ全体の作業)である場合、または音声・動画入力を伴う場合です。こうした分野では Luna は到底太刀打ちできません。また、本当に巨大な単一リクエストに対しても、こちらがより良い選択肢です。レートが全100万トークンにわたって一定であるのに対し、Luna は 272K を超えると段階的に上がるからです。
両方を使うべきだ勝ち続けているパターンは、安価なモデルが日常的な大半の呼び出しを処理し、品質が費用に見合うステップには高価なモデルを割り当てる、というものだ。両モデルは単一のOpenAI互換エンドポイントの背後にあるため、その分割はルーティングルールであって、別のベンダー関係ではない。そして、実行中に高価な側がダウンした場合、自動フェイルオーバーにより、評価結果がデータセットの半分で静かに汚染されることはない。エージェントシステムが実際にどう構築されるかについて正直であるなら、
今後1ヶ月間注視すべきは、次元別の内訳だ。Muse Spark 1.2のセールスポイントはすべてエージェンティック機能であり、前世代ではその次元でLunaが8ポイントリードしていた。誰かが1.2のエージェンティック指標を発表するまでは、3ポイントの総合スコア向上が、Metaがその差を縮めたことを示す唯一の証拠である。
