
Muse Spark 1.2 vs DeepSeek V4 Flash:4つの指標ポイントと9倍の請求額
- metaNEWMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenNEWQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxNEWMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 2278 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
- grokxAI: Grok 4.52026-07-0856知能72コーディング
- tencentTencent: Hy32026-07-0642知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3055知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
$72.02と$637.85。これはArtificial AnalysisがDeepSeek V4 FlashとMuse Spark 1.2を同じ9つのベンチマークで実行するのに費やした金額です。両モデルは4ポイント差でした——Intelligence Indexで50対54。Metaのモデルの方が優れています。また、同じ作業を実行するには8.9倍のコストがかかり、クローズドウェイトで、提供元はちょうど1つのプロバイダーのみ、そしてDeepSeek V4 Flashより5日新しいモデルです。4ポイントの差にそれだけの価値があるかどうかは、何を構築しているかに完全に依存しており、この比較は主にその問いに答えられるようにするためのものです。
両モデルは1週間以内に相次いで登場した。DeepSeek V4 Flash(ビルド0731)は2026年7月31日、Muse Spark 1.2は8月5日である。両方とも長期スパンのエージェント業務向けに売り出されている。以下のインデックススコア、レイテンシー数値、評価コストはすべてArtificial Analysisによるもので、同社は自らベンチマークを実行し、その料金を公開している。数値が独立した実行ではなくMetaまたはベンダー自身のドキュメントに由来する場合、その旨が文中に明記されている。
これを決める4つの数字
• Intelligence Index — Muse Spark 1.2 54(185中13位)、DeepSeek V4 Flash 50(同クラス101中3位、クラス中央値は25)。
• トークン100万個あたりのブレンド価格 — $0.78 vs $0.06。13倍。
• 同じ9ベンチマークスイートのコスト — $637.85 対 $72.02.
• 実行できる場所 — 1つのプロバイダー(クローズドウェイト)に対して、6つのAPIプロバイダーと、自分でホストできるMITライセンスのウェイト。
同じスイート、大きく異なる2つの請求書

評価コスト列は、2つのモデルを比較する際に利用できる最も正直なコスト比較です。なぜなら、同じ作業を各モデル自身のレートで価格設定し、各モデルが自分で使うと決めただけのトークンを使用するからです。Muse Spark 1.2 はインテリジェンス・インデックスを完了するのに637.85ドルを必要としました。DeepSeek V4 Flash は72.02ドルで済みました。これは、Artificial Analysisが測定した他のすべての著名なモデルよりも安く、その発見は8月初旬に独自の報道サイクルを得ました。
What makes that gap interesting is that it happens despite the DeepSeek V4 Flash model being the more verbose one, not because of it. Running the suite, DeepSeek V4 Flash emitted 210 million output tokens against Muse Spark 1.2's 95 million — more than twice as many. Meta's model is meaningfully more token-efficient at the same task, and it does not matter at all, because DeepSeek V4 Flash charges $0.28 per million output against Meta's $4.25. A 15× price advantage swallows a 2.2× verbosity disadvantage without noticing.
これが自社のコストモデルに持ち込むべき点です。トークン効率は実在する特性であり、推論モデルによってその差は大きなものですが、現在の市場スプレッドでは二次的な要素にすぎません。決定するのはレートカードであり、2つのモデルの価格がおよそ3倍以内の差である場合にのみ、その判断は覆ります。
4つのポイントがどこにあるのか — そして誰も発表していないこと

この対戦で厄介なのはここだ。インテリジェンス・インデックスは、エージェント、コーディング、一般的な能力、科学的推論にわたる9つの評価を合成したものだが、Artificial AnalysisはMuse Spark 1.2のベンチマークごとの内訳をまだ公開していない。つまり「54対50」は、今のところ内訳のない見出しにすぎない。4ポイントの差は、コーディングの差かもしれないし、長文コンテキストの差、幻覚耐性の差かもしれない。あるいは、4つの小さな差が積み重なって、あなたのワークロードでは相殺されて無に帰すかもしれない。
各ベンダー自社の数値がその空白の一部を埋めており、どちらも他方と照合して検証することはできない。Metaは、Muse Spark 1.2のTerminal-Bench 2.1スコアを82.9%(1.1の76.2%から上昇)、DeepSWE v1.1を59.3%(53.0%から上昇)と報告している。これはMetaの評価ハーネス上で、5回の試行におけるpass@1で実行され、各競合モデルはそれぞれ自社のエージェント製品とペアになっている。V4 Flashリリースは、このモデルを、総パラメータ284B/アクティブ13Bの混合エキスパート(MoE)上でエージェントおよびターミナル作業向けに調整されたポストトレーニングアップグレードとして位置づけた。両ラボが比較可能な数値を公開しているベンチマークは存在せず、第三者もいずれの数値セットも再現していない。
独立に確立されている事実は狭い範囲にとどまり、それを率直に述べる価値はある。すなわち、とある評価者によって実施された一つの複合インデックスにおいて、Muse Spark 1.2 は、コストが8.9倍であるにもかかわらず、4ポイント上回った。それよりも細かい点はすべて、依然としてベンダーの資料の域を出ない。
Muse Spark 1.2の支払い方法は3つ、DeepSeekは1つ半
ここでの価格比較は通常以上に捉えにくい。なぜなら、Metaは2種類の料金表を提供し、ベンダー自身がウェイトを提供しているからだ。
• Meta 標準ティア — 入力 $1.25、キャッシュ入力 $0.15、出力 $4.25(100万あたり)、レート上限は毎分約3,000リクエストです。
• Meta コントリビューター ティア — 入力 $0.10、キャッシュ入力 $0.002、出力 $0.20。将来の Meta モデルをあなたのトラフィックでトレーニングする許可と引き換えに、毎分 60 リクエストに上限があります。
• DeepSeek V4 Flash リスト — 入力$0.14、出力$0.28、キャッシュヒット時$0.003(98%割引。この価格帯のどのモデルよりも積極的なキャッシュレート)。競合する6つのAPIプロバイダーから提供。
• DeepSeek V4 Flash セルフホスト — MITライセンスのオープンウェイトなので、価格は自身のハードウェアであり、上限は自身のキャパシティです。
2行目と3行目を合わせて読むと、順位が逆転します。コントリビューター層では、Muse Spark 1.2 はDeepSeek V4 Flash よりもトークンあたりのコストが安く、$0.14/$0.28 に対して $0.10/$0.20 という価格で、スコアが4ポイント高くなっています。これはこの比較全体の中で最も攻勢的な価格設定であり、ほぼ誰もそれを利用できないでしょう。なぜなら、毎分60リクエストは標準予算の2%に過ぎず、実質的にあらゆる本番環境でのファンアウトを排除するからです。これは評価や小規模チームの作業向けに価格設定されており、その通貨はあなたのプロンプトです。そのトレードが利用可能かどうかは、設定ファイルで入れ替える項目ではなく、法務部門の管轄となるデータガバナンスの決定事項です。
オープンウェイト側はその逆です。MITライセンスのウェイトは、価格の下限がベンダーによって設定されることが一切ありません。GPUを正当化できるだけのボリュームがあれば、誰も料金を引き上げたり、モデルを非推奨にしたり、利用条件を変更したりすることはできません。この選択肢は、Meta側ではどのティアにも同等のものは存在しません。
プロバイダー1社対6社

Muse Spark 1.2 は Meta の Model API 経由でのみ提供されており、他の経路は一切ありません。サードパーティ製ホストもなく、量子化オプションもなく、フォールバック経路もなく、さらに本稿執筆時点では OpenRouter への掲載もなく、Hugging Face リポジトリもなく、OrcaRouter カタログへの登録もありません。単一プロバイダーによるクローズドモデルは、構造上、単一障害点となります。また、リリースから5日しか経っていないモデルには、安心を裏付けるアップタイム実績がありません。
DeepSeek V4 Flash はその逆のケースです。現在6つのAPIプロバイダーがこれを提供しており、ウェイトはMITライセンスで、OrcaRouterカタログには入力$0.15、出力$0.29で掲載されています。これはプロバイダーのリスト価格であり、0%マークアップでそのまま渡されます。また、プロバイダー間の自動フェイルオーバーを備えているため、単一のホストが劣化してもワークロードを巻き込んで停止することはありません。これが、スコアとは無関係な、より安価なモデルを選ぶ実際的な根拠です。つまり、移行、ミラーリング、完全な離脱のいずれも可能であり、どのオプションも新しい統合を必要としません。
今日、Muse Spark 1.2にとって評価とは、2つ目の契約、2つ目の請求書、そして2つ目のSDKパスを意味する。Metaのモデルはその実力に基づいてテストする価値があるが、それを実行する運用コストがトークン価格だけではないことを明確にすべきだ。
実トラフィックで測定されたレイテンシ
ベンチマークハーネスでは、Artificial AnalysisはDeepSeek V4 Flashのファーストトークンまでの時間を1.33秒、xhigh推論設定のMuse Spark 1.2では26.12秒と記録しており、出力速度はそれぞれ毎秒103.3トークンと165.0トークンです。Metaのモデルは、開始すると生成が速い一方で、開始までに非常に長い時間がかかり、これはまさに最大努力での必須熟考がどのようなものかを示しています。
本番稼働データは、同じ話のより穏やかなバージョンを物語っている。OrcaRouterでの7日間のライブルーティングにおいて、DeepSeek V4 Flashは、最初のトークンまでの時間のp50が439ミリ秒、p95が1.96秒、毎秒111トークン、エラー率1.6%を示している。Muse Spark 1.2はまだどこにもルーティングされていないため、同等の本番データは存在しない。最も近い代替指標であるMuse Spark 1.1は、p50が1.84秒、p95が6.00秒である。1秒未満の中央値応答は、DeepSeek V4 Flashが該当するカテゴリであり、Muse Sparkのどのバージョンもまだ到達していない。
両モデルはおおよそ100万トークンのコンテキストを宣言している——両者とも1,048,576トークンで、DeepSeek V4 Flashは完了応答を384,000トークンに制限している一方、Muse Sparkエンドポイントは完了上限を一切宣言していない。コンテキストに関しては、この対決は紙面上では互角であり、実際には両者とも未検証である。
乗り換える前に尋ねる価値のある3つの質問
DeepSeek V4 Flashをセルフホスティングする方が、実際には100万トークンあたり0.15ドルより安いのでしょうか?
通常はそうではない、そしてそれが要点だ。284Bパラメータの混合エキスパート(Mixture of Experts)で13Bがアクティブなモデルは、妥当なレイテンシで提供するには本格的なマルチGPUキャパシティが必要であり、100万入力トークンあたり0.15ドルというホステッド料金は、非常に高く非常に安定したボリュームでない限り、対抗するのが難しい。ほとんどのチームにとってMITライセンスの価値は、セルフホストするということではなく、実際にセルフホストできるという信頼性にある。それがプロバイダーが請求できる価格に上限を設け、非推奨リスクを排除する。それを保険として扱い、ホステッドトークンを購入しよう。
コントリビューターティアは、Muse Spark 1.2をより安価なモデルにするのでしょうか?
料金表上はその通りです。ただし実際には、データ提供が許可されている、毎分60リクエスト未満のワークロードに限られます。両方の条件が満たされる場合——研究の一時的な需要、社内ツール、合成入力によるベンチマークハーネスなど——トークンあたりの価格が低く、インデックスで4ポイント優れたモデルの方が、真にお買い得であり、それを選ぶべきです。どちらかの条件が満たされなければ、標準ティアが実際の価格であり、標準ティアはV4 Flashモデルのブレンドレートの13倍です。
インデックスポイントが4つでは小さく聞こえます。それが問題になるのはいつですか?
エラーが複合的に積み重なるとき。単発の分類・要約呼び出しでは、複合スコアの4ポイント差はしばしば見えず、そのために9倍のコストを払うのは正当化できません。50ステップのエージェントループでは、1ステップあたりの成功率の差が小さく見えても、実行全体を再起動しなければならない頻度に大きな差として増幅されます。そして再起動には1ステップではなく、軌道全体のコストがかかります。それがMetaの価格が議論の余地を帯びるケースです。また、複合スコアを信頼するのではなく、自分のタスクで測定すべきケースでもあります。なぜなら、1.2について決着をつけるエージェント型サブ指標を公開した人は誰もいないからです。
評決、そしてそれに付随する条件
コストが現実的な制約となるほぼすべてのワークロードにおいて、DeepSeek V4 Flash は正しいデフォルトです。ある複合指標では4ポイント遅れるものの、総合では13倍安く、本番環境での中央値レイテンシは1秒未満、6つのプロバイダーが利用でき、MITライセンスの重みで、しかもどのベンダーもあなたの利用条件を変更できません。現在、完全なベンチマークスイートを実行するのに最も安価な有名モデルであり、それは性能が悪いから実現したわけではありません。
Muse Spark 1.2 が価格に見合うのは、特定のワークの形態だけです。すなわち、失敗した軌道のコストが高く、追加の熟慮が待っているユーザーに感じられるのではなく数分単位の作業にわたって償却され、単一のプロバイダーで間に合い、4つのポイントが何から構成されているかの独立した内訳がなくても許容できる、長期的なエージェント型コーディングです。Meta は4か月で3つのモデルを出荷し、その間にインデックスを11ポイント動かしました。そのため、この主張は急速に強まるかもしれません。しかし今日のところ、それはベンダーが実施するコーディングベンチマークと1つの総合スコアに基づいています。
今週選ぶなら、両方を自分のエージェントループの50ステップで実行し、トークンあたりのドルではなく、完了したトラジェクトリあたりのドルを比較してください。その単一の測定は、そこで公開されているすべてのベンチマークよりも、この比較に正確に答えます。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
