
MiniMax M3 対 Muse Spark 1.2:ベンチマークを席巻する中での4倍の価格差
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniMax M3 は、当社のカタログでは入力100万トークンあたり0.30ドルです。Muse Spark 1.2 は1.25ドルです。これは入力で4.2倍、出力で3.5倍の差であり、この組み合わせについての最も有用な単一の事実です。なぜなら、同じカタログページ上で、Muse Spark 1.2 は両モデルが共通して評価されているすべてのベンチマーク行で MiniMax M3 を上回っているからです。一方は、ベンダー保証の512Kの使用可能コンテキストと512Kの出力上限を備えた、安価なオープンウェイトの選択肢です。もう一方は Meta の推論チェックポイントで、今や自らのファミリーより1世代遅れているにもかかわらず、それでもほぼどこでもそれを上回るスコアを出しています。このページの残りは、これら2つの事実のうちどちらが実際にワークロードを決定するのかについて述べています。そしてその答えは、すべてのワークロードで同じではありません。
これらのモデルが実際に何であるか
どちらも今年出荷されており、どちらも新しいものではない。それが重要なのは、どちらかが今まさに発売されるかのように書かれた比較ページは、1か月以内に時代遅れになるからだ。

MiniMax M3はMiniMax自身によるリリースで、2026年6月1日にベンダーのブログで「MiniMax M3:フロンティア級コーディング、1Mコンテキスト、ネイティブ・マルチモーダル——すべてを1つのモデルに」という見出しで発表されました。投稿は淡々とこう始まります。「MiniMax M3は本日正式にリリースされました。」MiniMaxによる3つの主張は、コーディングとエージェント作業でフロンティア級の性能に到達すること、同社が提案した新しいアテンションアーキテクチャであるMSA(MiniMax Sparse Attention)を使用していること、そしてネイティブにマルチモーダルであること——画像と動画の入力を受け付け、MiniMaxの言葉を借りれば「デスクトップコンピュータを操作できる」ことです。MiniMaxはさらに、これら3つの能力はクローズドソースのフロンティアモデルにとって最低限の必須条件であり、M3は「3つすべてを兼ね備えた初めてかつ唯一のオープンウェイトモデル」だと付け加えています。当社のカタログでは、このモデルはブログの日付より1日早い2026年5月31日から利用可能として掲載されています。
Muse Spark 1.2はMetaのものです。当社のカタログでは2026-08-05付としています。これは新しいティアではなく、Muse Spark 1.1に対する更新チェックポイントであり、性能がわずかに向上しています。同じStandardティアで同一価格で提供されるため、別製品ではなく、そのまま置き換えられるアップグレードです。際立った特徴は入力サーフェスです。テキスト、画像、動画、音声、PDFに対応します。出力はテキストです。
ここに、後で埋もれさせるのではなく記しておくべき文脈が一つある。Metaは2026-09-02にMuse Sparkファミリーを1.3チェックポイントへと進めた。その結果、1.2はこの系列の前世代となる。それは3週間前の出来事なのでニュースではなく、このページでもニュースとしては扱わない——ただし、今日この2つのどちらかを選ぼうとしている人は、現行のMiniMaxモデルと、取って代わられたMetaのモデルを比較しているのだと知っておくべきだ。
100万トークンあたりの価格、そしてワークロードに実際にかかるコスト

掲載料金は、当社自身のカタログにある各モデルのページから取得したもので、当該カタログはプロバイダーの定価を上乗せなしでそのまま反映しています:
• 入力 — MiniMax M3 100万トークンあたり$0.30 対 Muse Spark 1.2 100万トークンあたり$1.25
• 出力 — MiniMax M3 100万トークンあたり$1.20 対 Muse Spark 1.2 100万トークンあたり$4.25
• キャッシュ読み取り — MiniMax M3 100万あたり$0.060 対 Muse Spark 1.2 100万あたり$0.150
• 比率 — Muse Spark 1.2 は、入力で 4.2 倍、出力で 3.5 倍、キャッシュ読み取りで 2.5 倍
それらの抽象的な比率は、各ページのコスト計算ツールで具体的な数値になる。両方を月1,000万トークン、入力シェア70%に設定する — 要約や抽出のジョブにとって妥当な形で、この推定ツールが標準で備えているデフォルトでもある — と、MiniMax M3は月額5.70ドルになる。Muse Spark 1.2は月額11.30ドルになる。プロンプトキャッシュをオンにすると、同じワークロードは約4.86ドル対約9.63ドルになる。計算ツールは両方を定価に基づく推定値と表示しているが、これは適切な注意書きだ。実際のトークン数はプロバイダーのトークナイザーに依存する。
安価なワークロードなら、その差額はコーヒー代程度だ。重要なのは絶対値ではなく、曲線の形である。月に1億の出力トークンを扱うワークロードでは、Muse Spark側だけで3桁から4桁へと変わる。コストが、あなたがこの組み合わせを検討するきっかけになった制約なら、自分のトラフィックで試算すべきなのはその数字だ。
当社はプロバイダーの定価をマークアップなしでそのまま反映しているため、ベンダーの値下げは発表当日に当社側へ反映され、これらのモデルはどちらもここにルーティングされています。1つのキーで両方をカバーするので、両者を相互に価格設定するのに2つ目の契約やコード変更は必要ありません。
コンテキストウィンドウ、そして実際にそこに収まるもの
これは、スペック表の上ではこの2つが最もよく似て見え、実際の使用では最も似ていないセクションです。
• コンテキストウィンドウ — MiniMax M3 1,048,576トークン 対 Muse Spark 1.2 1,048,576トークン
• 最大出力 — MiniMax M3 512,000トークン 対 Muse Spark 1.2 131,072トークン
• 入力対応範囲 — MiniMax M3 のテキスト、画像、動画 対 Muse Spark 1.2 のテキスト、画像、動画、音声、PDF
• 出力サーフェス — どちらもテキストのみを出力します
• 構造化パラメータ — MiniMax M3 は tools と tool_choice を公開し、Muse Spark 1.2 は reasoning_effort と structured_outputs を公開します
どちらのウィンドウも同じ100万トークンなので、「どちらがより多くのコンテキストを持つか」という問いに勝者はありません。最大出力の行で両者は分かれます。MiniMax M3 の応答は512,000トークンに達することができ、Muse Spark 1.2 の上限131,072のおよそ4倍です。あなたの作業が長文生成——ファイル全体の書き直し、長いレポート、文字起こし規模の出力——なら、その差は構造的であり、漸進的ではありません。長い入力に対する短い回答が作業なら、それは無関係です。
入力サーフェスの行は逆に作用する。Muse Spark 1.2 は音声と PDF を直接受け付けるが、MiniMax M3 のドキュメント上の入力サーフェスは画像と動画までにとどまる。通話録音やスキャン済み文書を取り込むパイプラインでは、この2つで行う前処理の量が変わってくる。
MiniMax側では、このコンテキストに関する主張には、ベンダー自身によるものとして明確に位置づける価値のあるアーキテクチャ上の注記が含まれています。MiniMaxはM3の長コンテキスト挙動をMSA(MiniMax Sparse Attention)に帰しており、当社のカタログでは、MSAは最大100万トークンのコンテキストを「最低512Kを保証」でサポートすると説明しています。この最低保証という枠組みはMiniMaxによるものであり、当社が示せる独立した測定結果は存在しないため、512Kという下限は検証済みの数値ではなく、ベンダーの主張として扱ってください。
自社ゲートウェイにおけるレイテンシとスループット
これらは私たちが最も直接的に関与できる数値です。なぜなら、これらは私たち自身の数字だからです。これらは2026-09-23までの7日間を対象としており、ベンダーのベンチマークではなく、私たちのゲートウェイ上のトラフィックを表しています。
• p50 初回トークンまでの時間 — MiniMax M3 4.28 秒 対 Muse Spark 1.2 4.82 秒
• p95 初回トークン生成までの時間 — MiniMax M3 10.00 秒 vs Muse Spark 1.2 10.00 秒
• 出力速度 — MiniMax M3 289 tok/s 対 Muse Spark 1.2 507 tok/s
• エラー率 — MiniMax M3 0.12% 対 Muse Spark 1.2 0.15%
• トラフィック、過去7日間 — MiniMax M3 153.8Mトークン vs Muse Spark 1.2 79.6Mトークン
これを正直に読むと、全体像は割れている。初回トークンまでの時間では両者は近く、中央値で4.28秒対4.82秒、p95は10.00秒で小数第2位まで一致しているが、これは本当の互角ではなく、両者が同じ上限付近にあることによる丸めの産物だ。出力速度では、両者はまったく近くない。Muse Spark 1.2 は MiniMax M3 の約1.75倍の速度でストリーミングし、総コストが高くても、長い生成を眺めるユーザーの体感を変える。エラー率は互いに丸め誤差の範囲内で、どちらも低い。
トラフィックの行は、スコアボードというよりシグナルとして読む価値がある。同じ7日間で、MiniMax M3 は当社のゲートウェイ上で Muse Spark 1.2 の約2倍のトークンを処理した。それはベンチマークが語ることではなく、市場が選んでいるものだ。そしてこの組み合わせでは、両者の見解は一致しない。
両方を1つのエンドポイントの背後にルーティングするのは、ワークロードがどちらのモデルを好むかを安上がりに知る方法でもあります。フェイルオーバーがあれば、どちらかのモデルでプロバイダー側の劣化が起きても、エラーではなく動作する経路へと流れるからです。
ツール呼び出しと長期的なエージェント作業
ここは、測定結果において両者が最も大きく隔たっている点であり、また注意すべき留保事項が最も重要となる点です。
• Terminal-Bench v2.1 — MiniMax M3 52.4 対 Muse Spark 1.2 80.1
• tau_banking(ツール使用) — MiniMax M3 12.3 vs Muse Spark 1.2 34.8
• MCP Atlas — MiniMax M3 74.2(ベンダー報告値)対 Muse Spark 1.2 未測定
• BrowseComp — MiniMax M3 83.5(ベンダー報告値) 対 Muse Spark 1.2 未測定
• OSWorld-Verified — MiniMax M3 70.0(ベンダー報告)vs Muse Spark 1.2 未測定
最初の2行は、当社自身のカタログページにあるベンチマークパネルから来ており、両モデルが入力した唯一のエージェント系行です。両者は接戦ではありません。Muse Spark 1.2 は tau_banking で MiniMax M3 を2倍以上上回り、Terminal-Bench v2.1 では28ポイント近くリードしています。あなたのワークロードがツールサーフェスを備えた長期的なエージェントであるなら、これがこのページで最大の単一ギャップです。
次の3行はMiniMax自身の数値で、ローンチ記事に公開されたものだ。最初の2つとは比較できない——ハーネスが異なり、独立した監査もない——が、これらのタスクにおけるMiniMax M3の唯一の公開数値であり、これを省けばモデルを過小評価することになる。ベンダー報告として読み、それ以上ではない。
一つの相違点は、独立した段落として扱う価値がある。それは、比較ページなら通常はならしてしまいがちな類のものだからだ。MiniMaxの発表記事は、M3についてTerminal-Bench 2.1を66.0と示しており、それは数値表を伴わないグラフ画像の中にある。当社のカタログページにある独立したTerminal-Bench v2.1の行では、同じモデルについて52.4と表示されている。タスク名は十分に近いため、読者は両者を並べて目にすることになり、両数値は13ポイント以上異なっている。どちらかが誤りだと断定するつもりはない。考えられる説明は、ハーネスまたは実行構成が異なることだ。正直に述べるなら、ベンダー自身の数値と監査済みの数値は一致しておらず、ベンダーの数値の方が高い。
パラメータ一覧が語るのは、より小さく、より実用的な話だ。MiniMax M3 は tools と tool_choice を公開しているため、ツール選択はリクエストから操作できる。Muse Spark 1.2 は reasoning_effort を公開しているため、代わりに推論の深さを操作できる。どちらも相手方の調整ダイヤルは公開していない。アプリケーションの制御上の課題が「適切な関数を呼び出させること」なら、それは一方を指し、「難しいケースでより長く考えさせること」なら、もう一方を指す。
コーディング
コーディングはMiniMax M3の目玉の売り文句であり、測定された隔たりが同モデルにとって最も気まずくなる領域でもある。
• AAコーディングインデックス — MiniMax M3 38.7 対 Muse Spark 1.2 72.2
• SciCode — MiniMax M3 43.1 対 Muse Spark 1.2 57.4
• SWE-Bench Pro — MiniMax M3 59.0(ベンダー報告)対 Muse Spark 1.2 未測定
• KernelBench Hard — MiniMax M3 28.8(ベンダー報告値)vs Muse Spark 1.2 未計測
MiniMaxのM3におけるポジショニングはコーディング優先です——ローンチの見出しでは「Frontier Coding」が100万トークンのコンテキストとマルチモダリティよりも優先されています。同社が報告したSWE-Bench Proのスコア59.0は、ベンダーのハーネス上では強い数字です。しかし、両モデルが記入した独立系のCoding IndexとSciCodeの行では、Muse Spark 1.2が大差でリードしており、Coding Indexの33ポイントの差は、このページでtau_bankingに次いで2番目に大きいものです。
利用可能な証拠に基づいてMiniMax M3をより優れたコーディングモデルとして提示する誠実な方法は存在しない。言えるのは、ベンダー自身のコーディング指標は高く、独立系の指標はそうではないということであり、これは上記のTerminal-Benchの乖離と同じパターンである。コーディングを判断の決め手とする人は誰でも、ローンチ記事のチャートよりも監査済みの行を重く見るべきであり、どちらかでテストするのではなく自分たちのリポジトリでテストすべきだ。
それらが本当に近いところでは
三つの行は勝者を生み出そうとしない。そう言うことのほうが、勝者をでっち上げるよりも有用である。
• GPQA Diamond — MiniMax M3 89.9 対 Muse Spark 1.2 90.4、実用上は引き分けと言える0.5ポイント差
• p95 初回トークンまでの時間 — 過去 7 日間、当社のゲートウェイではいずれも 10.00 秒
• コンテキストウィンドウと出力モダリティ — 入力トークン1,048,576、テキストのみの出力で同一
大学院レベルの科学推論では、両者は事実上見分けがつかず、それは MiniMax M3 のはるかに安価なモデルが、より高価なモデルに対して互角に渡り合う唯一の推論項目だ。総合指標を読むときには覚えておく価値がある。これらのモデル間の差は能力全体にわたって一様ではなく、エージェント的作業とコーディング作業に集中しており、知識重視の多肢選択問題ではほぼゼロなのだ。

MiniMax M3ならこれを選び、Muse Spark 1.2ならこれを選ぶ
冒頭の段落にあった2つの事実は、何を作っているかによって異なる形で結論づけられる。だからここでは、曖昧にせずにその分岐を示す。
• トークンあたりのコストが制約条件になっているなら、131,072トークンを超える長文出力が必要なら、オープンウェイトが必要なら、別途パイプラインを用意せずに動画入力を扱いたいなら、あるいは入力価格のおよそ4分の1で推論重視のナレッジワークをこなしたいなら、MiniMax M3を選ぼう — GPQA Diamondではほぼ互角であり、まさにその項目こそ、この安価なモデルがその座を得る場面だ。
• ワークロードがツールを使う長期的なエージェントである場合、監査済みのコーディングスコアが最も高い必要がある場合、明示的な reasoning_effort ダイヤルが必要な場合、音声やPDFを直接取り込む必要がある場合、または高速なストリーミング出力が必要な場合には、Muse Spark 1.2 を選んでください — 507 tok/s 対 289 tok/s はベンチマーク上の違いではなく、目に見える違いです。
• どちらを選べばよいかまだ分からない場合、その決め手となる証拠はこのページにはありません。両方のモデルを自社のトラフィックのサンプルに当てて測定してください。各モデルページの料金計算ツールを使えばコスト面はすぐに分かりますし、上の7日間のレイテンシ数値は、性能面を予習するのに最も近い情報です。
どちらもプロバイダーの定価に上乗せのない単一のAPI上にあり、したがって試用は移行ではなくモデルIDの変更で済み、自動フェイルオーバーにより、どちらかのプロバイダーに障害が起きてもサービス停止ではなく回答が遅くなるだけで済みます。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
