Mistral Large 4 対 MiniMax M3 のタイトルカード。1億トークンあたり月48ドルの差を軸に、MiniMax M3 は動画入力と512K出力に対応し、Mistral Large 4 は画像のみのプレビュー版。
Guides & Insights

Mistral Large 4 対 MiniMax M3:5か月の進歩にかかるコスト

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

MiniMax M3はこのクラスで最も安いモデルであり、2026年5月31日以降ずっとそうだ。入力100万トークンあたり0.30ドル、出力100万トークンあたり1.20ドル、キャッシュ100万トークンあたり0.06ドルで、Mistral Large 4を入力ではおよそ半分、出力では2倍下回っている——そして新しい方のモデルと違い、プレビューというラベルが付かない状態で今日購入できる。Mistral Large 4は、2026年10月6日からパブリックプレビュー中の1.05兆パラメータのオープンウェイトモデルで、0.68ドルと2.09ドルかかり、今月末までに重みを公開すると約束している。オープンウェイトの旗艦モデルが2つ、5か月の隔たりがあり、その5か月が目に見える形で現れるのはたった一か所だけだ。M3の独立したIntelligence Indexスコア29.2に対し、Mistral Large 4のスコアはまだ存在しないのだから。

これがこの比較の正直な姿であり、価格表が示唆するよりも興味深い。M3は特定のアーキテクチャ上の賭け——MiniMax Sparse Attention、100万トークンを超えて持続するコンテキスト、動画を第一級の入力として扱うこと——を中心に構築されており、Mistral Large 4が争わない2つのカテゴリ、すなわち生の出力長とネイティブ動画において、紙の上では勝っている。それ以外のあらゆる点では、新しいモデルのほうが買い手にとって望ましいものであり、その価格も依然として十分に低いため、差が購入を左右することはほとんどない。

2つのアーキテクチャ、2つの賭け

MiniMax M3は、MiniMaxの旗艦オープンウェイト基盤モデルであり、最先端のコーディング性能とエージェント性能、100万トークンのコンテキストウィンドウ、ネイティブマルチモーダル対応を単一のリリースで兼ね備えた初のモデルです。テキスト、画像、動画を入力として受け取り、テキストを返します。また、MiniMax Sparse Attention上に構築されています。これは最大1,048,576トークンのコンテキストを維持し、最低512Kを保証するように設計されたアーキテクチャです。事前学習パイプラインは、マルチモーダルデータを後から追加するのではなく最初の段階から用いて、100兆トークンを超える規模に拡張できるよう再構築されました。最大出力は512,000トークンです。

Mistral Large 4は異なる賭けに出ている。これは細粒度の mixture-of-experts モデルで、総パラメータ1.05兆のうち490億がアクティブ、16億パラメータの視覚エンコーダを備え、Mistral自身の欧州データセンター内で、3,800基のNVIDIA Grace Blackwell GPU上で、160以上の言語にまたがるデータを用いてゼロから学習された。テキストと画像を扱い(動画は不可)、約100万トークンのコンテキストに対応する。そしてMistralはこれを主権的展開を軸に位置づけている。欧州のインフラ、オープンウェイト、自社のポリシーの下で実行できる能力、そしてサイバーセキュリティを旗艦ユースケースとする。

• コンテキストウィンドウ — MiniMax M3 1,048,576トークン 対 Mistral Large 4 約1,000,000

• 最大出力 — MiniMax M3 512,000トークン vs Mistral Large 4 は未記載

• 入力モダリティ — MiniMax M3 はテキスト、画像、動画 vs Mistral Large 4 はテキスト、画像

• 入力価格 — MiniMax M3 は100万トークンあたり$0.30、Mistral Large 4 は100万トークンあたり$0.68

• 出力価格 — MiniMax M3 は100万あたり$1.20、Mistral Large 4 は100万あたり$2.09

• キャッシュ入力 — MiniMax M3 は100万トークンあたり$0.06、Mistral Large 4 は100万トークンあたり$0.07

• パラメータ — Mistral Large 4 総計1.05T / アクティブ49B 対 MiniMax M3 非公開

• リリース済み — MiniMax M3 2026年5月31日 vs Mistral Large 4 2026年10月6日、プレビュー

• 重み — どちらもオープンライセンス、Mistral Large 4 のものは2026年10月末までに提供が約束されている

A two-column scoreboard comparing Mistral Large 4 and MiniMax M3 on input and output price, Artificial Analysis Index, input modalities, maximum output and release date.

スコアボードは接戦ではなく、フェアでもない

Artificial Analysis Intelligence Index v4.3.2では、MiniMax M3は29.2を記録し、147モデル中62位につけている。これは中位の結果であり、モデルへの批判ではない — このIndexはM3のリリース後に改訂され、MiniMaxのトレーニング時には存在しなかった評価が含まれている。コーディングのサブスコアはより良い状況を示している。AA Coding indexで58.6、138中46位、Terminal-Bench 2.1で65.2%だ。GPQA Diamondで92.9%、長文コンテキスト想起で83%、SciCodeで47.1%を記録している。

Mistral Large 4 は同じリーダーボード上に Index スコアを持たない。ページは「Mistral Large 4 Preview」というタイトルで公開されており、その数値は記載されていない。Mistral が公表しているのは、ML4 が総合 Coding Agent Index で 49.8% を記録し、DeepSeek V4 Pro 0813 と Qwen3.8 Max を上回っていること、そして AutomationBench——Gmail、Sheets、Slack、Salesforce にまたがる 657 の業務ワークフロー——で 59.9% をスコアし、Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Pro を上回っていることだ。どちらの比較でも MiniMax は名を挙げられておらず、このこと自体が、Mistral がどれを真の競合と見なしているかというシグナルになっている。

つまり、公平に解釈するならこうだ。M3は、能力が高く、安価で、ドキュメントも整ったモデルであり、総合スコアは中位、コーディング性能もまずまずで、登場から5か月が経っている。ML4はプレビューモデルで、自称する上限はより高く、総合スコアは未公開であり、Artificial Analysisが非公開で評価し、そのハーネスが出荷された際にCoding Agent Indexで公開する予定の一連のエージェント指標を備えている。今日すぐに数値が必要なら、M3がそれを与えてくれる。数週間待てるなら、ML4もそれを与えてくれるだろうし、Mistralはそれがより高くなると賭けている。

M3がMLからまったく競合を受けない場合

そのリストの2行はトレードオフではなく、不在である。

動画入力が第一だ。M3はテキストや画像と同様に、動画をネイティブに受け付ける。Mistral Large 4はテキストと画像だけを受け付け、それ以外は受け付けない——Mistral自身の深掘りは、ギガピクセル級の衛星画像や設計図に対するグラウンディングに関するものであり、これは依然として画像処理だ。あなたのパイプラインが画面録画、監視映像、ビデオドキュメンテーションを取り込むなら、価格がどうであれ、ML4はそのモデルにはなれない。それはMistralが価格改定で埋めるようなギャップではない。

出力長は2番目です。M3は1回の応答で最大512,000トークンを出力します。MistralはML4の出力上限を公表していません。長い構造化された成果物——完全なレポート、大規模な移行スクリプト、完全な仕様書——を一度に生成することは、512Kの上限がIntelligence Indexの1ポイントよりも価値を持つワークロードであり、MistralがML4の上限を文書化するまでは、そのワークロードを前提に計画できるのは2つのうちM3だけです。

M3のベンダー報告によるエージェント性能指標は、同じプロファイルを裏付けている。MiniMaxは、自律的なウェブリサーチのBrowseCompで83.5、コンピュータ操作のOSWorld-verifiedで70、ツール使用のMCP Atlasで74.2、GDPvalルーブリックで76.7、SWE Bench Proで59としている。これらはMiniMax自身の評価によるもので、独立に再現されたものではなく、その29.2というIndexスコアとは奇妙に食い違っている——まさにこれが、ベンダー対独立という区別が重要である理由だ。あるモデルがベンダーが選んだベンチマークで首位に立ち、中立的な10評価平均では中位に留まることはあり得るし、両方とも真実であり得る。

2xは価値がありますか

ここでの価格差は絶対額で見れば本当に小さく、その点はクローズドなフラッグシップに対するミスマッチと比べて判断の前提を変える。1億トークンの月を4:1の入力/出力比で考えてみよう。入力8000万トークン、出力2000万トークンだ。M3の請求は24ドル+24ドルで、合計48ドル。Mistral Large 4の請求は54.40ドル+41.80ドルで、合計96.20ドル。割増は月およそ48ドル——規模が大きければ実際の金額だが、1回の回避できた障害で元が取れる種類の差だ。

キャッシュを考慮すると差はさらに縮まり、しかもM3に有利なのはごくわずかだ。キャッシュ済みトークン100万個あたり$0.06対$0.07というのは、この価格帯では誤差に等しい。どちらも十分に安いので、判断は請求額ではなく能力と適合性で下すべきであり、これは一見したところのこの比較の読み方とは正反対である。

プレミアムで買えるのは span だ。ML4 は5か月後に、より新しいデータで、1兆パラメータ・アクティブ490億の mixture-of-experts 構成で学習され、Mistral はそれを公称1日330億トークンで強化学習にかけており、その実行はまだ飽和していない。M3 は完成しており、ML4 は公表されたケイデンスで改善を続けている。ベンダーが、今日買うモデルはあなたがこれから金を払う中で最も弱いバージョンだと述べ、現行モデルに対する上乗せが100万トークンあたり1ドル未満であるなら、通常は新しいモデルのほうがより良いデフォルトだ。例外は上記2つのワークロードであり、そこでは古いモデルだけが適合する。

ギャップを回り込むルーティング

A screenshot of the OrcaRouter model page for MiniMax M3, showing the minimax/minimax-m3 route from MiniMax, its text, image and video input, and the $0.30 input and $1.20 output price per million tokens.

これは、両方を動かすことがヘッジではなくむしろ本当の答えとなるペアリングです。なぜなら、2つのモデルは互いに重ならない領域で強みを発揮するからです。動画を入力し、長い成果物を出力する、あるいは computer-use ループ:M3。文書と画像の分析、エージェント型ワークフロー、あるいは自社のポリシーの下で欧州のインフラ上で実行する必要があるもの:ML4。どちらか一方を不要にするようなルーティングルールは存在しません。

どちらも OrcaRouter 上の単一の OpenAI 互換エンドポイントの背後にあり、マークアップは0%で、プロバイダーの定価は無改変でパススルーされます。これにより5か月分の価格差が実態に即して保たれます — MiniMax が M3 の料金を引き下げたり、Mistral がプレビュー料金を終了したりすれば、あなたのルートが評価される基準となる数値はその日のうちに変わります。ルーティング DSL は、ばらばらの強みを1つの呼び出しサーフェスに変えます。リクエストのモダリティを検査するルールが、動画を含むペイロードを M3 に、それ以外をすべて ML4 に送ります。プレビューモデルの可用性の一時的な不具合がユーザーに伝播するのではなく自動フェイルオーバーによって吸収されるという確信を持っています。単一の出力が単一の価格よりも重要である場合、モデルフュージョンは両方を実行し、パネルに選ばせることができます。これは、Mistral が主張する上限を手に入れつつ、M3 の文書化された挙動を下限として維持する合理的な方法です。

A decision card headed When each one wins, matching MiniMax M3 to video input and 512K output at $0.30 and $1.20, and Mistral Large 4 to image and document work that runs in Europe.

評決

MiniMax M3は、2つのワークロードには正解で、3つ目には擁護可能な答えだ。動画入力、数十万トークン規模のシングルパス生成、コンピュータ操作エージェントはその領域であり、価格はこのクラスのどのフラッグシップよりも低く、公表されている中位のスコアは、自分が何を手に入れるのかを正確に把握できることを意味している。自らのニッチで取って代わられていないモデルにとって、5か月経っていることは古くはない。

Mistral Large 4は、それ以外のすべてにおいてより良いデフォルトだ。月に1億トークンを使うと約48ドル余分にかかり、パラメータ数と欧州でのトレーニングの系譜はより高い上限を示唆しており、サイバーセキュリティに関する主張は検証可能なほど具体的で、約束されたオープンウェイトとオンプレミス展開は、M3のAPIのみのエンタープライズ向け提案では満たせない要件を満たす。その賭けの代償は、Independent Intelligence Indexのスコアが公表されておらず、Mistralが数週間以内に大幅に変わると述べている振る舞いのモデルにコミットすることだ。

これを決着させる2つの日付がある。2026年10月末——ML4の重みが公開されるか、さもなければオープンウェイトの約束が怪しくなり始める——と、Coding Agent Indexの公開——そこでは、同じリビジョンにおいて、Mistralが非公開で評価した49.8%がM3の公開コーディングスコア58.6と並ぶ。それまでは、M3は検証できるモデルであり、ML4はあなたが賭けているモデルだ——そして1億トークンあたり月額48ドルの割増なら、それは大きな賭けではない。