記事「Mistral Large 4 vs DeepSeek V4 Pro」用に生成されたタイトルカード。タイトルは太字のジオメトリックサンセリフ体で表示され、その下にサブタイトル「双子のアーキテクチャ、対照的な賭け」が添えられている。上部には3つのフラットなラインアイコンが横一列に並び、うち2つは同じネットワークノードで、一方にはダウンロード矢印があり、もう一方はグレーアウトされている。白い背景にブルーとシアンのグラデーションアクセントが入り、右下隅にはOrcaRouterのロゴが配置されている。
Guides & Insights

Mistral Large 4 vs DeepSeek V4 Pro:双子のアーキテクチャ、相反する賭け

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

この比較における2つのモデルは、紙の上ではほぼ同一でありながら、実運用においてはこれ以上なく異なっている。Mistral Large 4は、490億のアクティブパラメータを持つ1.05兆パラメータのスパース混合エキスパート(MoE)で、2026年10月6日に発表された。DeepSeek V4 Proは、490億のアクティブパラメータを持つ1.6兆パラメータのスパース混合エキスパートで、2026年4月24日にリリースされた。同じアクティベーションバジェット、同じアーキテクチャファミリー、オープンウェイトの経済性でフロンティア性能を実現するという同じ主張——そして、そのうちちょうど1つだけが、今日ダウンロードできる重みを持っている。

この組み合わせは、本記事が考案したものではない。Mistral自身のローンチ投稿は、DeepSeek V4 Proを名指しで3つの別々の箇所でベンチマーク比較している。エージェント型コーディング、長期的な知識作業、ビジネスワークフロー自動化だ。反対側に同じ問いを投げかける——DeepSeek V4 Proがすでに実現していて、Mistral Large 4が約束していることは何か——と、プレビューが実際に何を追加するのかを知る最速の方法であることが分かる。

仕様、並べて比較

10月6日閲覧。Mistralの数値は同社の発表とモデルカードから、DeepSeekの数値は同社のライブカタログ項目から:

• 総パラメータ数とアクティブパラメータ数 — 総1.05T/アクティブ49B 対 総1.6T/アクティブ49B

• モダリティ — テキストと画像を入力、テキストを出力 対 テキストのみ

• コンテキストウィンドウ — Mistralの公称は1M、Artificial Analysisがテストしている構成では524,288、それに対して提供されるのは1M

• 出力上限 — プレビュー版では非公開 vs 384Kトークン

• 100万トークンあたりの価格、入力/出力 — 定価 $1.36 / $4.18、現在プロモーション適用で $0.68 / $2.09、比較対象は $0.66 / $1.98

• 100万あたりのキャッシュ入力 — $0.14、現在 $0.07、対 $0.022

• 重み — 10月末を約束、ライセンスは未記載 対 今すぐ利用可能

• トレーニングインフラ — Mistral自身の欧州データセンターにある3,800台のNVIDIA Grace Blackwell GPU 対 DeepSeek自身のクラスター

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' appears at version v26.10 described as 'A state-of-the-art, open-weight, general-purpose multimodal model', with no licence badge, next to a Mistral Large 3 card at v25.12 that carries an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

49Bというアクティベーション数の対称性は、注目の的であり、同時に罠でもある。アクティブパラメータはトークン生成のコストを左右し、総パラメータはモデルが何を知っているかを左右する。DeepSeekの1.6T対Mistralの1.05Tは、DeepSeekが計算されるトークンあたり約50%多い容量を抱えていることを意味する——知識集約型の作業では実質的な優位であり、ボトルネックが指示追従やツール使用にあるタスクではまったく優位にならない。

独立した指数が示すもの

両モデルともArtificial Analysisにページを持っており、このシリーズにおいて両者が同じハーネスで測定される数少ない比較の一つとなっている。インテリジェンス指数 v4.3、10月6日時点:

• インテリジェンス指数 — Mistral Large 4 Preview が38.4、DeepSeek V4 Pro 0813 が36.0

• インデックスタスクあたりのコスト — $1.13 対 $0.67

• Terminal-Bench 4.0 — 26.8% 対 14.1%

• Humanity's Last Exam — 35.0% vs 41.0%

• AutomationBench、ビジネスワークフロー — 59.9% 対 56.7%

• τ²-Bench、ツール利用型エージェント — プレビュー版では未公開(96.2% 対比)

• SciCode — 54.2% 対 51.0%

これは価格表示が示唆するよりもはるかに僅差の競争であり、両者の見解の相違はノイズではなく有益な情報だ。Mistral Large 4はエージェント型コーディングの項目で約13ポイント差をつけて勝利し、ワークフロー自動化の項目でも僅差で勝利する一方、DeepSeek V4 Proはオープンエンドな知識で6ポイント上回り、タスクあたりのコストは40%低い。また、この指標はコストをキャッシュ読み取り、キャッシュ書き込み、推論トークン、回答トークンに配分している点にも注意してほしい。— Mistralのキャッシュは90%割引、DeepSeekのキャッシュは97%割引であり、似た公表レートの2モデルが完了タスクあたり$1.13と$0.67になるのはそのためだ。

A generated two-column scoreboard titled 'Mistral Large 4 vs DeepSeek V4 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': total and active params 1.05T / 49B; Intelligence Index v4.3 38.4; Terminal-Bench 4.0 26.8%; AutomationBench 59.9%; modalities text and image in; weights promised end of October. Right column 'DeepSeek V4 Pro': total and active params 1.6T / 49B; Intelligence Index v4.3 36.0; Terminal-Bench 4.0 14.1%; AutomationBench 56.7%; modalities text only; weights open and available now.

DeepSeek V4 Proがすでに勝利を収めている領域

決定的な違いはベンチマークではない。DeepSeek V4 Proは今日すでにオープンウェイトであり、Mistral Large 4は開発元自身のクラスターから提供されるプレビュー版だという点にある。Mistralは重みを10月末に公開すると述べている——それは約束であり、成果物ではない。10月6日時点で確認したHugging Faceの組織には、7月より新しいものは何もない。ライセンスファイル付きのリポジトリが現れるまで、Mistralが唱えている自己デプロイの主張はDeepSeekのものだ。

2つ目の違いは、利用可能な幅の広さです。DeepSeek V4 Pro は4月からルーティング可能で、当社自身のカタログ上で、大差をつけて最も使われているモデルです — 執筆時点の直近7日間で11億3,000万トークンに達しており、これは典型的なフロンティアモデルが処理する数千万トークンとは対照的です。その量は、リーダーボードにはない形で購入者にとって重要です。つまり、障害モードが知られており、スループット特性が知られており、それを提供しているプロバイダーは、他者の本番トラフィックによってストレステスト済みであるということです。

DeepSeekは地味な実務面でも勝っている。未公表の上限に対する384Kの出力上限、公表値ではなく実際に提供される1Mコンテキスト、そして長いコンテキストでのスループットを予測可能にするテキスト専用のスコープ。ワークロードが文書分析、長文生成、100万トークンを超える知識集約的な抽出であれば、DeepSeek V4 ProはMistralのプレビューより、あらゆる面で安価で、よりオープンで、実績も豊富だ。

Mistral Large 4 がより良い選択となるのはどのような場合か

Mistralはベンチマークする行を慎重に選んでおり、コーディングの差は見せかけではない。Terminal-Bench 4.0での26.8%対14.1%はおよそ2倍で、これはDeepSWE v1.1での61.7%とSWE-Atlas-QnAでの59.4%というMistralの主張と一致する——これらの数値は、Artificial Analysisがハーネスの公開リリースに先立って非公開で評価したものだと同社は述べており、そのためまだ公開インデックスには載っていない。それらが登場するか、しないかで、コーディングの疑問は決着する。

マルチモーダル性は2つ目の明確な分岐点です。Mistral Large 4は専用の1.6B視覚エンコーダーを備え、画像をネイティブに扱い、Mistralはオープンモデルの中で最先端の視覚グラウンディングを主張しています——Dense 200でGPT-6 Astraの41%に対して42%を挙げています。DeepSeek V4 Proはテキスト専用で、そのカタログカードにもそのとおり明記されています。スクリーンショット、設計図、スキャンした提出書類、チャートの読み取りを含むあらゆるパイプラインでは、ここでの候補は2つではなく1つです。

さらにサイバーの領域がある。そこでは、Mistralの主張はDeepSeekが公表したどの内容よりも際立っている。実際の脆弱性を再現して修正するようモデルに求めるArtificial Analysis Cyber Indexテストで82%を記録し、これはどのモデルよりも最高とされ、Cybenchの競技課題では93%だ。これらはベンダーが引用する数値であり、そのように表示されるべきである。しかし、それらは独立したインデックス上のものであり、DeepSeekについて比較可能な結果は公表されていない。セキュリティ業務に関して正直な立場をとるなら、Mistral Large 4は、誤りであると示されていない優位性を主張しているということになる。

最後の差別化要因は管轄権にある。Mistralは自社の欧州データセンターにある3,800基のGrace Blackwell GPUでモデルを訓練し、そこでプレビューを提供している。欧州での展開は欧州法の下でエンドツーエンドに運用されている。代替手段が中国のオープンウェイトモデルか米国のクローズドモデルとなる欧州の規制対象購入者にとって、それはそれ自体が一つのカテゴリーだ。

料金は、ちゃんと読んでください。

どちらのモデルの表示価格も、それだけで全体像が分かるわけではありません。DeepSeek V4 Pro のカタログ項目には、01:00~04:00 と 06:00~10:00 UTC という2つの時間帯があり、その時間帯には表示料金が倍率適用されるため、それらの時間帯に実行されるワークロードはヘッドライン価格の2倍のコストになります。Mistral Large 4 の $0.68 / $2.09 は、$1.36 / $4.18 の料金表に対するローンチプロモーションです。プロモーションは今日の価格であり、料金表は請求額を試算する際の基準となる価格です。

OrcaRouterがこの点を明快にするのはパススルーの部分です。プロバイダーの定価に対するマークアップは0%で、つまりベンダーの値下げはその日のうちにあなたの値下げとなり、ベンダーのプロモーション価格は吸収されるのではなくそのまま渡されます。DeepSeek V4 Proは本日時点で、次のものを通じてルーティング可能です:プロバイダー料金そのままの単一のOpenAI互換エンドポイントで、200以上の他のモデルと同じ認証情報を使用、プロバイダー間の自動フェイルオーバーも備え、いずれかが劣化した場合に対応します。Mistral Large 4は当社のカタログにはありません — そのプレビュー版はMistral自身のAPIおよび複数のサードパーティプラットフォームを通じてアクセスできます — したがって、この比較の両方を本日同時に実行したい場合、一方は当社経由、もう一方は直接アクセスするということになります。

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, showing the model identity, a 1M-token context window, a 384K maximum output, text-only input with text output, the 2026-04-24 release date, a p-50 time-to-first-token figure of 2.23 seconds, pricing of $0.66 per million input and $1.98 per million output, and a code sample using the api.orcarouter.ai base URL. The page describes the model as a 1.6T-total, 49B-active flagship MoE with a 1,048,576-token context and 384,000-token maximum output that is text-only.

どちらを選ぶべきですか

手元に置けるウェイト、384K の出力、提供コンテキスト100万トークン、このペアで完了したタスクあたりの最低コスト、そして他の人々がすでに本番環境でその挙動を壊してきたモデルが必要なら、DeepSeek V4 Pro は妥協ではない — 予告編に対する完成品だ。文書、ナレッジ、長文の作業にとって正しいデフォルトであり、そのオープンなウェイトは、それで何ができるかの上限がベンダーのロードマップではなく、あなた自身のインフラであることを意味する。

ワークロードがエージェント型コーディングであるなら、画像を扱うなら、セキュリティ業務に関わるなら、あるいは欧州の管轄区域が好みではなく要件であるなら、Mistral Large 4 はプレビューのリスクを取る価値のあるモデルだ — しかもそのリスクは限定的だ。なぜなら Mistral は重みと、終了時期が明示されたレッドチーミング期間を約束しているからだ。今すぐトラフィックの一部をそれに載せ、残りは DeepSeek V4 Pro に任せ、両者にあなたのデータ上でアーキテクチャの問いに決着をつけさせよう。49B のアクティベーション予算はどちら側から見ても同じに見えるだろう。違うのは、その周辺のすべてだ。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新