記事「Mistral Large 4 vs Gemini 3.1 Pro」用に生成されたタイトルカード。太字のジオメトリックサンセリフ体でタイトルを表示し、その下にサブタイトル「8か月、2つの方向」、上部には3つのフラットなラインアイコン(カレンダーページ、ターミナルウィンドウ、画像フレーム)を横一列に配置。白い背景にブルーとシアンのグラデーションアクセント、右下隅にOrcaRouterのロゴ。
Guides & Insights

Mistral Large 4 対 Gemini 3.1 Pro:8か月、二つの方向性

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Gemini 3.1 Proは2026年2月19日から市場に出ており、今秋にリリースされたモデルと比較されている表も含め、あらゆる総合能力の比較表で依然として上位に近い順位につけている。Mistral Large 4はせいぜい3週間前のもので、2026年10月6日に発表されたプレビューであり、重みは10月末に提供されると約束されており、ライセンス名は明記されていない。10月6日時点のArtificial AnalysisのIntelligence Indexでは、8か月前のGemini 3.1 Proが29.7点なのに対し、新参者は38.4点だ。これがこの比較の正直な出発点であり、リリース日が示唆するものとは正反対だ。

この説明は不可解ではない。Gemini 3.1 Proは、Googleが安定版へ昇格させたことのないプレビュー系統のフラッグシップであり、Artificial Analysisの該当ページには「Gemini 3.1 Pro Preview」というラベルが付いている。しかも同じページで、低めのインデックスがトップクラスのGPQA Diamondの隣に並んでいる。これは幅広さを狙って作られたモデルだ。非常に大きなコンテキストウィンドウ、幅広いモダリティ群、そして知識問題に強い推論を備えている。Mistral Large 4は、まったく異なる世界地図に合わせて作られており、価格もそれに応じて設定されている。

それぞれが何か

Gemini 3.1 ProはGoogleの最先端マルチモーダル推論モデルで、API IDはgemini-3.1-pro-preview、1,048,576トークンのコンテキストウィンドウと65,536トークンの出力上限を備えています。テキスト、画像、動画、音声、ファイルを受け付けます。OrcaRouterのカタログからGoogle自身の料金で提供されています。Googleのドキュメントには、プレビュー以外のGemini 3.1 Proは記載されていません。プレビュー名が製品です。

Mistral Large 4は、1兆500億パラメータのスパースなMixture-of-Experts(MoE)で、490億のアクティブパラメータと専用の16億パラメータのビジョンエンコーダを備え、API ID「mistral-large-4-0」のもとで「Mistral Large 4 Preview」として提供されている。Mistralのドキュメントは100万トークンのコンテキストウィンドウを記載しているが、Artificial Analysisはテスト中の構成で524,288と読み取っている。最大出力は記載なし。Mistralはこれを自社で最も大きく最も高性能なモデルと述べており、重みは10月末に登場するとしている。

数値と、それに付随する出所情報

両モデルには独立したページがあるため、以下の比較はベンダー対ベンダーではなく同一ハーネスによるものです:

• Intelligence Index v4.3 — Mistral Large 4 Preview 38.4 対 Gemini 3.1 Pro 29.7

• インデックスタスクあたりのコスト — $1.13 対 $1.30

• ロングコンテキスト推論 — 81.3% 対 82.0%

• GPQA Diamond — プレビュー版では未公開 vs 94.1%

• 人類最後の — 35.0% 対 47.0%

• Terminal-Bench 4.0 — 26.8% 対 4.0%

• SciCode — 54.2% 対 58.7%

• AutomationBench、ビジネスワークフロー — 59.9% 対 35.4%

• MMMU-Pro、マルチモーダル推論 — 76.4% vs 82.4%

• コンテキストウィンドウ — 公称1M / テスト済み524,288 対 提供1,048,576

• 出力上限 — 非公開 vs 65,536トークン

• 100万あたりの価格、入力 / 出力 — リスト $1.36 / $4.18、プロモーション $0.68 / $2.09、対 200Kトークン未満 $2.00 / $12.00、200Kトークン超 $4.00 / $18.00

• 重み — 約束済み、ライセンス名は不明、プロプライエタリとの比較

A generated two-column scoreboard titled 'Mistral Large 4 vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; GPQA Diamond not published; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Gemini 3.1 Pro': Intelligence Index v4.3 29.7; cost per index task $1.30; Terminal-Bench 4.0 4.0%; GPQA Diamond 94.1%; MMMU-Pro 82.4%; AutomationBench 35.4%.

最も際立っている行は Terminal-Bench 4.0 です。Gemini 3.1 Pro は 4.0% を記録しています — 誤植でも、表の中の幻覚でもありません。これは、2月のモデルが、それより後に登場したターミナルエージェント用ハーネス上で実行されたことを反映しています。Mistral Large 4 の 26.8% は、同じテストでその6倍です。古いエージェント型コーディングの数値に基づいて Gemini を除外した人は、その GPQA Diamond に基づいて再び候補に含めるべきであり、インデックス順位に基づいて Mistral を除外した人は、まずターミナルの行を見るべきです。

Gemini 3.1 Proが依然として優位を保つ分野

知識と広範さ。94.1%のGPQA Diamondは、この記事の中のどちら側においても最高の数値であり、それは大学院レベルの科学ベンチマークだ——モデルが言葉巧みに到達できる数字ではない。Humanity's Last Examでは47.0%対35.0%、そして新参者をわずかに上回るSciCodeスコアも、同じことを物語っている。あなたのワークロードが知識コーパスから難問に正確に答えることであるなら、Gemini 3.1 Proはリリースから8か月経ってもなお、より強力なモデルであり続けている。

モダリティの広さが2つ目の利点です。Gemini 3.1 Proはテキストと画像だけでなく、動画と音声も扱えます。Mistral Large 4はテキストと画像を扱います。パイプラインが録画した会議、画面録画、センサー音声を取り込むなら、ここにあるモデルの中で入力全体を見られるのは1つだけです。

出力上限は3番目です。65,536トークンは公表された保証済みの上限であり、Mistralはプレビュー版については上限を一切公表していません。ローンチ記事の中で、明言されていない出力上限ほど、本番環境で痛い目に遭いやすいものはありません。

Gemini のコンテキストウィンドウは実際に 1,048,576 トークンで提供されているのに対し、Mistral の 1M はベンダー公称値で、独立に読み取られた値は 524,288 です。ウィンドウの限界付近で動くワークロードにとって、公称値と実測値の差は、作り直しを意味します。

Mistral Large 4 が判断を変える場面

エージェント的な作業、とりわけターミナルに触れるものは、この2つのモデルがもはや比較可能ではなくなる領域だ。Mistral自身のローンチ投稿は、DeepSWE v1.1で61.7%、SWE-Atlas-QnAで59.4%、Terminal-Bench 4.0で28.3%という数値をCoding Agent Indexの49.8%にまとめ上げ、その複合指標でDeepSeek V4 Pro 0813とQwen3.8 Maxを上回ったと明言している。Mistralの言葉を借りれば、これら3つの数値は、Artificial Analysisが自社のハーネスを公開する前に非公開で評価したものである。それらはまだ公開インデックスには掲載されておらず、掲載されるまではベンダー公表としてラベル付けされるべきだ。

独立した証拠も同じ方向を指している。AutomationBench — Gmail、Sheets、Slack、Salesforceにまたがる657の業務ワークフロー — では、Mistral Large 4は59.9%を記録し、Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Proを上回った。また、同じハーネス上では、ベンチマークの方が後発であるため、Gemini 3.1 Proはまったく登場しない。Surge AIが実施したブラインド人間研究では、Mistral Large 4 Previewが5モデル中コーディング品質で3.74の2位と評価され、GLM-5.3とKimi K3を上回り、Claude Opus 5にのみ劣った。

サイバーに関する主張はMistralの投稿の中で最も際立つもので、正確に述べておく価値がある。実在する脆弱性を再現し、その後修正するようモデルに求めるArtificial Analysis Cyber Indexのテストで82%を記録し、あらゆるモデルの中で最高とされている。Cybenchの40の競技課題では93%で、Mistralは総合のCyber Indexで世界トップ5に入りつつ、中国以外で開発されたオープンウェイトモデルをリードしていると主張している。これらは独立した指標におけるベンダー引用の数値だ。その実用的な強みは、Mistralがモデルを拒否するのではなく作業を行うように作ったことにある。

表の中で最も安い項目もまたMistralのものだが、その差はわずかだ。タスクあたり$1.13対$1.30で、13%の優位はプロモーション料金が生み出すもので、通常の料金表なら消えてしまう。Gemini 3.1 Proは2026年の価格体系による2026年モデルで、インデックスタスクの実行費用は高くない。

誰もベンチマークしない決め手

表には示せない2つの要素が作用している。第一はライセンスである。Gemini 3.1 Proはプロプライエタリであり、今後もそうであり続ける。Mistral Large 4はプレビューであり、その売り込みのすべては、自分自身のポリシーの下、自前のハードウェア上、欧州法の下で実行できるダウンロード可能な成果物になるということにある——Mistralは自社データセンターの3,800基のGrace Blackwell GPUでこれを訓練し、そこでプレビューを提供している。その主張は、リポジトリが現れ、ライセンスに名前が付くまでは何の価値もない。それが実現する日には、極めて大きな価値を持つ。

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid with 'Mistral Large 4' listed at v26.10 as 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 carrying an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

二つ目は運用リスクです。まだ改良が続いているプレビューは、あなたの足元で変わり続けます。OrcaRouterでは、この比較の両側に、単一のOpenAI互換エンドポイントを通じて、プロバイダー定価・マークアップ0%で到達できます。Gemini 3.1 ProはGoogleの料金でカタログに掲載されていますが、Mistral Large 4は当社が提供するルートではないため、Mistral自身のAPIと複数のサードパーティプラットフォーム経由で到達する必要があります。ここで役立つのがルーティングDSLです。分類と抽出はその週に安い方のモデルへ送り、難しい残りはエスカレーションし、プレビューの不調な日は、あなたのオンコールローテーションが吸収するのではなく、自動フェイルオーバーに吸収させましょう。

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the preview model identity, a 1M-token context window, a 65K maximum output, inputs of audio, file, image, text and video with text output, the 2026-02-19 release date, a p-50 time-to-first-token figure of 10.00 seconds, pricing of $2.00 per million input and $12.00 per million output, and a code sample against the api.orcarouter.ai base URL.

評決

どちらのモデルが優れているかではなく、そのワークロードが何であるかを問おう。知識業務、音声・動画入力、保証された出力上限、提供される100万トークンのコンテキストウィンドウといった点では、Gemini 3.1 Pro のほうが依然として強力なモデルであり、その古さは欠陥ではない——それは、他の人々がその限界を見つけてきた8か月なのだ。エージェント型コーディング、ターミナル作業、セキュリティ運用では、Mistral Large 4 がインデックス順位が誤解を招くほど大きな差で先行しており、2つのうち最終的にセルフホスト可能になるかもしれないのはこれだけだ。

注目すべき決め手は10月末だ。重みが寛容なライセンスの下で公開されるなら、Mistral Large 4 は Gemini 3.1 Pro と価格で競うのをやめ、コントロールで競い始める。そしてそれは別の戦いだ。制限的なライセンスの下で公開されるなら、本記事の答えはあまり変わらない——だが理由は変わる。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新