
Mistral Large 4 対 Claude Opus 5:その差は価格差よりも小さい
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 151 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
誰かが公開した唯一の直接対決の数値はMistral Large 4とClaude Opus 5ブラインドの人間評価に由来するもので、ベンチマークの表が示唆するよりも僅差だ。Surge AIはモデルの素性を伏せ、プロのアノテーターにコーディング出力を1~5段階で評価させた。Claude Opus 5が4.22で1位、Mistral Large 4 Previewが3.74で2位に入り、Kimi K3、GLM-5.3、GLM-5.2を上回った。独立系の集計では、この2者はまったく隣り合ってはいない——10月6日時点のArtificial AnalysisのIntelligence Indexで50.8対38.4だ。この組み合わせに午後を一つ費やす価値があるのは、12ポイント低いスコアのモデルのほうが、タスクを動かすコストがおよそ5分の1で済むからだ。
両方の数値には出所を付記する必要がある。なぜなら、それらは同じ種類の数値ではないからだ。Surge AIの評価は、Mistralが委託し公表した第三者による人間研究であり、自社実施のベンチマークよりも強い証拠形態であり、しかも公表をMistralが管理した研究である。指数スコアはArtificial Analysis自身の実行であり、互いに比較可能で、したがってそこから推論するのに適したペアである。どちらも、どのモデルを基盤にすべきかを教えてくれるわけではない。両者を合わせると、その問いを挟み込む形になる。
2つの製品であり、1つの製品の2世代ではない
Claude Opus 5は、ベンダーによるクローズドウェイトのフラッグシップモデルで、2026年7月24日にリリースされ、100万トークンのコンテキストウィンドウと最大128Kの出力トークンを備え、入力100万トークンあたり5ドル、出力100万トークンあたり25ドル、キャッシュ読み取りは0.50ドルで提供されています。Opusラインにおけるベンダー史上最も高性能なモデルであり、長期的なエージェント作業——ツールを多用するマルチステップのセッションを通じて一貫性を保つこと——に明確に位置づけられています。
Mistral Large 4はプレビュー版で、2026年10月6日に発表されました。Mistralはこれを、1.05兆パラメータのスパースなMixture-of-Expertsで、アクティブパラメータは490億、16億パラメータの視覚エンコーダーを備えると説明しています。API IDはmistral-large-4-0で、ネイティブにマルチモーダルであり、Mistralのドキュメントでは100万トークンのコンテキストウィンドウが示されていますが、Artificial Analysisはテスト中の構成で524,288と読み取っています。重みは10月末に公開されることが約束されており、ライセンスはまだ明示されていません。
つまり、これは新しいモデルと旧モデルの対決ではない。独自開発のフロンティアモデルと、オープンウェイト化される予定の挑戦者との対決であり、両者はそれに応じた価格設定がなされている。

同じインデックス、両方のモデル
10月6日に彼らのArtificial Analysisのページから、Intelligence Index v4.3について読んだ:
• インテリジェンス指数 — Mistral Large 4 Preview 38.4 対 Claude Opus 5 50.8
• インデックスタスクあたりのコスト — Mistral Large 4 Preview は $1.13、Claude Opus 5 は $5.86
• Terminal-Bench 4.0 — 26.8% 対 49.0%、両者の間で最大の単一の差
• 人類最後の試験 — 35.0% 対 54.9%
• MMMU-Pro、マルチモーダル推論 — 76.4% 対 84.7%
AutomationBench、ビジネスワークフロー — 59.9% 対 56.6%、Mistral Large 4がリードする唯一の行
• コンテキストウィンドウ — Mistral による公称は 1M、テストした構成では 524,288、一方で提供されるのは 1M
• 出力上限 — プレビュー版では非公開、128Kトークンと比較
• 100万あたりの価格、入力 / 出力 — 定価 $1.36 / $4.18、現在プロモーションで $0.68 / $2.09、対 $5.00 / $25.00

パターンは明確に読み取れる。Opus 5 は最も難易度が高く推論重視の2項目——ターミナル作業とオープンエンドな知識——で先行し、Mistral Large 4 がその視覚能力を売りにしているモデルであるにもかかわらず、マルチモーダル理解でも先行している。Mistral Large 4 はワークフロー自動化の項目で首位に立ち、これは事業部門が実際にモデルに求める内容に最も近い項目であり、しかもタスクあたりの価格は5分の1でそれを実現している。
Mistral Large 4が真に優位に立つ場面
Mistral の発表記事で最も興味深い主張は、ベンチマークのスコアではない。それは、Artificial Analysis Cyber Index のテストの一つ——オープンソースソフトウェアの実際の脆弱性を再現し、それを修正する——において、Mistral Large 4 が 82% を記録し、あらゆるモデルの中で最高とされていること、そして主要なクローズドモデルのいくつかは、そのタスクを拒否するために同じテストでほぼゼロのスコアになっていることだ。Mistral は、そうした拒否の例として Claude Opus 5.5 と GPT-6 Astra を挙げている。
それはベンダーが引用した数値に対するベンダー側の解釈であり、そう読むべきものだ。また、それが成り立つなら実際の運用上の違いでもある。脆弱性を再現しないモデルは、その脆弱性が実在することを証明するために使うことはできないが、これは大半のインシデント対応の第一歩である。Mistralは82%を、Cybenchの40の競技演習での93%というスコア、およびJailbreakBench、StrongREJECT、AgentHarmから取ったサイバープロンプトに対する拒否率が他のオープンウェイトモデルより高いという反論と並べている。その論拠は、能力と規律のどちらかを犠牲にして他方を取るのではなく、同じモデルに双方を求めるべきだというものだ。
サイバー以外では、Mistral Large 4 を選ぶ根拠は、Opus 5 にはない3つの点にある。それは欧州法の下、欧州のインフラ上で訓練され提供されるという点で、データレジデンシー義務を負う購入者にとって重要だ。Mistral が約束するところでは、ダウンロード可能になる——これがこの取り組み全体の狙いであり、セルフデプロイこそが、Mistral が強調して説明しているインシデント発生中のアクセスリスクを取り除くのだから。そしてタスクあたりのコストが十分に安いため、ファーストパスとして使い、難しい残りをフロンティアモデルにエスカレーションするのは、丸め誤差ではなく経済的に理にかなっている。
Claude Opus 5がまだ価格に見合う価値があるところ
12ポイントの指数差は小さくない。そして、行ごとの内訳が、その差がどこにあるのかを物語っている。Terminal-Bench 4.0はほぼ2倍だ — 49.0%対26.8% — そしてターミナル作業は、エージェント型コーディングに最も近い公開代理指標であり、それは今年チームがフロンティアモデルを購入している理由の大半を占めている。Humanity's Last Examは両者を20ポイント引き離している。長期的自律性に関して言えば、Opus 5の適応型推論設計、その128K出力上限、そして提供される1Mコンテキストは、あなたのワークロードが単一の難しい質問ではなく数時間にわたるエージェントセッションであるなら、望ましい構成だ。
出力上限は、より地味な違いです。Mistral はプレビュー版の最大出力長を公開しておらず、Opus 5 の 128K はコード生成や長い構造化ドキュメントにとって、制約を大きく取り払ってくれるものです。あなたのパイプラインが回答ではなくファイルを出力するなら、切り替える前にその数値を確認してください。これは本番環境でしか表面化しない種類の差だからです。
タスクあたりのコストこそが重視すべき数値です
トークン単位の価格は安価なモデルを実際より良く見せ、高価なモデルについて誤解を招く。指標自身が示すタスク単位のコスト——キャッシュを含め、1つの評価タスクを完了するまでの総支出——こそが予算と向き合っても揺るがない数字だ。1.13ドル対5.86ドルである。
それは、すべてをより安いモデルへ移すための許可証ではない。安いモデルが失敗するタスクは、二度支払うタスクになるからだ。それは、単一のフロンティアモデルを唯一の選択肢として扱うのをやめるための許可証だ。OrcaRouterでは、Claude Opus 5 がベンダーの定価のまま0%のマークアップでカタログに並び、他の200以上のモデルと同じOpenAI互換エンドポイントにある。だからこそ、2モデルのパイプラインは、2つ目のベンダー契約ではなく、午後ひとつの作業で済む。Mistral Large 4 は現在カタログにはない——プレビューはMistral自身のAPIと複数のサードパーティプラットフォームを通じて利用できる。その重みが公開され、プロバイダーがホストするようになれば、同じパススルールールが適用される。ベンダーが請求する額があなたに請求される額であり、ベンダーの値下げは同じ日に請求書に反映される。

実績のないプレビュー段階では、最も重要なルーティング機能はフェイルオーバーです。Opus 5 が残りを担うなかで本番トラフィックの一部を Mistral Large 4 に流せば、リグレッションは障害ではなくルート変更で済み、そのモデルの実際の失敗モードをリーダーボード上ではなく自社のデータで学べます。
3週間でこれが解決するものは何か
三つの事実がまだ未確定であり、それぞれが答えを左右する。もし重みが寛容なライセンスで提供されるなら、Mistral Large 4はこのペアで唯一セルフホストできるモデルとなり、規制対象の買い手にとっての計算は大きく傾く。もしプロモーション価格の$0.68 / $2.09が料金表の$1.36 / $4.18に戻るなら、タスクごとの差は縮まるが決定的であり続ける。そして、Artificial Analysisが非公開で評価されたコーディングの数値を変更せずに公開インデックスに移すなら、コーディングの話はベンダーが第三者の代理で公開したものではなく、第三者によって検証されたものになる。
それまでの間は、Opus 5が本番環境における安全なデフォルトであり、エージェント型やターミナルを多用する作業においてはその何倍ものコストに見合う価値がある。Mistral Large 4は興味深い賭けだ——タスクあたりのコストが十分に安いためOpus 5と並行して走らせることができ、自動化とサイバー分野で今日トラフィックを稼げるだけの能力を備え、しかもこの比較に登場するどのクローズドモデルも太刀打ちできないセルフデプロイの約束を秘めている。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
