
Mistral Large 3は1Tパラメータのプレビュー:重みはまだ公開されていない
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 151 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Mistral Large 4は2026年10月6日、パブリックプレビューとして登場した。1兆パラメータのMixture-of-Expertsモデルで、アクティブパラメータは490億、16億パラメータのビジョンエンコーダを備え、開発元は「中国以外で作られた最強のオープンウェイトモデル」だと主張している。だが、まだ登場していないものがある。「オープンウェイト」という言葉が指し示す部分だ。今日ダウンロードできるチェックポイントはなく、ライセンスファイルもリポジトリもない。Mistralによれば、重みが公開されるのは「今月末」で、その前にはレッドチーミング期間があり、その間、審査を通過したパートナーと各国当局が、モデレーションを緩和しサイバー能力を拡張したアンロック版ビルドを入手する。つまり、今週のMistral Large 4を正確に言い表すなら、呼び出せるプレビューAPIであり、まだ所有できないモデルである。
その分裂こそが本題であり、その脚注ではない。Mistralが発表と同時に公表したあらゆる数値——コーディングのスコア、サイバーのスコア、財務および法務の評価——は、今も変更が続いているビルド上で出されたものであり、それをクローズドなフロンティアモデルと比べるあらゆる見出しは、あなたがダウンロードする成果物とは違う成果物を比較している。このようなローンチで役に立つのは、今日検証できるものと、信じることを求められているものを分けることだ。そしてmistral.ai自身の投稿は、どちらがどちらかについて異例なほど丁寧に示している。
10月6日に実際にライブ配信されているのは何ですか?
プレビューAPIはMistral StudioでモデルID mistral-large-4-0で公開されています。Mistral自身のモデルカードは、これを「最先端の、オープンウェイトの、汎用マルチモーダルモデル」と説明しており、細粒度のMoEアーキテクチャに基づいて構築され、パラメータ数は有効49B、総計1.05T、さらにビジョンエンコーダーを含むと内訳を示しています。同社は、自社の欧州データセンターにある3,800基のNVIDIA Grace Blackwell GPUでこれをゼロから学習させ、プレビューは同じインフラストラクチャ上で提供されています——Mistralが性能と同じくらい声高に打ち出している主権の主張です。
仕様は、ベンダーが述べるところによれば:
• 総パラメータ数とアクティブパラメータ数 — 総計1.05兆、トークンあたり490億がアクティブ、スパースMoE
• モダリティ — テキストと画像を入力、テキストを出力。後付けのアダプターではなく、ネイティブにマルチモーダル
• コンテキストウィンドウ — Mistralのドキュメントは100万トークンと記載しているが、Artificial Analysisはテスト対象の構成で524,288を計測している。したがって、100万は実際に提供されるウィンドウではなく、ベンダーが示す上限と見なすべきだ
• 価格 — 入力トークン100万あたり1.36ドル、出力トークン100万あたり4.18ドル、キャッシュ済み入力は0.14ドル(Mistralの公開カードによる)
• ローンチオファー — 同じカードに、取り消し線付きの $0.68 / $2.09 のプロモーションと $0.07 のキャッシュ済み入力、つまり半額が表示されます
• 重み — 未公開;発表によると「今月末」
• ライセンス — 告知でもドキュメントページでも名称は明かされておらず、ドキュメントページではこの項目に「Open」というタグが付けられているのみ
それらの行のうち2つは、二度読む価値がある。コンテキストウィンドウは、ベンダーを読むかサードパーティのラボを読むかによって2倍異なる。これは、サービング構成がまだ流動的なプレビューでは珍しくないが、その上でワークロードのサイズを見積もる前に知っておく価値はある。そして支払う価格は、プロモーション料金がローンチウィンドウを生き延びるかどうかで変わる。$1.36 / $4.18 は Mistral 自身の料金表に記載されている数字であり、$0.68 / $2.09 は現在請求している数字だ。請求額を見積もる際は前者を前提にせよ。

ベンチマークの数値と、それを実行したのは誰か
Mistralの投稿はprovenanceの扱いに慎重で、その慎重さは今後も引き継ぐ価値がある。見出しとなるエージェント型コーディングの数値のうち3つ——DeepSWE v1.1で61.7%、SWE-Atlas-QnAで59.4%、Terminal-Bench 4.0で28.3%、これらを合わせてCoding Agent Indexスコア49.8%——は、Mistral自身の言葉によれば「Artificial Analysisがハーネスの公開リリースに先立って非公開で評価した数値」である。これらはまだArtificial Analysisの公開インデックスには載っていない。ハーネスが出荷されれば載るだろう。それまでは、第三者が算出したもののまだ公表していない、ベンダー公表の数値であり、これは大半のローンチ時の主張より強いprovenanceではあるが、それでも再現可能な公開スコアと同じものではない。

今日、公開されていて独立しているものとは何か。10月6日のArtificial Analysisのモデルページから読み取ると、Mistral Large 4 Previewは38.4をIntelligence Index v4.3で記録し、タスクあたり約507秒を要し、Terminal-Bench 4.0は26.8%、Long-Context Reasoningは81.3%です。同じページでは、それがオープンウェイトモデルとして掲載されていますが、実際にはオープンウェイトではありません——フラグにはisOpenWeights: falseと表示され、カテゴリは「proprietary」です。というのも、存在するのはベンダー自身のクラスタから提供されるプレビューだからです。このフラグは、この記事が扱うギャップを最も明快に示す単一の例です。

最も引用したくなる結果は、Mistral自身が実施したものではない。第三者アノテーション企業Surge AIが、モデルの素性を伏せたコーディング品質に関するブラインド人間評価を実施し、プロのアノテーターはMistral Large 4 Previewを1~5段階で3.74と評価した——5つ中2位で、Kimi K3の3.59、GLM-5.3の3.60、GLM-5.2の3.40を上回り、唯一後れを取ったのはClaude Opus 5の4.22だった。相手が名の知られたラボであるブラインド人間評価は、自己実施のベンチマークとは異なる種類の証拠であり、この発表の中で単独で最も強力な独立系データポイントだ。
次にサイバー分野である。ここでMistralは最も鋭い主張を展開している。Artificial Analysisのサイバー指数において、同社はMistral Large 4が世界トップ5に入り、中国以外で開発されたオープンウェイトモデルの中で首位に立つと述べている。ある特定のテスト——オープンソースソフトウェアの実在の脆弱性を再現し、修正する——では82%を記録し、あらゆるモデルの中で最高とされている。Cybenchの40の競技課題では93%だ。Mistralはさらに鋭い指摘を添える。主要なクローズドモデルのいくつか、Claude Opus 5.5とGPT-6 Astraがその名に挙げられているが、タスクを拒否するため同じテストではほぼゼロのスコアしか出せないというのだ。第三者のページを目の前にしない限り、この82%はベンダーが示す数値であり、拒否率に関する主張はベンダーの解釈である。どちらももっともらしいが、今日の時点で独立に確認されたものはどちらもない。
プレビューのフレーミングが価格計算を変える理由
プレビューは単なるステージのラベルではない。GAリリースよりも短い予告で、モデルの参照先を切り替えたり、価格を改定したり、提供を終了したりできるという意味であり、ベンチマークを取る際のサービング構成が、実際にデプロイする構成と同じとは限らないという意味でもある。ルーティングの判断にとって、これは現実のコストだ。今週のビルドに合わせてチューニングしたパイプラインには、予算に入れていなかった再検証の請求書がついて回る。
では、OrcaRouter200以上のモデルが、プロバイダーの定価で、0%のマークアップをそのまま素通しした単一のOpenAI互換エンドポイントの背後に並んでおり、ベンダー自身の料金カードでの価格変更は、その日のうちに当社の価格変更となります——これはまさに、今回のローンチが2つの価格を提示し、一方には取り消し線が引かれているからこそ重要な点です。自動フェイルオーバーは、実績のないプレビューに対する答えのもう半分です。これにより、本番トラフィックの一部をMistral Large 4に載せつつ、残りをファーストパーティモデルに担当させることができるため、実際のワークロード下で劣化するプレビューは、インシデントではなく再ルーティングへと変わります。注意深い読者が想定すべきではないのは、Mistral Large 4が今日OrcaRouterでルーティング可能であるということです。カタログにはありません——プレビューはMistral自身のAPIといくつかのサードパーティプラットフォームを通じて利用でき、その重みは、登場するときには、セルフホスト型の選択肢となるでしょう。
オープンウェイトという主張は現時点では約束にすぎない
ミストラルの主張は、Mistral Large 4 が「オープンウェイト性能のフロンティアを押し広げる」ものであり、オープンウェイトこそが企業がモデルの制御を維持するための仕組みだ、というものだ。それは、ミストラルが投入しようとしているモデルにとっては擁護可能な主張だ。今週投入したモデルについては、その仕組みが存在しない。Hugging Face リポジトリも、ライセンス本文も、ダウンロード可能なチェックポイントもない。同社自身の Hugging Face 組織を10月6日に確認したが、7月より新しいものは何もなく、その最新のエントリは Large 系とは無関係だ。
これは計画への批判ではない。レッドチーミング期間後の段階的な重み公開は一貫した方針であり、Mistralはそれについて明言している。これは形容詞についての注意喚起だ。「オープンウェイト」は、重みが4週間先で、それを規定するライセンスもまだ明示されていない段落で、マーケティング上の役割を果たしている。寛容なライセンスとApacheスタイルの条件は一つの結果であり、研究用途限定や収益上限付きのライセンスはまた別の結果であり、発表はそのどちらを選ぶのか示していない。
10月末までに確認すべきこと
このプレビューを確定した事実に変えるものは5つあり、そのそれぞれはMistralに何も尋ねることなく確認できる。
• Mistral組織配下のHugging Faceリポジトリで、チェックポイントとライセンスファイルを含む — Mistralが今月約束したリリース
• ライセンス名そのもの。それは、「オープンウェイト」が Apache-2.0 的な自由を意味するのか、それとも利用上限付きの許諾を意味するのかを左右する。
• $0.68 / $2.09 のプロモーション料金が維持されるのか、それとも料金表の $1.36 / $4.18 に戻るのか
• Artificial Analysisが、ハーネスの提供開始時に、非公開で評価されたコーディング指標を公開インデックスに移すかどうか、またそれらが同じ値のまま維持されるかどうか
• 提供されるコンテキストウィンドウは、現在ベンダーによって1Mと記載されており、独立系ラボによって524,288と読み取られている
それらが解決するまでは、Mistral Large 4 に対する正しい姿勢は、そのローンチ自体が促すものだ。つまり、呼び出して自分のワークロードで測定し、本番経路は挙動が変更される予定のないモデルに維持することだ。重みこそが本編であり、プレビューは予告編にすぎない。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
