生成されたヒーローカード。タイトルは「MiniMax M3.1 Flash Preview vs MiniMax M3」、サブタイトルは「このラインの最新モデルは、呼び出すのに最も安全なモデルではない」。左のカードには「MiniMax M3.1 Flash Preview:月額$22~$132のトークンプラン、トークン単価の公表なし、重み非公開、思考は常時オン」とあり、右のカードには「MiniMax M3:100万トークンあたり$0.30 / $1.20、重み公開、思考はオフに切り替え可能」とある。フッターには「どちらも100万トークンのコンテキストウィンドウを備える。MiniMax M3.1 Flash Previewの数値はplatform.minimax.ioによる。」とある。
Guides & Insights

MiniMax M3.1 Flash Preview 対 MiniMax M3:新しいモデルの方がリスクが高いとき

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ベンダー自身のドキュメントでは今や MiniMax-M3.1-Flash-Preview が MiniMax-M3 より上に記載されており、その並び順が大きな説得力を生んでいる。それはこの系統で最新のテキストモデルで、同じ100万トークンのコンテキストウィンドウを備え、旧モデルにはない思考深度コントロールを追加している。この表が示していないのは、旧モデルのほうが、2つのうちダウンロードでき、トークン単位で価格を設定でき、何とでもベンチマーク比較でき、サブスクリプションなしで呼び出せる唯一のモデルだということ、そして新しいほうが MiniMax-M3 の与えてくれた切り替えを奪ってしまったということだ。

これは、あるモデルが取って代わられる話ではない。あるベンダーが自社の製品ラインを、従量課金制の主力モデルと、サブスクリプション限定のプレビューに分割した話であり、両者はどちらの方向にも互換ではない。それぞれが実際には何なのかを以下に示す。

2つの仕様書を並べて

まず、両方についてベンダー自身のページが述べていることから始めましょう。違いの形はベンチマーク表ではなく、ここに現れるからです。

• 発表 — 2026年6月1日にMiniMax-M3を、アーキテクチャノート、ベンチマークシート、料金表とともに発表。2026年9月27日にMiniMax-M3.1-Flash-Previewを、ドキュメントの項目とMiniMaxのエージェントアカウントへの投稿で発表 • コンテキストウィンドウ — MiniMax自身のモデル表によると、両モデルとも1,000,000トークン • 最大出力 — 当社のカタログ項目ではMiniMax-M3が512,000トークン。これはMiniMax自身が公表していない数値。MiniMax-M3.1-Flash-Previewについてはどこにも公表されていない • 入力モダリティ — 両モデルともテキスト、画像、動画を入力し、テキストを出力 • シンキング制御 — MiniMax-M3ではスキップするよう指示できるthinkingパラメータがあり、reasoning_detailsフィールドとしてreasoning_splitで分離できる。MiniMax-M3.1-Flash-Previewではシンキングは必須で、reasoning_splitをオフにできない • シンキングの深さ — MiniMax-M3では利用不可。effortの段階はlow、medium、high、xhigh、maxで、デフォルトはmax、MiniMax-M3.1-Flash-Previewで利用可能 • 公開されている出力速度 — MiniMax自身のモデル表によると、MiniMax-M3で毎秒およそ100+トークン。MiniMax-M3.1-Flash-Previewについては何も公表されていない • 重み — MiniMax-M3は公開リポジトリを伴うオープンウェイト。MiniMax-M3.1-Flash-Previewには公開リポジトリがない • 価格 — プロバイダー料金では、MiniMax-M3が入力100万トークンあたり0.30ドル、出力100万トークンあたり1.20ドル。MiniMax-M3.1-Flash-Previewにはトークン単位の料金が存在しない • アクセス — MiniMax-M3は従量課金およびToken Planで利用でき、サードパーティのプラットフォーム経由でもルーティング可能。MiniMax-M3.1-Flash-PreviewはToken PlanとMiniMax Codeのみ

そこにある2つの行は、他のものとは別のカテゴリーに属している。公表されている出力速度は旧モデルだけのベンダー公称値なので、新モデルは数値が添えられないまま「速い方」として売られている。そして思考の制御は、マーケティングとは正反対の方向に動いた。新モデルは、どれだけ考えるかについてより細かい制御を可能にする一方で、そもそも考えさせないようにする手段を奪っている。

MiniMaxが取り上げたスイッチ

これは最も足をすくわれやすい細部であり、隠されているのではなく文書化されています。MiniMax-M3 では、thinking: {"type": "disabled"}を OpenAI 互換エンドポイントで送信すると思考がスキップされ、直接回答が返ります。Anthropic 互換エンドポイントでは思考はデフォルトでオフになっており、adaptiveで有効にできます。MiniMax-M3.1-Flash-Preview では、同一のリクエストが HTTP 400 を返し、メッセージはrequires adaptive thinkingです。推論を行わない応答を得るためのサポートされた方法はありません。

実際には、これは、MiniMax-M3を安価で高速な分類器やルーターとして使っていたワークロード——短いプロンプトを入力し、短い構造化された回答を出力し、思考の連鎖はなし——には、新しいモデルへそのまま差し替えられるアップグレードパスがないことを意味する。effortをlowに下げることはできるし、MiniMaxのガイダンスは、思考を無効にするのではなく、思考のレイテンシとトークンを削減するための意図された方法はeffortを下げることだと明示している。しかし、トークンとレイテンシがゼロになるわけではなく、1回の呼び出しで4つのフィールドを書き込む大量の抽出ジョブにとって、「常に先に考える」は「求められたときに考える」とは異なるコスト構造だ。

A generated two-column scoreboard titled 'MiniMax M3.1 Flash Preview vs MiniMax M3 — the scoreboard'. The left column, MiniMax M3.1 Flash Preview, reads 'AA Intelligence: none published', 'Thinking off: not allowed (HTTP 400)', 'Thinking depth: effort low to max', 'Published speed: none', 'Open weights: no', 'Per-token price: not published'. The right column, MiniMax M3, reads 'AA Intelligence: 29.2', 'Thinking off: supported', 'Thinking depth: not available', 'Published speed: 100+ tokens per second (vendor)', 'Open weights: yes', 'Per-token price: $0.30 / $1.20'. A footer reads 'MiniMax M3 figures per Artificial Analysis and MiniMax; MiniMax M3.1 Flash Preview has no independent scores of any kind.'

それぞれで実際に測定されるものは何ですか

この比較では、片側には数値があり、もう片側には空欄の列がある。どの数値が誰のものなのかについては、正確に押さえておく価値がある。

MiniMax-M3の独立した記録は本物です。Artificial Analysisは、それをインテリジェンス指数で29.2——145モデル中60位——と評価しており、コーディング指数で58.6、数学指数で59.18、同じ指数ファミリーの下でのGPQA Diamondで92.9%、長文コンテキスト想起率83%、IFBenchで82.9%を記録しています。これらは、誰でもダウンロードして再実行できるモデルに対する第三者評価です。MiniMax自身が発表したM3のローンチ時数値——BrowseComp 83.5%、SWE-Bench Pro 59.0%、Terminal-Bench 2.1 66.0%、MCP Atlas 74.2%、OSWorld-Verified 70%——はベンダー公表値であり、われわれはそれらが再現されたところを見ていません。

MiniMax-M3.1-Flash-Preview には、MiniMax が公開したベンチマーク表もなければ、Artificial Analysis のインデックスにもエントリーがない。したがって、独立系の評価も、コーディング指標も、長文コンテキスト想起の数値も、ハルシネーションの測定も存在しない。出回っているあらゆる特徴づけ——「高速」「信頼できる」「日常的な開発向けに作られている」——は、ローンチ投稿でベンダー自身が使った形容詞にすぎない。この欠如は率直に述べておく価値がある。なぜなら、それは諸刃の剣だからだ。何かがより悪いと示されたこともなければ、何かがより良いと示されたこともない。

その非対称性こそが判断のすべてだ。MiniMax-M3なら、今日の午後にもダウンロードするか呼び出すかして評価でき、その評価を公開スコアボードと比較できる。MiniMax-M3.1-Flash-Previewでは、使って私的な意見を形成することしかできない。

新しいモデルが本当に優れている点

上記を、新しいモデルを無視するための論拠として読むのは容易だろうが、それは正しい結論でもない。三つの事柄があり、それらは新しいモデルに固有のものである。

エフォートラダーは本物の機能であり、単なるトグルではありません。5段階 — low から max — により、1つのモデルが定型的な名前変更とリポジトリ全体のリファクタリングを異なる計算コストで処理でき、MiniMax-M3.1-Flash-Preview でのみ有効であると文書化されています。MiniMax-M3 では、選択肢は二択です。タスクごとのレイテンシを予測できないことが問題なら、調整可能な深さこそ、あなたが求めていた制御です。

これはベンダー現行の最上位モデルであり、つまり6月以来Mシリーズの系譜が積み上げてきたものをすべて受け継いでいるということだ。そしてMiniMaxは、エージェント的推論、ツール使用、コーディング、長文脈タスク向けの最新モデルであると明確に述べている。M3が導入したインターリーブ思考のツール使用機構も引き継がれており、応答全体——思考ブロックも含めて——をメッセージ履歴に追加し直すという要件も同様だ。

しかも、サブスクリプション内で、Flashの価格帯で動画を扱える。MiniMax-M3も、トークン単位の価格で同様に対応している。すでにToken Planのシートに支払っていて、動画入力を使う上での唯一の障壁が呼び出しごとの限界コストだったなら、M3.1-Flash-Previewがその障壁を取り除いてくれる。

旧モデルが今なお頼りになる場面

3つのケース。いずれも品質ではなく、予測可能性に関するものだ。

コストをモデル化する必要があるとき。MiniMax-M3には料金表があり、入力トークン100万あたり0.30ドル、出力100万あたり1.20ドル、当社のカタログではキャッシュ読み取りが100万あたり0.06ドルです。ワークロードの月額請求額を、実行する前に1セント単位まで見積もれます。MiniMax-M3.1-Flash-Previewには、MiniMaxのページのどこにもトークン単位の料金がありません。そのためコストは、サブスクリプション料金を使用量で割ったものになります。固定予算には向いていますが、ユニットエコノミクスには役に立ちません。

モデルにモデルであってほしいとき。MiniMax-M3 はオープンウェイトです。ダウンロードして自分のハードウェアで実行でき、6か月後にあなたの呼び出しに応答する成果物が、今日応答しているものと同じだと確信できます。MiniMax-M3.1-Flash-Preview にはチェックポイントがなく、プレビュー相当のアクセスでは、サービングスタック、クォータの構成、可用性はすべてベンダーが管理し、明示的に変更される可能性があります。

非推論の回答が必要なとき。前述のとおり、これはこの比較における唯一の能力後退であり、人々を驚かせるものだ。なぜなら、新しいモデルが古いモデルにできたことをできないというのは、誰も想定していないケースだからである。

A headless Chromium screenshot of MiniMax's own model documentation page, showing the note that MiniMax-M3.1-Flash-Preview is available only through Token Plan and MiniMax Code for now, followed by the language model table in which MiniMax-M3.1-Flash-Preview is listed first with a 1,000,000-token context window and the description 'Frontier multimodal coding model with 1M context window and tunable thinking depth', above MiniMax-M3 with the same 1,000,000-token window, captured 28 September 2026.

1か所から両方を呼び出す

ここで厄介なのは、2つのモデルが異なる形で購入されることだ — 一方は従量課金、もう一方はサブスクリプション — そして自然な本能はどちらか一方を選ぶことにある。より有用なのは、タスクの形に応じて両者の間をルーティングすることであり、それが機能するのは、従量課金側が他のすべてと同じ場所から到達できる場合だけだ。

OrcaRouter 上の MiniMax-M3MiniMax の定価に 0% のマークアップを加えたもので、レートカード上の $0.30 と $1.20 が 1 回の呼び出しにかかるコストそのものであり、プラットフォームのマージンは一切上乗せされません。MiniMax M2.7 と同じ OpenAI 互換エンドポイント上にあります — 20 万トークンのウィンドウで同じ $0.30/$1.20 の表示価格、こちらもオープンウェイト — そして 200 以上の他のモデルも1 つの API キーの背後に集約され、プロバイダー間の自動フェイルオーバーによって、あるエンドポイントが不安定になっても対応します。ベンダーの数値とは種類の異なる、当社独自のテレメトリと比較すると、過去 7 日間、M3 は毎秒約 238 出力トークンで応答し、最初のトークンまでの p50 は約 4.1 秒、エラー率は 0.15% 近くで、これは OrcaRouter プレイグラウンド上で計測されたものです。MiniMax-M3 をパイプラインの信頼できる側として据え、MiniMax-M3.1-Flash-Preview を実験的な側として扱いたいなら、信頼できる側は 2 つ目のベンダーとの関係ではなく、設定 1 行で済みます。MiniMax-M3.1-Flash-Preview 自体は当社のカタログにはありません。そこへ至るルートはベンダー自身の Token Plan とコーディング製品です。

この記事を変えるものは具体的で、注目するのはたやすい。MiniMax-M3.1-Flash-Preview の料金表が公開されれば、経済性の観点で M3 を好む主な理由は崩れるだろう。独立したスコアが一そろいあれば、空白の列は比較可能な何かに置き換わるだろう。ダウンロード可能なチェックポイントがあれば、再現性への異論はなくなるだろう。それらの少なくとも一つが実現するまでは、MiniMax-M3 はこのペアの中で責任を問えるモデルであり続ける——そして新しい方は、MiniMax がトークン単位ではなく月額で課金すると決めた、より高速でより制御の効いた、未測定のプレビューのままだ。

A headless Chromium screenshot of the OrcaRouter model page for minimax/minimax-m3, showing the model title 'MiniMax: MiniMax M3', a context length of 1,048,576 tokens, a maximum output of 512,000 tokens, and a pricing panel reading 0.300 US dollars per million input tokens, 1.20 per million output tokens and 0.060 per million cache-read tokens, captured 28 September 2026.