
MiniMax M3.1 Flash Previewがトークンプランで利用可能に:あなたのサブスクリプションで実際に何が使えるのか
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 468 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 192 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
MiniMax-M3.1-Flash-Previewは2026年9月27日に公開され、その公開のされ方が話題だ。これは従量課金制のモデルではない。ベンダーは最新のテキストモデルを、すでにMiniMax-M3、MiniMax M2.7、およびM2.7-highspeedバリアントをカバーしている同じToken Plan Subscription Keyの背後に置いた。したがって、シートを保有していれば、新たにキーを発行する必要も、2つ目の契約に署名する必要もない。また、今日時点で存在しないものは、トークンあたりの価格、モデルカード、公開ベンチマーク、そしてモデルの思考をオフにする方法のいずれでもない。
その組み合わせ——摩擦のないアクセスと、まったく公表されていない経済性——は、誰かが本番パイプラインをそれに接続する前に解きほぐす価値があるほど異例だ。この記事の残りでは、ベンダー自身のドキュメントが実際に述べていること、それが明らかに述べていないこと、そしてこのモデルがあなたの仕事の進め方に合うかどうかを1分以内に教えてくれる1行のコードを取り上げる。
9月27日に実際に何が着陸したのか
MiniMaxの開発者ドキュメントには現在、テキストモデルの全ページで繰り返される常設の注記が掲載されている:MiniMax-M3.1-Flash-Previewは、当面はToken PlanとMiniMax Codeを通じてのみ利用可能です。 このモデルはベンダー自身のモデル表で最初に登場し、MiniMax-M3より上に位置づけられ、100万トークンのコンテキストウィンドウと調整可能な思考深度を備えたフロンティアなマルチモーダル・コーディングモデルとして説明されている。
• コンテキストウィンドウ — 1,000,000トークン。MiniMax-M3が搭載するのと同じ上限
• 入力モダリティ — テキスト、画像、動画。テキストを返す
• 思考の深さ — effort設定でlow、medium、high、xhigh、maxを受け付け、省略時はmaxが既定値
• プロトコル対応 — 同じモデルIDが、MiniMaxのAnthropic互換エンドポイント、OpenAI互換エンドポイント、OpenAI Responsesエンドポイントのいずれでも動作する
• 提供状況 — Token PlanおよびMiniMax Codeのみ。従量課金では利用不可
• 価格 — トークンあたりの料金はどこにも公開されていない
• 重み — なし。MiniMaxAI組織の直近の公開リポジトリ2件は依然としてMiniMax-Music3とMiniMax-H3
• 独立系ベンチマーク — なし。このモデルはArtificial Analysisのモデルインデックスに項目がない
同社は同日、自社のMiniMaxAgentアカウントでそれを発表し、フロンティア領域の作業ではなく日常的な開発向けとして位置づけた。高速で信頼性が高く、手早いバグ修正から本格的な機能開発まで対応する。それはフラッグシップの役割ではなく、Flashティアの役割だ。PANewsとKuCoinによる第三者系の速報報道も同じ表現で伝え、開発者たちが同社の確認前にMiniMax Codeのピッカーでこのモデルを見つけていたことも指摘した。

どのキーを使うかは、いつも以上に重要になる
これは多くの人がつまずく部分です。MiniMax は2種類の別々の認証情報を運用しており、M3.1-Flash-Preview はそのうちの一方にしか応答しません。Token Plan Subscription Key は Billing > Token Plan から取得でき、サブスクリプション利用と購入済みの Credits をカバーします。pay-as-you-go API Key はトークン単位のモデルをカバーします。ベンダーのドキュメントは、この2つが互換性がないこと、および Subscription Key は有料リソースが何も紐付いていない状態でも存在し得ること、その場合は有効なキーでありながらその背後に何もないことを明示しています。
したがって、実用的な判断基準は「MiniMax API キーを持っているか」ではなく、「Token Plan のシートを持っているか」です。既存のシートは対象に含まれます。ドキュメントには、シートまたは Credits へのアクセスが割り当てられると Subscription Key が使用可能になること、およびサブスクリプションのクォータを使い切ると Credits のオーバーフローが自動的に充当されることが記載されています。
ドキュメントにも不整合があり、これは知っておく価値があります。というのも、先に料金ページを読む人は必ず混乱するからです。Token Plan の料金ページの提供範囲に関する脚注には、対象ラインナップが依然として M3、M2.7、画像、音声で、H3 は除外されていると記載されています — M3.1-Flash-Preview の名前を挙げるようには更新されていません。モデルページには逆のことが書かれています。M3.1-Flash-Preview は Token Plan で利用でき、それ以外では利用できない、というものです。どちらのページも、本日時点で公開されているベンダーのページです。それを決着させるのは、あなたの手にあるキーだけです。
これがどの種類のモデルなのかを教えてくれる400
MiniMax Mシリーズのすべてのモデルは回答する前に思考しますが、M3.1-Flash-Preview は止まることを拒否する最初のモデルです。thinking: {"type": "disabled"} または reasoning_effort: "none" を送信すると、API は HTTP 400 と次のメッセージを返します:
モデル「MiniMax-M3.1-Flash-Preview」は適応型思考を必要とします。thinking.type="disabled"(reasoning.effort=none を含む)は許可されていません (2013)
ベンダー自身のガイダンスでは、effortを下げることが推奨されており、思考を無効化しようとするのではなく、この段階がレイテンシのレバーです。日常的な編集はlow、リポジトリ全体の変更はxhighで、同じモデルが異なるトレードオフをしているだけです。さらに、このモデルに固有の詳細が 2 つあります。reasoning_effort パラメータは MiniMax-M3.1-Flash-Preview にのみ有効であると文書化されており、一般的な M シリーズの制御ではありません。また、reasoning_split 出力スイッチは、思考をreasoning フィールドに分離しますが、現在このモデルではfalse に設定できません。
思考テキストがどこに格納されるかはプロトコルによって異なります。Anthropic 互換エンドポイントはそれを thinking コンテンツブロックとして返し、OpenAI 互換エンドポイントはそれを reasoning_content で返し、Responses エンドポイントはそれを reasoning 出力項目として返します。もし <think> タグを MiniMax-M3 の出力から解析していたなら、その作業は新しいモデルでは不要です — また、ツール使用がインターリーブされた会話では、thinking ブロックを含むレスポンス全体をメッセージ履歴に追加し直さなければ、推論チェーンが壊れます。
現在開催中のプロモーション
MiniMax Codeは9月28日から10月7日まで(UTC+8)チェックインキャンペーンを実施しており、毎日ログインで付与される無料クレジットを2倍にし、新規ユーザーと既存ユーザーの両方を対象にしています。付与されるクレジットは対応モデル全体で利用でき、M3.1-Flash-PreviewとH3動画モデルが例として挙げられています。別途、同社はToken Planのクォータがローンチ時に全ユーザーでリセットされ、イベント期間中にさらなるリセットが予定されていると述べ、対象条件はアプリ内で表示されるとしています。
その2つは、ローンチ報道を通じて伝えられたベンダー側の声明として扱うこと——これらは日付が付いた販促条件であり、製品の挙動ではない。また、同じ報道は、発表がチェックインごとのクレジット数や、未チェックイン日に関する正確なルールを明示していなかったと指摘している。定常状態の経済性のほうが説明しやすい。Token Plan の価格は、Plus が月額22ドル、Max が55ドル、Ultra が132ドルで、5時間ローリングと週次のクォータウィンドウを備え、ベンダーによる想定同時エージェント数はそれぞれおよそ3〜4、4〜5、6〜7である。Purchased Credits は1ドルあたり1,000クレジットで、各モデルの従量課金定価に従って控除される。
このモデルがまだ持っていない4つのもの
以下はどれもモデルへの批判ではない。それぞれがチームの前提として織り込む必要のある穴であり、その四つはいずれも今日時点で検証可能だ。
• 価格なし。MiniMax のどのページにも M3.1-Flash-Preview のトークンあたりの料金は存在しないため、M3 の入力 100 万トークンあたり $0.30、出力 100 万トークンあたり $1.20 とであれ、その他何であれ、トークンあたりのコストで比較することはできない。
• ベンチマークなし。MiniMax はこのリリースに伴う評価表を一切公表していない。他の誰も同様である。このモデルは Artificial Analysis のインデックスに存在しないため、その列は単にまだ早いだけでなく、文字通り空である。
• 重みなし。MiniMax-M3 はオープンウェイトで提供されたが、M3.1-Flash-Preview にはリポジトリもダウンロード可能なチェックポイントもない。
• 独立した測定なし。第三者による出力速度、レイテンシ、エラー率の数値は一切なく、当社自身のルーティングテレメトリからの数値もない。このモデルは当社のカタログに存在しないからである。
2026年6月のM3ローンチは、初日からアーキテクチャノート、ベンチマークシート、料金表がそろって登場した。それと比べると、今回は意図的に静かなリリースだ。もっともらしい読み方——これは読み方であって、明言された計画ではない——は、MiniMaxがモデルの価格や公開の可否を決める前に、自社製品内で実際に使われることを望んでいる、というものだ。

流出したプレビューメモが言い当てたこと
ローンチの4日前、公開パートナーリポジトリで文字起こしされたプレビュー文書が出回り、スパースアテンション、Q8KV4アテンション量子化、NVFP4ルーテッドエキスパート、DSpark投機的デコーディングヘッド、そして新しいreasoning_effortフィールド(maxからlowまでの値を取る)を備えたMiniMax M3.1について記述していた。当時、私たちはそれを未検証として記事にした。なぜなら実際にそうだったからだ。重みもモデルカードも料金ページもAPIモデルIDも存在しなかった。
その5つの主張のうち1つは、ベンダー自身のドキュメントによって今や確認されている。それはreasoning_effortフィールドであり、maxからlowへの段階を含め、出荷済みの値と完全に一致している。残りの4つは依然として未確認のままだ。MiniMaxが公開しているM3.1-Flash-Previewの説明には、1Mコンテキストウィンドウと調整可能な思考深度を備えたフロンティアなマルチモーダルコーディングモデルであるとしか記されておらず、アテンション方式、量子化、デコーディングヘッドについては記述していない。スパースアテンションやNVFP4に関する主張を確定した仕様として繰り返す人は、第三者の書き起こしを繰り返しているにすぎず、それはまさにこのリリースが確認しなかったものなのだ。
パイプラインをそれに賭けることなく試したいなら
Token-Plan限定プレビューの厄介な点は、新しいモデルを評価する自然なやり方——既存のスタックから呼び出して測定する——が、きれいに実行できない唯一のものだということだ。比較すべきトークン単位の料金はなく、公開されたレイテンシプロファイルもなく、プレビューが不安定になった場合にベンダー自身の製品内でどうフェイルオーバーするかという話もない。
まさにそうした状況のために、ルーティングレイヤーは存在します。OpenAI互換の単一エンドポイントと単一のAPIキーの背後に、今日呼び出せるものはすべて収まっており、これに隣接するモデルもすでに揃っています:プロバイダー料金でのMiniMax-M3は入力100万トークンあたり$0.30、出力100万トークンあたり$1.20、同じ価格表示で200,000トークンのウィンドウとオープンウェイトを備えるMiniMax M2.7、そして同じ価格帯のDeepSeekとQwen Flashの各ティアです。プロバイダーの定価をマークアップ0%でそのまま透過したものなので、ベンダーが料金を引き下げれば、再交渉サイクルを待つことなくその日のうちにここへ反映されます。自動フェイルオーバーとは、プレビュー品質の依存対象を本番パスより下に置くのではなく、その隣に置けるようにする仕組みです。そしてMiniMaxがMiniMax-M3.1-Flash-Previewの料金表とエンドポイントを実際に公開したときには、課題は移行プロジェクトではなくルーティングテーブルの1エントリになります。MiniMax-M3.1-Flash-Preview自体は当社のカタログにはなく、現時点でそこへ到達する方法はベンダー自身のToken Planとそのコーディング製品です。
ローンチ日にこれを読むチームに向けた正直なまとめ:モデルは稼働しており、すでにToken Planのシート料金を支払っているなら限界的には無料で、それ自体の基準では完全に価格付けも測定もされていない。MiniMax Code内で試してみて、依存しているパイプラインは料金表と実績のあるモデル上に維持し、これを好奇心の対象から意思決定へと変える2つのもの——公表された価格と最初の独立系スコア——に注目してほしい。

