
MiniMax M3.1:流出したプレビュー文書が語る内容 ― そして誰も確認していないこと
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 434 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 183 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
Hugging Face上には、MiniMax-M3.1-preview-privateという名前の250 GBのチェックポイントがあり、少数の推論パートナー以外は誰も開けません。9月22日付の文書があり、それはベンダーのアーキテクチャノートとまったく同じように読め、ベンダー自身のサイトではなく公開のパートナーエンジニアリングリポジトリに出回っています。そして9月26日、多くの人にフォローされているモデルウォッチャーが、MiniMax M3.1は「来週登場する次期モデル」であり、すでにそのプレビューをテストしていると投稿しました。この3つを合わせれば、MiniMax M3.1の公開記録のすべてが揃います — 名前、アーキテクチャの差分、重み数、登場週のすべてが出回っており、そのどれについてもベンダーは公に一言も発していません。その前身であるMiniMax M3は話が別です。こちらは出荷済みで、だからこそ誰もがこれを気にかけるのです。
未公開モデルを外から見るとこう見える。そして、証拠の形については正確を期す価値がある。というのも、三つの筋は同じ強さではないからだ。チェックポイントの存在は裏付けられている。複数の独立した手がかりが、同じ非公開リポジトリ名と同じファイル数を指している。アーキテクチャ文書はそのようには裏付けられていない——それは第三者による転記であり、本物である可能性も、古くなっている可能性も、一部が捏造されている可能性もある。「来週」という主張は、ある人物の期待であって、スケジュールではない。この記事のすべては、実際に持つ強度でラベル付けされており、ここにある何物もリリース告知として読まれるべきではない。
MiniMax M3.1が存在する前に記事にする価値があるのは、その前身モデルのおかげだ。多くの評価によれば、MiniMax M3はMiniMaxがこれまでに投入した中で最も強力なオープンウェイトモデルだった——100万トークン対応のテキスト・画像・動画モデルで、Artificial Analysis Intelligence Indexでは29.2に到達し、今なお本物の長いコンテキストを維持できる数少ないオープンモデルの一つだ。もしM3.1が9月最終週に登場するなら、開発者にとって重要な数字はリークの信憑性ではなく、各レイヤーで何が変わったか、そして提供コストがいくらかだ——そしてその両方について、漏えいした文書は異例なほど具体的だ。
何が確認済みで、何が単に出回っているだけなのか
正直な内訳、2026年9月27日時点:
• 確認済み:MiniMax M3.1の公開バージョンは存在しない。Hugging Face上のMiniMaxAI組織は、MiniMaxAI/MiniMax-M3.1、MiniMaxAI/MiniMax-M3.1-preview、MiniMaxAI/MiniMax-M3.1-preview-privateのいずれに対しても401——プラットフォームの「見つからないか、あなたには表示されません」という応答——を返す。同組織の最新の公開アップロードは依然としてMiniMax-Music3(2026年8月7日)とMiniMax-H3(2026年7月28日)である。
• 確認済み: MiniMax M3.1 は、私たちが確認できる限り、どこにもルーティング可能ではありません。OrcaRouter のモデルカタログにも、私たちが監視している公開リストにも存在しません。今日実際に呼び出せる MiniMax モデルは MiniMax M3 で、以下の場所にあります:minimax/minimax-m3。
• 確認済み:MiniMaxは何も公開していない。モデルカードも、ブログ記事も、価格ページも、重みも、APIモデルIDもない。ローンチに関する報道がないのは、ローンチが行われていないからだ。
• 出回っている:アーキテクチャ文書。それは公開リポジトリ — longsco/innoferra-eval、ホスト型モデルエンドポイント向けのパートナーオンボーディングスイートで、2026年9月23日に作成 — 内に、ファイル名 PREVIEW-20260922.md で逐語的に再現されている。ヘッダーには、それを9月25日に共有されたベンダー文書と説明し、「モデル名、プロバイダーのリリース日、一般公開は、実際のリリース次第である」という注意書きが付されている。それは文書自身の留保であり、当社のものではない。そしてそれは適切な留保だ:第三者がベンダーメモを複製したものは、MiniMaxの声明ではない。
• 出回っている:250 GB のチェックポイントとその2番目のドロップ。リポジトリのオンボーディング仕様書には、MiniMaxAI/MiniMax-M3.1-preview-private にある非公開のマルチモーダルチェックポイント — 62 ファイル、48 個の safetensors ファイル、およそ 250 GB、アーキテクチャ文字列 MiniMaxM3SparseForConditionalGeneration — が記録され、続いて、より大きな2番目のドロップである MiniMax-M3.1-preview2-dspark-private が、101 ファイル、約 236 GB で、2.3 GB の fp8 投機的ドラフトを追加した。どちらも非公開だ。我々はどちらも開けないし、あなたも開けない。
• 出回っているのは:タイムライン。9月26日の投稿は、誰かが公に示した唯一の日付であり、「来週」は期待にすぎない。9月28日の週は、日付ではなく、注視すべき期間として扱うこと。
エンジニアリングの詳細を網羅する唯一の文書
![A headless Chromium screenshot of the public GitHub page for the file PREVIEW-20260922.md inside the repository longsco/innoferra-eval, showing the file path models/minimax-m3.1/PREVIEW-20260922.md, the markdown body describing MiniMax M3.1's sparse attention across all layers, the Q8KV4 attention quantisation in E2M1 blocks of 16 with a per-block E4M3 scale of amax/6 clamped to [1/512, 448] and round-half-to-even thresholds, the W4A4 NVFP4 routed experts with FC1 row scale 2688 divided by the row absolute maximum and FC2 fixed scale 16, the DSpark speculative-decoding head with no confidence head, the new reasoning_effort field taking max/xhigh/high/medium/low, and the line 'No 3.1 baselines published yet; do not reuse M3 numbers as acceptance bars.'](https://cms.orcarouter.ai/api/media/file/2-1348.png)
MiniMax M3.1 の設計について具体的に知られていることはすべて、あの 1 つの Markdown ファイルと、同じリポジトリにある 2 つの付随ファイルにさかのぼる。それは、チェックポイントがどのように提供されることになっているかを説明する SGLang のデモ文書と、パートナーエンドポイントが満たすことになっている spec.yaml だ。リポジトリ全体を読むと、推論プロバイダーがまさに推論プロバイダーとして行うことをしているように見える——MiniMax から早期ドロップを受け取り、変更点を書き留め、それに対する検証スイートを構築しているのだ。このリポジトリはプレスキットではないし、誰かを説得するために書かれたものでもない。
それはその利点の一つであり、またそれが証明するものの限界でもある。その中にMiniMaxが署名したものは何もない。3つの文書は、本物の文書が一致するように互いに一致し — 同じ量子化定数、同じ環境変数名、同じ起動フラグ — そして本物のドロップが食い違うように食い違っている:9月22日のプレビューでは、新しい投機的デコーディング手法には信頼度ヘッドがないと述べられており、2回目のチェックポイント・ドロップでは、enable_confidence_headがtrueに設定されたドラフト構成が出荷された。捏造であれば、通常は修正の経緯は含まれない。しかし、「異常に首尾一貫している」ことは「確認済み」ではない。そして読者にとっての失敗モードは、以下の定数をMiniMaxの公開設計として吸収してしまうことであるが、それらはせいぜい、他の誰かが読んだMiniMaxの私的な設計に過ぎない。
その文書による5つのエンジニアリング変更
以下は、文書が説明する MiniMax M3 と MiniMax M3.1 の差分です。各行はベンダー由来で未監査であり、独立した第三者は、いかなる種類の MiniMax M3.1 の出力も測定していません。
• アテンションカバレッジ。最初の3層のフルアテンションはスパースアテンションに置き換えられるため、すべての層がスパースになる。MiniMax M3では、最初の3層がスパーススタックのフルアテンションのアンカーであった。
• アテンション精度 — 「Q8KV4」。クエリは、インデクサのクエリも含め、射影からBF16で出力され、FP8 E4M3にキャストされる。キーと値は、これもインデクサのものを含め、E2M1(4ビット)に16のブロック単位で量子化され、ブロックごとのE4M3スケールはamax/6を[1/512, 448]にクランプしたものである。文書は、ラダーが非対称なしきい値を持つ偶数丸めであること、外側のテンソルスケールが正確に1であること、大きさがゼロの場合は正のゼロとしてエンコードされなければならないことを強調している。M3は同じファミリーの8ビットKVパスを使用していたため、これでKVバイトが再び半減する。
• エキスパート精度。MoEのルーテッドエキスパートはMXFP8からW4A4 NVFP4へ移行し、共有エキスパートは意図的に除外されている。2つのエキスパート射影には異なる活性化方式が適用される。FC1は、行ごとの動的スケールとして2688を行の絶対最大値で割ったものを使用し、その行スケールはGEMMの後、活性化関数の前に適用される。FC2は固定の外側スケール16を使用する。パートナーのREADMEで明記されている実務上の帰結は率直だ。「これらなしでチェックポイントを汎用NVFP4パスで実行するプロバイダーは、気付かないうちに異なる数値結果を生成することになる」。
• 投機的デコーディング。EAGLE スタイルのマルチトークン予測ヘッドはなくなり、MiniMax が DSpark と呼ぶ手法に置き換わった——バニラなマルコフヘッドであり、9月22日の文書では信頼度ヘッドもない。これは提供エンドポイントの体感に最も大きな影響を与える変更である。というのも、設計上唯一のストリームごとの速度レバーだからだ。MiniMax がチェックポイントとともに出荷したデモエンジンには DSpark が含まれておらず、プロバイダはその差を測定した。投機なしの同じ 80,000 トークンのフレームで、ストリームごとのスループットは同時実行数 1 で毎秒 63.9 トークン、同時実行数 4 で 60 未満に落ちる。したがって、文書自体の結論は、DSpark なしではこのスタックは負荷時にレイテンシ目標を維持できないというものである。
• 新しいリクエストフィールド。MiniMax M3.1 は、max、xhigh、high、medium、low のいずれかを取るトップレベルの reasoning_effort フィールドを追加し、これはチャットテンプレートによってエフォートタグとしてシステムプロンプトに注入される。M3 には、adaptive と disabled を備えた思考スイッチしかなかった。文書は、奇妙なほど具体的に、このフィールドが検証も必須のデフォルトもなしに運ばれると記しており、プロバイダーはこれを、リストにない値を受け入れるか拒否するかの許可と解釈した。つまり、準拠した 2 つのエンドポイントが同じリクエストに対して異なる動作をする可能性がある。

チェックポイントの2つの細部は、発表記事が省きがちな類のものなので、別途取り上げる価値がある。第一に、このチェックポイントには画像前処理設定と動画前処理設定の両方が同梱されている。MiniMax M3.1 は設計上マルチモーダルモデルであり、後から視覚を後付けしたテキストモデルではない。また、提供元自身のガイダンスは、新しいスタック上で画像入力を拒否しないことにある。第二に、2回目のチェックポイント・ドロップでは MTP と NEXTN のキーが完全に削除され、それらに代わるものは何も追加されなかった。そのため DSpark ドラフトは、別個の 2.3 GB のアーティファクトとして届く必要があった。メインの重みには、有効化できるドラフトヘッドが存在しない。
M3.1のベンチマーク数値が存在しない理由、そしてそれが見落としではない理由
どんなリーク記事も、最終的にはベンチマーク表をでっち上げるか、そんなものはないと認めるかのどちらかに行き着く。MiniMax M3.1には、それが一切ない。パートナー仕様には、誰かがその間違いを犯すのを防ぐためだけに存在するフィールドで、はっきりそう書かれている:
• 「3.1のベースラインはまだ公開されていません。M3の数値を受け入れ基準として再利用しないでください。」
その指示は、コーパス全体で最も有用な一文だ。なぜなら、この記事の手抜き版は、MiniMax M3 の Artificial Analysis スコアを MiniMax M3.1 の見出しの下に書いてしまうからだ。そうすべきではない。同じリポジトリは、MiniMax 自身の M3.1 エンドポイントに対して AIME-25 と GPQA-Diamond のプローブを実行し、スコアが確定していないチームメイト対ベンダーの比較として記録している。GPQA-Diamond では、チームの実行が 0.904 に対しベンダーが 0.813、600 問の MMLU-Pro サブセットでは、0.898 対 0.821 だ。これらは同じ評価の2回の実行が食い違っているのであって、モデルの結果ではなく、繰り返しをカウントしたプレビューとしてラベル付けされている。今日、単一の MiniMax M3.1 ベンチマーク数値を引用している人は、まだ存在しないものを引用している。
MiniMax M3とは何か、続編の規模を測るために
MiniMax M3は2026年5月末に出荷され、6月2日にHugging Faceで公開された — 総パラメータ数4,280億、アクティブ230億、60層、トップ4ルーティングのルーティングエキスパート128、64のアテンションヘッドに対してKVヘッド4、コンテキストウィンドウは1,048,576トークン、最大出力は512,000。独立系の評価では、Artificial AnalysisがIntelligence Indexで29.2をつけ、サンプリングされた145モデル中60位に位置づけており、コーディング指数は58.6、当社独自のルーティングテレメトリにおける初回トークンまでのp50は3,348ミリ秒。MiniMax自身が掲げる目玉数値はBrowseCompで83.5だが、これはベンダーによる数値であり、その点では未監査である。
価格設定は、リークサイクルの中で最も色あせしにくい部分です。MiniMax M3は入力トークン100万個あたり$0.30、出力トークン100万個あたり$1.20、キャッシュ読み取りは$0.06 —— そしてOrcaRouterではminimax/minimax-m3として、プロバイダーの定価のままマークアップ0%で稼働しています。つまり、MiniMaxがM3.1を同じ価格体系で提供すれば、新しい料金は請求サイクルを1つ遅らせるのではなく、それが存在するその日から当社側でも反映されます。
それらすべてを繰り返し述べるのは、ノスタルジーではない。今週誰かがHugging Faceの組織ページを更新しているそもそもの理由は、MiniMax M3が十分に優れていたため、その後継が観戦材料ではなく実運用上の問題になっているということ、そして、1Mコンテキストを備えた4280億パラメータのモデルが$0.30/$1.20で、M3.1が超えなければならない価格性能比の基準を、能力の基準だけでなく打ち立てているということだ。
匿名リスティングという切り口、そしてそれがすでに答えられている可能性がある理由
9月上旬のあるスレッドには、ここで決着をつける価値がある。匿名のステルス掲載がサードパーティのコーディングプラットフォームに現れ、1,000,000トークンのコンテキスト、$0の価格設定、必須の推論レベルを備えていた。私たちはそれをSpace Bunny Alphaという名前で取り上げ、この種の匿名掲載は最終的にすべてベンダーによって自社モデルとして主張されるという基準率に言及した——Pony AlphaはZhipuのモデルになり、Hunter AlphaはXiaomiのものになり、Ox Alphaは別名でのMiniMaxリリースになった。その掲載におけるトークナイザーと異常のフィンガープリントは、MiniMaxのプレビューチェックポイントを指し示していた。もしMiniMax M3.1が今週本当に登場するなら、最も可能性の高い解釈は、あの匿名掲載がその現場テストであり、謎はさらなるフォレンジック作業によってではなく発表によって解決する、というものだ。それは推論であり証拠ではなく、そしてこの記事における最後の推論である。

今週、注目すべきことと、やるべきこと
これをリークからローンチへと変えるシグナルは具体的で検証可能であり、ほとんどの解説が追っているものではない。MiniMaxAI組織配下の、非公開ではなく公開のHugging Faceリポジトリで、モデルカード付きのものが、単一で最も強い指標だ。同組織のアップロード履歴は公開されており、あらゆるリリースの日付を日単位で特定できる。MiniMaxのモデルページまたはAPIモデルIDが2番目。公開された価格が3番目で、予算に関わるものだ。Artificial Analysis上の、リリース後に日付が付いたベンチマーク表が4番目で、唯一独立したものだ。
それまでは、構築に携わる人にとっての実用的な立場は、他のリリース前の週と何ら変わりません。今日ルーティングできるモデルはMiniMax M3で、1つのAPIキーが200以上の他のモデルと並んで自動フェイルオーバーとは、エンドポイントの揺らぎがあなたの障害になることはない、ということです。また、ルーティングDSLによる固定またはブレンドされたルート、あるいはモデルフュージョンを通じて一緒に応答するモデルのパネルが、まだ本番運用していないモデルのリスクを低減する方法です。M3.1が登場した場合、それは1つのモデルIDの交換であり、移行ではありません — これが、リークに対して特注の統合を構築しないことの完全な論拠です。
この記事がしないことの一つは、いつなのかを知っているふりをすることだ。チェックポイントは実在し、文書は具体的であり、最も新しい公の主張は「来週」と言う人物の発言だ。その三つのうち、自分で確認できるのは最初の二つだけである。
