
Xiaomi MiMo-V2.6-Pro 対 MiniMax M3:スコアが良いほどルートは薄い
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro は2026年9月22日に一般提供を開始し、Artificial Analysis Intelligence Index の v4.3.2 で46を記録してオープンウェイト部門の首位に立った。MiniMax M3 は2026年5月31日のリリース以来、その称号の一種を保持しており、同じ指数で今日は29 — 17ポイント差をつけられている。この2つについて最も面白くないのはスコアだ。MiniMax M3 は毎秒168.9出力トークンで稼働し、Xiaomiは134.3。応答は0.92秒に対し2.15秒。入力トークンあたりの料金も安く、15のAPIプロバイダーから利用できるのに対し、Xiaomiは1つだけ。実際に呼び出すのが難しいのは、新しくスコアが高いほうのモデルだ。そしてこの逆転こそが、この比較の主題である。
どちらもオープンウェイト、どちらもマルチモーダル、14週間違い
この2つのモデルは、設計意図において近縁関係にある。どちらも中国のラボによるスパースなMixture-of-Expertsモデルで、どちらも100万トークンのコンテキストウィンドウを備え、後付けのアダプターを介するのではなく画像と動画をネイティブに受け入れ、どちらも重みを公開している。両者のリリースは14週間隔てられており、その間のインデックスの差は、その期間にオープンウェイトのフロンティアが進んだ距離に等しい。
• 総パラメータ数 — Xiaomi MiMo-V2.6-Pro 1.02T;MiniMax M3 約427B、いずれもスパースMoE
• トークンあたりのアクティブ — Xiaomi MiMo-V2.6-Pro 42B、MiniMax M3 は約23~25B
• コンテキスト — それぞれ1Mトークン、MiniMax M3は最低512Kを保証
• 入力モダリティ — 両方ともテキスト、画像、動画に対応。Xiaomiは音声入力も追加
• モデルの重み — Xiaomi MiMo-V2.6-Pro は MIT ライセンス。MiniMax M3 は MiniMax Community Licence の下で提供されており、これは寛容型ライセンスではなく、商用利用には別途契約が必要です
• リリース済み — Xiaomi MiMo-V2.6-Pro 2026年9月21~22日、MiniMax M3 2026年5月31日
・到達可能性 — Artificial Analysis 上で Xiaomi MiMo-V2.6-Pro についてカウントされた API プロバイダーは1社、MiniMax M3 は15社
その最後の行こそ、見据えておくべきものだ。シート上の他のすべては、より新しいモデルに有利だ。その行はそうではなく、そしてその行こそが、あるモデルを本番経路に置けるかどうかを決める。
指数が測るもの、そして誰が測ったのか
Artificial Analysisは両モデルを自らv4.3.2上で実行した。これは推論、知識、数学、コーディングをカバーする10項目の評価からなる複合指標で、AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1が含まれる。46も29もベンダー数値ではない。この点がここでは重要である。なぜなら両ラボも独自のベンチマーク数値を公表しており、それらはベンダー数値であり、この2種類を混同してはならないからだ。
46という値は、その合成指標においてXiaomi MiMo-V2.6-Proをオープンウェイト分野の首位に立たせる。しかし、それをインデックスの首位に立たせるわけではない。Claude Fable 5.1とGPT-6 Astraはいずれも53、Claude Opus 5は51に位置する。MiniMax M3の29は、測定された114モデル中16位にあたり、同サイズクラスの中央値を大きく上回るが、6月に比較対象とされていたフロンティアからはほど遠い。
MiniMax M3にはXiaomiにはない証拠がある
これは比較の中で飛ばされがちな部分であり、購入者が最も重視すべき部分でもある。MiniMax M3は公開のDeepSWE v1.1リーダーボードに公式エントリーを持っている。Pass@1 20.4%、Pass@4 48.7%で、MiniMaxの推論アップグレードが異常なトークン生成を修正し、長コンテキストのキャッシュ挙動を改善した後の2026年6月8日に公開された。そのエントリーには効率の内訳も付いており、その内容は決して好意的ではない。エージェントステップの中央値311、出力トークン約91,000、タスクあたり約$5.04だ。長期的なエンジニアリングタスクを通過するが、それを高コストで行っている。
Xiaomiが新型モデル向けに打ち出したベンチマークの主要数値は、DeepSWE v1.1で72.57で、ベースラインの58.4から上昇しており、Xiaomi独自のハーネス上でmini-swe-agentを使い、3回の平均として測定された。これはリーダーボードへの掲載項目ではなく、そのように提出されたものでもない。72.57をMiniMaxの20.4の隣に置き、52ポイント差の勝利と読み取るのは、2つの異なる測定をまたいだ算術である。リーダーボードは特定の構成についてのPass@1を、第三者が再実行できる信頼区間とタスクあたりの平均コストとともに公表するが、ベンダーの数値にはそのいずれも付随していない。72.57は正直な数字である可能性は十分にある。ただ、同じ種類のものではないだけだ。
MiniMaxも自社のローンチ時数値を公表しており、そのすべてに同じ注意点が当てはまる。SWE-Bench Proは59.0、BrowseCompは83.5、SVG-Benchは63.7、Terminal-Bench 2.1は66.0で、いずれもMiniMax自身のインフラ上で、同社独自のスキャフォールディングを用いて実行されたものだ。これらはモデルについての主張として扱うべきであり、モデルの測定値として扱うべきではない。
速度、レイテンシ、そして請求額を左右する2つの数値
スループットの差は品質の差とは逆方向にあり、無視できないほど大きい。MiniMax M3は毎秒168.9出力トークンを生成するのに対し、Xiaomi MiMo-V2.6-Proは134.3であり、最初のトークンまでの0.92秒はXiaomiの2.15秒より約2.5倍速い。インタラクティブな製品では、最初のトークンまでの遅延はユーザーが体感する数値であり、バッチパイプラインでは、スループットが実時間を決める数値である。
コスト面では、両者は公表されている料金が示唆するよりも差が小さく、どちらが有利かはトラフィック次第です。MiniMax M3 は100万入力トークンあたり$0.30、100万出力トークンあたり$1.20、Xiaomi MiMo-V2.6-Pro は$0.43と$0.87です。入力の供給はM3が安く、生成はXiaomiが安くなります。キャッシュ割引——M3は80%、Xiaomiは99%——を適用すると、キャッシュヒット/入力/出力が7:2:1の構成で、混合単価は100万トークンあたり$0.22と$0.18になります。Artificial Analysis はまた、Xiaomi MiMo-V2.6-Pro について Intelligence Index タスクあたり$0.13のコストを記録しており、これは掲載されているすべてのモデルで同じ方法で測定されたもので、両者について利用できる最も比較可能な単一のコスト数値です。

十五のルート対一つ、そしてフェイルオーバーの価値とは
17ポイントのインデックス優位も、エンドポイントが落ちていては役に立たない。執筆時点でArtificial AnalysisがXiaomi MiMo-V2.6-Proについて数えたAPIプロバイダーはわずか1社であり、その数はモデルではなくリリースに関する事実だ。3日前に公開されたチェックポイントには、広く行き渡る時間がなかったのである。4か月前のMiniMax M3は、15社が提供している。
その違いこそがルーターの役割であり、両モデルが商業的に分かれる点でもある。MiniMax M3 は OrcaRouter 上で minimax/minimax-m3 として提供されている:OpenAI 互換の単一エンドポイントであり、プロバイダーの定価を 0% の上乗せなしでそのまま適用している。つまり上記の $0.30 と $1.20 は当社の数字ではなく MiniMax 自身の数字であり、MiniMax の価格変更は同日中に当社側でも反映される。その 15 の上流プロバイダーがあるからこそ、自動フェイルオーバーチェーンが意味を持つ——あるプロバイダーで行き詰まったリクエストは、応答が始まる前に別のプロバイダーへ再試行される。これは、行き先が一箇所しかないモデルとは異なる保証だ。Xiaomi MiMo-V2.6-Pro は OrcaRouter 上にはない。Xiaomi のモデルは一つもなく、今日それを利用するには Xiaomi 自身のプラットフォームと、それを掲載しているサードパーティのカタログを経由する必要がある。
同じアプリケーションで両方を望むなら、実用的な形は、すでに採用を決めたモデルを保持する1つのキーを使い、新参モデルは3日前のスコアの強みで採用するのではなく、それらに対して評価するというものだ。これはルーティングの判断であり、有用な性質は、フォールバック経路があなたを救うその日まで何のコストもかからないことだ。

どちらを選ぶべきですか
今週中に本番環境で、オープンウェイトでマルチモーダルな100万トークンモデルが必要なら、答えは MiniMax M3 であり、他を寄せ付けない——15社のプロバイダー、初回トークンは1秒未満、十分に許容度の高い商用利用の道はコミュニティライセンスを読んでいる場合に限り、そして検査可能な公式の長期的ベンチマーク項目がある。効率に関する警告は本物だ:トークン単価だけでなく、タスクあたり91,000出力トークンを見込んで予算を組むべきである。
来月から始める仕事のためにモデルを選ぶなら、Xiaomi MiMo-V2.6-Pro のほうが測定上も大きな差をつけてより高性能で、ブレンド料金も安く、MIT ライセンスなのでライセンスの話をする必要すらなくなります。ただ、まだ実行できる場所が2つ目がありません。注目すべきはプロバイダー数です。これが1から動いたとき、その17ポイントの差は研究結果ではなくなり、導入の判断材料になります。
それまでは、正直な要約はこうだ。より優れたモデルとは、そこからフェイルオーバーできないモデルであり、より弱いモデルとは、今夜すぐに顧客の前に出せるモデルである。

この記事の数字の出典
両モデルのインデックススコア、スループット、レイテンシ、キャッシュ割引、プロバイダー数は、2026年9月22日時点で取得された Intelligence Index v4.3.2 に基づく Artificial Analysis の測定値であり、MiniMax M3 の29は、Xiaomi MiMo-V2.6-Pro の46と同じバージョンの複合指標に基づくものです。MiniMax M3 の DeepSWE v1.1 の数値は、2026年6月8日の公開リーダーボードのエントリによるものです。DeepSWE の 58.4 から 72.57 への動き、Pro 実行における30ステップにわたる約262万ドルの強化学習支出、および MiniMax M3 の SWE-Bench Pro、BrowseComp、SVG-Bench、Terminal-Bench の数値は、いずれも各ラボ自身のハーネス上でベンダーが報告したものであり、独立して再現されたものではありません。トークンあたりの料金は、各ベンダー自身の定価です。
