MiMo-V2.6-Pro と DeepSeek V4 Pro の比較に向けた OrcaRouter モデルレーダーのヒーローカード。サブタイトルは「2つのオープンなフラッグシップ、インデックススコア差は10ポイント」。モデルごとに1つのパネルがあり、フッターには、両方とも MIT ライセンスで 1M トークンのコンテキストウィンドウを備えていること、およびスコアは v4.3.2 であり以前のインデックスバージョンとは比較できないことが記載されている。
Guides & Insights

MiMo-V2.6-Pro 対 DeepSeek V4 Pro:10ポイント差の2大オープンフラッグシップ

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Xiaomi MiMo-V2.6-Pro と DeepSeek V4 Pro は同じ種類の存在だ — 兆パラメータ級の中国製 Mixture-of-Experts フラッグシップ、MIT ライセンス、100万トークンコンテキスト、今日ダウンロードできるオープンウェイト — そして Artificial Analysis Intelligence Index v4.3.2 では10点差、46対36である。両者は、フラッグシップが何のためにあるのかについても見解が異なる。2026年8月13日リリースの DeepSeek V4 Pro はテキスト専用の推論モデルで、1.6兆パラメータ、アクティブ490億、公開されている仕様のどこにも視覚・音声・動画の入力はない。2026年9月21日リリースの Xiaomi MiMo-V2.6-Pro は1.02兆パラメータ、アクティブ420億で、テキスト、画像、動画、音声を扱う。この違いは、その10点差よりも多くの導入を左右する。そして、ほかの何かを比較する前にまず決着をつけるべき最初の事柄である。

同じライセンス、異なるマシン

まず、本当に同一な点から始めよう。競合する2つのラボをまたぐとなると、予想よりもずっと多いからだ。両方とも公開リポジトリ上でMITライセンスのタグ付きで提供されており、つまり収益のゲートや利用分野条項なしに、商用展開、改変、追加学習ができる。両方とも1Mトークンのコンテキストウィンドウを主張している。両方ともスパースな専門家混合(MoE)設計だ——この規模ではこのアーキテクチャはデフォルトになっており、差別化要因ではない。そして両方とも、手法について西洋のフロンティアラボよりも公表が少ないラボによって訓練された。

• パラメータ — MiMo-V2.6-Pro 総1.02T / アクティブ42B、DeepSeek V4 Pro 総1.6T / アクティブ49B

• 入力モダリティ — MiMo-V2.6-Pro はテキスト、画像、動画、音声。DeepSeek V4 Pro はテキストのみ

• コンテキスト — 両方とも1Mトークン、DeepSeek V4 Proは出力を384Kトークンに制限

• インデックススコア — MiMo-V2.6-Pro は Intelligence Index v4.3.2 で46、DeepSeek V4 Pro は同じバージョンで36

• Indexタスクあたりのコスト — MiMo-V2.6-Pro $0.13、DeepSeek V4 Pro $0.67

• 掲載レート — MiMo-V2.6-Pro は100万トークンあたり $0.43 / $0.87、DeepSeek V4 Pro は Artificial Analysis の掲載どおり $1.32 / $3.96(DeepSeek 自身のピーク/オフピーク料金体系が適用される前)

• 速度 — MiMo-V2.6-Pro 134.3 出力トークン/秒、DeepSeek V4 Pro 97.4

• 初回トークンまでの時間 — MiMo-V2.6-Pro 2.15秒、DeepSeek V4 Pro 1.62秒

そのリストは二度読んでください。2つの行が直感に反しているからです。小さい方のモデルが10ポイント高いスコアを出します — 420億のアクティブパラメータが490億を上回るのは丸め誤差ではなく、ポストトレーニングの結果であり、この比較で最も明確なシグナル、つまり強化学習の品質が生の規模を凌ぎ、てこの軸になったことを示しています。しかも安い方のモデルが速い方でもあり、スループットとタスクあたりコストの両方でそうなのです。これは通常のトレードオフとは逆です。Xiaomiは忍耐と引き換えに割引を売っているわけではありません。DeepSeekの優位は最初のトークンまでの時間、1.62秒対2.15秒です — 本物ですが、V4 Proがリードする唯一の項目です。

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists 1.02T total and 42B active parameters, text, image, video and audio input, a 1M-token context window, Intelligence Index v4.3.2 score 46, a listed rate of $0.43 / $0.87 per million tokens, $0.13 per index task, 134.3 tokens per second with 2.15 seconds to first token, and a release date of 21 September 2026. The DeepSeek V4 Pro column lists 1.6T total and 49B active parameters, text-only input, a 1M-token context window with output capped at 384K, index score 36, a listed rate of $1.32 / $3.96, $0.67 per index task, 97.4 tokens per second with 1.62 seconds to first token, and a release date of 13 August 2026.

なぜここで同じインデックスバージョンが重要なのか

オープンウェイトモデルをインデックスの改訂をまたいで比較することこそ、公開されている比較の多くが誤る所以要因であり、バージョン番号は脚注ではない。Artificial Analysis は2026年9月に Intelligence Index を v4.3 として再構築し、その境界を挟んでスコアは大きく動いた——Claude Opus 5 は v4.2 と v4.3 の間で3ポイントを失い、オープンウェイトの勢力図も並び替わった。上記の両方の数値は v4.3.2 であり、つまり46と36は互いに直接比較できる。どちらのモデルについても、他所で引用されている古い数値とは比較できない。

それは仮定の話ではない。DeepSeek V4 Proは、2026年8月に以前の指標スケールで53と広く報じられ、その時期の当社自身の報道もそれを伝えていた。v4.3.2では、同じモデルが36を示す。モデルについては何も変わっていない。変わったのは物差しだ。スプレッドシートに53が入っていて、その隣にMiMo-V2.6-Proの46があるなら、その比較は誤ったモデルを指し示すことになる。正しい組み合わせは46対36であり、正しい結論は、5週間後にリリースされ、パラメータ数が3分の2であるモデルのほうが、実質的に先行しているということだ。

2つの研究所間の報告ギャップ

第二の、より微妙な違いがある。それは、各研究室が何を確認されることを受け入れるかに関するものである。

MiMo-V2.6-Proの46はArtificial Analysisによる測定値です。評価機関は独自のスイート——推論、知識、数学、コーディングにわたる10の評価——を公開モデルに対して実行し、その結果を公表しました。併せて動作数値も示しています。毎秒134.3トークン、最初のトークンまで2.15秒、99%のキャッシュ割引、インデックスタスクあたり$0.13、評価総コスト$206.66です。これはXiaomiのモデルに関する第三者による数値です。

DeepSeek V4 Proが看板に掲げるエージェント性能の数値はDeepSeek自身によるものであり、それらと独立系の数値との乖離はすでに記録されている。同社の発表資料は、Terminal-Bench 2.1を87.9、DeepSWEを62.7、CyberGymを83.3、SWE-bench Verifiedを80.6と報告している。独立系の実行では、Terminal-Bench 2.1は78.7——ベンダー公称値よりおよそ9ポイント低い——となり、Artificial Analysis Coding Indexは68.8となっている。これらのベンダー数値はいずれも再現されておらず、Terminal-Benchの乖離幅の大きさこそが、残りの数値一式を測定値ではなく主張として扱うべき理由である。

Xiaomiにも同じ問題の自社版がある。同社のダッシュボードは、MiMo-V2.6-Proが強化学習の実行を通じてDeepSWE v1.1で58.4から72.57へ上昇したと報告している。評価はXiaomi独自のハーネス上で、mini-swe-agentを用い、3回の平均で行われた。これはリーダーボードへの提出ではなく、外部の誰も再実行していない。したがって、どちらのモデルも、ベンダーのベンチマークについて問題なしというお墨付きを持って現れたわけではない。違いは、MiMo-V2.6-Proには、DeepSeekのローンチ時点で同等のタイミングにはなかった独立した総合スコアも伴っていることだ。そして、マーケティングではなく証拠に基づいて両者を選ぶなら、重視すべきなのはその非対称性である。

Screenshot of the Artificial Analysis model page for DeepSeek V4 Pro, showing the Intelligence Index score of 36 on version 4.3.2, an open-weights model under the MIT licence, text-only input, 1.6 trillion total and 49 billion active parameters, a 1M-token context window, a listed price of $1.32 per million input tokens and $3.96 per million output tokens, output speed of 97.4 tokens per second and time to first token of 1.62 seconds.

本番環境ではこのようになります

モダリティの違いが実用上の分岐点であり、それがDeepSeekに有利に働くことは、その10ポイント差が示唆するほど頻繁ではない。あなたのパイプラインがスクリーンショット、画像としてレンダリングされたPDF、動画フレーム、または音声を取り込む場合、MiMo-V2.6-Proは1つのモデルでネイティブに処理でき、DeepSeek V4 Proはまったく処理できない——前に別の視覚モデルを置く必要があり、それは2つ目の契約、2つ目の障害モード、2つ目の請求を意味する。ワークロードがテキストのみの推論なら、追加のモダリティは、何の対価も払っていない単なる死重だ。

インデックスタスクあたりのコストは、覚えておくべきもう一つの数値です。$0.13 対 $0.67 は、管理された同一のタスクセットにおける5倍の差で、どちらも同じ方法で測定されています。DeepSeek はピーク時/オフピーク時の課金スケジュールを採用しており、呼び出すタイミングによって実効レートを大幅に下げられるため、実世界での比率はオフピーク時間帯には縮まり、ピーク時には広がります — トラフィックがバースト的で、いつ到着するかを選べない場合には重要な詳細です。

ここが、DeepSeek側がモデルとは無関係に真の優位性を持っている点です。つまり、それは私たちのプラットフォーム上にあるのです。DeepSeek V4 Proはdeepseek/deepseek-v4-pro OrcaRouterのキーを通じて、プロバイダーの定価・マークアップ0%でプロバイダー間の自動フェイルオーバーと、その上で使えるルーティングDSLも備わっています。つまり、ピーク/オフピークの計算、プロバイダー間のスプレッド、フォールバック経路は、どれも自分で作るものではなく設定するものです。MiMo-V2.6-Proは私たちのプラットフォーム上にはなく、そのことは率直に申し上げます。今日それに到達するには、Xiaomi自身のプラットフォームか、それを掲載しているサードパーティのカタログのいずれかを使うことになり、Artificial Analysisが取得時点で数えたAPIプロバイダーは1社だけでした。1つの経路は本番用の経路ではありません。これこそが、MiMo-V2.6-Proを今すぐ評価し、慎重にルーティングし、その背後に別のものを置いておくべきモデルとして扱うべきだという最も強い根拠です。

どちらを、そしていつ

DeepSeek V4 Pro を選ぶべきなのは、作業がテキストのみの場合、384K の出力上限が必要な場合、2 つの中で最初のトークンまでの時間が最速のものを求める場合、あるいはすでに当社のプラットフォーム上にいて、フェイルオーバー付きで新しい統合が不要な 1 兆パラメータのオープンウェイトのレーンを求める場合です。それが既存の定番であるのには理由があり、5 週間早く登場したということは、9 月のモデルがまだ積み上げていない 5 週間分のツーリング、量子化、サービングのレシピを意味します。

タスクがマルチモーダルである場合、タスクあたりのコストがユニットエコノミクスを支配する場合、0.5秒のレイテンシよりもスループットが重要である場合、または独立に測定された指標で現在のオープンウェイトのリーダーが欲しい場合は、MiMo-V2.6-Pro を選んでください。両方とも MIT ライセンスなので、どちらにせよウェイトに関する問題は解決済みです — 自分のハードウェアで実行し、ファインチューニングし、商業的に提供できます。

検討に値する構成は、そもそも二者択一ではない。ルーターを使えば、オフピーク料金でテキスト専用の推論を行う DeepSeek レーンを維持しつつ、マルチモーダル リクエスト用に MiMo レーンを追加でき、より細い方のルートの前段にフォールバックを置ける。それはヘッジではない。各リクエストを、実際にそれを処理するモデルに結び付けることだ。これは、勝者を一つ選んでワークロードの形が決して変わらないことを願うよりも、安価で持続性の高い答えである。

Decision card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the decision', with two columns. 'Choose MiMo-V2.6-Pro when' lists a multimodal task with screenshots, rendered PDFs, video frames or audio in the same request; cost per task dominating unit economics at $0.13 against $0.67 on an identical task set; throughput mattering more than latency at 134.3 against 97.4 tokens per second; and wanting the current open-weights leader on an independently measured index at 46 against 36. 'Choose DeepSeek V4 Pro when' lists text-only reasoning work; needing the 384K output ceiling; first-token latency being the binding constraint at 1.62s against 2.15s; and wanting a route with failover behind it.

この比較ではまだ答えられない問い

両モデルで最も引用されるベンチマークはベンダー自身が実施したもので、再現されていない。DeepSeek V4 Pro の場合、その空白は8月以来ずっと埋まっておらず、同モデルの独立系スコアが発表時の数値より低く出るのはそのためだ。MiMo-V2.6-Pro については、独立系の総合スコアは存在するが、エージェント関連の内訳は存在しない — Artificial Analysis が公表しているのは46という数値だけで、その下にある評価ごとのばらつきは公表されていない。そしてその内訳こそ、あるモデルがエージェントループに属するのか、質問応答パイプラインに属するのかを教えてくれる詳細なのだ。

そのスプレッドが公表され、誰かがXiaomiのDeepSWEハーネスを再実行するまでは、擁護できる立場はどちらのラボのマーケティングよりも限定的だ。MiMo-V2.6-Proは独立系の複合指標と計測されたタスクあたりコストで優位に立ち、DeepSeek V4 Proは成熟度、出力長、初回トークン遅延、そして背後に冗長性を備えた経路を通じて到達できる点で優位に立つ。5週間は短い先行であり、それがDeepSeekの唯一の先行だ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新