OrcaRouterのモデルレーダー向けヒーローカード(Xiaomi MiMo-V2.6-Pro用)。タイトルはモデル名と「オープンウェイト、インデックスで46、$0.43 / $0.87」という一行で、2つのパネルには「何が登場したか」と「コストはいくらか」というラベルが付きます。
Guides & Insights

Xiaomi MiMo-V2.6-Pro、オープンウェイト指数で46を記録して首位に — そしてトレーニング費用を公開

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Xiaomi MiMo-V2.6-Proは現在、Artificial Analysis Intelligence Indexで最高位のオープンウェイトモデルであり、v4.3.2で46——GLM-5.3を1ポイント、Kimi K3を2ポイント上回り、前身のMiMo-V2.5-Proが以前のインデックス尺度で記録した26を20ポイント上回っている。この数値はXiaomiではなく、Artificial Analysisが独自のハーネスを実行して出したものであり、このリリースで最も有用な単一の事実だ。2番目に有用な事実は、その隣に記された価格だ。入力100万トークンあたり$0.43、出力100万トークンあたり$0.87で、Claude Opus 5の$5.00と$25.00に対してである——そのモデルはインデックスで5ポイント上に位置する。3番目は、Xiaomiが明かすとは誰も予想していなかったものだ。MiMo-V2.6-Proを生み出した強化学習の実行に実際にかかったコストの公開計算書である。

スコアは測定値であり、主張ではない

中国のモデル発表について公表されるものはほとんど、ベンダーが出した数字という形で届き、読者はそれを割り引いて見ることを学んできた。今回のこれは違う。そしてその違いは正確に語る価値がある。なぜなら、発表をめぐる報道がすでにその違いを曖昧にしてしまっているからだ。

Artificial Analysisは、v4.3.2コンポジット上でMiMo-V2.6-Pro自体を評価した——推論、知識、数学、コーディングを対象とする10の評価で、AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1を含む。46という数値は、そのスイートが返したものだ。また、モデルが単に優れているだけでなく実用的かどうかを決める動作特性も記録した。すなわち、毎秒134.3出力トークン、最初のトークンまで2.15秒、99%のキャッシュ割引、Intelligence Indexタスクあたり$0.13という実測コストである。

そのうちの2つは強調に値する。毎秒134.3トークンという数値は、MiMo-V2.6-Proを速度において114モデル中11位に位置づける——1兆パラメータのMixture-of-Expertsモデルにとって、それは単なるトレーニング結果ではなく、サービング結果である。そしてタスクあたり0.13ドルという数字は、予算と突き合わせても生き残る数字である。これは、このモデルに対してインデックスを実行するのに実際にかかったコストであり、ボード上のすべてのモデルで同じ方法で測定されているため、見出しのトークンあたり料金とは異なり、比較可能な形になっている。

Scoreboard card headed 'Xiaomi MiMo-V2.6-Pro — the scoreboard', listing the index score of 46 on Intelligence Index v4.3.2 as the highest of any open-weights model, the open-weights field behind it at GLM-5.3 45 and Kimi K3 44, the top of the same index at Claude Fable 5.1 53, GPT-6 Astra 53 and Claude Opus 5 51, serving at 134.3 output tokens per second and 2.15 seconds to first token, a price of $0.43 in and $0.87 out per million tokens with a 99% cache discount and $0.13 per index task, MIT-licensed weights at 1.02T total and 42B active parameters with a 1M-token context window and text, image, video and audio input, and a route count of one API provider.

インデックスが対象とするものと対象としないもの

オープンウェイトの王冠は本物だが、見た目ほど広くはない。スコア46で、MiMo-V2.6-Proはオープンウェイト部門をリードしている。だがインデックスでは首位ではない。v4.3のトップは、デフォルトフォールバック付きの最大努力でのClaude Fable 5.1と、最大努力でのGPT-6 Astraで、どちらも53、Claude Opus 5が51、Claude Fable 5が50だ。したがって正直な捉え方は、広さを評価する複合指標でフロンティアまで5ポイントの差があり、Xiaomi自身の前世代から20ポイント改善した、というものだ。

• オープンウェイトのトップ — Xiaomi MiMo-V2.6-Pro 46、GLM-5.3(max)45、Kimi K3(max)44

• 同じ指標のトップ — Claude Fable 5.1(max、フォールバック)53、GPT-6 Astra(max)53、Claude Opus 5(max)51

• 速度 — 134.3 出力トークン/秒、測定した114モデル中11位、このサイズクラスの中央値は77.9

最初のトークンまでの時間 — 2.15秒、中央値2.34秒に対して

• Intelligence Index タスクあたりのコスト — $0.13、評価全体を実行するには $206.66

• 表示料金 — 入力トークン100万個あたり$0.43、出力100万個あたり$0.87、99%のキャッシュ割引、そしてキャッシュヒット/入力/出力が7:2:1の比率におけるブレンド$0.18

Artificial Analysisのページにある数字の1つは、自慢ではなく紛れもない注意点だ。執筆時点で、MiMo-V2.6-ProについてAPIプロバイダーを1社しか数えていなかった。これが現在このモデルの実用上のボトルネックであり、品質の問題ではない。可用性の問題だ。1つの経路でしか到達できないモデルにはフェイルオーバーがない。その経路が劣化すれば、あなたのアプリケーションも一緒に劣化する。そしてフェイルオーバーの仕組みこそ、ルーターが存在する理由そのものだ。このリリースを前提に計画する人にとっての重要な観察は、当社がMiMo-V2.6-Proをホストしておらず、そうでないふりをするつもりもないということだ。今日それへの経路は、Xiaomi自身のプラットフォームと、それを掲載している少数のサードパーティカタログだけだ。

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, showing the Intelligence Index score of 46 on version 4.3.2, the listed price of $0.43 per million input tokens and $0.87 per million output tokens, a 99% cache discount, output speed of 134.3 tokens per second, time to first token of 2.15 seconds, and the open-weights attribution with the MIT licence.

混同してはならない2つの数字

Xiaomiも独自のベンチマーク数値を公表しており、それらは46とは別種のものだ。同社のダッシュボードは、MiMo-V2.6-Proが強化学習の実行を通じてDeepSWE v1.1で58.4から72.57へ上昇したと報告している。評価はmini-swe-agentを用い、3回の平均で行われた。これはXiaomiのハーネスであり、Xiaomiの採点器であり、Xiaomiのオフライン実行だ。公開されているDeepSWEリーダーボードには提出されておらず、誰にも再現されていない。

72.57を、公開されているDeepSWEボードが最上位層に掲載する74%と同等のスコアとして扱いたくなるほど、この2つは並べて見ると誘惑的だ。しかし両者は同じ尺度ではない。リーダーボードの数値は、提出された構成によるPass@1であり、公開された信頼区間とタスクあたりの平均コストが付随している。一方、ベンダーの数値は内部評価であり、そうしたものは何も付いていない。私たち自身の9月21日の記事は、数値がまだダッシュボード上の読み取り値だった時点でこの点を指摘しており、重みが公開された今でもそれは当てはまる。ベンダーのハーネスは完全に正直でありえても、それだけでリーダーボードのエントリにはならない。リーダーボードのエントリとは、第三者が再実行できる特定の条件下での特定の構成についての主張だからだ。

同じ規律はトレーニング支出にも当てはまる。Xiaomiは、ProとFlashの各実行を通じて概算$3,474,715を報告している——Proが$2,620,670、Flashが$854,044——それぞれ30を超える強化学習ステップと、それぞれ約750,000の軌跡を、6日未満で完了した。これらは同社自身の計算資源会計上の数値だ。これらが興味深いのは、ラボがほとんど公表しないからであり、APIの価格ではなく、あなたが支払うコストでもなく、第三者が監査した数字でもない。

Xiaomiが実際に出荷したもの

このリリースは、総パラメータ数1.02兆、トークンあたり420億が活性化するスパースなMixture-of-Expertsモデルで、100万トークンのコンテキストウィンドウと、テキスト、画像、動画、音声にわたるネイティブなマルチモーダル性を備えている。その兄弟モデルであるXiaomi MiMo-V2.6-Flashは、同じアーキテクチャを小規模化したもので、総パラメータ数3090億、活性化150億となっている。公開された重みにはMITライセンスのタグが付いており、リリース一式には技術報告書、デプロイ手順、そしてXiaomiによれば、ポストトレーニングを検証・再現するために必要な強化学習トレーニング環境とコードが含まれている。

最後の項目は、今回のローンチと典型的なAPI発表との本質的な違いであり、マーケティングから切り離して考える価値がある。RL環境を公開することは、学習設定が検証可能だという主張である。公開された環境が72.57を再現するのに十分かどうかは別問題であり、それはリリースノートではなく、実際に試す人々によって決着する。Xiaomi自身のトレーニングノートは、コーディング、汎用エージェント、視覚、サイバーセキュリティのタスクを単一パスで混ぜ合わせた実行について述べており、成功した軌跡を順位付けし、より良い経路へ報酬を再配分するグレーダーを用いている。また失敗も記録している。エキスパートの負荷不均衡に起因するGPUのメモリ不足再起動、トレーニングクラスタとグレーダーデプロイメント間のネットワーク障害、そしてインフラエラーが約3時間検知されなかった後のFlash再起動である。成功とともに障害を公開することが、残りの開示を信頼できるものにしている部分だ。

通話にかかるコストと、ルーティングの課題がどこにあるか

100万トークンあたり0.43ドルと0.87ドルで、MiMo-V2.6-Proは中位モデル並みの価格設定ながら、フロンティア級オープンウェイトモデル並みのベンチマーク性能を誇る。Xiaomiは新しいチェックポイントの価格を引き上げるのではなく、前世代のMiMo-V2.5の標準価格を維持した。そのため、この料金はパラメータ数に対して低く見える。99%のキャッシュ割引により、キャッシュを多用するエージェントループは実質ゼロコストでコンテキストを読み込める。そして、長期的なエージェントの請求額が実際に積み上がるのはそこなのだ。

この取引には、きれいにルーティングできるバージョンと、そうでないバージョンがある。できるほうのバージョンとは、MiMo-V2.6-Pro と比較することになるフロンティアモデル——$5.00/$25.00 の Claude Opus 5、GPT-6 Astra、Gemini 3.8 Flash、GLM-5.3——が、プロバイダーの定価で、マークアップ0%で、1つの OrcaRouter キーを通じてすべて到達可能であるということだ。つまり、そのいずれかに対するベンダーの値下げは同日中にこちら側でも反映され、ルーティングルールによって、最初のモデルが遅い、あるいは利用不可のときはリクエストを2番目のモデルへ送ることができる。ここではこれがいつも以上に重要になる。最高のオープンウェイトスコアを持つモデルは、そこへ至るルートが最も細いモデルでもあるからだ。この2つ——大量処理向けの安価なオープンウェイトレーンと、難しいテール向けのフロンティアレーン——を組み合わせることはルーティングの判断であり、両方のレーンが同じキー上に載った瞬間に賭けではなくなる類の判断なのだ。

もう一つ、混同しないように整理しておきたい製品がある。モデルと取り違えられやすいからだ。XiaomiはMiMo-V2.6-Pro-UltraSpeedも提供している。同じチェックポイントから構築されたホスト型のサービング階層である。Xiaomi自身の資料では、標準のProサービスと同じ品質で最大20倍の出力速度をうたっており、第三者のカタログ掲載情報では約10倍と説明されている。これは同じ階層を指す二つの異なる数字であり、両者を整合させるリクエスト単位のレイテンシ分布を公表した人は誰もおらず、さらにこの階層は大幅に高い料金を伴う。UltraSpeedが重みの能力を変えることは何もない——変わるのは、他社のサーバーがそれをどれだけ速く実行するかである。

何がこの状況を変えるでしょうか

三つのこと、どれほど重要になるかの順に。

第2、第3のサービングルート。Artificial Analysisにおける単一プロバイダー数が、他のすべてを縛る制約となっている。ルートが増えればフェイルオーバーが実現し、サービング層での価格競争が生まれ、モデルを実験ではなく本番経路に投入できるようになる。

DeepSWEの数値の独立再現。46はすでに独立しているが、72.57はそうではない。外部の実行がその近くに着地すれば、このモデルを支持する根拠はかなり強くなる。もし著しく下回るなら、信頼すべきはArtificial Analysisの数値のままであり、ベンダー側の数値は、検証に耐えられなかった数多のローンチ時の主張のリストに加わることになる。

Timeline card headed 'MiMo-V2.6-Pro — what was disclosed, and by whom', with six dated rows: 21 September 2026 weights, technical report, deployment instructions and RL environments published; 22 September 2026 Xiaomi's launch page carrying the DeepSWE v1.1 figures and the training-spend accounting; the independent Artificial Analysis score of 46 on v4.3.2; the vendor harness result moving 58.4 to 72.57 on DeepSWE v1.1; the vendor accounting of $2,620,670 for Pro and $854,044 for Flash across the RL runs; and a route count of one API provider.

評価項目別の内訳。総合スコアはあくまで総合スコアだ。MiMo-V2.6-Pro が10の評価のうちどれで勝ち、どれで負けるかは、エージェント型コーディング向けに配備するモデルと、検索重視の質問応答向けに配備するモデルとの違いであり、インデックスだけでは分からない。その詳細こそ次に注目すべき点であり、ルーティング設定を書き留める価値が出る前に、それが必要としているものだ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新