記事「Xiaomi MiMo-V2.6-Pro: 72.57 on DeepSWE」のヒーロータイトルカード。上部のキッカーは「OrcaRouter・モデルレーダー — 未公開」、サブタイトルは「止まった実行、まだ出荷されていないモデル — 何が確認され、何が確認されていないのか」。その下に2枚のカード:左は「Xiaomi自身のダッシュボードにて」で、本文は「DeepSWE v1.1: 72.57 — 実行はステップ30で停止、9月20日」;右は「まだ未公開」で、本文は「モデルカードなし、API IDなし、価格なし、重みなし」。4つのチップには「Flashの兄弟: 65.68」「総支出: $3,474,715」「ボード首位: 74%」「ベンダー実施の評価、未提出」と表示されている。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

Xiaomi MiMo-V2.6-Pro:DeepSWEスコア72.57、停止した実行、そして依然としてリリース日は未定

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Xiaomi MiMo-V2.6-Proは、公開ストリーミングしていた強化学習ランを9月20日に停止し、DeepSWE v1.1のスコアは72.57でXiaomi自身のダッシュボードに表示されている——同じリーダーボードの首位でGPT-6 AstraGemini 3.8 FlashClaude Opus 5が並ぶ74%を1.4ポイント下回る。並行して学習された小型モデルXiaomi MiMo-V2.6-Flashは9月19日に65.68で停止した。両ランともステップ30で終了し、Xiaomiが併せて公開した合計請求額は$3,474,715で、これは今朝私たちがページをキャプチャした時点のものだった。

それが良い知らせのすべてであり、そして本当に良い知らせだ。話の残りは、ある数字と製品との間の隔たりである。Xiaomi MiMo-V2.6-Pro にも Xiaomi MiMo-V2.6-Flash にも、リリース日も、モデルカードも、API識別子も、公開価格も、ダウンロード可能な重みのセットもない。呼び出せるエンドポイントもない。存在するのは、誰でも見られるトレーニングダッシュボード、Xiaomi自身のハーネスが生成したベンチマーク数値、そして、かつて人々が茶葉を読んだようにテレメトリーページを6日間読み続けてきたコミュニティだけだ。

つまりこれは「現時点でわかっていること」をまとめた記事であり、その正直な版は、先週の報道が静かに混ぜ合わせてきた3つの事柄を切り分ける。小米が公式に明らかにしたこと、ただ一人の観察者がそれについて報告したこと、そしてそれが今日コーディングモデルを選ぶ人にとって何を意味するか、だ。

シャオミが実際にオンラインに公開したもの

9月16日、Luo Fuli氏が率いるMiMoチームは、Xiaomi自身のドメイン上にライブページを開設し、未公開の2モデルのポストトレーニングをリアルタイムで公開した。ステップ数、報酬曲線、トークンスループット、サンドボックス数、GPU障害通知、そして眺めている間に増えていくコストカウンター。報道によれば、Xiaomiの説明は、約6か月をかけて1つの問い――強化学習をどこまでスケールできるか――に取り組み、結果を発表するのではなく、その実験を公開で行うことを決めた、というものだ。

ダッシュボードは、ベンダーの成果物としては異例なほど率直だ。通知フィードに自らの失敗を列挙している:エキスパートの負荷不均衡によるGPUメモリ不足障害でステップ17でProが再起動したこと(チームによれば、トレーニングの並列化戦略を調整して修正したという);Proトレーニングクラスタとグレーディングデプロイメント間のネットワーク接続障害により再起動が余儀なくされ、ロールアウトログの「悪いパターン」を受けて次回のPro実行からcyber datasetを除外する決定が下されたこと;インフラストラクチャエラーの一種が約3時間検出されなかった後、ステップ15からFlashが再起動したこと;そして単一ノードのVRAM障害によるProの再起動。また、「現在のproモデルにとって比較的容易」と判断されたタスクが除外されたことも記している — ほとんどのポストトレーニングレポートが言及しないことを認めている。

Screenshot of Xiaomi's public MiMo-V2.6 reinforcement-learning dashboard captured September 21, 2026. A total-cost counter reads $3,474,715, and a notices feed lists a Pro restart at step 17 from a GPU out-of-memory fault caused by expert load imbalance, a network connectivity fault between the Pro training cluster and the grader deployment, a Flash restart from step 15 after an infrastructure error went undetected for about three hours, a Pro restart from a node VRAM fault, and a note that tasks relatively easy for the current Pro model were filtered out. Two run cards show mimo-v2.6-pro stopped at step 30 — started 2026-09-15 10:32 UTC, stopped 2026-09-20, $2,620,670 spent, 75B tokens, 753k samples, batch 1,568 x 16 — and mimo-v2.6-flash stopped at step 30 — started 2026-09-15 15:16 UTC, stopped 2026-09-19, $854,044 spent, 81.4B tokens. Three benchmark panels read DeepSWE v1.1 mini-swe-agent avg@3: mimo-v2.6-pro 72.57, mimo-v2.6-flash 65.68; an in-house coding bench at 65.43 and 62.87; and AutomationBench v1.0.6 at 53.10 and 52.70.

実行カード2枚は、タイミングを追跡する人にとって重要な部分です。どちらのモデルも停止と表示されています。MiMo-V2.6-Proは実時間で5日7時間後、MiMo-V2.6-Flashは3日11時間後、いずれもステップ30で、それぞれ9月20日と9月19日です。Proは$2.62Mで75Bトークンと753kサンプルを消費し、Flashは$854kで81.4Bトークンを消費しました。各ステップでは1,568件のプロンプトのバッチを、プロンプトあたり16回のロールアウトで処理します — 1ステップあたり25,088件のトラジェクトリを、完全に非同期で実行しています。

はっきり言っておく価値がある。Xiaomiは「停止した」が実行の完了を意味するのか、一時停止なのか、それともチェックポイントされた状態なのかを明言していない。停止したカードは完了通知ではなく、チーム外の誰もそのどれに当たるのか知らない。

確認されていることと、確認されていないこと

72.57は噂ではない。それはXiaomiのダッシュボードに、DeepSWE v1.1、mini-swe-agent、avg@3とラベル付けされたチャートの中、Pro実行のオレンジ色の曲線の隣に記されている。Flashモデルの65.68も同じチャート上にある。その数字はまた — 62.24として、後に65.97として — 同じパネルの以前のスナップショットにも現れている。それがこの曲線に形を与えている。つまり、一度の幸運な評価ではなく、30ステップにわたる着実な上昇である。

出発点となるのは、これが報告のみだという点だ。9月21日にX上で@nrehiew_というアカウントから広まっている主張は、ProモデルがDeepSWEで「58.41から72.57へ」進み、実行が完了したというものだ。終点はベンダーのダッシュボードと完全に一致する。58.41というベースラインは、そのアカウントが曲線の開始地点をどう読むかという解釈であり、チャートで最も左にあるProの点は確かに50代後半に位置している。またXiaomiはステップ1の数値を公表していない。完了という主張も同様に、stoppedと表示された2枚のカードの解釈であり、これは妥当な読み方ではあるが、Xiaomiの発言ではない。14ポイントの改善は、方向性としては堅実だが、数値としては概算として扱うべきだ。

A two-column scoreboard titled 'MiMo-V2.6-Pro vs the DeepSWE top tier', subtitled 'What Xiaomi published about its own checkpoint, against what the public leaderboard lists — September 21, 2026'. The left column, badged VENDOR-REPORTED and headed 'MiMo-V2.6-Pro', reads: DeepSWE v1.1 — 72.57; Basis — Xiaomi's own offline eval, mini-swe-agent avg@3; Confidence — not published; Cost per task — not published; Release — not announced; Independent runs — none. The right column, badged PUBLIC LEADERBOARD and headed 'Top tier — three-way tie', reads: DeepSWE v1.1 — 74%; Basis — submitted configs, Pass@1, GPT-6 Astra · Gemini 3.8 Flash · Claude Opus 5; Confidence — plus or minus 1 to 4 points; Cost per task — $2.36 to $11.84; Release — shipping today; Independent runs — on the public board. A footer reads 'MiMo-V2.6-Pro is Xiaomi's own offline evaluation, read from the vendor's public RL dashboard on 2026-09-21 and not submitted to the leaderboard. Top-tier figures per Datacurve's DeepSWE v1.1 leaderboard, updated 2026-09-03.' The OrcaRouter logo is composited in the bottom-right corner.

報道が見落としている区別がもう一つあり、それこそがこの数値の価値を決める。ダッシュボードのベンチマークパネルはXiaomi自身による評価だ。同社が自社のチェックポイントでハーネスを実行し、結果を公開した。そのハーネスは公開リーダーボードが使っているものと同じ——mini-swe-agent、DeepSWE v1.1——なので、この数値はベンダー独自開発のベンチマークよりも比較しやすい。しかし、自社実行の評価はリーダーボードへのエントリーではなく、誰も提出していないため、72.57はDatacurveのボードには現れない。

74%という上限は、見出しが示唆するよりも厳しい

これで比較が明確になる。DatacurveのDeepSWE v1.1リーダーボードは、2026年9月3日に最終更新され、5言語にわたる91のリポジトリの113のタスクを掲載しており、上位3つの構成は74% Pass@1で並んでいる。GPT-6 Astraはxhigh推論エフォート、Gemini 3.8 Flashはhigh、Claude Opus 5はmax。それらのスコアの隣に並ぶ数字こそが興味深い。

• 信頼度 — GPT-6 Astra 74% ±3、Gemini 3.8 Flash 74% ±1、Claude Opus 5 74% ±4。同じボード上では、GPT-5.6 Solは73% ±3、GLM-5.3Kimi K3は69%である。区間は小数点以下第2位をはるかに超えて重なっている。

• タスクあたりのコスト — Gemini 3.8 Flash は平均 $2.36、GPT-6 Astra は $6.52、Claude Opus 5 は $11.84。リーダーボード自身のチャートは、Gemini 3.8 Flash をボード上で最も効率的な構成として示しており、ベンチマークでは区別がつかない合格率でありながら、これら3者の開きはおよそ5対1である。

ステップ数 — Gemini 3.8 Flash は1タスクあたり平均166のエージェントステップを必要とし、Claude Opus 5 は99、GPT-6 Astra は29だった。同点のスコアは、3つの大きく異なる作業スタイルを覆い隠している。そして、最も安価なものが、最も懸命に働くものなのだ。

Screenshot of Datacurve's DeepSWE v1.1 leaderboard captured September 21, 2026, showing 113 tasks, 91 repositories, five languages and 28 models, with the v1.1 and Best tabs selected and the board marked 'updated September 3, 2026'. The Pass@1 table lists gpt-6-astra (xhigh) at 74 percent plus or minus 3 with an average cost of $6.52, 30k output tokens and 29 steps; gemini-3.8-flash (high) at 74 percent plus or minus 1 at $2.36, 143k tokens and 166 steps; claude-opus-5 (max) at 74 percent plus or minus 4 at $11.84, 118k tokens and 99 steps; gpt-5.6-sol at 73 percent; claude-fable-5 at 70 percent; glm-5.3 and kimi-k3 at 69 percent; and grok-4.6 and gpt-5.6-luna at 67 percent. The score-versus-average-cost chart above the table labels gemini-3.8-flash as the most efficient configuration. No Xiaomi MiMo model appears on the board.

したがって、報告された72.57が「ボードのトップに近づいている」と表現されるとき、正確な言い方はより限定的で、それほど劇的ではない。それは三者同点の約1.5ポイント以内にあり、その三者はベンチマーク自身の誤差範囲によっても互いに区別できない。これは、まだポストトレーニング中のモデルにとって強い結果であり、ベンチマークの維持管理者ではなくベンダーによって生成されたもので、そのモデルがまだ提出されていないボード上でのものである。リーダーボードの最後の更新はXiaomiの実行より完全に前のものであり、そのためMiMoの項目はまだそこに現れていない。

なぜXiaomiは公開でトレーニングしているのか

透明性は偶然ではない。Xiaomiの最後のオープンウェイトリリースは4月末のXiaomi MiMo-V2.5とXiaomi MiMo-V2.5-Proで、どちらもMITライセンスの下にあり、商用利用可能で、ファインチューニング可能で、再配布可能だった。MiMo-V2.5-Proは1.02兆パラメータのMixture-of-Expertsモデルで、42Bのアクティブパラメータ、ハイブリッドアテンションアーキテクチャ、100万トークンのコンテキストウィンドウを備え、その発表資料はエージェント的機能の主張を明確にしていた:何百回ものツール呼び出しを経てRustでゼロから書かれたコンパイラ、11時間のエージェント作業で構築された8000行のデスクトップアプリケーション。

次世代のポストトレーニングを逐次公開するというのは、また別の種類の主張だ。報酬曲線、サンドボックス数、GPU障害をリアルタイムで公表するラボは、ローンチ用のプレゼン資料ではなくプロセスで評価されたいと求めており、タイムラインを示唆している。Luo Fuli氏は、RLの取り組みの技術的詳細を今後数週間にわたって少しずつオープンソース化すると述べている。それは、これまでに誰かが提示したものの中で、スケジュールに最も近いものだ。方法論が先、モデルは後である。

これはまた、Xiaomiが以前に用いたパターンにも当てはまる。モデルが、同社が正式に発表する前に別の名前で公の場に現れるというパターンだ。同社の常套手段は、静かに訓練し、公の場でテストし、そして重みを公開することである。

今日実行できるもの

MiMo-V2.6 ファミリーには何もありません。今すぐ Xiaomi の MiMo モデルが欲しいなら、存在するのは V2.5 世代です — Xiaomi 自身のチャネルと複数のサードパーティプラットフォームを通じてオープンウェイトが提供され、モデルカードと価格も公開されています。MiMo-V2.6 の API はなく、モデル識別子も価格表もありません。MiMo-V2.6 の識別子やトークンあたりの料金を引用しているページは、Xiaomi が空けたままにしている空白を埋めているにすぎません。ダッシュボード上の `mimo-v2.6-pro` と `mimo-v2.6-flash` という文字列はトレーニングジョブ名であり、公開されたエンドポイントではありません。

もう一つの実用的な帰結は、その間に何をすべきかという点です。MiMo-V2.6-Pro があなたにとって興味深い理由が、フロンティア級のコーディング性能に到達するためのより安価な手段かもしれないというものであるなら、それが比較対象として測定されている構成はすでに呼び出し可能であり、リーダーボードは安価なほうが競争力があると示しています。Gemini 3.8 Flash は1タスクあたり2.36ドルでトップの合格率に並び、ボード上で最も効率的な構成としてフラグが立てられています。Gemini 3.8 Flash、Claude Opus 5、GPT-6 Astra はいずれも、1つの OrcaRouter API キーを通じて、プロバイダーの定価で、0%のマークアップをそのまま適用して利用できます — つまり、ベンダーの価格変更は次の請求サイクルではなく当日に当社側で反映されます — フェイルオーバーはベンダー単位ではなくモデル単位で構成されています。そして、ラボがこのようなモデルを実際に公開したとき、同じキーの背後でルーティングすることが、それを評価するためのコミットメントの低い方法です:まだ誰も特性を把握していないチェックポイントに本番パスを賭けることなく、実際のトラフィックの前に置くことができます。

実際にこの話を変えるものは何だろう

4つのシグナル。おおよそ、それらがどれだけ決着を左右するかの順に:

• 明示されたライセンスの下でHugging Faceに公開された重み — これがV2.5世代が登場した形であり、そのRL実行が、終わってしまった実験ではなく出荷可能なモデルを生み出したことを示す最も強い証拠である。

• パラメータ数、コンテキスト長、アーキテクチャを記載したモデルカード — V2.6 の数値はどれも公開されておらず、ダッシュボードにも表示されていない。V2.6-Pro が V2.5-Pro の 1.02T/42B の構成を継承していると仮定するのは推測にすぎない。

• API識別子と価格表——まさにこの瞬間、DeepSWEの数値は観戦するスポーツではなく、購入の判断材料となる。

• DatacurveのDeepSWEボードへの投稿。それによってMiMo-V2.6-Proは、比較対象となっているモデルと同じ表に、同じエラーバーの下に置かれることになる。ベンダーが実施した評価とリーダーボードへの投稿は同じ主張ではなく、両者の隔たりはまさにその表の1行分にほかならない。

それまでは、正直にまとめると、Xiaomiは主要ラボが公表した中で最も透明性の高いポストトレーニングの実施を示しており、それはまだ出荷していない2つのモデルについてのもので、自己申告のベンチマーク数値が1つ、ランキングのトップに近いものの——トップには並ばない——。手法の解説記事は今後数週間で公開されると約束されている。リリース日はまったく約束されていない。