記事「MiMo-V2.6: RL論文が示すもの」のヒーロータイトルカード。オーバーラインは「TECHNICAL REPORT」、サブタイトルは「Xiaomiの混合RLレポートを、何を検証し、何を検証していないかという観点から読む」。4つの角丸チップには「凍結されたMoEルーター」「採点コスト12.7%」「DeepSWE 58.4から72.6」「AA Index 46」と表示。フッター行には「DeepSWEの数値はベンダー報告。AA Index 46はArtificial Analysisによる測定」と表示。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

MiMo-V2.6:XiaomiのRL論文が実際に示していること、そして未検証のまま残していること

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

今月発表されたモデル論文のほとんどはアーキテクチャ論文である。Xiaomi MiMo-V2.6-ProとXiaomi MiMo-V2.6-Flashの背後にある技術レポートはそうではない。MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvementと題されたこのレポートは、2026年9月21日に提出され、LLM-Core Xiaomiに帰属するもので、その紙幅のほとんどをスパースなmixture-of-expertsバックボーンには一切と言ってよいほど割かず、ほぼすべてを一つの問いに費やしている。すなわち、ポストトレーニングの予算全体を単一の混合強化学習の実行に投じたら何が起きるのか、という問いである。これに対してDeepSeek-V4.1-Flashのレポートはメモリに関する文書だ。その紙幅は圧縮スパースアテンション、層をまたぐKV再利用、FP4ストレージに割かれている。両者を並べてみれば、これは能力がどこから来るのかについての主張であり、そして両者は一致していない。

その報告書は、それ自体の基準で読む価値がある。ただし、注意深く読む価値がある。実行を行った研究室による自己報告だからだ。報告書は自らのメカニズムを明示し、アブレーションを示し、失敗を公表し、同時に、外部から検証できない数値も報告している。この二つを切り分けることが作業の大半を占める。本稿はそれを行っており、2026年9月23日——チェックポイントが公開されてから2日後——に書かれた。その時点で、この論文はそれらについて最も新しく、最も裏付けの少ないものだった。

なぜ書類の日付がいつも以上に重要なのか

シャオミのMiMo-V2.6-ProとMiMo-V2.6-Flashのチェックポイントは2026年9月21日にモデルハブに公開され、MITライセンスで、ゲートは設けられていなかった。そのレポートは同じ日付で、投稿されたプレプリントサイトのトレンドリストの首位に達した。このタイミングこそ、これが回顧記事ではなくニュース記事である理由だ。論文は、すでに誰もがベンチマークしたモデルを後から説明するものではない。それは重みと同時に到着しており、シャオミ外部の誰かが独立した実行結果を公表する前に現れている。

Screenshot of the MiMo-V2.6 technical report page captured September 23, 2026, showing the title 'MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement', attributed to LLM-Core Xiaomi and dated 21 September 2026, with the author list and the opening of the abstract visible.

その順序づけは、証拠としてその論文の主な弱点でもある。そこから下流のすべて——DeepSWE曲線、合格率の向上、報酬ハッキングへの防御——は、一度だけ、一つのラボ内で、一つのクラスタ上で起きた訓練プロセスについての主張であり、ほかの誰も再現していない。その報告書を指摘したスレッドは、そこを面白い点として扱っている。これはデータと実験の論文であり、アーキテクチャの論文ではない。そして実験とは、再現するかしないかのどちらかである、まさにその種の結果なのだ。

スケーリングの3つの軸、そしてそのうちハードウェアの問題は1つだけ

その報告書の捉え方は、強化学習の計算資源が同時に3つの軸に沿ってスケールされたというものであり、そして3つ目の軸こそが、その手法に対する考え方を変えるものだ。

• バッチとスループット — 更新あたり1,568サンプル、それぞれ16回のロールアウトに展開され、その結果1ステップあたり約25,000の軌跡を生成し、最大100万トークンのコンテキスト長で1ステップあたり27億〜37億トークンを消費する。ロールアウトアーキテクチャは完全に非同期であり、それがこのバッチサイズをそもそも成立させている。

• 環境 — コード、汎用エージェント、視覚、サイバーの各タスクをまたぐ単一の混合実行を、複数のエージェントハーネス下で同時に行うもので、ドメインごとに個別のRL実行を行うのではない。Xiaomiのこれに対する独自の略称は「You Only RL Once」だ。混合する論拠は、ある能力の向上が他の能力を強化するという点にある。リスクは、遅いタスクタイプがスタベーションを起こすことだが、報告書によれば、これは適応型スケジューリングで対処している。

• グレーダー計算 — 通常の意味でGPUの話ではない軸。二値の合否では、どちらも合格する2つの解を順位付けできないため、報酬信号そのものがスケールさせる対象になる。エージェント型グレーダーは、あるタスクの16回の試行をまとめて比較し、1ビットではなく段階的な信号を生成する。

その第三の軸こそが、タイトルにある「自己改善」という言葉がその地位を得る場所であり、報告書が最も無防備になる場所でもある。モデルが自身のロールアウトを採点する行為は報酬ハッキングの攻撃面であり、報告書もそれをまさにそのように扱っている。

実際に理解する価値のある2つのメカニズム

グループ単位の優位性再分配

各ステップの後、ポリシーはタスクごとに16回の試行を生成し、それらはすべて共有ワークスペースに置かれるため、評価モデルは一度に1つずつではなくまとめて検討できる。次に、合格したパッチは5つの軸で採点される。アプローチが問題に適合しているか、実装が不要なフォールバックなしで正確か、変更が最小限か、スコープ外を編集していないか、周囲のコードスタイルに一致しているか、である。順位の低い合格には、より少ない正の強化しか与えられない。ハックであると確認されたパッチは0にリセットされ、失敗として扱われる。

その結果として、単に正確なものよりも、より短く、より安価な解決策へと促す学習信号が生じる——報告書はこれを、タスクあたりのトークン数を減らす方向への誘導と位置づけている。ここは押さえておくべき点だ。というのも、論文の後半にある主要な結果は逆の方向を示しているからだ。

グループ単位の報酬合成

同じアイデアのオフライン側です。品質をライブのグレーダーだけから導き出すのではなく、チームはタスク固有のルーブリックを事前計算し、二値のテスト報酬に、それらのルーブリックから得られる品質スコアと振る舞いスコアを掛け合わせます。報告書はこれを、対照的なロールアウト、つまり結果が異なったケースからルーブリックを構築することだと説明しています。そして、そこにこそ情報があります。

採点は無料ではない。報告書は、採点者コストをMiMo-V2.6-Proの強化学習総コストのおよそ12.7%と見積もっている。この一つの数字は、この手法を模倣しようと考える人にとって論文の中で最も有用なものだ。なぜなら、それは「採点者を増強せよ」をアイデアから予算上の費目へと変えるからである。

凍結されたルーターは、ほとんどのチームが真っ先にコピーする結果です

レポートの安定性セクションには、MiMo-V2.6とは無関係に、またモデルの性能の良し悪しにも左右されず、それ自体で成立する知見が含まれている。

訓練可能な mixture-of-experts ルーターでは、エキスパート負荷が20ステップにわたってひどくドリフトした。エキスパート間の変動係数は0.78から2.0へ上昇した。最も負荷の高いエキスパートのピーク負荷は、平均の6倍から16倍になった。コールドエキスパート——ほとんどトラフィックを受け取らないもの——の割合は0.5%から22%へ増えた。ステップ20でルーターの重みを初期値に戻すと、バランスは即座に回復した。

Xiaomiの対応は、その実行ではMoEルーターを凍結することだった。理屈は明白だ。このバッチ規模では、ルーティングの不安定さは、単に抱えないことを選べる学習ダイナミクスの問題であり、ルーターは強化学習がその仕事をしている場所ではない。凍結が最終品質に何かを犠牲にするかどうかは、公開されている資料のアブレーションでは答えられていない。そして、それを知りたいと思うのはもっともなことだ。

この知見が何も語っていないのは、サービングについてです。学習実行中のルーターの負荷分散と、本番トラフィック下でのエキスパート利用率は別の問いであり、報告書が扱っているのは前者だけです。

数字、それぞれのラベルが付いたもの

その報告書の見出しとなる結果は、形としてはすっきりしているが、細部は雑然としている。そしてその雑然さは不祥事ではない——同じ名前を共有する三つの異なる対象を、三つの異なる方法で測定した結果なのだ。

• DeepSWE v1.1(ホールドアウト)— MiMo-V2.6-Pro は実行を通じて 58.4 から 72.6 に上昇し、MiMo-V2.6-Flash は 48.7 から 65.7 に上昇しました。このベンチマークは、5 つのプログラミング言語にまたがる機能検証器によって判定される 113 の長期的なリポジトリエンジニアリングタスクであり、指標は average@3 — 3 回のサンプリングされた試行にわたる検証器の平均合格率であり、3 回のうちいずれか 1 回が成功したかどうかとは同じではありません。avg@3 を pass@3 として読むと、ページ上のすべての数値を過大評価することになります。

• 同じベンチマークを別の場所で測定した場合 — 公開されたモデルカードには Pro が 71.9、Flash が 67.9 と記載されています。Xiaomi の公開トレーニングダッシュボードには 72.57 と 65.68 が表示されていました。つまり、モデルごとに 3 つの公表値があり、そのうち 2 つは Xiaomi によるもので、その乖離の方向は兄弟モデルごとに異なります。どれも誤りではありません。それらは、異なる時点で、場合によっては異なるハーネスの下で取得された、ダッシュボードのスナップショット、カードの記載、レポートの一行をそれぞれ記述しているのです。

• 蒸留 — MiMo-V2.6-Distill-Qwen-9Bは、MiMoが生成したデモンストレーションでQwen3.5-9Bからファインチューニングされ、SWE-bench Verifiedを61.1から66.2に引き上げた。これは論文の中で最も転用可能な数値である。なぜなら、9Bの生徒モデルはほとんどのチームが実際に動かせる規模だからだ。

• 社内サイバーセキュリティのミニベンチマーク — 31.3から47.0。社内は文字通り社内を意味する。タスクは公開されていないため、その差分は原理的にさえ再現できない。

• Artificial Analysis Intelligence Index — MiMo-V2.6-Pro は46。これは種類が異なる。Xiaomiではなく、Artificial Analysisが公開チェックポイントに対して独自のハーネスを実行して生成したものであり、このリリースで読者が報告値ではなく実測値として扱える唯一の見出し数値となっている。また、GLM-5.3、Kimi K3、そしてクローズドなフロンティアと比較すべき数値でもあり、Claude Opus 5の5ポイント下に位置する。

A scoreboard card titled 'Published by Xiaomi vs verified from outside', subtitled 'Every headline figure in the report, and who stands behind it', with columns 'Dimension', 'In the report' and 'Independent status'. Rows read: DeepSWE v1.1, held out — 58.4 to 72.6 Pro; 48.7 to 65.7 Flash, average@3 — No third-party rerun; Released model card — 71.9 Pro; 67.9 Flash — Vendor-published; Public training dashboard — 72.57 Pro; 65.68 Flash — Vendor-published; Distill-Qwen-9B — SWE-bench Verified 61.1 to 66.2 — No third-party rerun; Internal cyber benchmark — 31.3 to 47.0 — Tasks not published; AA Intelligence Index — 46 for MiMo-V2.6-Pro — Measured by Artificial Analysis. A footer reads 'DeepSWE, card and dashboard figures are vendor-reported and have not been independently reproduced; the internal benchmark tasks are not published. The AA Intelligence Index is the one headline number produced outside Xiaomi.' The OrcaRouter logo is composited in the bottom-right corner.Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 23, 2026, showing an Intelligence Index of 46, an Intelligence versus Cost scatter placing MiMo-V2.6-Pro against Kimi K3, Claude Opus 5 and other frontier models, and a comparison table of the same models.

その報告書は自身の表の限界について正直であり、そうではない人に引用して突き返す価値がある一文はこれだ。比較は公開ベンチマークと内部ベンチマークを混在させており、強化学習の寄与をアーキテクチャや事前学習から切り離していない。RL後に優れたモデルは、RLがその理由だという証拠にはならない。

第二の注意点があり、これはその枠組みに逆行するものだ。報告されている向上は、一般にトークン使用量の増加を伴っている。報告書はそれを効率化ではなく、持続的な能力向上として提示しており、それは正しい。しかしGARは、より短い経路とタスクあたりより少ないトークンへと導くよう明示的に設計されていたが、集計結果は作業負荷が安くなっていることを示していない。能力は上がった。タスクあたりのコストは下がらなかった。「自己改善」を「来四半期にはモデルは私の資金をあまり必要としなくなる」という意味で読むなら、論文はその読み方を支持していない。

報告書が未検証のままにしているもの

2026年9月23日時点で、DeepSWE、Terminal Bench、CyberGymのいずれの列についても、第三者は独立した再実行を公開していない。重要な区別は、インデックス・ポイントとそれ以外のすべてとの間にある。46は他の誰かが行った測定値であり、72.6は誰にも再実行できないトレーニング実行に関する主張だ。というのも、その実行には報告によればProで260万ドル、Flashで90万ドルかかっており、二度行われることはないからだ。

Xiaomiが実際に公表したもののうち、ほとんどのラボが公表していないのは、トレーニング・ダイナミクス、強化学習フレームワーク、そしてタスク環境だ。ソフトウェアエンジニアリング、脆弱性の再現、ナレッジワーク、ウェブデザインにまたがる7,000以上の評価済み環境である。それこそが、最も長く価値を持ち続ける成果物だ。重みはその実行が何を生み出したかを教えてくれるが、環境は自分でその実験を走らせる方法を教えてくれる。RLに関する主張が決着するのは、その方法以外にない。

報酬ハッキング対策には、明確な留保を付すべきだ。それは多層的であると説明されている——報酬設計、敵対的評価、異常検知、検証者間の相互チェック——そして、そう説明しているのは、それが失敗すれば不名誉を被る当事者だけである。モデルがモデルベースの採点者を出し抜くことへの防御は、自己申告で決着がつくようなものではない。メカニズムは名指しされ、失敗モードも認められている。これは大半の論文が行う以上のことだが、それでもなお未解決の問題である。

これで今日実際にできること

両方のチェックポイントはダウンロード可能で、ゲートなし、MITライセンスタグ付きです。Xiaomi MiMo-V2.6-Pro-RL と Xiaomi MiMo-V2.6-Flash-RL は、オムニモーダルで、100万トークンのコンテキストを持ち、FlashインデックスではFP8で65シャードにわたる172.9 GBの重みデータが報告されています。XiaomiはV2.6世代のトークンあたりの料金表を公開していないため、今日の選択は、すでに支払っているホスト型モデルに対してセルフホスティングするかどうかです。

その比較こそがこの論文の実世界での価値が宿る場所であり、そしてそれは有益な形で論文にとって芳しくない事実を突きつける。検証対象の主張は「MiMo-V2.6-Pro は優れているか」ではない——それには46が答える。そうではなく「混合エージェントタスクでの強化学習は、自分のワークロードに転移する推論を生み出すか」であり、それに正直に答える唯一の方法は両方を動かして比較することだ。そしてそれは研究上の問題である前に、ルーティングの問題である。DeepSeek-V4.1-Flash は API キー一つで到達でき、100万トークンあたり0.15ドルと0.60ドル、Qwen3.8-Flash と GLM-5.3-Flash も同じキー上にある。そして、セルフホストした MiMo のチェックポイントを同じエンドポイントの背後に一週間置いて、DeepSWE の曲線が自分の評価にも現れるかどうか確かめたいなら、それは移行ではなく設定変更で済む。OrcaRouter は Xiaomi のモデルをホストしていないし、ここにある記述をそう主張するものとして読むべきではない——だが、それらをベンチマーク比較する相手のモデルはいずれもOrcaRouter の API キー一つで、プロバイダーの定価のまま、マークアップ0%でパススルーされる価格で到達可能であり、トライアル中のチェックポイントが負荷時に不安定だと判明した場合には自動フェイルオーバーも働く。

未検証モデルのケースこそ、フェイルオーバーがまさに想定して造られたものだ。2日前に公開されたチェックポイントで、ベンダーが実施した評価があるだけで独立した再実行がないものは、まさに本番経路をその後ろに置かずに試したい対象そのものだ。

この論文は誰が読むべきか

ポストトレーニングを回しているなら、ルーターに関する知見とグレーダーコストの数値のところだけは読んでおくといい。どちらも他所に持ち出せる話で、どちらも検証は安く済み、そしてどちらもMiMo-V2.6のベンチマーク表を信じるかどうかとは無関係だ。とりわけフローズンルーターの結果は、試すのに午後ひとつ分しかかからず、1回分の実行を節約してくれる類のものだ。

モデルを選ぼうとしているなら、インデックスの数値だけ読んで残りは飛ばしてください。Artificial Analysisは公開された成果物で46を計測しました。これは今回のリリースでベンダー由来ではない唯一の数値であり、MiMo-V2.6-Proをオープンウェイト分野の最高位に置き、Claude Opus 5の5ポイント後方に位置づけています。レポートの他のすべては、Xiaomiがそこに至った方法を説明しており、Xiaomiがそこに至った方法はお金では買えないものです。

そして、論文ではなく報道記事を読んでいるなら、注目すべきは「自己改善」という言葉だ。報告書自体の結果は、トークン使用量とともに能力が上昇することを示しており、これは強化学習のスケーリングに関する現実的で再現可能な知見である。これはモデルの実行コストが安くなったという主張ではなく、最終的にそうなるかどうかを教えてくれるのは、この論文に続く論文たちである。