OrcaRouterのモデルレーダーのヒーローカード。見出しは「MiMo-V2.6-Flash vs MiMo-V2.6」、サブタイトルは「1つのシリーズ、2つのチェックポイント、そして二役を担う名前」。左パネルはMiMo-V2.6-Flashで、合計309B/アクティブ15B、FP8ウェイト172.9 GB、Efficiencyチェックポイント。右パネルはMiMo-V2.6-Proで、合計1.02T/アクティブ42B、「フラッグシップを指して書かれる名前」、同じMITライセンス。下の3つのバッジは「2026年9月21日公開」「1Mトークンのコンテキスト主張」「呼び出せるXiaomiエンドポイントはない」。
Guides & Insights

MiMo-V2.6-Flash 対 MiMo-V2.6:1つのシリーズ、2つのチェックポイント、そして二役を担う名前

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

MiMo-V2.6とは何かと2人に尋ねれば、2つの異なるモデルという答えが返ってくるかもしれません。Xiaomiが2026年9月にリリースしたのは、公開された2つのチェックポイントを擁するシリーズです——MiMo-V2.6-Flashは3090億パラメータ、MiMo-V2.6-Proは1.02兆パラメータ——そして、素の名称MiMo-V2.6はファミリー全体を指すのにも、ほとんどの報道では同世代の最上位ティアを指すのにも使われます。つまり、「MiMo-V2.6-Flash vs MiMo-V2.6」という見出しのページは、実質的には効率重視のチェックポイントと、人々がフラッグシップを意味するつもりで書く名前との比較なのです。両チェックポイントは2026年9月21日、18秒差でHugging Faceに登場し、どちらもMITライセンスを採用しており、どちらもまずダウンロードして使うタイプです——呼び出せるXiaomiのエンドポイントはありません。それ以外に両者が共通する点はほとんどありません。

それは通常の命名をめぐる些末な議論以上に重要なことだ。というのも、この2つは後から順に上がっていけるようなサイズのはしごではないからだ。両者は別々のトレーニング実行であり、別々のベンチマーク表、別々のメモリ使用量を持ち、そして——公開された数値が示すように——小さい方が完全に勝っている箇所もいくつかある。

2つのチェックポイント、公開された1分

リポジトリは、15:39:51 UTC に作成された XiaomiMiMo/MiMo-V2.6-Flash-RL と、15:39:33 UTC に作成された XiaomiMiMo/MiMo-V2.6-Pro-RL です。どちらもゲート付きではありません。両方とも技術レポートとモデルカードを添付しており、Xiaomi によれば、どちらも、コーディング、汎用エージェント、視覚、サイバーセキュリティの各タスクを、ドメインごとの個別実行ではなく1回のトレーニングパスに織り込んだ、単一の混合強化学習実行の成果物であると説明されています。

• パラメータ — MiMo-V2.6-Flash:総パラメータ数309B、トークンあたり15Bを活性化。MiMo-V2.6-Pro:総パラメータ数1.02T、42Bを活性化。いずれもスパースなMixture-of-Expertsです。

• バックボーン — Flashは48層、39のスライディングウィンドウと9のフルアテンション、隠れサイズ4096、256のルーテッドエキスパート(8がアクティブ)、128トークンのスライディングウィンドウ、共有エキスパートなし。Proは同じハイブリッドアテンションのアイデアを、はるかに大きな幅で実行します。

• モダリティ — どちらもネイティブなオムニモーダルであり、テキスト、画像、動画、音声を、3つの継ぎ合わせたパイプラインではなく1つのモデルに取り込む。Flashは681Mパラメータの視覚トランスフォーマー、308Mの音声トークナイザー、127Mの音声パッチエンコーダーを搭載している。

• コンテキスト — 1Mトークン。両方で主張されており、その設定は1,048,576トークンの最大位置埋め込みを裏付けている。

• ライセンス — 両方ともMITで、収益閾値なし、通常を超える利用規約のゲートなし、研究条項なし。商用展開、変更、再配布はすべて許可されています。

• 重みファイル — Flashは172.9 GBのFP8重みデータを65個のシャードに分けて公開しています。Proはパラメータ数がおよそ3倍なので、自分で量子化を適用する前のダウンロードサイズは0.5テラバイト級になります。

• どこで提供されているか — Hugging Face、Xiaomi 独自の API プラットフォーム、AI Studio、MiMo Code、そして MiMo デスクトップアプリ。このカードは、どちらのチェックポイントも現在 Hub 上でサードパーティの推論プロバイダーによってデプロイされていない点を指摘している。

人々にハードウェアを失わせる衝突

この組み合わせにおける混乱は、実のところFlashとProの間にあるのではありません。MiMo-V2.6-Flashと、その前に登場したモデルとの間にあるのです。

MiMo-V2-Flashは2025年12月にリリースされ、それを発表したXiaomi自身のブログ記事は、総パラメータ数3,090億、アクティブ150億のmixture-of-expertsモデル、スライディングウィンドウとフルアテンションを交互に配置するハイブリッドアテンション方式、そして攻撃的な128トークンのスライディングウィンドウを説明している。それを上の箇条書きと照らし合わせて読んでほしい。2026年のチェックポイントと2025年のチェックポイントは、同じ見出しの形、同じスライディングウィンドウサイズ、同じアクティベーションバジェットを持っている——9か月の隔たりがあり、異なるトレーニング実行によるもので、能力もベンチマーク表も異なる。

「MiMo V2.6 Flash」を検索すると、MiMo-V2-Flash に関するページが平然と出てきます。しかも、古いモデルに属する 256K コンテキストという数値と、入力トークン100万個あたり0.1ドルという価格まで付いてきます。ノードのサイズを見積もっているなら、これは見た目だけの誤りでは済みません。古いチェックポイントと新しいものは別々のダウンロードで、サービングレシピも異なります。そして新しいものはコンテキストが4倍だとうたっています。

命名には、もう1つ、より静かな罠がある。どちらのリポジトリも -RL で終わっており、これは他のベースモデルの上に載った強化学習アダプターのように読める。だが、それらはアダプターではない。この接尾辞はポストトレーニングの系統を示している。つまり、ストリーミング RL 実行から出てきた完全なチェックポイントである。重みインデックスがそれを裏付けている — バックボーン全体、視覚エンコーダ、オーディオスタック、投機的ドラフターをカバーする数万のテンソルである。

ベンダー自身の表が示していること

このセクションのすべての数値は、2つのモデルカードにあるXiaomiの評価表に由来している。Xiaomiは自社のチェックポイント上でハーネスを実行した。そのいずれもラボの外で再現されたことはなく、公開リーダーボードに現れることもなく、比較列は、他社のモデルに対して同じハーネスをベンダー自身が実行した結果である。ランキングは参考程度に、小数点以下は飾りとして扱ってよい。

• コードエージェント — DeepSWE v1.1: Flash 67.9、Pro 71.9。Terminal Bench 2.1: Flash 87.6、Pro 89.9。ProgramBench: Flash 26.0。MiMo Code Bench: Flash 61.2。

• 汎用エージェント — AutomationBench v1.0.6:Flash 52.3、Pro 53.1。Toolathlon-Verified:Flash 73.6、Pro 76.9。OSWorld-Verified:Flash 80.8、Pro 82.0。Agents' Last Exam:Flash 27.6。Terminal Bench 4.0:Flash 28.8。

• サイバーセキュリティ — 小型モデルがリードする唯一の列。CyberGym:Flash 95.1 対 Pro の 94.0。MiMo Cyber Bench:Flash 77.2。すると底が抜ける:ExploitGym 6.0、ExploitBench 25.3、SEC Bench Pro 47.5。

• ビジュアルエージェント — MiMo VisualCoding: Flash 71.5、Pro 72.3。

箇条書きを上から読み下していくと、正直な要約はこうだ。Proはほぼすべての項目で小差ながら先行しており、その差は自前で実行したハーネスのノイズに埋もれるほど小さい。DeepSWEでは、Xiaomi自身の2つの評価間で同じチェックポイントが2ポイント動いたスケール上で、両者は4ポイント差だ。

最後の点は、それだけで一段落を割く価値がある。どちらのカードにとっても、これが最も有用な事実だからだ。Xiaomiの公開RLダッシュボードは、9月まで両方のトレーニング実行を配信していたが、そこではFlashを65.68として公表していた——mini-swe-agentハーネスを用いたDeepSWE v1.1での3回平均である。完成したカードには67.9が公開ウェイトについて記載されている。一方、Proのダッシュボード上の数値は72.57で、そのカードには71.9と記載されている——下がっているのだ。同じ実行から得た2つのチェックポイントを2回評価したわけだが、その2回の評価の差は、2つのモデルの差と同じ大きさだ。先週からダッシュボードの数値を引用しているなら、それらはトレーニングのスナップショットを表しているのであって、今日ダウンロードする成果物を表しているのではない。

Scoreboard card headed 'MiMo-V2.6-Flash vs MiMo-V2.6-Pro', with paired rows for parameters (309B total / 15B active against 1.02T total / 42B active), weights on disk (172.9 GB FP8 across 65 shards against about three times Flash), DeepSWE v1.1 (67.9 against 71.9, with the RL dashboard's earlier 65.68 and 72.57 noted), CyberGym (95.1 against 94.0), independent score (None published against an Artificial Analysis Index of 46 at 134.3 output tokens per second) and price, plus a sourcing footer stating that every benchmark is Xiaomi's own run except the Pro index score.

どちらもルーター上にはありません

ここが、実際の評価のほとんどを左右する部分だ。Xiaomiはどちらのチェックポイントも販売していない。MiMo-V2.6世代について自社サイトで公開されたトークン単価はなく、どちらについても発表された呼び出し可能なモデル識別子もない。代わりにあるのはダウンロードであり、さらに——Proのみについて——Artificial Analysisが、100万入力トークンあたり$0.435、100万出力トークンあたり$0.87で提供していると数えている単一のAPIプロバイダーだ。それはベンダーの料金表ではなくプロバイダーの掲載情報であり、Flashにはまったく比較できるものがない。第三者カタログページに出回っている数字も、同じように読むべきだ。

つまり、Flash と Pro のどちらを選ぶかは、異なるメーターを持つ2つのエンドポイントの間で選ぶことではありません。それは2つの GPU 請求額の間の選択であり、小さいほうは大きいほうのおよそ3分の1です。これこそが Flash の商業的な主張のすべてであり、ベンチマーク表が示すよりも強いものです。なぜなら、ほとんどの人が購入目的としているタスクでは、両モデルは数ポイントしか違わないからです。

そうして残るのは、おなじみの三択だ。フロンティアを借りるか、小型モデルを自前で持つか、大型モデルを自前で持つか。フロンティアの列こそ、Xiaomi が自社の表で比較対象にしている列だ——Claude Opus 5GPT-5.6 SolClaude Fable 5 はいずれも、ベンダー自身の比較で DeepSWE 上の Pro より数ポイント高く、しかもこの3つは今日OrcaRouter 上の1つの API キーから、プロバイダーの定価、つまり0%のマークアップをそのまま乗せた価格で呼び出せる。これが目の前の具体的な判断にとって重要なのは、ベンダーの価格改定が次回の契約更新時ではなくその日のうちにあなたの側へ反映されるため、ホスト型の価格が動いても「借りるか自前で持つか」の損得勘定が正直なままでいられるからだ。自動フェイルオーバーがあれば、まだ評価中のモデルを本番経路に単独で載せておく必要もない——あなたが判断を下すその間も。

今日どのルーターでもできないこと——当社のものも含めて——は、MiMo-V2.6-FlashやMiMo-V2.6-Proを呼び出すことです。当社はXiaomiのモデルを一切ルーティングしておらず、Xiaomi自身のカードにある可用性の記載は、Xiaomi自身のチャネル、つまりMiMo APIプラットフォーム、AI Studio、MiMo Code、デスクトップアプリを指しています。

どのチェックポイントで、いつですか

MiMo-V2.6世代を求めていて、ハードウェアが制約条件なら、MiMo-V2.6-Flashを選べ。フラッグシップと比べると、DeepSWEスコアをおよそ4ポイント、ほとんどのエージェントベンチマークで1〜2ポイント失う。その代わりに、メモリが約3分の1のチェックポイントが得られ、Xiaomi自身の表ではCyberGymでProを上回り、同じライセンス、同じ100万トークンのコンテキストという主張、同じマルチモーダル性を共有している。サイバーセキュリティ評価作業を行うチームにとって、そのCyberGymの列は丸め誤差ではない。

ワークロードがコーディングや長期的なエージェント作業で、そのノードの費用がすでに支払い済みなら、MiMo-V2.6-Proを選んでください。ほぼすべての項目でより優れたモデルであり、Artificial Analysisが実際に測定したものでもあります——再調整されたv4.3スケールでのIntelligence Indexは46、オープンウェイトクラス114モデル中第1位、出力は毎秒134.3トークン、価格は入力100万トークンあたり$0.435、出力100万トークンあたり$0.87として掲載されています——そして本番運用を計画しているなら、ベンダーの表よりも独立した測定のほうが価値があります。

要約ではなく設定ファイルを読むまでは、どちらも鵜呑みにしてはいけない。Flash のカードには、1パスあたり7トークンを予測する5層の投機的ドラフターが記載されているが、同じリポジトリの config.json はnum_nextn_predict_layersを3に設定している。カードの要約は、ランタイムが読み取る内容ではない。そしてリポジトリページの Safetensors ブロックは、Flash で159B、Pro で524Bのパラメータを報告しているが、どちらも各モデルカードの合計ともアクティブ数とも一致しない。Xiaomi はこの不一致を説明していない。パラメータがどう数えられるかに関わらず、VRAM で代金を払うのはこの数値なのだから、公表された重みデータからサイズを判断せよ。

Screenshot of the Hugging Face model page for XiaomiMiMo/MiMo-V2.6-Flash-RL, showing the MIT licence and multimodal tags, the model card heading 'Scaling Reinforcement Learning Toward Self-Improvement', a Safetensors block reporting a 159B model size, and an inference-providers panel stating that the model is not deployed by any inference provider.

それを解決するものは何だろう

3つの点を、おおよそ有用な順に挙げる。同じハーネス上での第三者による実行——DeepSWE や Terminal Bench、自己申告ではなく提出されたもの——があれば、Flash と Pro の間の4ポイント差が実際の地位なのか、それとも好都合な構成なのかがわかるだろう。公開された価格表があれば、比較全体はハードウェアプロジェクトから、ホスト型フロンティアの横に並べられる明細項目になるだろう。そして、Xiaomi がオープンソース化すると述べた RL 環境は、ほとんどのチームが実際に欲しがる成果物だ。なぜなら、自分のトレース上でそのループを再現するために必要なものだからだ。

それまでの間、実用上の読み方は限定的だ。{{1}}MiMo-V2.6{{/1}} は1つではなく2つのチェックポイントであり、名前だけが使われる場合は通常、高価なほうを指す。今日このシリーズの中から選ぶなら、正直なところ既定は {{2}}Flash{{/2}} だ。ただし、あなたが特に重視するベンチマークの列が別のことを示している場合を除く。そして、ノードを購入する準備ができていないなら、どちらもまだ正解ではない。

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro, showing an Intelligence Index of 46 on the updated scale, ranked first of 114, output speed of 134.3 tokens per second, a price of $0.435 per million input tokens and $0.87 per million output with a 99% cache discount and $0.13 cost per Intelligence Index task, a 1M-token context window, and 1.02T total with 42B active parameters under the MIT licence with weights on Hugging Face.