
Xiaomi MiMo-V2.6-Flashが登場:自分で運用する309Bのオープンモデル
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiMo-V2.6-Flash がトレーニングジョブではなくなったのは、2026年9月21日 15:39 UTC、Xiaomi の MiMo チームがそのチェックポイントを XiaomiMiMo/MiMo-V2.6-Flash-RL として Hugging Face で公開した瞬間だった——ゲートなし、MIT ライセンス、テクニカルレポート添付、インデックスには65個の重みシャード。XiaomiMiMo/MiMo-V2.6-Pro-RL は18秒後に続いた。その1週間前、両モデルは公開トレーニングダッシュボード上で「stopped」と表示された2枚のカードにすぎず、それらについて広く繰り返されていたのは「重みは存在しない」という説明だった。今やそれらは誰でもダウンロードして提供できるファイルである。これはモデルで何ができるかという点における実際の変化であり、モデルに関する発表とは別物だ。
まずタイムスタンプから示す。なぜなら、このリリースはいつものベンダーの振り付けなしに到着したからだ。9月22日に確認したXiaomi自身のブログでは、2025年12月のMiMo-V2-Flashのローンチが依然として最新の投稿として表示されている。V2.6のローンチ記事も、新世代向けの公開価格表も、Xiaomiがどちらのチェックポイントについても発表した呼び出し可能なモデル識別子もない。存在するのは、リポジトリ、技術レポート、デプロイレシピ、ベンダーが実施したベンチマーク表の一式——そして、モデルカードにある、実際にこれをロードしようと考えている人にしか重要でない、意地の悪い小さなディテールだ。
{{1}}あなたが持つことができる{{/1}}{{2}}2枚のカード{{/2}}
両チェックポイントは、公称100万トークンのコンテキストを持つネイティブなオムニモーダルで、どちらもMITライセンスを備えている——商業利用可能、ファインチューニング可能、再配布可能で、収益ゲートも研究条項もない。モデルカードでは、Flashはこのシリーズの「効率バランス型チェックポイント」、Proはフラッグシップとされている。興味深いのは、マーケティングの一文ではなく設定を見たときに、この2つがどう異なるかだ。
• パラメータ数 — MiMo-V2.6-Flash は総計309Bで、トークンごとに15Bを活性化。MiMo-V2.6-Pro は総計1.02Tで42Bを活性化。どちらもスパースな混合エキスパート(MoE)構成です。
• Backbone — Flash は48層(39層がスライディングウィンドウ、9層がグローバルアテンション)、隠れサイズ4096、ルーティングされるエキスパート256個(うち8個が活性化)、128トークンのスライディングウィンドウ、共有エキスパートなし。最初のブロックは密なフィードフォワードネットワークを備えたグローバルアテンションで、それ以降はすべて交互に配置されます。
• エンコーダ — 681MパラメータのMiMo ViT(28層、24のスライディングウィンドウ+4のフル)、308Mのオーディオトークナイザー、127Mのオーディオパッチエンコーダー。これにより、テキスト、画像、動画、音声はすべて、3つの継ぎ接ぎパイプラインではなく同一のモデルに入る。
• 投機的デコーディング — 5層のマルチトークン予測ドラフターで、DFlashスタイル。カードでは、フォワードパスごとに7トークン先を予測し、並列検証を行うと説明されている。
• ストレージ — 公開されているインデックスによると、65 個のシャードにまたがる 172.9 GB の重みデータが、動的アクティベーション方式を採用した FP8(e4m3)で報告されている。これはパラメータあたりおよそ 9 バイトということになる。Xiaomi が出荷したのはノート PC サイズに量子化されたものではなく、あの巨大なモデルそのものだ。
一致しない3つの数字
これは率直に言っておく価値がある。なぜなら、その3つはいずれもベンチマークの議論ではなくデプロイの判断に影响するものであり、しかもどれも悪意のあるものではないからだ。それらは、解説記事、リポジトリのページ、そして出荷済みのファイルの間で生じたドキュメントのずれのように見える。
1つ目は投機的デコーダーです。モデルの概要には、MTPヘッドが1パスにつき7トークンを予測する5層のドラフターであると書かれています。config.jsonは同じリポジトリ内でnum_nextn_predict_layersを3に設定しています。両方の数値が同じアーティファクトを指しているはずがありません。そして、ランタイムが読み取るのは設定ファイルのほうです。投機的デコーディング向けにメモリを見積もる場合は、設定を信頼し、ロード後に検証してください。
2つ目はより微妙で、誤りというより、誤りに見える命名規則のようなものだ。リポジトリは MiMo-V2.6-Flash-RL と呼ばれており、モデルではなく強化学習アダプターであるという想定を誘う。それはモデルだ。-RL という接尾辞はポストトレーニングの系譜を示す — このチェックポイントは Xiaomi が配信した混合RL実行の出力であり、他の何らかのベースの上に載ったLoRAではない。重みインデックスがそれを裏付ける。完全なバックボーン、視覚エンコーダ、音声スタック、ドラフターをカバーする数万のテンソルである。
3つ目は、カードではなくリポジトリのページでハードウェアを見積もる場合に最初に目にするものだ。そのページのSafetensorsブロックは159Bパラメータと報告している。これはカードにある2つの数字のどちらでもない——合計の309Bでも、アクティブの15Bでもない——そして、ダウンロードボタンのすぐ隣にあるため、容量計画を立てる人が最もそのままコピーしがちな数字である。Xiaomiはこの違いを説明しておらず、外部からでは結論を出せない。最もありそうな解釈は、別のモデルではなく、量子化テンソルに対する数え方の慣習だというものである。安全な策は、代わりに公開されている重みデータから見積もることだ。65シャードにまたがるFP8の172.9 GBは、パラメータがどう数えられようとVRAMで支払わなければならない数字である。
ベンチマークが示すこと、そしてそれを実行したのは誰か
以下の数値はすべて、Xiaomi自身のモデルカード内にある評価表に由来しています。そのいずれも独立に再現されたものではなく、公開リーダーボードにも掲載されておらず、比較列はベンダー自身が同じ評価ハーネスを他社のモデルに対して実行した結果です。結果の全体的な傾向は参考情報として受け止め、小数点以下の桁は飾りと見なしてください。
• コードエージェント — DeepSWE v1.1: Flash 67.9、Pro 71.9 に対して、Claude Opus 5は74.0、GPT-5.6 Solは73.0、Claude Fable 5は70.0。Terminal Bench 2.1では、Flashは87.6で、Opus 5の89.1に対し — その差は、モデルではなくハーネスが決めている可能性があるほど小さい。
• 汎用エージェント — AutomationBench v1.0.6では、Xiaomiの実行でFlashが52.3となり、GPT-5.6 Sol(45.8)とClaude Opus 5(50.3)の両方を上回っています。Toolathlon-Verified:Flash 73.6、Pro 76.9、Opus 5 80.6。
• サイバーセキュリティ — 表の中で最も偏りの大きい列。CyberGym:Flash は 95.1 で、より大きな兄弟モデルである 94.0 を上回り、MiMo-V2.5-Pro は 40.0。そこから底が抜ける:ExploitGym は Flash が 6.0 に対し Opus 5 が 22.1、ExploitBench は 25.3 に対し 70.0、SEC Bench Pro は 47.5 に対し GPT-5.6 Sol が 79.1。
• ビジュアルエージェント — MiMo VisualCoding:Flash 71.5、Pro 72.3、Opus 5 70.0。
1つ取り上げる価値のある数字がある。それはローンチ記事がたいてい隠す類のものだからだ。XiaomiのRLダッシュボードは、Flashを65.68としてDeepSWE v1.1で公開した——そしてモデルカードは今、67.9と、完成したチェックポイントでの同じベンチマークについて記載している。これは同じ測定ではない。ダッシュボードの数値は、学習スナップショット上での mini-swe-agent、avg@3 とラベル付けられていた。カードの表は、リリースされた重みに対するベンダーのオフライン評価だ。2ポイントの差は、実行の最後の部分による向上分と、評価設定で変わった何かが合わさったものであり、Xiaomiの外部の誰も現時点でその2つを分離できない。先週から65.68を引用しているなら、それは別の成果物に対する、今では古い数字だ。

実際に運用するにはいくらかかるのか
オープンウェイトはライセンスであって、請求書ではない。そしてここから、このリリースはあまり祝祭的ではなくなっていく。モデルカードのデプロイ節では、SGLang(テンソル並列16、データ並列2、EAGLE方式の多層投機的パスを有効化)またはテンソル並列8のvLLMレシピを推奨し、安定版vLLMはアーキテクチャに遅れを取る可能性があると注記している。これは309Bモデルのマルチノードサービングジョブであり、その重みは1Mトークンコンテキスト用のKVキャッシュを追加する前の時点で約173GBを占める。推奨サンプリングはtemperature 1.0、top_p 0.95。
ここでの「オープンソース」という正直な捉え方はこうだ。Xiaomiはライセンスの障壁を取り除き、ハードウェアの障壁はまったくそのままの場所に残した。自分のトレース上でFlashをファインチューニングすることは今や合法かつ可能だが、本格的なGPUノードより小さいものでそれを行うことは可能ではない。それはホスト型エンドポイントとは異なる、実質的な提供であり、この世代の2つの利用法が競合しないのはそのためだ——それらは異なる予算をカバーしている。
ノードなしでその能力が欲しいなら、あの表で Xiaomi がベンチマークの比較対象にしているモデルが実用的な選択肢です。GPT-5.6 Sol、Claude Opus 5、Claude Fable 5 はいずれも現在呼び出し可能で、API キー 1 つで、プロバイダー表示価格のまま、OrcaRouter では 0% のマークアップでそのまま通過します。つまり、実際に下している判断は「ノードを買う」か「呼び出しを従量課金する」かです。どちらに決めるにしても、同じコーディングタスクで呼び出し可能な層がどう比較されるかを見たいなら、コーディングボードのほうがベンダーの表より手早く読めます。今日どのルーターでもできないのは、MiMo-V2.6-Flash 自体を呼び出すことです — 当社は Xiaomi のモデルを一切ルーティングしておらず、Xiaomi 自身のカードの可用性の行は Xiaomi 自身のチャネル、すなわち MiMo API プラットフォーム、AI Studio、MiMo Code、デスクトップアプリを指しています。

価格に関する問題はまだ未解決だ
XiaomiはMiMo-V2.6-Flashのトークンあたりの料金を公開していない。ローンチに関する報道では、このシリーズはMiMo-V2.5のAPI価格を維持するとされているが、それはベンダーの価格表ではなく報道側の主張だ——V2.5世代の公開されていた海外料金は、入力100万トークンあたり約0.1ドルで、キャッシュ済み入力は1桁安かったが、新しいチェックポイントがそれを継承していることをXiaomiのサイトで確認できるものは何もない。価格表が登場するまで、MiMo-V2.6エンドポイントについて目にする数字は誰かの推測にすぎない。
まだ足りないものが2つあり、どちらも他ならぬXiaomi自身のToDoリストに載っている。Luo FuliはRLのライブ配信で、トレーニング環境とRLコードをオープンソース化すると述べており、発表資料もその約束を繰り返している。だが、現在リポジトリで提供されているのは重み、技術レポート、デプロイ手順であり、トレーニングスタックは含まれていない。さらに、独立した評価もない。リーダーボードへの提出も、DeepSWEやCyberGymの列を第三者が再実行した結果もない。15Bのアクティブ予算を持つ309Bモデルがノード1台分の価値があるかどうかを判断する人にとって、最も重要なのはこのギャップだ。
何が状況を変えるでしょうか
注目すべきシグナルは3つあり、意思決定をどれだけ動かすかのおおよその順に並べると次のとおりです。価格表が公開されれば、これはセルフホスティングのプロジェクトから、ホスト型の最先端と比較できる一行の項目になります。同じハーネス(DeepSWEやTerminal Bench)での第三者による実行——自己申告ではなく提出されたもの——があれば、67.9が本当の位置づけなのか、それとも有利な設定なのかが決着します。そしてRL環境が実現すれば、ほとんどのチームにとってより興味深い成果物になるでしょう。なぜなら、自社のデータで自己改善ループを再現するために必要となるのは、まさにそれだからです。
それまでは、このリリースの実用的な読み方は限定的かつ明確だ。MiMo-V2.6-Flash は、正当なオープンウェイトで MIT ライセンスのオムニモーダル・エージェントモデルであり、クラスタを前提とする規模のものである。そして、MiMo-V2.6 世代で実際に手に取れる最初のチェックポイントであり、これは先週には言えたことではなかった。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
