「MiMo-V2.6-Pro vs MiMo-V2.6-Flash」という見出しのヒーローカード。サブタイトルは「3倍の価格差、そしてそれを説明しないもの」。2つのパネルがあり、左パネルは「MiMo-V2.6-Pro」という見出しで「1Mあたり$0.435 / $0.87」と「42Bのアクティブパラメータ」、右パネルは「MiMo-V2.6-Flash」という見出しで「1Mあたり$0.14 / $0.28」と「15Bのアクティブパラメータ」と表示。その下のフッターには「両方ともMITライセンス · 両方とも1Mコンテキスト · インデックスはProのみ公開」とある。
Guides & Insights

MiMo-V2.6-Pro 対 MiMo-V2.6-Flash:2つのベンチマークでは説明できない3倍の価格差

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Xiaomi自身の評価表では、MiMo-V2.6-FlashがMiMo-V2.6-Proを上回っている。その行はCyberGymで、差は95.1対94.0だ。15行のうちの1行にすぎないが、だからこそ、フラッグシップが常に答えだと決めつけず、この比較の残りを注意深く読むべき理由がここにある。というのも、MiMo-V2.6-FlashのコストはMiMo-V2.6-Proのおよそ3分の1で、ほとんどの行では両者は数ポイント以内の差に収まっているからだ。

両モデルは2026年9月21日、MITライセンスの下、Hugging Faceリポジトリとして18秒差で公開された。一つの梯子の段ではなく、別々のトレーニング実行としてである。Xiaomi MiMo-V2.6-Proは1兆パラメータのティア。MiMo-V2.6-Flashは効率性ティアだ。このページが答える問いは、どちらがあなたの本番パスに載るべきかであり、正直な答えはどちらのリリースにも存在しない数値に依存する。

それぞれが何か

• パラメータ — Xiaomi MiMo-V2.6-Pro は合計1.02T、トークンあたり42Bがアクティブ。対するXiaomi MiMo-V2.6-Flashは合計約309B、15Bがアクティブ
• アーキテクチャ — 両者ともネイティブなオムニモーダル入力に対応するスパースな混合エキスパート(MoE)。Flashは48層、39のスライディングウィンドウと9のフルアテンション、隠れ層サイズ4096、256のルーテッドエキスパート(8がアクティブ、共有エキスパートなし)、加えて681Mのビジョントランスフォーマー、308Mのオーディオトークナイザー、127Mのオーディオパッチエンコーダーを備えると記載されている
• コンテキスト — 両者とも1Mトークン、出力は両者とも最大128,000トークン
• ライセンス — 両者ともMIT、重みは両者ともゲートなし
• 価格 — Proは100万トークンあたり入力$0.435、出力$0.87。対してFlashは$0.14と$0.28。カードの両側で3.1倍の差
• キャッシュヒット入力 — Proは100万トークンあたり$0.0036、Flashは$0.0028
• トレーニング費用 — Xiaomiの報告によると、ProのRL実行で約$2.62M、Flashで$854K。それぞれ6日未満で完了し、30の強化学習ステップと約750,000のトラジェクトリを経ている
• 独立指標スコア — Xiaomi MiMo-V2.6-ProはArtificial Analysis Intelligence Index v4.3.2で46。MiMo-V2.6-Flashについては公表なし

最後の行こそ、覚えておくべきものだ。それより上の内容は、Proスコアを除いてすべてXiaomiの自己申告だ。

3倍の価格でほとんど何も買えない場合

XiaomiのTable 3は、このシリーズが学習に用いた各ハーネスにわたって両者を横並びで比較しており、長期的なエージェント作業においてはその差はわずかだ:

• DeepSWE v1.1 — Pro 71.9、Flash 67.9
• MiMo Code Bench — Pro 63.2、Flash 61.2
• AutomationBench v1.0.6 — Pro 53.1、Flash 52.3
• Toolathlon-Verified — Pro 76.9、Flash 73.6
• Terminal Bench 2.1 — Pro 89.9、Flash 87.6
• OSWorld-Verified — Pro 82.0、Flash 80.8
• JobBench — Pro 62.0、Flash 61.2
• MiMo Visual Coding — Pro 72.3、Flash 71.5
• CyberGym — Pro 94.0、Flash 95.1
• MiMo Cyber Bench — Pro 80.2、Flash 77.2

その列を上から見ていくと、旗艦の優位性はおおむね1〜4点で、1行は完全に負けている。67.9と71.9の差が、タスクが完了するか失敗するかの差になるワークフローなら、3倍の価格は安い。それが許容できる2つの回答の差でしかないワークフローなら、安くはない。こうした小数点以下の桁を伴うベンダーの表は、誤った精度を誘う——Xiaomiの外部でそれらを実行した者はいないし、社内評価のハーネスにおける2点差など、別の評価者や別のリトライ方針で動きうる範囲に十分収まる。

Two-column scoreboard headed 'MiMo-V2.6-Pro vs MiMo-V2.6-Flash — the scoreboard'. The left column, MiMo-V2.6-Pro, reads Active params 42B, Price $0.435 / $0.87, DeepSWE v1.1 71.9, CyberGym 94.0, ExploitGym 17.8, Independent index 46. The right column, MiMo-V2.6-Flash, reads Active params 15B, Price $0.14 / $0.28, DeepSWE v1.1 67.9, CyberGym 95.1, ExploitGym 6.0, Independent index none published. A footer reads 'All benchmark figures are Xiaomi's own runs; only the Pro index score is independent.'

たくさん購入する場所

ギャップが丸め誤差の議論では済まなくなる行が一群ある。それらはすべてセキュリティ作業だ:

• ExploitGym — Pro 17.8、Flash 6.0
• ExploitBench — Pro 47.9、Flash 25.3
• SEC Bench Pro — Pro 66.3、Flash 47.5
• Agents' Last Exam — Pro 31.6、Flash 27.6
• Terminal Bench 4.0 — Pro 34.9、Flash 28.8

ExploitGymでは、旗艦モデルはより安価なモデルの3倍で、これは価格と同じ倍率であり、SEC Bench Proでは1.4倍だ。このパターンは、42Bのアクティブパラメータを持つモデルを15Bのモデルと比べたときに予想されるものだ。部分点のない長い推論の連鎖を必要とするタスクは、追加のキャパシティが現れる種類のタスクであり、CyberGymが逆の結果になっているのは、2つの実行が同じものをサイズだけ変えて学んだのではなく、異なるものを学んだことを証明する例外だ。

つまりこの分割は、マーケティング上の区分ではなく、実際のワークロードの境界に対応している。成功基準が寛容な大量のエージェント作業——検索、分類、定型的な編集、再試行で挽回できる呼び出し——はFlashの領域だ。誤った答えが高くつき、部分的な答えに価値がない作業——エクスプロイト開発、セキュリティレビュー、多段階の状態を持つターミナルセッション——こそ、Proティアがその倍数分の価値を稼ぐ場所である。

存在しない数

MiMo-V2.6-FlashにはArtificial Analysisのモデルページがありません。その兄弟モデルにはあります。この非対称性はこのページで最も重要な点です。なぜなら、MiMo-V2.6シリーズ全体で唯一独立に測定された数値は、Xiaomi MiMo-V2.6-Proの隣にある46だからです。上記のすべてのFlashの数値は — それが勝利しているCyberGymの行を含め — Xiaomiのハーネス、Xiaomiのグレーダー、そしてXiaomiのオフライン実行から来ています。

これが一時的なものであるという合理的な見方もある。執筆時点でこのモデルは公開から1日しか経っておらず、サードパーティによる評価には時間がかかるからだ。また、これが構造的なものであるという合理的な見方もある。Flashはボリューム層向けであり、ボリューム層はベンチマークの注目を集めにくいからだ。いずれにせよ、今日の実用的な帰結は、Flashをそのファミリー外のものと比較する際に、Proを比較するときと同じ自信を持てないということだ。価格対品質の観点でFlashとXiaomi以外のモデルを選ぶ場合、あなたはベンダーが公表した数値と、他者が測定した数値を比較していることになる。

どちらのモデルカードにも、同じ2つ目の注意事項が記載されている。どちらのリポジトリも、いかなる推論プロバイダーによってもデプロイされていない——Hugging Face は各ページで明示的にそう述べており、Artificial Analysis は Pro について API プロバイダーを1社しか数えていない。当社はどちらのチェックポイントもホストしていないため、どちらも当社経由ではルーティングできない。両者への経路は、Xiaomi 自身のプラットフォームと、それらを取り扱うサードパーティのカタログである。

Screenshot of the Hugging Face model page for XiaomiMiMo/MiMo-V2.6-Flash-RL, showing the MIT licence tag and multimodal tags including 8-bit precision and fp8, a Safetensors panel reporting a model size of 159B parameters, an Inference Providers panel stating 'This model isn't deployed by any Inference Provider', a model tree listing one finetune and six quantizations, and a collection block headed MiMo-V2.6 holding three items.

ハードウェアで払うのであって、トークンではない

トークン単位の料金は、チェックポイントにかかるコストの半分にすぎず、この両者は料金表の上よりもディスク上のほうがはるかに大きく食い違う。MiMo-V2.6-Flashは、65個のシャードにわたって172.9 GBのFP8重みを公開している。Xiaomi MiMo-V2.6-Proは約3倍のパラメータを抱えており、量子化を一切施す前の生のダウンロードだけで0.5テラバイト級になる。しかも自身のリポジトリはSafetensorsモデルのサイズを524Bパラメータと報告しており、この数値は1.02Tの総数とも42Bのアクティブ数とも整合しない。

その差は意思決定の形を変える。172.9 GBのFlashは、小規模チームがレンタル容量上でセルフホストし、コモディティとして扱えるモデルだ。その約3倍のProはクラスターの判断となる——ローンチ前後の報道では、2つの学習実行はそれぞれ約4,000基と8,000基のH200相当GPUとされた。オープンウェイトを検討する理由が、トークン単位の支払いをやめる選択肢が欲しいということであれば、この2つのチェックポイントは、まったく異なる規模のコミットメントでその選択肢を提供する。

それらの中から選ぶこと

上記の注意点を踏まえてもなお残る原則は、ベンチマークの平均ではなくワークロードのクラスで選ぶことだ。やり直しても問題ないものにはFlash、やり直しで救われないものにはPro。そして実際に測定すること。あなたが本当に重視するベンチマークにおいて、どちらのモデルにも独立したスコアは存在しないのだから。

2つのチェックポイントを並べて測定することこそ、ルーターがモデル単位の契約にはできないことをする場面です。トラフィックの大半には安価なティアを充て、難しいケースだけを高価なティアへエスカレーションするというのは、このページと同じ判断を、書き換えではなく設定として表現したものです — そしてその構成こそが、ルーティング層が存在する理由そのものです。これは価格そのものにも関わります。当社はプロバイダーの定価を0%のマークアップでそのまま反映していますので、Xiaomiがどちらかのチェックポイントの料金を引き下げれば、当社側の数字も次の契約更新時ではなく当日に動きます。これは当社が取り扱うモデルに適用されます。MiMo-V2.6のペアに関しては、現時点では、お客様は依然としてXiaomiから直接購入されています。

それを解決するものは何だろう

2つのことがあれば、これは判断を要する問題から算術的な問題に変わる。MiMo-V2.6-FlashのArtificial Analysisページがあれば、両方のチェックポイントが、現在ProをIntelligence Indexタスクあたり$0.133に位置づけているのと同じタスクあたりコスト軸に載り、比較はおのずと解決する。セキュリティ・クラスター——ExploitGym、ExploitBench、SEC Bench Pro——の第三者による再現が行われれば、それらの行における3倍の差がモデルの性質なのか、グレーダーの性質なのかが確認できるだろう。

それまでは、Xiaomi MiMo-V2.6-Flash がほとんどのチームにとってほとんどの場合により良い買い物であり、Xiaomi MiMo-V2.6-Pro は、失敗が高くつく結果となる限られた種類の作業にとってより良い買い物である、という立場が擁護可能だ。Flash が勝る唯一の行はそのことを覆さない — しかし、フラッグシップの割増価格はワークロードについての主張であり、モデルについての主張ではないという有用なリマインダーではある。

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro, showing the Xiaomi attribution and 'Released September 2026', an Intelligence card reading 46 ranked #1 of 114, a Speed card reading 125.2 output tokens per second, a Cost card reading $0.435 in and $0.87 out per million tokens with a 99% cache discount and $0.13 cost per Intelligence Index task, and a Verbosity card reading 140M output tokens, with a technical specifications panel listing 1M context window, 1.0T total parameters, 42B active, MIT licence and weights on Hugging Face.