
Xiaomi MiMo-V2.6-Pro-UltraSpeed 対 Xiaomi MiMo-V2.6:同じチェックポイント、10倍の価格
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro-UltraSpeed と Xiaomi MiMo-V2.6-Pro は、2つのモデルではない。1つのモデルを2通りの方法で販売しているのだ。どちらも、Xiaomi が2026年9月に公開した同一の1兆パラメータの MiMo-V2.6 チェックポイントから提供されている。これは Xiaomi MiMo-V2.6 シリーズの Pro ティアであり、その下位にあたるのが Xiaomi MiMo-V2.6-Flash だ。この2つの Pro 向け提供形態の違いは、トークンがどれだけ速く出てくるか、そしてそれにいくら支払うかだけにある。標準ティアは入力100万トークンあたり $0.435、出力100万トークンあたり $0.87 だ。UltraSpeed ティアは $4.35 と $8.70 を求める。これはメーターの両側で見事に10対1であり、それによっておよそ10倍の出力速度という主張が買える——Xiaomi が自社のサービングスタックについて述べている主張であり、まだどの独立系ベンチマークも数値を公表していないものだ。
だから興味深い問いは、どちらのモデルが優れているかではない。10倍の速度に対して10倍の価格が妥当なのかどうかであり、それに本番環境の道筋を委ねる前に、読む価値のある前例が実はあるのだ。
高速ティアはサービング上の決定であり、モデルの決定ではありません
Xiaomi自身によるUltraSpeedラインの位置づけは、品質は標準モデルと同等で、異なるのはスループットだけだというものだ。これは聞こえ以上に重要だ。というのも、新しいティアに二の足を踏むいつもの理由を取り除いてくれるからだ。あなたは別のチェックポイントの性格や拒否挙動、フォーマットの癖に賭けているのではない。同じ重みを、より積極的なサービング構成で動かしたときに、あなたのプロンプトに対して同じ振る舞いをするということに賭けているのだ。それが成り立つなら、2つのティア間の切り替えは移行ではなく、設定変更である。
そのサービング構成の内部は、この世代については文書化されていない。以前のUltraSpeedティアは、2026年6月のMiMo-V2.5-Proチェックポイント上に構築され、Xiaomiによれば、エキスパート層のみにFP4量子化を用い、DFlashと呼ばれるブロック並列の投機的デコーディング方式と、TileRTと呼ばれるランタイムを採用しており、単一の8GPUノードで動作していた。XiaomiはV2.6ティアについて同等の詳細を公開していない。以前のスタックは、速度がどのように得られているかの背景として扱い、現在動作しているものの説明として扱わないでください。
それが名を連ねるラインナップは短い。2つのProティアに並ぶのは、総パラメータ3,090億、アクティブ150億の小型モデル、MiMo-V2.6-Flashだ。ProはスパースなMixture-of-Experts(専門家混合)のフラッグシップである。Artificial Analysisは、総パラメータ1.0兆、トークンあたりのアクティブ420億、100万トークンのコンテキストウィンドウ、Hugging Face上に重みを置くMITライセンスとしてこれを掲載している。これらの数値はしっかり覚えておくべきだ。なぜなら比較全体がそれらに基づいているからである。
実際に検証されていること、そしてされていないこと

上の2つの列の間の非対称性は、この記事の中で最も重要な唯一の事柄です。このペアリングについて測定可能なほぼすべては、slow側で測定されてきました。
Artificial AnalysisはMiMo-V2.6-Proをベンチマークし、同モデルに対してIntelligence Index 46を公表している。これは、同モデルを分類した114モデルクラスにおける最高スコアだ。XiaomiのAPIを通じて毎秒134.3出力トークンを計測しており、クラス中央値は77.9、最初のチャンクまでの時間は2.15秒で、中央値は2.34秒となっている。Intelligence Indexタスクあたりのコストを0.13ドル、入力価格に対する99%のキャッシュ割引、出力の冗長性を1億4,000万トークンと記載している。これらは名前が明示された構成における独立した数値であり、この比較が持つ唯一の確固たるスループットの基準点である。
UltraSpeedの場合、検証済みリストはずっと短くなっています:
• 出力速度 — 標準ティアの約10倍。Xiaomiが公表しており、これを掲載する各プラットフォームも同様に伝えている。この特定のティアについて、第三者による毎秒トークン数の測定値は公表されていない。
• 価格 — 入力トークン100万個あたり4.35ドル、出力トークン100万個あたり8.70ドルで、いずれも標準ティアの10倍に当たります。これら2つの料金にはキャッシュティアの記載がありません。
• 品質 — 「オリジナルと一致する」、これもまたベンダーによる主張にすぎない。UltraSpeedエンドポイントについて独立した評価は公表されていないため、品質が変わらないという主張は、反証されたというよりも検証されていない。
• コンテキストとモダリティ — 1,048,576トークンのコンテキスト長と、ネイティブのテキスト、画像、動画、音声入力。ベースチェックポイントから継承。
また、その広まり方ゆえに正確に名を挙げる価値のあるベンダーベンチマークもある。Xiaomiの公開強化学習ダッシュボードは、2026年9月にV2.6のポストトレーニング実行をライブ配信したもので、DeepSWE v1.1のスコアとして、Pro実行で72.57、Flashで65.68を報告している。これらは、mini-swe-agentハーネスを用いた3回平均によるXiaomi自身のオフライン評価から得られたものであり、公開リーダーボードには一度も提出されておらず、ラボの外で再現されたこともない。もし72.57がリーダーボードスコアとして引用されているのを見かけたなら、それはリーダーボードの衣をまとったベンダーの数字だ。

前例では、前回Xiaomiは10倍ではなく3倍を請求した
これはXiaomiにとって初めてのスピードティアではなく、前回のものがこの話全体の中で最も有用な比較対象だ——なぜなら倍率が変わったからである。
MiMo-V2.5-Pro-UltraSpeedは2026年6月に登場し、V2.5-Proチェックポイントを基に構築され、価格は標準モデルの出力レートの約3倍に設定されていた。当時のXiaomiの触れ込みは、今もしている触れ込みと同じだった。出力速度が約10倍というものだ。当時の報道では、単一の8-GPUノード上で毎秒約1,000トークンの持続スループット、ピーク時には約1,200トークンに達すると報じられていたが、モデルページ自体にはより広い500~1,000の範囲が記載されていた。しかも、そのいずれも独立した検証はされていなかった。アクセスは自由なサインアップではなく、申請フォームによって制限されていた。
二つを並べて見れば、その変化こそが物語だ。速度の倍率はおよそ10倍のままだった。価格の倍率は3倍から10倍へ動いた。同じ種類のアップグレードに対して、これはかなり異なる条件であり、Xiaomiはこの変更についての説明を公表していない。実際により高コストなサービングを反映している可能性がある——より大きなチェックポイント、より積極的なデコード設定、あるいはローンチ時のより厳しいキャパシティなどだ。提供開始からまだ1日しか経っていないティアにおけるローンチ期間の価格設定を反映している可能性もある。まだ欠けているのは、確認できる公的な正当化だ。
V2.5ティアを使ったことがある人には、実用的な違いを1つ指摘しておく価値があります。それは承認制の試用版でした。V2.6ティアは、Xiaomi自身のAPIおよび複数のサードパーティ製プラットフォームを通じて、公表されている料金で、申請手順なしに一般提供されていると記載されています。ほかに何が変わったとしても、試すまでのハードルは下がりました。
実際のワークロードで10倍が何を犠牲にするか
割合ではこの形が見えなくなるので、具体的なエージェント実行——そのライフサイクル全体で2,000万の入力トークンを読み、200万の出力トークンを生成するもの——について計算を示します。これは重いものの、珍しいものではないエージェント型ワークロードであり、モデルがツール呼び出しをループし、自身のコンテキストを再読するような種類のものです。
• スタンダードティア、入力 — 20Mトークン、100万トークンあたり$0.435:$8.70。
• スタンダードティア、出力 — 100万トークンあたり$0.87で200万トークン:$1.74
• スタンダードプラン、合計 — 1回あたり$10.44
• UltraSpeedティア、入力 — 20Mトークン、100万あたり$4.35:$87.00
• UltraSpeed ティア、出力 — 200万トークン、100万トークンあたり$8.70:$17.40。
• UltraSpeed ティア、合計 — 1回あたり $104.40
差額は$93.96で、これは請求額の10倍であって、請求内訳の1行分の10倍ではありません。どちらの料金も一緒にスケールするからです。では、帳簿のもう一方の側を見てみましょう。Artificial Analysisが標準ティアについて測定した毎秒134.3出力トークンでは、200万出力トークンを生成するのに、純粋な生成時間で4時間強かかります。その10倍の速度なら、約25分です。つまり、追加の$94で、この実行では実時間がおよそ3時間半短縮される計算になります——そう言いたければ、節約した1時間あたりおよそ$27です。
そのトレードが良いかどうかは、ウォールクロック(実時間)があなたにとってどれだけの価値があるかで完全に決まり、しかも素朴な読み方に反する厄介な点が1つある。標準ティアの入力価格には、Artificial Analysisのページ上で99%のキャッシュ割引が付いており、つまり同じコンテキストを再読込するワークロードでは、請求の入力側がほぼゼロまで縮み得る。UltraSpeedの掲載には、目玉となる2つの料金しかなく、キャッシュ階層がない。あなたのワークロードがキャッシュ多用型なら、実効倍率は10倍ではない——はるかに悪い。なぜなら、ほとんど何も払っていなかった側で割引を失うからだ。ワークロードが出力多用型でキャッシュ利用が少ないなら、10倍は実際の数字に近い。どちらの数字を信じる前に、自分のワークロード構成を測ろう。
オープンウェイトの非対称性
2つのティアの間には、価格や速度とは何の関係もない構造上の違いがあり、それはどちらよりも重要かもしれない。
MiMo-V2.6-ProはMITライセンスの下で提供され、重みはHugging Faceで公開されています。これにより商用展開、改変、さらなる学習が可能になり、標準モデルの価格にはどのベンダーも取り除けない下限が存在することを意味します。ホスト型の料金が割に合わなくなったら、チェックポイントを自分でホストできます。自社ハードウェアでXiaomiのスループットには及ばず、GPU代も払うことになりますが、その選択肢は存在し、ホスト型ティアが請求できる額に上限を課します。
UltraSpeedにはそのような下限がない。UltraSpeedの重みは存在しない。というのも、このティアはモデルではなくサービングスタックだからだ——チェックポイントはすでに公開されているものと同じで、あなたが借りているのはXiaomiがそれを高速に動かす能力である。それは売り物として正当であり、市場にある他のあらゆる速度ティアと同じ形をしている。とはいえ、それは10倍のレートに、同じオープンウェイトを動かす他のプロバイダー以外の競争上の歯止めがなく、価格が再び動いた場合にセルフホスティングという逃げ道もないことを意味している。

それを入手可能性の全体像と照らし合わせて読んでください。標準チェックポイントはXiaomi自身のチャネルと複数のサードパーティプラットフォームを通じて入手でき、さらにダウンロードも可能です。UltraSpeedティアはXiaomi自身のAPIと複数のサードパーティプラットフォームを通じて入手でき、それが入手する唯一の方法です。長期的な依存を検討している人にとって、この選択肢の多さの違いは、トークンあたりの料金と併せて評価する価値があります。
誰がどれを取るべきか
その判断は、コストのうちどれだけが出力トークンで、レイテンシ予算のうちどれだけがキューイングではなく生成なのかによって、明確に分かれる。
• ワークロードが出力中心でキャッシュが軽く、インタラクティブな場合はUltraSpeedを使いましょう — 長文生成、モデルがツール呼び出しの合間に大量の推論を書くエージェントループ、あるいはリクエストの向こう側で人間が待っているようなあらゆる場面です。
• ワークロードがキャッシュ主体、バッチ処理を許容できる、あるいは限界的なコストに敏感な場合は、標準ティアを選ぶ — 一括分類、固定コーパスに対する検索拡張型の回答生成、夜間の評価実行など、誰も見ていないから4時間かけて生成しても問題ないあらゆる用途。
• セルフホストの選択肢が必要な場合は、標準ティアを選んでください。コンプライアンス要件上、手元に保持できるウェイトが必要な場合、UltraSpeed はいくら払っても利用できません。
• 測るまではどちらも選ぶな。ここで要となる数字は10倍という主張であり、それは現時点ではベンダー側が述べているものにすぎない。自分のプロンプトを両方のティアで走らせる午後1回のほうが、公表されているどの数値よりも多くを教えてくれる。なぜなら、誰かが独立に検証した唯一のスループット数値は、比較の遅い側のものだからだ。
最後の点について言えば、サービング層をテストする仕組みはモデルをテストする場合と同じであり、まさにそこがルーティング層の存在意義を示す場面です。OrcaRouterは単一のAPIキーの背後で200以上のモデルを、プロバイダーの定価のまま0%のマークアップで提供しており。そのため、ベンダーの価格変更は次回の契約更新時ではなく、当日にあなたの側へ反映されます。自動フェイルオーバーにより、まだ評価中の層がそれだけで本番パスに載ることはなく、ルーティングDSLを使えば、ある種のリクエストは高速エンドポイントへ、それ以外はすべて標準エンドポイントへ送ることができ、2つの統合を維持する必要はありません。これらのどれもXiaomiのモデルに固有の話ではありません。要点は、このような層レベルの判断は、層が1つのキーの背後にあれば簡単に覆せるということです。
これを解決してくれるものは何だろうか
MiMo-V2.6-Pro-UltraSpeed 対 MiMo-V2.6-Pro という問いの正直な現状は、その半分が測定されたもので、半分が主張されたものだ。標準ティアには独立した Intelligence Index、独立したスループット値、そして公開されたオープンウェイトがある。高速ティアには価格、コンテキストウィンドウ、そして同じモデルがより高速に動いているというベンダーの約束がある。
三つのことがギャップを埋めるだろう。UltraSpeedエンドポイントでの独立したスループット測定——Artificial AnalysisはXiaomiのAPIを通じて標準ティアを測定したので、同じ扱いが可能であり、ただまだ行われていないだけだ。高速ティア向けのキャッシュポリシー——それが存在しないことが、キャッシュ負荷の高い作業で10倍の請求をさらに悪いものに変えてしまうからだ。そして、XiaomiがV2.5世代でFP4 experts、DFlash、TileRTを文書化したのと同じ形で、V2.6サービングスタックについて公開された詳細が何かあること。
それまでは、10倍の価格は現実であり、10倍の速度はあくまで主張にすぎない。あなたのワークロードが出力中心で、誰かが待っているなら、その主張は自分のプロンプトで試す価値がある——そして、もしそれが成り立たなければ同じ日の午後には元に戻せるレイヤーの背後で試す価値がある。
