
MiMo-V2.6-Pro 対 Kimi K3:2兆パラメータのオープンウェイト、タスクあたりのコストで14倍の差
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
どちらも中国のラボによるオープンウェイトのMixture-of-Expertsモデルで、100万トークンのコンテキストウィンドウを持つ。どちらもダウンロード可能だ。2026年9月22日時点のArtificial Analysis Intelligence Index v4.3.2では、MoonshotAIのKimi K3が44、XiaomiのMiMo-V2.6-Proが46。2点差。同じ評価スイートをそれぞれに対して実行した測定コストは、Kimi K3が$3,658.07、MiMo-V2.6-Proが$206.66 — 実に17倍の差だ。このクラスのオープンウェイトが欲しいとすでに決めているなら、判断を決めるのはその2点差ではなく、この比率である。
Kimi K3 はこの2つのうちでは定評あるモデルだ。2026年7月16日にリリースされ、7月27日には完全な重みが続いて公開され、すでに数か月にわたる独立した評価に裏打ちされている。Xiaomi MiMo-V2.6-Pro は2026年9月22日に一般提供が開始され、その強化学習チェックポイントのリポジトリは前日に登場した。したがってこの比較は、プレミアム価格の実績あるオープンモデルと、コモディティ価格の新品モデルの比較であり、興味深いのは、測定された能力差がどれほど小さかったかである。
各モデルの正体
Kimi K3は2.8兆パラメータのオープンウェイトなマルチモーダル推論モデルであり、リリース時には3兆クラス初のオープンモデルと説明されました。トークンあたり896個のエキスパートのうち16個を活性化し — 約1,040億のアクティブパラメータ — Kimi Delta AttentionとAttention Residualsを用いて100万トークンのコンテキストを効率的に保持し、リクエストあたり最大100万トークンを出力します。常時推論が可能で、ネイティブビジョンを備えています。MoonshotのファーストパーティAPIは、100万入力トークンあたり$3.00、100万キャッシュ済み入力トークンあたり$0.30、100万出力トークンあたり$15.00で、コンテキスト長による階層化はなく一律です。また、Artificial Analysisは90%のキャッシュ割引と$2.31のブレンドレートを報告しています。測定値は毎秒42.8出力トークン — 同規模のモデルの中央値77.9に対して著しく遅い — で、最初のトークンまで3.93秒でした。
Xiaomi MiMo-V2.6-Proは、総パラメータ数1.02兆、トークンあたり420億が活性化されるスパースなMixture-of-Expertsモデルで、100万トークンのコンテキストウィンドウと、テキスト・画像・動画・音声にまたがるネイティブなマルチモーダル性を備えている。その重みにはMITライセンスタグが付いている。Xiaomiは新しいチェックポイントの価格を引き上げて再設定するのではなく、前世代の価格を維持した。そのため、100万入力トークンあたり$0.43、100万出力トークンあたり$0.87、99%のキャッシュ割引付き、ブレンド価格$0.18で表示されている。計測値は毎秒134.3出力トークン——速度では114モデル中11位——で、初回トークンまで2.15秒だった。
• アクティブパラメータ — MiMo-V2.6-Pro はトークンあたり42B、Kimi K3 は約104Bで、896個のエキスパートのうち16個を活性化
• 総パラメータ数 — MiMo-V2.6-Pro 1.02T、Kimi K3 2.8T
• 指標スコア — MiMo-V2.6-Pro 46、Kimi K3 44、いずれも Artificial Analysis v4.3.2
• 定価 — MiMo-V2.6-Pro は100万トークンあたり $0.43 / $0.87、Kimi K3 は $3.00 / $15.00、キャッシュ入力は $0.30
• 混合レート — MiMo-V2.6-Pro 100万あたり$0.18、Kimi K3 $2.31
• インデックスの実行にかかるコスト — MiMo-V2.6-Pro $206.66、Kimi K3 $3,658.07
• 速度 — MiMo-V2.6-Pro は秒間 134.3 出力トークン、Kimi K3 は 42.8 で、このサイズクラスの中央値 77.9 に対しての結果です
• 初回トークンまでの時間 — MiMo-V2.6-Pro 2.15秒、Kimi K3 3.93秒
• コンテキスト — 両方とも1Mトークン。Kimi K3はリクエストあたり最大1Mトークンの出力を公開
• 重み — どちらもダウンロード可能、MiMo-V2.6-Pro には MIT タグが付いています

速さこそ、インデックスが隠している違いだ
ここで2ポイントの総合差は最も興味を引く数字ではなく、秒あたり134.3対42.8トークンという数字のほうが最も興味深い。3倍速く生成するモデルは3倍優れているわけではないが、機能するアプリケーションのクラスとそうでないものとの違いではある——そしてKimi K3自身のArtificial Analysisページは、それをそのサイズクラスにしては著しく遅いと指摘している。数十回の逐次呼び出しを行う長期的なエージェントループにとって、スループットはレイテンシと同じように複利的に効いてくる。呼び出しごとの3倍の差はエンドツーエンドで3倍の差にはならないが、ユーザーが待ち続けるセッションと諦めてしまうセッションとの違いにはなる。
Kimi K3の優位性は、収支の入力側にある。最初のトークンまでの3.93秒はMiMo-V2.6-Proの2.15秒より遅いが、どちらかと最大限の推論を行うフロンティア推論モデルとを隔てるほどの桁違いの差ではない。K3がその大きさの代償を払うのは生成においてであり、そして生成こそが課金の対象なのだ。
ベンダー番号、そして読み間違えられるもの
両方のラボはそれぞれ独自のハーネスからDeepSWE v1.1の数値を公表しており、その2つは比較可能であるかのように出回っている。実際には比較可能ではなく、このペアこそ、数値が非常に近く見えるためにその誤りが最も大きな損害を与える場面だ。
Xiaomiは、MiMo-V2.6-Proが強化学習実行を通じてDeepSWE v1.1で58.4から72.57へ上昇したと報告している。評価はXiaomi独自のグレーダー上で、mini-swe-agentを用いて3回平均で実施された。この実行は30ステップ、モデルあたり約75万トラジェクトリと記録されており、6日未満で完了し、公表された支出はProモデルが約262万ドル、より小型のFlashが854,044ドルだった。その実行について広く流布した解釈では、同じベンチマークでKimi K3が68.51とされており、これならXiaomiのモデルが4ポイント差で勝者となる。その解釈はコミュニティによる数値であり、Moonshotの数値ではない。また、2つの測定は異なる指標—3回平均と合格率—を用いているため、それらを差し引くのは尺度が一致しない値に対する算術である。どちらのベンダーも、これらのモデルについてDatacurveの公開ボードに構成を提出していない。
本当に比較可能な数値はインデックスだ。なぜなら Artificial Analysis は両方を自ら実行しており、MiMo-V2.6-Pro が 46、Kimi K3 が 44、いずれも v4.3.2 での結果で、どちらについても評価ごとの内訳は公開されていない。この2ポイントの差は、10件の評価を合成した指標のノイズの範囲内に収まるほど小さく、測定された能力においてこの2つのモデルは実質的に同等である、というのが誠実な結論だ。
Kimi K3のプレミアムで得られるもの
コスト差を純粋なマージンと解釈するのは間違いだろう。Kimi K3は2.8兆パラメータのモデルで、Xiaomiの1.02兆に対して、トークンあたり約2.5倍のパラメータを活性化する。それはそのサイズクラスで初のオープンモデルであり、MiMo-V2.6-Proが単に蓄積する時間がなかった一連の独立した結果を持っている。Artificial Analysis自身の報告によると、リリース時点でIntelligence IndexでClaude Fable 5とGPT-5.6 Solに次いで3位にランクされ、GDPval-AA v2ではElo 1668、AutomationBench-AAでは53%で1位、AA-BriefcaseではElo 1547で2位、Frontend Code Arenaでは1679で1位だった。これらは独立した測定であり、ローンチ時の主張ではなく、2ポイントの複合マージンでは捉えきれない広がりを持つモデルを描写している。
容量に関する話も付随している。Kimi K3 の需要は、ローンチ時に提供容量を圧迫したと報じられており、一時的な API サブスクリプションの停止や、一部のゲートウェイにおける上流容量の制限を引き起こした。手に入れにくいモデルは、その上に構築しにくいモデルであり、それは品質ではなく可用性の問題である。

1つのエンドポイント、そして何をルーティングするのかについての明快な答え
Kimi K3はOrcaRouterでkimi/kimi-k3として利用可能です — OpenAI互換のキー1つで、プロバイダーの定価を0%のマークアップでそのまま提供しているため、Moonshotの価格変更は当日中に当社側でも反映され、プロバイダー間の自動フェイルオーバーが、このモデルをローンチ以来悩ませてきたキャパシティ上限をカバーします。Xiaomi MiMo-V2.6-ProはOrcaRouterにはありません。Xiaomiのモデルは一切なく、現在それを利用する経路はXiaomi自社プラットフォームか、それを扱うサードパーティのカタログのいずれかです。この点は、モデルページがそうでないかのような印象を与えるのではなく、はっきりと明記する価値があります。
これにより、この組み合わせはルーティングレイヤーが何のためにあるのかを示す好例となる。2つのオープンモデルが、双方が実行された唯一の独立した指標で並びながら、測定されたタスクあたりのコストでは17倍の差 — これは選択ではなく、2車線の構成だ。トラフィックの大半を安価な車線に流し、残りは自分で定義した述語に基づいてもう一方へルーティングする。あるいは一方の経路が劣化したときにフェイルオーバーさせる。モデルが1つのキーの背後にあれば、それぞれがどれだけのシェアを取るべきかを教えてくれる実験は、調達の会話ではなく自分のプロンプトに対する設定変更になる — そして、ローンチウィンドウが閉じた後にXiaomiがMiMo-V2.6-Proを再価格設定しても、競争に応じてMoonshotがK3の料金を引き下げても、どちらの動きも次の請求サイクルではなく同じ日にこちらの側に反映される。

どちらを選ぶべきか
Kimi K3は、このサイズで、かつ独立に測定されたモデルならではの広さ——視覚、大規模リポジトリをまたぐ長期的コーディング、エージェント型のツール利用——が必要なときに選びましょう。あるいは、すでに運用していて移行コストが現実の負担になっている場合にも。2つの中ではより徹底的に特性評価されたモデルであり、その100万トークンの出力上限は異例です。生成速度は見込んでおきましょう。毎秒42.8トークンでは、その推論品質が何を示唆していようと、対話用途で見る限りバッチおよびオフライン作業負荷向けのモデルです。
スループットとユニットエコノミクスが制約条件となる場合、ループがコンテキストを多く含み反復的である場合、ファーストトークン遅延が重要である場合、または寛容なライセンスの下で自分のハードウェアに重みを置きたい場合には、MiMo-V2.6-Pro を選びましょう。安価なモデルでありながら高速でもあるという稀なケースであり、両モデルが共通して評価されている唯一の独立系スコアでは、引き分けと見なせるほどわずかな差で先行しています。
ルーターがあるなら両方を選べ。避けるべき失敗モードは、見出しの比率を理由にどちらか一方に標準化してしまうことだ。46インデックスのモデルが同じように仕上げる要約ジョブにKimi K3の料金を払う、あるいは、すべてを安価なレーンに移した後に、リポジトリ規模のコーディングタスクには2.8Tモデルが必要だと気づく、といったことだ。どちらもモデルの問題ではなく、どちらも設定の問題だ。
OrcaRouterは、200以上のモデルを1つのOpenAI互換エンドポイントでプロバイダーの定価のまま、マークアップ0%で提供しているため、ベンダーの価格変更は当日に反映されます。
