
MiMo-V2.6-Pro 対 Grok 4.6:両ベンダーがDeepSWEの数値を公表、しかもどちらもリーダーボードに載っていない
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2社のベンダー、1つのベンチマーク、引き算できない2つの数値。SpaceXAIのGrok 4.6向け発表資料は、DeepSWE v1.1で65.9%を報告している。XiaomiのMiMo-V2.6-Pro向け資料は、DeepSWE v1.1で72.57を報告している。並べて読めば、安価なオープンウェイトモデルがプロプライエタリなフロンティアモデルを7ポイント近く上回ることを示唆する。注意深く読めば、ほとんど何も語っていない。一方はベンダー自身のハーネス上での発表資料のパーセンテージであり、もう一方はXiaomi自身の採点器での強化学習実行による3回平均であり、どちらも公開のDeepSWEボードには提出されていないからだ。精査に耐えるMiMo-V2.6-ProとGrok 4.6の比較は独立系インデックス上にあり、そこでの答えはベンダーの数値とは逆で、46対44、Xiaomi有利の2ポイント差である。
Grok 4.6は2026年8月12日にSpaceXAIによってリリースされ、ここでは既存の側だ。すでに出荷され広く提供されているフロンティアモデルであり、価格表も公開され、数か月にわたる独立した測定の裏付けもある。Xiaomi MiMo-V2.6-Proは2026年9月22日に一般提供が開始され、その前日には強化学習のチェックポイントリポジトリが登場した、新参者である。どちらも推論能力を備え、どちらも長時間稼働するエージェント的作業のために作られており、両者の価格差は、新参者の経験不足だけがこの比較の足を引っ張っていると言えるほど大きい。
各モデルの正体
Grok 4.6はプロプライエタリで、テキストと画像を入力として受け取り、テキストを返し、2026年2月1日を知識カットオフとする。そのコンテキストウィンドウは500,000トークンで、これは主要競合の半分のサイズであり、そのスペック表で最も重要な仕様である。そのリスト料金は、200,000プロンプトトークン未満では、入力100万トークンあたり$2.00、キャッシュ入力100万トークンあたり$0.50、出力100万トークンあたり$6.00であり、その境界に崖がある。200K以上では料金は$4.00、$1.00、$12.00になり、上位ティアはラインを超えた部分ではなくリクエスト全体に課金する。優先処理は標準料金を2倍にする。Artificial Analysisは、最大努力時に毎秒63.0出力トークンと最初のトークンまで42.79秒、そしてフルインデックスの実行に$2,351.83を測定した。
Xiaomi MiMo-V2.6-Proは、総パラメータ数1.02兆、トークンあたり420億が活性化されるスパースなMixture-of-Expertsモデルで、100万トークンのコンテキストウィンドウと、テキスト・画像・動画・音声にわたるネイティブなマルチモーダル対応を備えています。MITライセンスで重みをダウンロード可能で、Xiaomiは新しいチェックポイントに合わせて値上げするのではなく、前世代の価格を据え置きました。入力100万トークンあたり$0.43、出力100万トークンあたり$0.87、99%のキャッシュ割引、キャッシュヒット/入力/出力の7:2:1の混合でブレンド$0.18です。Artificial Analysisの測定では、毎秒134.3出力トークン、最初のトークンまで2.15秒、インデックスの実行に$206.66——タスクあたり$0.13でした。
• 重み — MiMo-V2.6-ProはMITライセンスでダウンロード可能、Grok 4.6はプロプライエタリでAPIのみ
• パラメータ — MiMo-V2.6-Pro 合計1.02T/アクティブ42B、Grok 4.6 非公開
• コンテキスト — MiMo-V2.6-Pro 100万トークン、Grok 4.6 50万トークン、入力20万トークンで価格が急に跳ね上がる
• モダリティ — MiMo-V2.6-Pro はテキスト、画像、動画、音声を扱う。Grok 4.6 の公表されている入力範囲はテキストと画像である
・インデックススコア — MiMo-V2.6-Pro 46、Grok 4.6 44、いずれもArtificial Analysis v4.3.2
• 定価 — MiMo-V2.6-Pro は100万あたり $0.43 / $0.87、Grok 4.6 は $2.00 / $6.00 で、入力200K超では倍額
• ブレンド料金 — MiMo-V2.6-Pro は1Mあたり$0.18、Grok 4.6 は$1.35
• インデックスの実行コスト — MiMo-V2.6-Pro $206.66、Grok 4.6 $2,351.83
• 速度 — MiMo-V2.6-Pro 134.3 出力トークン/秒、Grok 4.6 63.0
• 初回トークンまでの時間 — MiMo-V2.6-Pro 2.15秒、Grok 4.6 42.79秒
• 知識カットオフ — MiMo-V2.6-Pro は未公開、Grok 4.6 は2026年2月1日

両ベンダーが実施したベンチマークと、それが比較にならない理由
DeepSWE v1.1は、Datacurveが実施する、実在する公開の第三者によるコーディングエージェント評価であり、両社がそろって結果を公表する対象として選んだ唯一のタスクファミリーだ。そうなると、つい手を伸ばしたくなる。しかし、これを直接対決に使うべきではない。その理由は、どちらかのベンダーが嘘をついているからではなく、この2つの数値が同じタスク名に対する異なる測定結果を表しているからだ。
Xiaomiの72.57は、mini-swe-agentを用いた同社独自のハーネスでの3回平均であり、凍結されたリリース候補からではなく強化学習の実行中に生成されたもので、開始値58.4と並べて報告されている。その実行は30ステップおよびモデルあたり約75万トラジェクトリとして記録され、Proモデルについて公表された支出約262万ドルで6日未満で完了した。これはDatacurveのボードには提出されていない。SpaceXAIのGrok 4.6に対する65.9%は、ベンダー自身の評価セットによる発表資料の数値であり、同じベンチマークでGrok 4.5からの11.9ポイントの向上と並べて報告されている——そして公開ボードには、提出されたGrok 4.6構成が約67%で掲載されており、これはベンダーの数値に十分近く、ハーネスが少なくとも概ね整合していることを示唆する。これはXiaomiの数値には当てはまらず、それには公開された対応物がまったく存在しない。
では、正直に言えばこうだ。公開リーダーボードにはGrok 4.6が存在し、MiMo-V2.6-Proは存在しない。独立系の総合評価では、両方とも同じ評価者によって実際に評価されており、Xiaomiのモデルが2点リードしている。この2つの事実は矛盾していない。それらは単に別々のものを測っているだけであり、引用すべきなのは2つ目のほうだ。
500Kコンテキストこそが、実際のワークロードを左右する仕様です
50万トークンは、通常の基準では大きなコンテキストウィンドウであり、2026年基準では小さい。MiMo-V2.6-Pro が同じグループに分類されるモデルはすべて 1M であり、その実用的な帰結は、Grok 4.6 が宣伝されているワークロードにまさに現れる。リポジトリ、ツールのトランスクリプト、蓄積された計画を保持する長時間稼働のコーディングエージェントは、1回のセッションでプロンプトが20万トークンを超える。そしてそのラインに達すると、Grok 4.6 の料金は2倍になり、リクエスト全体に遡って適用される。MiMo-V2.6-Pro での同じセッションは、ティアの変更なしで100万トークンまで実行される。
それは同時に仕様の違いであり、価格構造の違いでもあり、後者は表面料金を比較するときに見落としやすい。Grok 4.6 のブレンド $1.35 に対して MiMo-V2.6-Pro は $0.18 で、7.5倍の差だ。200K を超えるプロンプトでは、Grok の料金が2倍になり Xiaomi の料金は動かないため、差は15倍に近づく。
反論もまた記録に残っており、それは残されるに値する。Grok 4.6のローンチ時の主張は、生のコンテキスト量ではなくターン効率だった。同一タスクでClaude Opus 5と比較して測定されたエージェント評価において、Grok 4.6は約53ターン・約5億入力トークンで完了したのに対し、もう一方のモデルは約103ターン・20億トークンで、タスクあたり推定0.84ドル——この比較におけるフロンティアモデルの中で最も低い数字だった。ループを半分の回数しか回らないモデルは、それほど多くのコンテキストを必要とせず、それほど多くのトークンも消費しない。これは真のアーキテクチャ上の優位性であり、トークン単価がより安いあらゆる代替案——これを含めて——に対するGrok 4.6の最も強い論拠である。

それぞれのところへ行くこと
Grok 4.6はOrcaRouterにgrok/grok-4.6として搭載されており、プロバイダーの定価・マークアップ0%で、OpenAI互換の単一エンドポイントから利用できます。そのため、SpaceXAIの価格変更は、あの200Kの崖の変更も含めて、当日中に当社側でも反映されます。Xiaomi MiMo-V2.6-ProはOrcaRouterにはありません。Xiaomiのモデルはどれもなく、現在それを利用する経路はXiaomi自身のプラットフォームか、それを掲載しているサードパーティのカタログのいずれかです。それをはっきり述べるほうが、モデルページにそうでないことをほのめかさせるよりも有用です。
その非対称性が実際にどれだけの価値を持つかは、安価な実験で測れる。Grok 4.6は、すでに料金を払っているかもしれないモデルだ。MiMo-V2.6-Proは、料金はその何分の一かで指数を2ポイント改善するモデルで、今週登場し、背後には単一の提供経路しかない。答える価値がある問いは、抽象的にどちらが優れているかではなく、あなた自身のプロンプトに対してXiaomiのモデルがGrokのトラフィックをどれだけ引き受けられるかだ — そして、2つ目の契約、2つ目のキー、2つ目の請求関係を開いてそれに答えることが、テストの実行を妨げる摩擦なのだ。1つのエンドポイントとプロバイダー間の自動フェイルオーバーがあれば、比較は設定変更で済む。そしてここでは、フェイルオーバー側の部分がいつも以上に重要だ。今週出荷され、Artificial Analysisが捉えた時点では1つのAPIプロバイダーにしか掲載されていなかったモデルを、退避先の経路なしに本番経路に入れるべきではない。

どちらを選ぶべきか
ターン効率こそが最適化対象であるとき、つまり、モデルが半分のステップで完了できる能力がトークン単価よりも価値を持つような長いエージェントループを回すときには、Grok 4.6 を選ぼう。あるいは、1週間ではなく何か月にもわたる独立した測定に裏打ちされたモデルが欲しいときにも。毎秒63トークンと初回トークンまでの42.79秒という数値は、インタラクティブな観点ではこれをバッチおよびオフライン作業向けモデルにしている。また、500Kコンテキストと200Kでの価格の急騰は、プロンプトを短く保つことを支持する。
MiMo-V2.6-Proを選ぶべきなのは、Grokの200Kの崖を超えてしまいそうな、コンテキストが重く反復的なループを回しているとき、人間が待てるほど初回トークン遅延を低くする必要があるとき、重みを自分のインフラに置きたいとき、あるいはボリュームのせいで7.5倍のブレンドレート差が決め手となる数字になるときです。その2ポイントの指数上のリードは、それ単独で理由にすべきではないほど小さい。同じ評価スイートを実行するコストが$206.66対$2,351.83であることのほうが、より良い根拠になります。
未解決の問いに決着をつけるのは、MiMo-V2.6-Pro 向けに提出された DeepSWE 構成だ。Grok 4.6 にはすでにそれがある。Xiaomi のモデルが、明示されたハーネス、信頼区間、タスクあたりコストとともに公開ボードに現れた瞬間、72.57 はベンダー公称値ではなくなり、上記の比較は現実のものになる — そしてインデックス上の2ポイント差を考えれば、どちらに転んでもおかしくない。
OrcaRouterは、200以上のモデルを1つのOpenAI互換エンドポイントでプロバイダーの定価のまま、マークアップ0%で提供しているため、ベンダーの価格変更は当日に反映されます。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
