MiMo-V2.6-Pro vs Grok 4.7と表示された生成タイトルカード。その下に「タスクあたり29倍安いが、両者ともより遅い」というサブタイトルがあり、タイトルの上には、比較されたコインの山、速度ダイヤル、開いた南京錠を思わせる3つのフラットラインアイコンがある。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

Xiaomi MiMo-V2.6-Pro vs Grok 4.7:タスクあたり30倍安価、そしてどちらも速くない

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Xiaomi MiMo-V2.6-ProとGrok 4.7はどちらも2026年9月21日に登場し、どちらもArtificial Analysis Intelligence Index v4.3.2で46を記録し、どちらもそれらを測定したページから遅いと言われている——MiMo-V2.6-Proは毎秒43.6出力トークンで中央値67.1に対して、Grok 4.7はxhigh effortで40だ。両者を分けるのは、回答にいくらかかるかだ。評価側のタスクあたりの数値は、中国のオープンチェックポイントが0.13ドル、Grok 4.7モデルが3.74ドルで、約29倍の差だ。それは速度差ではない、少なくともそれだけではない。Grok 4.7の出力料金は100万トークンあたり6.00ドルで、0.87ドルに対して7倍であり、残りの倍率は、各モデルが回答を出すまでに消費するトークン数から来ている。

同じ月に、同じインデックスで、同じスコアなのに、まるで市場の異なる年代に属しているかのような価格がついた2つのモデル。興味深い問いは、どちらが勝つかではない。その29倍のうち、実際にどの部分を迂回できるかだ——この組み合わせでは、2つのうちちょうど片方だけが今日買えるルートであり、しかもそれは高いほうなのだから。

同じ日、同じスコア、違う動物

Grok 4.7は2026年9月21日にリリースされ、入力100万トークンあたり2.00ドル、出力100万トークンあたり6.00ドル、500,000トークンのコンテキストウィンドウ、2026年5月の知識カットオフ、75%のキャッシュ割引を備え、テキストと画像の入力に対してテキストを出力します。xhigh effortでのインデックススコアは46、Grok BuildハーネスでのCoding Agent Indexは56、AA-BriefcaseではElo 1,657でした — 同ボードでは4位で、Anthropicの3エントリーに次ぎ、タスクあたりのコストはClaude Opus 5のおよそ半分です。

Xiaomi MiMo-V2.6-Pro はスパースな Mixture-of-Experts チェックポイントで、総パラメータ数 1.02 兆、アクティブ 420 億、MIT ライセンス、100 万トークンのコンテキスト、テキスト・画像・音声・動画の入力に対してテキスト出力、100 万トークンあたり $0.43 と $0.87、99% のキャッシュ割引によりウォームプロンプトでは実効入力レートがほぼゼロになる。Artificial Analysis は、このモデルをインデックス上で 114 のオープンウェイトモデル中 1 位、コストで 114 中 12 位に位置づけている。3 つの API プロバイダー経由で利用可能。当社のルートにはなく、プロバイダーがオンボーディングする前にモデルを掲載することはない。

決め手となる唯一の線

• インデックスタスクあたりのコスト — MiMo-V2.6-Pro $0.13、Grok 4.7 $3.74 — 29倍 • 出力レート — MiMo-V2.6-Pro $0.87 / 1M、Grok 4.7 $6.00 / 1M — 6.9倍 • インデックス実行時の出力トークン — MiMo-V2.6-Pro 140M、Grok 4.7 240M、中央値88Mに対して • 出力速度 — MiMo-V2.6-Pro 43.6 t/s、Grok 4.7 40 t/s — いずれも中央値未満 • コンテキストウィンドウ — MiMo-V2.6-Pro 1M、Grok 4.7 500K • 重み — MiMo-V2.6-Pro はMITライセンスでダウンロード可能、Grok 4.7 はプロプライエタリでAPIのみ

最初の2つの箇条書きを一緒に読むと、差の形が見えてくる。定価ベースでは、両者は出力で6.9倍離れている。インデックス実行では、回答にかかるコストで29倍離れている。その間にある倍率要因は冗長性だ。Grok 4.7は2億4000万出力トークンを生成したのに対し、同クラスの中央値は8800万であり、MiMo-V2.6-Proは1億4000万を生成した。これは6.9倍のレートペナルティの上に1.71倍のトークンペナルティが乗っていることを意味し、1.71 × 6.9は11.8になる。29までの残りの隔たりは入力側から生じており、そこではMiMo-V2.6-Proの99%キャッシュ割引と0.43ドルの入力単価が、繰り返しプレフィックスが少しでもあるワークロードで大きな役割を果たしている。

A two-column scoreboard titled MiMo-V2.6-Pro vs Grok 4.7 - the scoreboard, subtitled Same index score, same month, 29x apart per task. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; cost per index task $0.13; list price $0.43 / $0.87 per 1M; output speed 43.6 tokens per second; 140M output tokens on the index run; 1M context; weights downloadable, and carries a tag reading Open weights - MIT. The right column, Grok 4.7 (xhigh), reads Intelligence Index v4.3.2 46; cost per index task $3.74; list price $2.00 / $6.00 per 1M; output speed 40 tokens per second; 240M output tokens; 500K context; weights not released, and carries a tag reading Proprietary - API only. A footer line reads that index scores, per-task cost, speed and token counts are per Artificial Analysis Intelligence Index v4.3.2, read 25 September 2026, and that both models shipped 21 September 2026. The OrcaRouter logo is composited in the bottom-right corner.

冗長さとは、人が見積もりから省いてしまう数のことだ。

コストモデルは通常、料金表と想定トークン数から構築される。ここではそのどちらの半分も間違っている。料金表が間違っているのは、キャッシュ割引が脚注ではないからだ——99% 対 75% は、システムプロンプトが呼び出しのたびにコストを生むか、ほとんど何も生まないかの違いである。トークン数が間違っているのは、2つのモデルが同じ作業に対して同じ数のトークンを出力するわけではないからであり、評価者がその差を測定した:2億4000万 対 1億4000万、同一ベンチマークで 1.71 倍の開きである。

これらのどちらも、スペックシートから読み取れる代理指標ではない。Grok 4.7の冗長性ランキングは同クラス210モデル中#94、MiMo-V2.6-Proのコストランキングは同クラス114モデル中#12だ。Grok 4.7の料金表を引き、トークン中立なワークロードを前提とするチームは、タスクあたりでインデックスが実際に費やした額のおよそ4分の1を予測することになる。修正策は、インデックスのコストを自分の見積もりとして使うことでもない — それは1つのベンチマークの形を測ったものにすぎない。コミットする前に、双方で自分のトークン数を測ることだ。なぜなら、2つのモデル間の差は紙の上では6.9倍、実際には29倍であり、あなたのトラフィックにとって現実なのはそのうち片方の数値だけだからだ。

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 25 September 2026. The header shows Intelligence rank 21 of 210, Speed 159 of 210, Cost 210 of 210, Verbosity 94 of 210, 46 on the Artificial Analysis Intelligence Index, $2.00 input and $6.00 output per 1M tokens with a 75% cache discount, $3.74 per task to evaluate on the Intelligence Index, and 500K context; the summary paragraph calls the model notably slow and very verbose, and the verbosity line shows 240M output tokens generated on the index run against a median of 88M.

どちらも遅い。それは引き分けではない。

Artificial AnalysisはGrok 4.7を毎秒40出力トークンと測定し、「最も遅い部類」と評している。MiMo-V2.6-Proは43.6で、「顕著に遅い」と評している。これら2つの測定値は十分に近く、速度を両者間のタイブレーカーにすべきではない。しかし、その下にある中央値はそうではない。MiMo-V2.6-Proが属するオープンウェイト分野では67.1だ。両モデルともそれを大きく下回っており、MiMo-V2.6-Proはさらに、中央値2.31秒に対して初回トークンまでの時間が3.17秒かかる。これはバッチ処理ではなくインタラクティブなループで痛手となる数字だ。

つまり、レイテンシ面を正直にまとめると、29倍安くても速い製品が手に入るわけではなく、安く済む代わりに遅い製品が手に入るということです——そして、ユーザーがカーソルを見つめているなら、3.17秒の待ち時間は、節約できたトークン以上のコストになるかもしれません。夜間バッチ処理、オフライン評価、あるいは時間単位で計測されるようなあらゆるパイプラインでは、このトレードオフは単純明快で、29倍はほぼ無料です。

ルーターがこのペアリングでできることとできないこと

これは、当社のカタログが明らかに片手落ちになっている組み合わせであり、それについては率直に言っておく価値があります。Grok 4.7 は OrcaRouter 上で grok/grok-4.7 として、プロバイダー自身の $2.00 / $6.00、最大出力 450K、および https://api.orcarouter.ai/v1 の OpenAI SDK 互換エンドポイントで提供されています。つまり、この比較を見て、xAI のモデルをほかのすべてと同じキーの下で使いたいと思ったなら、そのルートは今日すでに存在します。Xiaomi MiMo-V2.6-Pro は当社のルートにはありません。その側については、ベンダー自身の API か、同社が挙げている3つのプロバイダーのうちすでに利用しているものが答えであり、そうでないふりはしません。

このような比較でルーターがその価値を発揮するのは、モデルそのものではない部分です。1つのキーで200以上のモデルに各プロバイダーの定価で0%のマークアップでアクセスできるということは、ベンダーの値下げが次の契約更新時ではなくその日のうちに請求書に反映されることを意味します。自動フェイルオーバーとは、40 t/sのルートが劣化してもパイプラインを巻き添えにしないことを意味します。ルーティングDSLを使用すると、分割はブランドへの忠誠心ではなく、公開されたタスクごとのコストに基づいて行われます — 大量処理には安価なモデル、難しい呼び出しには高性能モデルを、リクエストごとに決定します。また、どちらのモデルも完全には適していないワークロードでは、モデル融合によって1回の呼び出しの背後で複数のモデルを実行できます。

Screenshot of the OrcaRouter model page for Grok 4.7, captured 25 September 2026. The page shows the model id grok/grok-4.7, a maximum output of 450K, output text, public benchmarks by grok dated 2026-09-21, a price of $2.00 per 1M input and $6.00 per 1M output, and an OpenAI-SDK-compatible code sample whose base URL is https://api.orcarouter.ai/v1 and whose model field is grok/grok-4.7.

この比較で通常生じる疑問

29×は自分のワークロードにも当てはまりますか? あなたのトークン構成がインデックス実行のものと似ている場合に限られます。出力が短く、プロンプトが長くてキャッシュされている場合、倍率は出力側の6.9×という料金差のほうへ縮小し、入力側では広がります。入力側ではMiMo-V2.6-Proの99%割引が決定的な項になるからです。出力が長い推論トレースである場合、29×を超えて広がります。Grok 4.7の冗長性ペナルティは出力長に比例するためです。

両側の46は同じ46ですか? 同じインデックス、同じバージョン、同じスケールです — 基になるサブスコアは46.32と46.45で、0.13ポイントの差であり、インデックスはどちらも46に丸めます。Artificial Analysisはどちらのモデルについても評価ごとの内訳を公開していないため、合成スコアが入手可能な最も細かい粒度であり、0.13ポイントの差を能力ランキングとして読むべきではありません。

新しいプロジェクトはどちらをデフォルトにすべきか?ワークロードがバッチ処理で、レイテンシに寛容で、コストに敏感なら、1タスクあたり0.13ドルのMiMo-V2.6-Proがデフォルトであり、オープンウェイトは単一プロバイダーの価格設定に晒されないことを意味する。xAIモデルが特に必要な場合——Grok Buildハーネスの結果、AA-Briefcaseの配置、2026年5月カットオフの500Kコンテキスト——Grok 4.7は今日OrcaRouter上のライブルートであり、タスクごとの割増はその特定機能の対価である。ここで両方に勝つモデルは存在しない。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新