OrcaRouterのモデルレーダーヒーローカード。MiMo-V2.6-ProとClaude Opus 5の比較用で、サブタイトルは「インデックス5ポイント。価格は21倍。」、モデルごとに1つのパネルを備えています。
Guides & Insights

MiMo-V2.6-Pro 対 Claude Opus 5:21倍安価、インデックスで5ポイント差

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Xiaomi MiMo-V2.6-ProとClaude Opus 5は、ひとつのトレードオフの両端であり、そのトレードオフには値段がつく。Artificial Analysis Intelligence Index v4.3.2では、Claude Opus 5(最大effort)が51、Xiaomi MiMo-V2.6-Proが46。料金表では、Claude Opus 5は入力100万トークンあたり$5.00、出力100万トークンあたり$25.00。MiMo-V2.6-Proは$0.43と$0.87。割り算をすると、答えは入力で11.6倍、出力で28.7倍——そしてArtificial Analysisがそれぞれに公表している混合レートでは21倍になる。インデックス5ポイントの差に、21倍の費用。それが掘り出し物か無駄かは、あなたのワークロードがその5ポイント目で何をするかに完全に依存する。そしてほとんどのチームは、コミットする前にそれを計算しない。

平たく言えば、これら2つのモデルは

Claude Opus 5は、Anthropicのプロプライエタリなフラッグシップモデルで、2026年7月24日にリリースされ、100万トークンのコンテキストウィンドウと非公開のパラメータ数を持つ。Xiaomi MiMo-V2.6-Proは、総パラメータ数1.02兆、活性化パラメータ420億のスパースなMixture-of-Expertsモデルで、100万トークンのコンテキストウィンドウ、テキスト・画像・動画・音声にわたるネイティブなマルチモーダル対応、MITライセンスで公開された重みを備える。

• ウェイト — MiMo-V2.6-ProはMITライセンスでダウンロード可能、Claude Opus 5はプロプライエタリでAPIのみ

• パラメータ — MiMo-V2.6-Pro 合計1.02T / アクティブ42B、Claude Opus 5 非公開

• コンテキスト — 両方とも100万トークン、Claude Opus 5 の出力上限は Messages API で128K、Batch API で300K

• モダリティ — MiMo-V2.6-Proはテキスト、画像、動画、音声を扱う。Claude Opus 5の公表されている入力サーフェスはテキストと画像である

• 定価 — MiMo-V2.6-Pro 100万トークンあたり $0.43 / $0.87、Claude Opus 5 $5.00 / $25.00

• キャッシュ — MiMo-V2.6-Proは99%のキャッシュ割引を提示。Claude Opus 5は1Mあたり$0.50でキャッシュを読み取り、書き込みは$6.25でTTLは5分

• Intelligence Indexタスクあたりの実測コスト — MiMo-V2.6-Pro $0.13、Claude Opus 5 $5.86

• 推論性能 — MiMo-V2.6-Pro は毎秒134.3出力トークン、初回トークンまで2.15秒。Claude Opus 5 は毎秒57.9トークン

最後のそのペアこそが、見落とされてしまう。安いほうのモデルは速いほうでもある——出力スループットで2.3倍——なぜなら、Xiaomiとそのパートナーが掌握するハードウェア上で提供されており、バッチ処理を積極的に行えるからだ。最大エフォートのClaude Opus 5は、トークンあたりより多くの仕事をこなす推論モデルであり、速度差は欠陥ではなく、別の製品だということだ。だが、それは安価なレーンが割引の代償をレイテンシで支払っているわけではない、ということを意味する。代償は、インデックス5ポイント分と、その5ポイント目が宿るタスクのテールで支払っているのだ。

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs Claude Opus 5 — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists Intelligence Index v4.3.2 score 46, list price $0.43 / $0.87 per million tokens, measured cost per index task $0.13, serving speed 134.3 tokens per second, size 1.02T total and 42B active parameters, MIT-licensed downloadable weights, and text, image, video and audio input. The Claude Opus 5 column lists index score 51, list price $5.00 / $25.00, measured cost per index task $5.86, serving speed 57.9 tokens per second, undisclosed size, proprietary API-only weights, and text and image input.

実際に5つのポイントがどこにあるのか

10件の評価を合成したものにおける5ポイントの差は均等に広がっているわけではなく、その集計値は重要な事柄を覆い隠している。両モデルは同じv4.3.2スイートで実行されており、これにはAA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1が含まれる。公開されているページでは、どちらのモデルについても評価ごとのスコアが内訳として示されていない。これはこの比較の双方にとって実際の制約であり、ごまかすのではなく明言する価値がある。

記録に残っている数字は方向性を示すものだ。最大エフォートのClaude Opus 5は、v4.3スイート内のTerminal-Bench 4.0で49.0%を記録し、GPT-6 Astraの59.1%とClaude Fable 5.1の52.0%に後れを取った。AutomationBench-AAでは、Opus 5は28.3%のワークフローでガードレール違反なしに全目標を完了し、GPT-6 Astraは41.6%、Fable 5.1は32.1%だった。これらは紛れもないエージェント性能の数値であり、まさに5ポイントの総合スコア差が均等に分布する可能性が最も低いカテゴリだ—MiMo-V2.6-Pro自身のインデックス項目には、比較可能なエージェント性能の内訳が公表されていない。

一方で、両社が公開しているベンダー数値は互いに比較可能なものではなく、その理由については率直に言っておく価値がある。Anthropicの発表資料はSWE-bench Verifiedを96.0%、SWE-bench Proを79.2%と報告している。あるトラッカーは、Opus 5が単独のSWE-benchエントリなしで出荷され、それについて独立監査されたSWE-bench Verifiedの数値は存在しないと指摘している。Xiaomiの資料は、MiMo-V2.6-ProがRL実行を通じてDeepSWE v1.1で58.4から72.57へ向上したと報告しているが、それはXiaomi自身のハーネス上でmini-swe-agentを使い、3回平均で測ったものであり、公開のDeepSWEボードには提出されていない。2つのベンダーハーネス、2つの異なるタスク、重なりはない。96.0%を72.57の隣に置いて結論を導くのは、存在しない比較をでっち上げることになる。

Screenshot of the OrcaRouter model page for Claude Opus 5, showing the 1M-token context window, a 128K maximum output, input pricing of $5.00 per million tokens and output pricing of $25.00 per million, cache reads at $0.50 per million and cache writes at $6.25 per million on a five-minute TTL, and the provider uptime table listing the routes behind the model.

コスト比較をきちんと

トークン単位の計算ではこの差を過小評価してしまう。なぜなら、同じ作業を完了するのに両モデルが消費するトークン数は同じではないからだ。Artificial Analysisは、完全なIntelligence Indexを実行するのにそれぞれが実際にかかったコストを測定した。MiMo-V2.6-Proは0.13ドル、Claude Opus 5は5.86ドルだった。これは管理された同一のタスクセットにおける45倍の差であり、両方が同じ方法で測定されているため、入手可能な中で最も公平な単一の数値だ。

ここで、それに対して現実的な本番ループを当てはめてみましょう。各ステップで200,000トークンのコンテキストを読み、各ステップで2,000トークンを書き込む30ステップのエージェント実行は、1回あたり600万入力トークンと60,000出力トークンになります。Claude Opus 5の定価では、入力が$30.00、出力が$1.50、つまりキャッシュを一切使わない場合で1回あたり$31.50です。MiMo-V2.6-Proでは、入力が$2.58、出力が$0.05で、$2.63です。両ベンダーが提供するキャッシュ割引を使えば、どちらのモデルでも入力側は大きく縮みますが、比率は消えるどころか移ります。安価なモデルでの99%のキャッシュ割引と、高価なモデルでの$0.50のキャッシュ読み取りを比べても、コンテキスト量の多いループでは高価なモデルが依然として桁違いに高くつきます。

これが、安価なレーンを支持し、全面的な切り替えに反対する論拠のすべてである。ワークロードが、同じコンテキストを何百回も読み直す長い時間軸のエージェントループであるなら、実行ごとのコスト差は丸め誤差ではない——ユーザーごとに実行する余裕のある機能と、そうでない機能との違いなのだ。それが、トラフィックの大半を MiMo-V2.6-Pro に最初に通すべき根拠である。これは Claude Opus 5 を削除する根拠ではない。なぜなら、第5の指標ポイントが元を取れるタスクは、構造上、安価なモデルの失敗が高くつくタスクだからだ。

Cost card headed 'The same agent run, priced twice', listing a stated assumption of a 30-step agent run reading 200,000 tokens of context per step and writing 2,000 tokens per step for 6M input and 60K output tokens per run; MiMo-V2.6-Pro at $0.43 / $0.87 costing $2.58 input plus $0.05 output for $2.63 per run before caching; Claude Opus 5 at $5.00 / $25.00 costing $30.00 input plus $1.50 output for $31.50 per run before caching; a per-token ratio of 11.6x on input, 28.7x on output and 21x on the blended rate; a measured $0.13 against $5.86 per Intelligence Index task, a 45x gap; and the caching comparison of a 99% cache discount against a $0.50 cache read and $6.25 cache write.

ここでのルーティング決定はどのようなものか

Claude Opus 5 は 単一の OrcaRouter キーを通じて、プロバイダーの定価で、マークアップ 0% で利用できます。モデル名は anthropic/claude-opus-5 で、比較対象となるフロンティアモデルも同じキーの上に並んでいます。当社はプロバイダーの定価をマークアップなしでそのまま通しているため、どちらかのベンダーで価格変更があれば、再見積もりを待つことなく当日中に当社側にも反映されます。面白いのはルーティング DSL の部分です。2 つのモデルを選び分けるのではなく 1 回の呼び出しに組み合わせることができ、ワークロードの大半を安価なレーンに送り、残り — セルフチェックに失敗するタスクや、複雑度の述語に一致するタスク — を高価なほうにルーティングできます。フェイルオーバーはそのもう半分です。Claude Opus 5 はプロバイダーのカバレッジが広範です。MiMo-V2.6-Pro は、Artificial Analysis が捕捉した時点では単一の API プロバイダーのみが提供しており、本番経路に置くようなモデルとしては細いルートです。フォールバックできるルーターがあってこそ、安価なレーンを安心して採用できるのです。

率直に言っておく価値がある。そうでないと簡単に思い込まれかねないからだ。当社は MiMo-V2.6-Pro をホストしていない。今日それに到達するには、Xiaomi 自身のプラットフォームか、それを掲載している第三者カタログのいずれかを使うことになる。ここでのルーティングの議論は、当社が扱っているモデルと並べてこのようなモデルをどう使うかについてのものであり、これが当社のモデルの一つだという主張ではない。

どちらを選ぶべきですか

タスクの失敗コストがトークンコストを十分に上回り、5インデックスポイントが安い保険だと言えるなら、Claude Opus 5 を選ぼう。現実の副作用を伴う長期的なエージェント作業、誤った呼び出しが遅い呼び出しより悪いツール使用、出力を確認するためにすでに人間に対価を払っているあらゆる場面が該当する。インデックスタスクあたり5.86ドルという数字は、それを避ける理由にはならない。それはそのティアの価格であり、そのティアには存在する理由がある。

MiMo-V2.6-Pro を選ぶべきなのは、量が制約条件であるとき、ワークロードがコンテキスト重視で反復的であるとき、重みを自社インフラに置きたいとき——MIT ライセンスは商用展開、改変、さらなる学習を認めている——、あるいは、1000 トークンあたり 0.5 セントという単価でしか採算が合わないものを構築しているときだ。その 134.3 トークン/秒という性能は、大半の 1 兆パラメータ級オープンモデルにはない形で、対話的な用途を現実的なものにする。

ルーターがあるなら、両方選べ。なぜなら「どちらが優れているのか」に対する正直な答えは、両者は同じリクエストを奪い合っているわけではない、ということだからだ。避けるべき失敗の型は、最もコストが高くつくものだ。つまり、宣伝文句の21倍という比率だけを見て安いモデルに標準化し、3か月目になって、特定のクラスのリクエストには高いほうのモデルが必要だと気づき、そこへルーティングする道がないと分かる——これだ。2つ目の失敗の型はその裏返しで、46インデックスのモデルが同じ仕上がりで終わらせられる要約作業に、Opus 5 の料金を払ってしまうことだ。どちらもモデル側の問題ではない。どちらも設定の問題であり、設定こそ火曜日の午後に変えられる部分なのだ。