
MiMo-V2.6-Pro 対 Gemini 3.1 Pro:あるインデックスの1バージョンにしか存在しない16ポイントの差
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro と Gemini 3.1 Pro Preview を Artificial Analysis Intelligence Index 上で並べると、46 対 30 ——入力のコストが5分の1で済むモデルが16ポイントのリードを奪う。両ベンダーがそれぞれのローンチ時に公表した数値で並べれば、Gemini 3.1 Pro が11ポイント差で勝つ。どちらの読みも同じ評価機関によるものだ。両者が食い違う理由こそ、2026年9月にモデルを比較するうえで理解しておくべき最も有用な一点である。つまり、インデックスは両者の足元で作り直されており、スコアはそれを生み出したバージョン番号と並べて初めて意味を持つ。
v4.3.2 コンポジットが現在のものです。これは10の評価 — AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1 — を実行し、その指標では、2026年9月22日時点で、Xiaomiのモデルは46、Googleは30のスコアです。2026年2月19日の公開時、Gemini 3.1 Pro Preview は当時の尺度で57と報告され、首位に立っていました。これら2つの Gemini の数値は低下ではありません。異なる2つのものさしです。
各モデルの正体
Gemini 3.1 Pro PreviewはGoogleのフロンティア推論モデルであり、2026年2月19日にリリースされ、7か月後もなおプレビューのラベルが付いたままです。1Mトークンのコンテキストウィンドウを持ち、出力は65,536トークンに制限されています — Artificial Analysisでは64K、当社のモデルページでは65Kと記載されています — そしてテキスト、画像、PDF、音声、動画を入力として受け取り、テキストを出力します。プロプライエタリであり、パラメータ数は非公開で、知識カットオフは2025年1月です。Google独自のAPIでは、入力トークン100万あたり$2.00、出力トークン100万あたり$12.00(入力が200K以下の場合)で、それを超えると$4.00と$18.00になり、キャッシュされた入力は$0.20です。
Xiaomi MiMo-V2.6-Proは2026年9月22日に一般提供が開始され、強化学習チェックポイントのリポジトリはその前日に公開された。これはスパースな混合エキスパートモデルで、総パラメータ数は1.02兆、トークンあたり420億が活性化し、100万トークンのコンテキストウィンドウ、テキスト・画像・動画・音声にわたるネイティブなマルチモーダル対応、MITライセンスのダウンロード可能な重みを備える。Xiaomiは新しいチェックポイントを値上げするのではなく、前世代のMiMo-V2.5の価格を維持した。入力100万トークンあたり0.43ドル、出力100万トークンあたり0.87ドルで、99%のキャッシュ割引があり、キャッシュヒット/入力/出力が7:2:1の混合でブレンドレートは0.18ドルとなる。
• 重み — Xiaomi MiMo-V2.6-Pro は MIT ライセンスでダウンロード可能、Gemini 3.1 Pro Preview はプロプライエタリで API のみ
• パラメータ — MiMo-V2.6-Pro:総1.02T/アクティブ42B、Gemini 3.1 Pro Preview は非公開
• コンテキスト — 両者とも100万トークン;Gemini 3.1 Pro Preview は出力が65,536トークンで上限、MiMo-V2.6-Pro は同等の上限を公表していない
• モダリティ — MiMo-V2.6-Pro はテキスト、画像、動画、音声に対応し、Gemini 3.1 Pro Preview はテキスト、画像、PDF、音声、動画に対応する
• リスト価格 — MiMo-V2.6-Pro 100万トークンあたり $0.43 / $0.87、Gemini 3.1 Pro Preview 入力200K以下で $2.00 / $12.00、200K超で $4.00 / $18.00
• キャッシュ — MiMo-V2.6-Pro 99%割引、Gemini 3.1 Pro Preview はキャッシュ読み取り100万回あたり$0.20
• 速度 — MiMo-V2.6-Pro 134.3 出力トークン/秒、Gemini 3.1 Pro Preview 121.8
• 初回トークンまでの時間 — MiMo-V2.6-Pro 2.15秒、Gemini 3.1 Pro Preview 63.62秒
• インデックスを実行するための実測コスト — MiMo-V2.6-Pro $206.66、またはタスクあたり$0.13;Gemini 3.1 Pro Preview $1,310.21、またはタスクあたり$0.67

本当の違いはプレビューラベルにあります
ここまでがすべて仕様である。この比較全体の読み方を変える一行は「プレビュー」という言葉だ。プレビューモデルとは、Google がそのエンドポイントで提供し続けることを確約していない候補にすぎない。これは比較ページにとって、16ポイントのインデックス差などとは比べものにならないほど重要である。なぜなら、半年後にも存在していると信頼できないモデルは、標準採用するモデルではないからだ。そして Google 自身のファミリーもすでにそれを通り過ぎている。Gemini 3.6 Flash と Gemini 3.8 Flash は、コーディングとエージェント作業において、より低いコストで Gemini 3.1 Pro の上位に位置する。だからこそ、3.1 Pro リリースに関するある技術レビューは、それを紛れもなく前世代だと評した。AA のページ自体も、知能において 202 中 71 位と記載している。
Xiaomiのモデルは正反対の立場にある。今週出荷され、重みはMITの下で公開されており、サービング特性こそが最大の強みだ。毎秒134.3出力トークンで、速度を測定した114モデル中11位につけており、初回トークンまでの2.15秒は、Gemini 3.1 Pro Previewの63.62秒より約30倍速い。インタラクティブなアプリケーションにとって、それは決め手ではない。製品とデモの違いであり、ベンチマーク表では最も見えにくい数字だ。
お金は実際どこへ行くのか
トークン単位の計算では、この2つの差を過小評価してしまう。なぜなら、同じ仕事を終えるのに両モデルが消費するトークン数は同じではないからだ。より明確な数字は、Artificial Analysisが各モデルに対して完全なIntelligence Indexを実行するために測定したコストだ。MiMo-V2.6-Proは206.66ドル、Gemini 3.1 Pro Previewは1,310.21ドル。同じスイート、同じハーネス、同じ方法で測定 — 同一のタスクセットで6.3倍の差であり、推論モデルが思考に多くのトークンを出力するという事実をすでに考慮に入れたものだ。Gemini 3.1 Pro Previewはインデックス全体で6,700万出力トークンを生成した。同価格帯のモデルの中央値は9,000万なので、ポイントあたりでは実際には同価格帯の他のモデルより経済的であり、それでも評価コストはXiaomiのモデルの6倍かかる。
次に、それに対して本番運用のループを回してみましょう。30ステップのエージェント実行で、各ステップ 200,000 トークンのコンテキストを読み、各ステップ 2,000 トークンを書き込む場合、1回の実行あたり 600万の入力トークンと 60,000 の出力トークンになります。Gemini 3.1 Pro Preview の 200K 未満のティアでは、入力が $12.00、出力が $0.72 で、1回の実行あたり $12.72 です。MiMo-V2.6-Pro では $2.58 と $0.05 で、$2.63 です。Google のモデルで入力 200,000 トークンを超えると、入力レートは $4.00 に倍増し、その時点で同じループは出力分を除いて $24.00 かかります。キャッシュはどちらの数値も変えますが、安価なモデルでの99%割引と、高価なモデルでの$0.20のキャッシュ読み取りを比べても、コンテキストの多いループでは高価なモデルが一桁高いままです。

正直に言えば、ルーティングの問題
ここが間違いやすいところです。Gemini 3.1 Pro Preview は OrcaRouter 上に google/gemini-3.1-pro-preview として存在し、OpenAI 互換の単一キーで、プロバイダー定価・マークアップ0%で利用できます。つまり Google が価格を変更しても、次の請求サイクルを待たずにその当日からこちら側にも反映されます。Xiaomi MiMo-V2.6-Pro は OrcaRouter にはありません。Xiaomi のモデルは一つもなく、そうとはっきり言うほうが、モデルページでそうでないかのように匂わせるより役に立ちます。今日それを利用するには、Xiaomi 自身のプラットフォームか、それを掲載しているサードパーティのカタログのいずれかを使うことになります。
その非対称性こそが、ルーターがこの比較において脚注ではなく、確たる地位を得る理由である。2つのモデルは同じリクエストを奪い合っているわけではない。Gemini 3.1 Pro Preview は、すでに料金を支払っているかもしれない既存のモデルであり、このページが答える問いは、新しい安価なモデルがそのトラフィックの一部を引き受けられるかどうかである。このテストをきちんと行うには、自分のプロンプトを両方に送って回答を比較する必要があり、指標を読むだけでは不十分だ。そしてそれを、2つ目の契約、2つ目のキー、2つ目の請求関係を開くことで行うとなれば、その摩擦がテストを永遠に実施不能にする。キーは1つ、レーンは両方、ルーティングはこちらで行えば、比較は設定変更で済む。自動フェイルオーバーはもう半分を担う。プレビューモデルは予告なく提供終了やレート制限を受けることがあり、同じエンドポイントの背後に2つ目のレーンがあれば、それが障害ではなくルーティングの判断に変わる。

どちらを選ぶべきか
PDFと音声入力をネイティブに扱う必要があるタスクのとき、すでにGoogleのエコシステム内にいるとき、あるいはそのモデル固有の挙動がどうしても必要でプレビュー版エンドポイントの非推奨リスクを受け入れられるときには、Gemini 3.1 Pro Previewを選びましょう。最初のトークンまでの63秒という所要時間は、マーケティングが対話性について何と言おうと、実際にはこれがバッチおよびオフライン処理向けのモデルであることを意味しています。
処理量が制約になるとき、ループがコンテキストを大量に含み反復的であるとき、重みを自前のハードウェア上に置きたいとき——MITは商用展開、改変、追加学習を許可している——、あるいは初回トークン遅延が製品の一部であるときには、MiMo-V2.6-Proを選ぼう。安価なモデルでありながら高速でもあるという珍しい例であり、その組み合わせは、16のインデックスポイントが示す以上に価値がある。
この構図を変えるのは、Gemini 3.1 Pro の、プレビューではない後継モデルか、Xiaomi が自社ハーネスで公開した DeepSWE の数値を独立に再現した結果だろう——Pro は 72.57、Flash は 65.68 で、強化学習ランを通じてそれぞれ 58.4 と 48.8 から推移している。これらの数値はベンダー自己申告であり、Xiaomi の採点器上で mini-swe-agent を用いて3回平均で評価されたもので、公開リーダーボードには提出されていない。誰かがそれらを再実行するまでは、引用すべき数値は Artificial Analysis の 46 であり、それは 30 と同じ物差しで測定されている。
OrcaRouterは、200以上のモデルを1つのOpenAI互換エンドポイントでプロバイダーの定価のまま、マークアップ0%で提供しているため、ベンダーの価格変更は当日に反映されます。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
