
MiMo-V2.6-Pro 対 GPT-5.6 Sol:インデックス1ポイント、ブレンド料率は22倍
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
On the Artificial Analysis Intelligence Index v4.3.2, read on 22 September 2026, the vendor's GPT-5.6 Sol at maximum effort scores 47 and Xiaomi's MiMo-V2.6-Pro scores 46. One point. The blended rates Artificial Analysis publishes for the two — a 7:2:1 cache-hit, input, output mix — are $3.08 for GPT-5.6 Sol and $0.18 for MiMo-V2.6-Pro. Twenty-two times the money for one index point is the entire shape of this matchup, and the interesting question is not whether the point is worth it. It is which specific requests the point lives in, because the aggregate does not tell you.
そもそもこのペアを比較する価値があるのは、両者が明らかに同じカテゴリーに属しているわけではないからだ。GPT-5.6 Solは、マルチエージェントモードを備えた独自開発のフロンティアモデルで、それに見合った価格設定がなされている。Xiaomi MiMo-V2.6-Proは、MITライセンスのオープンウェイトのチェックポイントで、2026年9月22日にリリースされ、前日には強化学習リポジトリが公開された。そして、中堅モデルであるかのような価格が付けられている。1兆パラメータのオープンモデルがOpenAIのフラッグシップに1ポイント差以内で到達したことがニュースだ。その事実をどう扱うかは別の判断だ。
平たく言えば、これら2つのモデルは
GPT-5.6 Solは、TerraおよびLunaと並ぶGPT-5.6ファミリーのフラッグシップとして2026年7月9日にリリースされ、OpenAIは素のgpt-5.6エイリアスをこれにルーティングしている。プロプライエタリであり、テキストと画像を入力として受け取りテキストを返し、noneからxhighまでの推論エフォートに加えて、Sol専用の「ultra」マルチエージェントモードをサポートし、2026年2月の知識カットオフを備える。定価はOpenAIのファーストパーティAPIで、入力100万トークンあたり4.00ドル、出力100万トークンあたり20.00ドル、キャッシュ済み入力は0.50ドルで、コンテキストウィンドウは100万トークン。Artificial Analysisの測定では、毎秒77.3出力トークン、初回トークンまで127.21秒、インデックス全体を実行するコストは3,464.84ドルであった。
Xiaomi MiMo-V2.6-Proは、総パラメータ数1.02兆、トークンあたり420億が活性化されるスパースなMixture-of-Expertsモデルで、100万トークンのコンテキストウィンドウと、テキスト・画像・動画・音声にわたるネイティブなマルチモーダル対応を備えています。Xiaomiは新しいチェックポイントに合わせて価格を引き上げるのではなく、前世代の価格を維持したため、この規模のモデルが100万トークンあたり$0.43と$0.87、99%のキャッシュ割引という価格で提供されています。Artificial Analysisの測定では、出力134.3トークン/秒、最初のトークンまで2.15秒、インデックスの実行コストは$206.66、タスクあたり$0.13でした。
重み — MiMo-V2.6-Pro は MIT ライセンスでダウンロード可能、GPT-5.6 Sol はプロプライエタリで API のみ
• パラメータ — MiMo-V2.6-Pro 総計1.02T / アクティブ42B、GPT-5.6 Sol 非公開
• コンテキスト — どちらも100万トークン、GPT-5.6 Sol は出力を128Kに制限
• モダリティ — {{1}}MiMo-V2.6-Pro{{/1}}はテキスト、画像、動画、音声を扱うのに対し、{{2}}GPT-5.6 Sol{{/2}}の公開されている入力サーフェスはテキストと画像です
• 定価 — MiMo-V2.6-Pro 100万あたり $0.43 / $0.87、GPT-5.6 Sol $4.00 / $20.00、キャッシュ済み入力 $0.50
• 混合レート — MiMo-V2.6-Pro 100万あたり$0.18、GPT-5.6 Sol $3.08
• インデックスタスクあたりの実測コスト — MiMo-V2.6-Pro $0.13、GPT-5.6 Sol はインデックス全体で $3,464.84
• 速度 — MiMo-V2.6-Pro 134.3 出力トークン/秒、GPT-5.6 Sol 77.3
• 初回トークンまでの時間 — MiMo-V2.6-Pro 2.15秒、GPT-5.6 Sol 127.21秒
• 推論制御 — GPT-5.6 Sol は none/low/medium/high/xhigh/max に加えてウルトラ・マルチエージェントモードを公開している;MiMo-V2.6-Pro は同等の段階を公開していない

その一点が実際にどこに位置するのか
10項目の評価からなる複合スコアにおける1点差は、集計値のレベルでは丸め誤差であり、構成要素のレベルでは深い断絶である。このスイートは、AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1 を対象としており——推論、知識、数学、コーディング——そして両ベンダーとも、これら2モデルについて評価項目別の内訳を公開していない。この欠如は、本ページの双方にとって現実の制約であり、複合スコアで覆い隠すのではなく、明言する価値がある。
記録に残っているものは方向性を示しており、それはエージェント型の作業こそがギャップの集中する場所であることを指し示している。GPT-5.6 Sol の発表資料は、55分野にわたる長期のプロフェッショナル業務フロー評価である Agents' Last Exam で 53.6% を報告しており、OpenAI はこれを新記録と述べた。SWE-Bench Pro では 64.6%、Terminal-Bench 2.1 では 88.8%、コンピュータ操作向けの OSWorld 2.0 では 62.6%。BrowseComp のスコアは 90.4% で、約4倍のトークンコストで4つの並列サブエージェントを実行する ultra モードでは 92.2% に上昇する。これらはベンダー自身のハーネスによるベンダーの数値であり、いつもの注意事項がそのすべてに当てはまる——だが、これらは複合スコアの1ポイント差が均等に分布している可能性が最も低いカテゴリーであり、Xiaomi は MiMo-V2.6-Pro について比較可能なエージェント関連の内訳を公表していない。
つり合いを取る要素は、MiMo-V2.6-Pro 自身のベンダー公表値がまったく別のタスクファミリーに属しているという点だ。Xiaomi の報告によれば、このモデルは強化学習の実行を通じて DeepSWE v1.1 で 58.4 から 72.57 に伸びており、評価は Xiaomi 自身の採点器で mini-swe-agent を使った3回平均、公開ボードへの提出は一度もない。72.57 をいかなる Sol の数値の隣に置くのも、存在しない比較をでっち上げることになる。両モデルが同一の評価者によって実際に実行された唯一の数値は、46 と 47 だ。
コスト比較をきちんと
トークンあたりの計算では、この差は過小評価される。同じ作業を完了するのに、両モデルが消費するトークン数は同じではないからだ。公平に比較できる単一の数値とは、Artificial Analysis が各モデルに対してフルインデックスを実行するために測定したもので、MiMo-V2.6-Pro が $206.66、GPT-5.6 Sol が $3,464.84 だ。同じスイート、同じハーネス、同一条件で測定しており、管理されたタスクセット上での16.8倍の差である——しかもこれは、Sol が思考のためにトークンを出力する推論モデルであるという事実をすでに織り込んでいる。
さて、本番運用のループだ。1ステップにつき200,000トークンのコンテキストを読み、2,000トークンを書き込む30ステップのエージェント実行は、1回あたり600万入力トークンと60,000出力トークンになる。GPT-5.6 Solの定価では、入力が$24.00、出力が$1.20、つまりキャッシュなしで1回あたり$25.20だ。MiMo-V2.6-Proでは$2.58と$0.05、つまり$2.63になる。キャッシュは両方を変える。Solのキャッシュ済み入力は$0.50で、MiMo-V2.6-Proの99%割引と比べても、コンテキストが重いループでは高価なモデルのほうが依然としてコストで桁違いに先行する。そしてそれはまさにエージェントが回すループなのだ。
比較のレイテンシ側面は価格側面よりも鮮明で、注目されることも少ない。GPT-5.6 Solは最初のトークンまで127.21秒と測定された。MiMo-V2.6-Proは2.15秒だった。それは59倍の差であり、インタラクティブな製品がそもそも可能かどうかを決める数字だ。最大努力時のSolは事実上バッチモデルである — 送信し、待ち、戻ってくる。もしあなたのアプリケーションが最初のトークンでブロックするなら、インデックスが何と言おうと、選択はすでにあなたのために決まっている。

1つの鍵で、両方のレーン
両モデルとも、単一のOrcaRouterキーを通じて、プロバイダーの定価・マークアップ0%で利用できます。GPT-5.6 Solはopenai/gpt-5.6-solとして利用可能で、これが当社独自のルートです。当社はプロバイダーの定価をマークアップなしでそのまま通しているため、どちらか一方の価格が変更されれば、再見積もりを待つことなく、当日中に当社側でも反映されます。
ルーティングDSLこそ、この組み合わせが単に便利というだけでなく面白くなる場所だ。インデックスが1ポイントしか離れておらず、タスクあたりのコストが16倍異なる2つのモデルは、どちらかを選ぶ代替案ではない。それらは2車線構成なのだ。ワークロードの大半は安価な車線に送り、残りのテールは自分で定義した述語に基づいて高価な車線へルーティングする。自己チェックに失敗するリクエスト、複雑さのルールに一致するリクエスト、失敗コストがトークンコストを十分に上回るため、そのポイントが安価な保険になるリクエストなどだ。フェイルオーバーはそのもう半分である。Solは広く提供されている。MiMo-V2.6-Proは今週ローンチされ、Artificial Analysisが捕捉した時点では単一のAPIプロバイダーによってリストされていた。これは、本番経路に置くモデルにとって薄いルートだ。フォールバックできるルーターがあってこそ、安価な車線を安全に採用でき、また高価な車線を必須ではなく任意にできる。

どちらを選ぶべきですか
タスクの失敗コストがトークンコストをはるかに上回るときには GPT-5.6 Sol を選べ — 実際の副作用を伴う長期的なエージェント作業、コンピューター操作の自動化、誤った呼び出しが遅い呼び出しよりも悪いツール利用、すでに人間にアウトプットの確認を任せて支払っているあらゆる場面。$3,464.84 のインデックス実行は、それを避ける理由にはならない。それはこのティアの価格であり、そのティアには存在する理由があるのだ。
ボリュームが制約条件であるとき、ワークロードがコンテキスト中心で反復的であるとき、人間が待てる程度に初回トークンのレイテンシを低くする必要があるとき、重みを自社インフラに置きたいとき——MITは商用展開、改変、さらなる学習を許可している——、あるいは1000トークンあたり0.2セントでしか単位経済が成り立たないときに、MiMo-V2.6-Proを選べ。その毎秒134.3トークンは、ほとんどの1兆パラメータオープンモデルにはない形で対話的に使えるようにする。そしてそれは割引ではなく、能力だ。
ルーターがあるなら両方を選べ。というのも、「どちらが優れているか」に対する正直な答えは、1ポイントの総合スコア差は断定ではなく、平均でどれほど似ているか、そして裾ではどれほど異なる可能性が高いかの測定にすぎないからだ。避けるべき失敗パターンは、比率が22倍だからといって安価なモデルに標準化し、3か月目に、ある種のリクエストには高価なモデルが必要だと気づき、そこへルーティングする道がないことだ。鏡像的な失敗は、46インデックスのモデルがまったく同じに仕上げる要約作業にSolの料金を払うことだ。どちらもモデルの問題ではない。どちらも設定であり、設定は火曜日の午後に変更できる部分なのだ。
OrcaRouterは、200以上のモデルを1つのOpenAI互換エンドポイントでプロバイダーの定価のまま、マークアップ0%で提供しているため、ベンダーの価格変更は当日に反映されます。
