
MiMo-V2.6-Pro 対 GPT-5.6 Sol:インデックス1ポイントのコストはタスクあたり15倍
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 36 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 181 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
Artificial Analysis Intelligence Index v4.3.2 では、2026年9月25日時点で、GPT-5.6 Sol は最大努力設定で47点、Xiaomi の MiMo-V2.6-Pro は46点を記録している。1点。実際に両者を分けている数字はスコアではなく、トークンあたりの料金でもない。それはインデックスタスク1件あたりのコストであり、Artificial Analysis は GPT-5.6 Sol を1.99ドル、MiMo-V2.6-Pro を0.13ドルと公表している。1点のために15倍の金額。そしてこの参照時点では、評価元自身によるそのモデルのページに非推奨通知が掲載されている。GPT-6 Sol がそれに取って代わったためだ。
Xiaomiは2026年9月21日、本稿の4日前にMiMo-V2.6-Proの重みと技術レポートを公開した。OpenAIは2026年7月9日にGPT-5.6 Solをリリースした。この組み合わせが前回記事にされて以降、上記の2つの事実はいずれも新しく、しかも互いに逆方向に作用する。非推奨通知は、その比較がOpenAIにとってすでに乗り越えたモデルに対するものだと示している。タスクごとの数値は、両モデルが定価で提示されていたときには丸め誤差のように見えたものが、実際のワークロードでは判断のすべてになることを示している。この2つのどちらが重要かは、モデルを新規に購入するのか、既存のモデルを置き換えるのかによって決まる。
2つのページが今、何を伝えているか
GPT-5.6 Solは2026年7月9日に、GPT-5.6ファミリーのフラッグシップとしてリリースされた。その定価はOpenAIのファーストパーティAPIで入力トークン100万あたり4.00ドル、出力トークン100万あたり20.00ドルで、キャッシュ割引は90%であり、ページにはインデックス実行全体で生成された出力トークンが9,000万、中央値8,800万と記録されている。毎秒73出力トークンを計測し、同じページでは中央値72 t/sに対して平均より速いとされている。そのインデックス項目は、同クラス210モデル中19位に位置する。
Xiaomi MiMo-V2.6-Proは、総パラメータ数1.02兆、アクティブパラメータ420億の疎なMixture-of-Expertsチェックポイントで、MITライセンスの下に提供され、100万トークンのコンテキストウィンドウを持ち、テキスト、画像、音声、動画の入力に対してテキスト出力を行います。価格は100万トークンあたり0.43ドルと0.87ドルで、99%のキャッシュ割引が付き、Solの入力レートの10分の1、出力レートの23分の1です。インデックス実行では1億4000万の出力トークンを生成し、毎秒43.6出力トークンを計測しましたが、そのページでは、中央値67.1 t/sに対して顕著に遅いと説明されています。
• インデックスタスクのコスト — MiMo-V2.6-Pro $0.13、GPT-5.6 Sol $1.99 — その差は15倍 • 定価 — MiMo-V2.6-Pro 100万トークンあたり $0.43 / $0.87、GPT-5.6 Sol $4.00 / $20.00 • キャッシュ割引 — MiMo-V2.6-Pro 99%、GPT-5.6 Sol 90% • インデックス実行時の出力トークン — MiMo-V2.6-Pro 140M、GPT-5.6 Sol 90M • 出力速度 — MiMo-V2.6-Pro 43.6 t/s(中央値67.1に対して)、GPT-5.6 Sol 73 t/s(中央値72に対して)• コンテキストとモデル重み — MiMo-V2.6-Pro 1MかつMITライセンス、GPT-5.6 Sol 1Mかつプロプライエタリ

非推奨の通知のほうが、より重要な一行だ
Artificial Analysis は現在、GPT-5.6 Sol のページを開くと枠囲みの注記を表示する。「このモデルは非推奨です。デフォルトの10k入力トークン・ワークロードについてのみ、性能ベンチマークを継続します」。続けて、OpenAI がより新しいモデル GPT-6 Sol (max) をリリースしており、代わりにそちらを検討すべきだという一文が続く。したがって、インデックス上の47は、もはや買うべき対象ではないモデルの測定値だ。だからといってその測定値が誤りになるわけではない——それは46と同じインデックス、同じ日、同じエフォート設定で測定されたものだ——が、比較の目的を変えてしまう。もはや「どのフラッグシップを使うべきか」ではない。「プロプライエタリ・ボードの頂点は、それが頂点だった時点でいくらなのか」である。
その再定義は、聞こえ以上に重要だ。なぜなら、評価者ページの非推奨通知は、ベンダーの製品ケイデンスがプレスリリースではなくデータ変更として現れる、数少ない場所の一つだからだ。スコアは凍結されており、モデルは提供されていない。47 に対して何かを作ることは、スナップショットに対して作ることになる。

なぜタスクごとの数値こそがモデル化の基準となるのか
トークン単価は安価なモデルを実際より良く見せ、トークン中立でないワークロードでは誤解を招く。インデックスタスクのコストは別の測定値である。それは、評価者が各モデルから1つの回答を引き出すために実際に費やした額であり、単価と、モデルが出力することを選んだトークン数の両方を織り込んでいる。MiMo-V2.6-Proはインデックス実行でSolよりも多くのトークンを出力する——1億4000万対9000万、約1.6倍——それでも$0.13/タスクで、$1.99に対してである。単価の優位は出力でおよそ23倍、冗長さのペナルティは1.6倍、その積がタスクあたり15倍の差である。
それがコストモデルを構築すべき算術であり、$0.87と$20.00を比較してそこで止めると見えなくなる算術でもある。それはまた、何が結論を覆すかも教えてくれる。ワークロードがごく短い出力に支配されているなら、Solのトークン数はあなたの水準へと縮まり、23倍の料金レート差が大半を占めるため、実際の倍率はレート差から離れるどころか、レート差に近づく。ワークロードが長い推論トレースに支配されているなら、MiMo-V2.6-Proの1.6×の冗長性が積み重なり、$0.13は見積もりではなく上限になる。公表された数値は、あるベンチマークの形を測ったものであって、財務部門にそのまま渡せる見積もりではない。
レイテンシーの行は、正直な対抗軸だ
毎秒43.6出力トークンでは、MiMo-V2.6-Proは、同じ日に73で測定されたGPT-5.6 Solより遅く、自身のページが比較対象としているモデル群よりも遅い。その中央値は67.1だ。そのページにもはっきりと書かれている。「著しく遅い」。バッチパイプラインにとって、これは価格に換算できるスループットコストだ。対話型エージェントにとっては製品上の判断であり、タスクあたり15倍安いからといって、遅いモデルが速くなるわけではない。制約が月額請求額ではなくターンごとの予算なら、重要な比率は43.6対73であり、MiMo-V2.6-Proはそれに負ける。
これがルーター上でどこに配置されるか
この組み合わせの有用な形は「どちらかを選ぶ」ことではありません。両方のモデルが同じインデックスに応答し、評価者がタスクごとのコストをそれぞれ公開するため、ベンダーの階層ではなく実測コストに基づいて振り分けを行えるという点にあります。OrcaRouter ではカタログは200 以上のモデルにわたり、各プロバイダーの定価で 0% のマークアップのもと、1 つのキーの背後に並びます — ベンダーの値下げはその日のうちに請求書へ反映され、再交渉すべき 2 つ目の契約もありません — そしてルーティング DSLを使えば、ワークロードは安価で大量の呼び出しを一方のモデルへ、難しい呼び出しを別のモデルへと、ブランドではなくタスク単位で振り分けられます。安価なルートが劣化しているケースは自動フェイルオーバーがカバーします。Xiaomi MiMo-V2.6-Pro は当社のルートにはありません — プロバイダーがオンボーディングを済ませる前に当社がモデルを掲載することはないためです — ですから、比較のその側について正直に言えるのは、ベンダー自身の API、あるいはすでに関係のあるホスト型プラットフォームのいずれかです。

来週までにこれをどうするか
2026年9月25日に2つのことが変わり、そのうち価格に関するのは1つだけだ。GPT-5.6 Solは、測定値が47だったインデックス上で非推奨通知が付いており、これによって購入判断の対象から引退し、ベンチマーク参照として残る。MiMo-V2.6-Proはインデックスタスクあたり$0.13と測定され、Solの$1.99と比べて1インデックスポイントあたり15倍の金額になる。さらに毎秒43.6トークンで、比較対象のモデルより遅く、同クラスの中央値よりも遅い。どちらの数値も決定事項になる前に、この2つの数値を自分のトラフィックに当てはめてみよう。タスクあたりコストは測定値であってレートではなく、レイテンシは測定値であって意見ではない。出力が短く非対話型なら、オープンチェックポイントを選ぶ根拠は、インデックスの差が示唆するよりも強い。出力が長いか、ユーザーが待っているなら、15倍の節約はより遅い製品を買うことになり、それは自分のワークロードにしか値付けできないトレードオフだ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
