
MiMo-V2.6-Pro vs Qwen3.8-Max:インデックス1ポイント、価格は6倍
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-Maxは2.4兆パラメータのモデルで、トークンごとにそのうち950億を活性化し、単一のプロバイダー上で動作する。Xiaomi MiMo-V2.6-Proは1.02兆パラメータのモデルで、トークンごとに420億を活性化し、同じ独立系インデックスで1ポイント高いスコアを出し、呼び出しコストは約6分の1だ。これらの事実は並べるとぎこちなく、それをどう解釈するかが、この2つのどちらを選ぶかの判断そのものになる。要約すると、Artificial Analysis Intelligence Index v4.3.2では、Xiaomi MiMo-V2.6-Proが46、Qwen3.8-Maxが45で — ノイズの範囲内の引き分け — 一方、価格表は100万トークンあたり$0.43と$0.87で、$2.00と$6.00と対比される。
各モデルの正体
Qwen3.8-MaxはAlibabaのフラッグシップであり、2026年8月3日から一般提供されている。登場時点で、Qwenシリーズがこれまでに投入した中で最大のモデルだった。Qwen 3.5アーキテクチャに基づくスパースなMixture-of-Expertsで、総パラメータ数2.4兆、トークンあたり約950億がアクティブ、100万トークンのコンテキストウィンドウ、最大131,000トークンの出力、テキスト・画像・動画にまたがるマルチモーダル入力に対応する。Alibabaは国際料金を入力100万トークンあたり$2.00、出力100万トークンあたり$6.00に引き下げ、キャッシュ済み入力は$0.25とし、これはClaude Opus 5の入力価格のおよそ40%だと売り込んだ。ポイントアップデートのQwen3.8-Max-0902が2026年9月2日に続き、Artificial Analysisが現在45とベンチマークしているのはこれである。
Xiaomi MiMo-V2.6-Proは2026年9月22日に一般提供を開始した。これはこの比較記事が書かれる3日前のことで、強化学習のチェックポイントリポジトリは一般提供開始の前日に公開された。総パラメータ数1.02兆、トークンあたり420億のアクティブパラメータを持つスパースなMixture-of-Expertsであり、同じ100万トークンのコンテキストウィンドウ、テキスト・画像・動画・音声にわたるネイティブなマルチモーダル性を備え、重みはMITライセンスの下で公開されている。シャオミは新しいチェックポイントの価格を引き上げず、前世代の価格を維持した。そのため、99%のキャッシュ割引付きで$0.43と$0.87、ブレンド価格$0.18で提示されている。
• トークンあたりのアクティブ計算量 — Qwen3.8-Max 95B、Xiaomi MiMo-V2.6-Pro 42B、半分以下
• 総パラメータ数 — Qwen3.8-Max 2.4T、Xiaomi MiMo-V2.6-Pro 1.02T
• インデックススコア — Xiaomi MiMo-V2.6-Pro 46、Qwen3.8-Max 45、いずれもArtificial Analysis v4.3.2上
• 出力速度 — Xiaomi MiMo-V2.6-Pro 134.3トークン/秒、Qwen3.8-Max 39.2、同ティア中央値72.5に対して
• 初回トークンまでの時間 — Xiaomi MiMo-V2.6-Pro 2.15秒、Qwen3.8-Max 2.93
• 定価 — Xiaomi MiMo-V2.6-Pro は100万あたり $0.43 / $0.87、Qwen3.8-Max は $2.00 / $6.00
• 混合レート — Xiaomi MiMo-V2.6-Pro はキャッシュヒット/入力/出力が 7:2:1 で 100万トークンあたり $0.18、Qwen3.8-Max は $1.18
• 重み — Xiaomi MiMo-V2.6-Pro は MIT ライセンスでダウンロード可能。Qwen3.8-Max はプロプライエタリなエンドポイントとして提供され、1M コンテキストと視覚入力を削ったテキスト専用のオープンウェイト版がリリースされた
• 到達可能性 — Artificial Analysis 上ではそれぞれにつき 1 つの API プロバイダーをカウント
スコアは同点。スピードはそうではない。
10項目の評価を合成したスコアでの1点は、誰もそれに基づいて行動すべき差ではない。より有用なシグナルは、その背後で何が起きたかだ。トークンあたりのアクティブパラメータが半分未満のモデルは、わずかに高いスコアを出し、出力生成は3.5倍高速だった — 毎秒134.3トークン対39.2で、同等の推論モデルの中央値は72.5だ。Qwen3.8-Maxはそのページで測定されたフロンティアクラスのモデルの中で最も遅く、これはサービング上の偶発的な問題ではなく、トークンあたり950億パラメータをアクティブ化する設計上の帰結だ。
レイテンシは、パラメータ数が示唆する話とは逆の話を語っている。Qwen3.8-Max は最初のトークンに 2.93 秒で到達するのに対し、Xiaomi は 2.15 秒で、その差はスループットの差よりもはるかに小さい——Qwen3.8-Max は書き始めてから遅いのであって、開始が遅いのではない。回答が短いチャットインターフェースでは、その違いはほとんど表面化しない。数万の出力トークンを生成するエージェントループでは、スループットが実時間のすべてであり、3.4 倍の差は実行の各ターンごとに積み重なっていく。

ベンダーの表が食い違っている箇所と、それが矛盾ではない理由
AlibabaはQwen3.8-Maxについて広範な表を公開しており、それは本当に強力だ:Terminal-Bench 2.1が86.6、SWE-bench Proが67.7、PaperBenchが93.0、GPQA Diamondが92.6、IFBenchが82.8、OSWorld-Verifiedが86.1、Humanity's Last Examが43.6。これらはAlibaba自身のハーネス上でベンダーが実行した数値であり、一部はAlibaba独自のベンチマークによるものなので、測定値というより主張である——しかし、広く使われているベンチマークに関する主張であるため、特注ハーネスの結果よりもラボ間で比較しやすい。
Xiaomiのヘッドライン数値はDeepSWE v1.1で72.57であり、ベースラインの58.4から上昇した。これはXiaomi自身のグレーダーで3回の平均でmini-swe-agentを用いて測定され、Xiaomiが30ステップ、約75万のトラジェクトリ、公表された支出約262万ドルと記録した強化学習の実行によるものである。これは公開のDeepSWEリーダーボードに提出されておらず、第三者が再現したこともない。72.57をQwenの67.7 SWE-bench Proと比較し、Xiaomiの5ポイント勝利を宣言するのは、2つの異なるベンチマーク、2つの異なるハーネス、2つの異なる採点方式をまたいで読むことになる。両方のモデルが製作者以外の誰かによって実行された尺度はただ一つだけであり、それは46対45を示している。
Qwen3.8-Max のより重大な数字のうち2つは、実はスコアですらない。Alibaba は、Qwen3.8-27B とともに重みをオープンソース化すると発表したが、実際に登場したチェックポイントはテキスト専用であり、提供中の Max エンドポイントが持つ100万トークンのフルコンテキストや視覚入力は備えていない。つまり「Qwen3.8-Max はオープンウェイトである」と「Qwen3.8-Max はマルチモーダルな100万コンテキストのエンドポイントである」は、どちらも異なる成果物についての真実の記述であり、前者に基づいてデプロイ計画を立てながら後者を期待するなら、それは現実と接触した時点で持ちこたえないだろう。一方、0902 のポイントリリースは、バージョン番号を変えることなく、このモデルをある公開ウェブ開発アリーナの首位に押し上げた――8月にベンチマークしたモデルが、9月にあなたのリクエストを処理しているモデルとは限らない、という注意喚起である。
オープンウェイトとは、どちらでもセルフホストできるという意味ですか?
Xiaomi MiMo-V2.6-Proについては、原則としては可能です。MITライセンスであり、商用契約は不要です。実際には、42Bアクティブの1.02Tパラメータのチェックポイントにはマルチノードのサービングクラスタが必要で、これはAPIを呼び出すのとは次元の異なるコミットメントです。重みを公開してもセルフホスティングが合法になるだけで、安くなるわけではありません。
Qwen3.8-Max について言えば、答えは評判が示唆するよりも限定的だ。オープンリリースはテキスト専用で、完全なコンテキストウィンドウも備えていない。そのため、それをセルフホストしても、45 が測定されたモデルより実質的に小さいモデルしか手に入らない。求めるのがベンチマーク済みの構成なら、提供されるエンドポイントこそが製品であり、そのエンドポイントはプロプライエタリだ。
どちらかを呼び出すこと、そしてそれを決める算術
Artificial Analysisでは両モデルとも単一のAPIプロバイダーでカウントされています。これは2つのフラッグシップモデルとしては異例であり、フェイルオーバーを「あれば嬉しい機能」ではなく実務上の課題にしています。Qwen3.8-MaxはOrcaRouter上で qwen/qwen3.8-max — Alibabaの正規リスト価格のまま、マークアップ0%のOpenAI互換エンドポイント1つとして提供されています。つまり上記の$2.00と$6.00はそのまま反映され、Alibaba側での価格変更は同日中に当社側でも有効になります。当社独自の計測では、このエンドポイントのp50は約3.3秒であり、理論上の最良ケースではなくこの数値を前提に計画すべきです。またフォールバックチェーンにより、応答が始まる前にリクエストが滞留すると別のアップストリームへ再試行されます。Xiaomi MiMo-V2.6-ProはOrcaRouterにはありません。Xiaomiのモデルは一切なく、現時点でそこへ到達する経路はXiaomi自身のプラットフォームと、それを掲載しているサードパーティのカタログです。
コストの計算こそが、この対決の実際の決着点であり、それは見出しの料金が示唆する計算ではない。キャッシュヒット/入力/出力が7:2:1の混合では、ブレンド料金は100万トークンあたり0.18ドルと1.18ドル——6.6倍の差で、入力の4.6倍、出力の6.9倍の差よりも大きい。Xiaomiの99%のキャッシュ割引がAlibabaの88%よりも深いからだ。Artificial Analysisはまた、Xiaomi MiMo-V2.6-ProについてIntelligence Indexタスクあたり0.13ドルのコストを記録しており、これはボード上のすべてのモデルで同一に測定されている。同じワークロードを両方で実行すると、安いほうのモデルがより高いスコアを出した。これは書けることとしては異例であり、この比較が形式的なものではない理由である。

誰が切り替えるべきで、誰がそうすべきでないか
今日Qwen3.8-Maxを使っていてそれが機能しているなら、急いで移行する理由はありません。インデックスの差は一つのポイントであり、ビジョンと長文脈の挙動はあなたのワークロードで実証されており、Alibabaはまだこのラインを開発し続けています — 0902アップデートがそれを示しています。移行の根拠はスループットと混合コストであり、それはあなたのトラフィックが出力重視または長期的である場合にのみ強い根拠となります:エージェント、コード生成、読むよりもはるかに多く書くものすべて。
新規に始めるのであれば、公表されている証拠に照らして、その順位付けに異を唱えるのは難しい。Xiaomiモデルはより速く、あらゆる軸でより安く、MITライセンスで、両方をカバーする唯一の独立実施の総合評価でもわずかに先行している。対抗材料は現実的かつ具体的だ。本番運用歴は3日、単一のサービングルート、そして確認できる公開ベンチマークの登録がないこと。この組み合わせは、既存のものを置き換えるのではなく、現行モデルの隣のレーンで評価すべきだと示している——それがルーティング設定の目的であり、スコアボードから勝者を選ぶのではなく、候補と現行モデルを1つのキーの背後に置くことが有用な一手である理由だ。

何がこの回答を変えるでしょうか
三点。Xiaomi MiMo-V2.6-Proに2つ目と3つ目のプロバイダーがあれば、それに対する唯一の構造的異論が取り除かれ、価格差は魅力的なだけのものではなく、生きた判断材料になる。DeepSWE構成の独立実行は、72.57を追認するか、あるいはそれを引退させるかのどちらかであり、どちらの結果もその数値そのものより価値がある。そしてv4.3.2の評価ごとの内訳は、10の評価のうち各モデルがどれで勝つかを示すだろう——合成スコアは合成スコアであり、エージェント型コーディングで首位に立つモデルと、検索重視の質問応答で首位に立つモデルは、同じ指標スコアを記録しながら、互いの用途には不適切でありうる。
