
MiMo-V2.6-Pro 対 GLM-5.2:2つのオープンウェイトMoE、そして差し引いてはいけないベンチマーク
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
この比較の最も怠惰な版は、Xiaomi MiMo-V2.6-Pro の 72.57 を GLM-5.2 の 46.2 の隣に置き、26ポイントの勝利と呼び、公開してしまう。それは、どちらのモデルが優れているかとは何の関係もない理由で間違っている。それら二つの数字は同じ測定ではないからだ。Xiaomi の 72.57 は mini-swe-agent を使った独自ハーネスでの3回平均であり、公開ボードに提出されたことは一度もない。46.2 はまったく別のハーネスによる Pass@1 の数値だ。Xiaomi MiMo-V2.6-Pro と GLM-5.2 の誠実な比較は別のもので、両者が実際に実行された同じ物差しの上で行われる——そしてその物差しでは、差は実在するが、26ポイントではなく12ポイントだ。
Artificial Analysis Intelligence Index v4.3.2において、2026年9月22日時点で、Xiaomi MiMo-V2.6-Proは46を記録している。GLM-5.2は34だ。どちらも中国のラボによるオープンウェイトのMixture-of-Expertsモデルで、どちらも100万トークンのコンテキストウィンドウを備え、価格も十分に安いため、両者の選択は予算ではなく能力とサービングの問題である。しかし類似点はそこまでだ。なぜならGLM-5.2は自社の開発元によって後継モデルに取って代わられており、この比較記事が掲載されているページには非推奨(deprecation)の告知が表示されているからだ。
各モデルが何であるか、そしてそれがどのような状態にあるか
GLM-5.2はZ.aiのフラッグシップモデルで、2026年6月16日にリリースされました。総パラメータ数が約7,530億、トークンあたり約400億が活性化する混合エキスパート型トランスフォーマーであり、NvidiaハードウェアではなくHuawei Ascendアクセラレータのみで完全に訓練されたと報じられています。MITライセンスの下でオープンウェイトとして提供され、FP8およびINT4量子化に対応し、100万トークンのコンテキストを保持して最大131,072トークンを出力でき、Z.ai自身のAPIでは入力100万トークンあたり$1.40、出力100万トークンあたり$4.40で提供され、キャッシュ入力は$0.26、ブレンド料金は$0.90です。Artificial Analysisの測定では、出力は毎秒72.6トークン、初回トークンまでの時間は5.98秒で、フルインデックスを実行するコストは$1,559.05でした。
Xiaomi MiMo-V2.6-Proは2026年9月22日に一般提供を開始し、その強化学習チェックポイントリポジトリは前日に公開された。これは合計1.02兆パラメータ、トークンあたり420億活性化のスパース混合エキスパートモデルであり、GLM-5.2より総パラメータが多く、活性化数はほぼ同一である。100万トークンのコンテキストウィンドウ、テキスト・画像・動画・音声にわたるネイティブマルチモーダリティ、MITライセンスの重みを備える。Xiaomiは前世代の価格を維持し、値上げしなかったため、100万トークンあたり$0.43と$0.87、99%のキャッシュ割引、ブレンド$0.18で提供されている。
• 重み — どちらもMITライセンスで、ダウンロード可能。両者が真に同等である唯一のカテゴリはこれだ
• アクティブパラメータ — MiMo-V2.6-Pro はトークンあたり42B、GLM-5.2 は約40B。ほぼ同一であるため、スコア差はスケールの結果ではなくトレーニングの結果であることを意味する
• 総パラメータ数 — MiMo-V2.6-Pro 1.02T、GLM-5.2 は約753B
• インデックススコア — MiMo-V2.6-Pro 46、GLM-5.2 34、いずれもArtificial Analysis v4.3.2による
• 定価 — MiMo-V2.6-Pro 1Mあたり$0.43 / $0.87、GLM-5.2 $1.40 / $4.40、ブレンドで$0.18 対 $0.90
• インデックスを実行するコスト — MiMo-V2.6-Pro $206.66、GLM-5.2 $1,559.05
• 速度 — MiMo-V2.6-Pro は 134.3 出力トークン/秒、GLM-5.2 は 72.6
• 初回トークンまでの時間 — MiMo-V2.6-Pro 2.15秒、GLM-5.2 5.98秒
• ステータス — MiMo-V2.6-Pro は現行かつ GA。GLM-5.2 は Artificial Analysis で非推奨となっており、同サイトは現在、デフォルトの 10k 入力ワークロードでのみこれをベンチマークしている

非推奨の通知が見出しです
Z.aiはその後GLM-5.3をリリースしており、Artificial AnalysisのGLM-5.2のページもそれを直接示している。同モデルを非推奨と位置づけ、継続的なベンチマーク作業を単一のデフォルトワークロードに限定している。これによって、このページの役割は変わった。今日新しいモデルを選ぶのであれば、本当に気にかけるべき対決はMiMo-V2.6-Pro対GLM-5.3であり、GLM-5.2ではない。そして同じv4.3.2インデックスでは、最大エフォートのGLM-5.3が45、MiMo-V2.6-Proが46。わずか1点差だ。これは本物の戦いであり、まったく別の記事になる。
GLM-5.2の比較は、依然として行う価値がある。理由はひとつ、きわめて具体的だ。2026年6月から9月にかけてオープンウェイトのフロンティアがどれほど速く前進したかを示す、これ以上なく低コストな実例だからである。およそ14週間で12インデックスポイント、しかもアクティブパラメータ数はほぼ変わっていない。その向上を生み出したものが何であれ、それは規模ではなかった。
GLM-5.2が得意としていたこと、そして今もなおそうであるかどうか
GLM-5.2 の発表資料では、コーディングと長時間稼働のエージェント型作業が前面に押し出されており、これらの数値は今もこのモデルの説明として通用する。SWE-bench Pro は 62.1 対 GLM-5.1 の 58.4、Terminal-Bench 2.1 は 81.0 対 63.5、FrontierSWE は 74.4 対 30.5。知識と数学の面では、GPQA-Diamond が 91.2、AIME 2026 が 99.2、Humanity's Last Exam が 40.5 と報告した。当時、長期ホライズンのエージェント型コーディングベンチマーク1つで全モデル中首位となり、公開のウェブ開発リーダーボードでは2位にランクされた。これらはベンダー自身のハーネス上でベンダーが報告した数値であり、いつもの留保がそのすべてに当てはまる。
Xiaomiが自社で公表したMiMo-V2.6-Proの数値は、それらとは比較できるものではなく、曖昧に示唆するのではなく、なぜそうなのかを正確に述べる価値がある。Xiaomiは、このモデルが強化学習ランを通じてDeepSWE v1.1で58.4から72.57へ上昇したと報告している。評価はmini-swe-agentを使い、3回平均で、同社独自の採点器上で行われ、そのランは30ステップ、6日未満で約75万件のトラジェクトリを完了したと記録されており、Proモデルの公表された支出額は約262万ドルである。そのいずれもリーダーボードのエントリーではない。リーダーボードのエントリーとは、明示された条件下で特定の構成についての主張であり、第三者が再実行できるものを指す。そしてXiaomiのものはそうではない。別のトラッカーは、GLM-5.2をDeepSWE — Pass@1で46.2と掲載している。これは同じタスクファミリー上の異なる指標である。72.57を46.2の隣に置いて26ポイントの差を導き出すのは、2つの異なる尺度での算術である。それは行うべきではないし、この組み合わせについて流布している最も一般的な誤りである。

それらの中から選ぶこと、そしてそれを安くするルーティング
どちらも同じライセンスのオープンウェイトであれば、判断の決め手となるのは、何を実行できるか、そしてどこから呼び出せるかです。GLM-5.2 は OrcaRouter 上で z-ai/glm-5.2 として利用できます — OpenAI 互換のエンドポイントが1つ、プロバイダーの定価を0%のマークアップでそのまま反映しているため、Z.ai の価格変更は当日中に当社側でも有効になります。Xiaomi MiMo-V2.6-Pro は OrcaRouter にはありません。Xiaomi のモデルは一つもなく、利用するには Xiaomi 独自のプラットフォームか、それを扱っているサードパーティのカタログのいずれかを使うことになります。モデルページでそうでないかのようにほのめかすより、はっきりと明記する方を選びます。
有用な帰結は、既存モデルを1つのキーで保持し、2つ目の契約なしに新参モデルをそれらと比較評価できることだ。MiMo-V2.6-Proがあなたのプロンプトで勝つなら、それを安く学べたことになる。もし勝たなければ――12ポイントという指数の差は、トークンあたりの価格差が大きいことに比べれば小さく、結果は本当にあなたのワークロード次第だ――テスト以外に何も失ってはいない。自動フェイルオーバーを備えた1つのエンドポイントの背後に両者をルーティングすることは、今週ローンチしたばかりのモデルに対する実務的な反対意見にも答える。単一のサービング経路は単一障害点であり、フォールバックできるレーンがあってこそ、新しいモデルを実際のトラフィックの前に安全に置けるのだ。

手短に言えば
今日GLM-5.2を使っていて、それが機能しているなら、アップグレードの検討先はMiMo-V2.6-Proではない——同じ系統にあるGLM-5.3であり、Xiaomiモデルとの差は1点で、移行コストはまったくかからない。ゼロから路線を選び、3つの中で最も高い実測スコアを持つオープンウェイトを求めるなら、MiMo-V2.6-Proの46がその数字であり、毎秒134.3トークンとインデックスタスクあたり0.13ドルが、それが僅差の勝利ではない理由だ。3つの中で最も安全なものを求めるなら、GLM-5.2は間違った答えだ——6月にどれほど優れていたかとは無関係な理由で。3つの中で唯一、自社ベンダーが開発を中止したモデルだからだ。
OrcaRouterは、200以上のモデルを1つのOpenAI互換エンドポイントでプロバイダーの定価のまま、マークアップ0%で提供しているため、ベンダーの価格変更は当日に反映されます。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
