
Qwen 3.8 vs GLM-5.2: 実際に重なる最初のベンチマーク
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
これら2つのモデルは、中国のオープンウェイトAIにおける対照的な賭けの最も明確な表れです。ZhipuのGLM-5.2は、洗練された実証済みのモデルです。総パラメータ数753Bで、アクティブなのは40Bのみ、監査済みのArtificial Analysis Intelligence Indexは51、ウェイトは2026年6月からダウンロード可能で、公開価格は$0.95/$3.00です。一方、AlibabaのQwen3.8-Maxは、最大主義的な賭けです。約2.4Tのパラメータ、非公開のアクティブ数、そして—つい最近まで—数字が一切ありませんでした。
2026年8月3日の一般提供により、この対決には本シリーズの他のどの記事にもない何かが備わりました:両モデルがスコアを持つベンチマークです。 Alibabaの報告によると、 Terminal-Bench 2.1におけるスコアは86.6; Artificial AnalysisはGLM-5.2を監査した結果、82.7をその同じテストでのスコアとしています。初めて、Qwenの主張は、同じ条件で独立に測定された競合他社の数字と並べて比較できます。重要な注意点として、この2つのうち一方だけが審判によって作成されました。
ビルダーへのメモ — これを決着させる最速の方法は、両方を自分のプロンプトで実行することだ。OrcaRouterは、OpenAI互換の単一エンドポイントで200以上のモデルに対応しているため、2つのSDKを接続することなく、同じタスクでQwen 3.8 MaxとGLM-5.2を比較対決させることができる。
TL;DR の結論。唯一の共通ベンチマークでは、Qwenの主張は、Terminal-Bench 2.1における3.9ポイントのリード(86.6 vs 82.7)——再現されれば本当の結果だが、Qwenの数字は自己申告で、GLMの数字は監査済みだ。他の点ではすべてGLM-5.2が実用的な利点を持つ:約2倍安く、$0.95 / $3.00で、Qwenの$2 / $6に対して、その重みは本日ダウンロード可能であり、その40Bのアクティブパラメータにより実際にデプロイ可能で、Qwenにはない独立したインデックススコア51を持つ。Qwenは1Mトークンの定額コンテキスト、GLMにないネイティブなマルチモダリティ、そしてより高い潜在能力の上限で応答する。軽量で実績のあるものは、大規模だが未検証のものに、本番環境では依然として勝る——だが、その差は8月3日に縮まった。
重要なポイント
• シリーズ初の直接ベンチマーク重複: Terminal-Bench 2.1 — Qwen3.8-Max 86.6 (Alibaba報告) 対 GLM-5.2 82.7 (Artificial Analysis、監査済み)。Qwenは3.9ポイントリードしているが、両方の数値が同等に信頼できるわけではない。
• GLM-5.2 はおよそ半額です: $0.95 / $3.001Mあたり(AAブレンド約 $0.90)と比較して、Qwen3.8-Max の$2 / $6。
• アクティブパラメータこそが実際のアーキテクチャの本質です: GLM-5.2 の稼働では 40B のアクティブパラメータが、753B の合計のうちで使用されます。Alibaba は まだ Qwen のアクティブ数を開示しておらず、そのためサービングコストをモデル化できません。
• GLMのウェイトは本日からダウンロード可能で、Qwenのものは今週中に提供される予定だが、ライセンスもリポジトリもまだない。
• GLM-5.2は監査済みインデックスが51です。Qwen3.8-Maxは未評価のままですが、前モデルのQwen3.7-Maxは46を記録し、を下回っています。GLM
• Qwenの独自の提供内容:1Mトークンのウィンドウを定額で利用でき、長いプロンプトに対する追加料金はありません。さらに、テキスト・画像・動画のネイティブ入力に対応し、OmniDocBench 1.5 92.1を達成。GLM-5.2はテキストに特化しています。
精度に関する注記:Qwen3.8-Maxの品質数値はすべてAlibaba社の報告によるもので、第三者による検証は受けていません。GLM-5.2の数値はArtificial Analysisによるものです。同じベンチマークで自己報告のスコアと監査済みのスコアを比較することは参考になりますが、決定的なものではありません。ベンダーのハーネスと評価者のハーネスは異なります。Qwenの価格はGAレートカードに基づくもので、7月のプレビュー割引に取って代わります。
スペックと価格、並べて比較
これが確かなデータです。各数値はその出典が明記されています。
• メーカー / ステータス — Qwen3.8-Max: Alibaba; GA(2026年8月3日); GLM-5.2: Zhipu; 2026年6月リリース
アーキテクチャ — Qwen3.8-Max: 約2.4T(総計)、スパースMoE;GLM-5.2: 753B(総計)、スパースMoE(Artificial Analysis)
• アクティブパラメータ — Qwen3.8-Max: Alibabaはまだ非開示; GLM-5.2: 40Bアクティブ (Artificial Analysis)
• コンテキストウィンドウ — Qwen3.8-Max: 1Mトークン、定額(推論時は983,616、最大出力131,072);GLM-5.2:1Mトークン(Artificial Analysis)
• Terminal-Bench 2.1 — Qwen3.8-Max: 86.6(Alibaba社報告);GLM-5.2: 82.7(Artificial Analysis、監査済み)
• AA Intelligence Index — Qwen3.8-Max: 未評価; GLM-5.2: 51 (Artificial Analysis)
• 他社報告のスコア — Qwen3.8-Max: GPQA Diamond 92.6, OSWorld-Verified 86.1, FrontierSWE 73.5(Alibaba社報告); GLM-5.2: 順位は第三者測定によるもの
• モダリティ — Qwen3.8-Max: テキスト、画像、動画を入力 → テキストを出力;GLM-5.2: テキスト特化
• 価格(入力/出力)— Qwen3.8-Max:$2.00 / $6.00(1Mあたり、固定料金)。キャッシュ入力は$0.25。GLM-5.2:$0.95 / $3.00(1Mあたり、AAブレンド ~$0.90)
• オープンウェイト — Qwen3.8-Max: 今週中に提供予定(ライセンスはまだ未定); GLM-5.2: はい — 本日ダウンロード可能
この比較を形作るものは二つあり、その最初のものがシリーズ全体で最も有用なデータポイントです。
まず、Terminal-Benchが重複している点は実に有益です。Terminal-Bench 2.1は、モデルが実際のシェルを最後まで操作できるかどうか、つまりコマンドを実行し、出力を読み取り、エラーから回復できるかを測定します。これは「コード提案ツールではなくコーディングエージェントとして機能できるか」という問いに対する、利用可能な最も近い代理指標であり、両ベンダーが報告を選んだベンチマークです。Qwenの86.6に対してGLMの監査済み82.7は、Qwen優勢の3.9ポイント差です。
この但し書きは重要だが、過度に強調すべきではない。ベンダーのハーネスと評価者のハーネスは、スキャフォールディング、再試行ポリシー、プロンプト構築の点で異なり、それらの選択によってTerminal-Benchのスコアは4ポイント以上変動し得る。したがって、これはQwenがより優れたエージェントモデルであることの証明にはならない。この結果が確立するのは、Qwenの自己申告による主張が、監査済みのフロンティアオープンウェイトモデルと同じ競争圏内に位置し、非現実的な領域にはないということだ。それは「未評価」よりもはるかに強い立場である。
第二に、アーキテクチャ比較こそ、GLMが静かに勝つ点です。GLM-5.2が活性化させるのは、40Bパラメータであり、それは753Bのうちです。この数字だけを見れば、サービングコスト、レイテンシプロファイル、そして十分な設備を持つチームが実際に実行できるかどうかが分かります。アリババは依然としてQwenのアクティブ数を公開していません。つまり、2.4Tという見出しが伝える内容にもかかわらず、アリババの外部の誰も、Qwen3.8-Maxのサービングコストや、自己ホストした場合の挙動を推定できないのです。Mixture-of-Expertsの比較において、これは脚注ではありません。それは最も重要な欠落した数字です。

洗練され実証済み vs 巨大だが未検証
GLM-5.2のケースは一貫したエンジニアリング上の立場に基づいています。少ないリソースでより多くを実現し、数値を公開し、ウェイトをリリースするという立場です。40Bアクティブモデルは、推論コストが安く、構造上高速で、本格的だが荒唐無稽ではないGPU予算を持つチームならデプロイ可能です。監査済みのインデックス51と、監査済みのTerminal-Bench 82.7は、購入者が何も信頼だけで受け入れていないことを意味します。そして、$0.95 / $3.00という価格は、Qwenの約半分です。
Qwen3.8-Maxのケースは逆の賭けである。可能な限り最大のモデルを構築し、能力によってコストを正当化させるという賭けだ。GAはその主張を以前よりはるかに強力なものにした。ついに数字が伴ったからだ — GPQA Diamond 92.6(大学院科学分野)、OSWorld-Verified 86.1(GUI操作)、FrontierSWE 73.5(前任モデルの40.7に対して)、そして前述のTerminal-Bench 86.6。これらはフロンティア級の数字であり、FrontierSWEでのほぼ倍増は、完全に偽造するのが難しい世代を超えた飛躍である。
しかし、2つのギャップが依然として残っており、それは7月に重要だったのと同じ2つである。一つは独立したスコアが存在しないことであり——Artificial Analysis と LMArena は Qwen3.8-Max で未スコアのままであり、したがってすべての品質主張は Alibaba 自身のものである。もう一つはライセンスが存在しないことであり、オープンウェイトの約束はまだ商業的に評価できない。
歴史的なアンカーは、ここでは他の対戦以上にQwenに不利に働く。前世代のQwen3.7-Maxが記録したのは46で、AA指数では、下回るのはGLM-5.2の51である。したがって、Alibabaの暗黙の主張は、Qwen3.8-Maxが単に優れているというだけでなく、GLMを下回る水準から一世代で大きく上回る水準へと跳躍したというものである。FrontierSWEの改善はそれに一定の信頼性を与えている。独立したスコアがあれば決着がつくであろう。

実際のコスト: 2×が落ち着く場所
エージェント型コーディングパイプラインを例にとると、リポジトリコンテキストは180,000トークン、実行ごとの出力は10,000トークンです。
• GLM-5.2: 0.18M × $0.95 = $0.171、プラス0.01M × $3.00 = $0.03。 ≈ $0.20/回。
• Qwen3.8-Max: 0.18M × $2 = $0.36、さらに0.01M × $6 = $0.06。1回あたり≈ $0.42。
• 1日3,000回の実行時: GLMは約$603/日、Qwenは約$1,260/日で、月に約$20,000の差があります。
• 安定したリポジトリでQwenのキャッシュ入力が$0.25/1Mの場合、その実行コストは約$0.11まで低下し、実際にはGLMの非キャッシュコストを下回る。
この比較の中で、最後の行が実際に最も実用的なポイントだ。Qwenの提示価格はGLMの2倍だが、100万トークンあたり0.25ドルのキャッシュヒット率は十分に攻撃的で、キャッシュを適切に活用したパイプラインなら序列を覆すことができる。エージェントが毎ターンほぼ変わらないコンテキストを読み直す場合(ほとんどのコーディングエージェントが該当する)、レート表では不利に見えても、実際にはQwenの方が安い選択肢になるかもしれない。キャッシュを設定していないチームは、何の見返りもなく2倍のコストを支払うことになる。
両モデルとも思考トークンを出力として課金するため、推論に多くのリソースを使う構成では、どちらの場合もこれらの見積もりよりもコストがかかります。
デプロイ可能性: GLMが所有する軸
どちらも中国製のオープンウェイトMoEモデルで、100万トークンのコンテキストを謳っており、そのためデプロイ可能性が最も顕著な実用的な分岐点となっています。
GLM-5.2の重みは6月からダウンロード可能になっており、40Bのアクティブパラメータで現実的なセルフホスティング対象です。量子化も可能で、妥当な数のGPUで運用でき、すでにコミュニティによって活用されています。
Qwen3.8-Maxのウェイトは今週中に提供されると約束されているが、フラッグシップは誰にとっても現実的な目標ではない:およそ1.2TB(4ビット)は、H200 1台あたり約141GBと比べると、最上位アクセラレータが8基以上必要になることを意味し、さらに非公開のアクティブパラメータ数によって結果的なスループットは予測不可能になる。加えて、ライセンスが欠けているため、現時点ではフラッグシップのセルフホスティングは計画にはならない。
同時に発表されたQwen3.8-27Bは、この軸におけるAlibabaの本命の回答です。また、オープンウェイト化されており、約17GBのVRAMで動作すると報じられています — ハイエンドカード1枚分で、GLM-5.2のフットプリントをはるかに下回ります — 展開容易性の面で直接競合します。どちらかのモデルへの興味が、それを自分で動かすことにあるなら、Qwen 27B 対 GLM-5.2 の比較こそが実際に重要となるものであり、2.4T 対 753B よりもはるかに接戦です。
よくある質問
Qwen 3.8 は GLM-5.2 よりも優れていますか?
両者が共通して受けているベンチマークでは、Qwenがリードを主張している——Terminal-Bench 2.1で86.6に対し、GLMは監査済みの82.7だ。しかし、Qwenの数値は自己申告であり、GLMの数値はArtificial Analysisによる測定値である。また、ハーネスの違いだけで4ポイント以上の差が生じ得る。GLM-5.2は監査済みのインデックス51も保持しているが、Qwenには独立したスコアがまったくない。GLMはより安全な選択肢であり、Qwenは検証されていない上限値が高い。
Terminal-Bench 2.1では、それらはどのように比較されますか?
Qwen3.8-Maxは86.6を報告し、Artificial AnalysisはGLM-5.2を82.7と測定しました。これはQwenにとって3.9ポイントの名目上のリードであり、両者間で初めて同一ベンチマークでの重なりとなります。これはQwenがその帯域で競争力があるという証拠として読むべきであり、先行しているという証明ではありません。なぜなら、独立して生成されたのはGLMの数値だけだからです。
どちらの方が安いですか?
レートカード上のGLM-5.2は、1Mあたり$0.95 / $3.00(AAブレンドで約$0.90)で、Qwenの$2 / $6と比べておよそ半分です。しかし、Qwenのキャッシュ入力は1Mあたり$0.25と積極的な価格設定のため、キャッシュ利用率が高いパイプラインでは、GLMの非キャッシュ利用よりもQwenの方が安くなる可能性があります。
Qwen 3.8 Maxはアクティブパラメータをいくつ使用しますか?
Alibabaは、一般提供(GA)に至ってもこの数値を公表したことはない。この数値はMixture-of-Expertsモデルにおける推論コストとレイテンシを決定づけるものであり、その欠如は大きなギャップである。対照的に、GLM-5.2は総パラメータ数753Bのうちアクティブなパラメータ数が40Bであると文書化されている。
実際にセルフホストできるのはどれですか?
本日リリースのGLM-5.2 — ウェイトが公開され、アクティブ40Bなら扱いやすい。Qwen3.8-Maxのウェイトは今週中に公開予定とされているが、最上位モデルは4ビット量子化で約1.2TB、H200クラスのGPUが8基以上必要で、ライセンスもまだ公開されていない。同時に発表されたQwen3.8-27Bは、VRAM約17GBと報じられており、導入可能なQwenの選択肢で、GLMの立ち位置により近い。
I don't have specific information about a model called "Qwen 3.8 Max" or its preview status. I'd recommend checking the official Qwen blog or documentation for the latest updates on model releases and availability.
はい、2026年8月3日に、公開された料金表と、OpenAI および DashScope 互換のエンドポイントを備えています。7月の90%オフのQoderクレジットキャンペーンは、その販売方法を説明するものではなくなりました。
QwenにはGLM-5.2にはない何があるのでしょうか?
ネイティブなマルチモダリティ — 画像・動画の入力対応、文書解析において自己報告値でOmniDocBench 92.1 — そして、長いプロンプトの追加料金なしの一律料金で提供される100万トークンのコンテキスト。GLM-5.2はテキスト中心のモデルであるため、文書、スクリーンショット、動画パイプラインにおいて、QwenはGLM-5.2と競合するというより、むしろ別のことを行っている。
結論
Qwen 3.8 vs GLM-5.2は、一般提供によって最も真に新しい情報がもたらされた対決です。初めて、Qwen は独立した評価者も実行したベンチマークでスコアを持ち、GLM を上回っています: Terminal-Bench 2.1 で 86.6 対 82.7。これにより、Qwen は「未評価」から「測定された領域で競争力があると思われる」へと移行し、自己申告の注意点を考慮しても確かな進歩です。
しかし、GLM-5.2は実用的な王座を維持しており、それを地味な強みで実現しています:{{1}}半額の価格、監査済みの指数51、経済性を予測可能にし導入を実現可能にする400億のアクティブパラメータ、そして今すぐダウンロードできる重み{{/1}}。Qwenの答え—{{2}}定額の100万トークンコンテキスト、ネイティブなマルチモダリティ、より高い上限{{/2}}—は意味があるものの条件付きであり、7月時点の2つのギャップは変わりません:{{3}}独立したスコアがないこととライセンスがないこと{{/3}}。注目すべきは3つです:{{4}}Qwen3.8-Maxの初の独立インテリジェンス指数スコア{{/4}}、{{5}}評価者がその86.6のTerminal-Bench数値を再現できるかどうか{{/5}}、そして{{6}}Qwen3.8-27Bのリリース{{/6}}—{{7}}そこがこの2つの哲学が本当に衝突する場所です{{/7}}。それまでの間、{{8}}GLM-5.2が出荷すべきものであり{{/8}}、{{9}}Qwen3.8-Maxは評価すべきものです{{/9}}—{{10}}キャッシュを有効にして{{/10}}。

この記事で比較したモデル3
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
