GLM-5.3のヒーロータイトルカードに「LEAK REPORT」バッジ、サブタイトル「Z.aiの『Epic Plus』フラッグシップ — これまでに判明している情報」、そして「未リリース」「リークの痕跡: 8月3日」「GLM-5.2の後継機」という3つのチップが表示されます。
Guides & Insights

GLM-5.3登場:リークは本物だった — Z.aiのポストトレーニング済みコーディング&サイバーディフェンスのフラッグシップ

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

リークは本物で、ローンチも実現した。GLM-5.3には今、議論の対象となる独立したスコアが存在する。Artificial Analysisのインテリジェンス指数——{{1}}Z.aiではなく、同研究所が測定したもの{{/1}}——は、GLM-5.3を60と評価し、{{2}}オープンウェイトのスコアではKimi K3と並んでトップ、GLM-5.2の53を7ポイント上回る{{/2}}。APIは今週、前モデルと同じ価格で提供が開始された。{{3}}オープンウェイトは8月28日金曜日に公開が確定しており{{/3}}、{{4}}8月14日の発表以来Z.aiが主張してきたコーディングとサイバーディフェンスに関する主張は、テスト可能なものになりつつある{{/4}}。このページは、8月3日のリークの痕跡からGLM-5.3を最初に追跡した。今回の記事はローンチレポートであり、{{5}}ローンチ、API、そして最初の独立系ベンチマークが実際に確認した内容{{/5}}をもとに、随時更新されている。

リークからローンチへ

8月3日に表面化した4つの痕跡、すなわち「ZCode for GLM-5.3」ハーネスページ、約1時間アクセス可能だった公式ドキュメントページ、「GLM-5.3 Official Harness」と読めるBingのインデックスエントリ、そしてZhipu公式Java SDKにJSON Schemaサポート付きの「glm-5.3」エントリを追加するコミットは、すべて実在する名前付きリリースを指し示していた。Z.aiの共同創業者であるTang Jie氏の「sooooooon」という返信と「epic-level plus」という表現は、噂ではなく実際の製品によって裏付けられた。このページが検証した「およそ1週間」というタイミングのシグナル(DeepSeek V4 Proが8月13日にリリースされた後に@teortaxesTex氏がXに投稿したもの)は、その通りになった。Z.aiは8月14日、「Built to Code. Ready for Cyber Defense.」というスローガンのもとでGLM-5.3を正式に発表した。その翌週、8月19日には、GLM-5.3 APIが公開され呼び出し可能になったと発表し、価格はGLM-5.2と同じで、モデルはすでにZCode、AutoClaw、GLM Coding Planに組み込まれている。

ポストトレーニングが実際にもたらしたもの

アーキテクチャに関する主張こそ、見極める価値のある部分だ。リークの中で最も派手な具体的な主張——パラメータが1兆を超える——は間違っているからだ。GLM-5.3はより大きなモデルではない。Z.aiによれば、GLM-5.2とまったく同じ743BのMixture-of-Expertsベース(トークンあたり約400億のアクティブパラメータ)を再利用し、同じ100万トークンのコンテキストウィンドウと約128Kトークンの最大出力を維持しており、その向上はすべて、より多くの長期的タスク環境、より多くの環境タイプ、より長いトレーニングランというスケールアップされたポストトレーニングに由来する。これは、GLM-5.2を生み出したIndexShareロングコンテキスト、SAO非同期RL、オープンソースのslimeフレームワークの上に構築されている。「再トレーニングなし、すべてポストトレーニング」という説明はZ.ai自身のものであり、独立した監査を受けていない。もう一つの見出しはサイズだ。総パラメータ743Bで、トークンあたりのアクティブパラメータは約400億のみであるため、GLM-5.3は控えめなクラスターでセルフホスティングできるほど軽量で、大量に提供できるほど安価だ。これはローンチ当日の解説が結び付けた「より小さく、より安く、オープン」というポジショニングであり、比較対象となっているクローズドなフロンティアのフラッグシップモデルとは鋭い対照をなしている。

コーディングとエージェント:Z.aiが主張する数字

コーディングに関して、Z.ai は — {{1}}すべてベンダー報告であり未再現{{/1}} — {{2}}Terminal-Bench 3.0 が 4.6 から 28.3 へ上昇{{/2}}({{3}}Z.ai はこれを同ハーネスにおけるオープンウェイトの最高スコアと呼ぶ{{/3}})、{{4}}DeepSWE v1.1 が 46.2 から 66.9 へ上昇{{/4}}、{{5}}SWE-Marathon が 19.4 から 42.5 へほぼ倍増{{/5}}、{{6}}Agents' Last Exam (CLI) が 23.8 から 28.5 へ上昇{{/6}}と報告している。Z.ai の内部コードベンチでは、{{7}}GLM-5.3 は高負荷設定でタスクあたり約 50K 出力トークンで 31.4% を記録{{/7}}し、{{8}}Claude Opus 4.8 は約 120K トークンで 29.5%{{/8}}だった — Z.ai の主張は、{{9}}GLM-5.3 がはるかに少ない出力トークンで同等の結果に達する{{/9}}というものだ。{{10}}Claude Fable 5 は依然として最大努力設定で 39.5% を記録し、その内部評価をリードしており{{/10}}、Z.ai は{{11}}GLM-5.3 が GPT-5.6 Sol と Claude Fable 5 に依然として及ばない{{/11}}ことを、いくつかのより難しいコーディング評価において認めている。これらはすべて、独立したハーネスが再現するまで{{12}}ベンダー数値{{/12}}として扱うこと。

サイバー防衛:誰も予期していなかった能力

サイバーセキュリティの数値こそが本当のニュースであり、それらはすべてベンダーによる報告である。ホワイトボックスの脆弱性発見・検証ベンチマークであるCyberGymでは、Z.aiはGLM-5.3を84.5%と報告しており、GLM-5.2の77.2%から上昇し、AnthropicのMythos 5(83.8%)やGPT-5.6 Sol(83.6%)を上回る。根本原因分析と実動するエクスプロイトの両方が求められるExploitBenchでは、GLM-5.3は24.4%から54.4%へと2倍以上に増加したものの、Mythos 5(78.0%)が依然として先行している。ExploitGymでは、Z.aiは2時間の制限時間内で105タスク、6時間で130タスクを完了したと報告しており、GLM-5.2の29件および39件と比較される——ただし、こちらもMythos 5(181件および247件)には及ばない。Z.aiは、このサイバー能力を意図的なターゲットではなく、スケールしたポストトレーニングの創発的特性として位置づけている——同社の言葉を借りれば「トレーニングがスケールするにつれ、能力は複利的に伸び続けた」——。

Z.aiはベンチマークに加え、現実世界での成果を発表した。セキュリティチームとのテストにおいて、GLM-5.3は269のオープンソースプロジェクトから2,436件の脆弱性を特定し、そのうち1,097件が重大または高重要度と評価された。最古の発見は1981年に遡り、平均「寿命」は26.6年である。これは発表の中で最も印象的な数字である一方、独立した検証が最も難しい数字でもある。同社はこの機能と併せて、協調的な情報開示のためのSecurity Disclosure Ledger、機密性の高いサイバー機能を認証済みユーザーに限定する「信頼できるアクセス」プログラム、主要なオープンソースプロジェクトを継続的に監査する「オープンソースシールド」構想を打ち出している。

GLM-5.3が打ち負かす必要があったベースライン

GLM-5.2は、この話全体がかかっている基準点です。これは2026年6月にリリースされ、743BのMixture-of-Expertsモデルで、トークンあたり約40Bのアクティブパラメータ、1Mトークンのコンテキストウィンドウ、128Kの最大出力、MITライセンス、そしてHugging Face上でオープンウェイトを備えています。独立に、Artificial AnalysisのIntelligence Indexでは、GLM-5.2は53と評価されており、これは今週までのインデックス上で最も高いオープンウェイトのスコアです。GLM-5.3は今回、それを7ポイント上回りました。Artificial Analysisは同じインデックス(v4.1.1)でGLM-5.3を60と測定し、Kimi K3と並んでオープンウェイトのトップの座に就き、Claude Fable 5やGPT-5.6 Solなどのクローズドなフラッグシップと並んでフロンティア層に入りました。これはGLM-5.3に付けられた最初の独立した数値であり、Z.ai自身の主張の細部すべてではないにせよ、その方向性と一致しています。長期にわたるコーディングに関しては、OrcaRouterハーネスはTerminal-Bench 2.1で77.9を測定しています。一方、Z.aiが報告するGLM-5.2の最高値は82.7で、これは80を超える初のオープンウェイトスコアになりますが、ベンダー報告であり再現されていません。定価は、入力100万トークンあたり$1.40、出力100万トークンあたり$4.40です。

A two-column comparison scoreboard titled "GLM-5.3 vs GLM-5.2 — the scoreboard". Left column GLM-5.3 (rumored): Status "Leaked, not yet released", Size ">1T params (rumored)", Context "unconfirmed", Modality "text-first (rumored)", AA Index "~57-60 (projected)", License "unconfirmed". Right column GLM-5.2 (shipped): Status "Shipped June 2026", Size "753B MoE / 40B active", Context "1M tokens", Modality "text-only", AA Index "53", License "MIT". Footer reads "GLM-5.3 figures are unverified rumors; GLM-5.2 baseline per Artificial Analysis."

上記のスコアボードは、このページがローンチ前に公開したリーク段階での予測です。「>1Tパラメータ(噂)」の行、未確認のコンテキストとライセンス、予測されたAAインデックスが含まれています。ローンチにより、最も大きなセルが修正されました。GLM-5.3はGLM-5.2と同じ743Bベースを再利用しているため、パラメータのジャンプはありません。コンテキストウィンドウは1Mと確認されました。一方、ライセンスはオープンウェイトがまだ公開されていないため、未確認のままです。予測されたインデックスのセル — このページ自身の推測である約57〜60 — は、見事に的中した珍しい予測でした。実際の数値は60であり、現在の未解決の疑問は、そのスコアが実際のウェイトに対して再現された場合に何が起こるかということです。

A screenshot of the Artificial Analysis page for GLM-5.2 (max) showing an Intelligence Index of 53 (ranked #26), $1.40 per 1M input tokens and $4.40 per 1M output tokens, text input and text output, and a 1,000,000-token context window.

上記のキャプチャは、GLM-5.3の主張を測定する際の独立ベースラインである。GLM-5.2は、Artificial Analysis Intelligence Index 53でオープンウェイトのリーダーボード首位に立つ。GLM-5.3のポストトレーニングによる差分がその数値を動かすかどうかの最初の試金石が今まさに到来した:Artificial Analysisは同じインデックスでGLM-5.3を60と測定——オープンウェイトのリードでKimi K3と並び、GLM-5.2より7ポイント上回り、同ラボによって独立測定として報告されている。

料金と在庫状況

GLM-5.3の価格はGLM-5.2と同一です: 入力100万トークンあたり$1.40、出力100万トークンあたり$4.40(国内リストでは¥8 / ¥28)。キャッシュされた入力の読み取りは100万トークンあたり$0.26 / ¥2です。Z.aiは8月19日にAPIが公開されたことを発表し、Z.ai独自のAPI、ZCode、AutoClaw、GLMコーディングプラン、および複数のパートナーゲートウェイからアクセス可能です。API呼び出し元にとって重要な動作変更が1つあります: リクエストでは現在、「thinking」を3つの努力レベル(低、高、最大)で有効にする必要があり、オフにするスイッチはありません。これは既存の統合にとって破壊的な変更です。

価格が同じでも、請求額が同じとは限らない。GLM-5.3は同じワークロードにおいて、タスクあたりGLM-5.2より約20%多くのトークンを消費する。これをタスクあたりのコストに換算すると、GLM-5.2の$0.44に対し約$0.68になる——Kimi K3(約$0.84)やGPT-5.6 Sol(約$1.23)よりは依然として低い。このタスクあたりの数字は、観測されたトークン使用量から導出した推定値であり、ベンダー公表の値ではない。だが、定額$1.40/$4.40のレートカードが実際に費用を節約できるかを決めるのは、まさにこの数字なのだ。

そのローンチがあなたにとって何を変えるのか

すでにGLM-5.2を利用しているAPI呼び出し側にとって、実際の対応はプロジェクトではなくモデル名の変更だけです。GLM-5.2はOpenAI互換であり、統合はそのまま引き継がれます。ただし、上記のthinking-effortに関する注意点があります。セルフホスティングの利用者にとって、時期は推測ではなく具体的な日付になりました。智譜(Zhipu)は8月14日に「リリースから2週間後」に重みを公開すると約束しており、それは8月28日金曜日にあたります。未確定なのは、ライセンスがパーミッシブなままかどうかです。DeepSeek V4 Pro、Qwen3.8-Max、Kimi K3、GPT-5.6 Sol、Claude Fable 5という層のモデルを比較している人にとって、GLM-5.3は噂ではなく、そのランキングにおいて実際に存在し、独立してスコアリングされた変数になりました。

GLM-5.3をめぐる発売当日の議論は、コーディングの最前線が収束したというものだ。つまり、日常的なタスクの大半では、GPT-5.6 Sol、Claude Fable 5、Kimi K3、GLM-5.2、Qwen3.8-Maxを確実に見分けられるユーザーはほとんどいない、というのがその論旨だ。その収束が現実のものなら、決定要因は生の性能ではなく、価格、オープン性、乗り換えコストになる。これはまさにGLM-5.3が狙っているポジションであり、セルフホスト可能な743Bのベースモデルで、100万トークンあたり1.40ドル/4.40ドル、ウェイトは8月28日に公開確認済みという条件だ。コーディングモデルが本当に互換性を持つかどうかは意見の問題であり、ベンチマークではない。だが、価格、パラメータ数、ウェイト公開日は事実である。

ルーティング面では、GLM-5.3は8月18日にOrcaRouterで稼働開始しました。これはZ.aiのAPIが公開されたのと同じ日で、ファーストパーティのリスト価格である100万トークンあたり$1.40 / $4.40をそのまま素通しし、マークアップはゼロです。以下のスクリーンショットはGLM-5.2のページですが、GLM-5.3もまったく同じ形になっています。同じ価格、同じ100万トークンのコンテキスト、同じ128Kの最大出力です。実際のトラフィックの一部をGLM-5.3にルーティングし、GLM-5.2または別の実績あるモデルへ自動フェイルオーバーするのは、書き直しではなく設定変更です。同じキーのままで、追加契約も不要です。新しいモデルがワークロードで性能を落とす場合、ルーターはページが描画される前にフォールバックするため、ベンダーのスライドではなく、自社トラフィック上の品質シグナルを得られます。旗艦モデルの主張がまだほとんどベンダー報告に依存している状況では、これこそが低リスクで自ら確かめる方法です。

The OrcaRouter model page for z-ai/glm-5.2 showing the model id, Tools, JSON and Reasoning capability chips, a 1,000,000-token context window, a 128,000-token max output, text input and text output, $1.40 per 1M input tokens and $4.40 per 1M output tokens, and a p50 time-to-first-token of 5.95 seconds.

次に見るもの

8月28日(金曜日)に公開されるウェイトと、モデルカード上のライセンス表記——GLM-5.2と同様の寛容なMITか、それともより制限的なものか。智譜(Zhipu)は2週間の遅延の理由としてサイバーセーフティ強化を挙げており、「trusted access」プログラムは、一部の機能がいずれにせよアクセス制限されることを示唆している。

• Z.ai独自のハーネスの外でもサイバー関連の主張が通用するかどうか。実世界における2,436件の脆弱性という主張とCyberGymのリードは、独立系ラボが最初に検証する数字だ。AA Intelligence Indexは一般的な能力を測定するものであり、セキュリティを測定するものではない。

ウェイトが公開されれば、インデックスがどこに落ち着くかが決まる。その60は提供されているAPIに対してスコアリングされた値であり、ライセンスが付属するセルフホスト版こそ、チームが実際に再デプロイするものになる。

• DeepSeek V4 Flashが発表した値上げ(これはGLM-5.3が評価の基準とする価格帯を設定する)と、GPT-5.6 Solの61での1ポイントリード。

よくある質問

GLM-5.3はGLM-5.2よりも大きいモデルですか?

いいえ。Z.aiによると、GLM-5.3はGLM-5.2と同じ7430億パラメータのMixture-of-Expertsベースを使用し、同じ100万トークンのコンテキストウィンドウと、トークンあたり約400億のアクティブパラメータを備えています。報告されているすべての改善は、パラメータの増加ではなく、スケールアップされたポストトレーニングによるものです。これは、1兆を超えるベースモデルに関するリーク時代の噂を直接的に訂正するものです。そのアーキテクチャに関する主張はZ.ai自身のものであり、独立した監査は行われていません。

GLM-5.3のオープンウェイトはいつ利用可能になりますか?

8月28日金曜日。Zhipuは8月14日にGLM-5.3を発表した際、「リリースから2週間後」にウェイトを公開すると約束し、8月19日にAPIが稼働した際には「次の金曜日」と述べた——どちらの解釈も同じ日付になる。ライセンスはまだ確認されておらず、Z.aiは、機密性の高いサイバー機能は検証済みユーザー向けの「トラステッド・アクセス」プログラムに限定されると述べている。

ベンチマークの数値をどう扱えばいいですか?

リストを分割する。コーディングのスコア(Terminal-Bench 3.0が28.3、DeepSWE v1.1が66.9、SWE-Marathonが42.5)とサイバー関連の結果(CyberGymが84.5%、ExploitBenchが54.4%)は、すべてZ.ai自身の発表によるものであり、独立したハーネスが再現するまではベンダー報告のままである。Artificial Analysis Intelligence Indexの60は、最初の独立した測定値であり、Z.aiが主張するすべての内容と照合する際に重視すべき数字である。

リークは本物で、発表によって名前・位置づけ・タイミングが確認された。一方で、噂が最も大きく騒がれた一点については修正が入った。GLM-5.3は同じベースを徹底的にポストトレーニングしたもので、今回、ベンダーの主張を検証するための独立したスコアが付与された。Artificial Analysis Intelligence Indexで60点、Kimi K3と同点で、GLM-5.2より7ポイント上回る。コーディングとサイバーの数値は依然としてZ.ai自身によるもので、ウェイトは8月28日に公開される。残る論点はライセンスの文言と、セキュリティ主張に対する真に独立した検証だ。それまでは、実トラフィックの一部を使い、実績のあるものへのフェイルオーバーを用意するのが、自らの見解を形成するための低リスクな方法だ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube