記事のヒーローカードに「GLM 5.5 か GLM 5.3-Vision?」と表示され、サブタイトルには「Z.aiのフィンガープリントに一致する匿名モデルが出現」、バッジには「LEAK — 未検証」とある。背景は柔らかな白と青のグラデーションで、繊細なニューラルネットワークのモチーフと疑問符の要素があしらわれている。
Guides & Insights

GLM 5.5 か GLM 5.3-Vision? Z.ai の指紋に一致する匿名モデルが現れた

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

身元が特定されていないモデルが、そのサービングプロファイル(速度、最初のトークンまでの時間、キャッシュヒット率)がZ.aiのG​LMスタックと一致するとして、キャパシティアナリストの注目を集め始めている。現時点での推測では、GLM 5.3-VisionまたはGLM 5.5という名前になる可能性がある。8月20日、コンピュート・キャパシティアナリストのteortaxesTexは、追跡中の匿名モデルについて「少なくともD​ee​pSeekではないことは明らか」「これまでのところG​LMを除外する要素は何もない」「速度、TTFT、キャッシュヒット率もG​LMと一致する」と投稿した。彼の見立てでは、これはGLM 5.3-Visionまたは5.5と呼ばれることになり、Artificial Analysis Intelligence Indexでおおむね61点——現在リリースされているGLM-5.3より1ポイント上——を記録するだろうという。ここに確定した事実は何もない。モデルカードもZ.aiの発表もAPIも存在しない。このページでは、この目撃情報をそのまま、初期段階の、まだ再現されていないリークシグナルとして扱っている。G​LM-5.5が今月ずっとZ.aiのフラッグシップとして期待されていながら姿を現していないからこそ、追跡する価値があるのだ。その投稿から5日後、今度は完全に検証可能な2つ目のデータポイントが到着した。8月25日、大規模モデルサービングの大半を支える推論ランタイムであるvLLMが、G​LM-5のヘッド次元に対するマスク付きMHAカーネルサポートを有効にするDo-Not-Mergeプルリクエストを開いたのだ。これはバリアント名を明かさず、リリースを証明するものでもない。サービングスタックの下準備であり、新しいモデルが残す種類の背景活動である。

その信号が実際に言っていること

出典は、8月20日付のteortaxesTexによるXの投稿で、8月にGLM-5.3のローンチ時期に関する「約1週間」というタイミングのシグナルが、日単位で正確に当たったのと同じアカウントです。その枠組みは証拠レベルを明確にしています:「強い証拠(再現はしていない)」。アナリストはDeepSeekを除外し、GLMに矛盾するものは何もないとし、スループット、最初のトークンまでの時間、キャッシュヒット率という3つのサービスレベル測定値がZ.aiのスタックと一致することを挙げています。そして、候補名2つと予想スコア:「現在、GLM 5.3-Visionまたは5.5と呼ばれると予想し、AAでおおよそ61点と見込んでいます」。

それぞれの情報は個別に検討すべきだ。身元に関する主張(Dee​pSeekではない、G​LMと一致)は、モデルカードによるものではなく、モデルの提供方法から得られるフィンガープリント推論である。スコアは期待値であり、測定値ではない。名称は推測にすぎない。このシグナルがノイズ以上の価値を持つのは、今月のZ.aiのロードマップについて私たちが知っている他のすべての情報と方向性が一致しているからだ:GLM-5.3はテキストのみでリリースされ、コミュニティから最も強く求められたのはビジョン機能であり、GLM-5.5は複数の報道機関(JPモルガン、ロイター、CGTN、および8月18日のゴールドマンのノート経由)によって「8月中」に登場すると報じられている——まさに今がその月の最終盤なのだ。

提供されるフィンガープリントが重要な理由

Time-to-first-token(TTFT)とキャッシュヒット率は、インフラレベルのシグネチャである。これらは、プロバイダーが推論スタックをどのように構築するか(スケジューラ、キャッシュレイアウト、バッチ処理ポリシー)によって決まるものであり、プロンプトがどのモデル名を呼び出すかによって決まるのではない。アナリストが匿名モデルのTTFTとキャッシュヒット率がG​LMと一致すると言う場合、その背後にあるサービングスタックがZ.aiのそれと同様に動作することを述べているのであり、これは重みやモデルカードなしで得られる最も指紋に近いものである。それは証明ではない。別のベンダーが同じスタックを再現する可能性もあるし、Z.aiがパートナーのためにモデルを提供する可能性もある。しかし、それは具体的で検証可能な主張であり、「再現していない」という但し書きは、アナリストがそれを確定事項として提示していないことを示している。

Dee​pSeekの除外も重要だ。DeepSeek V4 Proは8月13日にGAし、そのFlashビルドは今月、もう1つのハイペースな中国製オープンウェイトリリースとなっている。Dee​pSeekを除外してG​LMを示す匿名モデルは、候補をZ.aiのパイプラインに絞り込む — そしてZ.aiのパイプラインには、もっともらしい2つの候補があり、これはまさにシグナルが名指す分岐点だ。

第二のシグナル:GLM-5アテンション向けにサービングスタックが構築されつつある

8月25日、2つ目のデータポイントが着地した。今回は完全に検証可能なものだ。大規模モデルサービスの大半を支える推論ランタイムvLLMに、プルリクエスト#53785「[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions」が届いた。リポジトリで照合したところ、このPRはG​LM-5のアテンション形状に対するマスク付きMHAプリフィル経路を有効にする。PRの説明によれば、その形状とは64ヘッド、KVランク512、QKヘッド次元192+64、Vヘッド次元256、すなわち256/256のQK/Vレイアウトである。このPRは、ヘッド次元256のマスク対応に関するFlashAttentionの変更に依存しており、FlashAttentionを一時的にフォークコミットに固定する(これがDo Not Mergeマーカーの意味である)。さらに、新しい経路向けにベンチマーク済みのルーティングしきい値を追加している:TP 1/2/4/8でのFlashMLAピュアプリフィル上限は8K / 20K / 48K / 112Kトークン、TP8でのFlashInfer上限は丸めて64Kトークンである。著者は、G​LM-5のマスク付きMHA対応を扱った他のオープンPRは存在しないと注記している。

それをあるがままに読むこと:これは発表ではなく、サービングスタックの下地作業である。そのPRはGLM 5.5やGLM 5.3-Visionを名指ししておらず、「GLM-5」と書かれている。そして、GLM-5のヘッド次元に対するmasked-MHAプリフィル経路の有効化は、vLLMエコシステムがすでにスパースMLA経路で実行しているファミリーに対する基盤作業である(GLM-5.3自身の系統は今日そこで提供されている)。また、これは孤立したものではない。今月の兄弟PRには、GLM-5向けのFlashInfer MLA次元チェック、GLM-5クラスのモデル向けのTritonスパースMLAフォールバック、そしてFlashAttentionの報告済み次元サポートが含まれていた。リーク追跡者のレーダーに留まる理由は2つの詳細にある。第一に、それが対象とするジオメトリ(64ヘッド、KVランク512、256/256 QK/V)は、DeepSeekの192/128とは異なり、これは匿名モデルのフィンガープリントが描く「DeepSeekではなくGLMに一致」という区別と同じであり、今やアテンションカーネルレベルで可視化されている。第二に、タイミングである。PRは8月25日に開設されたが、これは8月という同じ期間内であり、その間ずっとGLM-5.5の登場が期待されていた。そのいずれも匿名モデルが次世代GLMであることを証明するものではない——これは既に出荷済みのモデルに対するエンジニアリングである可能性も十分にある——しかし、これはサービングエコシステムがモデルに先立って行う種類の背景活動であり、Xの投稿とは異なり検証可能なのだ。

二つの名前、一つのフォーク: GLM 5.3-Vision vs GLM 5.5

2つの候補となる正体は、実際にはまったく異なる製品であり、リークによってどちらがボード上にあるかを確定することはできない。

• GLM 5.3-Vision は、8月14日にリリースされたモデルのビジョン対応バリアントとなるだろう。GLM-5.3 はテキスト入力のみに対応しており、Artificial Analysis ではテキスト入力・テキスト出力・画像非対応と分類されている。そしてこのギャップこそがコミュニティ最大の不満だ。Z.ai の Tang Jie 氏がグローバルなフィードバックキャンペーンを実施した際、寄せられたコメントはほぼ全会一致でビジョン対応を求めるものだった。また Z.ai は、フラッグシップラインにまだ統合していない構成要素(GLM-5V-Turbo マルチモーダルモデルと CogVLM エンコーダー)をすでに保有している。5.3-Vision バリアントは、そのギャップを埋める最速の方法となるだろう。

• GLM 5.5はフラッグシップそのものだ。報じられているが未確認のスペックは、1兆を超えるパラメータ数の基盤モデル(GLM-5.3の743Bから増加)、引き継がれた100万トークンのコンテキスト、オープンウェイト、そしてエージェント機能とコーディングへのより強い重点を示している。今月のアナリストノートはすべて5.5を大本命と見なしている——Z.aiの共同創業者Tang Jie氏がFableクラスのクローズドモデルとの差を埋めると示唆した切り札だ。8月以内に登場する見込みで、本稿執筆時点ではまだリリースされていない。

同じ指紋だけでは、これがどちらなのかを判別することはできない——ビジョンチューニング済みの5.3と新型フラッグシップは、同じサービングスタックに載っている可能性があるからだ。その曖昧さこそが、このシグナルが正直に示している状態であり、アナリストの投稿に出てくる二つの名前は、それを解決するのではなく反映しているにすぎない。

<img src="2.png" alt="「GLM 5.5 対 GLM-5.3 — スコアボード」というタイトルの2列比較スコアボード。左列 GLM 5.5(リーク情報): 「AA Index 約61(予測、未検証)」、「ステータス: 未リリース」、「サイズ >1T パラメータ(噂)」、「ビジョン: 期待される」、「コンテキスト: 1M(予定)」、「価格: 未定」。右列 GLM-5.3(出荷済み): 「AA Index 60」、「ステータス: API 8月19日公開」、「サイズ 743B MoE / 40B アクティブ」、「ビジョン: テキストのみ」、「コンテキスト: 1M」、「価格: $1.40 / $4.40」。フッターには「GLM 5.5 の数値は未検証の予測です。GLM-5.3 は Artificial Analysis による。」と記載。" />

A two-column comparison scoreboard titled 'GLM 5.5 vs GLM-5.3 — the scoreboard'. Left column GLM 5.5 (leaked): 'AA Index: ~61 (projected)', 'Status: unreleased', 'Size: >1T params (rumored)', 'Vision: expected', 'Context: 1M (expected)', 'Price: TBD'. Right column GLM-5.3 (shipped): 'AA Index: 60', 'Status: API live Aug 19', 'Size: 743B MoE / 40B active', 'Vision: text-only', 'Context: 1M', 'Price: $1.40 / $4.40'. Footer reads 'GLM 5.5 figures are unverified projections; GLM-5.3 per Artificial Analysis.'

AA Intelligence Index で ~61 が意味すること

{{1}}予測スコアはリークの中で最も鋭い部分だ。{{/1}}{{2}}Artificial Analysis Intelligence Index(v4.1.1)は現在、GLM-5.3を60としており{{/2}}、{{3}}オープンウェイトのスコアでKimi K3と並んでトップ、{{/3}}{{4}}GLM-5.2の53より7ポイント上回っている。{{/4}}{{5}}その1ポイント上にあたる61はGPT-5.6 Solの領域であり、{{/5}}{{6}}Claude Fable 5が62、Claude Opus 5が63である。{{/6}}{{7}}わかりやすく言えば、61を獲得するG​LMファミリーのモデルは、このインデックスで単独最高のオープンウェイトスコアとなり、{{/7}}{{8}}Kimi K3やGLM-5.3を引き離して単独トップに立ち、{{/8}}{{9}}実質的にクローズドフロンティアのラインに達する。{{/9}}

61が何でないかを強調する価値はある。これはteortaxesTexが独立評価の結果として返ってくるであろうと予想する値であり、公表されたArtificial Analysisのスコアでもベンダーの数字でもない。予測はどちらの方向にも誤り得る。ビジョン対応版はテキスト中心の指標で1〜2ポイントを失うかもしれないし、>1Tのフラッグシップはポストトレーニングの質次第でより高くも低くもなり得る。この数値の価値は、それが内包する主張にある。この匿名モデルが誰であることが判明しようとも、現在のオープンウェイトのリーダーに単に並ぶのではなく、それを上回ると期待されているということだ。

A screenshot of the Artificial Analysis page for GLM-5.3 (max) showing an Intelligence Index of 60 (well above the median of 35), $1.40 per 1M input tokens and $4.40 per 1M output tokens, text input and text output, a 1M-token context window, and summary text describing the model as leading in intelligence and reasonably priced.

確認されていることと、確認されていないこと

台帳をきれいに保て。リーク記事の生死はそれにかかっているのだから。

• 確認済み: GLM-5.3は実在し、8月14日にリリース、APIは8月18日/19日に稼働開始。AA Intelligence Indexで60点を獲得(Artificial Analysisによる独立測定)。価格は100万トークンあたり$1.40 / $4.40、テキスト入力のみ対応。オープンウェイトは8月28日(金)に公開されることが確定している。これらの事実はリークとは無関係である。

• {{1}}確認済み:GLM-5.5はまだ未公開です。{{/1}}{{2}}本稿執筆時点では、モデルカードも料金も提供状況もありません。8月の時期と>1Tパラメータという数字はアナリストによる報告であり、Z.aiのコミットメントではありません。{{/2}}

• 未確認: 匿名モデルが独立した製品として存在すること、それがG​LMであること、その名前がGLM 5.3-Visionまたは5.5になること、そしてスコアが61であること。この4つはすべて、1人のアナリストによる再現されていない投稿に基づいている。

• さらに未確認なのは、この匿名モデルがGLM-5.3そのものと本当に区別されるのかどうかだ。ラベルのないエイリアスで提供されるGLM-5.3のライブエンドポイントでも、同じサービングフィンガープリントが生成されるだろう。名前、モデルカード、または重みの公開によってそれが解決されるまでは、「新モデル」という読み方は有力な事前確率ではあるが、事実ではない。

次に見るもの

• 8月28日(金)— GLM-5.3の重み。匿名モデルが実際には名前を変えた5.3または5.3-Visionである場合、重みの公開とモデルカードによってすぐに判明するでしょう。

• 2つ目の裏付けとなる目撃情報。一人のアナリストの指紋は仮説であり、同じ匿名エントリに対する2回目の独立した読み取り、またはそれを名指しするArtificial Analysisのリストは、その仮説を証拠に格上げする。

• Z.ai による何らかの声明。GLM-5.5 は8月の期間に報じられており、その月もほぼ終わりに近づいている。正式な命名、価格ページ、または API チェンジログのエントリが、このリークをローンチストーリーに変える出来事となる。

• AAスコアが61で実現するかどうか。匿名モデルが実在し、G​LMファミリーであるなら、61前後の独立指標スコアは、60を超える初のオープンウェイト数値となるだろう。

vLLM attention work にモデル名が付けられるかどうか。PR #53785 は "GLM-5" のヘッド次元を対象としているが、5.3-Vision や 5.5 には言及していない。マージ、サポート対象モデルのエントリ、またはそのジオメトリを特定の名前と結びつけるモデルカードがあれば、これまでで最も強いシグナルとなるだろう。

このようなリークへの対応方法

リークは再プラットフォーム化ではなく、準備を促す理由です。次のG​LMファミリーのモデルがオープンウェイトのリーダーボードの上位かその近くに登場した場合、実際のトラフィックをそのモデルにルーティングすべきかどうかが現実的な問いとなります。そして、ベンダーの主張と一人のアナリストの予測だけがある未実証のモデルは、賭けではなく安全網を求めるまさにそのケースです。先週リリースされたGLM-5.3は、すでにOrcaRouter上で稼働しています。モデルページには、ベンダー希望価格$1.40 / $4.40から10%のローンチディスカウントが適用され、マークアップなしで転送された1Mトークンあたり$1.26 / $3.96と表示されています。そして、このルーティング設定は、5.5または5.3-Visionがリリースされた日に引き継ぐものとなります。トラフィックの一部をルーター経由で新モデルに向け、実績のあるモデル(GLM-5.3、DeepSeek V4 Pro、GPT-5.6 Sol)への自動フェールオーバーを設定すれば、スライド資料ではなく、自社のワークロードに対する品質シグナルを得られます。リークの予測が正しければ、あなたが最初に気づくでしょう。もし間違っていれば、フェールオーバーがそれを吸収し、壊れたものを出荷することはありません。同じキー、追加の契約は不要、そしてZ.aiが決めるまで2つの候補名の間で選択する必要もありません。

次のG​LMが来る — 唯一の未確定事項は、それがどの名前を冠するかだ。GLM 5.3-Visionなら、Z.aiが先にリリースしたモデルで最も不満が多かったギャップを埋めることになる。GLM 5.5なら、この一ヶ月ずっと示唆されてきた兆億パラメータのフラッグシップになるだろう。8月20日にteortaxesTexが指紋採取した匿名エントリは、そのどちらかに見える最初の具体的な存在であり、AA Intelligence Indexでの予測スコア61は、現在ボード上にあるすべてのオープンウェイトモデルを上回るだろう。指紋採取から5日後、サービングスタックも動いた。vLLMのG​LM-5アテンションに関する作業は、新しいモデルが残す典型的な下準備だ。たとえバリアント名が明記されていなくてもだ。そのいずれも確認されておらず、このページは、名前、カード、またはウェイトが決定され次第更新される。それまでは、リスクの低い選択肢はルーティングを準備しておくことだ — 指紋だけでスタックを賭けるのはやめよう。

The OrcaRouter model page for z-ai/glm-5.3, showing the model id, capability chips (Tools, JSON, Reasoning), a 1,000,000-token context window, a 128,000-token max output, text input and text output, and pass-through pricing of $1.26 per 1M input tokens and $3.96 per 1M output tokens.