「文章主視覺卡片的標題為『GLM 5.5 還是 GLM 5.3-Vision?』,副標題為『一個指紋與 Z.ai 相符的匿名模型剛現身』,徽章為『洩漏 — 未經證實』,背景是柔和的白色與藍色漸層,帶有細微的神經網路圖樣與問號元素。」
Guides & Insights

GLM 5.5 還是 GLM 5.3-Vision?一個與 Z.ai 指紋相符的匿名模型剛剛浮現。

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

一個身分不明的模型——其服務設定檔(速度、首個 token 延遲、快取命中率)與 Z.ai 的 G​LM 技術棧相符——已開始引起容量分析師的關注;目前的工作假設是它可能被命名為 GLM 5.3-Vision 或 GLM 5.5。8 月 20 日,運算與容量分析師 teortaxesTex 發文表示,他正在追蹤的一個匿名模型「至少顯然不是 Dee​pSeek」、「到目前為止沒有什麼能排除 G​LM」,而且「速度、TTFT、快取命中率也與 G​LM 相符」。他的解讀:預期它會被命名為 GLM 5.3-Vision 或 5.5,在 Artificial Analysis Intelligence Index 上得分約 61——比目前正式發布的 GLM-5.3 高出 1 分。目前這些都未經證實。沒有模型卡、沒有 Z.ai 公告、也沒有 API;本頁面僅將這次目擊視為其本來面貌:一個早期、尚未被複現的洩漏訊號,之所以值得追蹤,正是因為 GLM-5.5 整個月都被預期是 Z.ai 的旗艦模型,卻始終沒有出現。那則貼文發布五天後,第二個、且這次完全可以查證的資料點出現了:8 月 25 日,vLLM——支撐大多數大規模模型服務的推論執行環境——開啟了一個 Do-Not-Merge 拉取請求,為 G​LM-5 的 head 維度啟用 masked-MHA 核心支援。它沒有指名任何變體,也不證明任何發布計畫;這是服務技術棧的底層工作,正是新模型會留下的那種背景活動痕跡。

訊號實際上說了什麼

來源是 teortaxesTex 在 8 月 20 日發的一則 X 貼文——就是那個帳號,其關於 GLM-5.3 發布的「大約一週」時間訊號,在 8 月時精準到天。其框架明確說明了證據等級:「強烈證據(尚未複現)。」該分析師排除 Dee​pSeek,找不到與 G​LM 矛盾之處,並引用三項服務層級指標——吞吐量、首個 token 延遲(time-to-first-token)、快取命中率——認為與 Z.ai 的技術堆疊相符。然後有兩個候選名稱,以及一個預測分數:「目前我預期它會被稱為 GLM 5.3-Vision 或 5.5,並在 AA 上獲得約 61 分。」

分別看待每一項。身份宣稱(不是Dee​pSeek,而是符合G​LM)是從模型服務方式進行的指紋推斷,並非模型卡。分數是預期值,而非測量結果。名稱是猜測。讓這個訊號比雜訊更有價值的,是它與我們本月對Z.ai路線圖所知的一切在方向上一致:GLM-5.3僅以文字形式發布,社群最強烈的要求是視覺功能,而多個媒體(經由摩根大通、路透社、CGTN,以及8月18日的高盛報告)報導GLM-5.5將「在八月內」推出——如今正是這個月的尾聲。

為什麼服務指紋很重要

首次輸出延遲(time-to-first-token)與快取命中率是基礎設施層級的特徵。它們由供應商如何建構其推論技術棧所決定——即排程器、快取佈局、批次處理策略——而非由提示詞所呼叫的模型名稱決定。當分析師表示某個匿名模型的 TTFT 與快取命中率與 G​LM 相符時,他們其實是在說該模型背後的服務技術棧與 Z.ai 的服務技術棧行為相似;在沒有權重或模型卡的情況下,這已經是你能得到最接近指紋的東西。這並非證明。其他供應商也可能複製相同的技術棧,或者 Z.ai 可能為合作夥伴提供模型服務。但這是具體且可查證的主張,而「尚未複現」的保留條件告訴你,分析師並未將其視為定論。

DeepSeek 的排除也很重要。DeepSeek V4 Pro 於 8 月 13 日正式發布,其 Flash 版本是本月另一個快速的中國開放權重發布。一個排除 DeepSeek 但指向 GLM 的匿名模型,將範圍縮小到 Z.ai 的產品線——而 Z.ai 的產品線有兩個可能的候選者,這正是信號所指的分歧。

第二個信號:服務堆疊正在為 GLM-5 的注意力機制進行建置。

8月25日,第二個數據點出現了——這次完全可查證。vLLM,這個支撐大多數大規模模型服務的推論執行時期,收到了一筆 pull request #53785,標題為「[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions。」經與儲存庫核對,它為 G​LM-5 的注意力幾何啟用了 masked-MHA prefill 路徑:64 個注意力頭、KV rank 為 512、QK 頭維度為 192+64,以及 V 頭維度為 256——也就是 256/256 的 QK/V 佈局,依 PR 描述。它依賴於 FlashAttention 的一項變更以支援 head dimension 256 的 mask,暫時將 FlashAttention 固定到某個 fork commit(這就是 Do Not Merge 標記的用途),並為新路徑加入了實測的 routing 門檻:在 TP 1/2/4/8 下,FlashMLA 的純 prefill 限制為 8K / 20K / 48K / 112K tokens,而在 TP8 下 FlashInfer 的極限為無條件進位後的 64K。作者指出,沒有其他未合併的 PR 涵蓋 G​LM-5 的 masked-MHA 支援。

按它的本來面目來解讀:這是服務棧的基礎設施工作,而不是發布公告。該 PR 沒有點名 GLM 5.5 或 GLM 5.3-Vision——它寫的是{{1}}「GLM-5」{{/1}}——而且為 G​LM-5 的頭維度啟用一條 masked-MHA 預填充路徑;這是在 vLLM 生態已經透過稀疏 MLA 路徑運行的同一個模型家族上進行的基礎設施工作(GLM-5.3 自身的譜系如今就是透過這條路徑提供服務的)。此外,這並非孤立之舉:本月有一批姊妹 PR,涵蓋了針對 GLM-5 的 FlashInfer MLA 維度檢查、面向 GLM-5 級別模型的 Triton 稀疏 MLA 回退路徑,以及 FlashAttention 所回報的維度支援。有兩個細節讓它仍留在洩密追蹤者的雷達上。第一,它所針對的幾何配置——64 個注意力頭、KV rank 512、QK/V 為 256/256——與 Dee​pSeek 的 192/128 截然不同;這正是匿名模型指紋所劃出的那種{{2}}「不是 Dee​pSeek,而是 G​LM」{{/2}}區隔,如今在注意力內核層面也清晰可見。第二,時機:該 PR 於 8 月 25 日提出,正好落在整個八月 GLM-5.5 都一直被期待的同一時間窗口內。以上種種都無法證明那個匿名模型就是下一代 G​LM——這同樣可能是針對已經發布的模型所做的工程——但它正是服務生態系在模型發布前會進行的那種背景活動,而且它的可驗證性是任何 X 貼文都無法比擬的。

兩個名稱,同一分支:GLM 5.3-Vision 對比 GLM 5.5

這兩個候選身份確實是不同的產品,而這起洩漏並未釐清電路板上的是哪一個。

• GLM 5.3-Vision 會是 8 月 14 日推出之模型的視覺能力變體。GLM-5.3 僅支援文字輸入——Artificial Analysis 將其列為文字進、文字出,無圖片支援——而這項落差是社群最強烈的抱怨。當 Z.ai 的唐傑發起全球回饋活動時,收到的意見幾乎一致要求視覺功能,而 Z.ai 已具備尚未整合進旗艦產品線的基礎元件(GLM-5V-Turbo 多模態模型與 CogVLM 編碼器)。推出 5.3-Vision 變體將是填補此落差最快的方式。

• GLM 5.5 本身就是旗艦產品。據報導但未經證實的規格顯示,其基礎模型參數將超過一兆(高於 GLM-5.3 的 743B),沿用 100 萬 token 的上下文長度、開放權重,並更加聚焦於代理式(agentic)與程式碼相關任務。本月每一份分析師報告都將 5.5 視為重頭戲——Z.ai 共同創辦人唐傑曾暗示,此產品將縮小與 Fable 級別封閉模型之間的差距。它預計在 8 月內發布,截至本文撰寫時尚未出貨。

同一個指紋無法告訴你這兩者中是哪一個——一個經過視覺調校的5.3和一款全新的旗艦機可能運行在同一套服務堆疊上。這種模糊性正是信號的真實狀態,而分析師貼文中的兩個名稱反映了這種狀態,而不是解決了它。

<img src="2.png" alt="一個兩欄比較計分板,標題為『GLM 5.5 vs GLM-5.3 — 計分板』。左欄 GLM 5.5(洩漏版):『AA Index ~61(預測,未驗證)』、『狀態:未發布』、『規模 >1T 參數(傳聞)』、『視覺能力:預期會有』、『上下文長度:1M(預期)』、『價格:待定』。右欄 GLM-5.3(已發布):『AA Index 60』、『狀態:API 已於 8 月 19 日上線』、『規模 743B MoE / 40B 活躍』、『視覺能力:僅文字』、『上下文長度:1M』、『價格:$1.40 / $4.40』。頁尾寫著『GLM 5.5 的數據是未經驗證的預測;GLM-5.3 數據來自 Artificial Analysis。』" />

A two-column comparison scoreboard titled 'GLM 5.5 vs GLM-5.3 — the scoreboard'. Left column GLM 5.5 (leaked): 'AA Index: ~61 (projected)', 'Status: unreleased', 'Size: >1T params (rumored)', 'Vision: expected', 'Context: 1M (expected)', 'Price: TBD'. Right column GLM-5.3 (shipped): 'AA Index: 60', 'Status: API live Aug 19', 'Size: 743B MoE / 40B active', 'Vision: text-only', 'Context: 1M', 'Price: $1.40 / $4.40'. Footer reads 'GLM 5.5 figures are unverified projections; GLM-5.3 per Artificial Analysis.'

在AA Intelligence Index上獲得約61分意味著什麼

預測分數是這起洩漏中最犀利的部分。Artificial Analysis Intelligence Index(v4.1.1)目前將 GLM-5.3 列為 60 分,與 Kimi K3 並列開源權重最高分,並領先 GLM-5.2 的 53 分達 7 分。再往上 1 分、來到 61 分,就會是 GPT-5.6 Sol 的領域;Claude Fable 5 為 62 分,Claude Opus 5 為 63 分。簡言之:G​LM 家族模型若拿下 61 分,將成為該指數上唯一最高的開源權重分數,獨自高居於 Kimi K3 與 GLM-5.3 之上,實際上已觸及封閉前沿線。

值得強調的是,61 不是什麼。它是 teortaxesTex 對獨立評估結果的預期,既不是已發表的 Artificial Analysis 分數,也不是廠商數字。預測可能往任何一個方向出錯——視覺變體可能在以文字為主的指數上損失一兩分,而 >1T 的旗艦模型也可能因後續訓練的表現而落在更高或更低的位置。這個數字的價值在於它所承載的主張:無論這個匿名模型最終身分為何,它預期會擊敗目前開放權重的領先者,而不只是與之持平。

A screenshot of the Artificial Analysis page for GLM-5.3 (max) showing an Intelligence Index of 60 (well above the median of 35), $1.40 per 1M input tokens and $4.40 per 1M output tokens, text input and text output, a 1M-token context window, and summary text describing the model as leading in intelligence and reasonably priced.

哪些已確認,哪些尚未確認

保持帳目乾淨,因為洩漏內容的成敗取決於此。

• 已確認:GLM-5.3 確實存在,於 8 月 14 日發布,API 於 8 月 18/19 日上線,在 AA Intelligence Index(由 Artificial Analysis 獨立評測)中獲得 60 分,定價為每 1M tokens $1.40 / $4.40,僅支援文字輸入,並已確認於 8 月 28 日星期五開放權重。這些事實並不依賴於洩漏。

已確認:GLM-5.5 尚未發布。截至本文撰寫時,沒有模型卡、沒有定價、也沒有可用性;八月時間窗口和大於1T參數的數字是分析師報告的,而非 Z.ai 的承諾。

• 未經證實:該匿名模型是否作為獨立產品存在、是否為 G​LM、其名稱是否為 GLM 5.3-Vision 或 5.5,以及其得分是否為 61。這四點皆僅基於某位分析師一篇未經重複驗證的貼文。

• 同樣未獲證實的是:這個匿名模型是否真的與 GLM-5.3 本身有所區別。一個以未標示別名運作的 GLM-5.3 即時端點,會產生相同的服務指紋。在名稱、模型卡或權重釋出釐清此事之前,「新模型」的解读是強烈先驗,但並非事實。

接下來要看什麼

• 8月28日(星期五)——GLM-5.3 的權重。如果匿名模型其實是改名後的 5.3 或 5.3-Vision,權重發布與模型卡很快就會讓真相大白。

• 第二次佐證的目擊。單一分析師的指紋是假說;對同一匿名條目的第二次獨立解讀,或一份指名為 Artificial Analysis 的清單,會將其升級為證據。

• 任何 Z.ai 的聲明。GLM-5.5 據傳會在八月時間窗口發布,而這個月已接近尾聲。正式命名、定價頁面或 API 變更日誌條目,就是讓這則洩漏成為發布消息的事件。

• AA 分數是否會實際達到 61。如果該匿名模型是真的,且屬於 G​LM 家族,那麼一個接近 61 的獨立指數分數,將是第一個突破 60 的開放權重數字。

• vLLM 的注意力機制相關工作是否會附上模型名稱。PR #53785 針對的是「GLM-5」的注意力頭維度,但未指名 5.3-Vision 或 5.5;合併、支援模型清單條目,或將該幾何配置與特定名稱配對的模型卡片,都將是迄今為止最強烈的訊號。

如何針對這類洩漏採取行動

外洩是準備的理由,不是更換平台的理由。如果下一個 GLM 系列模型在開放權重排行榜上登上頂端或接近頂端,實際問題是要不要將真實流量導向它——而一個未經證實的模型,只有廠商的說法和一位分析師的預測,正是你需要安全網而非賭注的情況。上週發表的 GLM-5.3 已於 OrcaRouter 上線——模型頁面顯示每 100 萬個 token 收費 1.26 / 3.96 美元,這是從廠商定價 1.40 / 4.40 美元打 9 折的上市優惠,零加成轉售——而這套路由設定正是 5.5 或 5.3-Vision 一上市就會繼承的設定。透過路由器將一部分流量導向新模型,並自動故障轉移到經過驗證的模型——GLM-5.3、DeepSeek V4 Pro、GPT-5.6 Sol——你就能在自己的工作負載上得到品質訊號,而不是一份投影片簡報。如果外洩的預測正確,你會最先知道;如果錯誤,故障轉移會吸收影響,不會有任何東西帶著問題出貨。同一個金鑰、不需要第二份合約、也不必在 Z.ai 決定之前就從兩個候選名稱中二選一。

下一個 G​LM 即將到來——唯一未解的問題是它會以哪個名字亮相。GLM 5.3-Vision 將是 Z.ai 在剛推出的模型上,補齊最受詬病缺口的一步;GLM 5.5 則會是整個月一直指向的那個兆參數旗艦。8 月 20 日被 teortaxesTex 指紋識別出的匿名條目,是第一個看起來可能是兩者之一的具體物件;它在 AA Intelligence Index 上預計的 61 分,將使其領先目前榜上所有開放權重模型。指紋出現五天後,服務堆疊也有了動作:vLLM 的 G​LM-5 注意力工作正是新模型會留下的那種基礎工程,即便它沒有指名任何版本。這些都尚未證實;一旦名稱、規格卡或權重揭曉,本頁會立即更新。在那之前,低風險的做法是備好路由——而不是把整個堆疊押在一個指紋上。

The OrcaRouter model page for z-ai/glm-5.3, showing the model id, capability chips (Tools, JSON, Reasoning), a 1,000,000-token context window, a 128,000-token max output, text input and text output, and pass-through pricing of $1.26 per 1M input tokens and $3.96 per 1M output tokens.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新