主視覺標題卡,用於比較 GLM-5.3 和 GLM-5.2,副標題為「同一個大腦,基準測試成績翻倍」,兩張模型卡片共享一個連通的 743B MoE 基礎區塊,並有一條標示為「僅後期訓練」的彎曲升級箭頭,從 GLM-5.2 指向 GLM-5.3。
Guides & Insights

GLM-5.3 vs GLM-5.2:同樣的大腦,翻倍的基準測試成績

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

{{1}}智譜AI對於從GLM-5.2升級至G​LM-5.3的自述是誠實的:課本沒變,變的是學生的訓練方式。{{/1}}{{2}}G​LM-5.3於2026年8月14日發布,建立在與GLM-5.2完全相同的7430億參數MoE架構之上,該架構在6月的Artificial Analysis Intelligence Index中奪得開放權重領域的桂冠。{{/2}}{{3}}架構不變、佔用資源不變、每百萬tokens定價1.40美元/4.40美元亦不變——然而Z.ai報告稱,經過重新訓練的模型在兩個版本都發布的數項程式碼與安全基準測試中,表現是前代的一倍或更佳。{{/3}}{{4}}至於G​LM-5.3是必須升級還是靜觀其變,取決於你對一個在架構未變的情況下進步如此之大的模型有多信任,也取決於它新浮現的網路安全能力,是否是你希望被封鎖在兩週安全審查窗口之後的功能。{{/4}}

同一個大腦,重新訓練。

讓 GLM-5.2 成為實用伺服器的所有特點都延續下來:743B 的 MoE(約 40B 啟用參數)、在 1M 上下文下減少 FLOPs 的 IndexShare 稀疏注意力、MIT 授權、1M 上下文視窗,以及在獨立觀測中測得約每秒 145–168 個 token 的精簡吞吐量。G​LM-5.3 僅在一個維度上有所不同——後訓練。Z.ai 利用 IndexShare、SAO 和 Slime 框架擴大了強化學習階段的規模,增加了數十倍以上的長時程任務環境,並將它們從程式碼除錯擴展到安全漏洞發現與系統工程。結果是,在相同的硬體上,模型的行為有所不同;這正是為什麼升級的問題不是「我需要新的 GPU 嗎」,而是「我需要新的行為嗎」。

基準差異,雙向皆然

從 Z.ai 公布的數據來看,這是一組前後對比,而這項躍升是開放權重史上最大的一次。Terminal-Bench 3.0——這個難度更高的修訂版,兩個模型都在此接受評分——從 4.6 跳到 28.3,躍升了六倍。DeepSWE v1.1 從 46.2 提升到 66.9,這正是「優秀的開放模型」與「能與封閉式領先者競爭」之間的差別。Agents' Last Exam 的 CLI 子集從 23.8 進步到 28.5。CyberGym 的漏洞發現率從 77.2 上升到 84.5。ExploitBench 的分數成長超過一倍,從 24.4 來到 54.4,而 ExploitGym 的吞吐量則從完成 29 與 39 個任務(分別為兩小時與六小時)提升到 105 與 130。Z.ai 將其總結為約 50% 的編碼能力提升,而這些成長的分布——集中在長時程編碼、終端自動化與資安領域——與僅事後訓練的模型一致:原始知識不變,但實際執行多步驟工作的能力變得更強了。

Terminal-Bench 3.0 — GLM-5.2 4.6 對比 GLM-5.3 28.3

• DeepSWE v1.1 — GLM-5.2 46.2 對比 G​LM-5.3 66.9

• Agents' Last Exam (CLI) — GLM-5.2 23.8 對比 G​LM-5.3 28.5

• CyberGym 漏洞發現 — GLM-5.2 77.2 對比 GLM-5.3 84.5

• ExploitBench — GLM-5.2 24.4 對比 G​LM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

無人排程的能力

這些安全方面的成果值得單獨一段來說明,因為 Z.ai 表示這並非原本的計畫。後訓練團隊加入了漏洞發現環境,原本預期只會帶來小幅進展;然而模型反而開始串聯完整的漏洞利用鏈,這種湧現行為迫使 Z.ai 將模型權重延後約兩週發布,以進行安全強化。在與安全團隊進行的真實世界測試中,G​LM-5.3 協助在 269 個專案中發現了 2,436 個漏洞,其中 1,097 個屬於中高風險,包括一些在廣泛部署的軟體中潛藏數十年未被發現的缺陷。GLM-5.2 具備一般意義上的安全能力——它能閱讀程式碼來找出錯誤。G​LM-5.3 的安全能力則是另一種意義:它正是安全緩衝期所要防範的那種東西。這是本質上的改變,而非程度上的差異;這也是最有力的單一理由,讓我們即使兩者共享基礎模型,仍應將它們視為不同的產品。

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

一致性警告

上述每個數字的另一面在於,早期第三方測試將 G​LM-5.3 描述為表現不穩定,而 GLM-5.2 並非如此。獨立評測者回報,同一個模型在某些任務上表現得像勉強及格的外包工程師,在其他任務上卻交出專業級成果,差異取決於需求敘述是否明確。這正是你會從一個增益完全來自環境密集型後訓練的模型身上預測到的失敗型態:它從訓練時所見的任務形狀進行泛化,而規格不佳的提示詞則落在這些形狀之外。沒有一項獨立結果能像 Z.ai 公布的表格那樣乾淨,Z.ai 的數字也尚未被獨立重現。就生產環境而言,這表示遷移前必須針對你自己的實際工作負載進行明確評估——這是 GLM-5.2 當時也需要的同一項警示,只是如今最佳與最差情況之間的差距更大了。

價格、取得方式與等待問題

定價完全相同,這消除了常見的升級摩擦:兩個模型都是每百萬 tokens 1.40 美元 / 4.40 美元,其中 G​LM-5.3 需要啟用 thinking。真正的差異在於取用方式。GLM-5.2 今天即可在 MIT 授權下下載,可在低於 TB 等級的 FP8 佔用空間上自行託管,並可透過 OrcaRouter 以定價呼叫、無任何加價——這是現在就能路由使用、穩定且經獨立評測的模型。G​LM-5.3 目前可透過 Z.ai 的 ZCode / AutoClaw 與 G​LM Coding Plan 使用,但公開 API 與權重皆因安全窗口而設有門禁,其基準數據也全是廠商自行回報,尚待第三方重新執行驗證。因此,「該不該等」的誠實答案有兩部分:就絕不能退步的正式環境流量而言,GLM-5.2 至今仍是安全的開放權重選擇;而一旦 G​LM-5.3 的 API 開放且獨立評測結果過關,轉移只是換路線,不是重寫——你保留同一套一鍵設定,切換車道即可。至於探索性與安全評估工作,G​LM-5.3 現在就值得透過 Z.ai 的工具試用,但需理解:其宣稱的領先尚未驗證,且行為比它所取代的模型更不穩定。

誠實的裁決

G​LM-5.3 在 Z.ai 自己的數據上是更好的模型——在長時程編碼上明顯更好,在安全性上則截然不同——而且由於基礎、佔用空間和價格都保持不變,因此對你的工作流程沒有任何額外成本。但「在供應商的評測中更好」與「在你的管線中更好」之間,隔著 GLM-5.2 已經具備、而 G​LM-5.3 尚未具備的兩件事:獨立複現與釋出權重。如果你已經在跑 GLM-5.2,升級路徑是開放權重史上最便宜的——同樣的硬體、同樣的價格、同樣的 API 介面,只需等待兩週就能取得權重。這個決定與其說是關於 G​LM-5.3 是否比 GLM-5.2 好,不如說是關於你是否願意把生產環境押在一個模型上——其改進、以及其新湧現的安全能力,都尚未得到 Z.ai 以外任何人的確認。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube