GLM-5.2 评测:以開放權重價格提供接近前沿的編碼能力?

GLM-5.2 评测:以開放權重價格提供接近前沿的編碼能力?

作者

Fengya Tian

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Z.ai於2026年6月16日發布了GLM-5.2,並稱其為專為長期任務打造的旗艦模型。這一次,這個標籤名副其實。GLM-5.2配備了100萬token的上下文窗口,該窗口實際上經過了長期編碼代理會話的訓練,並具有迄今為止任何開放權重模型所發布的最強編碼分數——而且它同時在多處發布:Z.ai API、GLM Coding Plan,以及在Hugging Face上以完整MIT授權提供的權重,沒有任何地域限制。

這篇評測回答了大多數團隊真正在問的問題:開放權重模型是否終於夠格成為你的預設編碼模型,而封閉前沿的旗艦產品又在哪些環節依然值得其溢價?我們會涵蓋真正的新亮點、GLM-5.2 的實際成本(包括多數文章略過的緩存輸入折扣)、它與 GLM-5.1 及封閉前沿的對比,以及哪些人現在就該轉換。

快速判決

如果你…,請考慮 GLM-5.2。

- 執行高容量的編碼或代理工作負載,並希望以每百萬個令牌 $1.40 / $4.40 的價格獲得接近前沿的品質——僅為旗艦定價的一小部分

- 構建長時間運行的編碼代理——在 Z.ai 發表的 FrontierSWE 結果中,GLM-5.2 與 Claude Opus 4.8 相差不到一分,且領先於 GPT-5.5

需要一個1M token的上下文視窗,最多可輸出128K token,並且專門針對冗長且混亂的代理軌跡進行訓練,而不僅僅是規格表上的宣稱。

- 想要開放權重:MIT 許可證、自架、微調、以及零供應商鎖定

暫緩行動(或停留在已關閉的旗艦店)如果你…

- 在最困難的代理工作上需要絕對上限——Claude Opus 4.8 在工具編排和馬拉松式的自主任務上仍然明顯領先

- 需要图片或文件输入:GLM-5.2 僅支援文字;視覺功能在 Z.ai 單獨的 GLM-V 系列中。

- 受严格的延迟限制——GLM-5.2是一款思考优先的模型,公共网关统计显示中位首Token时间在数秒范围内

什麼是GLM-5.2?

GLM-5.2 是 Z.ai(原名智谱 AI)GLM 系列中最新的旗艦模型。Z.ai 是少數幾家發布前沿規模開源權重模型的實驗室之一。公開的模型文件顯示,其採用混合專家(Mixture-of-Experts)設計,總參數約為 7500 億,每 Token 活躍參數約 400 億。模型 ID 為 `glm-5.2`,現已全面開放:您可以在 Z.ai 上與其對話,通過 Z.ai API 調用它,在 GLM 編碼計畫訂閱中使用(比公開發布早幾天出現),或從 Hugging Face 下載權重並自行運行。

這一世代值得注意的是定位。Z.ai 並非將 GLM-5.2 作為更便宜的跟跑者來銷售,而是將其推銷為最強大的開源程式碼模型,並公佈了數據顯示,在大多數開發者目前投入的長期程式碼撰寫與智能體等任務上,它與封閉前沿僅差幾分。

GLM-5.2 有什麼新功能?

這是一個長遠的編碼飛躍,而不是一個小版本更新。主要的變化。在 Z.ai 發布的基準測試表中,GLM-5.2 在 Terminal-Bench 2.1 上得分為 81.0,而 GLM-5.1 為 63.5;在 SWE-bench Pro 上則為 62.1 對比 58.4。最驚人的數字是 FrontierSWE,該指標衡量的是運行數小時到數十小時的開放式工程專案:74.4 對比 GLM-5.1 的 30.5。

一個穩固的100萬token上下文。 GLM-5.2是首個GLM模型,將一個一百萬token的窗口(是GLM-5.1的200K的五倍)與針對該窗口的訓練相結合:Z.ai表示,它大幅擴展了程式碼代理場景下的1M上下文訓練——大規模實作、自動化研究、效能最佳化、複雜除錯。每次回應的輸出上限為128K token。

努力程度控制。全新一代特性:您可以透過設定思考努力程度,明確地在能力、執行速度和計算成本之間進行取捨,而非對每個請求都使用固定的推理深度。

更便宜的底层架構。 Z.ai 的新 IndexShare 技術在每四個稀疏注意力層之間重複使用同一個索引器,在完整 1M 上下文長度下將每 token 的計算量減少 2.9 倍;同時,改進後的 MTP 層將接受長度提升至 20%,從而加速推測解碼。

纯粹开放。 权重以MIT许可证发布,用Z.ai的话来说,没有区域限制——商业使用、微调和私有托管都是允许的。

定價:實際成本

第一方GLM 5.2 API的定價為每百萬輸入Token 1.40美元,每百萬輸出Token 4.40美元——與GLM-5.1的標價相同,因此如果您已經在使用GLM API,則能力躍升無需額外費用。快取輸入降至每百萬0.26美元,而Z.ai目前正在限時豁免快取存儲費用,這對於數百次重新讀取相同專案上下文的代理循環而言非常重要。

作為參考:Claude Opus 4.8 的定價為每百萬 token $5 / $25。如果 Z.ai 的基準測試表即使方向性正確,GLM-5.2 就能以不到旗艦輸出價格的五分之一提供前沿的長期編碼能力。兩點注意:努力程度決定了實際花費(更高的努力意味著更多的思考 token),而且第三方託管商有自己的定價——有些比第一方更便宜——所以在預算前請查看當前價格。

評分

以下分數是我們根據 Z.ai 發表的基準測試與模型文檔所做的編輯評估——基準測試表為供應商自行提供。我們會在獨立結果出爐後重新審視。

- 編碼: 9/10

- 代理/工具使用:8/10 — 在MCP-Atlas上接近前沿,但Opus 4.8在工具編排方面依然明顯領先

- 推理:8/10 — 頂尖數學(AIME 2026:99.2,Z.ai 表格中的最高分),但最廣泛的推理測試仍然偏愛封閉的前沿

- 成本效益:10/10

- 上下文與長文件: 9/10

- 速度與延遲:7/10 — 一個思考優先的模型;對於快速任務,使用較低的努力等級。

總體評分:~8.5/10 — 第一個開放權重模型,足夠接近前沿,以至於成為預設選擇,而非妥協。

優點

- 接近前沿的長期編碼,每百萬個令牌 $1.40 / $4.40 — 與 GLM-5.1 價格相同,遠低於封閉式旗艦模型

- 紮實的1M token上下文,128K輸出,基於真實編碼智能體軌跡訓練

每請求的成本/延遲/品質權衡調整的努力等級控制

- MIT 開放權重:自行託管、微調,或保留私有備用方案 — 無鎖定,無地域限制

- 缓存輸入每百萬次0.26美元,且快取儲存目前免費——對代理迴圈來說很重要

缺點

- Claude Opus 4.8 仍然在最难的智能體基準測試中領先——工具編排與馬拉松式長任務還不是 GLM-5.2 的桂冠。

- 純文字:無圖像輸入,因此以螢幕截圖為驅動或文件視覺的工作流程需要不同的模型。

- 思維優先設計意味著明顯的首令牌時間;對延遲敏感的用戶體驗需要更低努力設定或更快的備用方案。

- 自託管是一項數據中心級別的項目,而非週末可完成的簡單任務——據報導,完整檢查點需要集群規模的GPU記憶體。

- 基準測試的故事目前仍停留在 Z.ai 自身的平台上;獨立的複現結果尚待出爐。

GLM-5.2 的比較

对比 GLM-5.1. 相同的 $1.40 / $4.40 标价,上下文窗口增大五倍,以及一次看起来像代际跳跃的长期跳跃:FrontierSWE 74.4 对比 30.5,Terminal-Bench 2.1 81.0 对比 63.5,SWE-Marathon 13.0 对比 1.0。如果你正在使用 GLM-5.1,这会是今年最简单的升级选择——Z.ai 甚至发布了专门的迁移指南。

與封閉前沿的比較(Claude Opus 4.8、GPT-5.5)。 在Z.ai的評測表中,GLM-5.2在Terminal-Bench 2.1上與Opus 4.8僅差四分(81.0 vs 85.0),在FrontierSWE上差一分以內(74.4 vs 75.1),並且在SWE-bench Pro(62.1 vs 58.6)和FrontierSWE(74.4 vs 72.6)上實際超越了GPT-5.5。前沿模型在任務最長、工具負載最重的項目中仍保持優勢:Opus 4.8在SWE-Marathon上的得分是GLM-5.2的兩倍(26.0 vs 13.0),並在Tool-Decathlon中大幅領先。實用法則:GLM-5.2負責大量運算,旗艦模型負責攻頂。

与其他开放权重模型对比。在与Qwen3.7-MaxMiniMax M3和DeepSeek-V4-Pro的对比中,GLM-5.2在已发布表格的每一行编码指标上都位列第一。截至目前,开放权重编码领域的桂冠由Z.ai摘得。

誰應該使用 GLM-5.2?

大規模運行編碼代理的團隊 — 持續整合機器人、自動重構、程式碼審查 — 其中每項任務的成本決定了什麼在經濟上可行

- 想要前沿品質但沒有前沿價格的開發工具建構者

- 長上下文工作負載:單一儲存庫分析、多份文件工程規格、長達數小時的代理工作階段,實際上會填滿 1M 個 token

需要開放權重的組織——出於合規、隔離部署、微調,或僅僅是為了與API供應商談判時獲得籌碼。

誰應該堅持使用封閉式旗艦機?

- 那些最困難任務是馬拉松式自主運行或大量工具編排的團隊 — 基準測試顯示前沿溢價在那裡仍然真實存在

- 依賴視覺的工作流程:GLM-5.2 不接受圖片

- 首次令牌延遲的每一秒都讓使用者付出代價的產品

GLM-5.2 值得嗎?

對大多數編碼和代理工作負載而言,是的——毋庸置疑。誠實地說:GLM-5.2 以不到五分之一的價格為您提供約 90-95% 的前沿長期編碼能力,並附帶開放權重作為保障。封閉式旗艦模型在最艱難的 5% 任務中仍然勝出。這不是跳過 GLM-5.2 的理由,而是分流的原因:將大量任務交給 GLM-5.2,並將頂級問題升級至旗艦模型。

最終判決

GLM-5.2是現今最強大的開放權重程式碼模型,也是第一個讀起來像是預設選擇而非預算妥協的模型——我們的評分:約8.5/10。它並未在最高難度領域取代Claude Opus 4.8,但使旗艦機型成為專門工具,而非顯而易見的日常解答。如果你正在使用GLM-5.1,請立即升級。如果你正為常規代理工作支付旗艦價格,這是你重新衡量的信號。

通過 OrcaRouter 使用 GLM-5.2

因為明智的做法是「GLM-5.2 負責大量任務,而旗艦機型負責最困難的任務」,您在生產環境中很可能需要多個模型——來自多家供應商。而這正是 OrcaRouter 所消除的摩擦。

OrcaRouter 已透過一個與 OpenAI 相容的端點提供 GLM-5.2(模型 ID `z-ai/glm-5.2`),採用 Z.ai 自身的 $1.40 / $4.40 費率,且不收取任何代幣加成。將高流量的編碼與代理流量路由至 GLM-5.2,將最困難的推理任務升級至 Claude Opus 4.8 或其他旗艦模型,並為發佈視窗期間的容量高峰準備好自動容錯轉移——每次更換模型時,無需重寫您的整合程式碼。

常見問題

GLM-5.2 現在可用嗎?

是的。它於2026年6月16日推出,並已普遍可用:在Z.ai的聊天和API(模型ID glm-5.2)上,在GLM Coding Plan內部,經由OrcaRouter等網關,以及作為MIT許可的開源權重在Hugging Face上。

GLM-5.2 的價格是多少?

第一方API定價為每百萬輸入代幣1.40美元,每百萬輸出代幣4.40美元——與GLM-5.1相同。快取輸入為每百萬0.26美元,快取儲存在限定時間內免費。

GLM-5.2 是否比 GLM-5.1 更好?

在長期工作方面以大幅差距領先:Terminal-Bench 2.1 上 81.0 對 63.5,FrontierSWE 上 74.4 對 30.5,以及 1M 上下文對 200K — 且價格相同。

GLM-5.2 與 Claude Opus 4.8 — 我該使用哪一個?

預設使用 GLM-5.2 進行高容量編碼與代理工作;將馬拉松式的自主任務和繁重的工具協調升級到 Opus 4.8,它在這方面仍然領先。在它們之間進行路由切換勝過只選一個。

什麼是上下文視窗?

1M tokens,每個回應最多128K輸出tokens——而Z.ai表示,長視窗是專門針對編碼代理場景訓練的,而不僅僅是擴展的。

GLM-5.2 真的是開源的嗎?

是的——这些权重以MIT许可证发布,没有地区限制,可免费用于商业用途和微调。不过自建部署需要合理预算:一个约750B参数的MoE检查点需要集群级GPU内存。

GLM-5.2 支援圖片輸入嗎?

不。GLM-5.2 是文字輸入、文字輸出。針對視覺任務,Z.ai 維護了另一條 GLM-V 模型產品線,或者您可以將圖像請求路由至多模態模型。

我可以透過 OrcaRouter 使用 GLM-5.2 嗎?

是的——GLM-5.2 已於 OrcaRouter 上以 z-ai/glm-5.2 的形式上線,採用第一方費率且零加價,與 Claude、GPT、Gemini 及其他模型共同透過一個相容 OpenAI 的端點提供服務。

準備好將 GLM-5.2 投入生產了嗎?幾分鐘內即可啟用——建立您的 OrcaRouter 帳戶,透過一個相容 OpenAI 的端點調用 GLM-5.2、Claude Opus 4.8 以及所有其他領先模型。前沿級程式設計變得更加便宜;路由層正是您節省成本的方式。



© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube