GLM-5.3-Flash vs GLM-5.3 — 旗艦款的三分優勢能否證明十倍價格的合理性?重新生成的插圖。
Guides & Insights

GLM-5.3-Flash vs GLM-5.3:旗艦款的3分優勢值得十倍價格嗎?

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

智谱AI在8月26日这天,对自己的旗舰模型进行了降价。就在同一天,它确认了GLM-5.3-Flash——即匿名“Ox Alpha”背后的180亿参数多模态模型——并将该模型的定价定为GLM-5.3的十分之一。GLM-5.3是其7430亿参数的旗舰模型,一周前刚登顶开源模型排行榜。限时折扣更是将其价格降至二十分之一。这两款模型共享同一个名称、同一条技术血脉,以及100万token的上下文窗口,但它们却处于智谱定价表的两端。如今,两者之间的差距成了关键问题:GLM-5.3在Artificial Analysis Intelligence Index上得分为60,而智谱声称GLM-5.3-Flash得分为57——因此,整个旗舰溢价就维系在三个指数点上,而这三点是否值得多花十到二十倍的钱,就成了一个问号。

這是一場家族內的比較,所以一般「哪個比較好」的框架是錯的——而是「哪個等級適合這項工作」。Flash 更便宜、已準備好開放權重,而且原生多模態;旗艦款在獨立測量的推理能力上更強、回答更冗長,而且仍在等待自己的開放權重日期。先給成績表,再講理由。

一個家族,兩個層級

GLM-5.3 是智譜的推理旗艦:在與 GLM-5.2 相同的混合專家基礎上,總參數達 743B(每個 token 約 40B 活躍參數),純文字模型,三個努力等級皆需要思考,且獨立測量的 AA Intelligence Index 分數為 60,與 Kimi K3 並列開放模型最高分。GLM-5.3-Flash 則採取相反定位:總參數 320B / 活躍 18B,橫跨 45 層,原生支援文字/圖片/影片輸入,MIT 授權的權重在發布當天即釋出,AA Index 分數為 57,由智譜報告但尚未經 Artificial Analysis 獨立確認。兩者皆支援 1M token 的上下文視窗,皆透過智譜 API 提供,並皆承襲以訓練後期強化為重的 GLM-5 方法——GLM-5.3 的所有進展來自於在固定基礎上擴大強化學習,而 Flash 延續此方向,而非逆轉。

A generated two-column scoreboard titled 'GLM-5.3-Flash vs GLM-5.3 — the scoreboard'. Left column GLM-5.3-Flash: AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, Price ~$0.14/$0.44 (discount ~$0.07/$0.22). Right column GLM-5.3: AA Index 60 (independent), Active params ~40B, Context 1M tokens, Modality text only, Open weights promised ~Aug 28, Price $1.40/$4.40. Footer: GLM-5.3 index independently measured; Flash index vendor-reported.

三個點去哪裡

在指數上,57 和 60 的差距,等同於追上 Claude Opus 4.8(57 分)與追上開放模型頂端的 Kimi K3(60 分)之間的差距。實際上,三個 AA 點對應到推理中最困難的部分——也就是旗艦模型憑藉規模化後訓練而表現出色的長程、多步驟問題。這與我們對這兩款模型的其他了解一致:GLM-5.3 是同級中最冗長的模型,每個任務產生的輸出 token 遠多於同儕,這正是模型在回答前思考更久的特徵。而根據智譜的定位,Flash 則是以一部分這種深思熟慮換取成本與速度。

此外也存在驗證上的不對稱性。GLM-5.3 的 60 分是由 Artificial Analysis 獨立測量得出;GLM-5.3-Flash 的 57 分則來自智譜的發佈資料,截至本文撰寫時尚未出現在排行榜上。在程式碼能力方面,GLM-5.3 的廠商通報數據相當亮眼(Terminal-Bench 3.0 28.3、DeepSWE v1.1 66.9、Agents' Last Exam CLI 28.5),而智譜宣稱 Flash 在其內部 Z.ai Code Bench 上的程式碼表現可與 Claude Opus 4.8 相提並論——這項宣稱,社群將在數天內(而非數月內)用 MIT 權重進行驗證。

價格差距,量化

GLM-5.3 的定價為每百萬輸入 tokens 1.40 美元,每百萬輸出 tokens 4.40 美元。GLM-5.3-Flash 的價格為其十分之一——約 0.14 / 0.44 美元,這是根據智譜(Zhipu)公布的比率推算——或限時折扣期間約為 0.07 / 0.22 美元,即二十分之一。智譜也表示,Flash 在 AA Intelligence Index 任務上的成本約為 0.045 美元,而 GLM-5.3 的估計成本為 0.68 美元。每 token 的價差是重點:三分的指數差異卻帶來十到二十倍的價格差距。

有兩個注意事項讓差距保持誠實。首先,Flash 的折扣明確是限時的,因此其長期穩定價格可能是 $0.14 / $0.44 的等級,而不是折扣後的 $0.07 / $0.22。其次,實際成本差距取決於冗長度:GLM-5.3 已知會消耗大量輸出 token,而 Flash 的輸出行為在大量使用下尚未被測量。如果 Flash 的擴展因子類似,那麼部分標價優勢在每項任務的基礎上就會消失。一如既往,請以你自己的工作負載比較每項任務的成本,而不是比較每個 token 的標價。

開放權重:Flash 在序列處理上勝過旗艦

這次發布最令人意外的細節是授權的順序。GLM-5.3-Flash 於8月26日——也就是公告發布的當天——以 MIT 授權在 Hugging Face 上釋出了模型權重。GLM-5.3——Zhipu 定位為開放權重旗艦的模型——截至當天仍為專有,其權重預計於8月28日左右釋出,也就是8月14日發布的兩週之後。結果是,Zhipu 較便宜的模型現在可以自行部署,而旗艦模型還不行;社群將能在旗艦模型權重釋出前,將 Flash 與旗艦模型宣稱的效能進行實測對比。如果 Flash 廠商回報的57分與編碼能力宣稱能通過獨立測試,旗艦模型的價值主張就會更難成立;若否,三點的溢價看起來就屬合理。

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

你實際上應該呼叫哪個 GLM?

按照定價所暗示的方式依序處理各層級:

• 多模態輸入 — GLM-5.3-Flash 是兩者中唯一具備原生文字/圖像/影片理解能力的型號;GLM-5.3 僅支援文字。

• 自行託管 — GLM-5.3-Flash 的 MIT 權重現已上線;GLM-5.3 的權重仍在等待中。

• 最困難的推理任務 — GLM-5.3,憑藉其獨立測得的60分及其眾所周知的深思熟慮深度。

• 成本敏感型用量 — GLM-5.3-Flash,費率僅為旗艦版的十分之一到二十分之一,並須留意上述的折扣注意事項。

• 代理式程式編寫——在 Flash 獲得獨立基準測試之前,證據好壞參半;GLM-5.3 供應商報告的編碼數據很強,但同樣未被複現,而 Flash 的編碼宣稱則更新。請在你自己的測試套件上進行測試。

在路由方面,這組對比的旗艦端已經在 OrcaRouter 上線——GLM-5.3 在智譜 API 開放當天就加入陣容,按智譜官方定價、0% 加價轉發。GLM-5.3-Flash 尚未上線;今天是它發布的日子。實質的好處是,一旦 Flash 落地,整個家族就統一在單一金鑰之下,路由 DSL 讓你把困難問題送給旗艦、大量流量送給 Flash,無需再做第二次整合。在那之前,Flash 的 MIT 權重是讓你自己確認工作負載實際上需要哪個等級的最快方式。

A screenshot of the OrcaRouter model page for z-ai/glm-5.3 showing the model id, a 1,000,000-token context window, the current per-1M input and output rates, and the reasoning capability chip.

底線

GLM-5.3-Flash 與 GLM-5.3 的比較並非真正的對決——而是智譜在同一條能力曲線上定價兩個檔次,價格差距本身就是產品策略。旗艦版的三個百分點優勢在關鍵之處(獨立評測、最困難的推理)是真實的,對需要它的工作負載而言物有所值。Flash 的十到二十倍折扣換來的是同一系列的技術路線、原生多模態輸入與 MIT 權重,代價是三個指數點與一套未經複現的宣稱。對於大多數不在最困難推理端點上的生產工作負載,Flash 是理性的預設選擇;而其餘情況,GLM-5.3 就是保險。在旗艦版權重發布前的兩週窗口期,將決定溢價中有多少是真正的能力,又有多少只是佔位。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube