
GLM-5.3-Flash vs GLM-5.3:旗艦款的3分優勢值得十倍價格嗎?
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
智谱AI在8月26日这天,对自己的旗舰模型进行了降价。就在同一天,它确认了GLM-5.3-Flash——即匿名“Ox Alpha”背后的180亿参数多模态模型——并将该模型的定价定为GLM-5.3的十分之一。GLM-5.3是其7430亿参数的旗舰模型,一周前刚登顶开源模型排行榜。限时折扣更是将其价格降至二十分之一。这两款模型共享同一个名称、同一条技术血脉,以及100万token的上下文窗口,但它们却处于智谱定价表的两端。如今,两者之间的差距成了关键问题:GLM-5.3在Artificial Analysis Intelligence Index上得分为60,而智谱声称GLM-5.3-Flash得分为57——因此,整个旗舰溢价就维系在三个指数点上,而这三点是否值得多花十到二十倍的钱,就成了一个问号。
這是一場家族內的比較,所以一般「哪個比較好」的框架是錯的——而是「哪個等級適合這項工作」。Flash 更便宜、已準備好開放權重,而且原生多模態;旗艦款在獨立測量的推理能力上更強、回答更冗長,而且仍在等待自己的開放權重日期。先給成績表,再講理由。
一個家族,兩個層級
GLM-5.3 是智譜的推理旗艦:在與 GLM-5.2 相同的混合專家基礎上,總參數達 743B(每個 token 約 40B 活躍參數),純文字模型,三個努力等級皆需要思考,且獨立測量的 AA Intelligence Index 分數為 60,與 Kimi K3 並列開放模型最高分。GLM-5.3-Flash 則採取相反定位:總參數 320B / 活躍 18B,橫跨 45 層,原生支援文字/圖片/影片輸入,MIT 授權的權重在發布當天即釋出,AA Index 分數為 57,由智譜報告但尚未經 Artificial Analysis 獨立確認。兩者皆支援 1M token 的上下文視窗,皆透過智譜 API 提供,並皆承襲以訓練後期強化為重的 GLM-5 方法——GLM-5.3 的所有進展來自於在固定基礎上擴大強化學習,而 Flash 延續此方向,而非逆轉。

三個點去哪裡
在指數上,57 和 60 的差距,等同於追上 Claude Opus 4.8(57 分)與追上開放模型頂端的 Kimi K3(60 分)之間的差距。實際上,三個 AA 點對應到推理中最困難的部分——也就是旗艦模型憑藉規模化後訓練而表現出色的長程、多步驟問題。這與我們對這兩款模型的其他了解一致:GLM-5.3 是同級中最冗長的模型,每個任務產生的輸出 token 遠多於同儕,這正是模型在回答前思考更久的特徵。而根據智譜的定位,Flash 則是以一部分這種深思熟慮換取成本與速度。
此外也存在驗證上的不對稱性。GLM-5.3 的 60 分是由 Artificial Analysis 獨立測量得出;GLM-5.3-Flash 的 57 分則來自智譜的發佈資料,截至本文撰寫時尚未出現在排行榜上。在程式碼能力方面,GLM-5.3 的廠商通報數據相當亮眼(Terminal-Bench 3.0 28.3、DeepSWE v1.1 66.9、Agents' Last Exam CLI 28.5),而智譜宣稱 Flash 在其內部 Z.ai Code Bench 上的程式碼表現可與 Claude Opus 4.8 相提並論——這項宣稱,社群將在數天內(而非數月內)用 MIT 權重進行驗證。
價格差距,量化
GLM-5.3 的定價為每百萬輸入 tokens 1.40 美元,每百萬輸出 tokens 4.40 美元。GLM-5.3-Flash 的價格為其十分之一——約 0.14 / 0.44 美元,這是根據智譜(Zhipu)公布的比率推算——或限時折扣期間約為 0.07 / 0.22 美元,即二十分之一。智譜也表示,Flash 在 AA Intelligence Index 任務上的成本約為 0.045 美元,而 GLM-5.3 的估計成本為 0.68 美元。每 token 的價差是重點:三分的指數差異卻帶來十到二十倍的價格差距。
有兩個注意事項讓差距保持誠實。首先,Flash 的折扣明確是限時的,因此其長期穩定價格可能是 $0.14 / $0.44 的等級,而不是折扣後的 $0.07 / $0.22。其次,實際成本差距取決於冗長度:GLM-5.3 已知會消耗大量輸出 token,而 Flash 的輸出行為在大量使用下尚未被測量。如果 Flash 的擴展因子類似,那麼部分標價優勢在每項任務的基礎上就會消失。一如既往,請以你自己的工作負載比較每項任務的成本,而不是比較每個 token 的標價。
開放權重:Flash 在序列處理上勝過旗艦
這次發布最令人意外的細節是授權的順序。GLM-5.3-Flash 於8月26日——也就是公告發布的當天——以 MIT 授權在 Hugging Face 上釋出了模型權重。GLM-5.3——Zhipu 定位為開放權重旗艦的模型——截至當天仍為專有,其權重預計於8月28日左右釋出,也就是8月14日發布的兩週之後。結果是,Zhipu 較便宜的模型現在可以自行部署,而旗艦模型還不行;社群將能在旗艦模型權重釋出前,將 Flash 與旗艦模型宣稱的效能進行實測對比。如果 Flash 廠商回報的57分與編碼能力宣稱能通過獨立測試,旗艦模型的價值主張就會更難成立;若否,三點的溢價看起來就屬合理。

你實際上應該呼叫哪個 GLM?
按照定價所暗示的方式依序處理各層級:
• 多模態輸入 — GLM-5.3-Flash 是兩者中唯一具備原生文字/圖像/影片理解能力的型號;GLM-5.3 僅支援文字。
• 自行託管 — GLM-5.3-Flash 的 MIT 權重現已上線;GLM-5.3 的權重仍在等待中。
• 最困難的推理任務 — GLM-5.3,憑藉其獨立測得的60分及其眾所周知的深思熟慮深度。
• 成本敏感型用量 — GLM-5.3-Flash,費率僅為旗艦版的十分之一到二十分之一,並須留意上述的折扣注意事項。
• 代理式程式編寫——在 Flash 獲得獨立基準測試之前,證據好壞參半;GLM-5.3 供應商報告的編碼數據很強,但同樣未被複現,而 Flash 的編碼宣稱則更新。請在你自己的測試套件上進行測試。
在路由方面,這組對比的旗艦端已經在 OrcaRouter 上線——GLM-5.3 在智譜 API 開放當天就加入陣容,按智譜官方定價、0% 加價轉發。GLM-5.3-Flash 尚未上線;今天是它發布的日子。實質的好處是,一旦 Flash 落地,整個家族就統一在單一金鑰之下,路由 DSL 讓你把困難問題送給旗艦、大量流量送給 Flash,無需再做第二次整合。在那之前,Flash 的 MIT 權重是讓你自己確認工作負載實際上需要哪個等級的最快方式。

底線
GLM-5.3-Flash 與 GLM-5.3 的比較並非真正的對決——而是智譜在同一條能力曲線上定價兩個檔次,價格差距本身就是產品策略。旗艦版的三個百分點優勢在關鍵之處(獨立評測、最困難的推理)是真實的,對需要它的工作負載而言物有所值。Flash 的十到二十倍折扣換來的是同一系列的技術路線、原生多模態輸入與 MIT 權重,代價是三個指數點與一套未經複現的宣稱。對於大多數不在最困難推理端點上的生產工作負載,Flash 是理性的預設選擇;而其餘情況,GLM-5.3 就是保險。在旗艦版權重發布前的兩週窗口期,將決定溢價中有多少是真正的能力,又有多少只是佔位。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
