
GLM-5.3-FlashX 以所運行模型 2.5 倍的價格推出
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
該留意的數字不是 200,而是 2.5。2026 年 9 月 18 日,Z.ai 將 GLM-5.3-FlashX上架至其 API,輸出速度最高可達每秒 200 個 token——並將其定價為對 GLM-5.3-Flash 所收費用的 2.5 倍;後者是它賴以建構的開放權重模型。模型本身沒有任何改變。相同的權重、相同的 320B-A18B 專家混合骨幹、相同的 100 萬 token 上下文、相同的原生處理文字、圖像、影片與檔案能力。改變的是其底下的服務堆疊,以及 Z.ai 現在為更靠近佇列前端這項特權所收取的費用。
這使 FlashX 在模型市場中成為罕見的存在:一場沒有附帶任何基準測試的發布。Z.ai 並未發布任何 FlashX 專屬的評估,因為沒有新模型可供評估。每一項適用於 GLM-5.3-Flash 的能力指標也同樣適用於此,包括那些不如發布報導所暗示的那麼體面的數據。
一次完成所有差異
• 速度 — GLM-5.3-FlashX 最高達 200 tok/s(廠商回報的峰值),相較之下 GLM-5.3-Flash 在 Z.ai 自家 API 上由 Artificial Analysis 測得為 98 tok/sbr> • 價格 — 每 1M 輸入 $0.37 / 每 1M 輸出 $1.25,對比定價表的 $0.15 / $0.50br> • 快取輸入 — 每 1M $0.075,對比每 1M $0.03br> • 智慧 — 完全相同;FlashX 繼承基礎模型的各項評分br> • 上下文 — 兩者皆為 1M tokensbr> • 權重 — GLM-5.3-Flash 是 MIT 授權的開放權重;FlashX 是託管方案,本身沒有權重
200 和 98 不是同一種數字,這一點值得直白說清楚。一個是供應商聲稱服務能達到的上限。另一個是獨立實驗室在真實請求中測出的結果。使用者在決定是否要付 2.5 倍價格時,應該把 200 當成廣告,並去測量自己的工作負載。

Z.ai 所說的正在發揮作用
加速來自基礎設施,而非數學。Z.ai 將 FlashX 描述為運行於約十萬個中國國產加速器組成的叢集上,並搭配一套專用服務堆疊:一個基於 SGLang 的推論引擎、W8A8 量化、混合 INT8/FP8/BF16 快取量化,以及將多模態編碼階段與詞元生成階段分離的編碼-預填充-解碼分離式架構,使兩者互不阻塞。該公司報告,在相同硬體上,其端到端服務輸送量約為初始基準的 3 倍,並表示一個由 GLM-5.3 驅動的基礎設施代理協助調校了該堆疊。
這一切都是由廠商自行報告,而且到目前為止,Z.ai 以外的任何人都未能重現。這也是這套說法中最可信的部分:像這樣的服務層級推出通常屬於工程上的勝利,而所描述的架構選擇正是取得這類增益的標準工具組。但它們並不構成保證。200 tok/s 這個數字是峰值,而峰值是在短輸出、暖快取與未壅塞的叢集上達到的。長上下文多模態請求——也就是 FlashX 明確鎖定的工作負載——正是最不可能達到它的那些請求。
價格才是真正的產品決策
按定價計,GLM-5.3-FlashX 每百萬輸入 token 為 $0.37、每百萬輸出 token 為 $1.25,快取輸入為 $0.075,而快取儲存限時免費。在 Z.ai 的國內定價中,這相當於輸入 ¥2、輸出 ¥7,基礎版 Flash 則為 ¥0.8 與 ¥2.8——同樣是 2.5 倍的比率,只是以 Z.ai 在自家市場販售所用的貨幣來表述。

算起來很快就會讓人不舒服,而且是在人們很少查看的那個方向上。輸出 token 正是乘數效應咬得最兇的地方,因為在這個系列裡的每個模型上,輸出都是昂貴的那一側:FlashX 的輸出是 Flash 輸出的 2.5 倍,而兩者的輸出價格本來就已經是輸入的約 3.4 倍。一個每天產生一百萬個輸出 token 的批次工作,會從 $0.50 變成 $1.25——對於一個按定義根本沒人在等的工作負載而言,一年就差 $274。
它划算的地方在於可以攤銷的延遲成本。一個進行十次依序呼叫的 agent 迴圈,能把每次呼叫的差異省下十倍;如果這個差異是兩、三秒,那麼每個任務就等於討回了半分鐘的實際時間。對於互動式程式碼補全、即時對話,或任何人類或上游服務正卡在等待下一個 token 的流程而言,這筆交易通常是正確的。Z.ai 也明確表示,該模型目前不屬於其 GLM Coding Plan 的一部分,因此訂閱用戶不會獲得捆綁的 FlashX——他們得為此按 token 付費。
如果你的技術堆疊已經能與多個供應商溝通,那麼切換就只是改動模型字串,別無其他。這正是路由之所以要作為一層存在的實務理由:在 OrcaRouter 上供應商的定價會以 0% 加價原樣傳遞,因此 Z.ai 的價格調整或促銷降價,會在上游發生的同一天反映出來;而用單一端點統轄 200 多個模型,也意味著要拿 FlashX 與 Flash 做比較評估,只需改一筆設定,而不是啟動一個整合專案。容錯移轉在這裡同樣重要——一個全新叢集上的全新服務層級,正是那種值得在背後準備備援的相依項目。
未曾改變的是什麼,以及為何它更重要
FlashX 完整繼承了 GLM-5.3-Flash 的能力輪廓,而這份輪廓比發表時的報導所暗示的還要狹窄。Z.ai 的資料把這個基礎模型在 Artificial Analysis 智慧指數上與 Claude Opus 4.8 並列。Artificial Analysis 本身目前在该指數上將 GLM-5.3-Flash 列為 42 分,且是在 Z.ai 自家 API 上測得的——這是個紮實的分數,遠高於同級開放權重模型的中位數,但距離廠商比較所暗示的前沿層級還差得遠。兩種說法都是真的;它們只是並非同一種說法,而兩者之間的落差,正是本部落格把廠商數字標示為廠商數字的原因。
基礎模型確實兼具實力與真正的開放性。GLM-5.3-Flash 於 2026 年 8 月 26 日以 MIT 授權條款發布,權重上架 Hugging Face,而其混合線性加稀疏注意力設計——IndexPool 壓縮、流形約束超連接——相較於 GLM-5.3 將注意力運算量削減約 3 倍、KV 快取削減約 4.4 倍,這正是讓一個擁有 18B 啟用參數的 320B 模型得以將服務成本壓低到足以實際部署的關鍵。輸出上限為 131,072 個 token。以它的價格而言它很快,但就同級模型而言並不快:Artificial Analysis 測得每秒 98 個 token,而同級模型的中位數高於 70,但仍低於排行榜上最快的模型。
FlashX 不會改變這一切。它改變的,是你得等多久。
誠實的解讀
如果你的工作負載受延遲限制,而且你已經決定 GLM-5.3-Flash 是正確的模型——一個會串接呼叫的代理、一個能行內補全的編輯器、一個停頓本身就是產品的語音或聊天介面——那就買 FlashX。如果你的工作是批次處理、離線,或受吞吐量限制而非受延遲限制,那就繼續使用 GLM-5.3-Flash,或使用你可以自行託管的開放權重。你支付 2.5 倍價格換來的智慧,是你早已擁有的智慧。
懸而未決的問題是:獨立測量對 200 有什麼說法。Z.ai 以外還沒有人公布 FlashX 的吞吐量數據,而在有人這麼做之前,最誠實的立場是:FlashX 是一個前景看好的服務層級,但推銷靠的是一個峰值數字。值得注意的是,這同時也是一場商業測試:一個花了一年時間、以旗艦模型十分之一價格免費提供接近前沿模型的實驗室,如今正在問開發者是否願意單獨為速度付費。答案將形塑下一個層級如何定價。

本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
