GLM-5.3-FlashX 的主視覺標題卡,副標為「相同權重,2.5 倍的價格」,標籤寫著「最高 200 tok/s(廠商數據)」、「每 1M 美元 $0.37 / $1.25」以及「1M 上下文」,頁腳一行寫著「服務層級於 2026 年 9 月 18 日推出」。
Guides & Insights

GLM-5.3-FlashX 以所運行模型 2.5 倍的價格推出

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

該留意的數字不是 200,而是 2.5。2026 年 9 月 18 日,Z.ai 將 GLM-5.3-FlashX上架至其 API,輸出速度最高可達每秒 200 個 token——並將其定價為對 GLM-5.3-Flash 所收費用的 2.5 倍;後者是它賴以建構的開放權重模型。模型本身沒有任何改變。相同的權重、相同的 320B-A18B 專家混合骨幹、相同的 100 萬 token 上下文、相同的原生處理文字、圖像、影片與檔案能力。改變的是其底下的服務堆疊,以及 Z.ai 現在為更靠近佇列前端這項特權所收取的費用。

這使 FlashX 在模型市場中成為罕見的存在:一場沒有附帶任何基準測試的發布。Z.ai 並未發布任何 FlashX 專屬的評估,因為沒有新模型可供評估。每一項適用於 GLM-5.3-Flash 的能力指標也同樣適用於此,包括那些不如發布報導所暗示的那麼體面的數據。

一次完成所有差異

• 速度 — GLM-5.3-FlashX 最高達 200 tok/s(廠商回報的峰值),相較之下 GLM-5.3-Flash 在 Z.ai 自家 API 上由 Artificial Analysis 測得為 98 tok/sbr> • 價格 — 每 1M 輸入 $0.37 / 每 1M 輸出 $1.25,對比定價表的 $0.15 / $0.50br> • 快取輸入 — 每 1M $0.075,對比每 1M $0.03br> • 智慧 — 完全相同;FlashX 繼承基礎模型的各項評分br> • 上下文 — 兩者皆為 1M tokensbr> • 權重 — GLM-5.3-Flash 是 MIT 授權的開放權重;FlashX 是託管方案,本身沒有權重

200 和 98 不是同一種數字,這一點值得直白說清楚。一個是供應商聲稱服務能達到的上限。另一個是獨立實驗室在真實請求中測出的結果。使用者在決定是否要付 2.5 倍價格時,應該把 200 當成廣告,並去測量自己的工作負載。

A single-column scoreboard titled 'GLM-5.3-FlashX - the scoreboard' with rows reading 'Speed: up to 200 tok/s (vendor peak)', 'Measured speed: 98 tok/s (base model)', 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Context: 1M tokens' and 'Weights: hosted tier only', with a footer reading 'Speed is a vendor-reported peak; base-model figures per Artificial Analysis.'

Z.ai 所說的正在發揮作用

加速來自基礎設施,而非數學。Z.ai 將 FlashX 描述為運行於約十萬個中國國產加速器組成的叢集上,並搭配一套專用服務堆疊:一個基於 SGLang 的推論引擎、W8A8 量化、混合 INT8/FP8/BF16 快取量化,以及將多模態編碼階段與詞元生成階段分離的編碼-預填充-解碼分離式架構,使兩者互不阻塞。該公司報告,在相同硬體上,其端到端服務輸送量約為初始基準的 3 倍,並表示一個由 GLM-5.3 驅動的基礎設施代理協助調校了該堆疊。

這一切都是由廠商自行報告,而且到目前為止,Z.ai 以外的任何人都未能重現。這也是這套說法中最可信的部分:像這樣的服務層級推出通常屬於工程上的勝利,而所描述的架構選擇正是取得這類增益的標準工具組。但它們並不構成保證。200 tok/s 這個數字是峰值,而峰值是在短輸出、暖快取與未壅塞的叢集上達到的。長上下文多模態請求——也就是 FlashX 明確鎖定的工作負載——正是最不可能達到它的那些請求。

價格才是真正的產品決策

按定價計,GLM-5.3-FlashX 每百萬輸入 token 為 $0.37、每百萬輸出 token 為 $1.25,快取輸入為 $0.075,而快取儲存限時免費。在 Z.ai 的國內定價中,這相當於輸入 ¥2、輸出 ¥7,基礎版 Flash 則為 ¥0.8 與 ¥2.8——同樣是 2.5 倍的比率,只是以 Z.ai 在自家市場販售所用的貨幣來表述。

A screenshot of Z.ai's official pricing documentation page (captured September 19, 2026) showing the 'Latest Models' table with GLM-5.3-Flash at $0.15 input, $0.03 cached input and $0.50 output per 1M tokens, and GLM-5.3-FlashX at $0.37, $0.075 and $1.25.

算起來很快就會讓人不舒服,而且是在人們很少查看的那個方向上。輸出 token 正是乘數效應咬得最兇的地方,因為在這個系列裡的每個模型上,輸出都是昂貴的那一側:FlashX 的輸出是 Flash 輸出的 2.5 倍,而兩者的輸出價格本來就已經是輸入的約 3.4 倍。一個每天產生一百萬個輸出 token 的批次工作,會從 $0.50 變成 $1.25——對於一個按定義根本沒人在等的工作負載而言,一年就差 $274。

它划算的地方在於可以攤銷的延遲成本。一個進行十次依序呼叫的 agent 迴圈,能把每次呼叫的差異省下十倍;如果這個差異是兩、三秒,那麼每個任務就等於討回了半分鐘的實際時間。對於互動式程式碼補全、即時對話,或任何人類或上游服務正卡在等待下一個 token 的流程而言,這筆交易通常是正確的。Z.ai 也明確表示,該模型目前不屬於其 GLM Coding Plan 的一部分,因此訂閱用戶不會獲得捆綁的 FlashX——他們得為此按 token 付費。

如果你的技術堆疊已經能與多個供應商溝通,那麼切換就只是改動模型字串,別無其他。這正是路由之所以要作為一層存在的實務理由:在 OrcaRouter 上供應商的定價會以 0% 加價原樣傳遞,因此 Z.ai 的價格調整或促銷降價,會在上游發生的同一天反映出來;而用單一端點統轄 200 多個模型,也意味著要拿 FlashX 與 Flash 做比較評估,只需改一筆設定,而不是啟動一個整合專案。容錯移轉在這裡同樣重要——一個全新叢集上的全新服務層級,正是那種值得在背後準備備援的相依項目。

未曾改變的是什麼,以及為何它更重要

FlashX 完整繼承了 GLM-5.3-Flash 的能力輪廓,而這份輪廓比發表時的報導所暗示的還要狹窄。Z.ai 的資料把這個基礎模型在 Artificial Analysis 智慧指數上與 Claude Opus 4.8 並列。Artificial Analysis 本身目前在该指數上將 GLM-5.3-Flash 列為 42 分,且是在 Z.ai 自家 API 上測得的——這是個紮實的分數,遠高於同級開放權重模型的中位數,但距離廠商比較所暗示的前沿層級還差得遠。兩種說法都是真的;它們只是並非同一種說法,而兩者之間的落差,正是本部落格把廠商數字標示為廠商數字的原因。

基礎模型確實兼具實力與真正的開放性。GLM-5.3-Flash 於 2026 年 8 月 26 日以 MIT 授權條款發布,權重上架 Hugging Face,而其混合線性加稀疏注意力設計——IndexPool 壓縮、流形約束超連接——相較於 GLM-5.3 將注意力運算量削減約 3 倍、KV 快取削減約 4.4 倍,這正是讓一個擁有 18B 啟用參數的 320B 模型得以將服務成本壓低到足以實際部署的關鍵。輸出上限為 131,072 個 token。以它的價格而言它很快,但就同級模型而言並不快:Artificial Analysis 測得每秒 98 個 token,而同級模型的中位數高於 70,但仍低於排行榜上最快的模型。

FlashX 不會改變這一切。它改變的,是你得等多久。

誠實的解讀

如果你的工作負載受延遲限制,而且你已經決定 GLM-5.3-Flash 是正確的模型——一個會串接呼叫的代理、一個能行內補全的編輯器、一個停頓本身就是產品的語音或聊天介面——那就買 FlashX。如果你的工作是批次處理、離線,或受吞吐量限制而非受延遲限制,那就繼續使用 GLM-5.3-Flash,或使用你可以自行託管的開放權重。你支付 2.5 倍價格換來的智慧,是你早已擁有的智慧。

懸而未決的問題是:獨立測量對 200 有什麼說法。Z.ai 以外還沒有人公布 FlashX 的吞吐量數據,而在有人這麼做之前,最誠實的立場是:FlashX 是一個前景看好的服務層級,但推銷靠的是一個峰值數字。值得注意的是,這同時也是一場商業測試:一個花了一年時間、以旗艦模型十分之一價格免費提供接近前沿模型的實驗室,如今正在問開發者是否願意單獨為速度付費。答案將形塑下一個層級如何定價。

A screenshot of the OrcaRouter models catalogue (captured September 19, 2026) showing the header '199 models - 15 providers - one API key, one bill', the filter chips for input modalities, context length, input price, status, series and supported parameters, and the 'How to call any model' panel with the POST https://api.orcarouter.ai/v1/chat/completions endpoint.

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新