
GLM-5.3-FlashX 對比 GLM-5.3-Flash:相同權重,2.5 倍價格,只差一個數字
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
你無法買到 GLM-5.3-FlashX 就得到一個更好的模型。這不是批評——而是整件事的前提。GLM-5.3-FlashX,於 2026 年 9 月 18 日在 Z.ai 的 API 上推出,運行與GLM-5.3-Flash相同的權重:相同的 320B 總參數、18B 啟動參數的混合專家主幹,相同的 1M 詞元上下文,相同的原生文字、圖像、影片與檔案輸入,相同的 131,072 詞元輸出上限。Z.ai 並未發布 FlashX 基準測試,因為沒有新東西可供基準測試。不同之處在於詞元輸出速度以及成本,而這兩個數字是買家唯一需要權衡的事。
這是比大多數模型比較更單純的決定,也更艱難,因為沒有能力敘事可以躲在後面。延遲對你來說要嘛值得 2.5×,要嘛不值得。
一個模型,兩種價格標籤
• FlashX 是什麼——它是一個服務層級,而非模型發布;相同的權重、相同的分數、相同的限制br> • 輸入價格——FlashX 每 100 萬個 token 為 $0.37,而 Flash 定價表上每 100 萬個為 $0.15br> • 輸出價格——每 100 萬個 $1.25 對比 $0.50,這才是真正會讓帳單數字變動的倍數br> • 快取輸入——每 100 萬個 $0.075 對比 $0.03br> • 速度——最高每秒 200 個輸出 token(廠商回報的峰值),而 Artificial Analysis 獨立實測為 98 tok/sbr> • 訂閱存取——GLM-5.3-Flash 包含在 Z.ai 的 GLM Coding Plan 中,並享有 3× 配額;FlashX 則不包含在內br> • 自行託管——GLM-5.3-Flash 是在 Hugging Face 上以 MIT 授權的開放權重;FlashX 則沒有可下載的權重

在 Z.ai 的本土市場,同樣的比例被直白寫明:FlashX 為輸入 ¥2、輸出 ¥7,而 Flash 則是 ¥0.8 與 ¥2.8。多家中國媒體以相同方式描述這次發布——速度提升 5 倍,價格提高 2.5 倍——而且每一家都指出,其智能並未改變。
延遲是一項明細項目,而且它不是按 token 計價的
2.5× 並非自動就是壞交易,原因在於代幣價格與任務成本是不同的量。一個在夜間產生一百萬個輸出代幣的批次工作,光輸出在 Flash 上要付 $0.50,在 FlashX 上要付 $1.25,而多付的 $0.75 得不到任何回報,因為沒有人在等待。一個進行十次循序呼叫的代理迴圈,會支付相同的每代幣溢價,但每次呼叫都更快返回,而節省下來的是實際時間,而非帳單上的金額。如果 FlashX 真的只需一小部分時間就能返回,十輪就能為每項任務省下數十秒的延遲——而如果那項任務正在阻擋某個人或上游服務,那幾秒的價值就高於那些代幣。
Z.ai 自身的定位正好遵循這條路線。它將 FlashX 指向高併發程式設計、多步驟代理呼叫、即時對話、程式碼補全與長上下文多模態工作,並將對價格敏感、對延遲不敏感的工作負載——離線批次處理、大量生成、任何排程性質的任務——導回基礎版 Flash。這是正確的切分方式,而且值得注意的是,這條界線是由廠商自己劃出的。
推理的破綻在吞吐量這一端。FlashX 的每秒 200 個 token 是廠商報告的峰值;基礎模型的 98 則是獨立實驗室測得的中位數。峰值是在短輸出、快取已暖機且叢集閒置時達到的。長上下文多模態請求——正是 FlashX 所主打的負載——最不可能接近這個數字,而 Z.ai 之外沒有人發表過數字來解決這個問題。如果你的工作負載是受吞吐量限制,而非受延遲限制,那麼峰值數字幾乎無法告訴你實際會得到什麼。
FlashX 所沒有的逃生出口
這項比較中還有第三個選項,而它之所以存在,完全是因為基礎模型是開放的。GLM-5.3-Flash 於 2026 年 8 月 26 日以 MIT 授權條款發布,權重已上架 Hugging Face 與 ModelScope,目前由 SGLang、vLLM、TokenSpeed 和 KTransformers 等推論堆疊提供服務。如果你的用量高到足以證明硬體投資合理,那麼真正誠實的比較並不是 Flash 對上 FlashX,而是 FlashX 每百萬個輸出詞元 1.25 美元,對上你在自家加速器上分攤後的每詞元成本。

那個選項確實有實實在在的入門成本。FP8 版本需要大約 328 GB 的 GPU 記憶體才能提供服務,對多數團隊而言屬於多節點部署,對其餘團隊則根本行不通。但值得說明的是,正是這種不對稱,讓 FlashX 的定價成為一場刻意的測試,而非必然結果:Z.ai 針對一種服務配置收取溢價,而就基礎模型而言,客戶原則上可以自行建置這種配置。這筆溢價買的是便利性,而非能力,而便利性有市場行情,且會隨時間下降。
價格變動的真正意義
這次發布背後的經濟邏輯異常清晰。GLM-5.3-Flash 以 GLM-5.3 十分之一的價格推出——發布促銷期間更只要一半——而且被大量使用,包括一段匿名發布前測試,Z.ai 事後已證實。FlashX 是這個系列首次朝另一個方向移動:同一個模型,價格卻調高。中國財經媒體引述的分析師將其解讀為一次刻意的商業測試,測試在歷經一年以大宗商品般的價格提供近乎前沿的能力來換取市佔率之後,開發者是否願意單純為速度付費。
有兩個細節支持這種解讀。FlashX 被排除在 GLM Coding Plan 之外,而基礎版 Flash 則以三倍配額納入其中,因此訂閱用戶無法把這個新層級吸收進既有的方案承諾裡——他們得按 token 付費。而且價格是固定的,沒有離峰折扣,不像某些競爭對手採用分時段的價格結構來填補閒置容量。在速度層級上固定收 2.5 倍,是為那些等不了的人所訂的價格,而 Z.ai 正在摸清這種人究竟有多少。
從中選擇
如果在下一個 token 上卡住的是人類或服務,而模型本身已經是正確選擇——例如行內補全、互動式代理、即時聊天,任何「暫停就是產品本身」的情境——那就採用 FlashX。對於批次、離線與大量工作,對於任何你可以排程的事項,以及任何你付費購買的是輸出量而非輸出延遲的工作負載,則採用 GLM-5.3-Flash。如果你的用量龐大,而且團隊能運行加速器,請先為自架的基礎權重估價,再為 FlashX 估價;這樣的比較會比 token 費率所顯示的更有利。
無論你選擇哪一條路,在呼叫端都把這兩者視為可互換。它們接受相同的提示、回傳相同的格式,並產生相同的品質——唯一改變的只是一串模型字串,而這是最便宜的一種 A/B 測試。在 OrcaRouter 上,供應商的定價以 0% 加成原樣傳遞,因此 Z.ai 的價格調整或促銷會在上游上線的當天就生效,而兩個層級都位於同一個端點之後,這個端點前方有 200 多個模型。對於完全取決於實測延遲的決策來說,能在實驗進行中切換兩者而不必動到你的整合,就已經完成大部分的工作了。
這個結論比一般的模型比較來得狹窄,而這正是重點。FlashX 並不是更好的模型,它也沒有假裝是。它是同一個模型,只是佇列較短,以某個價格販售——而這個價格只有在佇列曾是你的問題時才說得通。在你做出決定之前,先分別測量你在兩者上各自的首次 token 時間——供應商說的 200 是上限,你的工作負載才是唯一重要的基準,而這兩個層級之間的差異,只差一次設定變更。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
