GLM-5.3-FlashX 對決 DeepSeek V4.1 Flash 的主視覺標題卡,副標為「比便宜模型還慢的速度等級」,標籤寫著「200 vs 214.7 tok/s」、「$0.37 / $1.25 vs $0.15 / $0.60」與「AA 42 vs 40」,頁腳一行寫著「GLM-5.3-FlashX 於 2026 年 9 月 18 日推出」。
Guides & Insights

GLM-5.3-FlashX 與 DeepSeek V4.1 Flash:比便宜模型還慢的速度等級

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Z.ai 的高階速度方案有個問題,它的名字叫 DeepSeek V4.1 Flash。當 Z.ai 推出 GLM-5.3-FlashX,時值 2026 年 9 月 18 日,它以一個數字來推銷這個新方案:最高每秒 200 個輸出 token,約為其基礎版本 GLM-5.3-Flash 吞吐量的五倍,而價格則是 2.5 倍。獨立測量已顯示,DeepSeek 的平價模型達到每秒 214.7 個 token,首 token 時間為 1.15 秒——兩項數據都比 Z.ai 宣傳的上限更快,而且價格更是 FlashX 望塵莫及。如果你買的是速度,市場早在 FlashX 登場之前就已經改變了。

這種說法在某一個特定方面對 FlashX 不公平,但在其他每個方面都算公道。這兩個模型都是為了成本而打造的 1M 上下文開放權重衍生模型,而且都確實擅長它們各自被打造來做的事。但它們是為同一個問題的不同兩半而打造,而如今兩者之間的價格差距已經大到,對大多數工作負載來說,「哪個更好」都有一行就能回答的答案。

在哪些方面各自實際上領先

• 價格、列表 — GLM-5.3-FlashX 每 1M 輸入/輸出 $0.37 / $1.25,對比 DeepSeek V4.1 Flash 離峰 $0.15 / $0.60、尖峰 $0.30 / $1.20br> • 快取輸入 — FlashX 每 1M $0.075,對比 DeepSeek 離峰 $0.003,25× 的差距在代理迴圈中會急遽累積br> • 實測輸送量 — FlashX 最高 200 tok/s(供應商峰值,未公布獨立數據)對比 DeepSeek 214.7 tok/s(Artificial Analysis,於 DeepSeek 的 API 上測得)br> • 首字延遲 — FlashX 未公布,對比 DeepSeek V4.1 Flash 實測 1.15 秒br> • 獨立智慧 — FlashX 承襲 GLM-5.3-Flash 在 Artificial Analysis Intelligence Index 上的 42 分,對比 DeepSeek V4.1 Flash 的 40 分br> • 架構 — 總計 320B / 啟用 18B 的 MoE,對比總計 552B、prefill 約啟用 8B、decode 約 16Bbr> • 輸入模態 — 文字、圖像、影片與檔案,對比文字與圖像br> • 輸出上限 — 131,072 個 token,對比約 384,000br> • 開放權重 — GLM-5.3-Flash 採用 MIT 授權;FlashX 是代管層級,本身沒有權重,而 DeepSeek V4.1 Flash 採用 MIT 授權

A two-column scoreboard titled 'GLM-5.3-FlashX vs DeepSeek V4.1 Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'AA Index: 42', 'Context: 1M tokens', 'Output cap: 131,072'; the DeepSeek V4.1 Flash column reads 'Price: $0.15 / $0.60 off-peak', 'Cached input: $0.003 per 1M', 'Speed: 214.7 tok/s (measured)', 'AA Index: 40', 'Context: 1M tokens', 'Output cap: 384,000'; the footer reads 'FlashX speed is vendor-reported; DeepSeek figures per Artificial Analysis.'

把那份清單讀兩遍,因為它的形狀就是故事本身。FlashX 只贏得兩行,而且兩者都很窄:在獨立智慧指數上領先兩點,以及影片輸入。DeepSeek 則在價格、快取價格、實測速度、輸出長度,以及真正要緊的那種模態廣度上勝出——它能接收圖像並產生長篇回答。那兩點的指數差距落在單次基準測試執行的雜訊範圍內,不該成為決定你架構的因素。

比便宜模型更慢的速度等級

這是值得細究的部分。Z.ai 打造 FlashX 是為了解決一個真實問題:GLM-5.3-Flash 速度很慢。Artificial Analysis 測得它的輸出速度為每秒 98 個 token,這高於同規模開放權重模型的中位數,但遠未達到互動式水準。該公司的解決方案是重建服務堆疊——約 10 萬個國產加速器、以 SGLang 為基礎的引擎、W8A8 量化、混合精度 KV 快取,以及編碼-預填充-解碼分離式架構——並表示在相同硬體上,端到端輸送量約為其基線的 3 倍。

DeepSeek 在架構層面解決了同一個問題,而且搶先一步達成。V4.1 Flash 的「因果編碼器–解碼器」分離架構,在預填充階段僅啟用約 8B 參數、在解碼階段啟用 16B 參數,而非固定不變的數字;搭配 FP4 KV 快取的「壓縮稀疏注意力 2」,將全域快取縮減至每 token 僅 890 位元組——約為前代所需 HBM 的四分之一、SSD 儲存空間的八分之一。成果是一款經中立實驗室實測可達每秒 214.7 個 token 的模型,且在同一套第一方 API 上運行,無需任何付費高階方案。

Z.ai 的 200 是廠商峰值,而 DeepSeek 的 214.7 是獨立中位數,這是對 Z.ai 最不利的比較,也是應當寬鬆看待它的理由。FlashX 在暖機後、短輸出、無壅塞的請求中,完全有可能勝過 DeepSeek。但這是無從得知的,因為 Z.ai 以外沒有人公布過 FlashX 的吞吐量數字。今天可以確定的是,這兩個模型處於同一速度區間,而其中一個的成本只要三分之一。

A screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash at max effort (captured September 19, 2026), showing an Intelligence Index score of 40, a measured 215 output tokens per second, $0.30 per 1M input and $1.20 per 1M output tokens, a 1M-token context window, 552B total parameters with 16B active, an MIT licence and weights on Hugging Face.

DeepSeek 的價格優勢在何處成為結構性優勢

DeepSeek V4.1 Flash 在離峰時段每百萬個輸入 token 收費 $0.15、每百萬個輸出 token 收費 $0.60,並在平日的兩個時段(UTC 01:00–04:00 和 06:00–10:00)倍增至 $0.30 與 $1.20。FlashX 則是固定 $0.37 與 $1.25。把這些並列比較,看似是一項特色的固定定價,對任何能安排工作時程的人來說,其實是更昂貴的收費結構。

快取輸入這一項,正是決定代理工作負載的關鍵。DeepSeek 在離峰時段每百萬個快取輸入 token 收費 0.003 美元;FlashX 則收 0.075 美元,高出二十五倍。若代理在每一步都重新傳送冗長的系統提示與工具結構定義,每一步都得付出這個差額,而這也是最可能主宰實際帳單的單一收費項目。Z.ai 列出快取儲存在限時內免費,但這是針對儲存空間的折扣,而非針對實際上會不斷累積的讀取次數。

有一個制衡點,那就是誠實說明 DeepSeek 自家數字所代表的成本。V4.1 Flash 招牌分數背後由廠商自行執行的評估,是在最大推理投入下產生的,而 DeepSeek 的文件記載,將 effort 從 25 提高到 100,會讓 DeepSWE v1.1 從 66.0 提升到 74.2,同時消耗約 2.5 倍的輸出 token。在 token 用量達 2.5 倍的情況下,高 effort 設定的實際成本會比標價所暗示的更接近 FlashX——而且文件記載這個模型非常冗長,在 Intelligence Index 上產生 250M 個輸出 token,而中位數是 130M。在多話的模型上,每 token 單價便宜,並不等於任務便宜。任何要比較這兩者價格的人,都應該比較每完成一項任務的成本,而不是每百萬個 token 的成本,而且應該預期要實測,而不是估算。

具體來說,該如何決定?

如果你的工作負載是具備穩定前綴的長時間執行代理,DeepSeek V4.1 Flash 就是首選,而單憑快取輸入比例這一點就能定案。如果你需要在同一次呼叫中進行影片理解或檔案輸入,FlashX 是兩者之中唯一支援這些功能的——這是真正的能力差異,而不是規格表上的差異。如果你需要長時間生成輸出,DeepSeek 約 384K 的輸出上限相對於 FlashX 的 131,072,對報告生成、長程式碼檔案,以及任何以合成而非問答為主的任務而言都很重要。如果你需要在單一基準指標上取得最強的獨立評分,FlashX 的 42 對比 40 確實存在,但差距太小,不足以作為依據。

如果你的技術堆疊已經設定好路由,這兩個模型都能從同一個端點存取,而這是解決這件事最省錢的方式。在 OrcaRouter 上供應商的定價是以 0% 加價原樣轉嫁,因此 DeepSeek 的離峰折扣,以及 Z.ai 未來任何價格調整,都會在發生的當天就反映出來,而在兩者之間切換只需要改一個模型字串,而不是做一次整合。自動容錯移轉對 FlashX 尤其值得採用:它是部署在新叢集上、才上線三週的服務層級,而你要防範的故障模式是容量上限,不是模型停止運作。

直白的總結:對大多數生產工作而言,DeepSeek V4.1 Flash 是更好的預設選擇——每 token 更便宜、每快取 token 更便宜、實測更快,且能產生更長的輸出。GLM-5.3-FlashX 則在較窄的區間裡才是正確選擇:當你需要影片或檔案輸入,並希望背後有略高的獨立指數時。Z.ai 將速度層級定為高價,並把它推向一個快速又便宜的模型早已存在的市場。這就是整個比較。

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash (deepseek/deepseek-v4.1-flash, captured September 19, 2026) showing the model header, a 384K max output, text and image input, an MIT licence by DeepSeek with a 2026-09-10 release date, and the billing row reading $0.15 per 1M input and $0.60 per 1M output tokens with a 1.33-second p50 time to first token.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新