主視覺標題卡:DeepSeek V4.1 Flash 對決 GLM-5.2 — 兩款 MIT 模型,一個無聊的答案
Guides & Insights

DeepSeek V4.1 Flash 對上 GLM-5.2:兩個 MIT 模型,一個無聊的答案

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

DeepSeek V4.1 FlashGLM-5.2屬於同一類物件,而這正是大多數比較所略過的部分。兩者都是混合專家模型,都以 MIT 授權發布且權重可下載,都支援一百萬個詞元的上下文,而且都能透過由並非訓練它們的廠商所提供的託管 API 取得。GLM-5.2 較早問世,發布時以 51 分成為 Artificial Analysis Index 上得分最高的開放權重模型。DeepSeek V4.1 Flash 則於 2026 年 9 月 10 日推出,是 DeepSeek 新架構系列中更小、更新、更便宜的模型。兩者之間真正重要的比較,不在於誰更聰明,而在於以你手邊實際的工作而言,你能跑得動哪一個,以及成本是多少。

他們共同擁有的部分,而這佔了大部分

先從重疊之處談起,因為它排除了大多數常見的決策準則。當你在開源模型與閉源模型之間做選擇時,你會衡量鎖定風險、衡量微調能力、衡量供應商是否可能片面更改條款。這些在這裡都不適用。DeepSeek V4.1 Flash 與 GLM-5.2 都是 MIT 授權,權重可自行下載並自行部署服務。兩者都支援 100 萬 token 的輸入。兩者都是 MoE 架構,這意味著相對於其總參數量,兩者的執行成本都很低,因為每個 token 只會啟用一小部分的權重。

所以,這個比較不是開源與閉源之別,也不是長上下文與短上下文之別。它是一組四、五個數字,而這些數字在成本上指向一個方向,在成熟度上則指向另一個方向。

它們真正分歧之處

• 每 100 萬個 token 的價格 — DeepSeek V4.1 Flash 離峰時段 $0.15 輸入 / $0.60 輸出,相較於 GLM-5.2 $1.40 輸入 / $4.40 輸出。這略高於輸入價格的 9 倍,也略高於輸出價格的 7 倍。

• 快取輸入 — V4.1 Flash 離峰時段每 1M 為 $0.003,相較於 GLM-5.2 每 1M 的 $0.26。在主宰代理迴圈帳單的項目上,相差近 90 倍。

• 參數 — V4.1 Flash 總計 552B,輸入時啟用 8B,輸出時啟用 16B;相較之下,GLM-5.2 總計約 745B,約有 40B 啟用。GLM-5.2 每個 token 啟用的參數量約為 2.5 倍。

• 最大輸出 — {{1}}V4.1 Flash 384K 詞元{{/1}} 對比 {{2}}GLM-5.2 128K 詞元{{/2}}。上限高出三倍。

• 上下文視窗 — 各 1M token。持平。

• 獨立指數分數 — GLM-5.2 在 Artificial Analysis 指數中獲得 51 分,是其發布時所有開放權重模型中最高者。DeepSeek V4.1 Flash 目前尚未有已公布的指數數據。

• 觀察到的首個 token 延遲——根據 OrcaRouter 自家七天期的遙測資料,V4.1 Flash 的 p50 為 2.63 秒、p95 為 9.05 秒,而 GLM-5.2 的 p50 為 2.36 秒、p95 為 10.00 秒。中位數旗鼓相當,尾端則不然。

價格走向和成熟度走向正好相反。GLM-5.2 是擁有獨立評分、且紀錄較長的那個模型。DeepSeek V4.1 Flash 則是代幣價格較低的模型,輸入價格只有九分之一,輸出上限則是三倍。這份清單無論怎麼解讀,都不會出現某個模型單純地全面勝出的情況。

Two-column scoreboard: DeepSeek V4.1 Flash vs GLM-5.2 — price per 1M tokens $0.15 input and $0.60 output vs $1.40 and $4.40, cached input $0.003 vs $0.26, total parameters 552B vs about 745B, active parameters 8B input and 16B output vs about 40B, context window 1M tokens on both, max output 384K tokens vs 128K tokens, Artificial Analysis Index score not yet published vs 51, both MIT-licensed, and a p50 time to first token of 2.63 s vs 2.36 s

尾巴是被低估的那條線

多數開放權重模型的比較都以指數分數打頭陣。反倒是延遲遙測資料值得關注,但原因並非你所預期的那樣:中位數其實不相上下。GLM-5.2 的 p50 首字延遲為 2.36 秒,對比 V4.1 Flash 的 2.63 秒,這不是差距,而是共享網路上的雜訊。任何拿首字優勢來說較便宜模型勝出的人,都看錯了百分位數。

p95 正是兩者分道揚鑣之處,而且方向與價差所暗示的相反。GLM-5.2 的最差等待時間是 10.00 秒;V4.1 Flash 的則是 9.05 秒。這比中位數更重要,因為使用者會注意到的請求,正是那些慢的請求。一個通常瞬間回應、偶爾停頓十秒的工具,會讓人覺得不可靠,而這是穩定維持三秒的工具不會給人的感受;在每回合會展開十次呼叫的代理迴圈中,p95 才是決定該回合能否在一個人的耐性之內完成的數字。GLM-5.2 的長尾不是缺陷;它是個較大的模型,每個 token 啟用約 400 億個參數,而該付的代價就是如此。但這正是為什麼這個模型更適合非同步工作——佇列、批次工作、沒人盯著看的背景代理——而不是請求-回應式的介面。

在我們能看到的頁面上,這兩款模型都沒有公布吞吐量數據;這一點值得直說,而不是代為補上。首個 token 時間是這兩個模型能在共同資料上相比的唯一延遲維度,而在這個維度上,誠實的解讀是:它們在中位數上持平,在尾部則相當接近。

指數分數能與不能決定什麼

GLM-5.2 在 Artificial Analysis Index 上的 51 分,是一個真實、獨立產出的數字,也是該模型最有力的單一論據。它同時也是一個綜合指標:把數個評估集彙總成單一數字,這讓它成為概括一般能力的好摘要,卻是預測任何單一特定任務表現的糟糕指標。一個得分 51 的模型與一個未公布分數的模型之間的差距,並不等同於一個得分 51 的模型與一個得分 40 的模型之間的差距。

關於 DeepSeek V4.1 Flash,誠實的立場是:它的獨立評測紀錄很單薄,而原因是問世時間太短。它正式開放使用至今僅十二天。它唯一出現在的近期第三方全面評測——2026 年 9 月 21 日發布的 Agents on Rails 代理式編碼排行榜——在最高投入設定下給它 17%,位居中段,高於 GLM-5.3 Flash 的 15%,低於 Gemini 3.8 Flash 的 23%。那只是單一排行榜,只衡量一個狹隘面向,無法取代 Index 分數。任何人現在聲稱 V4.1 Flash 在能力上勝過 GLM-5.2,都是從架構與價格推論而來,而非在報告實測結果。

把支持每一方的理由,直白地說清楚

DeepSeek V4.1 Flash 是當工作負載具高流量、延遲敏感或輸出量大時的首選模型。輸入價格只要九分之一,快取讀取價格約九十分之一,這在每一輪都會重新讀取上下文的代理迴圈中是結構性優勢;而 384K 的輸出上限與 128K 屬於不同級別的產物。如果你的任務是分類、擷取、長篇結構化生成,或代理管線中的高流量執行器,那麼成本差異並非邊際性的——而是決定管線是否可行的差別。

GLM-5.2 是當你需要一個已發布、經獨立驗證的能力數據來佐證決策時,或是當工作屬於非同步性質、最壞情況下十秒的等待根本無感時,會選擇的模型。它是成熟的選擇:分數擺在那裡,行為有文件記載,這個模型在正式環境中運作得夠久,久到其他人早已摸清它的極限。這其中蘊含著實實在在的價值,而這並非價格欄位所能體現的。

當兩者都沒有明顯正確的答案時——例如一個處理混合流量的一般用途助理——有用的做法並不是選邊站。而是把大部分流量送給便宜的模型,並把昂貴的模型保留給真正需要它的請求。

將兩者作為單一系統運行

由於這兩個模型都是開放權重且都已託管,分割並路由的模式在這裡設定起來異常便宜,而這正是 OrcaRouter 的路由層贏得一席之地、而非硬加上去的推銷話術之處。兩個模型都位於單一金鑰之後,因此路由決策是設定,而不是第二套整合:將短而高流量的請求傳送到 DeepSeek V4.1 Flash,並將長時間非同步工作傳送到 GLM-5.2 的規則,只需幾行,而不是應用程式碼中的分支。

平台的兩項特性對這種組合特別重要。OrcaRouter 以 0% 加價傳遞供應商的定價,因此上述數字是供應商自身的價格,而 DeepSeek 的尖峰時段排程完全按照 DeepSeek 的定義適用——尖峰時段為平日的 01:00–04:00 和 06:00–10:00 UTC,週末則完全為離峰,對於如此便宜的模型而言,這是值得明確做出的排程決定。而路由 DSL 可以將多個模型組合成一次呼叫,這是使用兩個優勢不重疊的開放權重模型的自然方式:便宜的模型負責生成,較強的模型負責審查,而呼叫方只看到單一回應。自動容錯移轉位於兩條路徑之後,當兩個模型中的一個只推出十二天、其在你資料上的行為尚屬未知時,這點就很重要。

這之所以是正確的架構,而不是妥協,是因為這兩個模型在彼此不競爭的軸線上有所不同。一個快速又便宜;另一個則是有評分且緩慢。同時使用兩者的管線並不是在對沖,而是在將工具與任務配對。

Screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model id, 1M-token context, 128K max output, text input and text output, $1.40 input and $4.40 output per 1M tokens, and observed time to first token of 2.36 s at p50 and 10.00 s at p95

看什麼

• 一份已發布的 DeepSeek V4.1 Flash 的 Artificial Analysis Index 數值。在它出現之前,這兩個模型之間的能力比較只是一場論辯,而非一項量測——而這正是唯一能一錘定音的證據。

• GLM-5.2 的延遲概況是否會改善。其 10.00 秒的 p95 是最可能隨著代管服務供應商最佳化而變動的數字,而且它目前是兩個模型之間單一實測差異中最大的一項——是尾端等待時間,而非價格。

• DeepSeek 的尖峰時段排程是否會變動。在每百萬個輸入 token 收費 $0.15 的模型上,尖峰倍率是成本模型中最大的單一變數。

在那些當中的第一項真正落地之前,準確的總結是:DeepSeek V4.1 Flash 的輸入成本大約只有 GLM-5.2 的九分之一,快取輸入成本更只有將近九十分之一,而且輸出上限是它的三倍;GLM-5.2 則是擁有獨立評測分數與更長實績紀錄的模型,它的首個 token 中位延遲與較便宜的那個模型不相上下,儘管最壞情況並非如此。兩者都是 MIT 授權。兩者都只差一個金鑰。依工作負載來挑,而不是挑贏家。

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id with a Featured badge, 1M-token context, 384K max output, text and image input, $0.15 input and $0.60 output per 1M tokens, a cache read rate of $0.003, and a p50 time to first token of 2.63 s

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新