
Qwen 4 Max 對 DeepSeek V4 Pro:950 億個活躍參數對上 490 億個
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen 4 Max 於 2026 年 9 月 22 日在雲棲大會上發表,帶給業界的只有一個名稱與一套層級結構,其餘一概皆無——沒有權重、沒有價格、沒有上下文視窗、沒有日期。DeepSeek V4 Pro 自 2026 年 4 月 24 日起便已列出,規格為 1.6 兆參數的混合專家模型,每 token 啟用 490 億參數、上下文長度 100 萬 token,離峰價格為每百萬輸入 token 0.66 美元、每百萬輸出 token 1.98 美元。真正值得並列比較的數字並非總參數量,而是啟用參數量:最後一次公布的 Qwen3.8-Max 每 token 啟用 950 億參數,大約是 DeepSeek V4 Pro 所運行的 490 億啟用參數的兩倍,而在尚未查閱任何一項基準測試之前,光是這一個數字就足以解釋兩家實驗室之間三倍的價格差距。
對稀疏性的兩種不同押注
兩家實驗室都在打造稀疏混合專家模型。對於該有多稀疏,他們意見嚴重分歧。Qwen3.8-Max——目前出貨的 Qwen 旗艦型號,也是 Qwen 4 Max 會是什麼樣子的唯一具體基準——是一個 2.4 兆參數的模型,每個 token 啟用 950 億個參數,比例大約是二十五分之一。DeepSeek V4 Pro 是一個 1.6 兆參數的模型,啟用 490 億個,比例大約是三十三分之一,而且它以 FP4 儲存專家權重,並將注意力、路由器和正規化層保留在 FP8,這又進一步壓低了每個 token 的運算量。
那些不是調校上的差異。它們是對同一個問題的兩種不同答案——前沿模型每 token 應該花費多少:
• 總參數量 — Qwen 3.8 旗艦版 2.4T 對比 DeepSeek V4 Pro 1.6T
• 每 token 的活躍參數 — Qwen 3.8 旗艦版 95B 對比 DeepSeek V4 Pro 49B
• 啟用率 — 約每 25 個中有 1 個,相較於約每 33 個中有 1 個
• 輸入價格,離峰時段 — Qwen3.8-Max 每 100 萬 $2.00,對比 DeepSeek V4 Pro 每 100 萬 $0.66
輸出價格,離峰時段 — Qwen3.8-Max 每 1M 為 $6.00,相較於 DeepSeek V4 Pro 每 1M 為 $1.98
• 旗艦權重 — 採用自訂 Qwen 授權條款的 Qwen 3.8 旗艦版本,對比以 MIT 授權條款發布的 DeepSeek V4 Pro
• 上下文 — Qwen3.8-Max 100 萬個 token 對比 DeepSeek V4 Pro 100 萬個 token
• 模態 — Qwen3.8-Max 支援文字、圖像與影片輸入,相較於 DeepSeek V4 Pro 在其列表中僅支援文字
• 觀測延遲 — 在同一份目錄上,Qwen3.8-Max 的 p50 首個 Token 延遲為 3.29 秒,而 DeepSeek V4 Pro 為 3.52 秒
這次稀疏度的差異與價格差異指向同一個方向,而這並不是總參數量所暗示的方向。Qwen 每個 token 啟用的參數量約為 DeepSeek 的兩倍,收費卻約為三倍,單憑稀疏性並無法彌補這個差距。填補其餘差距的是模態:Qwen 的旗艦模型搭載視覺與影片編碼器,無論請求中有沒有圖像,每次請求都得為它們付費,這就是輸入費率會落在這個水準的原因。DeepSeek V4 Pro 只接受文字並輸出文字,而它的定價就像一款只做這件事的模型。
在 DeepSeek 欄位被用於任何用途之前,應該先加上一項限定條件。DeepSeek 採用尖峰與離峰時段的定價方式:$0.66 與 $1.98 這兩個數字是離峰費率,而在尖峰時段——平日的 UTC 01:00 至 04:00 以及 06:00 至 10:00,不含中國國定假日——同一模型的計費為輸入 $1.32、輸出 $3.96。其他所有時段,包括所有週末與假日,都屬於離峰。因此,你支付的費率取決於你的流量在何時運行;而任何包含平日早晨時段的工作負載,若只依據離峰數字建立成本模型,都會不正確。

Qwen 4 Max 那一欄是空的,而這並非暫時的狀態
人們很容易忍不住用這樣的假設來填補這項比較:Qwen 4 Max 的表現會落在 Qwen 3.8 的數字附近,而且定價低於它們。要克制這種衝動。阿里巴巴將 Qwen 4 架構描述為新世代,並表示正在訓練;唯一已發布、描述該架構的成品是 Qwen3.8-Flash-Next,於 2026 年 8 月下旬開源,並在其自家模型卡上標示為 Qwen 4 設計的預覽。它是一個 1,250 億參數的主模型,具備 510 億參數的 N-gram 嵌入,每步約啟動 60 億參數,採用 QSA 稀疏注意力、門控殘差,以及可延伸至 100 萬的 262,000 詞元原生上下文。
如果那個設計能擴展到 Max 層級,啟用數量應該維持在數百億,而不是一路朝 DeepSeek 的總數攀升——隨著總參數成長,讓每步運算大致保持持平,這正是 QSA 以及以查找而非稠密計算取得的 N-gram 嵌入的全部重點。那是一個方向,而不是一份規格,因此不應把它當成規格印出來。
現在可知的是營運上的不對稱。已存在的模型可以針對你的工作負載進行衡量;不存在的模型則無法在任何事物上衡量。Qwen 4 Max 推出時,可透過廠商自家的 API 及多個第三方平台存取——這是每個阿里巴巴旗艦模型都走過的路線。它目前不在 OrcaRouter 上:型錄中沒有任何 Qwen 4 系列的項目。DeepSeek V4 Pro 現在已在 OrcaRouter 上,它的一個標註日期的快照也在那裡。
可重現性是沒有人提出的論點
DeepSeek 會發布帶日期的快照,並讓它們持續可供定址取用。型錄中同時收錄了浮動的 DeepSeek V4 Pro 識別碼,以及一個釘選的 2026-08-13 變體——那個日期正是 DeepSeek 自己指定為正式全面推出(general availability)版本的建置。這並不光鮮亮麗,但對任何執行評測框架或受合規控管管線的人來說,它比基準測試差異更重要:當你釘選快照時,你的迴歸測試套件衡量的是你的程式碼,而不是供應商的發布節奏。
Qwen 3.8 世代也做了同樣的事——在同一份目錄上,除了浮動名稱之外,還有一個標註日期的 Qwen3.8-Max 快照——而且沒有理由認為阿里巴巴會停止這麼做。但這是已發布模型的一項特性,也值得直白地說清楚:在 Qwen 4 Max 發布的那一天,它不會有可固定的快照、沒有穩定的識別碼可供測試比對,也無法用自己的資料做前後對照。無論你想做什麼比較,都只能之後再做。

在不必運行兩套堆疊的情況下同時運行兩者
OrcaRouter 以 deepseek/deepseek-v4-pro 的路由代號提供 DeepSeek V4 Pro,每百萬個 token 輸入 $0.66、輸出 $1.98,這正是 DeepSeek 自家的離峰定價原樣轉嫁、0% 加成。最後這點在本批評測中於此處的份量比其他地方更重,因為對前沿級模型而言,$1.98 的輸出價格已逼近下限:平台即使只抽一成利潤,也相當於這款模型與中階替代方案價差的五分之一;而在 0% 加成下,你在頁面上看到的費率就是 DeepSeek 公布的費率——包括尖峰與離峰的分段計價,這些時段依同一套排程原樣轉嫁,而非被平均成單一費率。
同一個端點也承載 Qwen 3.8 系列——Qwen3.8-Max、Qwen3.8-Flash 與 Qwen3.8-27B——與 DeepSeek V4 Pro 並列於同一個相容 OpenAI 的 API 上,涵蓋近 200 款模型,並在供應商路徑劣化時自動容錯切換,還有一套路由 DSL,讓你明確做出選擇,而不必硬編碼。若 DeepSeek 調降價格,變動當天就會反映到你的金鑰上,因為中間沒有讓降價卡住的利潤層。當 Qwen 4 等級推出時,同一份型錄就是它會現身的地方。
這對你意味著什麼
DeepSeek V4 Pro 在這場比較中因對手棄權而勝出,而值得精確說明原因,而不是加以美化。它在兩個面向上的成本都約為三分之一,每個 token 啟用的參數量是五倍,上下文視窗不相上下,而且有可釘選的具日期快照。Qwen 4 Max 則有一個等級名稱和一個會議場次。
目前真正實際進行中的比較,是 DeepSeek V4 Pro 對上 Qwen3.8-Max;這是一場實質的取捨,而非一面倒的潰敗:DeepSeek 是純文字模型,價格約為三分之一,權重以 MIT 條款發布,且每 token 的活化概況更精簡;而 Qwen 的旗艦模型則分別以 $2.00 和 $6.00 接受圖像與影片輸入。挑選時應依據模態,以及每項完成任務的實測成本,而不是參數數量;並在 Alibaba 發布模型卡時重新執行這項比較——到那時,耐人尋味的問題將是:Qwen 4 Max 把多模態能力定價在高於 DeepSeek 文字費率之上時,超出的幅度是否會比今日更小。

本文中的比較4
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
