一張「Qwen 4 Max 對決 DeepSeek V4 Pro」的主視覺標題卡,副標題為「950 億活躍參數對上 490 億」,三個藥丸形徽章分別寫著「$2.00 和 $6.00」、「$0.66 和 $1.98」以及「25 分之 1 對 33 分之 1」,頁尾一行寫著「阿里巴巴於 2026 年 9 月 22 日宣布;DeepSeek 於 2026 年 4 月 24 日上市」,右下角則有 OrcaRouter 標誌。
Engineering & Research

Qwen 4 Max 對 DeepSeek V4 Pro:950 億個活躍參數對上 490 億個

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Qwen 4 Max 於 2026 年 9 月 22 日在雲棲大會上發表,帶給業界的只有一個名稱與一套層級結構,其餘一概皆無——沒有權重、沒有價格、沒有上下文視窗、沒有日期。DeepSeek V4 Pro 自 2026 年 4 月 24 日起便已列出,規格為 1.6 兆參數的混合專家模型,每 token 啟用 490 億參數、上下文長度 100 萬 token,離峰價格為每百萬輸入 token 0.66 美元、每百萬輸出 token 1.98 美元。真正值得並列比較的數字並非總參數量,而是啟用參數量:最後一次公布的 Qwen3.8-Max 每 token 啟用 950 億參數,大約是 DeepSeek V4 Pro 所運行的 490 億啟用參數的兩倍,而在尚未查閱任何一項基準測試之前,光是這一個數字就足以解釋兩家實驗室之間三倍的價格差距。

對稀疏性的兩種不同押注

兩家實驗室都在打造稀疏混合專家模型。對於該有多稀疏,他們意見嚴重分歧。Qwen3.8-Max——目前出貨的 Qwen 旗艦型號,也是 Qwen 4 Max 會是什麼樣子的唯一具體基準——是一個 2.4 兆參數的模型,每個 token 啟用 950 億個參數,比例大約是二十五分之一。DeepSeek V4 Pro 是一個 1.6 兆參數的模型,啟用 490 億個,比例大約是三十三分之一,而且它以 FP4 儲存專家權重,並將注意力、路由器和正規化層保留在 FP8,這又進一步壓低了每個 token 的運算量。

那些不是調校上的差異。它們是對同一個問題的兩種不同答案——前沿模型每 token 應該花費多少:

• 總參數量 — Qwen 3.8 旗艦版 2.4T 對比 DeepSeek V4 Pro 1.6T

• 每 token 的活躍參數 — Qwen 3.8 旗艦版 95B 對比 DeepSeek V4 Pro 49B

• 啟用率 — 約每 25 個中有 1 個,相較於約每 33 個中有 1 個

• 輸入價格,離峰時段 — Qwen3.8-Max 每 100 萬 $2.00,對比 DeepSeek V4 Pro 每 100 萬 $0.66

輸出價格,離峰時段 — Qwen3.8-Max 每 1M 為 $6.00,相較於 DeepSeek V4 Pro 每 1M 為 $1.98

• 旗艦權重 — 採用自訂 Qwen 授權條款的 Qwen 3.8 旗艦版本,對比以 MIT 授權條款發布的 DeepSeek V4 Pro

• 上下文 — Qwen3.8-Max 100 萬個 token 對比 DeepSeek V4 Pro 100 萬個 token

• 模態 — Qwen3.8-Max 支援文字、圖像與影片輸入,相較於 DeepSeek V4 Pro 在其列表中僅支援文字

• 觀測延遲 — 在同一份目錄上,Qwen3.8-Max 的 p50 首個 Token 延遲為 3.29 秒,而 DeepSeek V4 Pro 為 3.52 秒

這次稀疏度的差異與價格差異指向同一個方向,而這並不是總參數量所暗示的方向。Qwen 每個 token 啟用的參數量約為 DeepSeek 的兩倍,收費卻約為三倍,單憑稀疏性並無法彌補這個差距。填補其餘差距的是模態:Qwen 的旗艦模型搭載視覺與影片編碼器,無論請求中有沒有圖像,每次請求都得為它們付費,這就是輸入費率會落在這個水準的原因。DeepSeek V4 Pro 只接受文字並輸出文字,而它的定價就像一款只做這件事的模型。

在 DeepSeek 欄位被用於任何用途之前,應該先加上一項限定條件。DeepSeek 採用尖峰與離峰時段的定價方式:$0.66 與 $1.98 這兩個數字是離峰費率,而在尖峰時段——平日的 UTC 01:00 至 04:00 以及 06:00 至 10:00,不含中國國定假日——同一模型的計費為輸入 $1.32、輸出 $3.96。其他所有時段,包括所有週末與假日,都屬於離峰。因此,你支付的費率取決於你的流量在何時運行;而任何包含平日早晨時段的工作負載,若只依據離峰數字建立成本模型,都會不正確。

A two-column scoreboard titled "Qwen 4 Max vs DeepSeek V4 Pro - the scoreboard". Left column Qwen 4 Max: Total parameters 2.4T, Active per token 95B, Input price off-peak $2.00 per 1M tokens, Output price off-peak $6.00 per 1M tokens, Context window 1M tokens, Modality text, image, video in. Right column DeepSeek V4 Pro: Total parameters 1.6T, Active per token 49B, Input price off-peak $0.66 per 1M tokens, Output price off-peak $1.98 per 1M tokens, Context window 1M tokens, Modality text-only. Footer reading "DeepSeek V4 Pro figures from its catalogue listing; Qwen figures from the Qwen3.8-Max model card, September 22 2026.", with the OrcaRouter logo bottom-right.

Qwen 4 Max 那一欄是空的,而這並非暫時的狀態

人們很容易忍不住用這樣的假設來填補這項比較:Qwen 4 Max 的表現會落在 Qwen 3.8 的數字附近,而且定價低於它們。要克制這種衝動。阿里巴巴將 Qwen 4 架構描述為新世代,並表示正在訓練;唯一已發布、描述該架構的成品是 Qwen3.8-Flash-Next,於 2026 年 8 月下旬開源,並在其自家模型卡上標示為 Qwen 4 設計的預覽。它是一個 1,250 億參數的主模型,具備 510 億參數的 N-gram 嵌入,每步約啟動 60 億參數,採用 QSA 稀疏注意力、門控殘差,以及可延伸至 100 萬的 262,000 詞元原生上下文。

如果那個設計能擴展到 Max 層級,啟用數量應該維持在數百億,而不是一路朝 DeepSeek 的總數攀升——隨著總參數成長,讓每步運算大致保持持平,這正是 QSA 以及以查找而非稠密計算取得的 N-gram 嵌入的全部重點。那是一個方向,而不是一份規格,因此不應把它當成規格印出來。

現在可知的是營運上的不對稱。已存在的模型可以針對你的工作負載進行衡量;不存在的模型則無法在任何事物上衡量。Qwen 4 Max 推出時,可透過廠商自家的 API 及多個第三方平台存取——這是每個阿里巴巴旗艦模型都走過的路線。它目前不在 OrcaRouter 上:型錄中沒有任何 Qwen 4 系列的項目。DeepSeek V4 Pro 現在已在 OrcaRouter 上,它的一個標註日期的快照也在那裡。

可重現性是沒有人提出的論點

DeepSeek 會發布帶日期的快照,並讓它們持續可供定址取用。型錄中同時收錄了浮動的 DeepSeek V4 Pro 識別碼,以及一個釘選的 2026-08-13 變體——那個日期正是 DeepSeek 自己指定為正式全面推出(general availability)版本的建置。這並不光鮮亮麗,但對任何執行評測框架或受合規控管管線的人來說,它比基準測試差異更重要:當你釘選快照時,你的迴歸測試套件衡量的是你的程式碼,而不是供應商的發布節奏。

Qwen 3.8 世代也做了同樣的事——在同一份目錄上,除了浮動名稱之外,還有一個標註日期的 Qwen3.8-Max 快照——而且沒有理由認為阿里巴巴會停止這麼做。但這是已發布模型的一項特性,也值得直白地說清楚:在 Qwen 4 Max 發布的那一天,它不會有可固定的快照、沒有穩定的識別碼可供測試比對,也無法用自己的資料做前後對照。無論你想做什麼比較,都只能之後再做。

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro, English UI), showing the FLAGSHIP badge, the 1M token context badge, the model ID deepseek/deepseek-v4-pro, a 384K maximum output, text input, the Tools, JSON and Reasoning tags, the listing date 2026-04-24 credited to DeepSeek, a p50 time-to-first-token of 3.52s, the OpenAI-compatible code samples against api.orcarouter.ai/v1, and the opening of the model description describing a 1.6T total / 49B active flagship MoE with 1M context and top-tier reasoning and agentic tool use.

在不必運行兩套堆疊的情況下同時運行兩者

OrcaRouter 以 deepseek/deepseek-v4-pro 的路由代號提供 DeepSeek V4 Pro,每百萬個 token 輸入 $0.66、輸出 $1.98,這正是 DeepSeek 自家的離峰定價原樣轉嫁、0% 加成。最後這點在本批評測中於此處的份量比其他地方更重,因為對前沿級模型而言,$1.98 的輸出價格已逼近下限:平台即使只抽一成利潤,也相當於這款模型與中階替代方案價差的五分之一;而在 0% 加成下,你在頁面上看到的費率就是 DeepSeek 公布的費率——包括尖峰與離峰的分段計價,這些時段依同一套排程原樣轉嫁,而非被平均成單一費率。

同一個端點也承載 Qwen 3.8 系列——Qwen3.8-Max、Qwen3.8-Flash 與 Qwen3.8-27B——與 DeepSeek V4 Pro 並列於同一個相容 OpenAI 的 API 上,涵蓋近 200 款模型,並在供應商路徑劣化時自動容錯切換,還有一套路由 DSL,讓你明確做出選擇,而不必硬編碼。若 DeepSeek 調降價格,變動當天就會反映到你的金鑰上,因為中間沒有讓降價卡住的利潤層。當 Qwen 4 等級推出時,同一份型錄就是它會現身的地方。

這對你意味著什麼

DeepSeek V4 Pro 在這場比較中因對手棄權而勝出,而值得精確說明原因,而不是加以美化。它在兩個面向上的成本都約為三分之一,每個 token 啟用的參數量是五倍,上下文視窗不相上下,而且有可釘選的具日期快照。Qwen 4 Max 則有一個等級名稱和一個會議場次。

目前真正實際進行中的比較,是 DeepSeek V4 Pro 對上 Qwen3.8-Max;這是一場實質的取捨,而非一面倒的潰敗:DeepSeek 是純文字模型,價格約為三分之一,權重以 MIT 條款發布,且每 token 的活化概況更精簡;而 Qwen 的旗艦模型則分別以 $2.00 和 $6.00 接受圖像與影片輸入。挑選時應依據模態,以及每項完成任務的實測成本,而不是參數數量;並在 Alibaba 發布模型卡時重新執行這項比較——到那時,耐人尋味的問題將是:Qwen 4 Max 把多模態能力定價在高於 DeepSeek 文字費率之上時,超出的幅度是否會比今日更小。

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the 1M token context badge, the model ID qwen/qwen3.8-max, text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, and the model description naming Qwen3.8-Max Alibaba's newest flagship and highest-capability tier to date.

本文中的比較4

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新