用於 DeepSeek V4 Pro 與 Qwen3.8 Max 對比的主視覺標題卡,副標題為「推理專家 vs 中國全能選手」
Guides & Insights

DeepSeek V4 Pro 對比 Qwen3.8 Max:推理專家 vs 中國全能選手

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

相隔十天,中國最受關注的兩款模型相繼上線:阿里巴巴發佈了Qwen3.8 Max,時間是2026年8月3日——這是一款2.4兆參數的稀疏MoE旗艦,被其標榜為智能體、辦公與多模態理解的全能選手——而D​eepSeek則推出了正式版DeepSeek V4 Pro,於8月12日發布。這款專攻推理與編碼的模型,總參數達1.6T,輸出token的價格約為Q​wen的七分之一。兩者瞄準的是同一批開發者的荷包,但對旗艦模型該做什麼卻意見分歧:Qwen3.8 Max想成為你所有任務都統一路由到的那個模型;DeepSeek V4 Pro則想成為你把棘手難題升級交給它的那個模型。

The OrcaRouter DeepSeek V4 Pro model page showing the flagship MoE badge, 1M-token context, 384K max output, per-million pricing and an OpenAI-compatible code sample.

關鍵要點

• Qwen3.8 Max 是中國通用排行榜上原始能力較高的模型(SuperCLUE 第一名,七月),也是更強大的多模態/企業級套件——影片輸入、內建工具、結構化輸出,全部集中在一個 API 中。

• DeepSeek V4 Pro 的價格大幅降低(輸出方面約 7 倍),已開放權重,如今在編碼/代理能力的宣稱上更勝一籌 — Terminal-Bench 2.1 得分 87.9,對比 Q​wen 廠商宣稱的 86.6。

• 注意冗長成本:獨立運行測試顯示,Qwen3.8 Max 平均每個代理任務約需 64 輪對話、耗費約 $1.14 —— 這是規格表所隱藏的實際成本問題。

• 誠實的標題:Qwen3.8 Max 是「能力之戰」的旗艦,定價與美國封閉模型看齊;DeepSeek V4 Pro 則是性價比的反擊。

同一張規格表中的兩種哲學

• 總參數 — Qwen3.8 Max 2.4T(稀疏 MoE,約 95B 活躍)對比 DeepSeek V4 Pro 1.6T(MoE,約 49B 活躍)

• 上下文/最大輸出 — 兩者上下文均為 1M;Qwen 的輸出上限約為 128–131K,而 DeepSeek 則為 384K

• 輸入 — Q​wen 支援文字、圖片與影片輸入;DeepSeek V4 Pro 支援文字與圖片輸入,並在官方版本中具備全新的原生圖片推理能力

• 開放權重 — DeepSeek V4 Pro:已發布(MIT);Qwen3.8 Max:承諾於8月10日當週發布,為史上首款開源的 Max 級 Q​wen

• API 附加功能 — Q​wen 內建工具與結構化輸出,開箱即用;DeepSeek V4 Pro 提供思考切換、結構化 JSON、Responses API,以及 Codex 相容性。

• 價格 — {{1}}Qwen3.8 Max{{/1}} 每百萬 tokens 為 $2.00 / $6.00(快取 $0.25)vs {{2}}DeepSeek V4 Pro{{/2}} 約 $0.42 / $0.87(快取 $0.0035)

Scoreboard contrasting DeepSeek V4 Pro (Terminal-Bench 2.1 87.9 official, output price $0.87 per 1M, 1.6T total params, MIT open weights out now, 384K max output, text+image input) with Qwen3.8 Max (86.6 vendor, $6.00, 2.4T params, weights promised, ~128K max output, text+image+video input).

Qwen3.8 Max 的優勢所在

在通用能力軸線上,{{1}}Qwen3.8 Max 居於領先{{/1}},獨立數據也印證了這點。{{2}}Artificial Analysis{{/2}} 對它的評測結果是{{3}}智能指數 58、程式碼指數 71.8、代理指數 58{{/3}}——{{4}}這是任何中國實驗室迄今最接近該代理排行榜榜首的一次{{/4}}。在 {{5}}SuperCLUE{{/5}} 七月的中文排行榜上,它位居{{6}}第 1 名,得分 71.48{{/6}},而 {{7}}DeepSeek-V4-Pro{{/7}} 則位居{{8}}第 5 名,得分 64.4{{/8}}。{{9}}阿里巴巴的發布示範{{/9}}——{{10}}一次為期 16 天的自主程式設計任務,以及一項論文復現,其 AIME24 成績超越了原論文{{/10}}——是{{11}}整個發布週期中最有力的證據{{/11}},證明這確實是一個具備真正能力的長程代理。

對開發者而言,實際的勝出點是整合型的:影片輸入、內建工具呼叫、免設定的結構化輸出,以及一個 D​eepSeek 無意追趕的生態系統(Model Studio、Q​wen 工具鏈)。若工作負載是文件密集型、多模態,或需要企業整合的應用情境,Qwen3.8 Max 就是中國市場目前預設採用的模型。

DeepSeek V4 Pro 的優勢所在

在編碼與成本方面,正式版 V4 Pro 就是最有力的反駁。D​eepSeek 報告稱,{{1}}正式版在 Terminal-Bench 2.1 上取得 87.9 分(高於預覽版的 72.1){{/1}},{{2}}在 DeepSWE 上為 62.7 分{{/2}}——而 Q​wen 廠商自行報告的 {{3}}Terminal-Bench 分數為 86.6{{/3}}。預覽版早已擁有 {{4}}80.6 的 SWE-bench Verified、90.1 的 GPQA Diamond,以及 93.5 的 LiveCodeBench{{/4}},是開源模型競賽程式設計的最高分,而正式版的變更恰好集中在這些分數所對應的代理型(agentic)與推理任務上。

接着是价格。以每百万 tokens 0.42/0.87 美元计算,DeepSeek V4 Pro 的输入成本比 Qwen3.8 Max 的 2/6 美元便宜约 4.8 倍,输出成本便宜约 6.9 倍。{{1}}DeepSeek 还在 8 月 6 日指出即将涨价,这使得今天的价格只是一个窗口期,而非承诺——下文将详细说明。{{/1}}

An infographic summarizing the official DeepSeek V4 Pro release: Terminal-Bench 2.1 at 87.9 (preview 72.1), DeepSWE 62.7 (preview 12.8), AutomationBench 31.8 (preview 12.8), with native image reasoning, 1M context, 384K output and $0.87 per 1M output.

在真實的代理任務上算一算。

獨立代理執行(agentic runs)正是 {{1}}Qwen 的標價不再是真實價格{{/1}} 之處。在 Artificial Analysis 的代理任務中,{{2}}Qwen3.8 Max 平均每次任務約 64 輪,每任務成本約 $1.14,上一代則約 $0.53{{/2}}——該模型相當冗長、規劃量大。{{3}}若在 DeepSeek V4 Pro 上以每百萬輸出 $0.87 執行相同任務形態,每次任務成本約莫低一個數量級{{/3}}。{{4}}如果你的產品是每天每位使用者呼叫模型一百次的迴圈,那麼這個差異就是你的利潤空間。{{/4}}

雙方的可靠性注意事項

這裡的來源誠實是雙向的。獨立測試指出 Qwen3.8 Max 的幻覺率從 23% 上升到 40%,AA-Omniscience 分數下降了十分——該模型在同一次發布中變得更強大,卻也更不可信。DeepSeek 的預覽版在 AA-Omniscience 上有記載的 94% 總是回答率,意思是它傾向於無論是否知道答案都會產生一個回答。這兩個警示對生產環境都很重要;對於這些模型所針對的工作負載來說,兩者都不構成取消資格的因素。

為什麼開放權重的時機改變了價格計算

Qwen3.8 Max 的開放權重釋出,{{1}}一旦正式推出{{/1}},將改變{{2}}這場對決在一週內的經濟格局{{/2}} — {{3}}自行託管者將獲得 2.4T 旗艦模型{{/3}},而{{4}}API 價格壓力將真實存在{{/4}}。這正是{{5}}轉嫁定價模式能讓你保持誠信{{/5}}的場景。OrcaRouter 以{{6}}零加價轉嫁供應商的目錄價格{{/6}},因此當阿里巴巴或 D​eepSeek 調整價格時 — {{7}}無論漲或跌{{/7}} — {{8}}這項變更當天就會在一把金鑰上生效{{/8}},{{9}}無需重新談判或閱讀第二份合約{{/9}}。你可以將流量路由至 {{10}}Qwen3.8 Max 或 DeepSeek V4 Pro{{/10}} 兩者中{{11}}目前評測較偏好的那一方{{/11}},而{{12}}價格始終維持供應商實際收取的金額{{/12}}。

為您的 API 建置器決策,該選哪一個?

當任務需要全方位覆蓋時,選擇 Qwen3.8 Max——多模態輸入、結構化輸出、內建工具、中文品質居當前排行榜之首——而且你的成本模型能容忍冗長的代理型(agentic)執行。當任務以推理或程式碼為主、Token 用量龐大、開放權重對合規或自架部署至關重要,或預算線是硬性約束時,選擇 DeepSeek V4 Pro。這場對決最直接的解讀,正是兩家公司自身所傳達的訊號:Qwen3.8 Max 是你衡量一切的旗艦,而 DeepSeek V4 Pro 讓基準測試看起來變得很昂貴。

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube