
DeepSeek V4 Pro 對比 Qwen3.8 Max:推理專家 vs 中國全能選手
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
相隔十天,中國最受關注的兩款模型相繼上線:阿里巴巴發佈了Qwen3.8 Max,時間是2026年8月3日——這是一款2.4兆參數的稀疏MoE旗艦,被其標榜為智能體、辦公與多模態理解的全能選手——而DeepSeek則推出了正式版DeepSeek V4 Pro,於8月12日發布。這款專攻推理與編碼的模型,總參數達1.6T,輸出token的價格約為Qwen的七分之一。兩者瞄準的是同一批開發者的荷包,但對旗艦模型該做什麼卻意見分歧:Qwen3.8 Max想成為你所有任務都統一路由到的那個模型;DeepSeek V4 Pro則想成為你把棘手難題升級交給它的那個模型。

關鍵要點
• Qwen3.8 Max 是中國通用排行榜上原始能力較高的模型(SuperCLUE 第一名,七月),也是更強大的多模態/企業級套件——影片輸入、內建工具、結構化輸出,全部集中在一個 API 中。
• DeepSeek V4 Pro 的價格大幅降低(輸出方面約 7 倍),已開放權重,如今在編碼/代理能力的宣稱上更勝一籌 — Terminal-Bench 2.1 得分 87.9,對比 Qwen 廠商宣稱的 86.6。
• 注意冗長成本:獨立運行測試顯示,Qwen3.8 Max 平均每個代理任務約需 64 輪對話、耗費約 $1.14 —— 這是規格表所隱藏的實際成本問題。
• 誠實的標題:Qwen3.8 Max 是「能力之戰」的旗艦,定價與美國封閉模型看齊;DeepSeek V4 Pro 則是性價比的反擊。
同一張規格表中的兩種哲學
• 總參數 — Qwen3.8 Max 2.4T(稀疏 MoE,約 95B 活躍)對比 DeepSeek V4 Pro 1.6T(MoE,約 49B 活躍)
• 上下文/最大輸出 — 兩者上下文均為 1M;Qwen 的輸出上限約為 128–131K,而 DeepSeek 則為 384K
• 輸入 — Qwen 支援文字、圖片與影片輸入;DeepSeek V4 Pro 支援文字與圖片輸入,並在官方版本中具備全新的原生圖片推理能力
• 開放權重 — DeepSeek V4 Pro:已發布(MIT);Qwen3.8 Max:承諾於8月10日當週發布,為史上首款開源的 Max 級 Qwen
• API 附加功能 — Qwen 內建工具與結構化輸出,開箱即用;DeepSeek V4 Pro 提供思考切換、結構化 JSON、Responses API,以及 Codex 相容性。
• 價格 — {{1}}Qwen3.8 Max{{/1}} 每百萬 tokens 為 $2.00 / $6.00(快取 $0.25)vs {{2}}DeepSeek V4 Pro{{/2}} 約 $0.42 / $0.87(快取 $0.0035)

Qwen3.8 Max 的優勢所在
在通用能力軸線上,{{1}}Qwen3.8 Max 居於領先{{/1}},獨立數據也印證了這點。{{2}}Artificial Analysis{{/2}} 對它的評測結果是{{3}}智能指數 58、程式碼指數 71.8、代理指數 58{{/3}}——{{4}}這是任何中國實驗室迄今最接近該代理排行榜榜首的一次{{/4}}。在 {{5}}SuperCLUE{{/5}} 七月的中文排行榜上,它位居{{6}}第 1 名,得分 71.48{{/6}},而 {{7}}DeepSeek-V4-Pro{{/7}} 則位居{{8}}第 5 名,得分 64.4{{/8}}。{{9}}阿里巴巴的發布示範{{/9}}——{{10}}一次為期 16 天的自主程式設計任務,以及一項論文復現,其 AIME24 成績超越了原論文{{/10}}——是{{11}}整個發布週期中最有力的證據{{/11}},證明這確實是一個具備真正能力的長程代理。
對開發者而言,實際的勝出點是整合型的:影片輸入、內建工具呼叫、免設定的結構化輸出,以及一個 DeepSeek 無意追趕的生態系統(Model Studio、Qwen 工具鏈)。若工作負載是文件密集型、多模態,或需要企業整合的應用情境,Qwen3.8 Max 就是中國市場目前預設採用的模型。
DeepSeek V4 Pro 的優勢所在
在編碼與成本方面,正式版 V4 Pro 就是最有力的反駁。DeepSeek 報告稱,{{1}}正式版在 Terminal-Bench 2.1 上取得 87.9 分(高於預覽版的 72.1){{/1}},{{2}}在 DeepSWE 上為 62.7 分{{/2}}——而 Qwen 廠商自行報告的 {{3}}Terminal-Bench 分數為 86.6{{/3}}。預覽版早已擁有 {{4}}80.6 的 SWE-bench Verified、90.1 的 GPQA Diamond,以及 93.5 的 LiveCodeBench{{/4}},是開源模型競賽程式設計的最高分,而正式版的變更恰好集中在這些分數所對應的代理型(agentic)與推理任務上。
接着是价格。以每百万 tokens 0.42/0.87 美元计算,DeepSeek V4 Pro 的输入成本比 Qwen3.8 Max 的 2/6 美元便宜约 4.8 倍,输出成本便宜约 6.9 倍。{{1}}DeepSeek 还在 8 月 6 日指出即将涨价,这使得今天的价格只是一个窗口期,而非承诺——下文将详细说明。{{/1}}

在真實的代理任務上算一算。
獨立代理執行(agentic runs)正是 {{1}}Qwen 的標價不再是真實價格{{/1}} 之處。在 Artificial Analysis 的代理任務中,{{2}}Qwen3.8 Max 平均每次任務約 64 輪,每任務成本約 $1.14,上一代則約 $0.53{{/2}}——該模型相當冗長、規劃量大。{{3}}若在 DeepSeek V4 Pro 上以每百萬輸出 $0.87 執行相同任務形態,每次任務成本約莫低一個數量級{{/3}}。{{4}}如果你的產品是每天每位使用者呼叫模型一百次的迴圈,那麼這個差異就是你的利潤空間。{{/4}}
雙方的可靠性注意事項
這裡的來源誠實是雙向的。獨立測試指出 Qwen3.8 Max 的幻覺率從 23% 上升到 40%,AA-Omniscience 分數下降了十分——該模型在同一次發布中變得更強大,卻也更不可信。DeepSeek 的預覽版在 AA-Omniscience 上有記載的 94% 總是回答率,意思是它傾向於無論是否知道答案都會產生一個回答。這兩個警示對生產環境都很重要;對於這些模型所針對的工作負載來說,兩者都不構成取消資格的因素。
為什麼開放權重的時機改變了價格計算
Qwen3.8 Max 的開放權重釋出,{{1}}一旦正式推出{{/1}},將改變{{2}}這場對決在一週內的經濟格局{{/2}} — {{3}}自行託管者將獲得 2.4T 旗艦模型{{/3}},而{{4}}API 價格壓力將真實存在{{/4}}。這正是{{5}}轉嫁定價模式能讓你保持誠信{{/5}}的場景。OrcaRouter 以{{6}}零加價轉嫁供應商的目錄價格{{/6}},因此當阿里巴巴或 DeepSeek 調整價格時 — {{7}}無論漲或跌{{/7}} — {{8}}這項變更當天就會在一把金鑰上生效{{/8}},{{9}}無需重新談判或閱讀第二份合約{{/9}}。你可以將流量路由至 {{10}}Qwen3.8 Max 或 DeepSeek V4 Pro{{/10}} 兩者中{{11}}目前評測較偏好的那一方{{/11}},而{{12}}價格始終維持供應商實際收取的金額{{/12}}。
為您的 API 建置器決策,該選哪一個?
當任務需要全方位覆蓋時,選擇 Qwen3.8 Max——多模態輸入、結構化輸出、內建工具、中文品質居當前排行榜之首——而且你的成本模型能容忍冗長的代理型(agentic)執行。當任務以推理或程式碼為主、Token 用量龐大、開放權重對合規或自架部署至關重要,或預算線是硬性約束時,選擇 DeepSeek V4 Pro。這場對決最直接的解讀,正是兩家公司自身所傳達的訊號:Qwen3.8 Max 是你衡量一切的旗艦,而 DeepSeek V4 Pro 讓基準測試看起來變得很昂貴。
本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
