
DeepSeek V4 Pro 对比 Qwen3.8 Max:推理专家 vs 中国全能选手
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
相隔十天,中国最受关注的两个模型相继上线:阿里巴巴发布了Qwen3.8 Max,时间为2026年8月3日。这是一款拥有2.4万亿参数的稀疏MoE旗舰模型,该公司称其为面向智能体、办公与多模态理解的全能型选手。同时,DeepSeek也发布了正式版DeepSeek V4 Pro,时间为8月12日。这是一款专注推理与编码的模型,总参数1.6万亿,输出token的价格约为Qwen的七分之一。两者瞄准的是同一批开发者的钱包,但对旗舰模型的定位却意见相左。Qwen3.8 Max希望成为你所有请求都路由经过的那个模型;DeepSeek V4 Pro则希望成为你把难题升级交给它的那个模型。

关键要点
• Qwen3.8 Max 是中国通用大模型榜单上原始能力更强的模型(SuperCLUE 排名第一,7月),也是更强的多模态/企业级方案——视频输入、内置工具、结构化输出,全部集成于一个 API。
• DeepSeek V4 Pro 的价格大幅下降(输出成本约为原来的 1/7),权重已开源,并且在编码/智能体(agentic)能力方面现在拥有更高的成绩——Terminal-Bench 2.1 得分 87.9,而 Qwen 厂商报告的得分为 86.6。
• 关注冗长成本:独立运行显示 Qwen3.8 Max 平均每项智能体任务约需 64 轮,花费约 1.14 美元——这是规格说明书未提及的有效成本问题。
• 实话实说的标题:Qwen3.8 Max 是"能力战"旗舰,定价对标美国闭源模型;DeepSeek V4 Pro 则是性价比的反击。
同一规格表中的两种理念
• 总参数量 — Qwen3.8 Max 2.4T(稀疏MoE,约95B激活参数)对比 DeepSeek V4 Pro 1.6T(MoE,约49B激活参数)
• 上下文 / 最大输出 — 两者均为 1M 上下文;Qwen 的输出上限约为 128–131K,而 DeepSeek 为 384K
• 输入 — Qwen 支持文本、图像和视频;DeepSeek V4 Pro 支持文本和图像,并在官方版本中新增了原生图像推理功能
• 开放权重 — DeepSeek V4 Pro:已发布(MIT 许可);Qwen3.8 Max:承诺于8月10日当周发布,这将是Qwen有史以来首款开源的 Max 级模型。
• API 附加功能 — Qwen 开箱即用地提供内置工具和结构化输出;DeepSeek V4 Pro 提供思考开关、结构化 JSON、Responses API 和 Codex 兼容性
• 价格 — Qwen3.8 Max 每百万 tokens $2.00 / $6.00(缓存 $0.25)对比 DeepSeek V4 Pro 约 $0.42 / $0.87(缓存 $0.0035)

Qwen3.8 Max 的优势所在
在通用能力轴线上,Qwen3.8 Max 处于领先地位,独立数据也印证了这一点。Artificial Analysis 将其智能指数评为 58,编码指数为 71.8,智能体指数为 58——这是任何中国实验室在该智能体排行榜上最接近榜首的一次。在 SuperCLUE 七月份中文排名中,它以 71.48 分位列第一,而 DeepSeek-V4-Pro 以 64.4 分位列第五。阿里巴巴的发布演示——一次为期16天的自主编码运行、一次击败原论文 AIME24 结果的论文复现——是整个发布周期中最有力的证据,表明这确实是一个具备真正长时程能力的智能体。
对构建者而言,实际的优势是以集成为核心的:视频输入、内置工具调用、无需配置即可获得结构化输出,以及一个DeepSeek并不试图匹敌的生态系统(Model Studio、Qwen工具链)。如果工作负载以文档为主、涉及多模态,或者需要企业级集成方案,那么Qwen3.8 Max就是当前中国市场默认选择的模型。
DeepSeek V4 Pro 的优势所在
就编码与成本而言,正式版 V4 Pro 就是最好的回击。DeepSeek 报告称,正式版在 Terminal-Bench 2.1 上得分 87.9(较预览版的 72.1 有所提升),在 DeepSWE 上得分 62.7——而 Qwen 厂商自报的 Terminal-Bench 得分为 86.6。预览版此前已持有 SWE-bench Verified 80.6、GPQA Diamond 90.1 和 LiveCodeBench 93.5 的成绩,后者是开源模型中排名第一的竞赛编程分数;而正式版的改动恰好集中在这些数字所在的智能体任务与推理任务上。
然后是价格。按每百万token 0.42美元/0.87美元计算,DeepSeek V4 Pro 的输入价格比 Qwen3.8 Max 的2美元/6美元便宜约4.8倍,输出价格便宜约6.9倍。DeepSeek 还于8月6日提醒称即将涨价,这使得当前价格只是一个窗口期,而非承诺——下文将详细说明。

对一项真实的智能体任务进行计算
在独立代理运行场景下,Qwen的标价就不再是真实价格。在Artificial Analysis的代理任务中,Qwen3.8 Max每个任务平均约64轮次,每任务成本约1.14美元,而上一代约为0.53美元——该模型输出冗长、规划量大。在DeepSeek V4 Pro上以每百万输出token 0.87美元的价格运行相同形态的任务,每任务成本大约低一个数量级。如果你的产品是一个每天为每个用户调用模型上百次的循环,那么这一差异就是你的利润空间。
双方的可靠性注意事项
数据来源的透明度在这里是一把双刃剑。独立测试发现 Qwen3.8 Max 的幻觉率从 23% 上升到 40%,AA-Omniscience 得分下降了十分——该模型在同一版本中变得更强大,但可信度降低。DeepSeek 的预览版在 AA-Omniscience 上记录了 94% 的始终回答率,这意味着它无论是否知道答案都会倾向于生成答案。这两个问题对生产环境都很重要;对于这些模型所针对的工作负载来说,两者都不是决定性因素。
为什么开放权重的时机会改变价格计算
Qwen3.8 Max 的开源权重发布一旦落地,将在一周内改变这场对决的经济格局——自托管者将获得一款 2.4T 参数的旗舰模型,API 价格压力将真实存在。这正是直通式定价模式让你保持诚实的场景。OrcaRouter 以零加价直通供应商的挂牌价格,因此无论是阿里还是 DeepSeek 调整价格——上调或下调——变更都将在当天通过同一个密钥即时生效,无需重新谈判,也无需阅读第二份合同。你可以路由到当前评估所青睐的 Qwen3.8 Max 或 DeepSeek V4 Pro 中的任意一个,而定价始终与供应商实际收取的价格保持一致。
哪个适合你的 API Builder 决策
当任务需要全方位能力时,选择 Qwen3.8 Max——多模态输入、结构化输出、内置工具、中文质量高居当前排行榜榜首——并且你的成本模型能容忍冗长的智能体运行。当任务偏重推理或编码、token 用量大、开放权重对合规或自托管至关重要,或预算是硬性约束时,选择 DeepSeek V4 Pro。对这场对决最清晰的解读,正是两家公司自己在传递的信号:Qwen3.8 Max 是衡量一切的旗舰,而 DeepSeek V4 Pro 让基准测试显得昂贵。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
