
DeepSeek V4 Pro 与 Qwen3.8 Max:3 倍价差,九月暂缓后重新评测
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
DeepSeek V4 Pro 与 Qwen3.8 Max 是这一代最重要的两款“开源或低价”旗舰,而 DeepSeek 一方在 9 月发生的一系列事件,对这场对决格局的改变,比两家厂商的营销宣传所承认的都要大。DeepSeek V4 Pro 于 2026 年 8 月 13 日发布,比阿里巴巴的 Qwen3.8 Max 于 8 月 3 日正式开放使用晚了十天;这一组合一直以来都被视为一场一边倒的较量:Qwen3.8 Max 是拥有 2.4 万亿参数的全能型选手,输入每百万 token 收费 2 美元、输出每百万 token 收费 6 美元;而 DeepSeek V4 Pro 则是拥有 1.6 万亿参数的推理专才,价格仅为前者的一小部分,采用 MIT 许可,并公开了权重。如今这一对比之所以值得重新审视,原因不在于发布当周的数字,而在于一个月后发生的事——DeepSeek 在 9 月 8 日那一周试图让 V4 Pro 退役,随后在 9 月 11 日又来了个急转弯,承诺在计费不变的前提下继续让其在线服务。这次反转是眼下这场对决中最重要的一件事,因为它决定了低价的那一方究竟是一个稳妥的选择,还是一个迁移陷阱。
本文中的独立测量数据来自 Artificial Analysis,于今日采集。Alibaba 和 DeepSeek 自家的基准测试表全程标注为供应商报告——两家公司的发布数据均未被第三方完全复现,而 DeepSeek 的数据如今已发布四周,面对的是一个不断变动的排行榜。
9月的暂缓才是关键,而非8月的发布
9月8日,DeepSeek宣布,9月14日之后,所有对 deepseek-v4-pro 的请求都将被路由至 V4.1 Flash,并按 Flash 的价格计费,直到 V4.1 Pro 发布。任何认真比较 Qwen3.8 Max 与 DeepSeek V4 Pro 的人,都不得不开始为这个便宜选项的消失做打算。随后,DeepSeek推迟了截止日期,并在9月11日彻底反转,表示将在9月14日之后继续为 DeepSeek V4 Pro 提供 API 服务,计费不变,并且如果情况有变会另行通知。这一反转当天就得到了中国官方媒体和科技媒体的报道。
这对这场对决的影响,是消除了此前一直在暗中左右决策的不对称性。在 9 月的第一周里,对于“我该基于 0.66 美元输出模型还是 6 美元输出模型来构建?”这个问题的诚实回答,一直受到生存风险的干扰:价格领先者当时有一个关停日期。截至 9 月 15 日,这种干扰已经消失。便宜的那个选项是持久的,而这场比较终于关乎它一直本该关乎的东西——智能、价格和速度。

价格:同样的游戏,却只需输出成本的一小部分
在当前的独立排行榜上,两者相差四分,而它们之间的价格差距是开放权重层级中最大的。Qwen3.8 Max 按 Alibaba 的标价,每百万输入 token 2.00 美元,每百万输出 token 6.00 美元,并享有 88% 的缓存折扣。DeepSeek V4 Pro 在非高峰时段每百万输入 0.66 美元,每百万输出 1.98 美元,高峰时段翻倍至 1.32 美元/3.96 美元,并享有 97% 的缓存折扣。
• 价格 — DeepSeek V4 Pro 每 1M 非高峰时段 $0.66/$1.98(高峰时段 $1.32/$3.96),而 Qwen3.8 Max 为统一价 $2.00/$6.00
• 智能指数 — V4 Pro 36(#7/113)对比 Qwen3.8 Max 40(#30/200)
• 输出速度 — V4 Pro 约 81 token/秒,对比 Qwen3.8 Max 约 41 token/秒
• 每任务成本 — V4 Pro $0.67 vs Qwen3.8 Max $2.67(按 AA 指数任务计)
• 上下文 — 两者均为 1M tokens
• 许可证 — V4 Pro MIT 开放权重 对比 Qwen3.8 Max 专有权重、商业许可
输出价格比就是整个论点:Qwen3.8 Max 的每输入 token 成本是 V4 Pro 的三倍,而在 V4 Pro 的峰值费率下,每输出 token 的成本也大致是其三倍——当 V4 Pro 按非峰值费率计费时,输出端的差距更扩大到六倍,而这一费率覆盖了一周中除一个狭窄时段之外的大部分时间。在推理密集型工作负载中,输出 token 占据账单大头,这一差距决定了模型是你能让它一直跑着,还是你得盯着仪表盘。缓存进一步拉大了差距:V4 Pro 的 97% 折扣对 Qwen 的 88%,意味着带有可复用前缀的长上下文任务在 DeepSeek 这边的成本只是其标价的一小部分。
智能:相差四分,而差距才是真正的产品
独立的排行榜让两者的差距比价格比所暗示的更接近。在最新的 Artificial Analysis 智能指数上,Qwen3.8 Max 得分 40,而 DeepSeek V4 Pro 为 36——这 4 分的差距在推理密集型任务中会显现出来,但在 token 密集型任务中则消失不见。Qwen3.8 Max 的优势是真实且稳定的:它在 200 个模型中综合排名第 30,刚好跻身前沿行列;而 V4 Pro 则在开放权重类别中于 113 个模型里排名第 7。在阿里巴巴自家的基准测试表上,Qwen3.8 Max 号称 Terminal-Bench 2.1 达到 86.6、GPQA Diamond 达到 92.6,以及 FrontierSWE 达到 73.5——几乎是其前代 40.7 的两倍——而这些全是厂商自报数据,没有一项经过独立复现。DeepSeek 的模型卡则称,在最大推理强度下其 Codeforces 评分为 3,348、Terminal-Bench 2.1 为 87.9——同样是厂商自报,未经第三方验证。
诚实的说法是,这两家公司其实是在各说各话。Qwen3.8 Max 的厂商榜单是围绕企业级与科研工作构建的——阿里巴巴于 9 月 2 日发布的 0902 更新版在 Coding 和 Cowork 上做了进一步后训练,Qwen 称这恰恰强化了这一定位。而 DeepSeek V4 Pro 自己的说法则聚焦于深度推理与智能体工具使用,在这方面,其四周前公布的 Codeforces 和 Terminal-Bench 成绩依然亮眼。两家厂商的榜单都没有被独立评测方复现,而在唯一一个真正独立的排行榜上,4 分的差距就是这两个模型之间的全部差别。
速度是 Qwen3.8 Max 悄然失守的地方
规格表所隐藏的那个维度是输出速度。Artificial Analysis 测得 DeepSeek V4 Pro 约为每秒 81 个 token,而 Qwen3.8 Max 约为 41 个——回答返回的速度相差两倍。在聊天类负载中,这是用户能察觉到的一次停顿;而在包含大量顺序调用的智能体循环中,它会累积成实实在在的墙上时钟时间。价格比本就对 V4 Pro 有利,而速度差距让每次回答的有效成本差距比 token 数字所显示的还要大。
那个数字背后藏着一笔账,那就是 Qwen3.8 Max 的啰嗦程度。Artificial Analysis 指出,该模型“明显偏慢,而且非常啰嗦”,其单任务成本——2.67 美元,对比 V4 Pro 的 0.67 美元——既反映了更高的费率,也反映了额外的输出 token。一个每次回答都写得更多的推理模型,即便还没乘上价目表,单任务成本也更高。如果你的工作负载对延迟敏感,或者你的智能体循环会发起几十次调用,那这个数字就值得你自己跑一次评测。
权重:MIT 与商业许可证
DeepSeek V4 Pro 采用 MIT 许可证并公开权重——你可以下载这些权重、自行提供服务、进行微调,并将修改保持闭源。Qwen3.8 Max 是有史以来首个发布开放权重的 Max 级 Qwen(2.4T A95B 检查点于 8 月 12 日发布),但它采用带有规模分级条件的商业许可证,而且 Alibaba 没有像 DeepSeek 那样发布完整的推理栈。对于比较这两者的公司而言,部署方案是决定性因素:V4 Pro 可以作为一种基础设施自托管;Qwen3.8 Max 则主要是一种你租用的服务。如果你担心供应商锁定,或者想完全摆脱 API 价格,权重差异就最为重要。
谁应该选择哪个
如果你的工作负载以推理为主、输出 token 占比高,或者对延迟敏感,那么 DeepSeek V4 Pro 几乎在账单上体现的每一个维度上都是答案:输出成本大约便宜三到六倍,速度约快一倍,缓存折扣更深,而且 MIT 权重可作为退路。那四个点的智能差距确实存在,但幅度有限,而且在生产流量面前,它往往经不起价格差异的冲击。
如果你的工作负载具有企业级形态——复杂的多步骤分析、深度逻辑推导、高要求的智能体工作,或任何边际答案质量值得付出三到六倍 token 成本的任务——那么 Qwen3.8 Max 在独立指数上多出的四个百分点,以及其更强的企业级基准表现主张,就是值得支付溢价的原因。0902 更新进一步强化了这一特征。而如果你需要图像或视频输入,选择更是毫无悬念:Qwen3.8 Max 支持文本、图像和视频,而 DeepSeek V4 Pro 仅支持文本。
只需一个密钥,即可通过 OrcaRouter 调用这两个模型——DeepSeek V4 Pro 和 Qwen3.8 Max 都经由该平台路由——而且由于 OrcaRouter 按供应商标价原样透传、不添加任何加价,本文中的数字就是你实际支付的数字,供应商降价当天即可同步生效。路由 DSL 让你能在同一套集成中,把 token 量大或对延迟敏感的流量交给 DeepSeek V4 Pro,把多模态或最关键的高风险推理任务交给 Qwen3.8 Max——而这正是大多数团队最终使用这一组合的方式:两者兼用,各展所长。


裁决
九月的暂缓决定解决了困扰这场对决的核心问题:便宜的那一方不再是流失风险。DeepSeek V4 Pro 是性价比的答案——输出成本便宜三到六倍,速度快一倍,采用 MIT 许可,且如今已承诺持续在线。Qwen3.8 Max 是能力的答案——在四项独立指标上高出四个点,企业级宣称更强,支持多模态输入,但商业许可让它无法进入你的技术栈。当你的评估证明那四个点确实重要时,就选那四个点;当你的账单才是真正起决定作用的评估时,就选价格。
将 token 消耗大或对延迟敏感的流量交给 DeepSeek V4 Pro,将多模态或最关键、最不容有失的推理交给Qwen3.8 Max,而这一切都出自同一套集成方案——这正是大多数团队最终使用这对组合的方式:两者兼用,各展所长。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
