一张生成的主视觉卡片,标题为“DeepSeek V4 Pro vs Qwen3.8 Max”,包含两张圆角卡片——一张 DeepSeek V4 Pro 卡片,标注为“$0.66 / $1.98 非高峰 · MIT 开放权重 · 1M 上下文”,以及一张 Qwen3.8 Max 卡片,标注为“$2.00 / $6.00 · 商业许可 · 1M 上下文”——两者之间由一个天平图标隔开,页脚为“三倍的价格,四点的智能——哪一个能经受住你的账单的考验?”
Guides & Insights

DeepSeek V4 Pro 与 Qwen3.8 Max:3 倍价差,九月暂缓后重新评测

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

DeepSeek V4 ProQwen3.8 Max 是这一代最重要的两款“开源或低价”旗舰,而 DeepSeek 一方在 9 月发生的一系列事件,对这场对决格局的改变,比两家厂商的营销宣传所承认的都要大。DeepSeek V4 Pro 于 2026 年 8 月 13 日发布,比阿里巴巴的 Qwen3.8 Max 于 8 月 3 日正式开放使用晚了十天;这一组合一直以来都被视为一场一边倒的较量:Qwen3.8 Max 是拥有 2.4 万亿参数的全能型选手,输入每百万 token 收费 2 美元、输出每百万 token 收费 6 美元;而 DeepSeek V4 Pro 则是拥有 1.6 万亿参数的推理专才,价格仅为前者的一小部分,采用 MIT 许可,并公开了权重。如今这一对比之所以值得重新审视,原因不在于发布当周的数字,而在于一个月后发生的事——DeepSeek 在 9 月 8 日那一周试图让 V4 Pro 退役,随后在 9 月 11 日又来了个急转弯,承诺在计费不变的前提下继续让其在线服务。这次反转是眼下这场对决中最重要的一件事,因为它决定了低价的那一方究竟是一个稳妥的选择,还是一个迁移陷阱。

本文中的独立测量数据来自 Artificial Analysis,于今日采集。Alibaba 和 DeepSeek 自家的基准测试表全程标注为供应商报告——两家公司的发布数据均未被第三方完全复现,而 DeepSeek 的数据如今已发布四周,面对的是一个不断变动的排行榜。

9月的暂缓才是关键,而非8月的发布

9月8日,Deep​Seek宣布,9月14日之后,所有对 deepseek-v4-pro 的请求都将被路由至 V4.1 Flash,并按 Flash 的价格计费,直到 V4.1 Pro 发布。任何认真比较 Qwen3.8 Max 与 DeepSeek V4 Pro 的人,都不得不开始为这个便宜选项的消失做打算。随后,Deep​Seek推迟了截止日期,并在9月11日彻底反转,表示将在9月14日之后继续为 DeepSeek V4 Pro 提供 API 服务,计费不变,并且如果情况有变会另行通知。这一反转当天就得到了中国官方媒体和科技媒体的报道。

这对这场对决的影响,是消除了此前一直在暗中左右决策的不对称性。在 9 月的第一周里,对于“我该基于 0.66 美元输出模型还是 6 美元输出模型来构建?”这个问题的诚实回答,一直受到生存风险的干扰:价格领先者当时有一个关停日期。截至 9 月 15 日,这种干扰已经消失。便宜的那个选项是持久的,而这场比较终于关乎它一直本该关乎的东西——智能、价格和速度。

A generated scoreboard titled 'DeepSeek V4 Pro vs Qwen3.8 Max — the scoreboard': left column DeepSeek V4 Pro rows AA Index 36 (#7/113), Price $0.66/$1.98 off-peak, Speed ~81 tok/s, Context 1M, License MIT open weights, Input text; right column Qwen3.8 Max rows AA Index 40 (#30/200), Price $2.00/$6.00, Speed ~41 tok/s, Context 1M, License Commercial, Input text + image + video; footer 'AA figures independent (current scale); DeepSeek price is vendor list off-peak.'

价格:同样的游戏,却只需输出成本的一小部分

在当前的独立排行榜上,两者相差四分,而它们之间的价格差距是开放权重层级中最大的。Qwen3.8 Max 按 Alibaba 的标价,每百万输入 token 2.00 美元,每百万输出 token 6.00 美元,并享有 88% 的缓存折扣。DeepSeek V4 Pro 在非高峰时段每百万输入 0.66 美元,每百万输出 1.98 美元,高峰时段翻倍至 1.32 美元/3.96 美元,并享有 97% 的缓存折扣。

• 价格 — DeepSeek V4 Pro 每 1M 非高峰时段 $0.66/$1.98(高峰时段 $1.32/$3.96),而 Qwen3.8 Max 为统一价 $2.00/$6.00

• 智能指数 — V4 Pro 36(#7/113)对比 Qwen3.8 Max 40(#30/200)

• 输出速度 — V4 Pro 约 81 token/秒,对比 Qwen3.8 Max 约 41 token/秒

• 每任务成本 — V4 Pro $0.67 vs Qwen3.8 Max $2.67(按 AA 指数任务计)

• 上下文 — 两者均为 1M tokens

• 许可证 — V4 Pro MIT 开放权重 对比 Qwen3.8 Max 专有权重、商业许可

输出价格比就是整个论点:Qwen3.8 Max 的每输入 token 成本是 V4 Pro 的三倍,而在 V4 Pro 的峰值费率下,每输出 token 的成本也大致是其三倍——当 V4 Pro 按非峰值费率计费时,输出端的差距更扩大到六倍,而这一费率覆盖了一周中除一个狭窄时段之外的大部分时间。在推理密集型工作负载中,输出 token 占据账单大头,这一差距决定了模型是你能让它一直跑着,还是你得盯着仪表盘。缓存进一步拉大了差距:V4 Pro 的 97% 折扣对 Qwen 的 88%,意味着带有可复用前缀的长上下文任务在 DeepSeek 这边的成本只是其标价的一小部分。

智能:相差四分,而差距才是真正的产品

独立的排行榜让两者的差距比价格比所暗示的更接近。在最新的 Artificial Analysis 智能指数上,Qwen3.8 Max 得分 40,而 DeepSeek V4 Pro 为 36——这 4 分的差距在推理密集型任务中会显现出来,但在 token 密集型任务中则消失不见。Qwen3.8 Max 的优势是真实且稳定的:它在 200 个模型中综合排名第 30,刚好跻身前沿行列;而 V4 Pro 则在开放权重类别中于 113 个模型里排名第 7。在阿里巴巴自家的基准测试表上,Qwen3.8 Max 号称 Terminal-Bench 2.1 达到 86.6、GPQA Diamond 达到 92.6,以及 FrontierSWE 达到 73.5——几乎是其前代 40.7 的两倍——而这些全是厂商自报数据,没有一项经过独立复现。DeepSeek 的模型卡则称,在最大推理强度下其 Codeforces 评分为 3,348、Terminal-Bench 2.1 为 87.9——同样是厂商自报,未经第三方验证。

诚实的说法是,这两家公司其实是在各说各话。Qwen3.8 Max 的厂商榜单是围绕企业级与科研工作构建的——阿里巴巴于 9 月 2 日发布的 0902 更新版在 Coding 和 Cowork 上做了进一步后训练,Qwen 称这恰恰强化了这一定位。而 DeepSeek V4 Pro 自己的说法则聚焦于深度推理与智能体工具使用,在这方面,其四周前公布的 Codeforces 和 Terminal-Bench 成绩依然亮眼。两家厂商的榜单都没有被独立评测方复现,而在唯一一个真正独立的排行榜上,4 分的差距就是这两个模型之间的全部差别。

速度是 Qwen3.8 Max 悄然失守的地方

规格表所隐藏的那个维度是输出速度。Artificial Analysis 测得 DeepSeek V4 Pro 约为每秒 81 个 token,而 Qwen3.8 Max 约为 41 个——回答返回的速度相差两倍。在聊天类负载中,这是用户能察觉到的一次停顿;而在包含大量顺序调用的智能体循环中,它会累积成实实在在的墙上时钟时间。价格比本就对 V4 Pro 有利,而速度差距让每次回答的有效成本差距比 token 数字所显示的还要大。

那个数字背后藏着一笔账,那就是 Qwen3.8 Max 的啰嗦程度。Artificial Analysis 指出,该模型“明显偏慢,而且非常啰嗦”,其单任务成本——2.67 美元,对比 V4 Pro 的 0.67 美元——既反映了更高的费率,也反映了额外的输出 token。一个每次回答都写得更多的推理模型,即便还没乘上价目表,单任务成本也更高。如果你的工作负载对延迟敏感,或者你的智能体循环会发起几十次调用,那这个数字就值得你自己跑一次评测。

权重:MIT 与商业许可证

DeepSeek V4 Pro 采用 MIT 许可证并公开权重——你可以下载这些权重、自行提供服务、进行微调,并将修改保持闭源。Qwen3.8 Max 是有史以来首个发布开放权重的 Max 级 Qwen(2.4T A95B 检查点于 8 月 12 日发布),但它采用带有规模分级条件的商业许可证,而且 Alibaba 没有像 DeepSeek 那样发布完整的推理栈。对于比较这两者的公司而言,部署方案是决定性因素:V4 Pro 可以作为一种基础设施自托管;Qwen3.8 Max 则主要是一种你租用的服务。如果你担心供应商锁定,或者想完全摆脱 API 价格,权重差异就最为重要。

谁应该选择哪个

如果你的工作负载以推理为主、输出 token 占比高,或者对延迟敏感,那么 DeepSeek V4 Pro 几乎在账单上体现的每一个维度上都是答案:输出成本大约便宜三到六倍,速度约快一倍,缓存折扣更深,而且 MIT 权重可作为退路。那四个点的智能差距确实存在,但幅度有限,而且在生产流量面前,它往往经不起价格差异的冲击。

如果你的工作负载具有企业级形态——复杂的多步骤分析、深度逻辑推导、高要求的智能体工作,或任何边际答案质量值得付出三到六倍 token 成本的任务——那么 Qwen3.8 Max 在独立指数上多出的四个百分点,以及其更强的企业级基准表现主张,就是值得支付溢价的原因。0902 更新进一步强化了这一特征。而如果你需要图像或视频输入,选择更是毫无悬念:Qwen3.8 Max 支持文本、图像和视频,而 DeepSeek V4 Pro 仅支持文本。

只需一个密钥,即可通过 OrcaRouter 调用这两个模型——DeepSeek V4 Pro 和 Qwen3.8 Max 都经由该平台路由——而且由于 OrcaRouter 按供应商标价原样透传、不添加任何加价,本文中的数字就是你实际支付的数字,供应商降价当天即可同步生效。路由 DSL 让你能在同一套集成中,把 token 量大或对延迟敏感的流量交给 DeepSeek V4 Pro,把多模态或最关键的高风险推理任务交给 Qwen3.8 Max——而这正是大多数团队最终使用这一组合的方式:两者兼用,各展所长。

A screenshot of the Artificial Analysis page for Qwen3.8 Max, captured September 15, 2026, showing the Intelligence Index score of 40 at rank 30 of 200, output speed 40.6 tokens per second, an input price of $2.00 and output price of $6.00 per million tokens with an 88% cache discount, and a cost of $2.67 per Intelligence Index task.A screenshot of the OrcaRouter model page for Qwen3.8 Max at orcarouter.ai/models/qwen/qwen3.8-max, captured September 15, 2026, showing the model listing with its provider Qwen, 1M-token context window, text+image+video input, and $2.00/$6.00 per-million-token pricing alongside the surrounding catalogue.

裁决

九月的暂缓决定解决了困扰这场对决的核心问题:便宜的那一方不再是流失风险。DeepSeek V4 Pro 是性价比的答案——输出成本便宜三到六倍,速度快一倍,采用 MIT 许可,且如今已承诺持续在线。Qwen3.8 Max 是能力的答案——在四项独立指标上高出四个点,企业级宣称更强,支持多模态输入,但商业许可让它无法进入你的技术栈。当你的评估证明那四个点确实重要时,就选那四个点;当你的账单才是真正起决定作用的评估时,就选价格。

将 token 消耗大或对延迟敏感的流量交给 DeepSeek V4 Pro,将多模态或最关键、最不容有失的推理交给Qwen3.8 Max,而这一切都出自同一套集成方案——这正是大多数团队最终使用这对组合的方式:两者兼用,各展所长。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新