
Qwen 4 Max 对比 DeepSeek V4 Pro:950 亿激活参数对 490 亿
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
在2026年9月22日的云栖大会上,Qwen 4 Max的发布只给业界留下了一个名称和一套层级划分,除此之外什么都没有——没有权重、没有价格、没有上下文窗口、没有日期。DeepSeek V4 Pro自2026年4月24日起就已被列出,为一个1.6万亿参数的混合专家模型,每个token激活490亿参数,具备100万token上下文,非高峰价格为每百万输入token 0.66美元、每百万输出token 1.98美元。真正值得并排比较的数字不是总参数量,而是激活参数量:最近发布的Qwen3.8-Max每个token激活950亿参数,约为DeepSeek V4 Pro所运行的490亿激活参数的两倍,而仅凭这一个数字,在参考任何基准测试之前,就能解释两家实验室之间三倍价格差距的大部分原因。
稀疏性上的两种不同押注
两家实验室都在构建稀疏混合专家模型。但对于究竟该有多稀疏,双方存在尖锐分歧。Qwen3.8-Max——当前在售的 Qwen 旗舰模型,也是判断 Qwen 4 Max 将是什么样子的唯一具体基准——是一个 2.4 万亿参数的模型,每个 token 激活 950 亿参数,比例约为二十五分之一。DeepSeek V4 Pro 是一个 1.6 万亿参数的模型,激活 490 亿参数,比例约为三十三分之一;它将专家权重以 FP4 存储,而注意力、路由器和归一化层则保留在 FP8,这进一步压低了每个 token 的计算量。
那些不是调优差异。它们是对同一个问题的两种不同回答——前沿模型在每个 token 上应该花多少:
• 总参数量 — Qwen 3.8 旗舰版 2.4T 对比 DeepSeek V4 Pro 1.6T
• 每 token 活跃参数 — Qwen 3.8 旗舰版 95B 对比 DeepSeek V4 Pro 49B
• 激活率——大约 25 分之一对比大约 33 分之一
• 输入价格,非高峰时段 —— Qwen3.8-Max 每 100 万 $2.00,对比 DeepSeek V4 Pro 每 100 万 $0.66
• 输出价格,非高峰时段 — Qwen3.8-Max 每 100 万 $6.00,而 DeepSeek V4 Pro 每 100 万 $1.98
• 旗舰权重 —— Qwen 3.8 旗舰版采用定制 Qwen 许可证,而 DeepSeek V4 Pro 则以 MIT 许可证发布
• 上下文 — Qwen3.8-Max 100 万 tokens 对比 DeepSeek V4 Pro 100 万 tokens
• 模态 — Qwen3.8-Max 支持文本、图像和视频输入,而 DeepSeek V4 Pro 在其产品列表中仅支持文本
• 实测延迟 —— 在同一目录下,Qwen3.8-Max 的 p50 首 token 时延为 3.29 秒,而 DeepSeek V4 Pro 为 3.52 秒
这一次,稀疏性差异与价格差异指向同一个方向,而这并不是总参数量所暗示的方向。Qwen 每处理一个 token 激活的参数量约为 DeepSeek 的两倍,收费也约为后者的三倍,而仅靠稀疏性并不能弥合这一差距。弥合其余差距的是模态:Qwen 的旗舰模型搭载视觉和视频编码器,无论请求中是否包含图像,每次请求都要为它们付费,这正是其输入费率处于当前水平的原因。DeepSeek V4 Pro 接收文本并返回文本,其定价也像是一个只做这件事的模型。
DeepSeek 这一列在用于任何用途之前,需要先加上一个限定条件。DeepSeek 按高峰与非高峰时段定价:0.66 美元和 1.98 美元这两个数字是非高峰费率,而在高峰时段——工作日 UTC 01:00 至 04:00 以及 06:00 至 10:00,不包括中国法定节假日——同一模型的计费为输入 1.32 美元、输出 3.96 美元。其他所有时间,包括所有周末和节假日,均为非高峰。因此,你实际支付的费率取决于你的流量在何时运行,而仅基于非高峰数字构建的成本模型,对于任何包含工作日早间部分的工作负载来说都是错误的。

Qwen 4 Max 这一列是空的,而且这不是暂时的情况
人们很容易想当然地认为 Qwen 4 Max 会落在 Qwen 3.8 的数字附近、定价则低于它们,从而把这项对比补全。要抵制这种冲动。阿里巴巴将 Qwen 4 架构描述为新一代架构,并表示其正在训练;唯一已发布、能够描述该架构的产物是 Qwen3.8-Flash-Next,它于 2026 年 8 月下旬开源,并在其自己的模型卡上被标注为 Qwen 4 设计的预览。它是一个 1250 亿参数的主模型,带有 510 亿参数的 N-gram 嵌入,每步激活约 60 亿参数,采用 QSA 稀疏注意力、门控残差,以及 262,000 token 的原生上下文,可扩展至 100 万。
如果那个设计能扩展到 Max 档,活跃数量应保持在数百亿,而不是向 DeepSeek 的总量攀升——随着总参数增长,让每步计算大致保持平稳,正是 QSA 以及那些通过查找而非稠密计算得到的 N-gram 嵌入的全部意义所在。那是一个方向,而不是一份规格说明,不应把它当作规格说明来印出来。
现在可知的是运营层面的不对称。一个已经存在的模型可以在你的工作负载上被衡量;一个尚不存在的模型则无法在任何东西上被衡量。Qwen 4 Max 一旦发布,就可以通过厂商自己的 API 以及若干第三方平台触达——这是每一款阿里巴巴旗舰模型都走过的同一条路径。它今天不在 OrcaRouter 上:目录中 Qwen 4 系列没有任何条目。DeepSeek V4 Pro 现在已在 OrcaRouter 上,它的一个带日期的快照版本也在。
可复现性是没人提出的论点
DeepSeek 发布带日期的快照,并让它们始终可被引用。目录中同时提供浮动的 DeepSeek V4 Pro 标识符和固定的 2026-08-13 版本——该日期正是 DeepSeek 自己指定为正式可用发布的构建。这并不光鲜,但对于任何运行评估测试框架或受合规控制的流水线的人来说,它比基准分数差异更重要:当你固定快照时,你的回归测试套件衡量的是你的代码,而不是供应商的发布节奏。
Qwen 3.8 这一代也做了同样的事——在同一个目录里,那个浮动名称旁边就有一个带日期的 Qwen3.8-Max 快照——而且没有理由认为阿里巴巴会停下。但这是已发布模型的一个特性,值得直白地说:在 Qwen 4 Max 宣布的那一天,它不会有可供固定的快照,没有可用于测试的稳定标识符,也没有办法在你自己的数据上做前后对比。无论你想进行什么比较,你都只能等到以后再做。

同时运行两者,而不运行两个堆栈
OrcaRouter 将 DeepSeek V4 Pro 以 deepseek/deepseek-v4-pro 的路由提供,价格为每百万 token 输入 0.66 美元、输出 1.98 美元,这正是 DeepSeek 自家的非高峰时段目录价,以 0% 加价直接传递。最后这一点在这里比本批次的其它情况更有分量,因为对于前沿级模型而言,1.98 美元的输出价已经接近地板价:哪怕只留 10% 的平台利润,也会占到该模型与中端替代方案之间差价的五分之一;而在 0% 加价下,你在页面上看到的价格就是 DeepSeek 公布的价格——包括高峰与非高峰的划分,它按同样的时段安排原样传递,而不是被平均成一个固定费率。
同一个端点还承载着 Qwen 3.8 系列——Qwen3.8-Max、Qwen3.8-Flash 和 Qwen3.8-27B——与 DeepSeek V4 Pro 并列在同一个兼容 OpenAI 的 API 上,涵盖近 200 个模型,当某个提供商路径性能下降时自动故障转移,并提供路由 DSL,让选择变得显式可声明,而不是硬编码。如果 DeepSeek 下调费率,这一变化当天就会落到你的密钥上,因为中间没有加价层会让降价被卡住。当 Qwen 4 档位发布时,它也会出现在同一个目录里。
这让你何去何从
DeepSeek V4 Pro 在这场对比中因对手弃权而获胜,值得精确说明原因,而不是加以粉饰。它在两个维度上都便宜约三倍,每个 token 激活的参数数量是对方的五倍,上下文窗口与之持平,而且有一个可固定的带日期快照。Qwen 4 Max 只有一个层级名称和一个会议档期。
实际正在进行的对比是 DeepSeek V4 Pro 对 Qwen3.8-Max,而且这是一场真正的取舍,而非一边倒的碾压:DeepSeek 是纯文本模型,价格约为前者的三分之一,权重以 MIT 许可发布,且每 token 的激活配置更为精简;而通义的旗舰模型则以 2.00 美元和 6.00 美元的价格接受图像与视频输入。选择应基于模态和每个已完成任务的实测成本,而不是参数数量;等阿里巴巴发布模型卡时再重新做一次对比——届时真正有意思的问题是:Qwen 4 Max 对其多模态能力的定价,高出 DeepSeek 文本价格的部分是否会比现在更小。

本文中的对比4
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
