一张"Qwen 4 Max 对比 DeepSeek V4 Pro"的英雄标题卡,副标题为"950 亿活跃参数对 490 亿",三个胶囊徽章分别写着"2.00 美元和 6.00 美元"、"0.66 美元和 1.98 美元"以及"二十五分之一 对 三十三分之一",页脚一行写着"阿里巴巴于 2026 年 9 月 22 日发布;DeepSeek 于 2026 年 4 月 24 日上市",右下角是 OrcaRouter 标志。
Engineering & Research

Qwen 4 Max 对比 DeepSeek V4 Pro:950 亿激活参数对 490 亿

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

在2026年9月22日的云栖大会上,Qwen 4 Max的发布只给业界留下了一个名称和一套层级划分,除此之外什么都没有——没有权重、没有价格、没有上下文窗口、没有日期。DeepSeek V4 Pro自2026年4月24日起就已被列出,为一个1.6万亿参数的混合专家模型,每个token激活490亿参数,具备100万token上下文,非高峰价格为每百万输入token 0.66美元、每百万输出token 1.98美元。真正值得并排比较的数字不是总参数量,而是激活参数量:最近发布的Qwen3.8-Max每个token激活950亿参数,约为DeepSeek V4 Pro所运行的490亿激活参数的两倍,而仅凭这一个数字,在参考任何基准测试之前,就能解释两家实验室之间三倍价格差距的大部分原因。

稀疏性上的两种不同押注

两家实验室都在构建稀疏混合专家模型。但对于究竟该有多稀疏,双方存在尖锐分歧。Qwen3.8-Max——当前在售的 Qwen 旗舰模型,也是判断 Qwen 4 Max 将是什么样子的唯一具体基准——是一个 2.4 万亿参数的模型,每个 token 激活 950 亿参数,比例约为二十五分之一。DeepSeek V4 Pro 是一个 1.6 万亿参数的模型,激活 490 亿参数,比例约为三十三分之一;它将专家权重以 FP4 存储,而注意力、路由器和归一化层则保留在 FP8,这进一步压低了每个 token 的计算量。

那些不是调优差异。它们是对同一个问题的两种不同回答——前沿模型在每个 token 上应该花多少:

• 总参数量 — Qwen 3.8 旗舰版 2.4T 对比 DeepSeek V4 Pro 1.6T

• 每 token 活跃参数 — Qwen 3.8 旗舰版 95B 对比 DeepSeek V4 Pro 49B

• 激活率——大约 25 分之一对比大约 33 分之一

• 输入价格,非高峰时段 —— Qwen3.8-Max 每 100 万 $2.00,对比 DeepSeek V4 Pro 每 100 万 $0.66

• 输出价格,非高峰时段 — Qwen3.8-Max 每 100 万 $6.00,而 DeepSeek V4 Pro 每 100 万 $1.98

• 旗舰权重 —— Qwen 3.8 旗舰版采用定制 Qwen 许可证,而 DeepSeek V4 Pro 则以 MIT 许可证发布

• 上下文 — Qwen3.8-Max 100 万 tokens 对比 DeepSeek V4 Pro 100 万 tokens

• 模态 — Qwen3.8-Max 支持文本、图像和视频输入,而 DeepSeek V4 Pro 在其产品列表中仅支持文本

• 实测延迟 —— 在同一目录下,Qwen3.8-Max 的 p50 首 token 时延为 3.29 秒,而 DeepSeek V4 Pro 为 3.52 秒

这一次,稀疏性差异与价格差异指向同一个方向,而这并不是总参数量所暗示的方向。Qwen 每处理一个 token 激活的参数量约为 DeepSeek 的两倍,收费也约为后者的三倍,而仅靠稀疏性并不能弥合这一差距。弥合其余差距的是模态:Qwen 的旗舰模型搭载视觉和视频编码器,无论请求中是否包含图像,每次请求都要为它们付费,这正是其输入费率处于当前水平的原因。DeepSeek V4 Pro 接收文本并返回文本,其定价也像是一个只做这件事的模型。

DeepSeek 这一列在用于任何用途之前,需要先加上一个限定条件。DeepSeek 按高峰与非高峰时段定价:0.66 美元和 1.98 美元这两个数字是非高峰费率,而在高峰时段——工作日 UTC 01:00 至 04:00 以及 06:00 至 10:00,不包括中国法定节假日——同一模型的计费为输入 1.32 美元、输出 3.96 美元。其他所有时间,包括所有周末和节假日,均为非高峰。因此,你实际支付的费率取决于你的流量在何时运行,而仅基于非高峰数字构建的成本模型,对于任何包含工作日早间部分的工作负载来说都是错误的。

A two-column scoreboard titled "Qwen 4 Max vs DeepSeek V4 Pro - the scoreboard". Left column Qwen 4 Max: Total parameters 2.4T, Active per token 95B, Input price off-peak $2.00 per 1M tokens, Output price off-peak $6.00 per 1M tokens, Context window 1M tokens, Modality text, image, video in. Right column DeepSeek V4 Pro: Total parameters 1.6T, Active per token 49B, Input price off-peak $0.66 per 1M tokens, Output price off-peak $1.98 per 1M tokens, Context window 1M tokens, Modality text-only. Footer reading "DeepSeek V4 Pro figures from its catalogue listing; Qwen figures from the Qwen3.8-Max model card, September 22 2026.", with the OrcaRouter logo bottom-right.

Qwen 4 Max 这一列是空的,而且这不是暂时的情况

人们很容易想当然地认为 Qwen 4 Max 会落在 Qwen 3.8 的数字附近、定价则低于它们,从而把这项对比补全。要抵制这种冲动。阿里巴巴将 Qwen 4 架构描述为新一代架构,并表示其正在训练;唯一已发布、能够描述该架构的产物是 Qwen3.8-Flash-Next,它于 2026 年 8 月下旬开源,并在其自己的模型卡上被标注为 Qwen 4 设计的预览。它是一个 1250 亿参数的主模型,带有 510 亿参数的 N-gram 嵌入,每步激活约 60 亿参数,采用 QSA 稀疏注意力、门控残差,以及 262,000 token 的原生上下文,可扩展至 100 万。

如果那个设计能扩展到 Max 档,活跃数量应保持在数百亿,而不是向 DeepSeek 的总量攀升——随着总参数增长,让每步计算大致保持平稳,正是 QSA 以及那些通过查找而非稠密计算得到的 N-gram 嵌入的全部意义所在。那是一个方向,而不是一份规格说明,不应把它当作规格说明来印出来。

现在可知的是运营层面的不对称。一个已经存在的模型可以在你的工作负载上被衡量;一个尚不存在的模型则无法在任何东西上被衡量。Qwen 4 Max 一旦发布,就可以通过厂商自己的 API 以及若干第三方平台触达——这是每一款阿里巴巴旗舰模型都走过的同一条路径。它今天不在 OrcaRouter 上:目录中 Qwen 4 系列没有任何条目。DeepSeek V4 Pro 现在已在 OrcaRouter 上,它的一个带日期的快照版本也在。

可复现性是没人提出的论点

DeepSeek 发布带日期的快照,并让它们始终可被引用。目录中同时提供浮动的 DeepSeek V4 Pro 标识符和固定的 2026-08-13 版本——该日期正是 DeepSeek 自己指定为正式可用发布的构建。这并不光鲜,但对于任何运行评估测试框架或受合规控制的流水线的人来说,它比基准分数差异更重要:当你固定快照时,你的回归测试套件衡量的是你的代码,而不是供应商的发布节奏。

Qwen 3.8 这一代也做了同样的事——在同一个目录里,那个浮动名称旁边就有一个带日期的 Qwen3.8-Max 快照——而且没有理由认为阿里巴巴会停下。但这是已发布模型的一个特性,值得直白地说:在 Qwen 4 Max 宣布的那一天,它不会有可供固定的快照,没有可用于测试的稳定标识符,也没有办法在你自己的数据上做前后对比。无论你想进行什么比较,你都只能等到以后再做。

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro, English UI), showing the FLAGSHIP badge, the 1M token context badge, the model ID deepseek/deepseek-v4-pro, a 384K maximum output, text input, the Tools, JSON and Reasoning tags, the listing date 2026-04-24 credited to DeepSeek, a p50 time-to-first-token of 3.52s, the OpenAI-compatible code samples against api.orcarouter.ai/v1, and the opening of the model description describing a 1.6T total / 49B active flagship MoE with 1M context and top-tier reasoning and agentic tool use.

同时运行两者,而不运行两个堆栈

OrcaRouter 将 DeepSeek V4 Pro 以 deepseek/deepseek-v4-pro 的路由提供,价格为每百万 token 输入 0.66 美元、输出 1.98 美元,这正是 DeepSeek 自家的非高峰时段目录价,以 0% 加价直接传递。最后这一点在这里比本批次的其它情况更有分量,因为对于前沿级模型而言,1.98 美元的输出价已经接近地板价:哪怕只留 10% 的平台利润,也会占到该模型与中端替代方案之间差价的五分之一;而在 0% 加价下,你在页面上看到的价格就是 DeepSeek 公布的价格——包括高峰与非高峰的划分,它按同样的时段安排原样传递,而不是被平均成一个固定费率。

同一个端点还承载着 Qwen 3.8 系列——Qwen3.8-Max、Qwen3.8-FlashQwen3.8-27B——与 DeepSeek V4 Pro 并列在同一个兼容 OpenAI 的 API 上,涵盖近 200 个模型,当某个提供商路径性能下降时自动故障转移,并提供路由 DSL,让选择变得显式可声明,而不是硬编码。如果 DeepSeek 下调费率,这一变化当天就会落到你的密钥上,因为中间没有加价层会让降价被卡住。当 Qwen 4 档位发布时,它也会出现在同一个目录里。

这让你何去何从

DeepSeek V4 Pro 在这场对比中因对手弃权而获胜,值得精确说明原因,而不是加以粉饰。它在两个维度上都便宜约三倍,每个 token 激活的参数数量是对方的五倍,上下文窗口与之持平,而且有一个可固定的带日期快照。Qwen 4 Max 只有一个层级名称和一个会议档期。

实际正在进行的对比是 DeepSeek V4 Pro 对 Qwen3.8-Max,而且这是一场真正的取舍,而非一边倒的碾压:DeepSeek 是纯文本模型,价格约为前者的三分之一,权重以 MIT 许可发布,且每 token 的激活配置更为精简;而通义的旗舰模型则以 2.00 美元和 6.00 美元的价格接受图像与视频输入。选择应基于模态和每个已完成任务的实测成本,而不是参数数量;等阿里巴巴发布模型卡时再重新做一次对比——届时真正有意思的问题是:Qwen 4 Max 对其多模态能力的定价,高出 DeepSeek 文本价格的部分是否会比现在更小。

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the 1M token context badge, the model ID qwen/qwen3.8-max, text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, and the model description naming Qwen3.8-Max Alibaba's newest flagship and highest-capability tier to date.

本文中的对比4

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新