
Qwen 4 Max 在 Apsara 2026 上发布:Alibaba 确认了什么,以及未确认什么
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
杭州的云栖大会——也就是 Apsara Conference——在 2026 年 9 月 22 日被用来展示四款尚未发布的模型。该实验室的大语言模型负责人刘大一恒在台上预告了 Qwen 4 Max、Qwen 4 Flash、Qwen 4 Plus 和 Qwen 4 27B,称这一系列基于新一代架构训练,并且只表示它很快就会到来。截至本文写作时,这四款模型没有任何一款有模型卡,没有开放权重,没有 API 标识符,没有上下文窗口,没有价格,也没有基准测试成绩。如今你真正能调用的最新旗舰是 Qwen3.8-Max,自 2026 年 8 月 3 日起正式可用;而舞台上的宣布与可调用的端点之间的这段距离,正是这个故事值得仔细品读的部分。
四个层级,以及每一个的定位
阿里巴巴的 Qwen 系列自 Qwen 3 代以来一直按能力层级进行划分,而 Qwen 4 的发布延续了这一形态,而非将其取代。台上展示的是一份产品阵容名单,而不是一张规格表:
• Qwen 4 Max — 旗舰层级,也是阿里巴巴用以对标其他各家前沿实验室顶级模型的那一款
• Qwen 4 Flash — 高吞吐量层级,专为延迟敏感和高负载工作打造,而非追求峰值推理能力
• Qwen 4 Plus — 均衡的中端层级,历来是多模态支持覆盖面最广的一款
• Qwen 4 27B——开放权重的本地层级,正是那些从不接触托管 API 的人所下载、微调和量化的那一个
• 架构——被描述为新一代,并被描述为正在训练,这与已完成不是一回事
• 主要工作负载——按照会议的界定,是智能体式与工具使用型任务,而非聊天
• 可用性——无。没有任何层级有发布日期、价格、上下文窗口、模态列表或公开评分
27B 这一档值得关注,原因与基准测试毫无关系。它是该系列中唯一历来以开放权重形式发布的档位,而 Qwen 3.8 世代展示了这能解锁多少独立工作:在 27B 权重发布后的几天内,社区就产出了 MLX 转换、NVFP4 量化以及未经审查的微调版本。已宣布的 27B 意味着整个下游生态的承诺,也是这份路线图中交付最可预测的部分。
5到10万亿参数这一数字并不属于 Qwen 4
对这次会议的报道在某个数字上一直不够严谨。与 Qwen 4 的消息一同流传的“5 到 10 万亿参数”目标,并不是 Qwen 4 的规格——它是针对其之后世代、即 Qwen 4.5 和 Qwen 5 时间框架的前瞻性表述。阿里巴巴并未给 Qwen 4 Max 附加任何参数量,而就现有证据而言,把它写出来会是错误的。
这一点很重要,因为参数量是读者会锚定的数字,也是会传播开来的数字。一个没有公开架构的模型被附上 5T 参数的说法,在两个方向上都不可证伪:没有人能证实它,而一旦它被反复传播,也没有人能纠正它。如果你这周看到 Qwen 4 Max 被描述为拥有数万亿参数的模型,那这个数字是从另一张幻灯片上借来的。
老实说,可以说的是,前代旗舰是一个 2.4 万亿参数的专家混合模型,每个 token 激活 950 亿参数,这一点已在 Qwen3.8-Max 的官方模型卡以及随后发布的开放权重版本中得到确认。无论 Qwen 4 Max 最终是什么,这都是它必须超越的基线,而且这是一个已公布、可核验的数字,而不是路线图上的愿景。

这一架构并非传言:它的预览版已经发布
Qwen 4 发布消息中最有价值的一点是,其部分架构早已以另一个名字发布过。Qwen3.8-Flash-Next 于 2026 年 8 月下旬开源,其模型卡明确将其标注为 Qwen 4 架构的预览版。这使它成为阿里巴巴之外的人了解 Qwen 4 系列如何构建的唯一确凿证据。
这是一个稀疏模型,拥有 1250 亿主参数以及 510 亿 N-gram 嵌入参数,每次推理步骤激活约 60 亿参数。它原生支持 262,000 token 上下文,模型卡称可扩展至 100 万 token;阿里巴巴报告其训练成本比 Qwen3.7-Plus 低约 90%。模型卡上列出了三种技术:
• QSA,一种 Qwen 专用的稀疏注意力方案,正是廉价长上下文训练这一说法背后的机制
• 门控残差连接,一种针对深度稀疏网络的稳定性度量
N-gram 嵌入,一个独立的 510 亿参数存储,通过查表而非密集计算获得
如果 Qwen 4 的各层级继承了这一设计,那么真正有意思的后果是经济层面的,而非架构层面的。一个旨在以大约十分之一的训练成本达到接近前沿水平质量的模型家族,就是一个能够激进定价的家族;而两年来,阿里巴巴的激进定价一直是开放权重模型经济学中最可靠的一股力量。这是一个预测,而非事实,也应当被明确标注为预测——但这正是值得跟踪这条路线图、而不是将其一笔带过的理由。
等待时可以运行什么
Qwen 4 发布公告中的任何内容都不会改变本周可用的东西,对于今天就要动手构建的人来说,诚实的答案就是 Qwen 3.8 这一代。Qwen3.8-Max 自 2026 年 8 月 3 日起已正式可用,价格为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,在完整的 100 万 token 上下文范围内统一计费,没有长提示附加费;其权重已于 2026 年 8 月 12 日以 Qwen3.8-2.4T-A95B 的名义发布,提供 BF16 和 FP8 两种版本,采用自定义 Qwen 许可证。它将是衡量 Qwen 4 各档模型的基准,而且它今天就在承载生产流量。
如果你想将已发布的 Qwen 代际与前沿阵营的其他模型进行对比,而无需为每家实验室分别管理账户、密钥和账单,OrcaRouter 提供 Qwen 3.8 系列——Qwen3.8-Max、Qwen3.8-Flash 和 Qwen3.8-27B——与 Claude Opus 5、DeepSeek V4 Pro、Gemini 3.1 Pro Preview 和 GLM 5.3 一同置于同一个兼容 OpenAI 的端点上。这就是一个 API 即可使用近 200 个模型,且零加价,这意味着服务商的标价原样传递,因此厂商降价当天就会反映到你的密钥上,而不是等到下一个计费周期。当 Qwen 4 层级真正发布时,同一目录中就会出现它的身影;而目前,它们尚无一个上线。

底线
Qwen 4 Max 是一场真实的发布,却不是一个真实的产品,而这句话的两半都同样重要。名单已确认:四个层级、新一代架构、以智能体为重点,以及一个开放权重的 27B 层级——对更多人来说,它比旗舰款更重要。做出购买决策所需的一切——价格、上下文、模态、权重、评分、日期——全都缺失。
把这件事当作一个路线图信号,而且它有异常完善的文档记录,因为 Qwen3.8-Flash-Next 的发布免费给了你架构预览,Qwen3.8-Max 则给了你现有基准,并附有已发布的权重和已公布的价格。关注 27B 层级,因为它将创造的生态;关注 Flash 层级,因为它的吞吐经济性。不要把 5 到 10 万亿参数这个数字当作 Qwen 4 的事实来重新发布,也不要围绕一个没有发布日期的模型规划迁移——要围绕 Qwen3.8-Max 来规划,等有可迁移到的端点时再行动。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
