一张生成的标题卡,标题为“Qwen 4.5 与 Qwen 5:5 至 10 万亿参数”,副标题为“一个路线图区间,而非规格说明”,另有三张卡片,分别写着“路线图目标 / 5–10T 参数”、“已发布旗舰 / Qwen3.8-Max 2.4T”和“发布日期 / 尚未公布”。页脚一行文字为“据阿里巴巴 2026 年 9 月 22 日新闻稿;未发布模型卡。”扁平矢量社论风格,白色背景,配以蓝至青色渐变晕染,OrcaRouter 标志合成于右下角。
Guides & Insights

Qwen 4.5 和 Qwen 5 目标 5 至 10 万亿参数:阿里巴巴说了什么、没说什么

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年9月22日,在杭州举行的云栖大会上,该公司为下下代模型给出了一个规模数字。Qwen 4.5Qwen 5系列“预计将扩展至 5 万亿至 10 万亿参数”——这是该公司自己英文新闻稿中的措辞——是路线图上的说法,而非规格说明。这两个模型都没有发布日期、模型卡、API 标识符、价格或已公布的基准测试成绩,这意味着如今它们中的任何一个都无法调用。你真正能买到的旗舰模型是 Qwen3.8-Max,自 2026 年 8 月 3 日起已全面可用,参数规模为 2.4 万亿。大会之后的这些天里,那句话在许多报道中被简化成了一个说法:10 万亿参数的模型即将到来——这比该公司原本的说法更强、也更简单。这两句话之间的距离,大约是整整一年的规划。

该主张,以及传播开来的那个版本

台上提到了两件事,值得分开来看,因为它们所承载的信息量截然不同。第一件是状态更新:Qwen 4 正在基于一种新架构进行训练。第二件是路线图:Qwen 4.5 和 Qwen 5 系列预计将达到 5 万亿到 10 万亿的参数区间。

阿里巴巴的英文新闻稿将这两者都归于公司,而非某位具名高管。更进一步的相关会议报道则把这一路线图归于刘大一恒——他在 Alibaba Token Hub 负责 Qwen 大语言模型项目——并报道了他所提出的框架:扩展规模是通往人工超级智能的一条关键路径。这一框架正是该参数数字被给出时所处的语境,也解释了为什么这个数字是一个区间,而非一个目标。

随后流传开来的,是该区间的上限。此后的英文报道标题中,至少有一条描述的是一个被预告的 10 万亿参数模型,另有若干条描述的则是一个 5 万亿至 10 万亿参数模型的计划。两者都是对同一张幻灯片站得住脚的解读。但两者都不是明确的规格,而对于任何需要据此做规划的人来说,这一差别至关重要。

5万亿是一代人的目标,而10万亿是另一代人的目标。

关于这份公告,最值得弄对的一点是:5 到 10 万亿是一个横跨两代的区间,而不是一个容差很宽的单一模型。阿里巴巴自己的那句话把这个区间与“即将推出的 Qwen 4.5 和 Qwen 5 模型系列”绑定在一起——是系列,复数,合在一起看。

来自同一场会议的中文报道再次在另一个方向上措辞精确,其标题将 Qwen 4.5 之后的模型描述为扩展到 5 万亿至 10 万亿区间。按照这种解读,10 万亿那一端同样超出了 Qwen 4.5。所有来源都一致认同的一点是,这个区间覆盖 Qwen 4.5 到 Qwen 5 的范围。将 10 万亿具体归给 Qwen 5,是一种后来变成标题的推断,而非引述。

为了有个概念,而且这些是本报道中唯一已公布而非预测的数字:

• 5 到 10 万亿 —— 阿里巴巴新闻稿为 Qwen 4.5 和 Qwen 5 系列标注的参数区间

• 2.4万亿——Qwen3.8-Max(已发布旗舰型号)的总参数量,依据其官方模型卡

• 950亿 — Qwen3.8-Max 每 token 的活跃参数,这一数字决定了服务一个 token 的成本

• 10万亿——该区间的上限,也是其中唯一登上大多数英文头条的部分

• 0 —— Qwen 4.5 或 Qwen 5 已发布的规格、发布日期、价格、上下文窗口或基准测试分数的数量

A generated scoreboard titled 'Shipped vs projected - the scoreboard'. Left column 'Qwen3.8-Max (shipping)' reads GA August 3, 2026; 2.4 trillion total parameters; 95 billion active parameters; 1,000,000-token context window; $2.00 in / $6.00 out; benchmarks vendor table plus AA Index 45. Right column 'Qwen 4.5 / Qwen 5 (roadmap)' reads release none given; 5 to 10 trillion series; active parameters not published; context window not published; price not published; benchmarks none published. Footer reads 'Qwen3.8-Max specs per its model card; AA Index per Artificial Analysis; Qwen 4.5 and Qwen 5 per Alibaba's September 22, 2026 roadmap.'

真正重要的参数数值,是无人公布的那个。

总参数量是实验室选择对外宣称的数字。激活参数量才是买家真正需要的数字,而路线图上偏偏没有这一项。

Qwen3.8-Max 是一个混合专家模型,总参数量达 2.4 万亿,每个 token 激活 950 亿。这大约是 4% 的激活比例:模型把大量知识存放在权重里,而在处理任何一个给定 token 时都不会读取这些权重,只为其中一小部分付出算力。总参数量告诉你这东西占多少内存、你需要多大的机器。激活参数量告诉你它每回答一次,你要付出多少。

把这个比例继续往前推,问题的轮廓就变得清晰可见了。一个以同样 4% 激活比例构建的 10 万亿参数模型,每个 token 大约会激活 4000 亿参数——是 Qwen3.8-Max 当前激活量的四倍多。这是基于一个明确假设所做的算术,而不是关于 Qwen 5 的论断:提高稀疏度,激活量就下降;降低稀疏度,激活量就上升。但正是这笔算术决定了一个 10 万亿参数模型是会投入服务的产品,还是研究产物;也正是“5 万亿到 10 万亿”这个标题所引出、随后却被搁置未做的计算。

这也正是路由经济性不再停留于抽象概念的地方。在 OrcaRouter 上,供应商的标价以0% 加价原样传递,因此 Qwen 某一档位的厂商降价当天就会在你的密钥上生效,而不必等到续约之时。对于服务成本确实难以确定的一代模型而言,这种原样传递的价值恰恰高于针对一个无人公布过的数字事先谈定的折扣。

芯片发布才是实际的时间线

阿里巴巴在同一份新闻稿中公布了模型路线图和一款新加速器,而二者的关联比新闻稿中所述的更为紧密。

T-Head 的 Zhenwu V900 是一款训练与推理处理器,拥有 216 GB 内存和 1,200 GB/s 的芯片间带宽,原生支持 FP8 和 FP4,并宣称性能达到其前代产品 Zhenwu M890 的三倍,后者于 5 月发布。量产和商用发布计划于 2027 年第一季度进行。配套的超级节点服务器支持多达 500,000 张卡的集群,T-Head 表示 Zhenwu 系列已服务超过 650 家客户。

把这两份公告放在一起读,事情的先后脉络就清晰了。在10万亿规模上训练和提供混合专家模型的服务,首先是一个互连问题,其次才是算力问题,因为专家并行意味着要在芯片之间不断移动激活值,而1,200 GB/s的芯片间带宽,正是决定这件事是否可行的关键数字。按照这样的时间表,芯片要到2027年后期,才可能为这类前沿规模的运行提供最早的合理窗口——而且即便到了那时,芯片出货也完全不能说明一次训练运行能够完成。Alibaba把这两个主题放进同一份发布里,从而将它们联系起来;这种联系本身是我们的解读,并且已标明为解读。

公司自身的时间跨度与此一致。首席执行官吴泳铭设定了到2032年全球阿里云数据中心容量超过20吉瓦的目标——这是容量目标,而非已部署容量,且是五年以上的时间跨度,而非下一季度的跨度。

支撑路线图的自我提升主张

一个5万亿到10万亿的计划之所以还能说是有讨论余地,而不只是昂贵而已,原因在于递归式自我改进:如果训练管线能自我改进,每一代所需的算力就会下降,前沿也就更接近可负担的水平。这是该路线图赖以成立的关键论断,也是阿里巴巴所说内容中最难验证的一点。

公司报告称:Qwen3.8-Max 在约一个月的全自动化工作中完成了 33 轮迭代循环,涵盖流水线设计、数据验证和错误诊断,并将其 Artificial Analysis 分数从 40 提升至 45。在一项芯片设计实验中,该模型在一个设计生命周期内投入了超过 60 小时的自我改进,进行了超过 10,000 次电子设计自动化工具调用,并在没有性能损失的情况下将芯片面积减少了 42%。会议中的一份报告还提到,通过自主调优一款新的 T-Head GPU,推理吞吐量提升了 96%。

这些是厂商报告的结果,尚未被独立复现。这不是什么细枝末节——一个给自己的实验打分的自主循环,是在拿自己的评分器来衡量自己,而外界无从核查其评分标准。对本次会议的报道普遍指出了这一点,读者应当假定如此。

同一个说法里还有第二个陷阱,这次关乎标签,而非诚实与否。阿里巴巴没有说明其40到45的增幅是相对于人工智能分析指数(Artificial Analysis Intelligence Index)的哪个修订版本衡量的,而该指数自这款模型发布以来已经过重建。目前 Artificial Analysis 页面上 Qwen3.8 Max(0902)的读数为45——这是一个独立数字,基于当今生效的修订版本。同一模型在八月中旬、按当时生效的修订版本所记录的读数为56。45和56不是同一单位下的同一测量值,用其中一个减去另一个,得出的数字毫无意义。而页面上没有的是阿里巴巴所称其改进起点的那40:该增量的起点来自公司自身,只有终点恰好落在独立读数当前所在之处。请把这个变动理解为一种方向,而不是一个测量值。

A screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured September 23 2026, showing an Artificial Analysis Intelligence Index of 45 (ranked 24 of 212, badge 'Updated'), speed of 39.2 output tokens per second (159 of 212), $2.00 per 1M input and $6.00 per 1M output tokens with an 88% cache discount and $5.41 cost per Intelligence Index task (90 of 212), verbosity of 190M output tokens (88 of 212), and a technical specification listing a 984k context window with reasoning enabled.

阿里巴巴在同一场大会上究竟发布了什么

剔除路线图后,这场发布会仍然包含真正的发布内容,而且全都是多模态的:

• Qwen3.8-LiveTranslate — 同声传译,延迟(LAAL)缩短近 20%,从 2.8 秒降至 2.3 秒

• Qwen-Audio-3.1-ASR、Qwen-Audio-3.1-TTS 和 Qwen-Audio-3.1-Realtime —— 焕然一新的语音套件

• Qwen-Audio-3.1-TTS-Next — 电影级音景,可将文本剧本中的对话与氛围融合在一起,面向有声书、影视、播客和游戏

• Qwen-Image 3.1 —— 面向创意设计与电商营销调优的图像生成,预计今年晚些时候推出,原生支持透明背景生成

• Qwen Intelligence — 面向智能手机制造商的全栈智能体平台

那份清单上的每一项,都是带有交付窗口的产品。前沿规模的说法,是议程上唯一没有附带日期的项目,而这种反差并非偶然:推出多模态层级,正是为一整年路线图提供资金的东西;而路线图,则让下一轮融资或下一份云合同成为一个故事,而不是一张电子表格。两件事都是真实的。只有其中一件是你能称之为产品的东西。

如今什么是可调用的,而要让这一点发生变化,又必须改变什么

Qwen 3.8 这一代仍是整个可购买产品线的全部。Qwen3.8-Max 自 2026 年 8 月 3 日起正式开放使用,价格为每百万输入 token 2.00 美元、每百万输出 6.00 美元,在完整的 1,000,000 token 上下文范围内统一计费,不收取长提示词附加费。其权重已于 2026 年 8 月 12 日以 Qwen3.8-2.4T-A95B 的名义发布,提供 BF16 和 FP8 版本,采用自定义的 Qwen 许可协议。其厂商基准测试表成绩亮眼但未经审计——Terminal-Bench 2.1 为 86.6,GPQA Diamond 为 92.6,OSWorld-Verified 为 86.1,全部为阿里巴巴自家数据——而独立视角的画面则不如厂商版本那么光鲜:Artificial Analysis 将 Qwen3.8 Max(0902)的 Intelligence Index 评为 45,在 212 个模型中位列第 24,每个 Intelligence Index 任务的实测成本为 5.41 美元,输出速度为每秒 39.2 个 token——在 212 个模型中排第 159,接近该领域的慢速末端。同一页面列出的上下文窗口为 984k,而我们自己模型页面上写的是 1,000,000,在安排长上下文任务规模之前,这一差距值得了解。前沿级的分数,中游的速度:这就是对当前出货旗舰的诚实总结,也是任何 Qwen 4.5 都必须在两个维度上同时超越的基准线。

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), captured September 23 2026, showing the model id, 1M-token context, text image and video input with text output, vision tools JSON and reasoning badges, a dated snapshot label of 2026-08-03, input at $2.00 and output at $6.00 per 1M tokens, p50 TTFT 3.09s and p95 TTFT 10.00s, trailing-7-day traffic of 29.4M tokens, and a Python code sample posting to the OpenAI-compatible base_url https://api.orcarouter.ai/v1.

OrcaRouter 搭载 Qwen 3.8 系列——qwen/qwen3.8-max、qwen3.8-flash 和 qwen3.8-27b——置于一个 OpenAI 兼容端点上,与200 多个其他模型并列,这意味着 Qwen 4.5 层级将是在现有密钥上更改模型 ID,而不是签订新的供应商合同、产生新账单和接入新 SDK。当它发布时,该目录就是它会现身的地方。如今,Qwen 4.5 和 Qwen 5 都不在其中,因为两者都尚未发布——再多的路线图宣传也改变不了这一点。

像这样一份路线图的实用之处,恰恰与迁移计划相反。如果某天 Qwen 4.5 这一档在你的工作负载上看起来变得可行,那么验证它最省钱的办法,是在自动回退机制背后把一小部分真实流量导给它;这样一来,即便这个模型最终被证明速度慢、成本高,或者还不如现有方案,你的代价也只是某个工作负载的一小部分,而不是四分之一。故障转移正是为此而生,而一个未经验证、才问世几天的前沿模型,就是使用它最明确的理由。

该关注什么,以及暂时还不该相信什么

当一组少量具体要素出现时,路线图上的一个条目就变成了正式发布。一张模型卡,包含总参数量、激活参数量和上下文窗口。一个可以在请求中传入的 API 标识符。模型中心上的权重。独立排行榜上带有日期的一个条目。一个价格。其中任何一项都是信号;其中大多数同时出现,就是一次发布。

有些东西算不上发布,无论它们看起来多么技术化:一场会议提及;一个服务框架的拉取请求,为某个实验性 Qwen 构建添加了架构分支——这是别人推理栈上的引擎工作,而不是一个你能调用的模型;一个已经发布的代际的带日期快照 ID;以及一条转述某场台上发言的社交帖子。促成这篇文章的信号是其中最后一项,而它值得写出来的原因在于,其背后的说法可以对照 Alibaba 自己的新闻稿来核实——5 到 10 万亿区间、Qwen 4 状态和 RSI 数字都出自那里。信号指向了这条报道;它不是报道本身。

近期的问题比头条标题所暗示的要更具体。阿里巴巴已表示 Qwen 4 正在训练中,这使得 Qwen 4 在序列中排在 4.5 和 5 之前——因此下一个值得关注的并不是一个 10 万亿参数的模型,而是 Qwen 4 是否会连同模型卡、价格和端点一起发布,以及何时发布。在这条链上的任何一环落地之前,对于 5 万亿至 10 万亿参数区间,诚实的立场是:它是一个行进方向,已在公开记录中披露,但未附带任何规格说明,也没有时间表。为 Qwen3.8-Max 做规划,把 4.5 和 5 这一区间当作一种规模化论点而非产品来观察,并且把你在一个没有模型卡的模型上看到的每一个参数数量都视为预测。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新