
Qwen3.8-Max 对比 Qwen3.7-Max:两款 Max 档位、16 个指数点,以及一个让价格倒挂的促销活动
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 495 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 186 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
四天前,供应商告诉我们,Qwen3.8-Max并不是它在 8 月发布的那个模型。2026 年 9 月 22 日,在杭州云栖大会发布的一份新闻稿中,该公司披露,其旗舰模型在一个多月里完成了33 轮迭代周期的全自动训练与后训练工作,并且由此产生的版本将其 Artificial Analysis 智能指数从 40 提升到 45。模型 ID 从未改变。它背后的数字却变了。
这一点在一个特定场景中最为重要:Qwen3.8-Max与Qwen3.7-Max之间的比较——也就是它所取代的那个 Max 层级。Qwen3.8-Max 于 2026年8月3日正式全面可用;Qwen3.7-Max 则发布于 5月。纸面上看,这似乎是一次轻而易举的代际更替——更新的旗舰、更高的分数,翻篇即可。但数字呈现出的情况更为尴尬。较旧的层级速度快三到四倍,每完成一项任务的成本大约只有五分之一,并且在纯知识类基准测试上与较新的层级不相上下。较新的层级支持多模态,在智能体类工作上表现大幅更优,而且在国际价目表上更便宜。你究竟该调用哪一个,取决于大多数对比都会跳过的一个问题:你买的是知识,还是工具调用。
Apsara 的披露究竟声称了什么
该披露是一份供应商声明,由阿里巴巴在其自家新闻站点发布,也应按此性质来解读。它所陈述的内容很具体:在一个多月的全自动运行中,涵盖流水线设计、数据验证、迭代实验和错误诊断,Qwen3.8-Max 完成了 33 个循环,而自主训练优化加上后训练技术带来了分数的变化。阿里巴巴还描述了第二个芯片设计实验,在该实验中,模型在一个设计生命周期内进行了超过 60 小时的自我改进,调用 EDA 工具逾 10,000 次,并产出了生产级芯片总线模块,同时将芯片面积减少 42%,且未提及性能上的损失。所有这些都只是阿里巴巴对其自家模型的陈述,公司外部无人复现。
不过,分数变化本身并非厂商的说法。该指数属于 Artificial Analysis,而 45 分就出现在这家第三方机构的 Qwen3.8 Max (0902) 页面上。它此前所在的 40 分,则出现在同一机构 8 月 3 日构建版本的页面上,该版本现已被标记为弃用,并指向当前版本。因此,这个差值是一个厂商报告的原因,附着在一个独立评分的效果之上,这比只看其中任何一半都更有说服力。而且,截至本文写作时,这也是任何人所能拿出的最具体的公开证据,表明某家前沿实验室在没有发布新版本号的情况下,改变了其旗舰产品的实测能力。
关于这次发布,还有两件事很容易被忽略,而这两件事都至关重要。首先,阿里巴巴确认Qwen 4正在训练中,Qwen 4.5 和 Qwen 5 系列预计将扩展到 5–10 万亿参数规模。其次,这个焕新后的模型有一份带日期的快照。阿里巴巴将后训练版本固定为qwen3.8-max-0902,发布日期为9月2日,并且它可以单独路由。这个固定版本,正是对 RSI 披露所暗示的一切给出的实际答案,我们稍后会再回过头来谈它。
记分牌
六个维度、两个方面,来源考证的规范保持明确,因为这两栏并未得到同等程度的核实。
• 上下文窗口 — Qwen3.8-Max 1,000,000 tokens 对比 Qwen3.7-Max 1,000,000 tokens(完全相同)
• 最大输出 — 131,072 tokens,而阿里巴巴自家模型页面标注为 131,072 tokens(两者相同;需注意,我们目录中 Qwen3.7-Max 的页面标注为 64,000,这一分歧我们如实指出,而非一笔带过)
• 输入模态——文本、图像和视频对比仅文本
• 每 100 万 tokens 的国际标价——输入 $2.00 / 输出 $6.00,对比输入 $2.50 / 输出 $7.50;同一费率卡在北京、法兰克福和弗吉尼亚已对两个模型收取 $1.65 / $4.951
• Artificial Analysis Intelligence Index — 45 对比 29
• 独立输出速度 — 39.7 tokens/秒 对比 211.3 tokens/秒,基于相同的 211 个模型对比类别测得,其中 Artificial Analysis 将较新的层级评为明显偏慢,而将较旧的层级评为明显偏快
最后两行就是全文。在同一个指数系列中,较新的档位领先 16 分。而在速度上,它却落后五倍还多。

这16个要点从何而来——以及它们并非来自何处
把 Index 拆解成各个部分,升级的形态就清晰了,而它并不是营销所暗示的那种形态。
在知识和推理方面,这两个模型实际上不相上下。GPQA Diamond:92.8 对 92.3。Humanity's Last Exam:43.1 对 40.5。长上下文召回:80.33 对 79。SciCode:52.1 对 49.5。如果你的工作负载是在大型语料库上进行问答,那么代际提升不过是一个舍入误差。为此支付数倍成本将很难说得过去。
在智能体与编程任务上,差距急剧拉开。Terminal-Bench 2.1:88.76 对 74.53。Artificial Analysis 的编程指数:76.2 对 66。而这一组中差异最大的是银行工具使用任务,其中 Qwen3.8-Max 取得47.84,而 Qwen3.7-Max 为11.75——四倍的差距,恰恰落在 RSI 描述所称自动化循环一直在优化的那项能力上:流水线设计、数据验证、迭代实验、错误诊断。一个花一个月改进自身训练循环的模型,就是一个在循环上变得更强的模型。
关于这些单项行,有一点需要坦诚说明。两个模型页面同属 Intelligence Index 的同一修订版本系列(v4.3 与 v4.3.2),因此 45 对 29 这一总体对比是公平的。但各基准测试的单项行并非同批次:Qwen3.7-Max 的任务级数据来自 5 月的评估窗口,而 Qwen3.8-Max 的数据则来自 9 月的序列。要看的是趋势方向,而不是第三位有效数字。
价格问题实际上是两个问题
在阿里巴巴的国际价目表上,较新的 Max 比它所取代的那款更便宜:$2.00 / $6.00(Qwen3.8-Max)对$2.50 / $7.50(Qwen3.7-Max),每百万 token。随着代际推进,两个方向都降价 20%,这并不寻常,本身就值得注意。缓存经济性也更有利于较新的层级——隐式缓存为 $0.25 对 $0.50,显式缓存读取为 $0.17 对 $0.25。
这是第一个问题,而它的答案因地区而异,大多数报道都把这一点抹平了。阿里对两款模型在北京、法兰克福和弗吉尼亚的收费都是$1.65 输入 / $4.951 输出。20% 的价差只存在于新加坡国际卡上。如果你的流量落在其他三个区域,如今两个 Max 档位的输入和输出 token 价格完全相同,决策就退化为纯粹的能力之争——此时较新的模型除了吞吐量之外全面胜出,也就没有什么账可算了。
第二个问题才是陷阱。Qwen3.7-Max 目前的定价并不是 $2.50 / $7.50。它实际以$1.25 / $3.75的价格提供服务——仅为标价的一半,属于促销费率。这样一来,上一代那一档反倒成了当下更便宜的选择,而且便宜得多。这也意味着,你本周能测到的价格,并不是你将要承诺的价格。阿里自家的模型页面明确写道,所公布的价目表展示的是原始定价,"不含任何限时促销",并指引你前往控制台查看当前优惠。从本质上说,促销就是一种随时可能终止的费率。一旦终止,Qwen3.7-Max 就不只是比今天更贵,而是比那个胜过它的模型还要贵 25%。
我们以0%的加价将供应商费率原样传递,因此标价和促销价在变更当天就会在我们这边生效——这便于比较,但如果你想做预算就帮不上忙。请以标价卡为基准来构建模型,并将促销费率视为上行空间。

颠覆成本论证的那个数字
Token 价格并不等于一项任务的实际成本。Artificial Analysis 发布了一项每任务成本指标,其中计入了缓存经济性、推理量和回答长度,而按这一指标衡量,排名会完全反转:Qwen3.8-Max 每完成一项 Intelligence Index 任务需 $5.41,而Qwen3.7-Max 仅需 $1.15。溢价高达 4.7 倍,相比之下,其 token 单价却因所在地区不同而便宜 20%,或完全持平。
差距主要在于输出的冗长程度。在同一项评测中,较新的模型生成了 190M 输出 token,而较旧的模型为120M,并且它会进行长篇推理才能得出答案。如果你是按输出 token 付费来处理高用量、中等难度的工作负载,那么无论按哪份费率表、以何种 token 价格计算,较新的 Max 都不是更便宜的模型。它是更贵的那个,而 token 标价并不是判断此事的正确工具。
速度,以及我们自己的流量所显示的
吞吐量差距之大,足以改变架构选择。Artificial Analysis 将 Qwen3.8-Max 列为每秒 39.7 个 token——其摘要称该模型明显偏慢——而 Qwen3.7-Max 则为 211.3,它称其明显偏快。这就是把一个模型放在交互式界面之后,还是放在队列之后的区别——而在 Qwen3.8-Max 上,它正是我们自己的统计面板最先向你展示的内容。
我们自己截至 9 月 25 日这七天的 playground 遥测数据,在延迟方面呈现的故事要稍微更微妙一些,而且有个前提:这些是我们在自身路由上的测量结果,并非受控基准测试。Qwen3.8-Max 的首响应中位数为 2,611 毫秒,速度为每秒 54.7 个 token,错误率为 2.45%;而固定使用的 0902 版本中位数为 3,360 毫秒,速度为每秒 46.2 个 token,错误率明显更干净,为 0.66%。Qwen3.7-Max 的中位数为 4,509 毫秒,但速度达到每秒 169.8 个 token,错误率为 3.80%。所以较旧的层级在开头响应更慢,随后流式输出速度快三倍,但失败也更频繁。如果你的工作负载具有突发性,那么错误率上的这一差异比中位数更值得关注。
两个层级都通过一个 OrcaRouter 密钥与固定的快照一起上线,并支持跨提供商自动故障转移。对于这样的对比而言,这才是实际意义所在:用你自己的提示词分别针对两代 Max 进行测试,只是更改配置,而不是再签一份合同。

可复现性如今是决定性因素
这就是 Apsara 披露中无人定价的那一部分。一个线上模型 ID,其测得能力在一个月内从 40 变到 45,版本没有变化,当时也没有任何公告,这本身就是可复现性隐患。如果你的产品行为取决于一个变动中的 ID,那么你拥有的模型可能会在一个冻结的评测套件、缓存的提示库或已签核的回归集之下改进——或者发生偏移。
两代都提供带日期的快照,这就是缓解措施。阿里巴巴的文档说明 Qwen3.7-Max 在功能上等同于 qwen3.7-max-2026-05-20,另有 2026-05-17 和 2026-06-08 的带日期构建版本。Qwen3.8-Max 有 qwen3.8-max-0902,即九月训练后的构建版本,也就是 45 所指的那个。如果你要发布任何需要可复现的内容,就固定带日期的 ID,把浮动 ID 当作预发布目标。RSI 周期是浮动 ID 的特性;固定版本就是你退出这些周期的方式。
有一个命名细节值得了解,以免你误读目录。阿里云列出了第三种带日期的形式,qwen3.8-max-2026-09-02,与 0902 别名并列;它们指的是同一个构建版本。最初的 8 月 3 日发布版在我们这边已不再可路由——我们提供的是 Qwen3.8-Max、其 0902 固定版本,以及 Qwen3.7-Max。
谁应该选哪个
这个决定的分歧并不在于哪种模型更好,而在于你买的是什么。
继续使用 Qwen3.7-Max如果你的工作负载是纯文本、偏重知识而非工具、且对吞吐量敏感——例如大批量分类、抽取、长上下文检索、批量摘要——那就继续用它。在 GPQA Diamond 和长上下文召回上,它与更新模型仅相差一分以内,流式输出速度快三到四倍,每任务成本为 $1.15,而后者为 $5.41。对于任何希望在融合或路由配置中获得廉价第二意见的人来说,它也是正确选择,因为按促销价计算,它完全属于另一个价格档位。但有两点需要注意:促销就是促销,而且 Artificial Analysis 已将该模型标记为弃用,被 Qwen3.8-Max 取代。不要基于它启动多年期的承诺。
迁移到 Qwen3.8-Max,如果以下任一情况属实:你需要图像或视频输入,而 Qwen3.7-Max 完全不接受此类输入;你的工作负载属于智能体类型,涉及长工具调用链或多步编码循环,此时 Terminal-Bench 2.1 上 88.76 对 74.53 以及四倍的工具使用差距,就是能否上线的关键;或者你按新加坡国际价目表计费,那么更新的模型就是便宜 20%,无需权衡取舍。请固定qwen3.8-max-0902,如果你需要行为保持稳定。
如果你身处北京、法兰克福或弗吉尼亚,这个选择比任何对比所能体现的都要清晰:两档 Max 的价格都是 $1.65 / $4.951每百万 token。一模一样。在这样的价位上,多模态输入不额外收费、Index 高出 16 分、工具使用得分好上四倍,这已经不是在做一个决定,而是白送的——而继续留在 Qwen3.7-Max 的唯一理由,就只剩下纯粹的吞吐量了。
两个值得直接回答的问题
33 个周期的训练运行是否意味着模型在现有 API 流量下发生了变化?这正是该披露所暗示的,也正是带日期固定版本存在的原因。阿里巴巴将改进后的模型描述为“更新后的 Qwen3.8-Max”,这是浮动 ID,而非新的 ID。如果你在整个 9 月的工作负载都跑在浮动 ID 上,那么为你提供服务的是一个实测能力在该窗口期内发生了变化的模型。阿里巴巴没有为中间这些构建版本发布变更日志,因此,要想确切知道你面对的是哪种行为,唯一可靠的方法就是固定版本。
RSI 的说法是否经过独立验证?它得出的分数是——该指数来自 Artificial Analysis,45 分就在他们的页面上。其背后的机制则是阿里巴巴对自己训练过程的自行描述,没有外部复现,没有公开的评估方案,也没有第三方观察这 33 个周期。要把“33 个迭代周期”当作厂商的说法,而把“40 之后是 45”当作一组实测数据。它们不是同一类陈述,而这一区别正是这个标题值得仔细阅读、而不是照搬复述的原因。
下一个值得关注的对象不是 Qwen 4,而是 Qwen3.7-Max 的半价促销能否挺过那款旨在取代它的模型登场。如果挺不过去,许多团队就会发现,他们一直在拿标价去比折扣价,而且这对“兄弟”中较老的那个,自始至终才是更贵的。
