Qwen3.8 Max Prime 的主视觉标题卡,这是阿里巴巴为 Qwen3.8-Max 旗舰模型提供的 1.5-2 倍吞吐量服务层级,规格标签显示同为 2.4T 总参数与约 95B 激活参数,Prime 为 $3.301/$9.902,标准版为 $1.65/$4.951。
Guides & Insights

Qwen3.8 Max Prime:Alibaba在其旗舰旁添了一张二流价目表

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年9月22日,在杭州云栖大会上,阿里巴巴的MaaS业务线宣布了一项它称为Prime mode——优速模式——的服务层级,并在其价目表上为此新增了一个模型ID:qwen3.8-max-prime。该ID并不是一个新模型。它是Qwen3.8-Max,这个2.4万亿参数的稀疏混合专家旗舰模型于2026年8月3日正式可用,只是通过一条更快的通道交付。Qwen3.8 Max Prime与基础模型拥有相同的权重、相同的上下文窗口、相同的工具链,以及相同的用量限额。不同之处在于吞吐量和价格,而价格大约翻了一倍。

这是七周之内,Alibaba 第二次在不改变 Qwen3.8-Max 本身的前提下,改变它的售卖方式。9 月 2 日,该公司上线了一个经后训练的刷新版本,代号 Qwen3.8-Max-0902,聚焦编码与智能体任务,仅提供 API。9 月 22 日又新增了速度档位。两者都不是正式发布,把其中任何一个当成发布,都会让你付出真金白银的代价。

Scoreboard infographic for Qwen3.8 Max Prime: underlying model Qwen3.8-Max GA August 3 2026, 2.4T total and ~95B active parameters, throughput 1.5-2x standard, Prime price $3.301/$9.902, standard price $1.65/$4.951, no independent Prime score yet.

Prime 模式究竟是什么

阿里巴巴自家的文档将 Prime 模式描述为面向“对输出速度敏感的场景”的通道——AI 编程助手、多步智能体推理、实时对话——并直白地说明了其好处:TPS 提升至标准 API 的 1.5 到 2 倍。无需设置任何新参数。只需把 model 的值切换为 Prime ID,你就驶上了快车道。

文档同样明确说明了哪些内容不会改变:“模型支持的能力和使用限制与原始模型相同。”因此,不存在更大的上下文窗口,没有更好的推理模式,也没有额外的工具接口。它仍是同一套服务栈,只是背后有了更多余量。

The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.

费率表,请仔细阅读。

Alibaba 的国际定价页面将这两个 ID 并排列出,这让对比显得格外清晰。每百万 token:

• 输入 — qwen3.8-max-prime $3.301 对比 qwen3.8-max $1.65

• 输出 — qwen3.8-max-prime $9.902 对比 qwen3.8-max $4.951

• 缓存命中 — qwen3.8-max-prime $0.413,对比同一页面上作为折扣行标注的标准 ID 的缓存读取费率

• 比率 — 输入和输出均为 2.0×,不是四舍五入的近似值,而是公布数字的字面算术结果

在中国价格表上,同样的 2 倍关系以人民币计算依然成立:Prime ID 每百万输入 ¥24、输出 ¥72,而标准版为 ¥12 和 ¥36,缓存命中为 ¥3。

Qwen3.8-Max 被广泛引用的发布价格为每百万 tokens 输入 2 美元、输出 6 美元。这是八月相关报道所采用的标题数字,但它并不是如今国际价目表上的价格。如果你要估算支出,请以你所在地区的价目表为准,而不是发布时的标题数字,并且在正式承诺前再核对一次——自 9 月 2 日以来,Aliba​ba 已两次修改该页面。

Screenshot of Alibaba Cloud's international Model Studio pricing page listing the qwen3.8-max-prime and qwen3.8-max model IDs side by side, with Prime at $3.301 per million input tokens and $9.902 per million output tokens against $1.65 and $4.951 for the standard ID.

限流规则才是真正的功能所在

大多数人一扫而过的那句话,恰恰是对生产环境最为关键的一句。阿里巴巴的 Prime 文档指出,当你的用量达到速率限制时,如果平台仍有空闲资源,就不会对你限流,因此你实际可用的吞吐量不会低于标称的限制。

这是一个软上限、硬下限,与标准层级限制的形状不同。这意味着 1.5–2× 这个数字是对下限的承诺,而不是对上限的限制:在资源争用时你能得到该限制,而在容量空闲时你可以得到更多。对于一个会发出数十次顺序调用的智能体循环,这种不对称性比原始 TPS 倍数更有价值,因为决定你的工作流能否完成的,正是最慢调用的尾部延迟。

标准模型的动态 TPM 限额按每月的 Model Studio 消费额分档——同一套文档中显示,基础 qwen3.8-max ID 在各档位下分别为 5,000,000、10,000,000 和 20,000,000 TPM,每月刷新。Prime 并未取消这一结构,只是改变了它实际产生影响的方式。

Screenshot of the Artificial Analysis model page for Qwen3.8-Max on the 0902 build, showing an Intelligence Index of 45 and a measured cost per task of $5.41 on the standard ID.

还没有人测量过的

这就是诚实的差距所在。1.5–2× 这个数字是厂商声称的。我们找不到任何可查的、独立的 Prime 模式吞吐量实测数据,而这一点很重要,因为标准构建版本自身的独立数据在速度方面并不好看。

Artificial Analysis 使用其自有的测试框架对模型进行评估,目前在 0902 版本上给 Qwen3.8-Max 打出的 Intelligence Index 为 45,其中 GPQA Diamond 为 92.8%,Terminal-Bench Hard 为 38.9%,Humanity's Last Exam 为 43.1%——并测算其每任务成本为 5.41 美元。这些是在标准 SKU 上取得的独立数据,采集于 2026-09-24。它们也提醒人们,该指数自 8 月发布报道以来已经过修订,因此不要把旧的指数值与当前的指数值并列,还称之为趋势。

AA 所没有的是 Prime 这一行。在有人实际测量之前,速度声明只属于阿里巴巴,正确的做法是在你自己的负载上测试它,而不是假定它就是该系列中的顶配。

这让路由决策处于何种境地

Prime 是 Aliba​ba 在其自有 API 上销售的一个档位,也是获取它的唯一渠道。我们这里不托管 qwen3.8-max-prime。OrcaRouter 实际路由的是标准版 Qwen3.8-Max及其按日期固定的版本 Qwen3.8-Max-0902,两者都与 Qwen3.8 系列其他成员使用相同的密钥——Qwen3.8、Qwen3.8-Flash、Qwen3.8-27B——以及 200 多个其他模型,供应商标价以 0% 加价原样透传。最后这一点正是为什么 9 月 2 日的更新以及未来任何 Max 费率变动,都会在它们登陆 Aliba​ba 的同一天在我们这边生效。

实际的拆分方式是这样的。让默认流量通过路由器走标准 ID,这样当单一提供商路径性能下降时,故障转移能为你兜底。把那些实际延迟本身就是产品的特定调用——交互式补全、紧凑的智能体步骤——迁移到 Prime,并按 2 倍而非 1.5 倍来衡量这一决策的成本。

谁应该切换,谁应该等待

如果用户正在等着 token 返回,那就切换:自动补全、一轮对话、有人盯着屏幕的代码编辑循环。在速度区间的顶端,Prime 按每消除一秒延迟计算是成本中性的——你付出恰好两倍的代价,换来恰好一半的时间。在区间的底端,你付出 2× 的代价只换来 1.5× 的速度,也就是每省下一秒要多付 33% 的溢价。如果你的工作负载是跑一整夜的批处理任务,这份溢价买不到任何你真正需要的东西。

等等,如果你的成本模型是建立在 $2/$6 的首发主打价格之上,或者你的请求以输入为主,那就要当心。厂商宣称的速度指的是 TPS——每秒输出 token 数——而 prefill 属于另一个流水线阶段。长上下文请求无论输出是否更快返回,都要为输入 token 付双倍费用。在迁移之前,先测量这种情况。

查一下你价目表上的日期。Qwen3.8-Max 自 8 月 3 日起就已上市,被更新过一次,也被重新包装过一次,而它现在仍然只有七周大。真正的新闻是这一档位;模型本身不是。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新