
Step 5 Preview 对比 Qwen 3.8 Max Prime:一个指数点,四美元三十八美分
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百万 tokens
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
从搜索框不会告诉你的事说起。Qwen 3.8 Max Prime并不是一个模型。它是一条服务通道——同一个Qwen3.8-Max权重,厂商已于 2026 年 8 月 3 日将其推进至正式可用状态,却以第二个模型 ID 出售,价格恰好是国际价目表的两倍。Step 5 Preview,StepFun 的闭源旗舰,于 2026 年 9 月 20 日开放 API,它才是通常意义上的模型:一个端点、一个价格、一套你无法握在手里的权重。所以这场对决的诚实版本,是用一个经过实测的模型去对一个未经实测的层级,而由此算出的结果比任何一家厂商愿意放上幻灯片都要直白。在独立的 Artificial Analysis Intelligence Index 上,两者仅相差一分,44 对 45;而在完成一项任务所需的成本上,二者相差 1.03 美元对 5.41 美元。一分,四美元三十八美分,每项任务——而这还没算上你为 Prime 实际收费的那些速度所付出的钱。
接下来就是对那个数字的拆解:它从何而来,为什么在 Prime 把任何东西翻倍之前,标准 Qwen ID 就已经是比较中更贵的那一半,以及每项任务额外的那四美元买到了什么、没买到什么。
这个名字在做产品本身并没有做的事。
阿里巴巴于 2026 年 9 月 22 日在云栖大会上发布了 Prime——优速模式,即快速模式——并将其作为一行列入了 Model Studio 的价目表。阿里巴巴自己的文档对变化之处毫不含糊:输出速度提升至标准 API 的 1.5 到 2 倍,并且用厂商的话说,其能力与使用限制与原模型完全一致。没有新增参数量,没有新的端点契约,也没有标准 ID 所不具备的任何能力。你只需在请求体中更改模型名称,就能驶上快车道。

这让这个搜索词变成了一个陷阱。想找比 Qwen3.8-Max 更新的 Qwen 旗舰模型的人,会搜到“Prime”,并把它当成版本号来读。那其实是一个价格。这个名字在能力方面所暗示的一切,都是由 Qwen3.8-Max 自身提供的:一个拥有 2.4 万亿参数的稀疏混合专家模型,每个 token 大约激活 950 亿参数,每层 512 个专家,并且在独立委员会测试的配置上具有 983,616 个 token 的上下文。
Step 5 Preview 没有类似的歧义,而且它面临的是相反的问题。StepFun 列出其总参数量约为 6000 亿,激活参数为 270 亿,支持文本、图像和视频输入,上下文窗口为 100 万 token,有文档记载的输出上限为 64,000 token,推理力度可选低、中或高。它是专有模型。一个 BF16 检查点曾被承诺于 2026 年 10 月 15 日发布,但至今仍未发布;自 API 开放之日起,BF16 版本的社区镜像便在 Hugging Face 上流传,但重新上传并不等于正式发布,StepFun 也未发布任何开放权重公告。
所以,在哪怕一项基准测试落地之前,这一对就已经明显失衡了:一边是一个预览版模型,未来或许会开放下载;另一边则是某个不会开放下载的模型,其服务层级被重新定价。
一个指数点值多少钱
两个模型都已由同一位独立评估者运行,而正是在这一点上,对比开始让"每 token 更便宜"的说法变得令人不适。2026 年 10 月 10 日继续阅读:
• Index — Step 5 Preview 44,远高于同类模型中位数 26。Qwen3.8-Max 在 0902 版本上为 45。仅一分之差。
• 每完成一项索引任务的成本——1.03 美元对 5.41 美元。优势超过五倍。
• 输出价格——每百万 token 为 $2.70,而在标准 ID 上为 $6.00,一旦转到 Prime 就会变为 $9.902。Step 5 Preview 比标准 ID 便宜 2.2 倍,比 Prime 便宜 3.7 倍。
• 输入价格 — $1.00,对比标准价 $2.00 和 Prime 上的 $3.301。它是输出列的镜像,而且在你读完下方成本明细后,这一点更重要。
• 缓存命中 —— Step 5 Preview 每百万 token 0.10 美元,相当于 90% 的折扣;Qwen3.8-Max 为 0.25 美元,相当于 87.5% 的折扣,而厂商自家页面将其四舍五入为 88%。
• 每秒输出 token 数——87 对 35.4。这里 Qwen 是较慢的那个,慢了大约两倍。
按 token 计费的列与按任务计费的列不一致,而该相信的是按任务计费的那一列,原因只有在你打开成本明细时才会显现。在 Step 5 Preview 的索引运行中,$1.03 里有 $0.85 来自输入侧,$0.17 来自输出。在 Qwen3.8-Max 的运行中,$5.41 里有 $4.76 来自输入侧,$0.65 来自输出。标价大约相差两倍;任务账单却相差五倍,因为 Qwen 这次运行通过测试框架推送了约 99 亿个输入 token,而 Step 5 Preview 为 55 亿,还因为其中大部分量是缓存流量,按供应商给予的折扣被重新读取,而不是按标价费率计费。
Step 5 Preview 被榜单描述为非常冗长,在整个测试套件中输出 token 约为 1.6 亿,而中位数为 8200 万——Qwen3.8-Max 也被用完全相同的措辞描述,在相同中位数下约为 1.9 亿。这两者都不是回答简短的模型。如果你希望优化的正是输出长度,那么这两栏都帮不了你。

这个比较有一个漏洞,而它是 Prime 形状的。
上一节中的每一项数据都是在标准 Qwen3.8-Max ID 上测得的。没有任何一项是在 Prime 上测得的。
那不是技术细节。Prime 的整个主张就是 token 到得更快,而榜单上这个系列唯一的速度数字是标准 ID 的 35.4 输出 token 每秒——是这里讨论的三个 ID 中最慢的,且差距悬殊,也是 Qwen3.8-Max 不只是昂贵、而且明显表现不佳的那一行。如果 Prime 达到阿里巴巴所述区间的上限,那么 35.4 会变成大约 70,仍低于 Step 5 Preview 的 87,而每输出 token 的成本却是后者的 3.7 倍。如果它达到区间的下限,则大约变成 53。
那些都是基于厂商声称的倍数得出的估算值,而不是实际测量值,因此理应如此标注。我们找不到任何人公开发表过对 Prime 模式的独立吞吐量测试。1.5 到 2 倍这个数字是 Alibaba 自己的,而它是整个层级下唯一承重的说法。
Prime 唯一一处对其有利的结构性细节,就是那条限流规则,而它很容易被一眼略过。阿里巴巴的文档说明,在 Prime 之下,当调用量触及速率上限时,如果平台仍有空闲资源,请求不会被限流——因此你可用的吞吐量不会低于所标称的上限。这是软上限配硬下限:有争用时你拿到的是上限,空闲时你能拿到更多。对于一个要连续发起数十次调用的智能体循环来说,这比中位数更重要,因为最慢的那次调用决定了循环何时结束。这也是对 Prime 为何能作为一款产品存在的最清晰解释。阿里巴巴卖的,是在自己已经建成的容量中插队的位置,并为此收双倍的钱,换取被优先服务的权利。
把两张费率卡并排放在一起时,它们说明了什么
阿里巴巴将其 Qwen 各行并排发布,这使得该层级的算术格外清晰。在国际版页面上,Prime 一行标注为每百万 token 输入 $3.301、输出 $9.902,而标准 ID 及其 0902 固定版本则为 $1.65 和 $4.951。两列上都正好是 2.0——不是四舍五入的近似值,而是公布数字的字面比值。StepFun 的英文定价页面列出 Step 5 Preview 为输入 $1.00、缓存命中时 $0.10、输出 $2.70,其中缓存未命中的输入包含将新内容写入缓存的成本。该厂商公布的缓存命中数字是 90% 折扣;独立测评榜则依据同样的材料记录为 95%,而弄清楚你究竟是以两者中的哪一个作为建模基准,是值得的。
把这三张卡放进同一列,格局就清楚了。Prime 输出,$9.902。标准版 Qwen 输出,榜单记录上是 $6.00,阿里巴巴自己的国际页面上是 $4.951。Step 5 Preview 输出,$2.70。而在那条没人宣传的廉价通道上,Step 5 Preview 的缓存读取价是 $0.10,Qwen 则是 $0.25——对于任何会重复其前缀的工作负载来说,这比输出那一列更重要。
关于过时数字的一个提醒,因为这个系列在七周内已经不止一次被重新定价。被广泛引用的 Qwen3.8-Max 的 $2 输入和 $6 输出价格是 8 月发布时的头条价格,而且 Alibaba 的新加坡标签页至今仍显示这个价格。国际和全球这两行现在显示的是 $1.65 和 $4.951。如果你正在对支出进行建模,请使用你所在地区的费率卡,并在你做出承诺的当天重新查看。
2× 的两种读法
由于 Prime 与标准 ID 是同一模型,价格却是后者的两倍,因此这种溢价容易定价,却难以证明其合理性。在 Alibaba 产品系列的高端,你花 2 倍价钱换来 2 倍速度,每消除一秒延迟的成本持平。在低端,你花 2 倍价钱换来 1.5 倍速度,每节省一秒就有 33% 的溢价。对交互式工作来说,两端都不算不合理;对隔夜批处理来说,两端都站不住脚。正因如此,关于这一档位的标准建议——对延迟敏感的调用用 Prime,其他一切用标准 ID——也是正确的建议。
与 Step 5 Preview 的对比,正是推理发生转折的地方,而这正是"vs"这种框定方式所凸显的部分。Prime 在价格上根本没有与 Step 5 Preview 竞争。标准 ID 按每个输出 token 计算,已经比 Step 5 Preview 更贵,按每个已完成任务计算则贵五倍,而得分只高一分。Prime 把一道本已落败的等式中的成本项成倍放大,换回来的速度,Step 5 Preview 却免费拥有更多。如果你需要的是这个系列的速度,那么老实说:本页另一侧的那个模型以每百万输出 token 2.70 美元的价格提供每秒 87 个 token,而快速通道给出的区间,按阿里巴巴自己的数据,最高约为 70,价格为 9.902 美元。
这不是论证 Step 5 Preview 胜出的理由。它论证的是,Prime 的价值完全内在于阿里巴巴自家产品线,而且支持它的理由取决于某些工作负载:在这些负载中,Qwen3.8-Max 领先一个点的指数、其 983,616 token 的上下文或其不同的任务画像,能完成 100 万 token 的 Step 5 Preview 上下文做不到的工作。而这正是目前没人能进行的对比,因为 Prime 这一行还不存在于任何独立榜单上。

这对买家来说意味着什么
这两者都不在 OrcaRouter 上。Step 5 Preview 可通过 StepFun 自家的 API 以及少数第三方平台访问;Prime 是 Alibaba Cloud Model Studio 的一个层级,通过工作区范围的端点提供服务;你可以在读到这些说法的同一分钟内对照我们的目录核实这两点,这比听信我们的一面之词是更好的检验。
我们实际路由到的是同一家族中的另一款产品,而它恰好正是本文的算术不断指向的那一款。标准版 Qwen3.8-Max 及其带日期的固定版本 Qwen3.8-Max-0902,与它们的同门 Qwen3.8-Max-Preview、Qwen3.8-Flash 和 Qwen3.8-27B 在目录中共享同一个键,与 200 多款其他模型并列,且提供商标价以 0% 加价透传。由此得出两点,二者都影响上述决策。第一,Alibaba 的费率卡变更在 Alibaba 发布当天就会出现在我们这边——这正是你希望从一家已在七周内两次调整该家族价格的供应商身上得到的特性。第二,你的基线不再是一场单一供应商押注:标准 ID 是你最可能保留在默认路径上的层级,而把它放在路由层之后而非直接集成,正是让 Prime 决策可按端点而非按合同逆转的原因。
如果你要在本文标题中的两个名称之间做选择,取舍很直接。当你想要评分、视频和图像输入,以及 90% 的缓存折扣时,就选 Step 5 Preview,并接受这一点:你租用的只是一个预览版,其检查点只是对 10 月 15 日的承诺,而不是许可证。只有当您已经确定要使用 Qwen3.8-Max,并且在自己的提示词上实测过,发现标准 ID 的每秒 35 个 token 正是让您花钱的原因时,才选择 Qwen 3.8 Max Prime——并且在做这一决定时,要按 2× 而不是 1.5× 来核算成本,因为供应商产品线中的顶配并不是你在生产环境中会看到的数字。
能够一锤定音的那项测量并不存在,这一点值得直说,而不必粉饰。需要有人把 Prime 跑进一套同时也跑 Step 5 Preview 的测试框架里,公布吞吐量的分布而不是一个倍数,并在它换来的那个指数点旁边标上每任务成本。在那之前,双方唯一共享的数字就是那两张费率表,而它们从相反的方向说着同一件事:要买一个 Qwen3.8-Max 的 token,快车道是最贵的方式;要买一秒钟的墙上时钟时间,它是最慢的方式——毕竟另一条路对同一秒的收费是那样。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
