GLM-5.3-FlashX 对比 GLM-5.3-Flash 的主视觉标题卡,副标题为“相同权重,两个价签”,标签分别写着“200 vs 98 tok/s”、“$0.37 / $1.25 vs $0.15 / $0.50”和“完全相同的智能”,页脚一行写着“GLM-5.3-FlashX 于 2026 年 9 月 18 日发布”。
Guides & Insights

GLM-5.3-FlashX 对比 GLM-5.3-Flash:相同的权重,2.5 倍的价格,仅一个数字不同

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

你无法通过购买 GLM-5.3-FlashX 得到一个更好的模型。这不是批评——这恰恰是全部前提。GLM-5.3-FlashX于 2026 年 9 月 18 日在 Z.ai 的 API 上线,运行着与 GLM-5.3-Flash完全相同的权重:相同的 320B 总参数、18B 激活参数的混合专家骨干,相同的 100 万 token 上下文,相同的原生文本、图像、视频和文件输入,相同的 131,072 token 输出上限。Z.ai 没有发布 FlashX 的基准测试,因为没有什么新东西可供基准测试。不同之处在于 token 的输出速度以及它们的成本,而这两个数字就是买家唯一需要权衡的东西。

这比大多数模型对比都更干净,也更难,因为没有什么能力上的说辞可以躲在后面。延迟对你来说值不值 2.5 倍,要么值,要么不值。

一个型号,两种价格

• FlashX 是什么——它是一个服务层级,而不是模型发布;相同的权重、相同的分数、相同的限制br> • 输入价格——FlashX 上每 100 万 token 为 0.37 美元,而 Flash 的标价为每 100 万 token 0.15 美元br> • 输出价格——每 100 万 token 1.25 美元 vs 0.50 美元,这才是真正影响账单的倍数br> • 缓存输入——每 100 万 token 0.075 美元 vs 0.03 美元br> • 速度——最高每秒 200 个输出 token(厂商报告的峰值),而 Artificial Analysis 独立测得 98 tok/sbr> • 订阅访问——GLM-5.3-Flash 包含在 Z.ai 的 GLM 编程套餐中,配额为 3 倍;FlashX 不包含在内br> • 自行托管——GLM-5.3-Flash 是在 Hugging Face 上以 MIT 许可发布的开源权重;FlashX 没有可下载的权重

A two-column scoreboard titled 'GLM-5.3-FlashX vs GLM-5.3-Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: hosted tier only'; the GLM-5.3-Flash column reads 'Price: $0.15 / $0.50 per 1M', 'Cached input: $0.03 per 1M', 'Speed: 98 tok/s (measured)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: MIT open weights'; the footer reads 'Same weights and same scores; only serving speed and price differ.'

在 Z.ai 的本土市场,同样的比例被直白地写明:FlashX 输入 ¥2、输出 ¥7,而 Flash 则是 ¥0.8 和 ¥2.8。多家中国媒体对这次发布的描述如出一辙——5 倍的速度,2.5 倍的价格——而且每一家都指出,其智能水平并无变化。

延迟是一项单独列出的条目,而且它不是按 token 计价的。

2.5× 并不自动意味着不划算,原因是 token 价格和任务成本是不同的量。一个夜间生成一百万输出 token 的批处理任务,仅输出部分在 Flash 上要付 $0.50,在 FlashX 上要付 $1.25,而多花的 $0.75 换不回任何东西,因为没人在等。一个进行十次顺序调用的智能体循环,也要支付同样的每 token 溢价,但每次调用返回更快,节省的是实际耗时,而不是账单金额。如果 FlashX 真的能在几分之一的时间内返回,那么十轮就能为每项任务省下数十秒的延迟——而如果这项任务正在阻塞某个人或某个上游服务,这些秒就比 token 更值钱。

Z.ai 自身的定位完全遵循这条路线。它把 FlashX 指向高并发编程、多步智能体调用、实时对话、代码补全以及长上下文多模态任务,而把对价格敏感、对延迟不敏感的工作负载——离线批处理、批量生成、任何可安排调度的任务——交回基础版 Flash。这条界线划得对,而且值得注意的是,划出它的正是厂商自己。

推理链条断裂的地方在吞吐量这一端。FlashX 的每秒 200 个 token 是厂商报告的峰值;基础模型的 98 是独立实验室测得的中位数。峰值是在短输出、缓存预热且集群空闲的情况下达到的。长上下文多模态请求——恰恰是 FlashX 主打的工作负载——最不可能接近这一数字,而 Z.ai 之外没有任何人公布过能解决这一问题的数据。如果你的工作负载受吞吐量制约而非受延迟制约,那么峰值数字几乎无法告诉你实际能拿到什么。

FlashX 所没有的逃生出口

这个对比中还有第三种选择,而它之所以存在,仅仅是因为基础模型是开源的。GLM-5.3-Flash 于 2026 年 8 月 26 日以 MIT 许可证发布,权重已上架 Hugging Face 和 ModelScope,如今由 SGLang、vLLM、TokenSpeed 和 KTransformers 等推理栈提供服务。如果你的用量足够大,大到足以证明硬件投入是值得的,那么真正诚实的对比就不是 Flash 对 FlashX——而是 FlashX 每百万输出 token 1.25 美元的价格,与你在自己的加速器上自行摊销的每 token 成本之间的对比。

A screenshot of the OrcaRouter model page for GLM 5.3 Flash (z-ai/glm-5.3-flash, captured September 19, 2026) showing the 1M-token context badge, a 128K max output, text, image and video input, a 2026-08-26 release date by Z.ai, the 320B total / 18B active parameter line, and the billing row reading $0.07 per 1M input and $0.25 per 1M output tokens with a 6.68-second p50 time to first token.

那个选项有着实实在在的入场成本。FP8 版本的服务部署大约需要 328 GB 的 GPU 内存,对大多数团队而言这意味着多节点部署,对其余团队来说则根本无从下手。但这一点值得说明,因为正是这种不对称性,使 FlashX 的定价成为一次刻意为之的试探,而非某种必然结果:Z.ai 是在为一种服务配置收取溢价,而对基础模型来说,客户原则上可以自行搭建这种配置。这笔溢价买的是便利,而非能力,而便利的市场价格会随着时间推移而下降。

价格变动真正关乎的是什么

此次发布背后的经济逻辑异常清晰。GLM-5.3-Flash 的发布价格是 GLM-5.3 的十分之一——发布促销期间更是低至其一半——并且被大量使用,其中包括一段匿名预发布测试,Z.ai 此后已证实此事。FlashX 是该系列首次朝相反方向迈进:同一模型,定价上调。中国财经媒体援引的分析师将其解读为一次刻意的商业测试,旨在检验开发者是否愿意单独为速度付费;此前一年,该公司一直以大宗商品般的价格提供接近前沿的能力来换取市场份额。

两个细节支持这一解读。FlashX 被排除在 GLM Coding Plan 之外,而基础版 Flash 则包含在内并享有三倍配额,因此订阅用户无法把这一新档位并入既有的承诺——他们只能按 token 付费。而且定价是统一费率,没有非高峰折扣,这不同于一些竞争对手为填补闲置产能而采用的按时段计费的结构。在速度档位上统一加价 2.5 倍,是给那些等不起的人定的价,而 Z.ai 正在弄清楚这样的人究竟有多少。

在它们之间做选择

如果人类或服务正卡在下一个 token 上等待,而模型本身已经是正确的选择——行内补全、交互式智能体、实时聊天,任何“停顿本身就是产品”的场景——那就选 FlashX。对于批处理、离线和批量工作,对于任何可以排期调度的事情,以及任何你为输出量而非输出延迟付费的工作负载,选择 GLM-5.3-Flash。如果你的用量很大,且团队能够运行加速器,那么在给 FlashX 定价之前,先算一算自托管基础权重的成本;对比结果会比 token 费率所显示的更为有利。

无论你选哪一条路,在调用侧都把两者视为可互换的。它们接收相同的提示词,返回相同的格式,产出相同的质量——唯一变化的是一个模型字符串,而这是最廉价的一种 A/B 测试。在 OrcaRouter 上厂商的标价按 0% 加价原样透传,因此 Z.ai 的调价或促销在上游生效的当天就会生效,而且这两个档位都位于同一个端点之后,该端点面向 200+ 个模型。对于一个完全取决于实测延迟的决策而言,能够在不改动集成的情况下于实验中途在两者之间切换,这已经完成了大部分工作。

这个结论比通常的模型对比更收窄,而这正是重点。FlashX 并不是更好的模型,它也没装作是。它就是同一个模型配上更短的队列,其定价只有在队列恰好是你的问题时才说得通。在做出承诺之前,先在两者上测量你自己的首 token 时间——厂商说的 200 只是上限,你自己的负载才是唯一重要的基准,而两个档位之间的差别,不过是一次配置改动之遥。

A screenshot of the Artificial Analysis model page for GLM 5.3 Flash (captured September 19, 2026) showing an Intelligence Index score of 42 against a class median of 18, 180M tokens generated during evaluation, $0.15 per 1M input and $0.50 per 1M output tokens, and a measured 98 output tokens per second against an average of 71.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新