为 GLM-5.3-FlashX 制作的主视觉标题卡,副标题为“相同的权重,2.5 倍的价格”,标签上分别写着“最高 200 tok/s(厂商数据)”“每 100 万 $0.37 / $1.25”和“100 万上下文”,页脚一行写着“服务层级于 2026 年 9 月 18 日推出”。
Guides & Insights

GLM-5.3-FlashX 的发售价格是其运行所用模型的 2.5 倍

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

值得注意的数字不是200,而是2.5。2026年9月18日,Z.ai 将 GLM-5.3-FlashX 上线到其 API,输出速度最高可达每秒200个token——并将其定价为 GLM-5.3-Flash 的2.5倍;后者是它基于构建的开放权重模型。模型本身没有任何变化。相同的权重,相同的320B-A18B混合专家骨干,相同的100万token上下文,同样原生处理文本、图像、视频和文件。改变的是其底层的服务栈,以及 Z.ai 如今为更靠近队列前排这一特权所收取的费用。

这让 FlashX 在模型市场中成为罕见的存在:一次没有附带基准测试的发布。Z.ai 没有发布任何专门针对 FlashX 的评估,因为并没有新模型可供评估。适用于 GLM-5.3-Flash 的每一项能力指标都同样适用于它,包括那些不如发布报道所暗示的那样好看的数据。

整个增量,一次完成

• 速度 — GLM-5.3-FlashX 最高可达 200 tok/s(厂商报告的峰值),而根据 Artificial Analysis 在 Z.ai 自有 API 上的实测,GLM-5.3-Flash 为 98 tok/sbr> • 价格 — 每 100 万输入 token 收费 $0.37 / 每 100 万输出 token 收费 $1.25,而标价分别为 $0.15 / $0.50br> • 缓存输入 — 每 100 万 token $0.075,而对比价为每 100 万 token $0.03br> • 智能水平 — 完全相同;FlashX 继承了基础模型的各项评分br> • 上下文 — 两者均为 100 万 tokenbr> • 权重 — GLM-5.3-Flash 是 MIT 许可的开放权重;FlashX 属于托管层级,自身不提供任何权重

200 和 98 不是同一类数字,这一点值得挑明了说。一个是厂商宣称该服务能够达到的上限。另一个是独立实验室在真实请求中实测出来的结果。用户在决定是否要为此多付 2.5 倍价钱时,应当把 200 当成广告宣传,然后自己去实测一下自己的实际负载。

A single-column scoreboard titled 'GLM-5.3-FlashX - the scoreboard' with rows reading 'Speed: up to 200 tok/s (vendor peak)', 'Measured speed: 98 tok/s (base model)', 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Context: 1M tokens' and 'Weights: hosted tier only', with a footer reading 'Speed is a vendor-reported peak; base-model figures per Artificial Analysis.'

Z.ai 所说的正在发挥作用

提速来自基础设施,而非数学。Z.ai 称 FlashX 运行在由约 10 万个中国国产加速器组成的集群上,并配备了一套专门构建的服务栈:一个基于 SGLang 的推理引擎、W8A8 量化、INT8/FP8/BF16 混合缓存量化,以及一种编码—预填充—解码解耦架构,该架构将多模态编码阶段与 token 生成阶段分离,使两者互不阻塞。该公司报告称,在相同硬件上,端到端服务吞吐量较其初始基线提升了约 3 倍,并表示一个由 GLM-5.3 驱动的基础设施智能体协助调优了该服务栈。

所有这些都是厂商自行报告的,而且迄今为止,Z.ai 之外的任何人都未能复现。它同时也是这个故事中最可信的部分:像这样的服务层发布通常属于工程上的胜利,而所描述的架构选择正是实现这类提升的标准工具集。但这些并不是保证。200 tok/s 是峰值,而峰值是在短输出、预热缓存和未拥塞集群上达到的。长上下文多模态请求——正是 FlashX 明确瞄准的工作负载——恰恰最不可能达到这一数字。

价格才是真正的产品决策

按标价,GLM-5.3-FlashX 每百万输入 token 收费 $0.37,每百万输出 token 收费 $1.25,缓存输入为 $0.075,缓存存储限时免费。换算成 Z.ai 的国内定价,就是输入 ¥2、输出 ¥7,而基础版 Flash 为 ¥0.8 和 ¥2.8——同样的 2.5 倍比例,只是以 Z.ai 在国内销售所用的货币来表示。

A screenshot of Z.ai's official pricing documentation page (captured September 19, 2026) showing the 'Latest Models' table with GLM-5.3-Flash at $0.15 input, $0.03 cached input and $0.50 output per 1M tokens, and GLM-5.3-FlashX at $0.37, $0.075 and $1.25.

算术很快就会朝着人们很少检查的那个方向变得令人不安。输出 token 正是倍率咬得最狠的地方,因为在这个系列的每一个模型上,输出都是昂贵的那一侧:FlashX 的输出是 Flash 输出的 2.5 倍,而在两者上,输出价格已经大约是输入的 3.4 倍。一个每天生成一百万输出 token 的批处理任务会从 $0.50 涨到 $1.25——对于一个按定义根本没人在等的工作负载来说,一年就相差 $274。

划算之处在于可以摊薄的延迟。一个会进行十次顺序调用的智能体循环,能把每次调用的差异节省十倍;如果这个差异是两三秒,那么每个任务就能挽回半分钟的实际耗时。对于交互式代码补全、实时对话,或任何人类或上游服务因等待下一个 token 而被阻塞的流水线来说,这种取舍通常是正确的。Z.ai 也明确表示,该模型目前不包含在其 GLM Coding Plan 中,因此订阅用户不会获得捆绑的 FlashX——他们需要按 token 为其付费。

如果你的技术栈已经能与多个供应商对接,那么切换不过是改一下模型字符串,仅此而已。这正是路由作为一层存在的现实原因:在 OrcaRouter 上供应商的标价原样传递,0% 加价,因此 Z.ai 的价格变动或促销降价会在上游发生的同一天落地,而 200+ 个模型前面只有单一端点,意味着拿 FlashX 与 Flash 做评估只需改一处配置,而不是启动一个集成项目。故障转移在这里同样重要——一个全新集群上的全新服务层级,恰恰是那种值得在背后准备好回退方案的依赖。

什么没有改变,以及为什么它更重要

FlashX 完整继承了 GLM-5.3-Flash 的能力画像,而这一画像比发布报道所暗示的要狭窄。Z.ai 的资料将基础模型在 Artificial Analysis Intelligence Index 上与 Claude Opus 4.8 列为同一水平。而 Artificial Analysis 本身目前在该指数上将 GLM-5.3-Flash 列为 42 分,且是基于 Z.ai 自家 API 测得的——这是一个扎实的分数,远高于同类开放权重模型的中位数,也距离厂商对比所暗示的前沿梯队相去甚远。这两种说法都是真实的;它们只是并非同一种说法,而两者之间的落差,正是本博客把厂商数字标注为厂商数字的原因。

这个基础模型确实能力出众,也确实真正开放。GLM-5.3-Flash 于 2026 年 8 月 26 日以 MIT 许可证发布,权重已上线 Hugging Face,其混合线性加稀疏注意力设计——IndexPool 压缩、流形约束超连接——相比 GLM-5.3 将注意力计算量削减约 3 倍、KV 缓存削减约 4.4 倍,这正是让一个拥有 18B 激活参数的 320B 模型成本低到足以投入服务的原因。输出上限为 131,072 个 token。就价格而言它很快,但就同级而言并不算快:Artificial Analysis 测得速度为每秒 98 个 token,而同类模型的中位数高于 70,但仍低于榜单上最快的模型。

FlashX 不会改变其中任何一点。它改变的是你等待它的时间。

诚实的解读

如果你的工作负载受延迟约束,并且你已经认定 GLM-5.3-Flash 是合适的模型——比如一个会链式调用工具的智能体、一个内联补全的编辑器、一个把停顿本身当作产品体验的语音或聊天界面——那就购买 FlashX。如果你的工作是批处理、离线或受吞吐量而非延迟约束,那就继续使用 GLM-5.3-Flash,或者使用你可以自行托管、开放权重的模型。你花 2.5 倍价钱换来的智能,其实是你早已拥有的智能。

悬而未决的问题是,独立测量对 200 说明了什么。Z.ai 之外还没有人公布过 FlashX 的吞吐量数据,在有人这样做之前,诚实的立场是:FlashX 是一个有前景的服务层级,却是靠一个峰值数字来推销的。值得注意的是,这也是一次商业测试:一个花了一年时间以旗舰产品十分之一的价格近乎白送地提供一款接近前沿模型的实验室,如今在问开发者是否愿意单独为速度付费。答案将影响下一个层级如何定价。

A screenshot of the OrcaRouter models catalogue (captured September 19, 2026) showing the header '199 models - 15 providers - one API key, one bill', the filter chips for input modalities, context length, input price, status, series and supported parameters, and the 'How to call any model' panel with the POST https://api.orcarouter.ai/v1/chat/completions endpoint.

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新