
GLM-5.3-FlashX 对比 DeepSeek V4.1 Flash:比廉价模型还慢的速度档位
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Z.ai 的高端速度档位存在一个问题,它的名字叫 DeepSeek V4.1 Flash。当 Z.ai 于 2026 年 9 月 18 日推出 GLM-5.3-FlashX 时,它用一个数字来推销这个新档位:最高每秒 200 个输出 token,大约是其基础版本 GLM-5.3-Flash 吞吐量的五倍,价格却是后者的 2.5 倍。独立测量结果早已显示,DeepSeek 的廉价模型达到每秒 214.7 个 token,首 token 延迟为 1.15 秒——两项指标都优于 Z.ai 所宣传的上限,而价格更是 FlashX 远不能及的。如果你买的是速度,那么市场早在 FlashX 到来之前就已经变了。
那种说法在某一个具体方面对 FlashX 不公平,而在其他所有方面都是公平的。这两个模型都是为成本而打造的 1M 上下文开放权重衍生模型,并且都确实擅长它们被打造出来要做的事。但它们是为同一个问题的不同两半而构建的,而它们之间的价格差距如今已经足够大,以至于对大多数工作负载来说,“哪个更好”只需一句话就能回答。
各自真正领先的地方
• 定价(标价)—— GLM-5.3-FlashX 每 100 万输入/输出 token $0.37 / $1.25,对比 DeepSeek V4.1 Flash 低谷时段 $0.15 / $0.60,高峰时段 $0.30 / $1.20br> • 缓存输入 —— FlashX 每 100 万 token $0.075,对比 DeepSeek 低谷时段 $0.003,25 倍的差距在智能体循环中会不断累积放大br> • 实测吞吐量 —— FlashX 最高 200 tok/s(厂商峰值,未公布独立数据),对比 DeepSeek 214.7 tok/s(Artificial Analysis,基于 DeepSeek 的 API 测得)br> • 首 token 时间 —— FlashX 未公布,对比 DeepSeek V4.1 Flash 实测 1.15 秒br> • 独立智能水平 —— FlashX 继承 GLM-5.3-Flash 在 Artificial Analysis 智能指数上的 42 分,对比 DeepSeek V4.1 Flash 的 40 分br> • 架构 —— 总参数 320B / 激活 18B 的 MoE,对比总参数 552B、预填充阶段约激活 8B、解码阶段激活 16Bbr> • 输入模态 —— 文本、图像、视频和文件,对比文本和图像br> • 输出上限 —— 131,072 tokens,对比约 384,000br> • 开放权重 —— GLM-5.3-Flash 采用 MIT 许可;FlashX 是托管层级,自身不提供权重;DeepSeek V4.1 Flash 采用 MIT 许可

把那份清单读两遍,因为它的形态本身就是故事。FlashX 恰好赢下两行,而且优势都很微弱:在一个独立智能指数上领先两分,以及视频输入。DeepSeek 在价格、缓存价格、实测速度、输出长度和模态广度上获胜——在真正重要的意义上,它能接收图像并生成长答案。这两分的指数差距在单次基准测试运行的噪声范围内,不应成为决定你架构的因素。
比廉价模型更慢的速度档位
这部分值得深入探讨。Z.ai 构建 FlashX 是为了解决一个真实问题:GLM-5.3-Flash 速度慢。Artificial Analysis 测得其为每秒 98 个输出 token,这高于同规模开放权重模型的中位数,但远未达到可交互水平。该公司的解决办法是重建服务栈——约 10 万个国产加速器、一个基于 SGLang 的引擎、W8A8 量化、混合精度 KV 缓存,以及编码—预填充—解码分离式架构——并报告在相同硬件上,端到端吞吐量较其基线提升约 3 倍。
DeepSeek 在架构层面解决了同一个问题,并且率先做到了。V4.1 Flash 的 Causal Encoder–Decoder 拆分在预填充时激活约 8B 参数,在解码时激活 16B 参数,而非一个固定数值;而带 FP4 KV 缓存的 Compressed Sparse Attention 2 将全局缓存压缩到每 token 890 字节——约为其前代所需 HBM 的四分之一、SSD 存储的八分之一。其结果是一个由中立实验室测得的、在同一第一方 API 上以每秒 214.7 个 token 运行的模型,且无需任何高级付费层级。
Z.ai 的 200 是厂商峰值,而 DeepSeek 的 214.7 是独立中位数,这是对 Z.ai 最不利的可能比较,也是不应把它看得太重的理由。在已预热、短输出、无拥塞的请求下,FlashX 完全有可能胜过 DeepSeek。但这一点无法确知,因为 Z.ai 之外没有人公布过 FlashX 的吞吐量数据。今天可以知道的是,这两个模型处于同一速度区间,而其中一个的成本只有另一个的三分之一。

DeepSeek 的价格优势在何处成为结构性的
DeepSeek V4.1 Flash 在非高峰时段每百万输入 token 收费 $0.15,每百万输出 token 收费 $0.60,并在工作日两个时段(01:00–04:00 和 06:00–10:00 UTC)翻倍至 $0.30 和 $1.20。FlashX 统一定价为 $0.37 和 $1.25。把这些放在一起对比,那种看似优点的统一价格,对任何能安排工作时段的人来说,实际上是更昂贵的结构。
缓存输入这一行才是决定智能体工作负载的关键。DeepSeek 在非高峰时段每百万缓存输入 token 收费 0.003 美元;FlashX 收费 0.075 美元,高出二十五倍。一个在每一步都重新发送冗长系统提示和工具架构的智能体,每一步都要为这一差价买单,而这很可能是最有可能主导真实账单的单项支出。Z.ai 将缓存存储列为限时免费,这是对存储的折扣,而非对实际不断累积的读取量的折扣。
有一个制衡因素,那就是对 DeepSeek 自家数字所隐含成本保持诚实。V4.1 Flash 招牌分数背后的厂商自跑评估,是在最大推理力度下生成的,而 DeepSeek 有文档记载:将力度从 25 提升到 100,会让 DeepSWE v1.1 从 66.0 升至 74.2,同时消耗约 2.5 倍的输出 token。在 2.5 倍 token 的情况下,高力度配置的实际成本比标价所暗示的要接近 FlashX 得多——而且该模型被记录为非常啰嗦,在 Intelligence Index 上生成 2.5 亿输出 token,而中位数为 1.3 亿。在一个话多的模型上,低廉的每 token 单价并不等同于低廉的任务成本。任何按价格比较这两者的人,都应该比较每个已完成任务的成本,而不是每百万 token 的成本,并且应该预期去实测,而非估算。
如何具体地做出决定
如果你的工作负载是一个具有稳定前缀、长期运行的 agent,那么 DeepSeek V4.1 Flash 就是首选,而单凭缓存输入比例这一点就能决定。如果你需要在同一次调用中进行视频理解或文件输入,FlashX 是两者中唯一支持这些的——这是真实的能力差异,而不是规格表上的差异。如果你需要较长的生成输出,DeepSeek 约 384K 的输出上限相较于 FlashX 的 131,072,对于报告生成、长代码文件以及任何以合成而非回答为主的任务都很重要。如果你需要在单一基准指标上获得最强的独立评分,FlashX 的 42 对 40 是真实的,但差距太小,不足以作为依据。
如果你的技术栈已经完成路由,那么两个模型都可以通过同一个端点访问,这是解决这个问题最省钱的方式。在 OrcaRouter 上,供应商的标价以 0% 加价直接透传,因此 DeepSeek 的错峰折扣以及 Z.ai 未来任何价格变动都会在发生当天同步生效,而在两者之间切换只需改一个模型字符串,而不是做一次集成。自动故障转移对 FlashX 尤其值得拥有:它是在新集群上仅上线三周的服务层级,而你要防范的故障模式是容量上限,而不是模型停止工作。
直白的总结:对大多数生产工作而言,DeepSeek V4.1 Flash 是更好的默认选择——每个 token 更便宜,每个缓存 token 更便宜,实测更快,并且能输出更长内容。GLM-5.3-FlashX 在更窄的范围内才是正确选择:当你需要视频或文件输入,并且希望背后有一个略高的独立指数时。Z.ai 把一个速度档位定为溢价,然后把它推向了一个快速廉价模型早已存在的市场。这就是整个对比。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
