
GLM 5.3 Prime 对比 GLM-5.3-Flash:两款不同型号之间 18 倍的价格差距
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
对于任何带着已定了一半的购买决定来的人,这里用一句话给出对比:GLM 5.3 Prime是GLM-5.3的旗舰权重,通过加速服务层级出售,每百万 token 价格为 2.80 美元和 8.80 美元,而GLM-5.3-Flash则是一个独立的原生多模态模型,拥有自己的开放权重,价格为 0.15 美元和 0.50 美元。两者在输入和输出上的差距都约为十八倍。这不是层级差异——而是家族中处于不同位置的不同模型;这两个名字在模型列表中相邻的唯一原因,是它们出现的时间相隔不到六周。
这两个方向上的误判,代价都很高昂。把 Flash 当作 Prime 的廉价版,你会对它做不到的事感到意外。把 Prime 当作更快的 Flash,你就会为一个连图像都看不见的模型多付十八倍的钱。
从每一个实际上是什么开始
GLM-5.3-Flash 是一款拥有 3200 亿参数、180 亿激活参数的多模态混合专家模型,于 2026 年 8 月 26 日以 MIT 许可证发布,权重已上架 Hugging Face 和 ModelScope。它能在同一请求中原生接受文本、图像、视频和文件,拥有 1,000,000 token 的上下文窗口和 128,000 token 的输出上限,并且是单独预训练的,而非从旗舰模型蒸馏而来。其混合线性加稀疏注意力设计将注意力计算量削减至约三分之一,并将 KV 缓存相比 GLM-5.3 缩小至四分之一以下——这正是其成本优势在架构层面的来源,而不是来自折扣。
GLM 5.3 Prime 就是 GLM-5.3——一个激活参数为 400 亿的稀疏混合专家模型,于 2026 年 8 月 14 日发布,自 8 月 18 日起在 API 中提供,8 月 25 日开放权重——通过高速通道提供服务。相同的 1,000,000 token 上下文,相同的 131,072 token 输出上限,文本输入、文本输出,推理在低、高或极大强度下为必需项,其中极大为默认值。Z.ai 自己的文档并未列出 Prime SKU;该层级存在于一个第三方平台上,该平台指明其背后有单一上游提供商。
记分牌

• 价格 — GLM 5.3 Prime 每 1M $2.80 / $8.80,对比 GLM-5.3-Flash 每 1M $0.15 / $0.50
• 缓存输入 — 每 1M $0.56,对比每 1M $0.03
• 倍数 — 输入和输出大约 18×,尚未计入任何缓存
• 模态 — 仅文本,对比文本、图像、视频和文件输入
• 参数 — 旗舰 MoE 上 40B 激活,对比总计 320B / 18B 激活
• 权重 — 开放,采用带收入门槛的定制许可证,对比 MIT,今天即可下载
• 最大输出 — 131,072 tokens,对比 128,000 tokens
• 上下文 — 两者均为 1,000,000 tokens
• 智能指数 — GLM-5.3 在 v4.3.2 指数上得分 45;GLM-5.3-Flash 得分 42
• 每个 Index 任务成本 — 旗舰版为 $2.01,对比 Flash 的 $0.25
• 速度 — 每秒约 61 个输出 tokens,对比约 46,两者均为独立测量的中位数
• 订阅访问 — Prime 不在 Z.ai 的 Coding Plan 中;Flash 在,且有 3× 配额
那个列表中有两行值得不止一个项目符号。第一行是智能差距:在 v4.3.2 修订版下,Artificial Analysis Intelligence Index 上相差三个点,45 对 42。同一指数更早的修订版将那些模型列为 60 和 57,而那对更早的数字仍在发布报道中广泛流传——不要把两者混为一谈,因为跨修订版的数字不可比较。三个点是狭窄的差距,表现为在非常长的代理链上稍多一点的漂移,以及对模糊指令更敏感,而不是另一类模型。
第二点是速度,它颠覆了这些名称让人产生的直觉。根据独立测量,Flash 是两者中较慢的那个——约每秒 46 个输出 token,而旗舰模型为 61,在这一类别中平均为 67。Flash 名副其实靠的是价格和多模态,而不是延迟。这对比较很重要,因为通常选择小模型的理由就是它回答更快,而在这里却并非如此。
真正由你来做出的决定
由于这两个模型同时在三个维度上存在差异——模态、许可和价格——选择通常会在第一个维度上就分出胜负,根本走不到算账那一步。Flash 能读取图像和视频;Prime 除了文本什么都读不了。如果你的工作负载涉及截图、扫描页、UI 截图或视频帧,那么还没等价格登场,比较就已经结束了,你只能买 Flash。
如果你的工作负载是纯文本,而问题真正关乎质量,那么诚实的答案是:那三个点的指数差距,就是你花 18 倍价钱所买到的全部。这值不值得,完全取决于你能否验证输出。在答案可核查的地方——能编译的代码、能返回行的查询、能通过 schema 校验的结构化提取——Flash 偶尔失手,抓出来便宜,重试也便宜,而价格只有十八分之一,你可以重试非常多次。而在输出是需要由人来判断的散文,或是没有中间检查环节的长链条多步计划时,这点差距更难弥补,溢价也就更容易说得通。
开放权重在哪里改写了数学
Flash 采用 MIT 许可证,其可用的最小量化需要约 93 GB 的加速器内存——对许多团队来说这是一台高内存节点,而对某些团队而言只是账单上的一个舍入误差。GLM-5.3 采用定制许可证,要求收入超过一定门槛的大型模型即服务运营商通过安全审查,其最小实用量化约为 217 GB,对多数团队而言属于多节点部署。
这种不对称意味着,对于高用量团队来说,真正要比较的并不是 Prime 的 $8.80 和 Flash 的 $0.50,而是 Prime 的 $8.80 与你在自己已经拥有的硬件上、运行今天就能下载且无需进行许可沟通的权重时,每百万输出 token 的摊销成本。对于拥有相应硬件和用量规模的团队来说,这个数字常常是三者中最小的,而且它只在这项对比的 Flash 一侧才有。
两者都买,以及一起购买它们

大多数生产系统并不需要做选择。适合这对组合的模式是路由器:默认路径上使用 Flash 处理文本和多模态任务,当任务属于长周期任务、或首次尝试未通过检查时,升级到旗舰模型。这不过是两个模型 ID 加一个决策函数,而分流稍有偏差的代价,是每千次请求多花几美分,而不是什么架构问题。
我们以每百万 token $0.07 和 $0.25 的价格托管 GLM-5.3-Flash——低于供应商自家 $0.15 和 $0.50 的标价——并以提供商标价 $1.40 和 $4.40 的费率托管 GLM-5.3,两者我们均零加价——提供商标价原样透传,而非重新定价,因此供应商的费率一变,在他们那边生效的同一天就会落到我们这边。这两个 ID 与 200 多个其他模型共用同一把密钥,这使得从 Flash 到旗舰的升级只是同一调用路径内的模型名更换,而非第二次集成。自动故障转移可应对快速层级背后单一上游提供商性能下降的情况,而对于像 Prime 这样只列出一家供应商的层级,这并非假设性的担忧。
我们应该直说这一点上的限制:OrcaRouter 不托管 GLM 5.3 Prime,我们也不托管 GLM-5.3-FlashX。这两个模型页面在这里都会返回 404。如果你需要的是 Prime 的加速能力,那就得从销售它的平台那里购买。
我们实际上会告诉你的

如果你读到这里还在寻找赢家,答案是这两者从来就不构成竞争。Flash在成本、模态、许可和可部署性上都胜出,而且是以很大优势在四项上全部胜出。旗舰模型唯一的说辞是多三个指数点和每秒大约多15个输出token,却为此收取十八倍的价格。对于绝大多数文本工作负载,Flash是正确的默认选择,举证责任在昂贵的那一方。
需要谨慎的地方在中间地带。一个既需要文本上的旗舰级推理质量、又需要读取图像的团队,最终会同时运行两个模型,而诱惑在于把所有任务都路由到旗舰模型,因为它才是那个有口碑的模型。正是在这里,18× 会悄然变成一项实实在在的预算条目。把多模态工作路由到 Flash,在失败时升级,并在假设升级率很高之前,先检查你实际的升级率是多少。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
