
GLM 5.3 Prime 对比 GLM-5.3:相同的权重加一块秒表,价格却翻倍
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
这次比较中不存在质量疑问,而这正是它不同寻常的地方。GLM 5.3 Prime和GLM-5.3是同一个模型——相同的权重、相同的 1,000,000 token 上下文、相同的 131,072 token 输出上限、相同的强制推理以及相同的三档推理强度、在每个已发布的基准测试上分数相同。GLM-5.3 于 2026 年 8 月 14 日发布,于 8 月 18 日登陆 API,并于 8 月 25 日开放权重;Prime ID 于 9 月下旬出现,作为购买完全相同之物的第二种方式。比较中唯一不同的一行,正是对你的账单至关重要的那一行,而它恰好相差 2.0×。
所以,问题不在于用哪个模型。而在于:一条声称输出吞吐量可达1.5–2×的服务通道,是否值2×的价格,而这不过是一段话就能算清的算术。关于这对模型的大多数文章都跳过了算术,转而争论那些从构造上就完全相同的基准测试。这就是这笔账。
唯一不同的行

• 价格 — GLM 5.3 Prime 每 100 万 2.80 美元 / 8.80 美元,对比 GLM-5.3 每 100 万 1.40 美元 / 4.40 美元
• 缓存输入 — 每 100 万 0.56 美元,对比 0.26 美元
• 倍率 — 每项均为 2.0×,双向皆然,毫无例外
• 吞吐量 — 厂商报告称加速通道为标准通道的 1.5–2×;Prime ID 无独立实测数据
• 智能指数 — 两者均为 45,因为它是同一个模型,只评分一次
• 上下文 — 两者均为 1,000,000 tokens
• 最大输出 — 两者均为 131,072 tokens
• 推理 — 两者均强制启用,低 / 高 / 最高,默认 最高,两者皆同
• 模态 — 两者均为文本输入、文本输出
• 权重 — GLM-5.3 的权重可依定制许可证下载;Prime 则完全没有权重
• 可用性 — GLM-5.3 可用于 Z.ai 自有 API 以及所有承载它的平台;Prime 仅在一个平台上提供,且经由一家具名的上游提供商
注意,相同的行会对常见的对比文章造成什么影响。这里不存在推理深度方面的论据,不存在长上下文方面的论据,不存在工具调用方面的论据,也不存在服务许可方面的论据,能把这两款产品区分开来,因为服务通道不会改变模型的行为。如果你读过针对这一组合的正面交锋,并发现 Prime 在某项任务上“能力更强”,那么这一发现就是噪声——相同的权重不会产生不同的分布,它们唯一的差异在于 token 到达的速度有多快,以及默认推理努力会让模型输出多少 token。
盈亏平衡的正确做法
按单位工作量来给这两条路径定价,整个比较就归结为一个比率。如果 Prime 以 2.0 倍的价格提供 2.0 倍的吞吐量,那你就是以相同成本买到相同产出,无非是用钱换实际耗时——纯粹购买低延迟,既无溢价,也无折扣。如果 Prime 以 2.0 倍的价格提供 1.5 倍的吞吐量,那你为每 token/秒 支付的费用约为 1.33 倍,也就是为少等待这项特权支付三分之一的溢价。这是厂商自己宣称区间的两端,而两端都是最理想的情况,因为它们假设 1.5–2× 在你的工作负载上成立,而不是只在厂商的基准测试条件下成立。
实际上,这种溢价比那还要糟糕,原因只有一个:吞吐量是在一个预热过的、短小的、无争用的请求上测量的,而它又是对其他一切最敏感的指标。长上下文智能体会话每一轮都会重新读取不断增长的记录,这会把负载压在预填充和缓存读取上,而不是稳态解码上——而 Prime 对缓存读取也收取双倍费用。对基础模型的独立测量显示,GLM-5.3 约为每秒 61 个输出 token,而同级别平均为 67,但那个数字是标准化评估集上的中位数,而不是你在负载下会碰到的尾部情况。诚实的总结是:Prime 每单位吞吐量的成本大约在基础通道的 1.0 倍到 1.33 倍之间,而 1.0 倍这一端需要厂商的最优情况完全成立。
相同权重的意义远不止于此

共享权重集的实用价值在于,你针对 GLM-5.3 所构建的一切都能在双向切换中沿用下来。提示词形态可迁移,工具 schema 可迁移,缓存键可迁移,而你当初为这款旗舰模型背书所跑的评测,在两个 ID 上都依然有效。无需重新调优,无需重建基线,失败模式也不会带来任何意外,因为失败模式属于模型本身,而不属于承载它的那条服务通道。
这是一把双刃剑,而第二个方向才是需要内化的那一个。如果 GLM-5.3 的推理默认值 max让它在你的任务上变得啰嗦,那么 Prime 也会连同其他一切继承这份啰嗦。一条生成比你所需更多 token 的更快通道,端到端并不更快。在为加速付出 2× 代价之前,先把 effort 等级降到 high或 low再测量——effort 设置对端到端延迟的影响通常比服务通道更大,而且它不花任何成本。
价目表未显示的那一处不对称
GLM-5.3 的权重已开放。任何拥有相应硬件的人都能下载这些权重,并以成本价提供该模型的服务,既没有按 token 计费的账单,也无需在服务通道之间做选择。最小实用量化大约需要 217 GB 的加速器内存,对大多数团队而言这是多节点部署,对某些团队则只是一个舍入误差,而该许可证设有收入门槛,超过此门槛的大型模型即服务运营商在将其投入商业服务之前,必须通过安全审查。
Prime 没有权重。它是托管在别人部署上的一条通道,其条目恰好指明了该端点背后的一家上游提供商。值得点明的正是这种不对称:对于基础模型,你是在按 token 计价和你自己的摊销成本之间做选择;而对 Prime,你只能在按 token 计价和别无他物之间做选择。一个已经在自有硬件上运行 GLM-5.3 的团队,在这场比较中还拥有价目表从不显示的第三种选择,而它通常是三者中最便宜的。
秒表真正胜出的地方
有些工作负载中,每个 token 支付 1.33× 的溢价显然是正确的,而它们都有一个共同点:瓶颈不是你的 token 预算,而是别的东西。比如,有人在聊天界面里等待响应。流水线中的一个同步步骤,在模型返回之前,下一阶段无法开始。一个智能体循环要发起十次顺序调用,其中每次调用的延迟都会乘以链长,而用户实际体验到的是总实际耗时。在那些情况下,你买的不是 token,而是买回这些 token 本来要耗费的时间,而发票上的 2× 并不是决定该功能能否奏效的数字。
在这种情形之外,算账很快就会对 Prime 不利。夜间批量生成并不关心单个请求返回得有多快。大规模分类任务也不在乎,而且在规模化场景下,缓存读取上 2× 的溢价会累积成一笔实实在在的开支。而任何以模型自身推理长度为主导项的工作负载——一道高难度数学题、一条漫长的规划链——都是在为请求中从来就不是瓶颈的那一部分的加速买单。
双通道,一个密钥,无需二次集成

大多数团队最终解决这个问题的办法,不是选定某一条路线,而是在两者之间做路由,而这只有在两个 ID 能以同样的方式访问时才说得通。OrcaRouter 提供 GLM-5.3,按提供商标价每百万 token 1.40 美元和 4.40 美元,我们零加价——这是按提供商标价直接传递,而不是重新定价,因此供应商那边一调价,我们这边当天就能同步生效。GLM-5.3-Flash 也已上线,价格为 0.07 美元和 0.25 美元,这很重要,因为从廉价模型升级到旗舰模型的路线,正是大多数生产流量真正需要的形态。
两个 ID 与另外 200 多个模型一起,都位于同一个 API 密钥之下,这使得通道决策变成了在同一条调用路径内更换模型名称,而不是再签一份合约、再做一次集成。路由 DSL 正是在这一对组合上体现出价值的地方:把对延迟敏感的调用发往加速通道,其余的发往标准通道;或者在检查失败时升级,而不是靠猜测。自动故障转移覆盖了单一上游提供商性能下降的情况,而这正是单一供应商快速通道所特有的风险敞口。
有一点我们不会暗示:OrcaRouter 不托管 GLM 5.3 Prime,其模型页面在这里会返回 404。如果你想要的是加速通道,就得从售卖它的平台购买。我们能做的是给你基础通道、Flash 模型,以及一个在两者之间进行路由的地方。
如何在三十秒内做出决定
问问是否有任何东西在等待该响应。如果某个人或下游服务被阻塞,且工作负载受延迟限制而非受吞吐量限制,并且你已经确认推理投入并非你延迟的真正驱动因素,那么 Prime 的溢价就是这项功能的价格,你应该支付它。如果没有任何东西在等待——批处理作业、离线评估、批量提取,以及任何由队列吸收延迟的情况——那么你就是在为一个人永远不会看的数字,按每单位吞吐量支付三分之一的溢价,而基础通道才是正确答案。
更宏观的问题在于,这个系列是如何被销售的。GLM-5.3 只在 8 月发布过一次,而 9 月已经为它产生了至少四种不同的价格,取决于你落在哪条线路、哪个平台以及哪个同系列模型上。Prime 是其中最贵、也最少有文档说明的,因为名字出现在权重上的那家公司并没有把它列出来。这并不是反对购买它的理由。这是在主张:在你将生产流量接入它之前,应当知道,相较于基础模型,你多买到的唯一东西就是一块秒表——而且这块秒表按 token 计费。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
