
GLM 5.3 Prime:相同的 GLM-5.3 权重,价格正好是费率表的两倍
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
GLM 5.3 Prime 每百万输入 token 收费 2.80 美元,每百万输出 token 收费 8.80 美元。它所运行的模型 GLM-5.3 则收费 1.40 美元和 4.40 美元。这不是四舍五入造成的差异,也不是促销价差——它在两项上都恰好是 2.0 倍,而且是这两个产品唯一存在分歧的地方。GLM 5.3 Prime 不是新模型。它承载的是 GLM-5.3 自己的权重,即 Z.ai 于 2026 年 8 月 25 日开放的那套权重,只是背后换上了更快的服务栈。GLM-5.3 本身于 2026 年 8 月 14 日发布,并于 8 月 18 日登陆 API。当 Prime 这个 ID 在 9 月下旬出现时,底层模型没有任何改变。改变的是,有人给它贴上了第二个价签。
如果你正在读这段话,是因为某个模型列表在一个你熟悉的名字旁边显示了一个陌生的名字,那么简短的回答是:你看到的是一个服务层级,而不是一次发布。更长的回答值得花上两分钟,因为这里的算术异常干净,而来源却异常模糊。
用一段话说明“Prime”等级是什么
服务层级是第二个产品 ID,指向相同的权重,针对吞吐量而非成本进行调优。你不会得到更大的模型、更长的上下文、更好的推理模式或更广的工具面。你能更快地把 token 送出门,并且要为这项特权按每个 token 付费,而不是按你省下的墙上时钟时间付费。这种权衡是真实存在的,有时也是正确的——一个进行十次顺序调用的多步骤智能体循环,确实能从每次调用更快返回中获益——但这是购买延迟,不是购买能力,并且它应当按此定价。
GLM 5.3 Prime 的厂商描述直接说出了不言自明的那部分:它是“Z.ai 的 GLM-5.3 的高速变体,继承其全部能力,同时通过推理加速实现 1.5–2 倍的输出吞吐量”。完整能力。同样 1,000,000 token 的上下文窗口。同样 131,072 token 的输出上限。文本输入,文本输出。推理为必选项,可选low、high 和 max 三档思考强度,默认使用max——与基础模型完全一致。
费率卡,并排显示
• 输入 — GLM 5.3 Prime 每 100 万 token $2.80,对比 GLM-5.3 每 100 万 token $1.40
• 输出 — GLM 5.3 Prime 每 100 万 token $8.80,对比 GLM-5.3 每 100 万 token $4.40
• 缓存输入 — GLM 5.3 Prime 每 100 万 token $0.56,对比 GLM-5.3 每 100 万 token $0.26
• 倍数 — 三项均为 2.0×,双向都适用
• 上下文 — 两者均为 1,000,000 个 token
• 最大输出 — 两者均为 131,072 个 token
• 推理 — 两者均为强制启用,相同的三档努力级别,相同的默认值
缓存这一项正是人们容易忽略的。缓存读取是你从前沿模型那里能买到的最便宜的 token,而智能体工作负载真正花钱的地方恰恰在这里——系统提示、工具定义以及不断增长的对话记录,每轮都会被重新读取。缓存费率翻倍,长时间智能体会话中最大的一笔开销就随之翻倍,这意味着真实工作负载上的实际溢价更接近 2 倍,而非新输入 token 的表面价差所暗示的那样。如果你原本指望"快车道"在实践中会更便宜,因为你做了积极的缓存,那它并不会。
到底是谁在卖它?
这正是这份清单开始变得有意思的地方,也是细心的读者应当放慢速度的地方。Z.ai 自家的文档、模型概览以及已公布的定价页面,都没有列出 Prime 这个 SKU。在该厂商的模型 ID 中搜索 glm-5.3-prime,你什么也找不到。Z.ai 自家的速度层级完全属于另一条产品线上的另一个产品——GLM-5.3-FlashX,它归属于更便宜的 Flash 系列,于 2026 年 9 月 18 日推出,定价为每百万 token 0.37 美元和 1.25 美元。
所以 Prime 是一个平台侧产品,建立在 Z.ai 的权重之上。有两个细节指向它属于哪个平台。第一个是“1.5–2× 输出吞吐量”这个说法,它与一家大型云服务商用来描述自家加速服务模式的措辞完全相同——你通过切换模型 ID 来启用这种模式,而能力和使用限制明确保持不变。第二个是,该上架信息在端点背后恰好只列出了一个上游提供商。快速层级 SKU 背后只有一个提供商,并不是开放权重模型被提供服务的方式;那是一个平台自家加速部署从外部看起来的样子。
这一切都不会让 GLM 5.3 Prime 变成一个糟糕的产品。它只是让它变成一个只有单一供应商的产品,而这是在让生产流量经由它路由之前,你应当提出的一个韧性方面的问题。
速度声明值多少

1.5–2× 这个数字是在厂商自家条件下测得的吞吐量宣称,而吞吐量恰恰是对这些条件最敏感的指标。在热缓存、短提示词和空闲集群下得到的每秒输出 token 数,并不是长上下文智能体所看到的数字。对基础模型的独立测量显示,GLM-5.3 的每秒输出 token 数约为 61,GLM-5.3-Flash 约为 46,而在该测试集上同类平均为 67——所以更便宜的那条路线也是更慢的一条,这与名称给人的暗示恰好相反。这些是标准化评估集上的中位数,而非峰值。
还有一个更微妙的成本。两个 ID 的 reasoning effort 默认值都是 max,而这是会产生最长思维链的设置。在这里,速度和冗长度朝相反的方向拉扯:一个同样以最大长度进行推理的快速层级,在困难问题上端到端仍可能很慢,因为瓶颈在于模型决定生成的 token 数量,而不是它生成这些 token 的速率。如果你的工作负载以推理为主,在花 2 倍代价换取加速之前,先降到 high或low——努力等级对延迟的影响会比服务层级更大。
购买同一型号的三种方式

GLM-5.3 现在以三种可购买的形式存在,而它们并不是三个模型:
• GLM-5.3,$1.40 / $4.40 —— 基础价目表,完整能力,即公开了开放权重、可自行托管的那个版本
• GLM 5.3 Prime,$2.80 / $8.80 —— 同样的权重,经由加速技术栈提供,仅一个上游供应商,不涉及权重
• GLM-5.3-FlashX,$0.37 / $1.25 —— 根本不是 GLM-5.3,而是更便宜的 Flash 系列中的速度档位,也是购买低延迟迄今最便宜的方式
第三行值得你仔细盯着看。如果你真正想要的是更快的 token 输出速度,并且对从哪个 GLM 获得这些 token 比较灵活,那么 FlashX 能在一个本身成本大约只有旗舰模型十分之一的模型上提供加速,而花费不到旗舰模型未加速时的一半。Prime 只有在你还特别需要 GLM-5.3 的推理质量,并且特别需要更快得到它时,才说得通。
这在我们这边处于什么位置

我们应该把一件事说清楚:OrcaRouter 不托管 GLM 5.3 Prime,我们也不托管 GLM-5.3-FlashX。这两个模型页面在我们网站上都会返回 404。如果你想要加速档,就必须从出售它的平台购买,或者从厂商自己的 API 购买基础模型。
我们托管的是 GLM-5.3 和 GLM-5.3-Flash,按提供商的标价提供,我们不收任何加价——就是你在 Z.ai 自家价目表上看到的 $1.40 和 $4.40,原样传递,而非重新定价。对于一个定价在六周内已经变动两次的模型来说,这一点比听起来更重要。由于我们不添加价差,供应商那边价格一变,我们这边当天就会同步生效,无需迁移,也无需提交支持工单。这两个 ID 与 200 多个其他模型共用同一个 API 密钥,因此 GLM-5.3 与 GLM-5.3-Flash 之间的 A/B 测试只需改一行模型名称,而不必再签一份合同,并且如果某个上游提供商性能下降,自动故障转移会为你兜底——这正是单一供应商提供的快速层所特有的风险。
你应该支付2倍吗?
在以下情况下为它付费:有人类或上游服务因等待响应而受阻,工作负载是延迟受限而非吞吐受限,并且你已确认推理投入是造成你延迟的真正原因。在以下情况下不要为它付费:你在通宵运行批量生成;你的用量高到 2 倍的 token 溢价超过了你所节省的墙钟时间;或者你原本指望这一档位会悄然是一个更好的模型。并不是。它是带着秒表运行的 GLM-5.3,而秒表按 token 计费。
眼下,对整个 GLM-5.3 系列最诚实的表述是:Z.ai 在 8 月发布了一个模型,而市场却花了整个 9 月,把它重新包装成四种不同的价格。GLM 5.3 Prime 是这些包装中最贵的一个。它也是书面记录最薄弱的那个,因为权重上署名的公司并未将其列出。这并不是避开它的理由。这是你在把它投入生产路径之前,确切弄清自己到底在买什么的理由。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
