生成了一张标题卡,上面写着“GPT-6 vs GLM 5.3”,还有一个标签写着“GLM 5.3:开放权重,发布于 2026-08-18”,以及一个标签写着“GPT-6:闭源权重,发布于 2026-09-22”,页脚写着“AA 同行组不同:开放权重与专有模型的分数不可相减。”OrcaRouter 标志合成在右下角。
Guides & Insights

GPT-6 与 GLM 5.3:其中一款你可以下载,而价格差距比指数差距还小

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

拿 GPT-6去对比 GLM 5.3的理由,并不在于那张基准测试表,而在于:GLM 5.3 是这个价位段里唯一一个你能把权重带回家的模型,而 GPT-6 是闭源的一代,其三个成员只能通过 API 访问。这一差别比任何指数差值都更能左右采购决策,也正是两者的分数无法直接比较的原因——而这恰恰是大多数公开发表的这对模型对比文章弄错的地方。

正是这两侧

GLM 5.3 是 Z.ai 的旗舰模型,于 2026 年 8 月 18 日发布,权重约一周后公布。它是一个纯文本模型——不支持图像输入——具有 1,000,000 个 token 的上下文窗口和 128,000 个 token 的输出上限,Z.ai 标价为每百万输入 token 1.40 美元、每百万输出 token 4.40 美元,缓存输入费率为每百万 0.234 美元。其服务所用的模型 ID 为 z-ai/glm-5.3。

GPT-6 是一代,而不是一个模型。GPT-6 Astra、GPT-6 Sol和GPT-6 Luna是三个 ID,对应三个价位,均于 2026 年 9 月 22 日发布,在输入侧均为多模态(文本、图像和文件),上下文窗口都接近 1,050,000 个 token,输出上限为 128,000 个 token。不存在 openai/gpt-6 端点。在价格讨论中,当有人说“GPT-6”时,几乎总是指 GPT-6 Sol,即 $2.00 / $10.00 的中档——因此,在只需要一个 ID 的地方,本比较采用的就是这个成员。

• 权重 — GLM 5.3 开放,可下载、可自行托管;GPT-6 闭源,仅提供 API
• 输入模态 — GLM 5.3 仅支持文本;GPT-6 的三个档位均接受文本、图像和文件
• 输入价格 — GLM 5.3 每百万 $1.40,对比 GPT-6 Sol 每百万 $2.00
• 输出价格 — GLM 5.3 每百万 $4.40,对比 GPT-6 Sol 每百万 $10.00
• 缓存输入 — GLM 5.3 每百万 $0.234,对比 GPT-6 Sol 每百万 $0.20
• 上下文 — GLM 5.3 1,000,000 tokens,对比 GPT-6 Sol 1,050,000 tokens
• 长请求计费阶梯 — GLM 5.3 在其公开的说明卡上没有;GPT-6 Sol 在输入超过 272,000 tokens 时会将整个请求重新定价为 $4.00 / $15.00
• 许可证 — GLM 5.3 以 Z.ai 自家的开放许可证发布;GPT-6 没有许可证文件,因为没有什么可授权的

注意价格行上的说明,因为这一点确实存在,而且本博客之前已经碰到过:OrcaRouter 的模型页面并不总是与供应商自己的费率卡保持同步,具体到 GLM 5.3,我们的目录中是 $1.26 / $3.96,而 Z.ai 公布的数字是 $1.40 / $4.40。当两者不一致时,在正文中引用供应商的数字——上面的项目符号正是这么做的——并把页面上的数字理解为该页面自身的值。两者都是合理的;它们只是并非同一个数字。

为什么指数比较需要警告标签

这就是陷阱所在。在 Artificial Analysis 智能指数上,GLM 5.3 的得分为44.8,而 GPT-6 Sol 的得分为47.6——相差 2.8 分。这看起来像是一个闭源模型与一个开源模型几乎打成平手,而后者的输出价格大约只有前者的五分之一,而这正是大多数针对这一对的比较所止步的那句话。

这不是一个有效的减法。Artificial Analysis 只将开放权重模型与同规模级别的其他开放权重模型进行排名比较,而对专有模型则在一个专有区间内排名,采用 3∶1 的输入输出混合价格比。GLM 5.3 的 44.8 是一个开放权重分数。GPT-6 Sol 的 47.6 是一个专有区间分数。它们处于不同的量表上,二者之间的差距并不是对能力的度量。同样的注意事项也适用于 OrcaRouter 目录条目上的那两个数字,上面这两个数字正是出自那里。

在该行中可比较的是成本核算和费率卡,其次是以相同方式运行同一评估的那些行。请阅读这两个页面:

• AA Coding Index — GLM 5.3 74.8,对比 GPT-6 Sol 的 60.0
• GPQA Diamond — GLM 5.3 91.7
• Humanity's Last Exam — GLM 5.3 42.3,对比 GPT-6 Sol 的 47.9
• Terminal-Bench 2.1 — GLM 5.3 83.9
• Terminal-Bench 4.0 — GLM 5.3 41.9,对比 GPT-6 Sol 的 43.9
• τ-bench banking — GLM 5.3 50.3
• SciCode — GLM 5.3 59.0,对比 GPT-6 Sol 的 57.6
• 长上下文召回 — GLM 5.3 79.7,对比 GPT-6 Sol 的 83.7

要把它当作能力轮廓来读,而不是当作分数差距:GLM 5.3 在智能体与编程类评测上表现强劲——τ-bench 银行业务和 SciCode 都偏向它,其 Coding Index 也远高于 Sol——而 GPT-6 Sol 则占据长上下文召回和 Humanity's Last Exam 这两行。这两种解读都不是定论。它们是两组不同的强项,由第三方测量,分别来自一个你可以下载的模型和一个你无法下载的模型。

开放权重在这里究竟有什么价值

关心 GLM 5.3 的许可证,原因不在于意识形态,而在于:一旦权重归你所有,有三件具体的事就不再由厂商说了算。

第一点是数据驻留。自托管的 GLM 5.3 运行在你所部署的位置,没有任何数据处理协议来约束离开你网络的数据。GPT-6 没有对等的选项——调用它的唯一途径是通过 API,而数据会流向你无法掌控的地方。对于受监管的工作负载而言,这往往就是决策的全部,而这一决策是索引永远无法体现的。

第二个是价格曲线。API 费率表是供应商给出的数字,供应商可以调整;已公布的 GPT-6 费率被供应商称为永久性费率而非促销费率,但那是一种关于意图的声明,而不是合同。自有模型权重有一项固定成本,不再随 token 数量增长,而交叉点取决于你的用量,而不是任何人的定价决策。这就是为什么 $1.40 / $4.40 的费率表并非真正的比较对象——真正的比较是 $1.40 / $4.40 与按你自身流量摊销的自有硬件之间的比较。

第三个是失效模式。托管模型可能被弃用、限流,或因服务变更而性能下降。GLM 5.3 自 8 月 18 日起便可调用,背后有一个公开检查点;如果 Z.ai 做出了你不认同的改动,你验证时所用的那个检查点仍然在磁盘上。

这种自由的代价也是实实在在的,值得明说。GLM 5.3 仅支持文本,因此,如果某个工作负载需要把截图或 PDF 输入模型,那么在这一对比的开源权重一侧就根本没有可行路径。自行提供 100 万 token 的上下文可不是在笔记本电脑上就能应付的事。而且,你下载的模型就得由你负责——评估、安全过滤、正常运行时间和升级都成了你自己的事,这是一笔实实在在的工程预算,API 价格并不包含在内。

GPT-6 在哪里物有所值

相比之下,支持封闭一方的理由范围比其价格所暗示的要窄,但并非毫无内容。

多模态输入是其中具体的一项。GPT-6 的三个层级都原生接受图像和文件,而 GLM 5.3 两者都不接受。一条能在同一次调用中读取图表、截图或扫描文档并据此推理的流水线,无法在已发布的 GLM 5.3 上构建。

长上下文召回是第二项。GPT-6 Sol 在该行上以四分领先 GLM 5.3,而这一行决定了一个超大上下文究竟是真正可用,还是仅仅被接受。一个会丢失文档中间部分的 1,000,000 token 窗口,比一个不会丢失的 100,000 token 窗口要更大。

而且这一代产品不止一个价格档位。通常被拿来与 GLM 5.3 对比的是 $2.00 / $10.00 的 Sol 卡,但 GPT-6 Luna 的定价为 $0.10 / $0.50——比 GLM 5.3 的输入价格低一个数量级,比其输出价格低了近九倍——而 9 月 29 日发布的 GPT-6.1 Sol 在同一指数上以 Sol 的价格拿下 51.8 分。如果问题纯粹是"最便宜且够用的 token",那么 GPT-6 这一代给出了 GLM 5.3 所没有的答案。

A generated two-column comparison scoreboard titled "GPT-6 Sol vs GLM 5.3 — the scoreboard". The left column, GPT-6 Sol, reads Weights closed, Input $2.00, Output $10.00, AA Intelligence 47.6, AA Coding 60.0, Long-context recall 83.7. The right column, GLM 5.3, reads Weights open, Input $1.40, Output $4.40, AA Intelligence 44.8, AA Coding 74.8, Long-context recall 79.7. A footer line reads "AA ranks open-weights and proprietary models on different peer scales; the two Intelligence figures are not subtractable." The OrcaRouter logo is composited in the bottom-right corner.

将它们一起运行,这是大多数团队最终选择的答案

这一比较的实际结论是,二者并非互斥。GLM 5.3 一直在承接非常大的调用量——OrcaRouter 的目录记录显示,在七天的窗口期内约有 19 亿 token 被路由至它,而 GPT-6 Sol 约为 210 万——这正是当团队将批量工作交给一个输出价格低廉的开放权重模型时,它会呈现出的样子。同一窗口期内,GPT-6 的流量集中在更高层级,因为那里的工作属于需要多模态输入或高级模型的那类任务。

两者都是同一目录中的实时路由,且都位于 OrcaRouter 上:用一个 API 统辖 200 多个模型,通过兼容 OpenAI 的端点调用,供应商的标价以 0% 加价率透传,因此供应商一调价,我们这边当天就能生效,而不用等到你的下一个计费周期。在这次特定的对比中,这一点比平常更重要,因为整个 GLM 5.3 的价格问题上有一个变动因素——目录数字和供应商数字已经相差约 10%——而透传路由意味着你按供应商的数字付费,而不是按一个掩盖了该数字的加价。

路由 DSL 的作用就是让这种拆分变得明确:把大批量的纯文本分类与提取流量发送给 GLM 5.3,把多模态或长召回任务发送给 GPT-6 层级,按请求而非按季度,并让 自动故障转移覆盖任意一侧。开源权重与 API 之争不再是一种全有或全无的架构承诺,而是变成一条你下周就能更改的路由规则。

Screenshot of the OrcaRouter model page for z-ai/glm-5.3, showing the Z.ai vendor label, a 2026-08-18 catalogue release date, a context of 1M tokens, a 128K maximum output, text-only input, Tools, JSON and Reasoning badges, and a rate strip reading $1.26 per million input tokens, $3.96 per million output tokens, a 4.54 s median time to first token, a 10.00 s p95, and 1,903.6M tokens routed in seven days.

裁决,这是一个关于你约束条件的问题。

如果你能够自托管、需要大规模纯文本吞吐量,或者有 API 无法满足的数据驻留要求,那么 GLM 5.3 就是答案,而且价格差足够大,足以支撑部署运维工作。如果你需要图像和文件输入,如果长上下文召回是关键支撑,或者你不想自己运维模型,那么 GPT-6 就是答案,而这份溢价买到的是具体的能力,而不是一个品牌。

两个答案都不是:“GPT-6 得分高出 2.8 分”。这个减法不能做,因为这两个数字来自同一榜单上的不同同类组——而基于它构建的比较,会是在援引一个数字,仿佛它衡量了某种它实际并不衡量的东西。费率表是可比的。许可状况是可比的——这里的可比,是指二者截然不同。指数中的各行则不可比。

Screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1,050,000-token context window (shown as 1.05M-token context in the model blurb), a 128K maximum output, text, image and file input, and a rate strip reading $2.00 per million input, $10.00 per million output, a 6.79 s median time to first token, a 10.00 s p95, and 2.1M tokens routed in seven days.

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新