一张为 GPT-6.1 Sol 与 GLM-5.3 对比生成的 hero 卡片,标题为“七个指数点,2.8 倍的价格”,徽章上分别写着“GPT-6.1 Sol:每个指数任务 $0.72”“GLM-5.3:每个指数任务 $2.01”和“GLM-5.3 权重:自 2026 年 8 月 25 日起可下载”,页脚写着“数据为 Artificial Analysis v4.3.2 的独立统计,最高努力档;卡片由 AI 生成”,右下角为 OrcaRouter 标志。
Guides & Insights

GPT-6.1 Sol 对决 GLM-5.3:权重已发布,账单却纹丝未动

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

OpenAI 发布了GPT-6.1,时间是 2026 年 9 月 29 日,在 DevDay 主题演讲上;而 Z.ai 发布了GLM-5.3,比这早六周,即 2026 年 8 月 18 日,随后又将该 checkpoint 延迟一周才放出。这一延迟已经结束:zai-org/GLM-5.3自 8 月 25 日起就一直在 Hugging Face 上,是一个约 7530 亿参数的 BF16/FP8 checkpoint,其中每个 token 约激活 400 亿参数,下载量此后已突破 140 万次。因此,自 8 月以来大多数对比一直在追问的那个问题——这是开源模型还是租用服务?——如今有了答案,而这个答案并没有改变这笔账。在独立榜单上,GPT-6.1 Sol 得分为 51.8,每完成一项索引任务的成本为 0.72 美元;GLM-5.3 得分为 44.8,成本为 2.01 美元。现在你可以拥有这个按 token 计价更便宜的模型,却仍要为每项完成的工作多付近三倍的钱。

每个模型实际上是什么

GPT-6.1 Sol 是 Open​AI 的中端 GPT-6 模型,比旗舰 GPT-6 Astra 低一档,但高于经济型 GPT-6 Luna。它拥有 1,050,000 个 token 的上下文窗口,输出上限为 128,000 个 token,知识截止日期为 2026 年 4 月 30 日,并接受文本、图像和文件作为输入。推理强度从 low 到 max,默认值为 medium;none 和 minimal 这些 GPT-6 Sol 曾接受的值现在会返回错误,Open​AI 自己的迁移指南通过告知开发者改用 low来解决这一点。其价格为每百万输入 token 收费 2.00 美元,每百万输出 token 收费 10.00 美元,缓存输入为 0.10 美元。

GLM-5.3 是 Z.ai 当前面向软件工程和长周期智能体任务的旗舰模型,它与 GLM-5.2 基于相同的专家混合底座,性能提升来自后训练,而非更大的模型。它是文本输入、文本输出——任何价位都不支持视觉——上下文窗口为 100 万 token,输出上限为 128,000 token,且思考模式永久开启。它没有非推理模式,这对延迟敏感的调用而言是一项硬性约束。Z.ai 官方标价为每百万 token 输入 $1.40、输出 $4.40,缓存输入 $0.26;我们自己的目录中定价为 $1.26 和 $3.96,缓存读取 $0.234,因此厂商价目表上的数字更为保守,也更适合作为讨论的依据。

费率表,以及颠覆它的那一行

每个维度一行,每行均包含两侧:

• 输入 — GPT-6.1 Sol 每 100 万 $2.00 对比 GLM-5.3 每 100 万 $1.40;GLM 便宜 30%
• 输出 — GPT-6.1 Sol 每 100 万 $10.00 对比 GLM-5.3 每 100 万 $4.40;GLM 便宜 56%
• 缓存输入 — GPT-6.1 Sol 每 100 万 $0.10 对比 GLM-5.3 每 100 万 $0.26;排序反转,Sol 便宜 2.6 倍
• 长上下文条款 — 当输入 token 超过 272,000 时,GPT-6.1 Sol 会对整个请求重新定价,输入和缓存按 2×、输出按 1.5× 计费;而 GLM-5.3 在公布的卡片上没有同等条款
• 上下文和输出 — 1,050,000 输入 / 128,000 输出 对比 100 万输入 / 128,000 输出;相差 5%,无关紧要
• 模态 — 文本、图像和文件输入,文本输出 对比 仅文本
• 推理下限 — GPT-6.1 Sol 低、中(默认)、高、xhigh、max 对比 GLM-5.3 始终开启,没有可下调的下限
• 权重 — 闭源,仅 API 对比 开放,可下载,FP8
• 独立评分,Artificial Analysis v4.3.2 在最大 effort 下 — 51.8 对比 44.8
• 每项索引任务的独立成本 — $0.72 对比 $2.01
• 索引运行的输出 token 数 — 6700 万 对比 2.1 亿

<img src="2.png" alt="一张生成的双栏对比记分板,标题为“GPT-6.1 Sol vs GLM-5.3——记分板”。左栏“GPT-6.1 Sol”:各行分别显示“智能指数:51.8”“每个指数任务成本:0.72 美元”“输入价格:每 100 万 2.00 美元”“输出价格:每 100 万 10.00 美元”“指数运行中的输出 token 数:6700 万”“权重:闭源”。右栏“GLM-5.3”:各行分别显示“智能指数:44.8”“每个指数任务成本:2.01 美元”“输入价格:每 100 万 1.40 美元”“输出价格:每 100 万 4.40 美元”“指数运行中的输出 token 数:2.1 亿”“权重:在 Hugging Face 上开源”。页脚写着“依据 Artificial Analysis v4.3.2 在最大 effort 下的独立数据;厂商目录价格。”OrcaRouter 标志位于右下角。" /> 最后一组数据正是这场较量分出胜负的地方,而且这一影响绝非微不足道。

A generated two-column comparison scoreboard titled 'GPT-6.1 Sol vs GLM-5.3 - the scoreboard'. Left column 'GPT-6.1 Sol': rows reading 'Intelligence Index: 51.8', 'Cost per index task: $0.72', 'Input price: $2.00 per 1M', 'Output price: $10.00 per 1M', 'Output tokens on index run: 67M', 'Weights: closed'. Right column 'GLM-5.3': rows reading 'Intelligence Index: 44.8', 'Cost per index task: $2.01', 'Input price: $1.40 per 1M', 'Output price: $4.40 per 1M', 'Output tokens on index run: 210M', 'Weights: open on Hugging Face'. A footer reads 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.' The OrcaRouter logo sits in the bottom-right corner.

2.1 亿 token 的难题

Artificial Analysis 对其榜单上的每一个模型都运行同一套十项评测,并公布每个得分背后的 token 计数。GLM-5.3 完成该次运行生成了约 2.1 亿个输出 token。GPT-6.1 Sol 生成了 6700 万个。按照榜单上各模型自身所属的对比类别来看,GLM-5.3 的 2.1 亿高于约 1.4 亿的类别中位数,而 Sol 的 6700 万则远低于其被评分所在旗舰类别约 8100 万的中位数。由于输出是每一张费率表中昂贵的一端,GLM-5.3 在输出项上作为宣传亮点的 56% 折扣一旦与实测数据对照便不复成立:它以 0.44 倍的价格输出了 3.1 倍的 token,而 3.1 × 0.44 等于 1.37——尽管费率表明显更便宜,GLM-5.3 在这一工作负载上却是更贵的模型。

董事会自己给出的每任务成本数据证实了这一方向和大致的幅度。2.01 美元对 0.72 美元是 2.8 倍,比单看 token 比例所暗示的差距更大,因为 GLM-5.3 在每项任务的输入和缓存项上也付出更多。值得精确说明这能证明什么、不能证明什么:该指数运行是十项固定评估,它们上面的冗长度并不等同于你实际流量上的冗长度。但对买家来说,计费的是 token,而在任何模型必须产出长答案的任务集上,这种差异的形态都是一样的。

部分抵消来自缓存输入这一项。GLM-5.3 的缓存读取价格为 $0.26,基础价格为 $1.40;GPT-6.1 Sol 的缓存读取价格为 $0.10,基础价格为 $2.00——在这一费率上,Sol 以 2.6 倍的优势胜出,而这一费率主导着任何具有稳定前缀的工作负载。如果你的流量是大型固定语料库,答案只有一段话,那么 GLM-5.3 显然就是更便宜的选择,你应该选它。如果你的流量看起来像这两个模型都为之打造的那类流量——智能体循环、仓库级编辑、长生成输出——那么在 3 倍的 token 比率面前,缓存输入的优势就沦为噪声。

供应商编号落在哪里

Z.ai 的发布数据很亮眼,而且一如既往地未经复现。Terminal-Bench 2.1 为 88.2,DeepSWE v1.1 为 66.9,CyberGym 为 84.5,ExploitBench 为 54.4,AutomationBench 为 48.2,GDPval-AA v2 为 1769 Elo。唯一值得读两遍的数据是 Terminal-Bench 3.0 的 28.3——这是后继基准,也是对旧基准上 88.2 的修正。一个模型可以在其后训练所针对的基准上表现优异,而在同一基准的下一代上表现平平。

OpenAI 为 GPT-6.1 Sol 公布的各项数据,完全是围绕每完成一项任务的成本、而非原始分数来呈现的:DeepSWE v1.1 在推理投入更低的情况下,比 GPT-6 Sol 的最好成绩高出 6.4 个百分点;AutomationBench 1.0.6 在中等推理投入下比 Claude Opus 5.5 高出 2.2 分;OSWorld 2.0 在最高推理投入下比 GPT-6 Sol 高出七分;Terminal-Bench Science 0.1 以不到一半的每任务成本,成绩达到 GPT-6 Sol 的两倍以上。请注意,这些用的都是 OpenAI测试框架、OpenAI设置和OpenAI选定的基准集,且没有任何一项经过独立复现。

两家供应商公布的结果集之间重合很少,而唯一可用的直接对比是在同一个基准上:Z.ai 报告在 DeepSWE v1.1 上为 66.9,OpenAI 报告 GPT-6 Sol——即 6.1 所取代的模型——为 68.8,并报告 6.1 Sol 相较其自身前代提升了 6.4 点。在供应商报告的对比上相差两分,而在 OpenAI 自身的提升差值上相差约六分。这近乎一次受控比较,并且它说明了独立委员会所说的:能力上接近持平,完成任务的成本上差距很大。

一个 API,还是两个契约

这两款模型都托管在 OrcaRouter 上,而这是这一组合中不寻常的地方。GPT-6.1 Sol 在发布当天就以 OpenAI 自己的标价进入了目录——每百万 token 2.00 美元和 10.00 美元,缓存输入 0.10 美元,272,000 token 后升至 4.00 美元和 15.00 美元的档位也完全按供应商所列原样传递——而 GLM-5.3 与它并列,价格为 1.26 美元和 3.96 美元,缓存读取为 0.234 美元。两者都没有任何加价:平台原样传递提供商的标价,这就是为什么供应商降价当天就会体现在我们这边,而不是等到经销商重新议价之后。

A screenshot of the OrcaRouter model page for z-ai/glm-5.3, showing the listing dated 2026-08-18, the model described as Z.ai (Zhipu AI)'s latest flagship for complex software engineering and long-horizon agentic tasks, a 1M-token context with 128K maximum output, text in and text out, and the pass-through list price of $1.26 input and $3.96 output per million tokens, with the page's own pricing tabs and a 4.00 s median time to first token visible.

对这对特定组合而言,这一点比大多数情况都更重要。在它们之间做选择,不是“哪个更好”——而是你自己输出长度上的一个阈值,而一旦 Z.ai 提高其费率卡,或 Open​AI 改变 6.1 档位的分层边界,这个阈值就会第一次移动。把两者都放在同一个密钥之后,在它们之间自动故障转移,并用一条通过配置而非部署来更改的路由规则,才能让你在真实流量上测试那个阈值,而不是为它争论不休。如果 Sol 的缓存那一行在你的工作负载中胜出,就按它路由;如果你的回答长度保持较短,而 GLM-5.3 没有上下文断崖的固定费率卡在这一细分中胜出,那就改按它路由——同一个密钥,没有第二份合同,没有第二笔账单。

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

如果今天必须选一个,你选哪个?

• 长篇幅生成输出、智能体循环、输出密集型工作 —— GPT-6.1 Sol,而一旦把 token 数算进去,差距接近三倍。这里正是费率表说谎、而实测不说谎的地方。
• 稳定前缀、简短回答 —— GLM-5.3。其缓存输入费率和输入费率确实更优,而啰嗦根本没机会造成伤害。
• 任何超过 272,000 输入 token 的请求 —— GLM-5.3,因为 GPT-6.1 Sol 在该阈值处会对整个请求重新计价,而 GLM-5.3 的费率表没有对应的阶梯。
• 任何以图像或文档作为视觉输入的内容 —— GPT-6.1 Sol。GLM-5.3 仅支持文本,这里差距不小。
• 在你自己边界内进行推理,或对冲供应商条款变化的风险 —— GLM-5.3,而且现在下载已经存在,不再是空头承诺。要为硬件预留预算:该 checkpoint 是一个大型 FP8 产物,自托管是资本层面的决策,而非 API 层面的决策。
• 对延迟敏感的调用 —— 两者都需谨慎。GLM-5.3 无法关闭推理;GPT-6.1 Sol 的下限是 low,而它在独立榜单上的首 token 时间实测为 332 秒,榜单中位数则为 3.7。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新