一张生成的主视觉标题卡,标题为“GPT-6 Luna vs GLM-5.3”,副标题为“以十倍的每任务成本换取八个指数点,而模型权重仍未公开。”,标签显示 Luna 为每 1M $0.10/$0.50、指数 37,GLM-5.3 为每 1M $1.40/$4.40、指数 45,每个指数任务成本为 $0.07 对 $0.68,右下角是 OrcaRouter 标志。
Guides & Insights

GPT-6 Luna 与 GLM-5.3:你仍然无法下载的开放权重模型

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

GLM-5.3是更好的模型。在最高推理强度下,它在 Artificial Analysis Intelligence Index 上得分 45,而GPT-6 Luna为 37;据 Z.ai 称,它在部分网络安全评估中与 Mythos 5 持平,并且在多个综合榜单上都是领先的开放权重模型。不过眼下,它仍是一个你租用的 API,而不是你拥有的模型:出于网络安全方面的担忧,Z.ai 将权重发布推迟了大约两周,而那个本应是开放权重旗舰模型全部意义的下载,目前仍未出现。

那个延迟就是这场对比的关键所在,而它改变算术的方式恰恰是价格表所忽略的。GPT-6 Luna 于 2026 年 9 月 22 日推出,输入每百万 token 收费 0.10 美元,输出每百万 token 收费 0.50 美元,全面开放,没有任何附加条件。GLM-5.3 于 2026 年 8 月 18 日推出,收费分别为 1.40 美元和 4.40 美元——输入费率是 Luna 的十四倍,输出费率接近其九倍——而其权重却未公开。所以,这并非开源与闭源之间的比较。而是一个你今天就能调用、成本只有十分之一的闭源模型,对比一个你今天同样只能调用、却按仿佛在购买你还无法获得之物来定价的开源模型。

两款车型,相隔一个月,两笔截然不同的交易

GPT-6 Luna 是 OpenAI GPT-6 代际中的小杯版本,与 GPT-6 Sol 一同发布,定价为每百万 token 2.00 美元/10.00 美元,位于旗舰款 GPT-6 Astra(10.00 美元/50.00 美元)之下。它具备 1,050,000 token 的上下文窗口、128,000 token 的输出上限,支持文本和图像输入,并配备一档从 none 到 low、medium、high、xhigh 和 max 的推理阶梯——默认档位为 medium。OpenAI 称其为该系列中最高效的模型,适合专注、高吞吐量的工作,而价目表也印证了这一点:缓存输入为每百万 token 0.01 美元,仅为本就低廉的非缓存输入价格的十分之一。

GLM-5.3 是 Z.ai 当前面向复杂软件工程与长周期智能体工作的旗舰模型,于 2026 年 8 月 18 日发布。它是文本输入、文本输出,拥有 100 万 token 的上下文窗口和 128,000 token 的输出上限,并且始终处于推理状态——不存在非推理模式。Z.ai 称其编码体验相较 GLM-5.2 提升约 50%,并将其定位为仓库级编码和自主多步骤工程。权重落地之时将成为最大亮点;而目前实际可用的则是 API。

这两张费率卡究竟写了什么?

每个维度一行,每行均包含两侧:

• 每 100 万输入 — GPT-6 Luna $0.10 对比 GLM-5.3 $1.40

• 每 100 万 tokens 输出 — GPT-6 Luna $0.50 vs GLM-5.3 $4.40

• 缓存输入 — GPT-6 Luna 每 100 万 $0.01,对比 GLM-5.3 每 100 万 $0.26,在其自身输入费率基础上享受 81% 的折扣

• AA Intelligence Index —— GPT-6 Luna 在最高努力程度下得分 37,对比 GLM-5.3 在最高努力程度下得分 45

• 默认努力得分——GPT-6 Luna 29 在中等默认设置下对比 GLM-5.3 常开推理,以最高设置测量

• 索引运行中的输出 token 数——GPT-6 Luna 150M 对比 GLM-5.3 210M,而榜单中位数为 140M

• 运行该指数的成本 —— GPT-6 Luna $122.39 对比 GLM-5.3 $2,503.48

• 每个索引任务的成本 —— GPT-6 Luna 约 $0.07,而 GLM-5.3 约 $0.68

• 上下文与输出 — GPT-6 Luna 1,050,000 输入 / 128,000 输出 对比 GLM-5.3 1M 输入 / 128,000 输出

• 长上下文条款——GPT-6 Luna 输入和缓存为 2 倍,输入超过 272K 时输出为 1.5 倍,按整次请求计;相比之下,GLM-5.3 在已发布卡片上没有对应条款

• 推理关闭开关——GPT-6 Luna 提供 none 到 max,而 GLM-5.3 始终开启,没有非推理模式

• 权重 — GPT-6 Luna 闭源,仅提供 API;而 GLM-5.3 按承诺开源,发布推迟

A generated single-panel scoreboard card headed 'Same suite, ten times the task cost' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M with index 37 at max effort; GLM-5.3 $1.40 in / $4.40 out per 1M with index 45 at max effort; cost per completed index task about $0.07 against about $0.68; output tokens on the index run Luna 150M against GLM-5.3's 210M and a board median of 140M; reasoning configuration Luna none through max against GLM-5.3 always on with no off switch; and weights, Luna closed and API-only against GLM-5.3 open by commitment with the release delayed. Footer: 'Index and cost per task per Artificial Analysis; prices per OpenAI and Z.ai.'

冗长税才是决定这一切的数字。

八分的指数差距是真实存在的,而价格差距更大,但两者都不是最重要的数字。真正重要的是每个已完成任务的输出 token 数,因为正是在这里,八分的能力优势要么能收回成本,要么不能。

Artificial Analysis 的指数测试运行是目前可获得的最干净的受控比较:相同的测试套件、相同的测试框架,对两个模型分别运行。GLM-5.3 在完成它时生成了 2.1 亿个输出 token。GPT-6 Luna 生成了 1.5 亿个。相较榜单中位数 1.4 亿,两者都话多——GLM-5.3 比中位数高出五成,GPT-6 Luna 高出约一成。但这一差异的方向在价格上对 Z.ai 的模型更为不利:它多生成了 40% 的 token,而且每个 token 的收费是后者的 8.8 倍。

把两者放在一起看,GLM-5.3 每完成一项索引任务的成本约为 0.68 美元,而 GPT-6 Luna 约为 0.07 美元——差距大约十倍,比原始价目表上的比率还要大,因为更贵的模型同时也是更啰嗦的那个。这就是这种组合的真实面貌。GLM-5.3 以每完成一项任务十倍的花费,为你换来八个索引点,而这笔购买是否划算,完全取决于你的工作负载是否属于那种八个点就决定能不能用的场景。

对于许多生产流量来说,情况并非如此。对于在模型能力边缘处理代码仓库的编程智能体来说,情况却常常如此,而再大的价格优势也无法弥合失败任务上的能力差距。

为什么开放权重会改变答案,以及为什么延迟会把它改回去

开源权重旗舰模型的标准论点是:按 token 计价的价格只是暂时的。你先租用,直到你的用量足以证明购买划算,然后下载模型,此后每个 token 的边际成本就变成了电费。按照这一论点,GLM-5.3 的 $1.40/$4.40 实际上并不是 GPT-6 Luna 的 $0.10 的十四倍——它是在通往零成本道路上的过渡价格,而闭源模型更便宜的费率则是一种没有退出机制的租赁。

那个论点是正确的,而它目前被暂时搁置了。Z.ai 因网络安全方面的发现,将权重推迟了大约两周才发布,这意味着支撑其溢价的那条退出通道目前还不存在。在它出现之前,GLM-5.3 是一个按量计费的 API,其每项任务成本是某个模型的十倍,而后者在通用榜单上落后它四个指数点、在编程榜单上落后一个点——买家正以开放权重的价格,为封闭权重的访问付费。

有一个二阶要点值得点明。这次延迟不是丑闻;而是供应商认真对待一项能力发现,而一个能出色发现漏洞的模型,恰恰是实验室在将其作为可下载文件发布时应当谨慎对待的那类模型。但这确实意味着,权重的发布日期现在是这项比较中唯一最重要的日期,而它并未公布。一个团队若要在十二个月的时间跨度上在这两个模型之间做选择,就是在选择一个条款可能下个月就改变的模型,和一个条款不会改变的模型之间做选择——而这两者中只有一种的定价与之相称。

迁移面很小

两个模型都提供 OpenAI 兼容的 chat completions 接口,都具备 1M 级别的上下文窗口,输出上限均为 128,000 个 token,因此在两者之间迁移更接近于是改配置,而不是重写。真正会让人吃苦头的差异在于行为层面,而非结构层面。

GPT-6 Luna 的长上下文条款是昂贵的那一条:输入 token 超过 272,000 的请求,整笔请求的输入和缓存费率按两倍计,输出费率按 1.5 倍计,因此一次 300,000 token 的调用,成本是同样工作拆成两次的两倍。GLM-5.3 公布的价目卡中没有对等条款,这在真正的大型单次请求上会大幅缩小价格差距,并且在输出密集型任务上可能使差距反转。

推理配置则朝着相反的方向起作用。GLM-5.3 始终开启推理,且不提供关闭的方式,这对任何对延迟敏感的场景都是硬性约束——分类器或路由器根本无法使用它。GPT-6 Luna 则提供 none、low、medium、high、xhigh 和 max 六档,默认为 medium,而在此档位下它得分 29,而非 37。仅这一个参数,就决定了 GPT-6 Luna 是落后 Z.ai 的模型八个指数点,还是落后十六个点;而一个在迁移时没有显式设置该参数的团队,实际运行的是第二种配置,却以为买到的是第一种。

GLM-5.3 已在 OrcaRouter 上架,价格与 Z.ai 的标价一致,采用直通定价,供应商调价当天就能反映到我们这边,而不必等经销商重新议价——对于一个核心指标预计会随权重落地而变化的模型来说,这一点比平时更重要。截至本文撰写时,GPT-6 Luna 尚未进入我们的目录,需通过 OpenAI 自家的 API 调用。同时使用两者的团队——考虑到两者在边缘场景上的差异之大,这才是此处理性的配置——可以用同一个密钥调用 GLM-5.3,同时沿用其已有的 OpenAI 方案,并且只需更改一条路由,而无需重新部署,就能在五美分的分类器与仓库级编码智能体之间切换流量

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

呼叫

凡是程序消费型且高吞吐量的场景,都选 GPT-6 Luna。分类、抽取、路由、批量摘要、智能体的内层循环。在 $0.10/$0.50 的价格下,缓存输入只需一美分,Batch 仅为标准费率的一半,它每完成一个任务的成本都比 GLM-5.3 低一个数量级,而八点的指数差距在你的评测中不会显现。显式设置 effort 参数,并让长调用保持在 272,000 个 token 以内。

当任务很难、答案比账单更重要时,就选 GLM-5.3。仓库级软件工程、自主多步骤工作,以及任何 8 个指数点就能决定任务完成还是失败的事情。冗长确实是一笔实打实的税负,十倍的任务成本也真实存在,但一个能完成的模型,比一个必须重试的模型更便宜。

另外,留意权重。Z.ai 发布 GLM-5.3 下载的那一天,就是这份对比的核心事实发生改变的那一天,而这是本页唯一一个尚未排上日程的日期。

A screenshot of the OrcaRouter model page for GLM-5.3 (z-ai/glm-5.3), showing the Tools, JSON and Reasoning badges, a 2026-08-18 catalogue date, 1M-token context with 128K maximum output, list pricing of $1.26 input and $3.96 output per 1M tokens, a p50 time to first token of 3.99s, 1807.1M tokens of traffic, and the description of GLM-5.3 as Z.ai's flagship model for complex software engineering and long-horizon agentic tasks.

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新