一张 GLM-5.2 对比 Kimi K3 的主视觉标题卡,副标题为"更便宜、更快,还是更大、更好",三个圆角胶囊徽章分别写着"各 1M token 上下文"、"AA Index 34 对 44"和"$1.40 / $4.40 对 $3.00 / $15.00",页脚一行写着"厂商费率卡与 Artificial Analysis,2026-09-23",右下角为 OrcaRouter 标志。
Guides & Insights

GLM-5.2 与 Kimi K3:更便宜更快,还是更大更好

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

GLM-5.2Kimi K3 于 2026 年年中相隔一个月相继问世,二者几乎完美地互为镜像。Kimi K3 于 2026-07-16 发布,开放权重随后于 2026-07-27 跟进,是两者中更大、纸面上也更强的模型:2.8 万亿参数,其中 1040 亿为激活参数,并且在两者共同参与评测的几乎所有基准上都得分更高。GLM-5.2 自 2026-06-16 起就已发布,是两者中较小的一个,7530 亿参数、400 亿激活,每输出词元的成本大约只有三分之一,中位响应速度更快,并且以 MIT 许可证发布,而非带有收入触发条款的定制许可证。

以上就是用一段话给出的结论。接下来是支撑它的证据——针对你可能会实际运行的作业所做的价格计算,两者足够接近、差异不过是噪声的那些测量值,以及一个与它旁边印着的数字并不可比的流行数字。

两人所处的位置

两者通常都可以通过各自厂商自己的 API 获取,都可以在 OrcaRouter 上路由,并且都有可下载的权重。在你接近任何基准测试之前,真正重要的差异在于:

• 发布日期 — GLM-5.2 于 2026-06-16,对比 Kimi K3 于 2026-07-16(Artificial Analysis 模型页面;OrcaRouter 自家针对 Kimi K3 的模型页面将其日期记为早一天,即 2026-07-15)

• 权重 — GLM-5.2 以 MIT 许可开源,而 Kimi K3 以 Kimi K3 许可开源,后者要求年模型即服务收入超过 2000 万美元时需另行签订协议,月活跃用户超过 1 亿时须进行显著署名(内部研究与开发除外)

• 规模 — GLM-5.2 总参数 753B / 激活参数 40B,对比 Kimi K3 总参数 2.8T / 激活参数 104B

• 上下文 — GLM-5.2 1,000,000 tokens 对比 Kimi K3 1,048,576 tokens

• 输入 — GLM-5.2 文本输入、文本输出,对比 Kimi K3 文本和图像输入、文本输出

• 已公布的最大输出 — GLM-5.2 为 128,000 tokens,而 Kimi K3 的 OrcaRouter 页面则未公布

在 OrcaRouter 上,两者都通过一个密钥、经由一个 OpenAI 兼容端点 https://api.orcarouter.ai/v1 访问,而且我们按供应商的标价原样透传,不加任何加价——因此下面的每一个数字都是供应商给出的,而不是我们的。

一百万 token 的成本,在一项本身就有成本的任务上

供应商价目表先来,数据于 2026-09-23 从供应商自家的定价页面读取。Z.ai 将 GLM-5.2 标为每百万输入 token 1.40 美元、每百万缓存输入 token 0.26 美元、每百万输出 token 4.40 美元。Moonshot 将 Kimi K3 标为输入 3.00 美元、缓存读取 0.30 美元、输出 15.00 美元——此外还有缓存写入费用:五分钟缓存为每百万 3.00 美元,一小时缓存为每百万 6.00 美元。这些只是公布价格,并非经独立审计的价格,且两家供应商都可能调整。

让它们做一项以阅读为主的任务:审查一个 60 万 token 的代码库,并写出 8,000 token 的书面答案。在 GLM-5.2 上,输入成本为 0.6 x $1.40 = $0.84,输出成本为 0.008 x $4.40 = $0.035,合计约 $0.88。在 Kimi K3 上,则是 0.6 x $3.00 = $1.80,加上 0.008 x $15.00 = $0.12,合计约 $1.92。同样一项任务,成本大约是前者的 2.2 倍。

现在,在代码库已经位于提供商缓存中的情况下再运行一次。输入行降至缓存读取费率,原本相差 2.1 倍的两个价格变成每百万 $0.26 对 $0.30——差距为 15%。这是对比中最少被讨论的数字,却对每一轮都要重新读取同一上下文的智能体最为重要。它还有一个星号注记:Kimi K3 对写入缓存单独计费,而 GLM-5.2 的页面根本没有标出写入费用,因此冷启动在 Kimi K3 上的成本明显高于 $3.00 这一标价所暗示的水平。

• 读取 600k token、回答 8k —— GLM-5.2 约 $0.88,而 Kimi K3 约 $1.92

• 相同的缓存输入行——每 600k tokens,GLM-5.2 为 $0.16,Kimi K3 为 $0.18

A self-built two-column scoreboard for GLM-5.2 vs Kimi K3. Left column 'GLM-5.2' (753B total / 40B active, MIT, $1.40 / $4.40): Intelligence Index 34, blended price per million $0.902, cost per task $0.96, output speed 68.2 tok/s, long context AA-LCR 78%, agentic AutomationBench 28%. Right column 'Kimi K3' (2.8T total / 104B active, Kimi K3 License, $3.00 / $15.00): Intelligence Index 44, blended price per million $2.31, cost per task $2.00, output speed 36.7 tok/s, long context AA-LCR 89%, agentic AutomationBench 58%. Footer reads 'Benchmark, speed and cost figures per Artificial Analysis (Intelligence Index v4.3.2, read 2026-09-23), both models in their maximum-reasoning configuration. Vendor list prices per Z.ai and Moonshot. OrcaRouter passes provider list price through at 0% markup.'

独立模型在方向上一致,但在幅度上并不一致。Artificial Analysis 按 7:2:1 的比例混合缓存命中、输入和输出 token,并计入模型实际消耗的推理 token;在其 v4.3.2 指数下于 2026-09-23 读取的这些数据中,GLM-5.2 为每百万混合 token 0.902 美元,而 Kimi K3 为 2.31 美元;完成其一个评估任务的成本则分别为 0.96 美元与 2.00 美元。完整运行一次 Intelligence Index 在 GLM-5.2 上花费 1,559 美元,在 Kimi K3 上花费 3,658 美元。

那个成本模型里藏着一个反直觉的细节。Kimi K3 使用更少的每次任务的输出 token,比 GLM-5.2 少——48,000 对 64,000——推理 token 也更少,32,000 对 51,000。它是单位工作量上更经济的模型,但每个任务的成本却大约是对方的两倍,因为它的每 token 价格在输入上是 2.1 倍,输出上是 3.4 倍。按任务便宜和按 token 便宜是两种不同的属性,而这是一种两者指向相反方向的组合。

上下文窗口,以及它实际能容纳的内容

两者在纸面上相差不到 5%:1,000,000 个 token 对 1,048,576 个。把这一点说成 Kimi K3 的胜利,未免太荒唐了。两者都是百万级 token 模型,窗口大小并不构成区分点;真正该问的是,面对埋在中间位置的文本,它们各自还能做到什么。

这正是 Artificial Analysis 的长上下文推理评估所衡量的内容,也是该数据集中差距较大的项目之一:Kimi K3 得分 89%,而 GLM-5.2 为 78%。如果你的工作是加载大规模语料库,并提出需要将语料库两端的事实关联起来的问题,那么额外的 48,576 个 token 并不是选择 Kimi K3 的理由——十一个百分点的长上下文优势才是。

窗下地板也不一样。GLM-5.2 公布了 128,000 token 的最大输出量;Kimi K3 的页面并没有公布一个对等的数字,因此我们也不打算替它给出一个。如果你要做的是生成长文档,而不是阅读长文档,那么在购买其中任何一个之前,这种不对称性值得对照你自己的实际工作量核实一下。

速度:GLM-5.2 绝对主宰的唯一维度

两项独立测量在此指向同一方向,这一点值得说明,恰恰是因为它们并非在所有方面都一致。

我们自己的路由数据(截至 2026-09-23 的七天内)显示,GLM-5.2 的首 token 中位响应时间为 3.28 秒,而 Kimi K3 为 8.09 秒;流式输出速度为每秒 68.1 个 token,而 Kimi K3 为 43.4 个。两个模型的首 token 响应时间 p95 都恰好为 10.00 秒。Artificial Analysis 的独立测量显示,GLM-5.2 的输出速度为每秒 68.2 个 token,而 Kimi K3 为 36.7 个;端到端耗时为 41.29 秒,而 Kimi K3 为 72.13 秒;首个答案响应时间为 33.95 秒,而 Kimi K3 为 58.52 秒。

A screenshot of the OrcaRouter model page for GLM 5.2 (z-ai/glm-5.2) captured 2026-09-23, showing the FEATURED badge, the byline 'by Z.ai · 2026-06-16', a 1M-token context with 128K maximum output and text in / text out, rate cards of $1.40 input and $4.40 output per 1M tokens with a $0.260 cache read, a p50 time to first token of 3.28 s against a p95 of 10.00 s, 29.4M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 68.1 tokens per second and a 9.2% error rate.

两个来源在一点上存在分歧,这值得指出,而不是加以淡化。Artificial Analysis 在原始首 token 时间上把 Kimi K3 排得略靠前,为 4.08 秒对 4.62 秒;而我们自己的路由显示,GLM-5.2 在 p50 上快将近两倍半。不同的端点,不同的上游提供商,不同的时间窗口。把吞吐量方向——GLM-5.2 明显更快——视为可靠,而把任何单个首 token 时间数值,无论来自我们还是他们,都视为特定某一周的属性。

我们的 GLM-5.2 页面上还有一个数字,我们不会悄悄略过:在同样的七天里,它显示出 9.2% 的错误率,而 Kimi K3 为 0.26%。这么大的差距,既可能是为 GLM-5.2 提供服务的上游供应商遭遇了糟糕的一周,也可能是模型本身的特性,两者可能性差不多;而七天的时间窗口不足以区分二者。这正是路由旨在解决的问题——当某个供应商每十一个请求就有一个失败时,自动故障转移会转移流量,而无需任何人呼叫值班人员。

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) captured 2026-09-23, showing the FEATURED badge, the byline 'by MoonshotAI · 2026-07-15', text-and-image input with text output, a 1,048,576-token context, rate cards of $3.00 input and $15.00 output per 1M tokens with a $0.300 cache read, a p50 time to first token of 8.09 s against a p95 of 10.00 s, 1116.2M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 43.4 tokens per second and a 0.26% error rate.

基准测试:一次真正的横扫,范围比标题所示更窄

Kimi K3 在双方都跑过的几乎所有项目上都胜出。以下为 Artificial Analysis 在指数修订版 v4.3.2 下的数据,两个模型均处于最高推理配置,读取于 2026-09-23:

• 智能指数 — Kimi K3 44 对比 GLM-5.2 34

• AA-Briefcase v1.1 — 1510 对比 1233

• GDPval-AA v2.1 — 1524 对比 1358

• AutomationBench-AA — 58% 对比 28%

• Terminal-Bench 4.0 — 13% 对比 1%

• SciCode — 59% 对比 51%

• Humanity's Last Exam — 47% vs 41%

• GDP.pdf — 22% 对比 10%

• AA-LCR v1.1 — 89% 对比 78%

• CritPt — 23% 对比 21%

在任何人把那份清单截图之前,先说明两点注意事项。

首先,是指数修订。Kimi K3 在 7 月发布时的报道称其在 Intelligence Index 上为 57,GLM-5.2 为 51。而今天的实时页面显示为 44 和 34。这两者不是同一种测量——Artificial Analysis 会修订该指数,并据此重新给模型评分,而把 7 月的数字与 9 月的数字并列,是在这一组合上最容易犯的错误。方向在每一份快照中都保持稳定;绝对数值在不同修订版本之间不可比较。

其次,是层级。Terminal-Bench 4.0 上的 13% 和 1% 是一项严苛的评测,而在那样的高度上,这个比值比其中任何一个数字都更能说明问题。AA-Omniscience 考察的是模型是否了解自身知识的边界,其中 GLM-5.2 为 4,而 Kimi K3 为 20——如果你打算在无人监督的情况下运行其中任何一个,这个下限值得了解。

关于 GLM-5.2 列表,Artificial Analysis 还记录了一点:它将 maximum-reasoning 配置标记为已弃用,转而推荐更新的 GLM-5.3。这不会改变上面的任何数字——那些数字是 GLM-5.2 被测量时的快照——但这确实意味着 Z.ai 的路线图已经越过了这个模型。在路由端点上,这只需要更换一个模型字符串,而不是做迁移,这也是不要把这两个名称中的任何一个硬编码到应用里的主要理由。

智能体与工具使用:差距最大之处

如果那张表格中只有一个部分能决定是否购买,那就是这一部分。长周期智能体任务正是 Kimi K3 优势最大且最稳定的领域:

• AutomationBench-AA——58% 对 28%,相差 30 个百分点

• GDPval-AA v2.1 — 1524 对比 1358

• AA-Briefcase v1.1 — 1510 对比 1233

• Terminal-Bench 4.0 — 13% 对比 1%

Moonshot 自家的发布材料讲的也是同一个故事——K3 权重发布时附带了一份技术报告,内容涵盖该厂商的专家并行训练栈和一套智能体环境评测框架——但厂商材料终究是厂商材料,上文那些数字才是独立得出的。

第三方聚合平台 LLM Stats 在一套共享基准集上运行自己的综合评分,从另一个方向得出了相同结论:在它为两个模型评分的十一项基准中,Kimi K3 拿下全部十一项,其分类得分让 Kimi K3 在工具使用(30.8 对 19.6)、智能体(38.3 对 29.6)和编程(42.3 对 34.8)上领先。这些是 LLM Stats 在自身加权方式下得出的自有综合分数,基于的共享集合规模并不大,因此应将其视为佐证,而非实验室结果。十一项全拿,仍然算不上是胶着的较量。

编码

方向相同,差距更小。在 Artificial Analysis 为两者评分的编码评测中,Kimi K3 在 SciCode 上以 59% 对 51% 领先;在 LLM Stats 的共同评测集上,它拿下了 DeepSWE、DeepSWE 1.1、FrontierSWE、SWE-Marathon、Program Bench 和 Terminal-Bench 2.1。GLM-5.2 那些好看的数字——第三方聚合平台转载的 AIME 2026 上的 99.2%、HMMT 2025 上的 94.4%、GPQA 上的 91.2%——都是厂商报告的、未经复现的,而且其中大多数衡量的是竞赛数学,而非软件工程。

实用解读是:对于一个长时间运行、要编辑大量文件、还必须从自身错误中恢复的编程智能体而言,Kimi K3 在智能体能力上的领先幅度,是比两个模型各自的数学成绩更相关的信号。而对于一个快速、廉价、基本只需单次执行的代码助手来说,GLM-5.2 的吞吐量优势,其价值要超过基准测试差距所带来的代价。

在它们足够接近、以至于无关紧要的情况下

• 缓存输入价格 — 每百万 $0.26 对 $0.30,与输出端 3.4 倍的差距相比,仅相差 15%

• 上下文窗口 — 1,000,000 与 1,048,576 个 token

• p95 首个 token 耗时 — 在我们自己的路由上为 10.00 秒 vs 10.00 秒

• CritPt — 23% 对比 21%

• 数学 — LLM Stats 在其数学综合评分中将 GLM-5.2 略微排在前面(41.4 对 40.9),而 Kimi K3 在带图数学上领先;就现有证据而言,两个模型都未在算术上占据明显优势

任何告诉你这两款模型中有一款在各方面都是另一款两倍的人,都只是在看表格里的某一行。

如果……就选 GLM-5.2

你在付账单,而账单就是约束条件。GLM-5.2 的输出价格大约只有三分之一,缓存那一档也更便宜,采用 MIT 许可,没有需要对照检查的收入触发条款,中位速度更快,流式输出时更是快得多,而且它的百万 token 窗口与 Kimi K3 已经接近到这种差距永远不会决定任何事情。如果你的工作负载是文本进、文本出,而且主要是阅读,而不是一长串工具调用链,那么 Kimi K3 多出来的那些基准测试分数,是你的应用永远拿不到的分数。

如果……就选 Kimi K3

这项工作具有代理性且耗时很长。AutomationBench 上 30 分的差距、在 GDPval 和 AA-Briefcase 上的领先、11 分的长上下文推理优势,以及 LLM Stats 共享集上的全面胜出,都指向同一个方向:Kimi K3 是更适合把多步骤任务交给它、然后放手不管的模型。它也是两者中唯一接受图像的模型。为此,你每个任务的成本大约会翻倍;如果你的工作集被大量缓存,花费会低于两倍——但支持它的理由不是价格,也不是速度。

两者都可以在 OrcaRouter 上通过同一个密钥、针对同一个 OpenAI 兼容端点进行路由,按各提供商的原价计费,不额外加价,而且两者都处于同一套自动故障转移机制之后。这是弄清你的工作负载究竟更适合哪一个的最省钱方式,因为在它们之间切换只需改一个模型字符串,而无需签订合同。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新