
GLM-5.3 对比 Kimi K3:压榨 743B 基座,还是构建 2.8T 模型——哪种押注更划算?
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0247智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75代码
- obsidianQwen3.8 27B2026-08-1541智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69代码
- grokSpaceXAI: Grok 4.62026-08-1251智能77代码
- metaMeta: Muse Spark 1.22026-08-0547智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0347智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49代码
中国开源权重模型的竞赛刚刚分化为对同一问题的两种答案。月之暗面(Moonshot AI)构建了Kimi K3——一个从零开始打造的2.8万亿参数混合专家基础模型,也是有史以来发布的最大开源权重模型,于2026年7月16日宣布,权重于7月27日发布。GLM-5.3则押注相反的路线:智谱(Z.ai)保留了驱动GLM-5.2的完全相同的7430亿参数基础模型,将整个发布周期都投入后训练,认为基础模型的智能天花板从来不是问题。两者都是1M上下文、聚焦编程与智能体的旗舰模型,并且都声称是市场上顶尖的开源编程模型。它们不可能都是花同一笔预算的最佳方式,而基准测试结果也确实平分秋色——这使得这与其说是一次对比,不如说是一场关于如何构建下一代前沿模型的公投。
关于如何构建前沿模型的两种押注
Z.ai 将 GLM-5.3 称为一次“深度挖掘”,而非代际升级。其基础是与 GLM-5.2 逐字节相同的 743B 模型;增量完全来自后训练,通过开源 slime 框架在覆盖整个工程会话的任务上运行——诊断、修复、验证,并在真实集群、存储系统和代码库上完成交付,有些任务需要资深工程师数天的工作量。该厂商报告的性能提升幅度很大:在其自研 Code Bench 上提升 50%,Terminal-Bench 3.0 从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9;此外还有一项网络(cyber)能力,已经迫使团队在权重发布前进行安全审查。Moonshot 则反其道而行之。Kimi K3 是一个全新的基座模型——总参数量 2.8T,每个 token 激活约 104B 参数(896 个专家中激活 16 个),采用 Kimi Delta Attention 架构,原生支持图像和视频输入,推理始终开启且无法关闭,输入和输出均支持 1M 上下文窗口。Z.ai 押注的是同款模型再加量就已足够,而 Moonshot 押注的则是基座模型本身就是天花板。

附有出处的正面交锋。
两个模型出现在同一页面的唯一地方是Z.ai自己的发布表格,因此并排对比的数字就来自那里——标注为供应商报告,而非独立审计结果。Kimi K3的独立数据与Moonshot在7月发布的数据以及Artificial Analysis的测量结果相吻合,但目前还没有中立实验室对两者都进行过测试。
• Terminal-Bench 3.0 — GLM-5.3 得 28.3 分,而 Kimi K3 得 17.4 分(Z.ai 的表格)。这是该对比中最大的编码差距,出现在最新、最难的版本上。
• Terminal-Bench 2.1 — GLM-5.3 得分 88.2,Kimi K3 得分 88.3。不相上下。
• DeepSWE v1.1 — GLM-5.3 获得 66.9 分,Kimi K3 获得 67.5 分。Kimi 以微弱优势胜出。
• SWE-Marathon v1.1 — GLM-5.3 得分 42.5,Kimi K3 得分 48.1。这是 Kimi 的最佳编程胜利。
• ExploitGym——GLM-5.3 以 105/130 的成绩对阵 Kimi K3 的 36/70。GLM 几乎全面胜出。
• GDPval-AA v2(知识工作) — GLM-5.3 为 1,769,而 Kimi K3 为 1,682。
• 访问 — GLM-5.3:Coding Plan 订阅,权重在 8 月 28 日左右之前受限。Kimi K3:API 已上线,定价 $3 / $15,权重自 7 月 27 日起可下载。

安全护城河才是真正的分水岭
抛开编码基准测试不谈,决定性的差异在于网络安全。GLM-5.3 在 CyberGym 上取得 84.5 分,而 Kimi K3 为 80.0;其 ExploitBench 得分 54.4,几乎是 Kimi K3 的 32.2 的两倍。在 ExploitGym 上,差距已经不是差异,而是不同的量级——在 2 小时和 6 小时两档运行中,前者为 105 和 130,后者为 36 和 70。这就是为什么两款模型{{1}}在实际使用中{{/1}}给人的感觉如此不同:Kimi K3 的权重在 Modified MIT 许可证下完全公开,而 GLM-5.3 的权重则因安全加固而被暂缓发布——原因正是 Z.ai 表示,该模型发现和利用漏洞的能力已经强到让团队觉得立即发布权重是不负责任的。如果你的工作涉及审计他人的代码,或者防御自己的代码免受自动化漏洞搜寻的侵扰,那么这就是整个对比中最值得关注的一条——{{2}}同时也是最缺少独立验证的一条{{/2}}。
Kimi K3 反击之处
Kimi K3的优势集中在GLM-5.3最薄弱的环节:长周期代码库任务。它在DeepSWE和SWE-Marathon上保持领先,在Toolathlon Verified上位居前列,其100万token的输出窗口意味着它可以在单次生成中完成整个代码库或一整段智能体轨迹。其始终在线的推理会将完整轨迹流式传输到API,开发者认为,这在调试智能体时远比不透明的摘要式解释更有用——但操作上的限制是,你必须在工具调用之间原样传回推理字段,且不支持assistant预填充(prefill)。在Artificial Analysis的Intelligence Index上,Kimi K3得分57,总排名第四,其标准测试集的每任务成本约为0.94美元。它也是中国实验室推出的最昂贵模型:每百万输入token收费3美元,每百万输出token收费15美元,属于Sonnet级别的定价,而GLM-5.3目前根本无法按token定价,因为它只存在于订阅计划中。
获取与成本的现实
Kimi K3 现已上线 OrcaRouter,按 Moonshot 官方标价——每百万 token 输入 3 美元、输出 15 美元,缓存读取 0.30 美元,0% 加价——因此 1M 上下文的 agent 工作可以用与其余技术栈相同的 key 调用,开放权重则是你若要自托管时的退出选项。GLM-5.3 才是那个难以获取的:月订阅费 18 至 168 美元,采用积分制,输入按 6.9 倍、输出按 24 倍消耗积分,中国时间 14:00–18:00 之外的非高峰定价可将消耗减半,且在安全审查通过之前不提供按 token 计费的 API。路由层实际上在两周窗口期内抹平了这一不对称:当 GLM-5.3 的 API 接入同一 key 时,面板调用即可让两款开放编码旗舰模型各自跑你的任务,再由裁判模型对两者进行对账——如果你等不及,Kimi K3 已发布的权重使其成为两者中唯一今天就能完全本地部署的选项。

哪个赌注在赔付?
一周后的实事求是结论是:两笔押注都在产生回报,但适用于不同的工作负载。如果你的工作以终端操作为主、与安全相关,并且由智能体编排,那么基于 Z.ai 已发布的证据,GLM-5.3 是更有利的方向——而且网络安全方面的差距足够大,值得等两周拿到权重后自行验证。如果你的工作是长时间的仓库会话、多模态输入,或任何需要今天就拿到权重的情况,那么在这两者中,Kimi K3 是唯一真正可用的——而且它在深度仓库上的优势,你现在就能通过其实时 API 验证。有一点需要厘清:本次对比中的每一个数字都来自 Z.ai 自己的表格,因此在独立实验室对两者进行测试之前,请将编码性能差异仅视为方向性参考。而这正是等待两周所能带来的那种验证。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
