GLM-5.3-Flash 对比 GLM-5.3 — 旗舰版三分的领先优势是否值得十倍价格?重新生成的插图。
Guides & Insights

GLM-5.3-Flash vs GLM-5.3:旗舰产品的三分优势是否配得上十倍价格?

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

智谱AI在8月26日当天对自己的旗舰模型进行了降价。就在同一天,它确认了GLM-5.3-Flash——即匿名“Ox Alpha”背后的18B激活多模态模型——并将其定价为GLM-5.3(其一周前登顶开源模型排行榜的743B旗舰模型)的十分之一,加上限时折扣后更是降至二十分之一。这两个模型共享同一个名称、同一条血脉,以及100万token的上下文窗口,但它们却位于智谱定价表的两端。如今,二者之间的差距成了关键问题:GLM-5.3在人工分析智能指数(Artificial Analysis Intelligence Index)上得分为60,而智谱声称GLM-5.3-Flash为57——因此整个旗舰溢价就落在这三个指数点上,而这几个点是否值得多花10到20倍的钱,则是个问题。

这是一次家族内部的比较,因此通常那种“哪个更好”的提问框架并不适用——正确的问法是“哪个档位适合这项工作”。Flash 更便宜,开放权重已经就绪,并且原生支持多模态;旗舰版在独立测量的推理能力上更强,回答更冗长,而且仍在等待自己的开放权重发布日程。下面是评分表,然后是分析。

一个家庭,两级

GLM-5.3 是智谱的推理旗舰:总参数743B,基于与GLM-5.2相同的混合专家基础(每个token约40B激活参数),仅支持文本,在三个努力级别上均要求推理,并且独立测得的AA智能指数得分为60,与Kimi K3并列开放模型最高分。GLM-5.3-Flash则是相反定位:总参数320B / 18B激活,横跨45层,原生支持文本/图像/视频输入,发布当日即提供MIT许可权重,AA指数得分57为智谱报告,但Artificial Analysis尚未独立确认。两者均支持1M token上下文窗口,均通过智谱API提供服务,并且都采用重后训练的GLM-5方法——GLM-5.3的所有提升都来自在固定基座上的规模化强化学习,而Flash延续了这一方向,而非逆转。

A generated two-column scoreboard titled 'GLM-5.3-Flash vs GLM-5.3 — the scoreboard'. Left column GLM-5.3-Flash: AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, Price ~$0.14/$0.44 (discount ~$0.07/$0.22). Right column GLM-5.3: AA Index 60 (independent), Active params ~40B, Context 1M tokens, Modality text only, Open weights promised ~Aug 28, Price $1.40/$4.40. Footer: GLM-5.3 index independently measured; Flash index vendor-reported.

这三个点去哪里

在指数上,57分和60分的差距,就是匹配Claude Opus 4.8(57分)与匹配开放模型榜首Kimi K3(60分)之间的差距。实际上,三个AA分值对应的是推理中最困难的部分——长程、多步骤的问题,而旗舰模型在这些问题上展现了规模化后训练的效果。这与关于这两款模型的其他已知信息一致:GLM-5.3是同级别中最冗长的模型,每项任务生成的输出token远多于同类模型,这正是模型在回答前思考更久的特征。而按照智谱的定位,Flash版本则是用部分这种深思熟虑来换取成本和速度。

还有一个验证不对称性。GLM-5.3 的 60 分是由 Artificial Analysis 独立测得的;而 GLM-5.3-Flash 的 57 分来自智谱的发布材料,截至撰写本文时尚未出现在排行榜上。在编程方面,GLM-5.3 的厂商报告数据很强(Terminal-Bench 3.0 28.3,DeepSWE v1.1 66.9,Agents' Last Exam CLI 28.5),智谱还声称 Flash 在其内部 Z.ai Code Bench 上的编程能力与 Claude Opus 4.8 相当——这一说法社区将在数天内而非数月内,用 MIT 权重进行检验。

价格差距,量化

GLM-5.3 定价为每百万输入 token 1.40 美元,每百万输出 token 4.40 美元。GLM-5.3-Flash 的价格是这个的十分之一——约为 0.14 / 0.44 美元,依据智谱公布的比率推算——在限时折扣期间约为 0.07 / 0.22 美元,即二十分之一。智谱还表示,Flash 每次 AA Intelligence Index 任务的成本约为 0.045 美元,而 GLM-5.3 的估计成本为 0.68 美元。每 token 的价差是重点:三点的指数差异对应着十到二十倍的价格差距。

有两个注意事项让这一差距保持真实可信。首先,Flash 的折扣明确是限时的,因此其稳态价格可能是 $0.14 / $0.44 这一档,而非折扣后的 $0.07 / $0.22。其次,实际成本差距取决于冗长程度:GLM-5.3 以消耗大量输出 token 著称,而 Flash 的输出行为尚未在大规模使用中得到测量。如果 Flash 的扩展系数与之类似,那么部分标价优势就会在单任务层面化为乌有。和以往一样,请在自己的工作负载上比较单任务成本,而不是比较每个 token 的标称价格。

开放权重:Flash 在序列任务上超越了旗舰模型

这次发布最令人惊讶的细节是许可证的顺序。GLM-5.3-Flash 于 8 月 26 日,也就是公告发布的同一天,在 Hugging Face 上以 MIT 许可证发布了其权重。而 GLM-5.3——智谱定位为开放权重旗舰的模型——截至该日期仍是专有的,其权重预计在 8 月 28 日左右发布,即 8 月 14 日发布两周之后。结果是,智谱更便宜的模型现在可以自行托管,而其旗舰模型还不能;并且社区将在旗舰模型权重落地之前,就能将 Flash 与旗舰模型声称的性能进行基准测试。如果 Flash 的供应商报告的 57 分及编码相关声明能够通过独立测试,那么旗舰模型的价值论点就变得更难成立;如果不能,那么三分的溢价看起来就是合理的。

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

你到底应该调用哪个 GLM?

按照定价所暗示的方式逐层处理:

• 多模态输入 — GLM-5.3-Flash 是两者中唯一原生支持文本/图像/视频理解能力的模型;GLM-5.3 仅支持文本。

• 自托管 — GLM-5.3-Flash 的 MIT 权重现已上线;GLM-5.3 的权重仍在等待中。

• 最难的推理任务——GLM-5.3,凭借其独立测得的60分及其众所周知的深思熟虑深度。

• 成本敏感型用量 — GLM-5.3-Flash,费率仅为旗舰版的十分之一至二十分之一,但需遵循上述折扣限制说明。

智能体编码(Agentic coding)——在 Flash 获得独立基准测试之前,证据好坏参半;GLM-5.3 供应商报告的编码数据表现强劲但也未被复现,而 Flash 的编码表现宣称则更为新近。建议在自己的测试集上进行验证。

在路由方面,这次对比中的旗舰型号已经在 OrcaRouter 上线——智谱 API 开放当天,GLM-5.3 就进入了名单,按智谱官方定价透传,0% 加价。GLM-5.3-Flash 尚未进入名单;今天是发布日。一个有用的结果是,一旦 Flash 落地,整个系列就只需一个 key,路由 DSL 让你无需二次集成即可将难题发送给旗舰版、将高并发量发送给 Flash。在此之前,Flash 的 MIT 权重是亲自验证你的工作负载实际需要哪个档位的最快方式。

A screenshot of the OrcaRouter model page for z-ai/glm-5.3 showing the model id, a 1,000,000-token context window, the current per-1M input and output rates, and the reasoning capability chip.

底线

GLM-5.3-Flash 与 GLM-5.3 并非真正的对决——这是智谱对同一条能力曲线的两档定价,价差本身就是产品策略。旗舰版三个指数点的优势在关键之处(独立评测、最难推理)真实存在,对需要它的工作负载而言物有所值。Flash 以低十到二十倍的价格,买到的是同一家族的路线、原生多模态输入和 MIT 权重,代价是三个指数点和一批未经复现的宣称。对于大多数不处于推理最难端的生产工作负载,Flash 是理性的默认之选;其余场景,GLM-5.3 就是保险。旗舰版权重发布前的两周窗口期,将厘清溢价中有多少是真实能力、多少只是占位。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube