
GLM-5.3-Flash vs GLM-5.3:旗舰产品的三分优势是否配得上十倍价格?
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
智谱AI在8月26日当天对自己的旗舰模型进行了降价。就在同一天,它确认了GLM-5.3-Flash——即匿名“Ox Alpha”背后的18B激活多模态模型——并将其定价为GLM-5.3(其一周前登顶开源模型排行榜的743B旗舰模型)的十分之一,加上限时折扣后更是降至二十分之一。这两个模型共享同一个名称、同一条血脉,以及100万token的上下文窗口,但它们却位于智谱定价表的两端。如今,二者之间的差距成了关键问题:GLM-5.3在人工分析智能指数(Artificial Analysis Intelligence Index)上得分为60,而智谱声称GLM-5.3-Flash为57——因此整个旗舰溢价就落在这三个指数点上,而这几个点是否值得多花10到20倍的钱,则是个问题。
这是一次家族内部的比较,因此通常那种“哪个更好”的提问框架并不适用——正确的问法是“哪个档位适合这项工作”。Flash 更便宜,开放权重已经就绪,并且原生支持多模态;旗舰版在独立测量的推理能力上更强,回答更冗长,而且仍在等待自己的开放权重发布日程。下面是评分表,然后是分析。
一个家庭,两级
GLM-5.3 是智谱的推理旗舰:总参数743B,基于与GLM-5.2相同的混合专家基础(每个token约40B激活参数),仅支持文本,在三个努力级别上均要求推理,并且独立测得的AA智能指数得分为60,与Kimi K3并列开放模型最高分。GLM-5.3-Flash则是相反定位:总参数320B / 18B激活,横跨45层,原生支持文本/图像/视频输入,发布当日即提供MIT许可权重,AA指数得分57为智谱报告,但Artificial Analysis尚未独立确认。两者均支持1M token上下文窗口,均通过智谱API提供服务,并且都采用重后训练的GLM-5方法——GLM-5.3的所有提升都来自在固定基座上的规模化强化学习,而Flash延续了这一方向,而非逆转。

这三个点去哪里
在指数上,57分和60分的差距,就是匹配Claude Opus 4.8(57分)与匹配开放模型榜首Kimi K3(60分)之间的差距。实际上,三个AA分值对应的是推理中最困难的部分——长程、多步骤的问题,而旗舰模型在这些问题上展现了规模化后训练的效果。这与关于这两款模型的其他已知信息一致:GLM-5.3是同级别中最冗长的模型,每项任务生成的输出token远多于同类模型,这正是模型在回答前思考更久的特征。而按照智谱的定位,Flash版本则是用部分这种深思熟虑来换取成本和速度。
还有一个验证不对称性。GLM-5.3 的 60 分是由 Artificial Analysis 独立测得的;而 GLM-5.3-Flash 的 57 分来自智谱的发布材料,截至撰写本文时尚未出现在排行榜上。在编程方面,GLM-5.3 的厂商报告数据很强(Terminal-Bench 3.0 28.3,DeepSWE v1.1 66.9,Agents' Last Exam CLI 28.5),智谱还声称 Flash 在其内部 Z.ai Code Bench 上的编程能力与 Claude Opus 4.8 相当——这一说法社区将在数天内而非数月内,用 MIT 权重进行检验。
价格差距,量化
GLM-5.3 定价为每百万输入 token 1.40 美元,每百万输出 token 4.40 美元。GLM-5.3-Flash 的价格是这个的十分之一——约为 0.14 / 0.44 美元,依据智谱公布的比率推算——在限时折扣期间约为 0.07 / 0.22 美元,即二十分之一。智谱还表示,Flash 每次 AA Intelligence Index 任务的成本约为 0.045 美元,而 GLM-5.3 的估计成本为 0.68 美元。每 token 的价差是重点:三点的指数差异对应着十到二十倍的价格差距。
有两个注意事项让这一差距保持真实可信。首先,Flash 的折扣明确是限时的,因此其稳态价格可能是 $0.14 / $0.44 这一档,而非折扣后的 $0.07 / $0.22。其次,实际成本差距取决于冗长程度:GLM-5.3 以消耗大量输出 token 著称,而 Flash 的输出行为尚未在大规模使用中得到测量。如果 Flash 的扩展系数与之类似,那么部分标价优势就会在单任务层面化为乌有。和以往一样,请在自己的工作负载上比较单任务成本,而不是比较每个 token 的标称价格。
开放权重:Flash 在序列任务上超越了旗舰模型
这次发布最令人惊讶的细节是许可证的顺序。GLM-5.3-Flash 于 8 月 26 日,也就是公告发布的同一天,在 Hugging Face 上以 MIT 许可证发布了其权重。而 GLM-5.3——智谱定位为开放权重旗舰的模型——截至该日期仍是专有的,其权重预计在 8 月 28 日左右发布,即 8 月 14 日发布两周之后。结果是,智谱更便宜的模型现在可以自行托管,而其旗舰模型还不能;并且社区将在旗舰模型权重落地之前,就能将 Flash 与旗舰模型声称的性能进行基准测试。如果 Flash 的供应商报告的 57 分及编码相关声明能够通过独立测试,那么旗舰模型的价值论点就变得更难成立;如果不能,那么三分的溢价看起来就是合理的。

你到底应该调用哪个 GLM?
按照定价所暗示的方式逐层处理:
• 多模态输入 — GLM-5.3-Flash 是两者中唯一原生支持文本/图像/视频理解能力的模型;GLM-5.3 仅支持文本。
• 自托管 — GLM-5.3-Flash 的 MIT 权重现已上线;GLM-5.3 的权重仍在等待中。
• 最难的推理任务——GLM-5.3,凭借其独立测得的60分及其众所周知的深思熟虑深度。
• 成本敏感型用量 — GLM-5.3-Flash,费率仅为旗舰版的十分之一至二十分之一,但需遵循上述折扣限制说明。
智能体编码(Agentic coding)——在 Flash 获得独立基准测试之前,证据好坏参半;GLM-5.3 供应商报告的编码数据表现强劲但也未被复现,而 Flash 的编码表现宣称则更为新近。建议在自己的测试集上进行验证。
在路由方面,这次对比中的旗舰型号已经在 OrcaRouter 上线——智谱 API 开放当天,GLM-5.3 就进入了名单,按智谱官方定价透传,0% 加价。GLM-5.3-Flash 尚未进入名单;今天是发布日。一个有用的结果是,一旦 Flash 落地,整个系列就只需一个 key,路由 DSL 让你无需二次集成即可将难题发送给旗舰版、将高并发量发送给 Flash。在此之前,Flash 的 MIT 权重是亲自验证你的工作负载实际需要哪个档位的最快方式。

底线
GLM-5.3-Flash 与 GLM-5.3 并非真正的对决——这是智谱对同一条能力曲线的两档定价,价差本身就是产品策略。旗舰版三个指数点的优势在关键之处(独立评测、最难推理)真实存在,对需要它的工作负载而言物有所值。Flash 以低十到二十倍的价格,买到的是同一家族的路线、原生多模态输入和 MIT 权重,代价是三个指数点和一批未经复现的宣称。对于大多数不处于推理最难端的生产工作负载,Flash 是理性的默认之选;其余场景,GLM-5.3 就是保险。旗舰版权重发布前的两周窗口期,将厘清溢价中有多少是真实能力、多少只是占位。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
