一张生成的标题卡片,上面写着“GLM-5.3-Flash Revealed”,副标题为“Zhipu的开源多模态前沿模型就是匿名的Ox Alpha——现在价格仅为GLM-5.3的十分之一”,并配有闪电芯片、MIT徽章和图像-视频图标的扁平线条图标。
Guides & Insights

GLM-5.3-Flash 揭晓:匿名的“Ox Alpha”一直是智谱的开源多模态前沿模型

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

连续一周位居第三方编程平台使用量排行榜榜首的模型,终于有了名字和价格。2026年8月26日,智谱AI确认,自8月20日以来开发者们一直在大量使用的免费“Ox Alpha”模型,就是GLM-5.3-Flash——一个总参数量3200亿、激活参数量180亿(320B-A18B)的混合专家模型,也是GLM-5系列中首个原生多模态版本,更是发布时任何费率表上价格最低的前沿级模型之一。智谱将GLM-5.3-Flash的API定价定为其旗舰GLM-5.3费率的十分之一,限时折扣期间仅为二十分之一;采用MIT许可的开源权重也已于当日在Hugging Face上线。与GLM-5.3(其权重仍需等到月底)不同,这款模型本周即可自行部署,无需等到下周。

简而言之:智谱开源了其迄今最便宜的大模型,尽管活跃参数仅为其一小部分,它在各项基准测试中仍超越了自家的 GLM-5.2;根据智谱的发布材料,该模型在 Artificial Analysis Intelligence Index 上的得分为 57——与 Claude Opus 4.8 持平。截至撰写本文时,此次发布附带的所有基准测试数据均为厂商自报,尚未经过复现验证;价格与参数数量则是当前已确认的事实。

实际发布的内容

GLM-5.3-Flash 是一个总参数量320B、激活参数量18B的MoE模型,具有45层,其激活规模略高于GLM-5.2约32B激活参数的一半。主打能力是多模态:它原生支持文本、图像和视频输入——这是首个这样做的GLM-5模型——而不是通过单独的适配器来处理视觉信息。上下文长度达到100万token,智谱声称长上下文的服务成本约为GLM-5.3的三分之一。

在架构方面,智谱将其描述为首个采用混合稀疏注意力加线性注意力设计的开源前沿模型,搭配流形约束超连接(mHC)用于扩展,以及一种IndexPool机制——将四个索引器键向量压缩为一个加权池——以降低长上下文延迟。预训练使用了包含30万亿token的多模态语料。这些说法尚未经过独立审计——只是智谱对其自身模型的描述——但服务效率方面的主张足够具体,一旦权重进入开源推理栈,就可以进行测试。

发布当天的规格表,一目了然:

• 参数 — 总计320B / 激活18B,45层,MoE。

• 模态 — 原生文本、图像和视频输入;文本输出。

• 上下文窗口 — 最多 1,000,000 tokens

• 许可证 — MIT,开放权重在发布时上线 Hugging Face。

• 价格——每百万个标记(输入/输出)$0.15 / $0.50,每百万个缓存输入 $0.03;截至2026年9月9日的五折促销将其降至 $0.075 / $0.25 / $0.015。按标价计算,这大约是 GLM-5.3 的 $1.40 / $4.40 的十分之一。

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

Ox Alpha周

这一消息的公布结束了一周的猜测。8月20日,一个匿名模型出现在第三方AI API平台上,拥有100万token的上下文窗口,支持文本、图像、视频输入,价格为零,并迅速成为该平台周榜上被调用次数最多的模型。社区在48小时内通过指纹识别将其追溯到智谱的GLM系列——这种先匿名后认领的模式此前也曾识别出其他中国实验室的模型——分析师普遍猜测这是GLM-5.3的Flash变体。8月26日的公告证实了这一猜测,并补充了一个细节:免费周是一次有意的测试。智谱表示,匿名运行在其上架的编码平台上创下了调用量纪录,所有流量均由国产芯片提供。

免费周这一背景对定价预期很重要。一款模型以 0 美元免费提供一周,随后以旗舰产品十分之一的价格推出,并附带限时二十分之一价格的折扣——这是预算档位中一次蓄意的做市之举,而“限时”这个限定词才是关键。折扣是一种可以收回的定价决定;而 MIT 开放权重则无法收回。

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

以实际美元计算,它的成本是多少

智谱的价目表已以实际美元公布,而不仅仅是比率:每百万输入token 0.15美元,每百万输出token 0.50美元,每百万缓存输入token 0.03美元。对照GLM-5.3公布的1.40美元/4.40美元,这大约是标价的十分之一;而截至2026年9月9日的五折发布促销可将其降至0.075美元/0.25美元/0.015美元——约为二十分之一。智谱还报告称,该模型每次AA Intelligence Index任务的成本约为0.045美元(供应商数据),这正是"Opus 4.8的1/40"说法的由来。对于一款得分与价格高出10至40倍的模型同处一档的模型而言,头条宣称的经济性确实成立;但细则在于:发布折扣是暂时的,单次任务成本取决于模型在生产环境中实际输出的冗长程度。

智谱声称成本优势正源于效率表现。与GLM-5.3相比,其报告注意力计算量降低3.0倍,KV缓存降低4.4倍,并声称在所对比的预算级模型——GLM-5.3、DeepSeek V4 FlashKimi K3——中拥有最低的注意力计算量,同时承认其KV缓存仍略大于DeepSeek V4 Flash和Kimi K3。在服务端,智谱报告称,在国产芯片上端到端服务性能较基线提升3倍,使每token成本达到其声称可与主流NVIDIA GPU相媲美的水平。以上均为厂商自报数据,尚未有任何独立复现;这些正是对照开放权重进行核对时需要注意的数字。

为何这一揭示很重要

抛开基准测试不谈,这次发布本身仍然从两个方面改变了开放模型的格局。首先,它是一款处于前沿梯队、定价亲民的开放权重多模态模型——MIT许可证、100万上下文、原生图像/视频输入、单次任务成本仅个位数美分,这一组合在美国前沿实验室中找不到直接对等物,后者同类多模态模型的成本要高出整整一个数量级,且以闭源形式发布。其次,它削弱了智谱自家旗舰产品的地位:GLM-5.3是一款743B参数的模型,本月在AA智能指数上独立测得了60分,而GLM-5.3-Flash则针对同一产品线定位为"前沿智能,闪电成本"。智谱的故事在于,一个更小、更便宜的模型能够捕获旗舰产品的大部分能力——如果该厂商在编码与智能体方面的主张成立,这正是整个行业今年一直在盘旋探讨的同一个后训练经济论点。

有一点需要保持清醒。GLM-5.3-Flash的AA Index评分57分来自智谱自家的发布材料,而非Artificial Analysis排行榜;与Claude Opus 4.8的编码对比也是智谱内部Z.ai Code Bench的评估结果。在独立评测落地之前,57分和编码能力持平只能视为厂商宣称——该模型已接受广泛匿名测试,第三方数据应该很快就会出炉。

试试它,以及路由层如何适配

上线首日即可通过智谱自有 API、Hugging Face 上的开源权重(zai-org/GLM-5.3-Flash,MIT 协议)以及智谱的编程产品——ZCode 和 GLM Coding Plan(其中包含一批每日体验卡)进行访问。对于自托管部署,MIT 协议加上对 vLLM 和 SGLang 的支持,意味着上文关于服务效率的声明可以直接验证。

在路由方面,截至本次更新,GLM-5.3-Flash本身尚未列入OrcaRouter的名单。GLM系列的其他模型则已接入:GLM-5.3在智谱API开放的当天就已在我们的平台上线,按智谱的定价原价转发,不加价。这种原价转发机制正是此类发布的关键——无论是折扣持续有效还是后续费率表调整,供应商价格变动都会在当天同步到我们这边,无需重新谈判。一旦Flash上线,如果你想用同一个API密钥将其与GLM系列其他模型一起运行,就是这种配置方式;在此之前,Hugging Face上的权重是你自行测试的最快途径。

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

接下来看什么

三件事将在接下来几周内确定真实情况。首先,对57的独立Artificial Analysis测量——该模型已经以Ox Alpha的名义在运行,所以排行榜应该很快就能追上。其次,目前定于2026年9月9日结束的五折促销是否会在该日期之后延长,因为这决定了Flash的稳态成本。第三,GLM-5.3权重,仍承诺在8月28日左右发布——与Flash的MIT权重上线的同一周,这将让开放权重社区能同时比较同一家族的两个层级。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube