文章《Ox Alpha》的主视觉标题卡,副标题为“Z.ai 的 GLM-5.3-Flash 背后隐秘代号的权威参考页面”,标签分别写着“自 2026 年 8 月 20 日起以 Ox Alpha 预览”、“2026 年 8 月 26 日揭晓”、“总计 320B / 激活 18B,1M 上下文”和“MIT 许可证,开放权重”,页脚一行写着“封装、模态、费率表、端点范围与基准测试——已于 2026-09-28 验证”。OrcaRouter 标志合成在右下角。
Guides & Insights

Ox Alpha:现以 GLM-5.3-Flash 名义发布的隐秘模型完整规格表

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Ox Alpha 是匿名名称,GLM-5.3-Flash 曾以此名义预览,它于 2026年8月26日 亮相,而且它不是如今可以调用的模型。承载 Ox Alpha 这个名称的预览列表已不再提供它;其背后的模型有厂商页面、MIT 许可的权重、已发布的价目表和文档化的 API 接口,所有这些都属于 Z.ai。本页是该模型的参考——能力范围、模态、价目表、端点接口、每一个已发布的基准数据及其附带的修订版或测试框架,另外,由于该别名仍然只会返回单薄且令人困惑的搜索结果,这里也直白说明哪些内容在任何地方都没有文档记录。以下所有内容均于 2026年9月28日 从 Z.ai 自己的模型文档和定价页面、Hugging Face 上的 Z.ai 模型卡、Artificial Analysis 以及我们自己的目录中读取;厂商发布的数据与独立方测得的数据分别标注,此处没有任何内容是根据相似性推断出来的。

Ox Alpha 这个名字如今指的是什么?

该别名已停用,而且是厂商自己停用的。Z.ai 为 GLM-5.3-Flash 提供的官方文档称,该模型在发布前曾以 ox-alpha 之名进行匿名测试,以收集用户反馈,而这次匿名运行还成了那一周最受欢迎的模型。可资定年的锚点简短而具体:那则隐身上架信息显示 Ox Alpha 于 2026 年 8 月 20 日发布,而揭晓则落在 8 月 26 日——这既是 Z.ai 文档页所载的日期,也是我们自己目录中 z-ai/glm-5.3-flash 的发布日期。

由此得出两点,而这两点对搜索这个名字的读者来说都很重要。

• 别名不是路由。我们的目录对 stealth/ox-alpha 的查询返回“model not found”,读取时间为 2026-09-28。那个名称之下没有任何可调用的东西,因为厂商的产品用的是厂商自己的名字。

• 该别名下同样不存在厂商自有的权重仓库。在 Hugging Face 上搜索 ox-alpha,返回的是 2026 年 8 月下旬隐蔽窗口期内创建的社区上传内容,以及一个 2026 年 9 月 27 日的纯卡片仓库——它不含任何权重,只指向 Z.ai 的官方发布。仓库名称不过是上传者自行选定的标签,并不能说明任何问题。Z.ai 自己的组织将该模型发布为 zai-org/GLM-5.3-Flash,该仓库的创建时间为 UTC 2026-08-25。

那个匿名模型周里占据主导的提供方问题如今已有了答案,而且是以最寻常的方式收场的:一家实验室站了出来,在这款模型上署下了自己的名字。剩下的就是一份规格说明,而这正是本页所涵盖的内容。发现的过程——揭晓之前所进行的指纹识别、它所归属的匿名模型谱系,以及随之披露的部署硬件信息——见我们早前关于 Ox Alpha 调查的报道,本页不会对其中任何一点再做论述。

该信封,如供应商文档所述

A screenshot of Z.ai's official developer documentation page for GLM-5.3-Flash, showing the Model Overview section with the four spec rows on the right reading Input Modality 'Video / Image / Text / File', Output Modality 'Text', Context Length '1M' and Maximum Output Tokens '128K', alongside vendor-stated architecture notes describing 320B total parameters with 18B activated and a hybrid sparse-and-linear attention design that reduces attention computation and KV cache by 3.01x and 4.44x versus GLM-5.3.

这些是 Z.ai 报告的数据,读取自供应商自己的文档页面,日期为 2026-09-28;四项规格维度中有三项得到了独立印证——Artificial Analysis 的模型记录同样载有 320B 总参数、18B 激活参数、1,000,000 token 上下文和 MIT 许可,而我们自己的目录卡片则载有上下文与输出上限。

• 上下文窗口 — 1,000,000 个词元(Z.ai 文档;Artificial Analysis;我们自己的目录卡片,其中列出 1,000,000)

• 最大输出 — 128K 词元(Z.ai 文档);我们的卡片记录为 128,000

• 输入 — 文本、图像、视频和文件(Z.ai 文档,阅读于 2026-09-28);我们的卡片列出的是文本、图像和视频,并未声称支持文件输入

• 输出 — 仅文本,适用于每个来源

• 参数——总参数 320B,每个 token 激活 18B(Z.ai 文档和模型卡;Artificial Analysis 独立记录为 320B 和 18B)

• 许可证 — MIT,权重发布于 Hugging Face(厂商模型卡;Artificial Analysis 将该模型归类为宽松许可证下的开放权重)

• 架构——稀疏注意力与线性注意力的混合体,Z.ai 称其为首个将两者结合的开源前沿模型,相比 GLM-5.3 将注意力计算量降低 3.01×、KV 缓存降低 4.44×,另有一个 IndexPool 步骤,可在长上下文下将四个索引器键向量压缩为一个,以及用于提升扩展效率的流形约束超连接(Manifold-Constrained Hyper-Connections)。以上均为厂商自述;没有可引用的独立架构审计。

• 预训练——一个 30 万亿 token 的多模态语料库(Z.ai 所述)。除 320B/18B 这一总体数字外,厂商未公布总训练算力数值,也未公布分层参数量明细。

一项总体性说法自发布以来已经收窄,如今应以当前文档为准。8月流传的那份关于服务硬件的披露称,那个匿名一周的容量约为10万颗中国国产芯片。而Z.ai今天可查的文档则称,该模型是“在数万个国产加速器上”提供服务的,在相同硬件上相较厂商自身基线实现了3倍的端到端服务性能提升,且每token成本被厂商描述为与主流NVIDIA GPU相当。数万是页面现在的说法;较大的数字是发布时期的说法。两者都是公司说法,均未经独立审计,而修订的方向是下调。

费率卡,以及为什么实际投放量才是关键

Z.ai 的定价页面显示,GLM-5.3-Flash 的价格为每百万输入 token 0.15 美元、每百万缓存输入 token 0.03 美元、每百万输出 token 0.50 美元,而同系列的 FlashX 档位则为 0.37 / 0.075 / 1.25 美元。这是厂商的标价,取自厂商自己的页面,读取日期为 2026-09-28。

今天在我们路由上实际提供的费率更低,而这就是本节的要点。在 2026-09-28 查看时,z-ai/glm-5.3-flash 的 OrcaRouter 卡片将输入定价为 $0.075 每百万 token,输出为 $0.25 每百万,缓存读取为 $0.0173 每百万。这只有供应商标价的一半,同一模型、同一天——是折后数字而非挂牌价,且卡片上没有任何促销标签。我们此前对该模型的报道曾指出,在所述促销窗口关闭后也存在同样的价差;这一观察今天仍然成立,我们仍然无法查明原因出处,因此我们报告实际提供的数字,并让原因保持未解。

缓存输入正是三个来源明显不一致的地方,这也提醒我们:表格里的“$0.03”未必是任何人实际支付的价格。供应商页面上写的是每百万缓存输入 token $0.03;Artificial Analysis 的模型记录中,缓存命中价格为 $0.026;而我们的线路提供的缓存读取价格为 $0.0173。三者的读取时间均在 2026-09-28 当天或稍早,且均为供应商或平台自行报告。我们把供应商的标价作为标价引用,把实际服务价格作为调用方真正被计费的价格。

对一个具有代表性的智能体任务进行测算——100,000 个输入 token 和 10,000 个输出 token,无缓存命中:

• 按供应商标价费率计算 — 100,000 个 token × $0.15/1M = $0.015,加上 10,000 个 × $0.50/1M = $0.005,因此每次调用为 $0.020

• 按我们路由今天提供的费率——$0.0075 加 $0.0025,即每次呼叫 $0.010,正好是一半

这正是为什么在确定工作负载规模之前,要查看实际服务价格而不是标价:对于一个每天运行数千次调用的长时程智能体来说,这两个数字之间的差距,就是两种预算之间的差距。OrcaRouter 以 0% 加价透传提供商的标价,所以供应商正在进行的折扣会直接显示在我们的价格卡片上,而不是在中间某个环节被吸收掉。

模态与端点表面

厂商文档中说明了一种接口形态和两个模型代码:glm-5.3-flash和glm-5.3-flashx,二者均通过 Chat Completion API 提供服务。图像以内容块的形式传入,在消息 content 数组中类型为 image_url,可接受 URL(厂商推荐使用这种方式)或 base64 data URL,且一条消息中可以发送多个图像块。支持流式传输,Z.ai 建议在流式请求中同时启用 stream 和 tool_stream。工具调用、上下文缓存和结构化 JSON 输出均为有文档记载的能力;思考功能受支持,但如下一节所述,并非可选。

FlashX 是同一模型的一个独立服务层级,而非一项独立的能力:Z.ai 的文档标明其速度为每秒 200 tokens,并说明它尚未在 GLM Coding Plan 上提供。它不是我们目录所收录的层级,也不是本页数据所描述的内容。

在我们的路由中,端点面更窄,值得精确说明。z-ai/glm-5.3-flash 的卡片暴露 POST /v1/chat/completions——仅支持 chat completions,没有第二个协议端点——并接受 reasoning、reasoning_effort、include_reasoning、tools、tool_choice、response_format、stream、temperature、top_p、max_tokens 和 stop。卡片上的能力标签为 vision、tools、JSON 和 reasoning。上下文为 1,000,000 个 token,最大输出为 128,000 个 token,与厂商文档一致。

投入程度与思考:锁定每个基准测试数字的设置

这是规范中对你如何解读分数影响最大的部分,供应商对此做了精确说明。GLM-5.3-Flash 接受一个 reasoning_effort参数,共有三个档位——low、high 和 max——如果你什么都不传,或者传入任何不是 low 或 high 的值,它都会默认为 max。思考无法关闭:供应商表示 thinking.type 仅支持 enabled。聊天模板的 clear_thinking 标志默认为 false,Z.ai 建议在聊天场景中将其显式传为 true。供应商推荐的采样设置是 temperature 为 1、top_p 为 0.95,并且它明确指出,基准测试和排行榜复现应保持默认的 max 推理强度。

把这两个事实放在一起看,任何要比较数字的人都无法回避这样一个结论:一个未注明投入档位的分数并不是一项完整的测量,因为 low、high 和 max 这三种设置是同一模型的不同工作点,而默认档是三者中成本最高的。我们的卡片在其支持的参数中公开了 reasoning 和 reasoning_effort,因此该设置可以经由这条路由访问,而不只是通过厂商。

基准表,附有修订版

Z.ai 发布了 GLM-5.3-Flash 的基准测试表,而这些数据完全由厂商自行报告——Artificial Analysis 的独立记录并未复现这些行。该厂商的主打编程与智能体指标为:DeepSWE v1.1 得分 63.4,而 GLM-5.2 为 46.2;AutomationBench v1.0.6 得分 48.8,而 GLM-5.2 为 26.2。表格其余部分,正如我们自己的目录所收录、并以 Z.ai 为署名来源的那样:Humanity's Last Exam with tools 55.3、Agents' Last Exam 26.3、NL2SQL 56.3、Chartography with tools 78、CharXiv reasoning with tools 89.4,以及在多模态方面 MMVU 80.5、MVBench 77.3 和 BabyVision 53.4。

有两行厂商数据值得把它们的脚注一并写进句子中,因为读者最有可能在不带脚注的情况下引用它们。Z.ai 的内部编程评测 Z.ai Code Bench v1.0 显示,GLM-5.3-Flash 在最大投入下得分为 29.0,而 Claude Opus 4.8 为 29.5——在该厂商自家的测试框架上几乎打平,运行于 Claude Code 2.1.207,由该厂商自行报告。这并非独立对比,也不是由第三方进行的同等投入对比;这是 Z.ai 在自家评测中拿自己的模型与竞争对手作比较。此外,该厂商还引用了 Artificial Analysis Intelligence Index 的 57 分,每任务成本 $0.045,并注明版本为 v4.1.1。

上一个数字需要与 Artificial Analysis 今天发布的内容区分开,因为不能把两者并列视为一次变动。Artificial Analysis 自己关于 GLM-5.3-Flash 的页面(读取于 2026-09-28)报告了智能指数为 41.8,基于 Index v4.3.2,在最大努力下记录。v4.3.2 包含十项评估——AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1——而 v4.1.1 不包含。两次指数修订,两套任务,两个数字。两者都没有错;它们不是同一种测量,而把 57 与 41.8 并列引用,仿佛模型发生了变动,无论朝哪个方向解读都会是错误。

独立记录所证实的是整体规格,而非评分:Artificial Analysis 独立记录到 320B 总参数、18B 激活参数、1,000,000 token 上下文窗口、MIT 许可证、开放权重以及 2026-08-26 的发布日期,并列出供应商定价为每百万 token 输入 $0.15、输出 $0.50,缓存命中价格为 $0.026。如果供应商发布了评分而独立方没有发布,我们会说明这一点;如果独立方证实了某项规格,那是本页最有力的一类事实。

这里没有对等的正面交锋,而承认这一点比硬凑一场更有用。还没有人公布过 GLM-5.3-Flash 与 Claude Opus 4.8、GPT-6 Sol 或 Grok 4.7 在共享测试框架上、按明确设定的努力程度进行的对比运行——Z.ai 自己的比较是在自家基准上、以最大努力程度,对阵竞品的默认设置。在这改变之前,这个模型与其他任何模型之间诚实的比较只能基于价格、能力包络和端点接口,而这三者正是本页上所有人都能从同一组数字中读出的东西。

未记录在案的内容,直白地说

对于一个信息面较为单薄的模型,参考页面只有坦诚面对其中的空白才有用,而这个页面恰好有几处这样的空白。

• 没有厂商知识截止日期。Z.ai 的文档和 Hugging Face 模型卡均未说明,Artificial Analysis 的记录中该字段也为空。来自隐身窗口的估算属于社区工作,而非厂商数字,本页不会将其当作厂商数字来复述。

• 该基准测试表的大部分内容没有关于 harness 的脚注。模型卡片确实为 HLE with-tools 运行附有脚注——temperature 1.0、top_p 0.95、最大生成长度为 163,840 个 token、在最多 300,000 个 token 的上下文下采用上下文管理策略进行评估,并以 medium effort 的 GPT-5.6 Luna 作为评判模型——也为 NL2Repo 和 DeepSWE 附有脚注,厂商称后者是使用 mini-swe-agent harness 运行的。其余各行则仅为百分比,未附有 harness 或 effort 信息。

• 没有对缓存输入价格差异作出解释。同一模型、同一数量却出现三个数字,且没有任何来源说明它们为何不同。

• 没有针对匿名服务期的独立基准测试。该隐秘上架已不复存在;它当时测得的任何结果都无法再次测量,而且在其上线期间,没有任何第三方针对该别名发布过运行测试。

• 由于上述原因,未进行同等投入的第三方对比。

• 没有供应商确认发布时的芯片数量。文档中说的是数万个国产加速器;10万这个数字并未出现在页面上。

就这么定了:我们目录所提供的内容,今日已验证

A single-column reference scoreboard titled 'GLM-5.3-Flash, the model behind Ox Alpha', with six rows reading 'Context: 1,000,000 tokens', 'Max output: 128K tokens', 'Input / output: text, image, video in / text out', 'Parameters: 320B total, 18B active, MIT licence', 'Vendor list price: $0.15 in / $0.50 out per 1M, $0.03 cached', and 'Served on OrcaRouter: $0.075 in / $0.25 out per 1M'. A footer line reads 'Z.ai-reported envelope and list price; OrcaRouter card read 2026-09-28; Artificial Analysis independently confirms 320B/18B, 1M context and MIT.' The OrcaRouter logo is composited in the bottom-right corner.

Ox Alpha 背后的模型已以自身名称在我们的目录中上线,这是今天核实过的,而非假设。2026-09-28 对 z-ai/glm-5.3-flash 的 OrcaRouter 模型 API 进行的一次读取完整返回了该卡片:1,000,000 token 上下文、128,000 最大输出、文本、图像和视频输入并输出文本,能力标签为 vision、tools、JSON 和 reasoning,发布日期为 2026-08-26,未弃用、未下架,价格为每百万输入 token $0.075、每百万输出 token $0.25、每百万缓存输入 token $0.0173,经由单一端点 POST /v1/chat/completions 提供。

我们自己在 Playground 上对那张模型卡进行的七天测量显示,同一时间段内为每秒 61.8 个输出 token,首 token 时间 p50 为 7.39 秒,错误率为 1.47%。这些是关于我们自身服务的第一方数据,不是供应商的数字,也不是独立基准测试;因此,它们是本页唯一的速度数据。

这个别名本身并不在这条路由上。如果你是搜索 Ox Alpha 才来到这里的,那么应该调用的模型是 z-ai/glm-5.3-flash,请求结构与上文描述的一致。它与目录中其他所有内容共用同一把密钥——一套 API 覆盖 200 多个模型,供应商的价格原样传递、不额外加价,并且当供应商停滞时会自动故障转移,因此你正在试用的模型,不必是生产路径所依赖的模型。

A screenshot of the OrcaRouter model page for Z.ai GLM-5.3-Flash (z-ai/glm-5.3-flash), showing the model name and provider, a 1M-token context window with 128K maximum output, text, image and video input with text output, a stat strip reading $0.075 input and $0.25 output per million tokens, the capability chips Vision, Tools, JSON and Reasoning, a release date of 2026-08-26 and a supported-endpoint line reading POST /v1/chat/completions, with a code sample against the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

关于本页是什么,需要先作一点澄清,因为从模型自身名称过来的读者理应得到这个说明。这是一个已收录在目录中的模型的参考页,而不是发布报道:GLM-5.3-Flash 的日期是 2026 年 8 月 26 日,它在这里的位置取决于 Ox Alpha 这个名字不断被搜索、却没有专门页面可供落脚这一事实,而不是取决于这次发布有多新。上方的日期用于给该模型标注日期,而不是当作新闻。能改变本页内容的,是以下四件事之一——在注明投入程度的情况下进行的独立基准测试、厂商声明的知识截止日期、服务费率的调整,或 Z.ai 决定说明发布时期的芯片数量究竟是多少。在其中任何一项落地之前,上方规格就是厂商文档所载的全部内容,而上一节列出的空白,与那些数字一样,都是答案的组成部分。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新