一张“Qwen 4 Max vs GLM-5.3”的主视觉标题卡,副标题为“开放权重、自定义许可,以及真正会发布的那一档”,三个胶囊徽章分别写着“1.26 美元和 3.96 美元”、“纯文本 vs 多模态”和“27B 才是值得关注的那个”,页脚一行写着“阿里巴巴于 2026 年 9 月 22 日宣布;GLM-5.3 于 2026 年 8 月 18 日列出”,右下角是 OrcaRouter 标志。
Engineering & Research

Qwen 4 Max 与 GLM-5.3:开放权重、自定义许可证,以及真正交付的那一档

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Qwen 4 Max 于 2026 年 9 月 22 日在杭州云栖大会上首次预览,作为四款模型产品线中的旗舰,该系列还包括 Qwen 4 Flash、Qwen 4 Plus 以及开放权重的 Qwen 4 27B 层级。Z.ai 的 GLM-5.3 自 2026 年 8 月 18 日起上架,仅支持文本,具有 100 万 token 上下文窗口和 128,000 token 输出上限,在我们的目录中为每百万输入 token 1.26 美元、每百万输出 token 3.96 美元,而 Z.ai 公布的标价分别为 1.40 美元和 4.40 美元。两家实验室都出自开放权重传统,如今都通过托管 API 销售前沿层级模型,因此常见的闭源与开源对立框架在这里并不适用。真正适用的维度是没人会放进对比表里的那个:许可证实际允许什么,以及每个家族中哪一层级才是你可以用来做任何有趣事情的。

两个实验室,同一个问题的两种答案

阿里巴巴和 Z.ai 是前沿附近实验室中最一贯的两家开放权重发布者,而对于这种开放性有多少能延续到旗舰层级,它们采取了不同的姿态。

阿里巴巴的 Qwen 3.8 代际于 2026 年 8 月 12 日发布了其最大模型 Qwen3.8-2.4T-A95B 的权重,包含 BF16 和 FP8 两种格式。这些权重采用的并非 Apache 2.0,而是阿里巴巴自定义的 Qwen 许可证。这一区别正是关键所在:权重确实存在,这意味着微调、量化和自托管都成为可能,而对闭源模型来说这永远无法实现;但条款由阿里巴巴自行制定,它们并不是“开放权重”这一说法通常暗示的那种宽松默认许可。

Z.ai 的 GLM 系列出自一个有着开放权重传承的实验室,而旗舰模型也不再是这一传统的例外。GLM-5.3 自身的权重已于 2026 年 8 月 28 日发布——这个 7430 亿参数的旗舰模型以 141 个 safetensors 分片形式发布——采用的是 Z.ai 为其专门编写的自定义许可证,而非 MIT。条款大致相当于 MIT 授权,但为收入超过某一高门槛的模型即服务业务附加了安全审查条件。请注意这对该系列意味着什么:GLM-5.2 和 GLM-5.3-Flash 采用 MIT 许可证,而旗舰模型则不然。

如所列,GLM-5.3 是一个纯文本模型,具有已公布的上下文窗口、已公布的输出上限,以及有文档记载的工具调用、JSON 模式和推理能力。

把两者放在一起对比,实际上的区别是这样的:

• 旗舰权重——Qwen 3.8 旗舰模型依据自定义 Qwen 许可协议发布,而 GLM-5.3 权重则于 2026 年 8 月 28 日依据自定义 Z.ai 许可协议发布

• 输入价格 — 在我们的目录中,Qwen3.8-Max 为每 100 万 tokens 2.00 美元,而 GLM-5.3 为每 100 万 tokens 1.26 美元,在 Z.ai 自己的价目表上则为 1.40 美元

• 输出价格——Qwen3.8-Max 为每 100 万 tokens 6.00 美元,而 GLM-5.3 在我们的价目表中为每 100 万 tokens 3.96 美元,在 Z.ai 自己的列表上则为 4.40 美元

• 上下文 — Qwen3.8-Max 100万 tokens 对比 GLM-5.3 100万 tokens

• 输出上限 — Qwen3.8-Max 128K tokens 对比 GLM-5.3 128K tokens

• 模态 — Qwen3.8-Max 支持文本、图像和视频输入,而 GLM-5.3 仅支持文本,并已如此记录

• 能力标签 — Qwen3.8-Max 的视觉、工具、JSON 和推理 对比 GLM-5.3 的工具、JSON 和推理

• Qwen 4 Max —— 于 2026 年 9 月 22 日宣布,无价格、无上下文、无权重、无发布日期,而 GLM-5.3 已发布并承接流量

多模态这一行才是为价差买单的一方。Qwen 的旗舰模型接受图像和视频输入,输入收费 2.00 美元、输出收费 6.00 美元;GLM-5.3 接受文本,收费为 1.26 美元和 3.96 美元。如果你的工作负载是文本,那你就是在为你从未调用过的视觉编码器溢价付费,而这就是纯文本专用模型在文本工作的成本上胜过多模态旗舰模型的最具体原因。

A two-column scoreboard titled "Qwen 4 Max vs GLM-5.3 - the scoreboard". Left column Qwen 4 Max: Status Max announced, no date; Input price $2.00 per 1M tokens; Output price $6.00 per 1M tokens; Modality text, image, video in; Flagship weights custom Qwen licence; Output ceiling 128K tokens. Right column GLM-5.3: Status shipping since Aug 18 2026; Input price $1.26 per 1M tokens; Output price $3.96 per 1M tokens; Modality text-only; Flagship weights custom Z.ai licence, Aug 28 2026; Output ceiling 128K tokens. Footer reads "GLM-5.3 pricing from its catalogue listing; Qwen3.8-Max figures from its published model card, September 22 2026.", with the OrcaRouter logo bottom-right.

27B 层级才是决定这一点的那个层级。

Qwen 4 Max 是头条,而 27B 这一档才是真正的看点。每一代 Qwen 都以允许人们放手去做的条款发布其小型开源档位,而下游的证据也毫不含糊:Qwen 3.8 27B 权重落地后没几天,生态里就出现了 MLX 转换、NVFP4 量化以及未经审查的微调版本,而这些都不需要任何人的许可。这正是宽松的小模型发布所能换来的东西,也是一种任何托管 API 都无法匹敌的分发方式。

旗舰层级则是另一回事。一个以自定义许可证发布的2.4万亿参数模型,其“开放”在于字节可下载,其“封闭”在于你可以用它做什么由发布方界定。这两件事同时成立,而Qwen 4的发布公告并未改变其中任何一点。如果Qwen 4 27B层级沿袭其前代产品的模式,那么它将是关乎最多人的一次发布,同时也是交付日期最可预测的一次发布,因为小型开放层级是路线图上最容易完成的一环。

这就把对比拉回到了可用的层面。GLM-5.3 是一个托管模型,价格公开,能力范围也有成文说明,而且现在就能用。Qwen 4 Max 只是一个档位名称。如果你想让关于开放性的论证变得具体,而不是停留于哲学层面,那么值得等的模型是 27B,而不是 Max。

路由层正是许可证问题不再重要的地方

这个决策存在一种完全绕开许可证问题的做法,而且值得坦诚地说,这是一种真正可行的选择,而非妥协。如果你的需求是调用一个模型,而不是拥有一个模型,那么权重上的许可证就无关紧要,真正重要的条款是价格、延迟和故障行为。

OrcaRouter 以 z-ai/glm-5.3 的名义提供 GLM-5.3,每百万 token 输入 $1.26、输出 $3.96 —— 低于 Z.ai 公布的 $1.40 和 $4.40,模型页面会将这两个标价与我们实际计费的费率并列展示,且在我们向供应商支付的费用之上不加任何加价。同一个 OpenAI 兼容端点还提供 Qwen 3.8 系列,Qwen3.8-Max、Qwen3.8-Flash 和 Qwen3.8-27B,以及近 200 个其他模型,当某条供应商路径性能下降时自动故障转移,并提供一套路由 DSL,让你可以显式表达替换策略,而不必在应用代码里修改模型字符串。当供应商调整费率时,变更当天就会体现在你的密钥上,因为中间没有会把它卡住的利润加价层。

OrcaRouter 并未提供 Qwen 4 Max 或任何 Qwen 4 层级的产品。产品目录中没有该系列的任何条目,对于一个已在台上宣布但尚未发布的模型来说,这才是正确的状态。Qwen 4 Max 若能访问,也将是通过厂商自己的 API 和若干第三方平台。在那之前,本次对比中你实际可以调用的 Qwen 模型是 Qwen3.8-Max,它与 GLM-5.3 同属一个产品目录——这使得这场对决的实际可用版本成为一项路由策略决策,而非采购决策。

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, English UI), showing the 1M token context badge, the model ID z-ai/glm-5.3, a 128K maximum output, text input, the Tools, JSON and Reasoning tags, the listing date 2026-08-18 credited to Z.ai, a p50 time-to-first-token of 4.41s, the OpenAI-compatible code samples against api.orcarouter.ai/v1, and the opening of the model description calling GLM-5.3 Z.ai's latest flagship for complex software engineering and long-horizon agentic tasks.

许可问题实际上决定了什么

GLM-5.3 在两个维度上都更便宜,其上下文窗口和输出上限与 Qwen 旗舰机型持平,其模态限制有文档可查,而不是留给用户自行推断,而且它今天就已经在承载流量。Qwen 4 Max 拥有的只是一个发布会档期和一个层级名称,而 Qwen 4 路线图中唯一交付时间可预测的部分,就是 27B 层级。

发布会过后依然成立的决策,不是哪个模型更好,而是你是否需要真正拥有这东西。如果你需要自行托管、微调或修改,那么两家中任何一家的旗舰模型权重都附带条款,在以此建立业务之前,你应该先读一读;而宽松许可的选项历来都存在于小型的开放层级中。如果你需要调用模型,就文本任务而言,GLM-5.3 是如今更便宜的选择;如果你需要图像或视频输入,Qwen3.8-Max 就是答案;而这两者都只差一个端点和一张账单。等阿里巴巴发布模型卡时,再重新审视旗舰模型的问题;并且先读许可证,再看基准测试表。

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the 1M token context badge, the model ID qwen/qwen3.8-max, text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, and the model description naming Qwen3.8-Max Alibaba's newest flagship and highest-capability tier to date.

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新