为文章《Mistral Large 4 vs GLM-5.5》生成的一张标题卡,标题以粗体几何无衬线字体呈现,其下方是副标题“A real model against a name”,上方则是一排三个扁平线性图标——一个实心模型卡旁边是一个空白的虚线轮廓卡——背景为白色,带有蓝色与青色的渐变点缀,右下角是 OrcaRouter 标志。
Guides & Insights

Mistral Large 4 对比 GLM-5.5:真正的模型对决徒有其名

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

没有 GLM-5.5 可供对比Mistral Large 4。截至 2026 年 10 月 6 日,这个名字没有模型卡,没有 API 标识符,没有定价条目,没有检查点,也没有许可证文件,而 Z.ai 自己的网站也从未在任何地方使用它。那个编号序列末端的模型是GLM-5.3,Z.ai 于 2026 年 8 月 18 日发布——正是 Mistral 在其自己的发布帖中指名将 Mistral Large 4 与之对比的同一个 Z.ai 开放权重旗舰模型。所以,实际能进行的对比,是今天发布的预览版,对比一个两个月前发布的开放权重模型;后者有实时价格、每周 45 亿 token 的真实流量,以及一份你可以阅读的许可证文件。无论如何,这反倒成了更有用的对决。

它也比发布文章所做的 GLM 对比更能干净地检验 Mistral 的说法。Mistral 称,Mistral Large 4 是中国境外构建的最强开放权重模型。GLM-5.3 则是中国境内构建的最强开放权重模型。这两项说法可以在同一指数上相互验证,而其中一项目前所依赖的权重尚未发布。

什么存在,以及什么不存在

检查大约需要十分钟,而这些都是已发布的 Z.ai 旗舰产品会出现的地方:

• Z.ai 自己的 model-api 页面恰好只列出了三张卡片——GLM-5.3、GLM-5.3-FlashX 和 GLM-5.2。在任何 5.4 或 5.5 名下都没有第四条条目。

• Artificial Analysis 有一个 GLM-5.3 的实时页面;artificialanalysis.ai/models/glm-5-5 和 /glm-5-4 均返回 404。

• zai-org Hugging Face 组织最新的仓库是 GLM-5.3 系列,创建于 2026 年 8 月 25 日——其中包括 GLM-5.3、GLM-5.3-BF16 和 GLM-5.3-Flash。不存在比这更晚的内容。

• 我们自己的目录对 z-ai/glm-5.5、z-ai/glm-5.4 和 z-ai/glm-6.0 返回模型未找到,而 z-ai/glm-5.3 能解析出实时价格。

• Z.ai 在 2026 年 8 月 31 日的财报电话会议上将 GLM-6.0 称为下一代基座,完全跳过了 5.4 和 5.5。

这个名字之所以流传,是因为 Z.ai 在 8 月发布了 5.3,而下一款旗舰自然会被读作下一个数字。那是一种命名惯例,而不是一款产品。本文中的任何内容都不应被解读为 GLM-5.5 的规格表,因为要制作这样一份规格表,就意味着其中每个数字都只能靠编造。

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid with 'Mistral Large 4' at version v26.10 described as 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside Mistral Large 3 at v25.12 with an APACHE 2.0 badge, and Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes. Z.ai GLM 5.3 appears as the first card in the grid.

真正的对比:Mistral Large 4 preview 与 GLM-5.3

Mistral 的数据来自其自家的发布帖和模型卡;GLM-5.3 的数据来自其在 OrcaRouter 上的实时目录条目及其 Artificial Analysis 页面,二者均于10月6日查阅。

• 架构 — 总参数 1.05T / 激活参数 49B 的稀疏 MoE,配备 1.6B 视觉编码器,对比仅文本且已公开发布开放权重的 MoE

• 模态 — 文本和图像输入、文本输出 vs 文本输入、文本输出

• 上下文窗口 — Mistral 声称 1M,Artificial Analysis 测试的配置为 524,288,而实际提供的是 1M

• 输出上限 — 未公布 vs 128K 个 token

• 每百万价格,输入/输出 —— 标价 $1.36 / $4.18,当前促销价 $0.68 / $2.09;对比标价 $1.40 / $4.40,当前实际服务价 $1.26 / $3.96

• 每百万缓存输入 — $0.14,当前为 $0.07,对比标价 $0.26,实际服务价 $0.234

• 智能指数 v4.3 — 38.4 vs 44.8

• 每个索引任务的成本 — 1.13 美元 vs 2.01 美元

• Terminal-Bench 4.0 — 26.8% 对比 41.9%

• AutomationBench — 59.9% 对比 62.2%

• 权重——承诺于十月底,许可证未具名 vs 现已根据 Z.ai 自己的条款提供

直白地说:GLM-5.3 在独立指数上高出 6.4 分,是更好的模型,而且已经可以下载。Mistral Large 4 每完成一个任务便宜 44%,但在 Terminal-Bench 这一项上,作为编码模型弱了十五分。定价上的对称纯属巧合,且接近到令人困惑——标价分别为 $1.36 / $4.18 与 $1.40 / $4.40,不过 OrcaRouter 以 $1.26 / $3.96 提供 GLM-5.3,直接低于 Mistral 的标价。Mistral 的促销价 $0.68 / $2.09 是让预览版今天更便宜的原因,而这是一个发布价。

在 Mistral 占上风的地方

重要的是两行,而两者都不是索引。

第一个是多模态的。GLM-5.3 是一个文本输入、文本输出的模型,其产品目录卡对此说得很明确。Mistral Large 4 搭载了一个 16 亿参数的视觉编码器,Mistral 声称其在开源模型中具备最先进的视觉定位能力——援引在 Dense 200 上取得 42%、而 GPT-6 Astra 为 41% 的成绩,并展示了十亿像素级卫星影像、工程图纸和密集文档检索的演示。在同一测试框架上,GLM-5.3 的多模态得分并未出现,因为根本没有什么可评分的。对于任何需要读取图表、图纸、申报文件或截图的流水线来说,这场比较就只剩下一个候选者。

第二项是安全方面的工作。Mistral 在 Artificial Analysis Cyber Index 测试中声称达到 82%,该测试要求模型复现一个真实漏洞并随后将其修补——据称是所有模型中最高的——此外还在 Cybench 的 40 项竞赛练习中取得 93%,并在 Cyber Index 总排名中进入前五,领先于在中国以外构建的开源权重模型。Z.ai 也发布了针对 GLM-5.3 的网络安全宣称,而 GLM-5.3 自己的描述称其在部分网络安全能力上与 Mythos 5 相当。这两组数据都来自厂商引用,因此两者都应如此标注。区别在于,Mistral 的数据被放在一个具名的独立指数上,并与一项具体测试挂钩,这使它们更容易核查,也更容易被证伪。

A generated two-column scoreboard titled 'Mistral Large 4 vs GLM 5.3 — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; AutomationBench 59.9%; multimodal vision encoder; weights promised end of October. Right column 'GLM 5.3': Intelligence Index v4.3 44.8; cost per index task $2.01; Terminal-Bench 4.0 41.9%; AutomationBench 62.2%; multimodal text only; weights open and available now.

其他一切都有利于现有供应商,而关于预览成本的论点才是需要警惕的那个。Mistral 的发布文章称,该预览版运行在其训练所用的同一套欧洲基础设施上——即位于 Mistral 自有数据中心内的 3,800 块 NVIDIA Grace Blackwell GPU——并且权重将在十月底跟进发布。这如今为你带来的是一个可调用的模型,且其预览期有明确的结束时间;但它无法为你带来的,恰恰是 Mistral 整套宣传所立足的那件事。

什么会让 GLM-5.5 成为一个模型

如果 Z.ai 确实发布了 5.4 或 5.5,相关产物会按固定顺序出现,而且每一个都可以在无需向 Z.ai 询问任何信息的情况下进行核验:

• Z.ai 自有 model-api 页面上的一个模型卡,该页面目前只列出三个条目,仅此而已

• 一个可成功解析的 API 标识符,就像 z-ai/glm-5.3 能解析而 z-ai/glm-5.5 不能那样

• Z.ai 文档中一行按每百万 token 计费的定价

• 一个来自 zai-org 组织、附带许可证文件的 Hugging Face 仓库——当前系列截至 2026 年 8 月 25 日

• 中立基准评测机构的一个页面,glm-5.5 目前在该页面返回 404

前瞻性证据指向的并非这个名字,而是与之相反的方向:该公司自己的财报电话会议跳过了 5.4 和 5.5,直接点名 GLM-6.0 为下一代。这个月还在写 GLM-5.5 规格书的人,写的不过是一篇标题看似合理的虚构故事。

在现有的两者之间做出选择

如果你想要今天更好的模型,答案是 GLM-5.3,而且在独立指数上它遥遥领先。它在 Intelligence Index v4.3 上领先 6.4 分,在 Terminal-Bench 4.0 上领先十五分,在工作流自动化方面也领先,是一个真正的开放权重发布,带有可下载的检查点,并且每周在我们的目录中流转超过五十亿个 token——这样的量级告诉你,它的失败模式是已知的。它的上下文是已提供服务的一百万 token,输出上限是已公布的 128K;相比之下,有一个预览版的上下文数字会因你读的是谁的页面而相差两倍,而且其输出上限完全没有说明。

如果你需要视觉能力,如果你需要做安全工作,或者如果带明确结束日期的预览版对于一款未来可能由你自己运行的模型来说是可以接受的风险,那么 Mistral Large 4 就是这笔交易中有意思的那一面。在 OrcaRouter 上,GLM-5.3 以服务商的价格出现在目录中,加价 0%,与 200 多个其他模型共用同一个 OpenAI 兼容端点,并具备跨服务商的自动故障转移,以及一套路由 DSL,可以把分类和抽取任务发给当周最便宜的那个模型。Mistral Large 4 不在我们的目录中;该预览版需通过 Mistral 自己的 API 以及若干第三方平台访问。

A screenshot of the OrcaRouter model page for z-ai/glm-5.3, showing the model identity, a 1M-token context window, a 128K maximum output, text-only input with text output, the 2026-08-18 release date, a p-50 time-to-first-token figure of 3.99 seconds, pricing of $1.26 per million input and $3.96 per million output, and a code sample against the api.orcarouter.ai base URL. The page describes the model as Z.ai's latest flagship for complex software engineering and long-horizon agentic tasks, text-in and text-out.

明确你到底在买什么。GLM-5.3 是一个产品。Mistral Large 4 是一个附带承诺的产品,而承诺正是尚未交付的那部分。它们之间的差距不在于那 6.4 个指数点——这些还会变动——而在于:这些模型中的一个以你能握在手里的形态存在,另一个则只是一个带着交付日期的命名约定。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新