为文章《Mistral Large 4 vs Claude Opus 5》生成的一张标题卡:标题采用粗体几何无衬线字体,其下方是副标题“差距比价差更小”,上方有一排三个扁平线性图标——两根高度不等的条形、一个价签和一个人工评分量表——背景为白色,带有蓝色与青色的渐变点缀,右下角是 OrcaRouter 标志。
Guides & Insights

Mistral Large 4 对比 Claude Opus 5:差距比价差还小

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

任何人公开发布的、关于Mistral Large 4与Claude Opus 5的唯一正面对比数字,来自一次人类盲评,而且比基准测试表格显示的更接近。Surge AI 隐藏了模型身份,并让专业标注员按 1–5 分制给编程输出打分;Claude Opus 5 以 4.22 分位列第一,Mistral Large 4 Preview 以 3.74 分位列第二,领先于 Kimi K3、GLM-5.3 和 GLM-5.2。在独立汇总数据上,两者根本不在相邻位置——在 Artificial Analysis 的 Intelligence Index 上,10 月 6 日的读数为 50.8 对 38.4。这组对比之所以值得花一个下午,是因为得分低 12 分的模型运行一项任务的成本大约只有其五分之一。

这两个数字都需要标明出处,因为它们不是同一类数字。Surge AI 的评估是 Mistral 委托并发表的第三方人类研究——它比自行开展的基准测试是更有力的证据形式,但它仍然是一项由 Mistral 控制发表的研究。这些指数分数是 Artificial Analysis 自己运行得出的,彼此之间具有可比性,因此是推理时应依据的正确一对。两者单独都不能告诉你该基于哪个模型来构建;合在一起,它们才框定这个问题。

两款产品,而非同一款产品的两代

Claude Opus 5 是该厂商推出的闭权重旗舰模型,于 2026 年 7 月 24 日发布,提供 100 万 token 的上下文窗口和最高 128K 的输出 token,定价为每百万输入 token 5 美元、每百万输出 token 25 美元,缓存读取为 0.50 美元。它是该厂商 Opus 系列中能力最强的模型,明确面向长时程智能体工作——在大量使用工具的多步骤会话中保持连贯。

Mistral Large 4 是一个预览版,于 2026 年 10 月 6 日发布,Mistral 将其描述为一个 1.05 万亿参数的稀疏专家混合模型,拥有 490 亿激活参数和一个 16 亿参数的视觉编码器。其 API id 为 mistral-large-4-0,原生支持多模态,Mistral 的文档为其给出 100 万 token 的上下文窗口,而 Artificial Analysis 在其测试的配置上读数为 524,288。权重承诺于 10 月底发布,许可证尚未命名。

所以这不是新模型对旧模型的比较。这是专有的前沿模型对一个即将开源的挑战者,两者的定价也相应不同。

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' is listed at version v26.10 with the description 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 that does carry an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible, with the OCR MODELS section starting below.

相同的索引,两个模型

于10月6日从他们的 Artificial Analysis 页面读取,基于 Intelligence Index v4.3:

• 智能指数 — Mistral Large 4 Preview 38.4 对比 Claude Opus 5 50.8

• 每个索引任务的成本 — Mistral Large 4 Preview 为 $1.13,而 Claude Opus 5 为 $5.86

• Terminal-Bench 4.0 — 26.8% vs 49.0%,两者之间最大的单项差距

• 人类最后的考试 — 35.0% 对 54.9%

• MMMU-Pro,多模态推理 — 76.4% 对比 84.7%

• AutomationBench,商业工作流——59.9% 对 56.6%,Mistral Large 4 领先的唯一一行

• 上下文窗口 — Mistral 标称 1M,测试配置下为 524,288,而实际提供 1M

• 输出上限——预览版未公布,对比 128K tokens

• 每百万价格,输入 / 输出 — 标价 $1.36 / $4.18,当前促销价 $0.68 / $2.09,对比 $5.00 / $25.00

A generated two-column scoreboard titled 'Mistral Large 4 vs Claude Opus 5 — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; Humanity's Last Exam 35.0%; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Claude Opus 5': Intelligence Index v4.3 50.8; cost per index task $5.86; Terminal-Bench 4.0 49.0%; Humanity's Last Exam 54.9%; MMMU-Pro 84.7%; AutomationBench 56.6%.

这个模式清晰可辨。Opus 5 在两个最难的、以推理为主的行上领先——终端操作与开放式知识——并且在多模态理解上也领先,尽管 Mistral Large 4 才是以视觉能力为卖点的模型。Mistral Large 4 在工作流自动化这一行领先,而这一行最接近业务部门实际要求模型去做的事,且它做到这一点时每任务价格只有五分之一。

Mistral Large 4 真正胜出之处

Mistral 发布文章中最有趣的论断并不是基准测试得分。而是在 Artificial Analysis Cyber Index 的一项测试中——复现开源软件中的一个真实漏洞,然后将其修补——Mistral Large 4 得分 82%,据称是所有模型中最高的,并且若干领先的闭源模型在同一测试中得分接近零,因为它们拒绝执行该任务。Mistral 点名 Claude Opus 5.5 和 GPT-6 Astra 作为这种拒绝的例子。

那是对供应商所引用数字的一种供应商解读,也应该按这种方式来理解。如果成立,这也是一种真实的运营差异:无法复现某个漏洞的模型,就不能用来证明该漏洞确实存在,而这在大多数事件响应中是第一步。Mistral 将 82% 与 Cybench 的 40 项竞赛练习中 93% 的得分并列,并提出反驳称,其在来自 JailbreakBench、StrongREJECT 和 AgentHarm 的网络提示上的拒绝率高于其他开放权重模型——其论点是,人们希望能力与纪律存在于同一个模型中,而不是为了一个而牺牲另一个。

除了网络安全之外,支持 Mistral Large 4 的理由还建立在 Opus 5 所不具备的三点上。它在欧洲基础设施上训练并提供服务,受欧洲法律管辖,这对负有数据驻留义务的买家来说至关重要。Mistral 承诺,它将可以下载——这正是整件事的关键所在,因为正是自部署消除了 Mistral 竭力描述的那种事件中途访问风险。而且它的单任务成本足够低,以至于先用它跑第一遍、再把难啃的残余部分升级交给前沿模型,在经济上是划算之举,而不是可以忽略不计的零头。

Claude Opus 5 仍然物有所值之处

12 个百分点的指数差距并不小,而逐行数据清楚说明了差距体现在哪里。Terminal-Bench 4.0 几乎翻了一倍——49.0% 对 26.8%——而终端类工作是智能体编程最接近的公开代理指标,智能体编程正是今年各团队采购前沿模型的主要用途。Humanity's Last Exam 将二者拉开了 20 个百分点。在长时程自主性方面,如果你的工作负载是多小时的智能体会话,而不是单个高难度问题,那么 Opus 5 的自适应推理设计、128K 输出上限以及实际可用的 1M 上下文,正是你想要的配置。

输出上限是那个更不显眼的差异。Mistral 尚未公布该预览版的最大输出长度,而 Opus 5 的 128K 对代码生成和长结构化文档而言确实解除了一个实际约束。如果你的流水线产出的是文件而非答案,那么在切换之前先核实这个数字,因为这类差距往往只在生产环境中才会暴露出来。

每项任务成本才是要牢牢盯住的数字。

按 token 计价会美化廉价模型,也会让人对昂贵模型产生误判。该指数自身的单任务成本——完成一项评估任务的总支出,缓存等全部算在内——才是经得起预算检验的数字:1.13 美元对 5.86 美元。

这并不是把一切都搬到更便宜模型上的许可,因为便宜模型搞不定的任务,你要付两次钱。它是让你不再把单一前沿模型当作唯一选择的许可。在OrcaRouter上,Claude Opus 5 以供应商标价、0% 加价出现在目录中,与其他 200 多个模型同处一个兼容 OpenAI 的端点,这正是为什么双模型流水线只需一个下午就能搭好,而不必再签一份供应商合同。Mistral Large 4 目前不在目录中——该预览版需通过 Mistral 自家的 API 和若干第三方平台获取。当它的权重发布、并有提供商托管它时,同样的转嫁规则依然适用:供应商收多少,就向你收多少,供应商降价当天就会体现在你的账单上。

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the model identity, a 1M-token context window, a 128K maximum output, input modalities of text, image and file with text output, the pre-October-2026 release date, a p-50 time-to-first-token figure of 4.82 seconds, pricing of $5.00 per million input and $25.00 per million output, and an OpenAI-compatible code sample pointing at the api.orcarouter.ai base URL.

对于一个尚未经过验证的预览版而言,最关键的路由功能就是故障转移。将一部分生产流量交给 Mistral Large 4,同时让 Opus 5 承接其余流量,意味着一旦出现性能回退,就会变成一次重新路由,而不是一次服务中断;而且你是在自己的数据上、而非在排行榜上了解该模型真实的失效模式。

什么能在三周内解决这件事?

有三个事实仍未确定,而每一个都会改变答案。如果权重以宽松许可证发布,Mistral Large 4 就会成为这一对中唯一可供你自行托管的模型,受监管买家的权衡也会大幅倾斜。如果促销价 $0.68 / $2.09 恢复到价目表上的 $1.36 / $4.18,每任务差距会收窄,但依然具有决定性。而如果 Artificial Analysis 将私下评估的编程数据原样移入其公开指数,那么编程方面的说法就会变成经第三方验证,而非供应商借第三方之名发布。

在此之前:Opus 5 是安全的生产默认选择,对于智能体和高强度终端类工作而言,其数倍的价格是值得的。Mistral Large 4 则是更有意思的一注——单任务成本足够低,可以与之并行运行;在自动化和网络安全方面能力足够强,今天就能赢得流量;并且承诺支持自部署,这是本次对比中任何闭源模型都无法匹敌的。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新