
Mistral Large 4 对比 Claude Opus 5:差距比价差还小
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 151 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
任何人公开发布的、关于Mistral Large 4与Claude Opus 5的唯一正面对比数字,来自一次人类盲评,而且比基准测试表格显示的更接近。Surge AI 隐藏了模型身份,并让专业标注员按 1–5 分制给编程输出打分;Claude Opus 5 以 4.22 分位列第一,Mistral Large 4 Preview 以 3.74 分位列第二,领先于 Kimi K3、GLM-5.3 和 GLM-5.2。在独立汇总数据上,两者根本不在相邻位置——在 Artificial Analysis 的 Intelligence Index 上,10 月 6 日的读数为 50.8 对 38.4。这组对比之所以值得花一个下午,是因为得分低 12 分的模型运行一项任务的成本大约只有其五分之一。
这两个数字都需要标明出处,因为它们不是同一类数字。Surge AI 的评估是 Mistral 委托并发表的第三方人类研究——它比自行开展的基准测试是更有力的证据形式,但它仍然是一项由 Mistral 控制发表的研究。这些指数分数是 Artificial Analysis 自己运行得出的,彼此之间具有可比性,因此是推理时应依据的正确一对。两者单独都不能告诉你该基于哪个模型来构建;合在一起,它们才框定这个问题。
两款产品,而非同一款产品的两代
Claude Opus 5 是该厂商推出的闭权重旗舰模型,于 2026 年 7 月 24 日发布,提供 100 万 token 的上下文窗口和最高 128K 的输出 token,定价为每百万输入 token 5 美元、每百万输出 token 25 美元,缓存读取为 0.50 美元。它是该厂商 Opus 系列中能力最强的模型,明确面向长时程智能体工作——在大量使用工具的多步骤会话中保持连贯。
Mistral Large 4 是一个预览版,于 2026 年 10 月 6 日发布,Mistral 将其描述为一个 1.05 万亿参数的稀疏专家混合模型,拥有 490 亿激活参数和一个 16 亿参数的视觉编码器。其 API id 为 mistral-large-4-0,原生支持多模态,Mistral 的文档为其给出 100 万 token 的上下文窗口,而 Artificial Analysis 在其测试的配置上读数为 524,288。权重承诺于 10 月底发布,许可证尚未命名。
所以这不是新模型对旧模型的比较。这是专有的前沿模型对一个即将开源的挑战者,两者的定价也相应不同。

相同的索引,两个模型
于10月6日从他们的 Artificial Analysis 页面读取,基于 Intelligence Index v4.3:
• 智能指数 — Mistral Large 4 Preview 38.4 对比 Claude Opus 5 50.8
• 每个索引任务的成本 — Mistral Large 4 Preview 为 $1.13,而 Claude Opus 5 为 $5.86
• Terminal-Bench 4.0 — 26.8% vs 49.0%,两者之间最大的单项差距
• 人类最后的考试 — 35.0% 对 54.9%
• MMMU-Pro,多模态推理 — 76.4% 对比 84.7%
• AutomationBench,商业工作流——59.9% 对 56.6%,Mistral Large 4 领先的唯一一行
• 上下文窗口 — Mistral 标称 1M,测试配置下为 524,288,而实际提供 1M
• 输出上限——预览版未公布,对比 128K tokens
• 每百万价格,输入 / 输出 — 标价 $1.36 / $4.18,当前促销价 $0.68 / $2.09,对比 $5.00 / $25.00

这个模式清晰可辨。Opus 5 在两个最难的、以推理为主的行上领先——终端操作与开放式知识——并且在多模态理解上也领先,尽管 Mistral Large 4 才是以视觉能力为卖点的模型。Mistral Large 4 在工作流自动化这一行领先,而这一行最接近业务部门实际要求模型去做的事,且它做到这一点时每任务价格只有五分之一。
Mistral Large 4 真正胜出之处
Mistral 发布文章中最有趣的论断并不是基准测试得分。而是在 Artificial Analysis Cyber Index 的一项测试中——复现开源软件中的一个真实漏洞,然后将其修补——Mistral Large 4 得分 82%,据称是所有模型中最高的,并且若干领先的闭源模型在同一测试中得分接近零,因为它们拒绝执行该任务。Mistral 点名 Claude Opus 5.5 和 GPT-6 Astra 作为这种拒绝的例子。
那是对供应商所引用数字的一种供应商解读,也应该按这种方式来理解。如果成立,这也是一种真实的运营差异:无法复现某个漏洞的模型,就不能用来证明该漏洞确实存在,而这在大多数事件响应中是第一步。Mistral 将 82% 与 Cybench 的 40 项竞赛练习中 93% 的得分并列,并提出反驳称,其在来自 JailbreakBench、StrongREJECT 和 AgentHarm 的网络提示上的拒绝率高于其他开放权重模型——其论点是,人们希望能力与纪律存在于同一个模型中,而不是为了一个而牺牲另一个。
除了网络安全之外,支持 Mistral Large 4 的理由还建立在 Opus 5 所不具备的三点上。它在欧洲基础设施上训练并提供服务,受欧洲法律管辖,这对负有数据驻留义务的买家来说至关重要。Mistral 承诺,它将可以下载——这正是整件事的关键所在,因为正是自部署消除了 Mistral 竭力描述的那种事件中途访问风险。而且它的单任务成本足够低,以至于先用它跑第一遍、再把难啃的残余部分升级交给前沿模型,在经济上是划算之举,而不是可以忽略不计的零头。
Claude Opus 5 仍然物有所值之处
12 个百分点的指数差距并不小,而逐行数据清楚说明了差距体现在哪里。Terminal-Bench 4.0 几乎翻了一倍——49.0% 对 26.8%——而终端类工作是智能体编程最接近的公开代理指标,智能体编程正是今年各团队采购前沿模型的主要用途。Humanity's Last Exam 将二者拉开了 20 个百分点。在长时程自主性方面,如果你的工作负载是多小时的智能体会话,而不是单个高难度问题,那么 Opus 5 的自适应推理设计、128K 输出上限以及实际可用的 1M 上下文,正是你想要的配置。
输出上限是那个更不显眼的差异。Mistral 尚未公布该预览版的最大输出长度,而 Opus 5 的 128K 对代码生成和长结构化文档而言确实解除了一个实际约束。如果你的流水线产出的是文件而非答案,那么在切换之前先核实这个数字,因为这类差距往往只在生产环境中才会暴露出来。
每项任务成本才是要牢牢盯住的数字。
按 token 计价会美化廉价模型,也会让人对昂贵模型产生误判。该指数自身的单任务成本——完成一项评估任务的总支出,缓存等全部算在内——才是经得起预算检验的数字:1.13 美元对 5.86 美元。
这并不是把一切都搬到更便宜模型上的许可,因为便宜模型搞不定的任务,你要付两次钱。它是让你不再把单一前沿模型当作唯一选择的许可。在OrcaRouter上,Claude Opus 5 以供应商标价、0% 加价出现在目录中,与其他 200 多个模型同处一个兼容 OpenAI 的端点,这正是为什么双模型流水线只需一个下午就能搭好,而不必再签一份供应商合同。Mistral Large 4 目前不在目录中——该预览版需通过 Mistral 自家的 API 和若干第三方平台获取。当它的权重发布、并有提供商托管它时,同样的转嫁规则依然适用:供应商收多少,就向你收多少,供应商降价当天就会体现在你的账单上。

对于一个尚未经过验证的预览版而言,最关键的路由功能就是故障转移。将一部分生产流量交给 Mistral Large 4,同时让 Opus 5 承接其余流量,意味着一旦出现性能回退,就会变成一次重新路由,而不是一次服务中断;而且你是在自己的数据上、而非在排行榜上了解该模型真实的失效模式。
什么能在三周内解决这件事?
有三个事实仍未确定,而每一个都会改变答案。如果权重以宽松许可证发布,Mistral Large 4 就会成为这一对中唯一可供你自行托管的模型,受监管买家的权衡也会大幅倾斜。如果促销价 $0.68 / $2.09 恢复到价目表上的 $1.36 / $4.18,每任务差距会收窄,但依然具有决定性。而如果 Artificial Analysis 将私下评估的编程数据原样移入其公开指数,那么编程方面的说法就会变成经第三方验证,而非供应商借第三方之名发布。
在此之前:Opus 5 是安全的生产默认选择,对于智能体和高强度终端类工作而言,其数倍的价格是值得的。Mistral Large 4 则是更有意思的一注——单任务成本足够低,可以与之并行运行;在自动化和网络安全方面能力足够强,今天就能赢得流量;并且承诺支持自部署,这是本次对比中任何闭源模型都无法匹敌的。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
