为文章《Mistral Large 4 vs Gemini 3.1 Pro》生成的标题卡,标题采用粗体几何无衬线字体,其下方是副标题“八个月,两个方向”,上方一排三个扁平线性图标——一页日历、一个终端窗口和一个图像边框——白色背景上点缀着蓝色与青色的渐变,右下角是 OrcaRouter 标志。
Guides & Insights

Mistral Large 4 对比 Gemini 3.1 Pro:八个月,两个方向

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.1 Pro自2026年2月19日上市以来,至今仍在各大综合能力榜单上名列前茅,包括那些将其与今年秋季发布的模型进行对比的榜单。Mistral Large 4最多只有三周历史——它是一款于2026年10月6日发布的预览版,权重承诺在10月底放出,且未提及任何许可证。在Artificial Analysis的智能指数中,10月6日读取的数据显示,已有八个月历史的Gemini 3.1 Pro得分为29.7,而这位新来者则为38.4。这是本次对比诚实的起点,而它与发布日期所暗示的情形恰恰相反。

这个解释并不神秘。Gemini 3.1 Pro 是 Google 从未推向稳定版发布的预览线旗舰,而 Artificial Analysis 为它设立的页面标注的正是"Gemini 3.1 Pro Preview"——同一个页面上,一个较低的指数与顶级的 GPQA Diamond 成绩并列。这是一款为广度而生的模型:超大的上下文窗口、广泛的模态覆盖,以及在知识类问题上表现强劲的推理能力。Mistral Large 4 则是为一张完全不同的世界地图而构建的,其定价也与之相称。

每一个是什么

Gemini 3.1 Pro 是 Google 的前沿多模态推理模型,API id 为 gemini-3.1-pro-preview,具有 1,048,576 个 token 的上下文窗口和 65,536 个 token 的输出上限。它接受文本、图像、视频、音频和文件。它由 OrcaRouter 的目录以 Google 自己的费率提供服务。Google 的文档中没有列出非预览版的 Gemini 3.1 Pro;预览名称就是该产品。

Mistral Large 4 是一个拥有 1.05 万亿参数的稀疏专家混合模型,激活参数为 490 亿,并配备一个专用的 16 亿参数视觉编码器,以“Mistral Large 4 Preview”的名称提供,API ID 为 mistral-large-4-0。Mistral 的文档称其上下文窗口为 100 万 token;Artificial Analysis 在其测试的配置上读数为 524,288。最大输出未公布。Mistral 称其为迄今规模最大、能力最强的模型,并表示权重将于 10 月底发布。

这些数字,附有其出处

两个模型都有独立的页面,因此下面的比较属于同一测试框架内的比较,而不是厂商之间的对比:

• 智能指数 v4.3 — Mistral Large 4 Preview 38.4 对比 Gemini 3.1 Pro 29.7

• 每个索引任务的成本 — 1.13 美元 vs 1.30 美元

• 长上下文推理 — 81.3% 对比 82.0%

• GPQA Diamond — 预览版未公布,对比 94.1%

• 人类的最后考试 — 35.0% 对比 47.0%

• Terminal-Bench 4.0 — 26.8% 对比 4.0%

• SciCode — 54.2% 对比 58.7%

• AutomationBench,业务工作流 — 59.9% 对 35.4%

• MMMU-Pro,多模态推理 — 76.4% vs 82.4%

• 上下文窗口 — 标称 1M / 实测 524,288,而实际提供 1,048,576

• 输出上限 — 未公布,对比 65,536 个 token

• 每百万 token 价格,输入 / 输出 — 标价 $1.36 / $4.18,优惠价 $0.68 / $2.09,而 20 万 token 以下为 $2.00 / $12.00,20 万以上为 $4.00 / $18.00

• 权重 — 已承诺,许可证未具名,对比专有

A generated two-column scoreboard titled 'Mistral Large 4 vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; GPQA Diamond not published; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Gemini 3.1 Pro': Intelligence Index v4.3 29.7; cost per index task $1.30; Terminal-Bench 4.0 4.0%; GPQA Diamond 94.1%; MMMU-Pro 82.4%; AutomationBench 35.4%.

最引人注目的一行是 Terminal-Bench 4.0。Gemini 3.1 Pro 得分 4.0%——不是笔误,也不是表格里的幻觉:它反映的是一个来自二月的模型,被放在一个晚于它出现的终端智能体测试框架上运行。Mistral Large 4 的 26.8% 在同一测试中高出六倍。任何因为一个旧的智能体编程分数而排除 Gemini 的人,都应该基于其 GPQA Diamond 重新把它纳入考虑;任何因为指数排名而排除 Mistral 的人,都应该先看看终端那一行。

Gemini 3.1 Pro 在哪些方面仍占据优势

知识与广度。94.1% 的 GPQA Diamond 是本文中出现的最高数值,无论哪一方都是如此,而它是一项研究生水平的科学基准——不是模型靠嘴上功夫就能刷出来的数字。Humanity's Last Exam 上 47.0% 对 35.0%,以及 SciCode 分数略胜这位新来者,都说明了同一件事。如果你的工作负载是依靠一个知识语料库准确回答高难度问题,那么 Gemini 3.1 Pro 在发布八个月后依然是更强的模型。

模态广度是第二项优势。Gemini 3.1 Pro 除了文本和图像外,还能处理视频和音频。Mistral Large 4 则只接受文本和图像。如果你的流水线需要摄入会议录音、屏幕录制或传感器音频,那么这里只有一个模型能看到完整的输入内容。

输出上限是第三点。65,536 个 token 是一个已公布且有保证的上限;Mistral 根本没有为预览版公布任何上限。在发布公告中,没有什么比未说明的输出限制更有可能在生产环境中让你栽跟头。

而 Gemini 的上下文窗口是实打实地按 1,048,576 个 token 提供的,相比之下,Mistral 的 1M 只是厂商宣称的数字,独立实测为 524,288。对于运行在窗口最远端的工作负载来说,标称数字与实测数字之间的这点差别,就意味着要推倒重来。

Mistral Large 4 改变决策之处

智能体工作,尤其是任何涉及终端的事情,正是这两个模型不再具有可比性的地方。Mistral 自己的发布文章将 DeepSWE v1.1 上的 61.7%、SWE-Atlas-QnA 上的 59.4% 和 Terminal-Bench 4.0 上的 28.3% 汇总为一个 49.8% 的 Coding Agent Index,并明确表示,在这一综合指标上,它领先于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。用 Mistral 的话说,这三个数字是 Artificial Analysis 在其评测框架公开之前私下评估得出的;它们尚未出现在公开指数上,在出现之前应被标注为厂商发布。

独立证据也指向同一个方向。在 AutomationBench——涵盖 Gmail、Sheets、Slack 和 Salesforce 的 657 个业务工作流——上,Mistral Large 4 得分 59.9%,领先于 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro;而在同一测试框架上,Gemini 3.1 Pro 完全没有出现,因为该基准测试的发布时间晚于它。Surge AI 开展的一项盲测人工研究将 Mistral Large 4 Preview 在编程质量上评为五款模型中的第二,得分为 3.74,领先于 GLM-5.3 和 Kimi K3,仅次于 Claude Opus 5。

网络安全方面的说法是 Mistral 博文中最尖锐的一点,值得准确引述:在 Artificial Analysis Cyber Index 测试中——该测试要求模型复现一个真实漏洞并随后修补它——得分为 82%,被描述为所有模型中最高的;在 Cybench 的 40 项竞赛练习中得分为 93%;Mistral 还声称,它在 Cyber Index 总榜上位列全球前五,同时在非中国开发的开放权重模型中领先。这些是厂商在独立指数上引用的数据。它们的实际优势在于,Mistral 构建这个模型是为了让它去做这件事,而不是拒绝去做。

表中最低的一行同样属于 Mistral,但优势很微弱:每项任务 1.13 美元对 1.30 美元,这 13% 的领先来自促销价,而标准价目表会将其抹平。Gemini 3.1 Pro 是按 2026 年定价的 2026 年模型,用它跑一项索引任务并不算贵。

没人评测的决胜关键

有两件事在起作用,而表格无法体现。第一件是许可授权。Gemini 3.1 Pro 是专有模型,并将一直如此;Mistral Large 4 是一个预览版,其全部卖点就在于它会成为一个可下载的产物,让你能在自己的政策下、在自己的硬件上、依据欧洲法律运行——Mistral 在自己的数据中心用 3,800 块 Grace Blackwell GPU 训练了它,并在那里提供预览服务。在代码仓库出现、许可证有了名字之前,这个论点一文不值。而等到那一天,它就价值巨大。

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid with 'Mistral Large 4' listed at v26.10 as 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 carrying an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

第二点是运营风险。仍在完善中的预览版会在你脚下发生变化。在 OrcaRouter 上,这次比较的双方都可以通过同一个兼容 OpenAI 的端点,按提供商标价、以 0% 加价访问——Gemini 3.1 Pro 已按 Google 的价格在目录中上线,而 Mistral Large 4 必须通过 Mistral 自己的 API 和若干第三方平台访问,因为它不是我们提供的路由。这里有用的一环是路由 DSL:把分类和抽取发给当周更便宜的那个模型,把难处理的残余升级出去,让自动故障转移去承受预览版的不顺日子,而不是让你的待命轮值去承受它们。

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the preview model identity, a 1M-token context window, a 65K maximum output, inputs of audio, file, image, text and video with text output, the 2026-02-19 release date, a p-50 time-to-first-token figure of 10.00 seconds, pricing of $2.00 per million input and $12.00 per million output, and a code sample against the api.orcarouter.ai base URL.

裁决

要问的是工作负载是什么,而不是哪个模型更好。对于知识工作、音频和视频输入、有保障的输出上限以及可用的百万 token 窗口而言,Gemini 3.1 Pro 仍然是更强的模型,它的“老”不是缺陷——而是其他人已经用八个月时间摸清它边界的积累。对于智能体编程、终端工作和安全运营,Mistral Large 4 领先的幅度足够大,以至于指数排名会产生误导,而且它是两者中唯一可能最终实现自托管的。

值得关注的胜负手是十月底。如果权重以宽松许可证发布,Mistral Large 4 就不再在价格上与 Gemini 3.1 Pro 竞争,而是开始在控制权上与它竞争,而那是另一场不同的较量。如果权重以限制性许可证发布,本文的答案不会有太大变化——但理由会变。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新