
Mistral Large 4 对比 Gemini 3.1 Pro:八个月,两个方向
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 151 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Gemini 3.1 Pro自2026年2月19日上市以来,至今仍在各大综合能力榜单上名列前茅,包括那些将其与今年秋季发布的模型进行对比的榜单。Mistral Large 4最多只有三周历史——它是一款于2026年10月6日发布的预览版,权重承诺在10月底放出,且未提及任何许可证。在Artificial Analysis的智能指数中,10月6日读取的数据显示,已有八个月历史的Gemini 3.1 Pro得分为29.7,而这位新来者则为38.4。这是本次对比诚实的起点,而它与发布日期所暗示的情形恰恰相反。
这个解释并不神秘。Gemini 3.1 Pro 是 Google 从未推向稳定版发布的预览线旗舰,而 Artificial Analysis 为它设立的页面标注的正是"Gemini 3.1 Pro Preview"——同一个页面上,一个较低的指数与顶级的 GPQA Diamond 成绩并列。这是一款为广度而生的模型:超大的上下文窗口、广泛的模态覆盖,以及在知识类问题上表现强劲的推理能力。Mistral Large 4 则是为一张完全不同的世界地图而构建的,其定价也与之相称。
每一个是什么
Gemini 3.1 Pro 是 Google 的前沿多模态推理模型,API id 为 gemini-3.1-pro-preview,具有 1,048,576 个 token 的上下文窗口和 65,536 个 token 的输出上限。它接受文本、图像、视频、音频和文件。它由 OrcaRouter 的目录以 Google 自己的费率提供服务。Google 的文档中没有列出非预览版的 Gemini 3.1 Pro;预览名称就是该产品。
Mistral Large 4 是一个拥有 1.05 万亿参数的稀疏专家混合模型,激活参数为 490 亿,并配备一个专用的 16 亿参数视觉编码器,以“Mistral Large 4 Preview”的名称提供,API ID 为 mistral-large-4-0。Mistral 的文档称其上下文窗口为 100 万 token;Artificial Analysis 在其测试的配置上读数为 524,288。最大输出未公布。Mistral 称其为迄今规模最大、能力最强的模型,并表示权重将于 10 月底发布。
这些数字,附有其出处
两个模型都有独立的页面,因此下面的比较属于同一测试框架内的比较,而不是厂商之间的对比:
• 智能指数 v4.3 — Mistral Large 4 Preview 38.4 对比 Gemini 3.1 Pro 29.7
• 每个索引任务的成本 — 1.13 美元 vs 1.30 美元
• 长上下文推理 — 81.3% 对比 82.0%
• GPQA Diamond — 预览版未公布,对比 94.1%
• 人类的最后考试 — 35.0% 对比 47.0%
• Terminal-Bench 4.0 — 26.8% 对比 4.0%
• SciCode — 54.2% 对比 58.7%
• AutomationBench,业务工作流 — 59.9% 对 35.4%
• MMMU-Pro,多模态推理 — 76.4% vs 82.4%
• 上下文窗口 — 标称 1M / 实测 524,288,而实际提供 1,048,576
• 输出上限 — 未公布,对比 65,536 个 token
• 每百万 token 价格,输入 / 输出 — 标价 $1.36 / $4.18,优惠价 $0.68 / $2.09,而 20 万 token 以下为 $2.00 / $12.00,20 万以上为 $4.00 / $18.00
• 权重 — 已承诺,许可证未具名,对比专有

最引人注目的一行是 Terminal-Bench 4.0。Gemini 3.1 Pro 得分 4.0%——不是笔误,也不是表格里的幻觉:它反映的是一个来自二月的模型,被放在一个晚于它出现的终端智能体测试框架上运行。Mistral Large 4 的 26.8% 在同一测试中高出六倍。任何因为一个旧的智能体编程分数而排除 Gemini 的人,都应该基于其 GPQA Diamond 重新把它纳入考虑;任何因为指数排名而排除 Mistral 的人,都应该先看看终端那一行。
Gemini 3.1 Pro 在哪些方面仍占据优势
知识与广度。94.1% 的 GPQA Diamond 是本文中出现的最高数值,无论哪一方都是如此,而它是一项研究生水平的科学基准——不是模型靠嘴上功夫就能刷出来的数字。Humanity's Last Exam 上 47.0% 对 35.0%,以及 SciCode 分数略胜这位新来者,都说明了同一件事。如果你的工作负载是依靠一个知识语料库准确回答高难度问题,那么 Gemini 3.1 Pro 在发布八个月后依然是更强的模型。
模态广度是第二项优势。Gemini 3.1 Pro 除了文本和图像外,还能处理视频和音频。Mistral Large 4 则只接受文本和图像。如果你的流水线需要摄入会议录音、屏幕录制或传感器音频,那么这里只有一个模型能看到完整的输入内容。
输出上限是第三点。65,536 个 token 是一个已公布且有保证的上限;Mistral 根本没有为预览版公布任何上限。在发布公告中,没有什么比未说明的输出限制更有可能在生产环境中让你栽跟头。
而 Gemini 的上下文窗口是实打实地按 1,048,576 个 token 提供的,相比之下,Mistral 的 1M 只是厂商宣称的数字,独立实测为 524,288。对于运行在窗口最远端的工作负载来说,标称数字与实测数字之间的这点差别,就意味着要推倒重来。
Mistral Large 4 改变决策之处
智能体工作,尤其是任何涉及终端的事情,正是这两个模型不再具有可比性的地方。Mistral 自己的发布文章将 DeepSWE v1.1 上的 61.7%、SWE-Atlas-QnA 上的 59.4% 和 Terminal-Bench 4.0 上的 28.3% 汇总为一个 49.8% 的 Coding Agent Index,并明确表示,在这一综合指标上,它领先于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。用 Mistral 的话说,这三个数字是 Artificial Analysis 在其评测框架公开之前私下评估得出的;它们尚未出现在公开指数上,在出现之前应被标注为厂商发布。
独立证据也指向同一个方向。在 AutomationBench——涵盖 Gmail、Sheets、Slack 和 Salesforce 的 657 个业务工作流——上,Mistral Large 4 得分 59.9%,领先于 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro;而在同一测试框架上,Gemini 3.1 Pro 完全没有出现,因为该基准测试的发布时间晚于它。Surge AI 开展的一项盲测人工研究将 Mistral Large 4 Preview 在编程质量上评为五款模型中的第二,得分为 3.74,领先于 GLM-5.3 和 Kimi K3,仅次于 Claude Opus 5。
网络安全方面的说法是 Mistral 博文中最尖锐的一点,值得准确引述:在 Artificial Analysis Cyber Index 测试中——该测试要求模型复现一个真实漏洞并随后修补它——得分为 82%,被描述为所有模型中最高的;在 Cybench 的 40 项竞赛练习中得分为 93%;Mistral 还声称,它在 Cyber Index 总榜上位列全球前五,同时在非中国开发的开放权重模型中领先。这些是厂商在独立指数上引用的数据。它们的实际优势在于,Mistral 构建这个模型是为了让它去做这件事,而不是拒绝去做。
表中最低的一行同样属于 Mistral,但优势很微弱:每项任务 1.13 美元对 1.30 美元,这 13% 的领先来自促销价,而标准价目表会将其抹平。Gemini 3.1 Pro 是按 2026 年定价的 2026 年模型,用它跑一项索引任务并不算贵。
没人评测的决胜关键
有两件事在起作用,而表格无法体现。第一件是许可授权。Gemini 3.1 Pro 是专有模型,并将一直如此;Mistral Large 4 是一个预览版,其全部卖点就在于它会成为一个可下载的产物,让你能在自己的政策下、在自己的硬件上、依据欧洲法律运行——Mistral 在自己的数据中心用 3,800 块 Grace Blackwell GPU 训练了它,并在那里提供预览服务。在代码仓库出现、许可证有了名字之前,这个论点一文不值。而等到那一天,它就价值巨大。

第二点是运营风险。仍在完善中的预览版会在你脚下发生变化。在 OrcaRouter 上,这次比较的双方都可以通过同一个兼容 OpenAI 的端点,按提供商标价、以 0% 加价访问——Gemini 3.1 Pro 已按 Google 的价格在目录中上线,而 Mistral Large 4 必须通过 Mistral 自己的 API 和若干第三方平台访问,因为它不是我们提供的路由。这里有用的一环是路由 DSL:把分类和抽取发给当周更便宜的那个模型,把难处理的残余升级出去,让自动故障转移去承受预览版的不顺日子,而不是让你的待命轮值去承受它们。

裁决
要问的是工作负载是什么,而不是哪个模型更好。对于知识工作、音频和视频输入、有保障的输出上限以及可用的百万 token 窗口而言,Gemini 3.1 Pro 仍然是更强的模型,它的“老”不是缺陷——而是其他人已经用八个月时间摸清它边界的积累。对于智能体编程、终端工作和安全运营,Mistral Large 4 领先的幅度足够大,以至于指数排名会产生误导,而且它是两者中唯一可能最终实现自托管的。
值得关注的胜负手是十月底。如果权重以宽松许可证发布,Mistral Large 4 就不再在价格上与 Gemini 3.1 Pro 竞争,而是开始在控制权上与它竞争,而那是另一场不同的较量。如果权重以限制性许可证发布,本文的答案不会有太大变化——但理由会变。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
