一张为文章《Mistral Large 4 vs DeepSeek V4 Pro》生成的标题卡,以粗体几何无衬线字体显示标题,其下方是副标题“孪生架构,对立的押注”,上方有一排三个扁平线性图标——两个相同的网络节点,一个带有下载箭头,一个变灰——背景为白色,带有蓝青渐变点缀,右下角是 OrcaRouter 标志。
Guides & Insights

Mistral Large 4 对比 DeepSeek V4 Pro:架构相似,赌注相反

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

本次对比中的两个模型在纸面上几乎一模一样,在实际表现上却截然不同。Mistral Large 4是一个拥有 1.05 万亿参数的稀疏专家混合模型,激活参数为 490 亿,于 2026 年 10 月 6 日发布。DeepSeek V4 Pro是一个拥有 1.6 万亿参数的稀疏专家混合模型,激活参数为 490 亿,于 2026 年 4 月 24 日发布。相同的激活预算、相同的架构家族、同样宣称以开放权重的经济性实现前沿性能——而其中恰好只有一个模型的权重是今天就能下载的。

这一配对并非本文杜撰。Mistral 自己的发布文章就在三处点名以 DeepSeek V4 Pro 为基准进行评测:智能体编程、长周期知识工作,以及业务流程自动化。反过来向另一方提出同样的问题——DeepSeek V4 Pro 已经做到了哪些 Mistral Large 4 正在承诺的事——结果发现,这是看清该预览版究竟增添了些什么的最快方式。

规格,并排对比

10月6日查阅,Mistral 的数据来自其自身的公告和模型卡,DeepSeek 的数据来自其实时目录条目:

• 总参数与激活参数 — 1.05T 总参数 / 49B 激活参数,对比 1.6T 总参数 / 49B 激活参数

• 模态 — 输入文本和图像、输出文本 vs 仅文本

• 上下文窗口 — Mistral 声称 1M,Artificial Analysis 测试的配置为 524,288,而实际提供的是 1M

• 输出上限——预览版未公布,对比 384K tokens

• 每百万价格,输入 / 输出 —— 标价 $1.36 / $4.18,促销期间现为 $0.68 / $2.09,相比之下为 $0.66 / $1.98

• 每百万缓存输入 — $0.14,当前为 $0.07,对比 $0.022

• 权重 — 承诺十月底,许可证未命名 vs 现已可用

• 训练基础设施 — Mistral 自有欧洲数据中心中的 3,800 块 NVIDIA Grace Blackwell GPU,对比 DeepSeek 自有集群

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' appears at version v26.10 described as 'A state-of-the-art, open-weight, general-purpose multimodal model', with no licence badge, next to a Mistral Large 3 card at v25.12 that carries an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

49B激活数字的对称性既是头条亮点,也是陷阱。激活参数决定生成一个token的成本;总参数决定模型知道什么。DeepSeek的1.6T对比Mistral的1.05T,意味着DeepSeek每计算一个token所承载的容量大约多出50%——在知识密集型工作中是真正的优势,而在瓶颈在于指令遵循或工具使用的任务中则毫无优势。

独立指数说明了什么

两个模型都在 Artificial Analysis 上有页面,这使其成为该系列中少数几组双方在同一测试框架上被评估的对比之一。Intelligence Index v4.3,读取于 10 月 6 日:

• 智能指数 — Mistral Large 4 Preview 为 38.4,而 DeepSeek V4 Pro 0813 为 36.0

• 每个索引任务的成本 — $1.13 对比 $0.67

• Terminal-Bench 4.0 — 26.8% 对比 14.1%

• Humanity's Last Exam — 35.0% vs 41.0%

• AutomationBench,业务流程 — 59.9% vs 56.7%

• τ²-Bench,工具使用智能体 —— 预览版未发布 vs 96.2%

• SciCode — 54.2% vs 51.0%

这场竞争远比价格标签所显示的要胶着得多,而这些分歧带来的是有价值的信息,而非噪音。Mistral Large 4 在智能体编程这一项上以近十三个百分点的优势胜出,在工作流自动化这一项上也以微弱优势取胜,而 DeepSeek V4 Pro 则在开放式知识上以六分的优势胜出,且每项任务的成本低 40%。另请注意,该指数将成本分摊到缓存读取、缓存写入、推理 token 和答案 token 上——Mistral 的缓存享有 90% 的折扣,而 DeepSeek 的折扣高达 97%,这正是两个标价费率相近的模型,每个已完成任务的成本分别为 $1.13 和 $0.67 的原因。

A generated two-column scoreboard titled 'Mistral Large 4 vs DeepSeek V4 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': total and active params 1.05T / 49B; Intelligence Index v4.3 38.4; Terminal-Bench 4.0 26.8%; AutomationBench 59.9%; modalities text and image in; weights promised end of October. Right column 'DeepSeek V4 Pro': total and active params 1.6T / 49B; Intelligence Index v4.3 36.0; Terminal-Bench 4.0 14.1%; AutomationBench 56.7%; modalities text only; weights open and available now.

DeepSeek V4 Pro 已胜出的领域

决定性的差别不在于某个基准测试,而在于:DeepSeek V4 Pro 如今是开放权重的,而 Mistral Large 4 只是由其自家集群提供的一个预览版。Mistral 表示权重将于十月底发布——这是一项承诺,而非已存在的产物。其 Hugging Face 组织在 10 月 6 日查看时,没有任何比 7 月更新的内容。在出现带有许可证文件的仓库之前,Mistral 所主张的自部署理由属于 DeepSeek。

第二个差异在于可用范围的广度。DeepSeek V4 Pro 自 4 月起便可供路由调用,并且以巨大优势成为我们自有目录中使用量最高的模型——截至撰写本文时,过去七天共处理 11.3 亿个 token,而典型前沿模型的调用量仅为数千万。这样的调用量对买方的重要性,是排行榜无法体现的:它意味着故障模式已知、吞吐特征已知,而且承载该模型的供应商已经过他方生产流量的压力检验。

DeepSeek 在那些不起眼的机制指标上也更胜一筹。384K 的输出上限,对手却未公布;100 万上下文是实打实提供而非只是口头宣称;纯文本的范围让长上下文吞吐量变得可预测。如果你的工作负载是文档分析、长文生成,或是在百万级 token 上进行知识密集型信息抽取,那么 DeepSeek V4 Pro 在每一个维度上都比 Mistral 的预览版更便宜、更开放,也更经得起验证。

Mistral Large 4 在哪些情况下是更好的选择

Mistral 精心挑选了它用来做基准测试的那些行,而编码能力上的差距并非表面功夫。在 Terminal-Bench 4.0 上,26.8% 对 14.1%,大约翻了一倍,这与 Mistral 声称的在 DeepSWE v1.1 上达到 61.7%、在 SWE-Atlas-QnA 上达到 59.4% 相吻合——它表示这些数字是 Artificial Analysis 在该测试框架公开发布之前私下评估得出的,这也是它们尚未出现在公开指数上的原因。等这些结果最终落地,或者没有落地时,就能为这个编码能力问题盖棺定论。

多模态是第二个明确的分野。Mistral Large 4 原生支持图像,配备专用的 1.6B 视觉编码器,并且 Mistral 声称其在开源模型中拥有最先进的视觉定位能力——在 Dense 200 上给出 42%,对比 GPT-6 Astra 的 41%。DeepSeek V4 Pro 仅支持文本,其产品目录卡也直白地标明了这一点。任何涉及屏幕截图、工程图纸、扫描版申报文件或图表读取的流程,在这里都只有一个候选方案,而非两个。

接下来是网络安全领域,在这里 Mistral 的说法比 DeepSeek 已发布的任何内容都更为明确:在 Artificial Analysis Cyber Index 测试中达到 82%,该测试要求模型复现一个真实漏洞并为其打补丁,据称是所有模型中最高的;在 Cybench 的竞赛练习中达到 93%。这些是厂商引用的数据,理应照此标注——但它们出自一个独立指数,而 DeepSeek 尚未发布任何可比结果。就安全工作而言,诚实的立场是:Mistral Large 4 所声称的领先地位尚未被证明为不实。

最后一个差异化因素在于司法管辖区。Mistral 在其位于欧洲的自有数据中心里用 3,800 块 Grace Blackwell GPU 训练了该模型,并在当地提供预览版,其欧洲部署端到端地依照欧洲法律运营。对于受监管的欧洲买家而言,当替代选择要么是中国的开放权重模型,要么是美国的闭源模型时,这自成一类。

定价,请正确阅读

两款模型的标价都不是全部真相。DeepSeek V4 Pro 的目录条目包含两个限时时段——01:00–04:00 和 06:00–10:00 UTC——在此期间所列费率会翻倍,因此落在这些时段的工作负载成本会是标称价格的两倍。Mistral Large 4 的 $0.68 / $2.09 是相对于 $1.36 / $4.18 价目表的发布促销价;促销价是今天的价格,而价目表才是你用来估算账单的价格。

OrcaRouter 在这里把事情说清楚的关键就在于直通式定价:对供应商标价 0% 加价,这意味着供应商降价,你的价格当天就跟着降,供应商的促销价会原样传递,而不是被我们吸收掉。DeepSeek V4 Pro 现在就可以通过一个与 OpenAI 兼容的端点、按其供应商价格进行路由调用,并与其他 200 多个模型共用同一套凭证,当某个供应商出现故障时还能在多家供应商之间自动故障转移。Mistral Large 4 不在我们的目录中——其预览版需通过 Mistral 的 API 以及若干第三方平台访问——所以如果你想今天就同时跑通这组对比的两边,那就意味着一端走我们、一端直连。

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, showing the model identity, a 1M-token context window, a 384K maximum output, text-only input with text output, the 2026-04-24 release date, a p-50 time-to-first-token figure of 2.23 seconds, pricing of $0.66 per million input and $1.98 per million output, and a code sample using the api.orcarouter.ai base URL. The page describes the model as a 1.6T-total, 49B-active flagship MoE with a 1,048,576-token context and 384,000-token maximum output that is text-only.

该选哪一个

如果你需要能握在手里的权重、384K 的输出、上百万 token 的可服务上下文、两者中每完成一项任务的最低成本,以及一个其行为早已被其他人在生产环境中摸透并突破的模型,那么 DeepSeek V4 Pro 就不是一种妥协——与预告片相比,它就是成品。它是文档、知识与长篇工作的正确默认选择,而其开放权重意味着,你能用它做到什么程度,上限取决于你自己的基础设施,而不是某家厂商的路线图。

如果你的工作负载是智能体编程,如果它涉及图像,如果它涉及安全工作,或者如果欧洲司法管辖是硬性要求而非偏好,那么 Mistral Large 4 就是值得承担预览风险的模型——而且风险是有边界的,因为 Mistral 已对权重作出承诺,并承诺了一个有明确结束时间的红队测试窗口。现在就把一部分流量放到它上面,其余流量继续交给 DeepSeek V4 Pro,让两者在你的数据上解决架构问题。49B 激活预算从哪一边看都会是一样的;不同的是它周围的一切。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新