一张围绕 1 亿 token 每月 48 美元差价打造的 Mistral Large 4 与 MiniMax M3 对比标题卡,其中 MiniMax M3 支持视频输入和 512K 输出,而 Mistral Large 4 仅为纯图像预览。
Guides & Insights

Mistral Large 4 vs MiniMax M3:五个月的进步要付出多少成本

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

MiniMax M3 是该类别中最便宜的模型,而且自 2026 年 5 月 31 日以来一直如此。其价格为每百万输入 token 0.30 美元、每百万输出 token 1.20 美元、每百万缓存 token 0.06 美元,输入价格比 Mistral Large 4 低约一半,输出价格则是其两倍——而且与那款更新的模型不同,你今天就能买到它,无需附带预览版标签。Mistral Large 4 是一款拥有 1.05 万亿参数的开源权重模型,自 2026 年 10 月 6 日起进入公开预览阶段,价格为 0.68 美元和 2.09 美元,并承诺在本月底前发布权重。两款开源旗舰,相隔五个月,而这五个月只在一个地方显露无遗:M3 的独立 Intelligence Index 得分为 29.2,而 Mistral Large 4 的得分尚不存在。

这就是这场对比的真实面貌,而且它比一张价格表所能呈现的更耐人寻味。M3 的构建围绕着一个明确的架构赌注——MiniMax 稀疏注意力(MiniMax Sparse Attention),在超过一百万 token 的上下文长度上持续生效,并将视频作为一等输入——因此它在两个 Mistral Large 4 并不参与的类别上纸面胜出:原始输出长度和原生视频支持。而在其他所有方面,更胜一筹的都是那款更新的模型,而且其价格仍然足够低,以至于这点差异很少真正决定购买。

两种架构,两种赌注

MiniMax M3 是 MiniMax 的旗舰级开放权重基础模型,也是首个将前沿编程与智能体性能、百万级上下文窗口和原生多模态能力融于一次发布之中的模型。它可接受文本、图像和视频输入并返回文本,并基于 MiniMax Sparse Attention 构建——这是一种旨在支撑最高 1,048,576 个 token 上下文、并保证不低于 512K 的架构。其预训练流程经过重建,从第一步起便引入多模态数据以扩展至超过 100 万亿 token,而非后期追加。其最大输出为 512,000 个 token。

Mistral Large 4 押下了一个不同的赌注。它是一个细粒度的专家混合模型,总参数量达 1.05 万亿,其中活跃参数为 490 亿,并配备了一个 16 亿参数的视觉编码器;它在 Mistral 位于欧洲的自有数据中心内,使用 3,800 块 NVIDIA Grace Blackwell GPU 从零开始训练,训练数据涵盖 160 多种语言。它可处理文本和图像——不支持视频——上下文长度约达一百万个 token,而 Mistral 将其定位围绕主权部署:欧洲基础设施、开放权重,以及按照你自己的政策运行它的能力,并以网络安全作为旗舰用例。

• 上下文窗口 — MiniMax M3 为 1,048,576 个 token,相比之下 Mistral Large 4 约为 1,000,000 个

• 最大输出 — MiniMax M3 512,000 tokens,而 Mistral Large 4 尚未记录

• 输入模态 — MiniMax M3 支持文本、图像和视频,而 Mistral Large 4 支持文本和图像

• 输入价格 — MiniMax M3 每 1M $0.30,而 Mistral Large 4 每 1M $0.68

• 输出价格 — MiniMax M3 每 1M $1.20,而 Mistral Large 4 每 1M $2.09

• 缓存输入 — MiniMax M3 每 100 万 $0.06,对比 Mistral Large 4 每 100 万 $0.07

• 参数 — Mistral Large 4 总参数 1.05T / 激活参数 49B,而 MiniMax M3 未披露

• 发布日期 — MiniMax M3 2026年5月31日 对比 Mistral Large 4 2026年10月6日,预览版

• 权重——两者均为开放许可,Mistral Large 4 的权重承诺于 2026 年 10 月底前发布

A two-column scoreboard comparing Mistral Large 4 and MiniMax M3 on input and output price, Artificial Analysis Index, input modalities, maximum output and release date.

比分并不接近,也谈不上公平。

在 Artificial Analysis Intelligence Index v4.3.2 上,MiniMax M3 得分为 29.2,在 147 款模型中位列第 62 名。这是一个中游成绩,而这并非对该模型的批评——该指数在 M3 发布后经过了修订,其中包含的评测在 MiniMax 训练时还不存在。它的编程子分数则展现了更好的表现:在 AA Coding 指数上为 58.6,位列 138 款中的第 46 名,在 Terminal-Bench 2.1 上为 65.2%。它在 GPQA Diamond 上达到 92.9%,在长上下文召回上为 83%,在 SciCode 上为 47.1%。

Mistral Large 4 has no Index score on the same board; the page is live under the title "Mistral Large 4 Preview" and the number is absent. What Mistral does publish is that ML4 leads DeepSeek V4 Pro 0813 and Qwen3.8 Max on the combined Coding Agent Index at 49.8%, and that on AutomationBench — 657 business workflows across Gmail, Sheets, Slack and Salesforce — it scores 59.9%, ahead of Kimi K3, MiMo-V2.6-Pro and DeepSeek V4 Pro. MiniMax is not named in either comparison, which is itself a signal about which model Mistral considers the real competitor.

所以公允的解读是这样的:M3 是一个能力强、价格低、文档完善的模型,通用评分处于中游,编程表现也相当不错,已发布五个月。ML4 是一个预览模型,宣称的上限更高,没有公布通用评分,还有一组智能体数据,Artificial Analysis 已私下评估过,并将在该评测框架上线时发布到 Coding Agent Index 上。如果你今天就需要一个数字,M3 能给你。如果你能等几周,ML4 也会给你一个,而且 Mistral 押注它会更高。

在 M3 完全不存在来自 ML4 的竞争的情况下

那份清单上的两行并非权衡取舍,而是一种缺失。

视频输入是首要一项。M3 原生支持视频,同时也支持文本和图像。Mistral Large 4 只接受文本和图像,仅此而已——Mistral 自己的深入分析关注的是基于千兆像素级卫星影像和工程图纸的 grounding,这仍然属于图像工作。如果你的流水线要摄入屏幕录制、监控录像或视频文档,那么无论价格如何,ML4 都不能作为模型。这不是 Mistral 靠重新定价就能填补的缺口。

输出长度排在第二位。M3 单次响应最多可生成 512,000 个 token。Mistral 尚未公布 ML4 的输出上限。一次性生成一份长篇幅的结构化产物——一份完整报告、一个大型迁移脚本、一份完整规格说明——正是 512K 上限比一个 Intelligence Index 分数更有价值的工作负载;而在 Mistral 公布 ML4 的限制之前,两者之中只有 M3 能让你围绕这类工作负载做规划。

M3 厂商报告的智能体数据也印证了同样的画像。MiniMax 给出的成绩是:自主网页研究的 BrowseComp 上为 83.5,计算机使用的 OSWorld-verified 上为 70,工具使用的 MCP Atlas 上为 74.2,GDPval rubrics 上为 76.7,SWE Bench Pro 上为 59。这些数据来自 MiniMax 自己的评测,尚未被独立复现,而且与其 29.2 的 Index 得分放在一起显得颇为矛盾——这正是厂商评测与独立评测之分之所以重要的原因。一个模型完全可以在厂商选定的基准上领先,同时在一个中立的十项评测平均值上位列中游,而这两件事可以同时成立。

2x 值得吗?

这里的价格差距按绝对值算确实很小,这使得它的权衡与对标闭源旗舰模型不匹配时有所不同。假设一个月使用 1 亿 token,输入/输出比例为 4:1:8000 万输入 token 和 2000 万输出 token。M3 计费 $24 加 $24,总计 $48。Mistral Large 4 计费 $54.40 加 $41.80,总计 $96.20。溢价约为每月 $48——在规模化使用时是实打实的钱,但也就是一次被避免的故障就能抵消的那种差距。

缓存进一步缩小了差距,而且仅仅略微偏向 M3:每百万缓存 token 0.06 美元对 0.07 美元,在这个价位上不过是舍入误差。两者都足够便宜,因此决策应基于能力和契合度,而非账单金额——这与乍看之下这份对比给人的印象恰好相反。

高端版本换来的主要是覆盖范围。ML4 晚了五个月,基于更新的数据训练,采用万亿参数、490 亿激活的专家混合架构,而且 Mistral 正在对它进行强化学习,公布的速度是每天 330 亿 token,并且这一轮训练尚未饱和。M3 已经定型;ML4 则按照公开的节奏持续改进。当一个供应商说,你今天买的模型将是你付过费的最弱版本,而相较现有版本的溢价还不到每百万 token 一美元时,更新的模型通常就是更好的默认选择。例外情况就是上面这两类工作负载,只有较旧的模型才适合。

绕过缺口

A screenshot of the OrcaRouter model page for MiniMax M3, showing the minimax/minimax-m3 route from MiniMax, its text, image and video input, and the $0.30 input and $1.20 output price per million tokens.

这是一个组合搭配,同时运行两者并非对冲,而是真正的答案,因为这两个模型各有所长,且优势互不重叠。处理视频输入、生成长篇产物,或运行计算机使用循环:M3。处理文档与图像分析、代理式工作流,或任何需要在你自己的策略下运行于欧洲基础设施上的任务:ML4。没有任何路由规则能让其中一方变得多余。

两者都通过 OrcaRouter 上同一个兼容 OpenAI 的端点提供服务,加价 0%,且供应商的标价原样透传,这让长达五个月的价格差始终真实可信——如果 MiniMax 下调 M3 的费率,或 Mistral 结束预览期价格,你的路由所依据比对的数字当天就会变化。路由 DSL 正是把彼此错位的优势整合为统一的调用界面的关键:一条检查请求模态的规则会把含视频的载荷发给 M3,其余一切发给 ML4,且可以确信预览模型的可用性闪断会由自动故障转移吸收,而不会传导给你的用户。当单一输出的重要性高于单一价格时,模型融合可以让两者同时运行、由一个评判小组来挑选,这是在保留 M3 有据可查的表现作为下限的同时,买入 Mistral 所宣称上限的一种合理方式。

A decision card headed When each one wins, matching MiniMax M3 to video input and 512K output at $0.30 and $1.20, and Mistral Large 4 to image and document work that runs in Europe.

判决

MiniMax M3 对两类工作负载而言是正确的答案,对第三类而言也是站得住脚的答案。视频输入、单次生成数十万级 token 以及计算机使用智能体是它的主场,其价格是这一级别所有旗舰模型中最低的,而它公布的中游分数意味着你清楚知道自己得到的是什么。对于一个在自己的细分领域尚未被超越的模型来说,五个月并不算老。

Mistral Large 4 在其他所有方面都是更好的默认选择。每月一亿 token 的成本大约高出 48 美元,其参数规模和欧洲训练血统指向更高的上限,网络安全方面的说法足够具体、可供核查,而承诺的开放权重加本地部署,满足了 M3 仅靠 API 的企业方案无法满足的要求。这种押注的代价是,你要承诺采用一个模型:其 Independent Intelligence Index 得分尚未公布,且 Mistral 表示其行为将在数周内发生重大变化。

两个时间点:2026 年 10 月底,届时 ML4 的权重要么落地,要么「开放权重」的承诺开始显得底气不足;以及 Coding Agent Index 的发布,届时 Mistral 私下评测的 49.8% 将与 M3 在同一版本上 58.6 的编程得分正面相遇。在那之前,M3 是你能够验证的模型,ML4 是你押注的模型——而按每月 48 美元、一亿 token 来算,这算不上多大的赌注。