
Mistral Large 4 是一个 1T 参数预览版:权重尚未发布
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 151 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Mistral Large 4于2026年10月6日以公开预览的形式亮相——这是一个拥有1万亿参数的专家混合模型,具备490亿激活参数、一个16亿参数的视觉编码器,其开发者还宣称它是中国以外构建的最强开放权重模型。但尚未兑现的,恰恰是“开放权重”这几个字所描述的那部分。今天没有可供下载的检查点,没有许可证文件,也没有代码仓库。Mistral表示,权重将在“本月底”发布,此前会经历一段红队测试窗口期,期间经过审核的合作伙伴和国家主管部门可以获得一个解锁版本,其内容审核有所放宽,网络能力则有所扩展。因此,本周对Mistral Large 4的准确描述是:一个你可以调用的预览API,以及一个你尚无法真正拥有的模型。
这种分野本身就是故事,而不是故事的脚注。Mistral 在发布公告时一并公布的每一个数字——编程得分、网络安全得分、金融与法律评估——都是在一个仍在不断更改的构建版本上产出的,而每一个拿它与闭源前沿模型作比较的标题,所比较的产物都不会是你最终下载到的那个产物。面对这样一次发布,有用的做法是把今天你能验证的内容,与要求你凭信念接受的内容区分开来;而 mistral.ai 自己的文章在说明哪些是哪些这一点上,异常慷慨。
10月6日实际上有什么直播?
预览 API 已在 Mistral Studio 上线,模型 id 为mistral-large-4-0。Mistral 自家的模型卡将其描述为“一个最先进的、开放权重的通用多模态模型”,基于细粒度 MoE 架构构建,并将参数数量拆解为 490 亿激活参数对 1.05 万亿总参数,外加视觉编码器。该公司在自己的欧洲数据中心里,用 3,800 块 NVIDIA Grace Blackwell GPU 从零开始训练了它,而预览版也部署在同一套基础设施上——这是 Mistral 与性能主张同样高声宣扬的主权论调。
供应商所述的规格:
• 总参数与激活参数 — 总计 1.05 万亿,每个 token 激活 490 亿,稀疏 MoE
• 模态 — 文本与图像输入,文本输出;原生多模态,而非外挂式适配器
• 上下文窗口 —— Mistral 的文档声称 1M tokens;Artificial Analysis 在其正在测试的配置上测得 524,288,因此应将 1M 视为厂商宣称的上限,而非实际提供的窗口
• 价格 — 每百万输入 token 1.36 美元,每百万输出 token 4.18 美元,缓存输入为 0.14 美元,依据 Mistral 公布的价目表
• 上线优惠——同一张卡片显示划掉价的 $0.68 / $2.09 促销,缓存输入为 $0.07,即半价
• 权重 — 尚未发布;根据公告,“本月底”
• 许可证——在公告和文档页面中均未具名,文档页面仅将该条目标为“Open”
其中两行值得读上两遍。视你读的是厂商还是第三方实验室,上下文窗口会相差一倍;对于一个服务配置仍在变动的预览版来说,这并不稀奇,但在你据此估算工作负载规模之前,这一点值得了解。而你要付多少钱,取决于促销费率能否挺过发布窗口期;$1.36 / $4.18 是 Mistral 自家价目表上列出的数字,$0.68 / $2.09 则是它目前实际收取的价格。在为账单做估算时,请按前者来假设。

基准测试数据,以及是谁运行的这些测试
Mistral 的帖子对来源问题很谨慎,这种谨慎值得继续保持。三个核心的智能体编码数据——DeepSWE v1.1 上的 61.7%、SWE-Atlas-QnA 上的 59.4%,以及 Terminal-Bench 4.0 上的 28.3%,合并为 49.8% 的 Coding Agent Index 分数——用 Mistral 自己的话说,是“由 Artificial Analysis 在该评测框架公开发布之前私下评估得出的数字”。它们尚未出现在 Artificial Analysis 的公开指数上。等该评测框架发布后,它们就会出现在那里。在那之前,它们是厂商发布的数字,由第三方产生但尚未发布;这比大多数发布声明具有更强的来源可信度,但仍不等同于可复现的公开分数。

从 Artificial Analysis 10 月 6 日的模型页面上读到的、今天仍然公开且独立的结果是:Mistral Large 4 Preview 在 Intelligence Index v4.3 上得分 38.4,每项任务耗时约 507 秒,Terminal-Bench 4.0 为 26.8%,Long-Context Reasoning 为 81.3%。同一页面却将其列为开放权重模型,而它事实上并非开放权重——该标记显示为 isOpenWeights: false,归类为“专有”,因为实际存在的只是一个从厂商自有集群提供服务的预览版。这个标记,正是本文所讨论的那道鸿沟最简洁的一个例证。

最值得引用的结果,是 Mistral 自己并未运行的那一个。第三方标注公司 Surge AI 在隐藏模型身份的情况下,针对编码质量进行了一次盲测人工评估,专业标注员按 1–5 分制给 Mistral Large 4 Preview 打出了 3.74 分——在五个模型中排名第二,领先于 Kimi K3 的 3.59、GLM-5.3 的 3.60 和 GLM-5.2 的 3.40,仅次于 Claude Opus 5的 4.22 分。有具名实验室作为另一方的盲测人工评估,与自行运行的基准测试是不同类型的证据,而它是此次公告中最有力的单一独立数据点。
接下来是网络安全领域,Mistral 在这里提出了其最尖锐的主张。在 Artificial Analysis 的 Cyber Index 上,该公司称 Mistral Large 4 位列全球前五,并在中国以外开发的开放权重模型中领先。在一项具体测试中——复现开源软件中的真实漏洞,然后将其修补——它得分 82%,被称为所有模型中最高的,并且在 Cybench 的 40 项竞赛练习中得分 93%。Mistral 还补充了一个尖锐的观察:若干领先的闭源模型,Claude Opus 5.5和GPT-6 Astra位列其中,在同一测试中得分接近零,因为它们拒绝执行任务。如果没有摆在面前的第三方页面,82% 是厂商数字;拒绝率这一论点也是厂商的解读。两者都说得通,但今天都没有得到独立证实。
为什么预览构图会改变价格计算
预览不只是一个阶段标签。它意味着该模型可以在比 GA 版本更短的通知期下被重新指向、重新定价或下线,也意味着你用作基准测试的服务配置可能并非你实际部署时所使用的配置。对于路由决策而言,这是一项实实在在的成本:基于本周构建版本调优的流水线,会附带一笔你未曾预算的重新验证开销。
在 OrcaRouter,200 多款模型共用一个 OpenAI 兼容端点,按提供商的标准价提供,0% 的加价直接透传:供应商自家价目表上的价格变动,当天就是我们这边价格的变化——这一点在这里尤为关键,因为本次发布带来了两个价格,其中一个已被划掉。对于一个尚未经过验证的预览版来说,自动故障转移是答案的另一半:它让你可以把一小部分生产流量放到 Mistral Large 4 上,其余部分由第一方模型承接,这样一来,即便该预览版在你的真实工作负载下出现回退,也只会降级为一次重新路由,而不是一场事故。细心的读者不应假定 Mistral Large 4 目前可在 OrcaRouter 上路由。它并不在目录之中——该预览版需通过 Mistral 自家的 API 和若干第三方平台访问,而它的权重一旦发布,也将是自托管的方案。
开放权重的说法目前只是一个承诺
Mistral 的表述是,Mistral Large 4“推动了开放权重性能的前沿”,而开放权重是企业保持对模型控制权的机制。对于 Mistral 打算发布的模型来说,这是一个站得住脚的论点。但对于它本周实际发布的模型而言,这一机制并不存在:没有 Hugging Face 仓库,没有许可证文本,没有可下载的检查点。该公司自己的 Hugging Face 组织在 10 月 6 日查看时,没有任何比 7 月更新的内容,其最新条目也与 Large 系列无关。
这不是对该计划的批评;在红队测试窗口之后分阶段发布权重是一项连贯一致的政策,Mistral 对此说得很明确。这是对那个形容词的提醒。“开放权重”在一个距离权重发布还有四周、且约束这些权重的许可证尚未被点名的段落里,发挥着营销作用。宽松许可证和 Apache 式条款是一种结果;仅限研究或设有收入上限的许可证则是另一种,而公告并未在两者之间做出选择。
十月底前需要检查什么
五件事能让这个预览变成定论,而且每一件都无需向 Mistral 询问任何东西就可以核实:
• Mistral 组织下的一个 Hugging Face 仓库,包含检查点和许可证文件——Mistral 承诺本月发布的版本
• 许可证名称本身,它决定了“开放权重”是指 Apache-2.0 式的自由,还是带有使用上限的授权
• $0.68 / $2.09 的促销费率是会继续保留,还是会恢复为费率表上的 $1.36 / $4.18
• Artificial Analysis 是否会在评测框架发布时,将私下评估的编程数据纳入其公开指数,以及这些数据是否会保持相同的数值
• 所提供的上下文窗口,目前供应商标称为 1M,而独立实验室读取为 524,288
在那些问题解决之前,对待 Mistral Large 4 的正确姿态,正是它自己的发布所邀请的那一种:调用它,在你的工作负载上衡量它,并让生产路径停留在一个行为不会按计划改变的模型上。权重才是真正的重头戏,预览只是预告片。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
