
Mistral Large 4 vs GPT-6 Sol:预览价格对阵已发布的默认之选
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 143 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 293 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
纸面上,这并不是一场势均力敌的较量。Mistral Large 4 是 Mistral 拥有 1.05 万亿参数的开放权重旗舰模型,定价为每百万输入 token 0.68 美元、每百万输出 token 2.09 美元。GPT-6 Sol 则是高性价比的高端层级,定价为 2.00 美元和 10.00 美元——输入约是它的三倍,输出接近它的五倍,而且一旦请求超过 272,000 个 token,就会重新定价为 4.00 美元和 15.00 美元。按 4:1 的输入/输出比例,每月使用 1 亿个 token,在 Mistral Large 4 上大约花费 140 美元,在 GPT-6 Sol 上大约花费 480 美元。这就是全部论据,而且非常有力,直到你读到 Mistral 自己文档的第二行:Mistral Large 4 处于公开预览,而且它是这两个模型中唯一仍在演进的模型。
这种区别才是整个对比的关键。GPT-6 Sol 于 2026 年 9 月 22 日发布,现已稳定;它的行为、费率卡和独立评分都已确定。Mistral Large 4 于 2026 年 10 月 6 日推出,带有预览 API、承诺“于本月底前”发布权重,以及 Mistral 表示仍在进行中的强化学习训练。你今天调用的版本,并不是 11 月会拥有的版本。因此,有意思的问题不是“哪个更好”——就可衡量的智能而言,二者还不在同一档位——而是“哪一个该放进你的技术栈,以及在什么条件下”。
每个厂商实际交付了什么
Mistral Large 4 是一款细粒度的专家混合模型,总参数达 1.05 万亿,其中 490 亿为活跃参数,另配有一个 16 亿参数的视觉编码器。它可接收文本和图像,提供约 100 万 token 的上下文窗口,并在 Mistral 位于欧洲的自有数据中心内,从头开始基于 3800 块 NVIDIA Grace Blackwell GPU 训练而成。Mistral 称其是迄今为止规模最大、能力最强的模型,并表示以开放许可证发布的权重将于 2026 年 10 月底前推出,目前尚待与网络安全合作伙伴及国家主管部门共同开展的红队测试阶段结束。在此之前,唯一的访问途径是预览版 API。
GPT-6 Sol 是 OpenAI GPT-6 系列的中端层级,位于旗舰级的 GPT-6 Astra 之下、快速型的 GPT-6 Luna 之上。它接受文本、图像和文件,上下文窗口略超一百万 token,输出最多可达 128,000 token,并提供可配置的推理力度、函数调用、结构化输出和带种子的采样。它是一个封闭、受审核的 API——与 Mistral 的宣传恰恰相反,后者主张的是一个组织最终可以在自己的硬件上、按照自己的政策运行 ML4。
• 总参数量 — Mistral Large 4 1.05T(49B 活跃)对比 GPT-6 Sol 未披露
• 上下文窗口 — 各约 1M token,Mistral Large 4 标称 1M,GPT-6 Sol 约 1.05M
• 最大输出 — GPT-6 Sol 为 128K tokens,而 Mistral Large 4 尚未有文档记录
• 输入模态 — Mistral Large 4 支持文本和图像,而 GPT-6 Sol 支持文本、图像和文件
• 输入价格 — Mistral Large 4 每 100 万 为 $0.68,而 GPT-6 Sol 为 $2.00,超过 272K tokens 后升至 $4.00
• 输出价格 — Mistral Large 4 每 1M 为 $2.09,而 GPT-6 Sol 为 $10.00,超过同一阈值后升至 $15.00
• 缓存输入 — Mistral Large 4 为每 100 万 $0.07,相比 GPT-6 Sol 的 $0.20,升至 $0.40
• 权重——Mistral Large 4 开放许可证,承诺于 2026 年 10 月底前发布,对比 GPT-6 Sol 闭源
• 发布状态 — Mistral Large 4 公开预览,2026年10月6日,对比 GPT-6 Sol 全面可用,2026年9月22日

GPT-6 Sol 明显领先的地方
Mistral 的发布博文对此异常直白,这省去了所有人的猜测。在 Artificial Analysis 智能指数(v4.3.2 修订版,包含从 AA-Briefcase 到 CritPt 的十项评测)上,GPT-6 Sol 得分 47.6,在该榜单的 147 个模型中位列第 14 名左右。Mistral Large 4 则完全没有公布指数得分。现有的是 Artificial Analysis 上一行不完整的数据,其中将该模型列为“Mistral Large 4 Preview”,并标注其排名为暂不公开。在可见的单项评测中,GPT-6 Sol 明显领先:在 Humanity's Last Exam 上为 47.9,且达到了及格线,而 ML4 未出现在榜单中;在 AA-LCR 长上下文召回上为 83.7 对 80.3;在 Terminal-Bench 4.0 上为 43.9 对 28.3。
Terminal-Bench 的那些数据也应当附带一条反方向的提醒。Mistral 的 28.3% 和 SWE-Atlas-QnA 上的 59.4% 来自 Artificial Analysis 在一个评测框架发布前私下评估得出的数字,而 Mistral 明确表示,当该评测框架发布时,这些数字会出现在 Artificial Analysis Coding Agent Index 上。它们并非厂商凭空捏造,但今天的你同样无法复现。请把它们视为有前景但尚未核实。
在 Mistral 确实公布数据的地方,其中几项值得认真解读,因为这类说法正是厂商在充满信心时才会提出的。Mistral 报告称,在 Artificial Analysis Cyber Index 的一项测试中——复现开源软件中的真实漏洞,然后修补它——ML4 得分 82%,是所有模型中最高的,并且它在 Cybench 的 40 个挑战中解决了 93%。它还报告称,包括 Claude Opus 5.5 和 GPT-6 Astra 在内的领先闭源模型在同一可复现性测试中得分接近零,因为它们拒绝执行该任务。这些是厂商报告的数据,尚未被独立复现,但其底层机制并不稀奇:拒绝更多的模型实际上完成得更少,而自转向开放权重以来,Mistral 一直在推销这一论点。
在综合能力上,坦率地说,GPT-6 Sol 是如今更好的模型,而 Mistral Large 4 是更便宜的那一个。如果你的工作负载是直接的问答或编程任务,且不偏好自托管,那么 GPT-6 Sol 每百万输出 token 多出的五美元,换来的是一个不会在你使用过程中改变行为的模型。
支持预览的理由,不仅仅是价格
三件事让 Mistral Large 4 不只是个廉价之选,而这三件事都与价格标签无关。
第一点是字面意义上的主权。ML4 在欧洲的数据中心、使用欧洲硬件训练,并将可在 Mistral 端到端运营的欧洲区域内提供服务。对受监管的买家而言,这不是一句营销话术;而是一项 GPT-6 Sol 目前无论花多少钱都无法满足的采购要求。Mistral 在 D 轮融资中筹集了 30 亿欧元,专门用于资助此事,这是欧洲科技公司迄今筹集的最大一笔股权融资,而该模型是朝着这一目标迈出的首个里程碑。
第二个是权重。当权重落地时,拥有 GPU 的组织就能在本地运行 ML4,无需提供商介入,这会同时改变拒绝行为和数据驻留方面的说法。到那时,GPT-6 Sol 仍然只是一次 API 调用。如果你的路线图包含本地部署阶段,那么两者之中只有 ML4 具备这一阶段。
第三点是节奏。Mistral 表示,这次预览背后的 RL 运行尚未饱和,并预计“未来数周乃至数月将出现巨大而快速的改进”。当一家厂商发布预览版并声称曲线仍在攀升时,你今天得到的报价,绑定的是你今后会为之付费的模型中最差的版本。GPT-6 Sol 的价格则绑定于固定的能力。
同时运行两者,但不押注任何一方

预览版的棘手之处在于你无法将其固定。如果你的产品依赖 ML4 的当前行为,下周的一次更新就是一起生产事故。如果它依赖 GPT-6 Sol,你就是在为稳定性支付固定溢价。合理的形态通常是两者兼有,置于同一个端点之后,这样决策就是一条路由规则,而不是一种架构。
这正是 OrcaRouter 的用途。 这两个模型都通过同一个兼容 OpenAI 的 API 提供,且加价 0%,这一点在这里比平常更重要:Mistral 的预览定价是发布价,并且会变动——预览结束时会上调,而当权重发布、开放模型上的竞争开始产生影响时,也可能下调——并且由于提供商的标价会直接传递,供应商降价当天就会在我们这边生效,而不是等到有人更新硬编码表格时。路由 DSL 让你可以把长上下文文档工作交给对该形态而言最便宜的模型,并把 GPT-6 Sol 保留为任何必须稳定运行之事的兜底。 自动故障转移覆盖了预览版 API 最容易招致的情况:端点繁忙或短暂不可用,这对任何模型在第一个月里都很正常。

该选哪一个
如果工作负载是生产环境,行为比单价更重要,而且你没有自行运行该模型的需求,那就选择 GPT-6 Sol。它在智能指数上的 47.6 分、128K 的输出上限以及 0.20 美元的缓存读取价格,使它成为更稳妥的默认选择,而 272,000 个 token 处的长上下文调价也很容易提前规划,因为这一阈值是公开的。
如果以下三种情况中有一种成立,就选择 Mistral Large 4:你需要一个欧洲部署的模型,你最终需要开放权重,或者你身处安全研究行业——在那里,拒绝就是失败——在复现与修补测试中拿下 82%,而闭源替代方案近乎为零,这是实实在在的能力差距,无论是否为厂商自报数据。同时要接受,你买的是一款仍在飞行途中、尚未定型的模型。要为 API 接口可能发生变化预留预算,也不要把预览版价格硬编码进下个季度的预测里。
无论最终选择哪一方,在此之前需要关注的是:10月底的实际权重发布,到那一刻,开放权重的说法将不再只是一句承诺;ML4 首次公布的 Artificial Analysis Intelligence Index 得分,它将决定这一价格差到底是划算,还是折扣背后的减配;以及 Coding Agent Index,Mistral 未公开的 Terminal-Bench 数据要么在那里得到印证,要么悄无声息地得不到印证。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
