生成的标题卡显示 GPT-6 Sol 对比 MiniMax M3,八倍的输出价格买不到什么,统计卡显示输出价格每百万 $10.00 对比 $1.20,智能指数 47.6 对比 29.2,以及权重闭源对比开源,页脚显示指数依据 Artificial Analysis v4.3.2;MiniMax M3 费率依据 MiniMax,GPT-6 Sol 费率依据 OpenAI 的费率卡。
Guides & Insights

GPT-6 Sol 对比 MiniMax M3:八倍的输出价格仍然买不到什么

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

首先要说的是,关于GPT-6 Sol与MiniMax M3的对比:价格相差悬殊,分数也相差悬殊,而两者指向的方向恰好相反。MiniMax M3 是一款开放权重的模型,你可以自行下载运行,标价为每百万输入 token 0.20 美元、每百万输出 token 1.20 美元;GPT-6 Sol 是 2026 年 9 月 22 日发布的 GP-6 代际中的中端型号,在相同单位下为 2.00 美元和 10.00 美元。也就是说,其输出单价高出八倍多一点。MiniMax M3 还支持视频作为输入模态,而 GPT-6 Sol 不支持——Sol 模型接受文本、图像和文件。M3 所缺的,是接近 Sol 的分数:在同一份 v4.3.2 修订版榜单上,Artificial Analysis 智能指数为 29.2 对 47.6。

这种不对称才是关键所在,而且它比简单的价格与质量权衡更有意思,因为开放权重那一栏得以保留某种闭源那一栏无论出价多高都卖不了的东西:M3 的检查点就在 Hugging Face 上,而且模型可以在网络边界内运行。如果你要在这两者之间做选择,有用的问题不是哪一个更好,而是你正在购买的四种彼此独立的东西——价格、吞吐量、控制权或能力——当中,哪一个是你能够承受失去的。

四个维度,而且它们的排序方式并不相同

• 输出价格 — GPT-6 Sol 每百万 $10.00,对比 MiniMax M3 每百万 $1.20
• 输入价格 — GPT-6 Sol 每百万 $2.00,对比 MiniMax M3 每百万 $0.30
• 缓存输入 — GPT-6 Sol 每百万 $0.20,对比 MiniMax M3 每百万 $0.06
• 权重 — GPT-6 Sol 闭源,仅提供 API,对比 MiniMax M3 开放权重且可自托管
• 输入模态 — GPT-6 Sol 文本、图像和文件,对比 MiniMax M3 文本、图像和视频
• 上下文窗口 — GPT-6 Sol 1,050,000 tokens,对比 MiniMax M3 1,048,576 tokens
• 最大输出 — GPT-6 Sol 128,000 tokens,对比 MiniMax M3 512,000 tokens
• 智能指数 — GPT-6 Sol 47.6,对比 MiniMax M3 29.2
• 编程指数 — GPT-6 Sol 在此版本上未公布,对比 MiniMax M3 58.6
• 长请求阶梯 — GPT-6 Sol 在输入超过 272,000 tokens 时对整个请求重新计价,对比 MiniMax M3 其价格卡上没有阶梯

其中两行值得多花些笔墨。最大输出上限的走向与其他所有指标正好相反:M3 单次响应最多可输出 512,000 个 token,是 GPT-6 Sol 的 128,000 的四倍。对于要在单次调用中生成整个文件或长篇报告的工作负载来说,这是结构性优势,而不是可以忽略的零头。而长请求阶梯则是 GPT-6 Sol 实实在在的一项成本,M3 完全没有——输入超过 272,000 个 token 时,Sol 会把整个请求重新定价为 $4.00 / $15.00,而 M3 的价目卡中并无任何等效条款。在 300,000 个 token 的提示词上,输出单价的比较不是八倍,而是十二点五倍。

所以,诚实的排名完全取决于工作负载。对于大批量分类或抽取,错误答案的代价很低,而缓慢答案的代价并不低,M3 以 $0.30 / $1.20 且没有长上下文惩罚,是理智的默认选择,而 Sol 就是在烧钱。对于第一个答案就必须正确的任务——迁移计划、安全审查、一段会被将据此采取行动的人阅读的推理——以八倍输出价格换来 18.4 个点的指数差距,是大多数团队会做的权衡,因为替代方案是付钱请人来修正它。

Generated comparison scoreboard titled GPT-6 Sol vs MiniMax M3, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, weights closed, Intelligence Index 47.6, context window 1,050,000 tokens, reprices above 272K input tokens. MiniMax M3: input $0.30 per million, output $1.20 per million, weights open and downloadable, Intelligence Index 29.2, context window 1,048,576 tokens, no long-request step. A footer reads MiniMax M3 figures per Artificial Analysis v4.3.2 and MiniMax; GPT-6 Sol figures per Artificial Analysis v4.3.2 and OpenAI.

在 M3 公布的数据异常出色之处,以及数据较为薄弱之处

MiniMax M3 最强的独立成绩并不在你对一个这个价位的模型所预期的地方。长上下文召回率达到 83.0,比 GPT-6 Sol 的 83.7 低 0.7,实际上打平——在百万 token 窗口上,输入价格只有其六分之一。GPQA Diamond 达到 92.9,已经足够接近前沿梯队,这一差距处于你会预期由推理力度设置而非能力造成的范围内。这两项成绩正是 M3 值得认真对待、而不是被归入“廉价”一类的原因。

这些薄弱之处同样清晰,应当明确指出,而非含糊带过。零售式的工具使用表现很差:在 tau-banking M3 上得分为 15.3,而在更新的 Terminal-Bench 4.0 修订版上得分仅为 2.0。这两项都是第三方测量结果,且都表明:一个模型的基准平均分掩盖了它在针对模拟服务的智能体工具调用方面一个具体而巨大的弱点。厂商自己报告的数字则描绘出好得多的图景——SWE-Bench Pro 59、BrowseComp 83.5、MCP Atlas 74.2、Terminal-Bench 2.1 为 66——而这些是厂商在其自有测试框架上给出的数字,属于一种主张,而非测量结果。任何依赖工具使用的部署,都应当把这两组数字放在一起看,并直接对其进行测试。

关于基准比较本身,还有一点是次要层面的。在我们的目录中,GPT-6 Sol 所依据的基准集比 M3 更小——五项得分对 M3 的二十三项——因为厂商公布的内容更少,第三方对它跑过的测试也更少。一个公布了二十三个数字的模型,看起来总会比只有五个的模型得到更彻底的评估,而这差别在于文档,而非能力。

除了更低的账单,开放权重究竟还能给你带来什么

自行托管 M3 是 GPT-6 Sol 无法匹敌的选项,而它的价值主要不在财务层面。按 $0.30 / $1.20 的价格,API 比大多数团队运行硬件的成本还低,因此下载它的理由是一种约束,而不是一张电子表格:不能离开边界的数据、无法接受外部依赖的工作负载、一次微调,或者共享端点无法满足的延迟预算。在这四种情况中,开放权重是闭源模型唯一能回答的一种,而它的回答方式就是:它并不提供。GPT-6 Sol 的答案是,你不需要运行它——这是另一种论点,并且对另一类团队而言才成立。

吞吐量值得单独成行,因为这是演示里从不展示的数字。在我们的滚动七日窗口中,MiniMax M3 实测约为每秒 495 个输出 token,而 GPT-6 Sol 约为 244。在这次对比中,M3 不只是更便宜的那个模型,它在我们的路由上还更快,大约快一倍,这既改变了批处理任务的实际耗时,也改变了它的花费。需要说明的是,这些是共享演练场上的滚动窗口数据,并非受控基准测试,而且它们会变化。

OrcaRouter model page for MiniMax M3 (minimax/minimax-m3) by MiniMax, dated 2026-05-31, tagged Vision, Tools, JSON and Reasoning, describing it as MiniMax's flagship open-weight foundation model with a 1M-token context window and text, image and video input, listing $0.30 per million input and $1.20 per million output, with a model-page note that it is available through OrcaRouter under the model id minimax/minimax-m3.

将这对组合作为单一系统运行

两个模型都位于同一个 OrcaRouter 密钥之后,与另外 200 多个模型并列,因此这里真正有意思的配置方式不是做选择,而是构建一条廉价优先的级联。把大体量流量路由到 MiniMax M3,让 GPT-6 Sol 留在它后面,承接那些未通过检查或触发难度信号的请求,这样混合成本就会远远更接近开放权重模型的价位,而不是 Sol 的价位,同时那些棘手调用仍能得到得分 47.6 的模型。OrcaRouter 的路由 DSL 正是表达这种组合关系的地方——一次调用可以指定多个模型以及它们之间的条件,而不必为每个任务硬编码一个端点。

对于确实无法做出决定的团队而言,模型融合是同一思路的粗暴版本:由一组模型共同作答,再将各回答合并。它不适合大批量工作,但对于很少运行、高风险的提示词却颇为合适——此时 29.2 分与 47.6 分答案之间的差距就明明白白地呈现在页面上。

在开放权重模型上,故障转移比在闭源模型上更重要,原因很具体:M3 由不止一家基础设施提供商提供服务,而各端点并不相同。预先配置好第二条路由,意味着某台主机变慢或性能下降时,只是一次重试,而不是一次服务中断。而且,由于我们的目录按提供商标价原样传递、不加任何加价,供应商的费率变动当天就会在我们这边生效——这在一条 1.20 美元的输出计费项上尤为重要,因为供应商哪怕只调整一项缓存输入的费率,账单也会明显变化。

Artificial Analysis model page for MiniMax-M3, described as an open-weights model released June 2026, showing an Intelligence rank of 18 of 117 with an Intelligence Index of 29 on a comparable-model median of 18, an output speed rating above average, a 1M-token context window, and support for text, image and video input with text output.

你实际上应该打哪一个呢

用 MiniMax M3 应对大批量场景,凡是需要视频输入的,凡是需要在单次响应中输出超过 128,000 个 token 的,以及任何必须在你自己边界内运行的,都选它。对于答案本身就是产品的请求,对于工具密集型智能体循环——在这类场景中,M3 的 tau-banking 和 Terminal-Bench 4.0 分数是警告而非脚注——以及任何 18 个点的指数差距对你来说值八倍输出速率的情况,则选 GPT-6 Sol。如果这两者都无法概括你的全部流量,那就两个都用,让路由器来做决定。

无论先看哪一个,都有一件事需要先确认,而这正是本博客反复提到的同一个检查点:自 2026 年 5 月以来,M3 一直是 M 系列产品线的旗舰,并且仍是我们产品目录中最新的 M 系列型号,所以它确实是最新的——但 GPT-6 Sol 已经被 GPT-6.1 Sol 取代,后者在相同的短上下文费率下提供更便宜的缓存输入,而且它自己的 GPT-6 Sol 页面也带有指向后者的指引。如果你在这里关注 Sol 的原因是能力,而不是那个已有八天历史的集成,那就先看看它的继任者。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新