
GPT-6.1 Sol 与 MiniMax M3:费率更低,账单上却输了
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
MiniMax M3的要价只是GPT-6.1 Sol要价的一小部分——每百万输入词元 0.30 美元对 2.00 美元,每百万输出词元 1.20 美元对 10.00 美元——而按真正运行的那套计价表来算,它也更便宜:在 Artificial Analysis 的 v4.3.2 评测中,每项任务 0.508 美元对 0.724 美元。这是一场实实在在的胜利,而这也正是该论点的全部,因为同一套测量在把更低的账单交给 M3 的同时,也把 22.6 分的指数领先优势交给了 GPT-6.1 Sol,而那套衡量模型能否完成智能体工作、而非仅仅描述它的基准测试,则把这一差距变成了一堵墙。该厂商于 2026 年 9 月 29 日发布了 GPT-6.1 Sol。该公司于 2026 年 5 月 31 日发布了 M3——其拥有 4280 亿参数的开源权重模型。
两者都在运行中,都已标价,也都只差一次API调用。接下来是决定二者取舍的算术,以及算术并非全部实情的两个地方。
每个模型实际上是什么
GPT-6.1 Sol 是 OpenAI 当前在推理与软件工程领域的旗舰模型——一款闭源模型,在它所取代的 GPT-6 Sol 发布仅一周后问世,并以与其前代相同的 2.00 美元 / 10.00 美元标价出售。它的缓存输入价格为 0.10 美元,仅为 GPT-6 Sol 缓存命中收费的一半;而 OpenAI 在谈及智能体编程而非聊天时所指向的,正是这款模型。
MiniMax M3 是一个混合专家模型,总参数量达 4280 亿,每个 token 激活 230 亿参数,以 MiniMax 社区许可证发布——这是一次开放权重发布,采用带有非商业色彩的自定义许可证,而非 OSI 认可的许可证。为它提供服务的推理服务商众多:Artificial Analysis 记录到 M3 有十五家托管方,而 GPT-6.1 Sol 只有八家。这种广度正是开放权重的实际优势所在,也是 M3 上的价格竞争比这款闭源模型更为迅速的原因。
价目表,以及推翻它的计量表

把两份已公布的费率卡摆在一起一对比,差距显而易见。
• 输入 — GPT-6.1 Sol 每 100 万 $2.00,对比 MiniMax M3 每 100 万 $0.30;M3 便宜 85%
• 输出 — 每 100 万 $10.00,对比每 100 万 $1.20;M3 便宜 88%
• 缓存输入 — 每 100 万 $0.10,对比每 100 万 $0.06
• 每个 AA 任务的成本 — $0.724 对比 $0.508;M3 便宜 30%,而不是 85%
• 每个任务的输出 token 数 — 38,128 对比 48,192;M3 多写 26%
• 每个任务用时 — 640 秒 对比 486 秒
• 上下文窗口 — 1,050,000 对比 1,048,576 个 token;实际上持平
• 最大输出 — 128,000 个 token 对比 512,000;M3 会写出一篇非常长的回答
• 可接受的输入 — 文本、图像和文件 对比 文本、图像和视频
• Index 排名 — GPT-6.1 Sol 在 147 个模型中排第 10,而 MiniMax M3 排第 62
顶部那两条便宜的行是采购表会看到的内容。第三行才是真正买单的那一行,它说明 85–88% 的费率卡优势会变成 30% 的现实优势,因为 M3 每项任务会输出更多 token,也因为一项任务并不是固定不变的工作量。费率卡按 token 定价;工作则按任务计价。任何止步于前两行的比较,都是在用错误的单位比较错误的数字。
那百分之三十不再重要之处
任务成本足够接近,因此对于批量文本以外的任何场景,指数差距都具有决定性。Artificial Analysis 将 GPT-6.1 Sol 评为 51.83,将 MiniMax M3 评为 29.22——相差 22.6 分,而且这一差距并非在整个测试套件中均匀分布。在要求模型操作终端、编辑代码仓库并验证自身工作的评估中,这两个模型不在同一类别:
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.5606 vs MiniMax M3 0.0202
• Terminal-Bench Science — 0.5810 vs 0.0048
• AA-Omniscience — 41.53 vs 1.35
• MMLU-Pro — 0.8595 vs 0.7856
• AutomationBench — 0.6487 vs 0.2125
• τ²-bench — 本次运行中未公布 GPT-6.1 Sol 的数据,而 M3 为 0.8889
• GPQA Diamond — 本次运行中未公布 GPT-6.1 Sol 的数据,而 M3 为 0.9293
• CritPT — 0.3171 vs 0.0371
仔细读一读,因为这不是一场全面胜利,而例外之处才是有意思的部分。MiniMax M3 在 τ²-bench(工具使用与客服对话评估)上得分为 0.8889,在 GPQA Diamond 上得分为 0.9293——这一研究生水平的科学成绩超过了本次特定运行中公布的每一个 OpenAI 数据。M3 是一个有能力的推理者,也是一个不错的对话式工具使用者。在 Terminal-Bench 4.0 上,它得分为 0.0202。那不是“更差”;那是一个根本无法把多步骤代码仓库任务连贯维持下来的模型,而对 token 的任何折扣,都不会让模型失败的任务比模型完成的任务更便宜。
每任务数据背后隐藏着一项二阶成本。M3 每任务记录 48,192 个输出 token,首次回答时间为 23.0 秒,而 GPT-6.1 Sol 为 332.0 秒——小模型几乎立刻开始输出,然后再进行长时间推理。如果你的工作负载对延迟敏感但较为浅层,这一点对 M3 有利。如果它是智能体式的,那么 token 数量就是你要付出的代价,最终得分才是你得到的结果。
我们自己的 GPT-6.1 Sol 模型卡也以你实际会用来做路由决策的那种形式列出了同样的数字:$2.00 / $10.00 的费率、1,050,000 token 的上下文窗口、4.54 秒的首 token p50 延迟,以及同一页上呈现的 Artificial Analysis 指数与基准测试板块。

开放权重在这里价值几何
M3 可下载,是支持它的最强论据,而值得精确说明的是:这究竟换来了什么。它换来的是许可条款,让你能在自己的边界内运行模型——如果数据不能外流,这一点很有用——也换来了来自十五家独立托管方的价格竞争。它并不能给你带来廉价的部署:4280 亿参数、230 亿激活,仍然需要相当可观的推理硬件,而 MiniMax 社区许可证是一份附带条件的自定义许可证,并非无限制许可。对大多数团队而言,“开放权重”意味着托管推理上更划算的价格,而不是机架里多一台机器。
MiniMax M3 的 OrcaRouter 卡片上展示了实际提供的各项数据:$0.30 / $1.20 的价格、1,048,576 token 的上下文窗口、512,000 token 的最大输出、文本/图像/视频输入,以及在为其提供路由的各服务商中七天合计 5,640 万 token 的调用量。

两者共用一个按键
这次比较之所以实际上只是改配置而非迁移,是因为两个模型都能通过同一个 OrcaRouter 端点访问——一个 API 即可接入 200 多个模型,并以 0% 加价透传供应商的目录价,这意味着 MiniMax 的价格变动会在供应商发布当天就落到你的账单上,而不是等到某个经销商重新谈价的时候。这对 M3 来说比对其竞争对手更重要:选择路由到开放权重模型的全部理由,就在于其价格和托管方列表都在变动,而只有透传式计价才能跟踪一个移动的目标。
自动故障转移是另一半。M3 由众多可靠性参差不齐的提供商共同提供服务,当某个主机性能下降时,路由层可以把请求转移到另一台主机上,而调用方并不知道它落在了哪台主机上。这才是诚实地采用一个 Terminal-Bench 分数表明“不适合关键路径”的模型的方式——把它放在重试成本低廉的地方。
如果今天必须选一个,你选哪个?
如果工作是批量文本——抽取、摘要、分类、对话,以及任何输出是散文、失败模式是句子写错而非构建失败的任务——MiniMax M3 就是正确的默认选择,而那百分之三十是实打实的钱。把 GPQA 和 τ²-bench 的分数当作你的依据:这是一个恰好很便宜的能力强劲的模型。
如果任务是智能体式的——代码仓库、终端、工具链,任何带验证步骤的环节——那么 Terminal-Bench 4.0 上的 0.0202 就直接出局,而 GPT-6.1 Sol 以每任务 0.724 美元拿下 0.5606,即便每 token 贵 85%,也是更划算的选择。价目表从来都不是你真正要买的东西。
有用的答案是:你不必只选一次。把浅层任务路由到 M3,把智能体层路由到 GPT-6.1 Sol,并让两者共用同一份凭证——当任务一开始是抽取、随后变成修复工作时,路由 DSL 会把这两者组合成一次调用。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
