
GPT-6 Sol 对决 Gemini 3.1 Pro:实际价格差距比双方发布公告中所承认的都要小
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
两款模型的输入价格均为每百万输入 token 2.00 美元。GPT-6 Sol 的输出价格为每百万输出 10.00 美元;Gemini 3.1 Pro 为 12.00 美元。按照标价费率,GPT-6 Sol 与已推出六个月的 Gemini 3.1 Pro 之间差距在 20% 以内,这使其成为当前产品阵容中最不悬殊的价格对比——同时也是最具误导性的,因为对于长上下文工作,两款模型实际上都不会按标价费率计费,而且两者的分层边界处于不同位置,并朝不同方向重新定价。
这才是值得认真进行的比较。GPT-6 Sol 于 2026 年 9 月 22 日发布,价格为 $2/$10,比 GPT-5.6 Sol 降低了 50%;对于超过 272,000 输入 token 的长上下文层级,输入价格大约翻倍,输出价格提高一半。Gemini 3.1 Pro 自 2026 年 2 月 19 日起可用,价格为 $2/$12,在 200,000 token 处设有层级分界,一旦超过就变为 $4/$18,批处理费率为 $1/$6。标价相同,费率卡结构却不同,下面的算术才能决定哪一个对你的流量更便宜。
两张费率卡,按比例绘制
• 基础输入 — GPT-6 Sol 每 1M $2.00 vs Gemini 3.1 Pro 每 1M $2.00
• 基础输出 — GPT-6 Sol 每 1M $10.00 对比 Gemini 3.1 Pro 每 1M $12.00
• 长上下文阈值 — GPT-6 Sol 输入超过 272K,而 Gemini 3.1 Pro 输入超过 200K
• 长上下文费率 — GPT-6 Sol 约 $4.00 / $15.00,对比 Gemini 3.1 Pro $4.00 / $18.00
• 重新定价范围 — GPT-6 Sol 对整个请求重新定价,而 Gemini 3.1 Pro 也对整个请求重新定价
• 缓存 — GPT-6 Sol 的缓存输入约降价 90%,相较之下 Gemini 3.1 Pro 的缓存定价在发布时未重申
• 批量 — GPT-6 Sol 批量费率未公布,对比 Gemini 3.1 Pro $1.00 / $6.00
• 上下文窗口 — 据 Artificial Analysis,GPT-6 Sol 为 872K,声称 1.05M,对比 Gemini 3.1 Pro 的 1M 输入
• 最大输出 — GPT-6 Sol 128K 对比 Gemini 3.1 Pro 大约 64K 到 66K
• AA Intelligence Index (v4.3.2) — GPT-6 Sol 48 对比 Gemini 3.1 Pro 30

由此可以得出两个结构性结论。第一,长上下文的边界彼此接近但并不相同——272K 对 200K——而且两者都对整个请求适用更高的费率,而不是只对超出的部分适用。一次携带 210K token 的调用,在 Gemini 3.1 Pro 上按溢价费率计费,在 GPT-6 Sol 上则按基础费率计费。那 72,000 token 的区间,正是这两个模型在价格上分歧最大的地方。
其次,输出空间不可同日而语。GPT-6 Sol 支持 128K tokens 的输出;Gemini 3.1 Pro 则止步于 64K 到 66K 左右。如果你的工作负载会产生长篇幅的产物——完整的文件重写、长篇草稿、你确实会保留的扩展思维链轨迹——那么这一上限比输出定价上 2 美元的差异更重要。
一个演算示例,因为表面上的费率掩盖了答案
以一个真实的月度工作负载为例:1000 万输入 token 和 200 万输出 token,全部为短上下文。
• GPT-6 Sol — 10M 输入按 $2.00 计算为 $20.00,2M 输出按 $10.00 计算为 $20.00。总计:$40.00
• Gemini 3.1 Pro — 10M 输入按 $2.00 计算为 $20.00,2M 输出按 $12.00 计算为 $24.00。总计:$44.00
GPT-6 Sol 便宜了 9%。这就是全部的差距,而它小到只需技术栈中其他位置的某一个工程决策就能将其抹平。
现在让同样的工作负载变成长上下文——一个每次调用都携带 300K token 工作状态的智能体。两个模型都会越过各自的阈值。
• GPT-6 Sol — 输入约为 $4.00,得到 $40.00;输出约为 $15.00,得到 $30.00。总计:$70.00
• Gemini 3.1 Pro — 输入价格为 $4.00,对应 $40.00;输出价格为 $18.00,对应 $36.00。总计:$76.00
两份账单都几乎翻倍,GPT-6 Sol 保持领先,但差距仍在 10% 以内。长上下文并不能打破这一对决,只会让两个选项都变得昂贵。
有意思的情况是缓存和批处理,这两个厂商下了不同的赌注。如果你的输入中有 80% 是稳定前缀,GPT-6 Sol 约 90% 的缓存折扣会大幅改变这笔账——800 万缓存 token 按每百万约 0.20 美元算是 1.60 美元,再加上 200 万新 token 按 2.00 美元算是 4.00 美元,再加上 20.00 美元的输出,总计接近 25.60 美元。Gemini 3.1 Pro 的批处理费率则从另一个方向做同样的事:在输入 1.00 美元、输出 6.00 美元的价格下,同样的 1000 万/200 万工作量落在 10.00 美元加 12.00 美元,也就是 22.00 美元。
诚实的总结是:GPT-6 Sol 在交互式流量和缓存前缀工作负载上胜出,Gemini 3.1 Pro 则在你能够批处理的任何场景中胜出,而两种最佳情况之间的差距不过是每一千万个 token 几美元。这不是价格决策,而是工作负载形态决策。
能力差距才是真正的决策
在同一榜单上,这两款模型相差五十一个 Index 点:GPT-6 Sol 为 48 分,Gemini 3.1 Pro 为 30 分。差距并不接近,这正是价格持平只是一种有趣现象、而非竞争威胁的原因。
Artificial Analysis 的 Intelligence Index 是一个综合指数,而综合指数可能会美化结果。但如此大的差距,在每个厂商发布的各组成部分基准测试中都经得起检验:
• AA Intelligence Index — GPT-6 Sol 48,在 212 个中排名第 18,对比 Gemini 3.1 Pro 30,在 212 个中排名第 81
• 输出速度 — GPT-6 Sol 每秒 104.4 个 token,而 Gemini 3.1 Pro 每秒 115.0 个 token
• 首token延迟——GPT-6 Sol 为 107.18秒,而 Gemini 3.1 Pro 为 32.96秒,相比之下榜单中位数仅为 3.87秒
• GPQA Diamond — Gemini 3.1 Pro 94.3%(谷歌报告)
• ARC-AGI-2 — Gemini 3.1 Pro 77.1%(Google 报告)
• HLE — Gemini 3.1 Pro 44.4%(Google 报告)
• SWE-bench Verified — Gemini 3.1 Pro 80.6%(谷歌报告)
• Terminal-Bench 2.0 — Gemini 3.1 Pro 68.5%(Google 报告)
• LiveCodeBench Pro — Gemini 3.1 Pro 2887 Elo(Google 报告)
仔细看看谷歌那些数据,因为它们并不弱。GPQA Diamond 上的 94.3% 和 ARC-AGI-2 上的 77.1% 都是强劲的结果,而且它们是在二月份发布的。Index 仍然把 Gemini 3.1 Pro 低了三十分,原因是 Index 对智能体和长时程任务赋予了很高的权重,而这正是这两次发布之间相隔六个月所体现出的差距。Gemini 3.1 Pro 是一个强大的推理模型。GPT-6 Sol 是一个强大的智能体。
延迟这一项上,Gemini 3.1 Pro 完胜,而且优势不小。33 秒的首个 token 在绝对意义上很慢——榜单中位数是 3.87 秒——但它只有 GPT-6 Sol 的 107 秒的三分之一。对于任何需要用户等待的场景,Gemini 3.1 Pro 是这两者中唯一还算能用的。GPT-6 Sol 的 107 秒首个 token 是会让最多试点项目夭折的数字,不过值得注意的是,它一旦开始输出,吞吐量非常出色:104.4 token/秒 与 Gemini 的 115.0 相比并没有实质性落后。这个模型并不慢。它只是启动慢。
Gemini 3.1 Pro 尚未逃脱的东西
Gemini 3.1 Pro 自二月以来一直处于预览阶段。带着预览标签长达六个月,这时间可不短,而 Google 在此期间已经发布了 3.5、3.6 和 3.8 Flash 模型,却没有将 3.1 Pro 提升为正式可用。在 OrcaRouter 上,可路由的 slug 仍然是 gemini-3.1-pro-preview,并且还有一个单独的 gemini-3.1-pro-preview-customtools 变体与之并存。
这一点对采购的重要性,是基准测试所无法体现的。预览版端点可能会在你脚下发生变化、在短时间内被弃用,并且其速率限制与 GA 模型不同。如果你今天基于 Gemini 3.1 Pro 进行构建,那你就是在基于一个预览版进行构建,因此应当据此权衡迁移风险——尤其是当谷歌自家更新的 Flash 模型已经在多个维度上超越它时。
GPT-6 Sol 没有那个问题,但它有另一个问题:发布时的可用范围比公告所暗示的要窄。它出现在 API、ChatGPT Work 以及付费方案中的 Codex 里——而 Enterprise 管理员必须先启用它,用户才能看到它。它不在 ChatGPT Chat 中。一款跳过消费级入口的旗舰,是瞄准开发者的旗舰。
同时运行便宜的那个和好的那个
这是一个罕见的对比:答案显然是“两者都要”,而定价也支持这一点。Gemini 3.1 Pro 是你放在用户面前的模型:首个 token 快,批处理费率让大批量任务成本低廉,公布的推理得分强劲。GPT-6 Sol 是你放在队列后面的模型:启动慢,吞吐量出色,Index 得分高出 51 分,并且在交互式工作负载上,其定价与被它取代的模型相差在 20% 以内。
Gemini 3.1 Pro 已在 OrcaRouter 上架,价格与 Google 的标价一致,在直通模式下,这意味着 Google 一调价,我们这边当天即生效,而无需等待经销商重新议价。截至本文撰写时,GPT-6 Sol 尚未进入我们的目录——它可通过 OpenAI 自家的 API 访问——因此,若要一条路由同时覆盖两者,就意味着为 Gemini 配置一个密钥,并在旁边直接接入 OpenAI。在快速预览模型与较慢的前沿模型之间进行路由,正是自动故障转移所针对的场景:当预览端点性能下降或被弃用时,路由会自动切换,而你是从日志行中得知,而非从用户那里得知。

决策规则
当有人等待时、当工作可以批处理时,或当输出保持简短时,选择 Gemini 3.1 Pro。33 秒的首 token 并不好,但它比 GPT-6 Sol 的快三倍,而 $1/$6 的批处理费率是让大型语料通过强大推理模型的最便宜方式。接受你身处预览端点这一事实,并为迁移做好规划。
当工作是代理式的、长周期的、无人值守的,并且你的上下文保持在 272K token 以内时,就选 GPT-6 Sol。它以 48 比 30 胜出,能产出 128K 的输出,而对手约为 64K,其缓存前缀定价享有 90% 的折扣,使重复性的代理循环变得异常便宜。它 107 秒的首 token 延迟是其推理方式的特点,而不是缺陷——只有当你把它摆到别人面前时,这才会成为问题。
不要以价格作为选择依据。在短上下文工作负载下,两者的差距在9%以内;在长上下文工作负载下,差距在10%以内。对于一本一千万 token 的账本来说,每月九美元的差价不足以成为选择哪一款模型的理由,而五十一分的 Index 差距才是。

本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
