
GPT-6 对比 GPT-5.6 Sol:价格减半,得分相同
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
GPT-6 Sol的成本是GPT-5.6 Sol的一半,而且两者在独立智能指数上的得分相差不到一分。这就是一句话说清的全部对比,也是本页没什么悬念的原因:厂商于2026年9月22日发布 Sol,定价为每百万输入 token 2.00 美元、每百万输出 token 10.00 美元,这是在 GPT-5.6 Sol 于2026年7月9日以 4.00 美元和 20.00 美元面世七周之后。相同的 1,050,000 token 上下文窗口。相同的 128,000 token 输出上限。相同的 272,000 token 重新定价阈值。更新的模型并非一次能力跃升;它是一次价格事件,而故事的后半段,则是厂商在10月7日对它做了什么。
如果你今天要在这两者之间做选择,有用的问法不是哪个更聪明,而是你已经在跟哪一个做集成,以及你的评测基线是否值得保留。
10月7日究竟发生了什么变化?
截至 9 月底,GPT-6 是一个拥有三个成员的 API 系列,自身没有面向消费者的界面。GPT-6 Astra以 $10.00 / $50.00 位居最高档,GPT-6 Sol以 $2.00 / $10.00 位居中档,GPT-6 Luna则以 $0.10 / $0.50 垫底。2026 年 10 月 7 日,OpenAI 通过一项名为 Intelligent UI 的能力,将这一代模型引入 ChatGPT 本身,向每周使用 ChatGPT 的超过 12 亿人推出。
对于与 GPT-5.6 Sol 进行比较而言,真正重要的细节是 OpenAI 在其自己的公告中说明的路由规则。ChatGPT 中的 GPT-6,在 Plus、Pro、Business 和 Enterprise 套餐中由 GPT-6 Sol 驱动,在 Free 和 Go 套餐中由 GPT-6 Luna 驱动。换句话说,要求你与 GPT-5.6 Sol 比较的模型,就是你可以通过 API 调用的同一个 GPT-6 Sol——ChatGPT 的这次推出并不是一个单独的、更好的检查点。此次推出于 10 月 7 日在 Chat 标签页中覆盖 Plus、Pro、Business 和 Enterprise,Free 和 Go 从 10 月 8 日起跟进,而企业版可用性受工作场所管理员设置限制。驱动 Work 和 Codex 的模型被明确保持不变。
相比之下,GPT-5.6 Sol 从未拥有属于自己的消费者界面。它于 2026 年 7 月 9 日作为一个 API 模型诞生,并且至今仍是如此。因此,这两款产品是在不同的分发覆盖面上被比较的——一个 API 模型成为了十亿多周活跃用户的默认答案引擎,而另一个 API 模型则始终停留在 API 模型的身份上。
两张费率卡并排
两者都采用两档式计费:标准费率适用于最多 272,000 个输入 token,而一旦越过这条界线,更高的费率会对整个请求重新计价。OpenAI 的模型页面针对两者以相同方式说明了这一规则——输入 token 超过 272K 的提示词,将对整个请求按 2 倍输入与缓存费率、1.5 倍输出费率计费,而不仅仅是超出阈值的部分。
• 标准输入:GPT-6 Sol 每百万 $2.00,GPT-5.6 Sol 每百万 $4.00
• 标准输出:GPT-6 Sol 每百万 $10.00,GPT-5.6 Sol 每百万 $20.00
• 缓存输入(减免 90%):GPT-6 Sol 每百万 $0.20,GPT-5.6 Sol 每百万 $0.40
• 缓存写入:GPT-6 Sol 每百万 $2.50,GPT-5.6 Sol 每百万 $5.00
• 超过 272K 输入 token 时:GPT-6 Sol 重新定价为 $4.00 / $15.00,GPT-5.6 Sol 为 $8.00 / $30.00
• 上下文和输出:两者均为 1,050,000 token 输入,128,000 token 输出
• 推理强度:两者都提供可配置的 reasoning.effort,取值范围从 none 到 max
• 模态:两者均接受文本、图像和文件输入,并返回文本
长上下文层级是绝对差距最大的地方:一旦超过 272,000 个 token,GPT-5.6 Sol 的费用为 $8.00 / $30.00,而 GPT-6 Sol 为 $4.00 / $15.00。如果你运行很长的 agent 记录,整请求计费规则意味着一次 300,000 token 的调用会从第一个 token 起就按更高层级计费,而两个模型在那次调用上的差额大约是一个非常大的数字的一半。
关于 GPT-5.6 Sol 这一列有一点需要注意:OpenAI 当前的定价页面已不再在其旗舰表中列出 GPT-5.6 Sol 这一行,因为该位置现在由 GPT-6.1 Sol 占据。上表中的数字是从 GPT-5.6 Sol 模型页面读取的,该页面仍记录着这些数字,而其 4.00 美元 / 20.00 美元的标价是促销价,OpenAI 表示该促销价至少持续到 2026 年 11 月 21 日。OpenAI 向媒体表示,GPT-6 的价格是永久性的,而非促销价,但这是发言人的说法,而非书面承诺——应将 GPT-6 的价格视为稳定,而 GPT-5.6 Sol 的价格视为有期限的。

独立的数字
以厂商对厂商的框架来比较,会让你去看 OpenAI 自家发布的图表。那些数据由厂商自行报告,而且这两个模型从未由其开发者以值得引用的形式彼此对照发布过。更清晰的解读,来自两个模型共同采用的那家独立评测机构。
Artificial Analysis 在其 Intelligence Index 上给 GPT-6 Sol 打出 47.6 分,GPT-5.6 Sol 则为 47.0。这落在单次指数修订的噪声范围内——对两个模型来说都算不上胜出。在随附的单项基准测试中,排名是参差的,而非决定性的。对照 GPT-6 Sol 公布的数据,GPT-5.6 Sol 在 GPQA Diamond 上得分更高(94.1,对比 GPT-6 Sol 的数值),SciCode 上与之相当,而 GPT-6 Sol 则在 Humanity's Last Exam 和长上下文召回上领先。
关于这些数字,有两点需要坦诚说明。第一,OrcaRouter 目录中每个模型的指数值是在不同日期评估的,所以你看到的并不是同一周的正面对比;两个修订版本之间零点几分的差距说明不了任何问题。第二,GPT-5.6 Sol 上榜时间更长,运行的次数也更多;较新模型的首次指数得分往往会随着更多评估结果出炉而变化,通常是略微上升。如果这两个模型之间的差异是你工作负载的决定性因素,那么最诚实的建议是:基于你自己的流量做基准测试,而不是依据任一模型的指数排名。

GPT-5.6 Sol 在哪些情况下仍然是正确之选
继续沿用 GPT-5.6 Sol 而非切换,有三个站得住脚的理由。第一个是冻结的评估基线:如果你的回归测试套件或成本模型是依据 GPT-5.6 Sol 的精确输出和 token 特征校准的,那么换模型会使该基线失效,而重新建立基线所需的工程时间,可能在一段时间内超过每 token 节省的成本。第二个理由是,在已部署的系统里,它是一个被固定下来的快照,而且一切都还没有出故障。第三个理由是,如果你的提示词低于 272K tokens,且你的用量小到绝对节省微不足道,那么这次降价并不适用于你——每月几百万 token 的规模下,2 美元与 4 美元的输入费率只是一个舍入误差。
不构成理由的一点是能力。公开记录中没有任何一项基准测试,能让 GPT-5.6 Sol 为自身辩护的理由依赖于它保持对 GPT-6 Sol 的领先,而且在包括长上下文在内的每一个档位上,价格都对它不利。
它们之间的路由
两代模型做对比时的实际问题在于,你往往需要在一段时间内同时保留两者。OrcaRouter 正是为这种场景而打造的:一个 API,按供应商标价原样透传、零加价,因此供应商调价当天就会生效,而不用等到你下次对账时才体现,并且当某条路由质量下降时,可跨供应商自动故障转移。openai/gpt-5.6-sol 与 GPT-6 Sol 在 OrcaRouter 上均为同一目录中的实时路由,通过兼容 OpenAI 的 chat completions 和 Responses 端点调用,这意味着把流量从一个模型迁到另一个只是改一下 model-id,而不是重写代码。路由 DSL 让你可以按请求大小进行分流,因此短提示词可以走低成本层级,而任何超过你自己设定阈值的请求都可以固定到你在长文本上信得过的那个模型。
一句话的结论
GPT-6 Sol 是应当首先选用的模型。在每个档位上,它的价格都只有 GPT-5.6 Sol 的一半;它如今背靠可触达 12 亿周活跃用户的 ChatGPT 界面,而独立指数显示它与对手持平,而非落后。只有在冻结的基线或不变的部署比价格差更有价值时,GPT-5.6 Sol 才仍是合理之选——而这关乎的是你的工程日历,而非模型本身。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
