一张生成的主视觉卡片,标题为“GPT-6 Sol 对比 GPT-5.6 Sol”,主标题为“仅差 1 个指数点,价格却减半”,两张模型卡片分别显示 AA Index 为 48 对 47,价格为 $2.00/$10.00 对 $4.00/$20.00,右下角是 OrcaRouter 标志。
Guides & Insights

GPT-6 Sol vs GPT-5.6 Sol:一个指数点,一半的价格,以及无人宣布的性能回退

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

是的,升级吧——但动手之前先读第二段。2026 年 9 月 22 日发布的 GPT-6 Sol 在 Artificial Analysis 的 Intelligence Index 上得分为 48。2026 年 7 月 9 日发布的 GPT-5.6 Sol 得分为 47。只差一分。取代它的模型成本只有一半:每百万输入 $2.00、每百万输出 $10.00,而此前是 $4.00 和 $20.00。从关键数字来看,这是当前产品线中最容易做出的升级决定,而且这次降价是真实的、永久的,也是该厂商对旗舰产品所做的最大单次降价。

麻烦之处在于,Artificial Analysis 自己对 GPT-6 Sol 的评估发现的是进步与退步并存,而不是一次利落的跃升。在 GDPval-AA v2.1 上出现了退步。此外,还有一个针对超过 272,000 个输入 token 的长上下文重新定价档位,它大致会将输入费率翻倍,并将输出费率提高一半——而 272K 恰恰是 GPT-5.6 Sol 已有公开优势的区间。一次看起来像是直接把你的账单减半的迁移,在长上下文流量上,最终可能更接近打平,并且还附带着能力上的取舍。

Index 上涨一个点实际上意味着什么

两款模型都是在同一块板卡上、版本 4.3.2 下测得的,这使其成为整个 GPT-6 Sol 系列中最干净的对比——没有评测框架差异,没有厂商与独立评测方之间的不匹配,同一个实验室测量同一厂商的两款模型。

• AA Intelligence Index — GPT-6 Sol 48,在 212 个中排名第 18,而 GPT-5.6 Sol 47,在 212 个中排名第 19

• 每个 Index 任务的成本 — GPT-6 Sol 约为 GPT-5.6 Sol 的一半

• 输出速度 — GPT-6 Sol 104.4 tokens/秒,对比 GPT-5.6 Sol 72.6 tokens/秒

• 首个 token 时间 — GPT-6 Sol 107.18s,而 GPT-5.6 Sol 更快,两者均对照 3.87s 的榜单中位数

输入价格 — GPT-6 Sol 每 100 万 2.00 美元,对比 GPT-5.6 Sol 每 100 万 4.00 美元

• 输出价格 — GPT-6 Sol 每 100 万 $10.00,对比 GPT-5.6 Sol 每 100 万 $20.00

• 缓存输入 — GPT-6 Sol 相比 GPT-5.6 Sol 约便宜 90%,每 100 万 $0.40

• 批量费率 — GPT-6 Sol 未公布,对比 GPT-5.6 Sol $2.50 / $15.00

• 长上下文档位 — GPT-6 Sol 在输入超过 272K 时重新定价,而 GPT-5.6 Sol 没有对应阶梯

• 上下文窗口 — 据 AA,GPT-6 Sol 为 872K,官方宣称 1.05M;而 GPT-5.6 Sol 约为 1.05M 至 1.1M

• 最大输出 — 两者均为 128K

• 已发布 — GPT-6 Sol 2026-09-22 对比 GPT-5.6 Sol 2026-07-09

A generated two-column scoreboard titled 'GPT-6 Sol vs GPT-5.6 Sol — the scoreboard'. Left column GPT-6 Sol: Input $2.00 per 1M, Output $10.00 per 1M, AA Index 48, Speed 104.4 tok/s, Long context 'reprices above 272K', Released 2026-09-22. Right column GPT-5.6 Sol: Input $4.00 per 1M, Output $20.00 per 1M, AA Index 47, Speed 72.6 tok/s, Long context 'no step', Released 2026-07-09. Footer: 'Both measured by Artificial Analysis, Index v4.3.2.'

把这两条速度曲线放在一起看。GPT-6 Sol 生成输出的速度比其前代快约 44%,但它在生成首个 token 上却慢得多——107.18 秒,而榜单中位数为 3.87 秒。按榜单标准,GPT-5.6 Sol 也算不上快模型,但还没到那个地步。如果你是为了交互式产品而迁移到 GPT-5.6 Sol,那么 GPT-6 Sol 并不能直接取而代之,而这与任何基准测试无关,属于功能性倒退。

有一条信息悄然利好:GPT-6 Sol 的标准费率 $2/$10 低于 GPT-5.6 Sol 的批量费率 $2.50/$15。即便是旧型号的折扣档,也比新型号的标价更贵。这是最有力的证据,表明此次降价是结构性的,而非促销性的。

回归才是有意思的部分

Artificial Analysis 发现,GPT-6 Sol 大致将每项任务成本减半,同时带来了提升与退步并存的混合表现。GDPval-AA v2.1 是被点名的退步项。另外,OpenAI 的 GPT-5.6 Luna 在 Coding Agent Index 上也出现了退步——这表明这是这一代模型中的一种模式,而非某个模型的孤立失误。

这值得认真对待,恰恰因为它是独立得出的发现。OpenAI 的发布材料围绕的是每任务成本,以及它自行挑选的基准测试行;Artificial Analysis 没有产品要卖,只报告其评测框架产出的结果。一个在综合指标上更便宜且大致相当、但在特定子任务上明显更差的模型,并不是严格意义上更好的模型。它是前沿上的另一个点。

这个的实际版本是:如果你的工作负载高度符合 GDPval-AA 的形态——具有经济价值的知识工作,也就是那个基准旨在衡量的那类任务——那么这一点综合提升并不适用于你,回退才是真正重要的数字。如果你的工作负载是通用的,那么每任务成本减半才是真正重要的数字,而综合指标表明你并没有牺牲任何可衡量的东西。

GPT-5.6 Sol 仍然在哪些方面胜出

GPT-5.6 Sol 公布了一项长上下文检索结果,GPT-6 Sol 拿不出任何同等级别的成绩与之相匹敌:MRCR v2、8-needle,在 256K 至 512K 区间达到 91.5%。这是一个检索准确率数字,而该区间正是 GPT-6 Sol 费率卡发生变化的地方。

把这两个事实并排来看。当输入超过 272,000 个 token 时,GPT-6 Sol 的整个请求会被重新计价,输入约为 $4、输出约为 $15。这大约相当于 GPT-5.6 Sol 原来的输入费率,输出则是它的四分之三——于是你为迁移所追求的 50% 节省,在输入上缩水到约 0%,在输出上缩水到 25%,而这恰恰是在 GPT-5.6 Sol 有明确记录的优势、GPT-6 Sol 却没有公开对应表现的上下文区间。

GPT-5.6 Sol 的其他已发布结果依然体面,这也是某些团队不会迁移的原因:

• 智能体最后的考试 —— GPT-5.6 Sol 53.6

• Terminal-Bench 2.1 — GPT-5.6 Sol 88.8 / 88.0

• SWE-Bench Pro — GPT-5.6 Sol 64.6

• OSWorld 2.0 — GPT-5.6 Sol 62.6

• BrowseComp — GPT-5.6 Sol 90.4

• GDPval-AA v2 — GPT-5.6 Sol 1747.8 Elo

• HLE — GPT-5.6 Sol 49.5

• MRCR v2,8 针 — GPT-5.6 Sol 在 256K 至 512K 下达到 91.5%

这些是 OpenAI 报告的数据。请注意,BrowseComp 的 90.4 分和 MRCR 的数值是最难被替代的两项:在网络研究智能体和长上下文检索这类工作负载中,一个有公开分数、已经发布两个月的模型,比一个没有对应测量结果的新模型更稳妥。

GPT-6 Sol 带来哪些价目表上没有的内容

定价才是重点,但另外三件事也发生了变化。

首先,是上下文上限。Artificial Analysis 列出 GPT-6 Sol 为 872,000 个 token,而 OpenAI 其他材料中则声称可达 1.05M,最大输入为 922K。视来源不同,GPT-5.6 Sol 大约在 1.05M 到 1.1M 之间。从纸面上看,这在可用窗口上是一次小幅退步——但需注意,决定成本的是 272K 的档位边界,而非上限。

第二,可用性。GPT-6 Sol 已在 API 中提供,也在 Plus、Pro、Business、Enterprise 和 Edu 版的 ChatGPT Work 与 Codex 中提供——而 Enterprise 管理员必须先启用它,用户才能看到。它不在 ChatGPT Chat 中。GPT-5.6 Sol 的发布范围更广。如果你们团队的访问路径需要经过企业管理员,那么这次迁移就不只是改代码那么简单。

第三,新旗舰的推出通常意味着旧款会沦为更便宜的备选方案,而不是被淘汰。定价为 $4/$20 的 GPT-5.6 Sol 在 Index 上得分 47,依然是一款出色的模型;而且在长上下文检索类任务上,它有一项已公布的数值,而 GPT-6 Sol 没有。

一次成本比看起来更低的迁移

这次升级之所以容易,是因为这两个模型来自同一家供应商,拥有相同的 API 形态,并且在排名中相邻——这意味着迁移只是改一下模型字符串,而不是重新架构,而且回退路径已经在你的代码里了。 GPT-5.6 Sol 已在 OrcaRouter 上以 OpenAI 的标价提供,采用的是直通模式:OpenAI 一调价,我们这边当天就会生效,而不是等经销商重新谈价之后。

截至本文撰写时,GPT-6 Sol 并不在我们的目录中——它可以通过 OpenAI 自家的 API 访问。因此,迁移的真实形态是一条由同一密钥承载、其后接着 GPT-5.6 Sol 的路由:把新流量发给 GPT-6 Sol,让之前的模型只需改动一处配置即可调用,并让自动故障转移覆盖新旗舰模型可用性尚未稳定的那段窗口期。对于一个才发布两天、前面还挡着一个 Enterprise 启用开关、且长上下文档位会在超过 272K token 时改变成本结构的模型而言,把上一代仍然接在链路里并不是谨慎——而是糟糕的一个下午与糟糕的一周之间的差别。

A screenshot of the Artificial Analysis page for GPT-6 Sol (max), showing an Intelligence rank of 18th of 212 models, a Cost rank of 49th and a Verbosity rank of 43rd, input pricing of $2.00 and output of $10.00 per 1M tokens with a 90% cache discount, a cost per Intelligence Index task of $1.06, an 872k-token context window, 77M tokens generated during the index run, and a total of $1,550.08 spent evaluating the model on the Intelligence Index.

迁移检查清单

在动手做任何其他事情之前,先测量你实际的上下文分布。如果你请求的第 95 百分位低于 272,000 个输入 token,那就迁移——账单两边都能实打实省下 50%,每个任务的成本减半,而综合指数表明你并没有放弃任何东西。如果流量中有相当一部分位于这条线以上,那就仔细地为这一档建模:在大约 $4/$15 的价格下,相对于 GPT-5.6 Sol 的 $4/$20,输出上的优势是 25%,输入上则毫无优势,而你为此付出的代价是失去一个有文档记录的长上下文检索结果。

检查是否有人在等待第一个 token。107 秒大约是榜单中位数的二十八倍,而这正是生产环境中最先暴露出来的故障模式。任何另一端有真人等待的场景,都应继续使用 GPT-5.6 Sol,或改走其他路由。

然后检查启用路径。企业套餐需要由管理员开启 GPT-6 Sol,而它在 ChatGPT Chat 中完全没有提供。在内部宣布迁移之前,先确认你的用户确实能够访问到它。

最后,在第一个月里,请在你自己的评估集上关注 GDPval-AA v2.1。独立实验室在那里发现了一个性能回退,而综合分数提升一个点并不能说明你的特定任务集是变好了还是变差了。在正式切换之前,先在两个模型上运行你的评估,而不是切换之后再跑。

A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the Vision, Tools, JSON and Reasoning badges, a 1.05M-token context with 128K maximum output and text + image + file input, list pricing of $4.00 input and $20.00 output per 1M tokens, and the description of GPT-5.6 Sol as the flagship of OpenAI's GPT-5.6 series, strong at command-line and multi-file coding tasks.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新