一个生成的双栏对比记分板,标题为“GPT-6.1 Sol 对比 GPT-5.6 Sol——记分板”。左栏“GPT-6.1 Sol”:各行文字分别为“智能指数:51.8”、“每项指数任务成本:$0.72”、“输入 / 输出:$2.00 / $10.00”、“缓存输入:$0.10”、“指数运行输出 token 数:67M”、“努力下限:低”。右栏“GPT-5.6 Sol”:各行文字分别为“智能指数:47.0”、“每项指数任务成本:$1.99”、“输入 / 输出:$4.00 / $20.00”、“缓存输入:$0.40”、“指数运行输出 token 数:90M”、“努力下限:无”。页脚写着“独立数据,依据 Artificial Analysis v4.3.2 在最大努力下的结果;厂商标价。”
Guides & Insights

GPT-6.1 Sol vs GPT-5.6 Sol:四个半指数点、一半费用、两处回退

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

OpenAI 发布了 GPT-6.1 Sol,发布时间为2026年9月29日,比GPT-5.6 Sol晚了十一周。后者于2026年7月9日推出,是上一代的旗舰产品。两者目前仍在售,也仍可调用,它们在中立榜单上的差距为4.8分——在 Artificial Analysis 的智能指数上分别为51.8和47.0,两者都是在同一套十项评估中以最大推理努力测得的。价格差距远大于分数差距:每完成一个指数任务分别为0.72美元和1.99美元,每百万token分别为2.00/10.00美元和4.00/20.00美元。以上就是简要版本。详细版本是:这次升级并不均衡,其中两项评估还出现了退步。

每一项是什么,以及什么取代了什么

GPT-5.6 Sol 是 5.6 系列中的顶配——一个封闭式、仅通过 API 提供的模型,拥有 1,050,000 token 的上下文窗口、128,000 token 的输出上限,支持文本、图像和文件输入,并具备一条从无到最大的推理档位。OpenAI 将其描述为专为最艰巨工作打造的层级:长时程智能体工作流、多文件软件工程、深度推理,其定价也与此相应,为每百万 token 4.00 美元和 20.00 美元,缓存输入为 0.40 美元,缓存写入为 5.00 美元。输入超过 272,000 token 时,价格调整为 8.00 美元和 30.00 美元;它还提供 Batch 层级,价格为每百万 token 2.50 美元和 15.00 美元。

GPT-6.1 Sol 是其后一代产品中的中端型号:低于 GPT-6 Astra,高于 GPT-6 Luna,如今是 OpenAI 引导注重成本的开发者选用的模型。它保留了 1,050,000 token 的上下文窗口和 128,000 token 的输出上限,将知识截止日期从 2026 年 4 月 20 日延长至 4 月 30 日,并将努力等级从六档缩减为五档——low,medium(默认),high,xhigh,max。GPT-5.6 Sol 曾接受的 none值现在会返回错误,OpenAI 的迁移指南明确指出应改用 low,而非静默升级。

这一点值得停下来想一想,因为这是本次发布中唯一一项花更多钱、而非省钱的改动。一条为了获得廉价、快速、非推理调用而选用 none 的流水线,在任一模型系列上都不再拥有这种配置。GPT-6.1 Sol 上最便宜的一档就是推理档,而推理 token 无论你是否看得见,都按输出 token 计费。

梯子,一级一级地

独立评测方公布了两款模型上每一项设置的分数和运行成本,让这场正面对决比单一对比更有参考价值。在同等设置下对齐来看:

• 努力阶梯,GPT-6.1 Sol——在每项指数任务 $0.72 时最高 51.8;xhigh 为 51.0,成本 $0.39;high 为 50.2,成本 $0.32;medium(默认)为 47.8,成本 $0.21 • 输出速度——GPT-6.1 Sol 为每秒 59.7 个 token,而 GPT-5.6 Sol 为 87.8
• 首个分块时间——GPT-6.1 Sol 为 332 秒,而 GPT-5.6 Sol 的数值更快,榜单中位数约为 4 秒
• 指数运行中的输出 token——GPT-6.1 Sol 为 6720 万,而 GPT-5.6 Sol 为 9000 万
• 输入 / 输出价格——$2.00 / $10.00 对比 $4.00 / $20.00
• 缓存输入——$0.10 对比 $0.40;缓存写入 $2.50 对比 $5.00
• 批量费率——GPT-6.1 Sol 未公布,而 GPT-5.6 Sol 为 $2.50 / $15.00
• 长上下文档位——输入 token 超过 272,000 后,GPT-6.1 Sol 会对整个请求重新定价为 $4.00 / $15.00,而 GPT-5.6 Sol 为 $8.00 / $30.00
• 努力下限——低对比无

从这份清单中可以得出两点结论。第一,这次降价是结构性的,而非促销性的:GPT-6.1 Sol 的标准费率 2.00 美元和 10.00 美元,已经低于 GPT-5.6 Sol 的 批量费率 2.50 美元和 15.00 美元,因此即便是旧模型的折扣档位,也比新模型的标价更贵。第二,这次升级在延迟上并非一条直线式的改善。GPT-6.1 Sol 生成输出的速度大约慢三分之一,在该榜单的长提示词测试中,首个分块耗时 332 秒——与 GPT-6 Sol 的 107 秒处于同一数量级,约为榜单中位数的八十倍。如果你基于 GPT-5.6 Sol 构建了交互式产品,那么无论基准测试结果如何,这都是功能上的倒退,而且解决办法是架构层面的,而非调整参数。

A generated hero card for a GPT-6.1 Sol versus GPT-5.6 Sol comparison, headed 'Four and a half index points, half the bill', with two badges reading 'GPT-6.1 Sol: $0.72 per index task' and 'GPT-5.6 Sol: $1.99 per index task', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

两项评估朝错误的方向发展

综合增益为 4.8 分。各组成部分并非一致为正,董事会的逐次评估得分也说明了这一点:

• SciCode — GPT-6.1 Sol 0.542 对比 GPT-5.6 Sol 0.571。在科学编码方面下降了 2.9 个百分点。
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575.1 对比 GPT-5.6 Sol Elo 1611.3。在具有经济价值的知识工作上,Elo 下降了 36 分。
• Humanity's Last Exam — GPT-6.1 Sol 0.529 对比 GPT-5.6 Sol 0.495。提升了 3.4 个百分点。
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.561 对比 GPT-5.6 Sol 0.399。提升了 16 个百分点,是该配对中最大的单项变动。
• AA-Omniscience — GPT-6.1 Sol 41.5 对比 GPT-5.6 Sol 22.0,这关乎知识可靠性与幻觉,而非原始召回。
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — 其余五项,它们补全了综合得分,而剩余 4.8 个百分点的提升正是在这里获得的。

一个在终端工作上明显更优、在事实可靠性上大幅更优,但在科学编程和职业工作 Elo 上可量化地更差的模型,并不是一个严格意义上更好的模型。它是前沿上的另一个点,而且是被有意放在那里的:OpenAI 自己对 GPT-6.1 Sol 的发布定位,是在接近旗舰级质量下的每完成任务成本,而不是最高分数。如果你的工作负载是 SciCode 形态或 GDPval 形态的,那么适用于你的不是那个综合数字,而是那个退步。

GPT-5.6 Sol 仍然保有已发布的长上下文结果

较旧模型拥有、较新模型却没有数字的唯一一处,是 GPT-6.1 Sol 价目表发生变化的那个上下文区间内的检索准确率。GPT-5.6 Sol 在 256,000 至 512,000 token 区间公布了 91.5% 的 MRCR v2 八针结果。GPT-6.1 Sol 没有已发布的对应结果,而当输入超过 272,000 token 时,其整个请求都会按输入和缓存 2×、输出 1.5× 重新计价。

把这两个事实放在一起看,新模型经济性最薄弱的那个细分场景,恰恰正是旧模型唯一有据可查的强项所在。省钱并没有消失——重新定价档位上的 $4.00 和 $15.00,对比 GPT-5.6 Sol 自家长上下文档位上的 $8.00 和 $30.00,仍然相当于打对折——但半价这套说法讲的是通用工作负载,而长上下文检索流水线并不属于这一类。如果你的工作负载正是后者,那么 GPT-5.6 Sol 以 $4.00 和 $20.00 的价格、以及公开的 91.5% 成绩,是一个站得住脚的留守之选。

GPT-5.6 Sol 的其他已公布结果依然有效,这也是一些团队不会迁移的原因:面向网页研究智能体的 BrowseComp 90.4,Terminal-Bench 2.1 为 88.8 和 88.0,SWE-Bench Pro 64.6,Agents' Last Exam 53.6,OSWorld 2.0 为 62.6。这些都是 Open​AI 报告的,基于 Open​AI 的测试框架,而且是在 7 月报告的。此后发生变化的是,该评测板现在在同一套设置下、于同一个测试套件上为两个模型打分,而较旧的模型在综合成绩和成本上都落败。

迁移本身只是一处字符串更改,只有一个例外

同一个供应商、同一套 API 接口、在排名中紧挨着、同样的窗口和输出上限——所以对大多数技术栈来说,这不过是换一个模型标识符,价格就降了一半。例外情况很具体,在你切换开关之前,值得先把它们点出来。

如果你的代码将reasoning.effort设为none或minimal,它会直接报错而不是降级运行,low才是有文档记录的替代取值。如果你的流量超过 272,000 个输入 token,在推算能省下多少钱之前,先查一下重新定价后的档位。如果你的产品依赖首 token 时间,发布前务必实测,因为董事会给出的 332 秒这个数字不是四舍五入的误差。如果你的评测集中含有 SciCode 形态或 GDPval 形态的切片,请把该切片在两个模型上都跑一遍,而不要轻信综合得分。

两个模型都在 OrcaRouter 上,按 Open​AI 自己的标价提供——GPT-6.1 Sol 为 $2.00 和 $10.00,缓存输入为 $0.10;GPT-5.6 Sol 为 $4.00 和 $20.00,缓存输入为 $0.40——采用直通模式,Open​AI 的价格一旦变动,当天就落到我们这边,而不是等经销商重新议价之后。因为价目表是原样直通,而不是加价,所以本文中的算术就是你实际得到的算术:同样的每任务 $0.72 模型,同样的减半,两边都没有叠加平台溢价。

A screenshot of the OrcaRouter model page for openai/gpt-5.6-sol, showing the listing dated 2026-07-09, the model described as the flagship of OpenAI's GPT-5.6 series for deep multi-step reasoning and long-horizon agentic workflows, a 1.05M-token context with 128K maximum output, text, image and file input, and the list price of $4.00 input and $20.00 output per million tokens.

把两者放在同一个端点之后的实际用处在于,比较始终是实时的。把新流量发送到 GPT-6.1 Sol,让 GPT-5.6 Sol 只差一次配置变更,作为回退方案和长上下文路径,并让自动故障转移覆盖这样一个窗口期:一款发布两个月的旗舰模型的可用性和 Enterprise 启用仍在逐步稳定。一次能把账单减半、却让两个子基准倒退的迁移,不是一个做一次就能忘掉的决定;它应该按路由逐一做出,而路由层正是让这件事变得成本低廉的东西。

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

每个所属的地方

• 通用智能体与终端工作 —— GPT-6.1 Sol。在 Terminal-Bench 4.0 上领先十六分,而价格只要一半,这可不是一个差距很小的选择。
• 事实可靠性、检索答案类产品 —— GPT-6.1 Sol,在 AA-Omniscience 上领先近二十分。
• 科学编程 —— 先检查你自己的评测。榜单显示有 2.9 分的下降,而综合分数不会把它反映出来。
• 具有经济价值的知识工作 —— 同样需谨慎。GDPval-AA Elo 回退了 36 分。
• 超过 272,000 个 token 的长上下文检索 —— 选 GPT-5.6 Sol,直到 GPT-6.1 Sol 在该区间有公布数据为止。
• 交互式、对延迟敏感的界面 —— 迁移前先测量。输出更快,但首 token 慢得多。
• 最便宜的非推理调用 —— 两者皆非。该配置在这个系列上已不复存在。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新