
GPT-6.1 Sol vs GPT-5.6 Sol:四个半指数点、一半费用、两处回退
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
OpenAI 发布了 GPT-6.1 Sol,发布时间为2026年9月29日,比GPT-5.6 Sol晚了十一周。后者于2026年7月9日推出,是上一代的旗舰产品。两者目前仍在售,也仍可调用,它们在中立榜单上的差距为4.8分——在 Artificial Analysis 的智能指数上分别为51.8和47.0,两者都是在同一套十项评估中以最大推理努力测得的。价格差距远大于分数差距:每完成一个指数任务分别为0.72美元和1.99美元,每百万token分别为2.00/10.00美元和4.00/20.00美元。以上就是简要版本。详细版本是:这次升级并不均衡,其中两项评估还出现了退步。
每一项是什么,以及什么取代了什么
GPT-5.6 Sol 是 5.6 系列中的顶配——一个封闭式、仅通过 API 提供的模型,拥有 1,050,000 token 的上下文窗口、128,000 token 的输出上限,支持文本、图像和文件输入,并具备一条从无到最大的推理档位。OpenAI 将其描述为专为最艰巨工作打造的层级:长时程智能体工作流、多文件软件工程、深度推理,其定价也与此相应,为每百万 token 4.00 美元和 20.00 美元,缓存输入为 0.40 美元,缓存写入为 5.00 美元。输入超过 272,000 token 时,价格调整为 8.00 美元和 30.00 美元;它还提供 Batch 层级,价格为每百万 token 2.50 美元和 15.00 美元。
GPT-6.1 Sol 是其后一代产品中的中端型号:低于 GPT-6 Astra,高于 GPT-6 Luna,如今是 OpenAI 引导注重成本的开发者选用的模型。它保留了 1,050,000 token 的上下文窗口和 128,000 token 的输出上限,将知识截止日期从 2026 年 4 月 20 日延长至 4 月 30 日,并将努力等级从六档缩减为五档——low,medium(默认),high,xhigh,max。GPT-5.6 Sol 曾接受的 none值现在会返回错误,OpenAI 的迁移指南明确指出应改用 low,而非静默升级。
这一点值得停下来想一想,因为这是本次发布中唯一一项花更多钱、而非省钱的改动。一条为了获得廉价、快速、非推理调用而选用 none 的流水线,在任一模型系列上都不再拥有这种配置。GPT-6.1 Sol 上最便宜的一档就是推理档,而推理 token 无论你是否看得见,都按输出 token 计费。
梯子,一级一级地
独立评测方公布了两款模型上每一项设置的分数和运行成本,让这场正面对决比单一对比更有参考价值。在同等设置下对齐来看:
• 努力阶梯,GPT-6.1 Sol——在每项指数任务 $0.72 时最高 51.8;xhigh 为 51.0,成本 $0.39;high 为 50.2,成本 $0.32;medium(默认)为 47.8,成本 $0.21 • 输出速度——GPT-6.1 Sol 为每秒 59.7 个 token,而 GPT-5.6 Sol 为 87.8
• 首个分块时间——GPT-6.1 Sol 为 332 秒,而 GPT-5.6 Sol 的数值更快,榜单中位数约为 4 秒
• 指数运行中的输出 token——GPT-6.1 Sol 为 6720 万,而 GPT-5.6 Sol 为 9000 万
• 输入 / 输出价格——$2.00 / $10.00 对比 $4.00 / $20.00
• 缓存输入——$0.10 对比 $0.40;缓存写入 $2.50 对比 $5.00
• 批量费率——GPT-6.1 Sol 未公布,而 GPT-5.6 Sol 为 $2.50 / $15.00
• 长上下文档位——输入 token 超过 272,000 后,GPT-6.1 Sol 会对整个请求重新定价为 $4.00 / $15.00,而 GPT-5.6 Sol 为 $8.00 / $30.00
• 努力下限——低对比无
从这份清单中可以得出两点结论。第一,这次降价是结构性的,而非促销性的:GPT-6.1 Sol 的标准费率 2.00 美元和 10.00 美元,已经低于 GPT-5.6 Sol 的 批量费率 2.50 美元和 15.00 美元,因此即便是旧模型的折扣档位,也比新模型的标价更贵。第二,这次升级在延迟上并非一条直线式的改善。GPT-6.1 Sol 生成输出的速度大约慢三分之一,在该榜单的长提示词测试中,首个分块耗时 332 秒——与 GPT-6 Sol 的 107 秒处于同一数量级,约为榜单中位数的八十倍。如果你基于 GPT-5.6 Sol 构建了交互式产品,那么无论基准测试结果如何,这都是功能上的倒退,而且解决办法是架构层面的,而非调整参数。

两项评估朝错误的方向发展
综合增益为 4.8 分。各组成部分并非一致为正,董事会的逐次评估得分也说明了这一点:
• SciCode — GPT-6.1 Sol 0.542 对比 GPT-5.6 Sol 0.571。在科学编码方面下降了 2.9 个百分点。
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575.1 对比 GPT-5.6 Sol Elo 1611.3。在具有经济价值的知识工作上,Elo 下降了 36 分。
• Humanity's Last Exam — GPT-6.1 Sol 0.529 对比 GPT-5.6 Sol 0.495。提升了 3.4 个百分点。
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.561 对比 GPT-5.6 Sol 0.399。提升了 16 个百分点,是该配对中最大的单项变动。
• AA-Omniscience — GPT-6.1 Sol 41.5 对比 GPT-5.6 Sol 22.0,这关乎知识可靠性与幻觉,而非原始召回。
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — 其余五项,它们补全了综合得分,而剩余 4.8 个百分点的提升正是在这里获得的。
一个在终端工作上明显更优、在事实可靠性上大幅更优,但在科学编程和职业工作 Elo 上可量化地更差的模型,并不是一个严格意义上更好的模型。它是前沿上的另一个点,而且是被有意放在那里的:OpenAI 自己对 GPT-6.1 Sol 的发布定位,是在接近旗舰级质量下的每完成任务成本,而不是最高分数。如果你的工作负载是 SciCode 形态或 GDPval 形态的,那么适用于你的不是那个综合数字,而是那个退步。
GPT-5.6 Sol 仍然保有已发布的长上下文结果
较旧模型拥有、较新模型却没有数字的唯一一处,是 GPT-6.1 Sol 价目表发生变化的那个上下文区间内的检索准确率。GPT-5.6 Sol 在 256,000 至 512,000 token 区间公布了 91.5% 的 MRCR v2 八针结果。GPT-6.1 Sol 没有已发布的对应结果,而当输入超过 272,000 token 时,其整个请求都会按输入和缓存 2×、输出 1.5× 重新计价。
把这两个事实放在一起看,新模型经济性最薄弱的那个细分场景,恰恰正是旧模型唯一有据可查的强项所在。省钱并没有消失——重新定价档位上的 $4.00 和 $15.00,对比 GPT-5.6 Sol 自家长上下文档位上的 $8.00 和 $30.00,仍然相当于打对折——但半价这套说法讲的是通用工作负载,而长上下文检索流水线并不属于这一类。如果你的工作负载正是后者,那么 GPT-5.6 Sol 以 $4.00 和 $20.00 的价格、以及公开的 91.5% 成绩,是一个站得住脚的留守之选。
GPT-5.6 Sol 的其他已公布结果依然有效,这也是一些团队不会迁移的原因:面向网页研究智能体的 BrowseComp 90.4,Terminal-Bench 2.1 为 88.8 和 88.0,SWE-Bench Pro 64.6,Agents' Last Exam 53.6,OSWorld 2.0 为 62.6。这些都是 OpenAI 报告的,基于 OpenAI 的测试框架,而且是在 7 月报告的。此后发生变化的是,该评测板现在在同一套设置下、于同一个测试套件上为两个模型打分,而较旧的模型在综合成绩和成本上都落败。
迁移本身只是一处字符串更改,只有一个例外
同一个供应商、同一套 API 接口、在排名中紧挨着、同样的窗口和输出上限——所以对大多数技术栈来说,这不过是换一个模型标识符,价格就降了一半。例外情况很具体,在你切换开关之前,值得先把它们点出来。
如果你的代码将reasoning.effort设为none或minimal,它会直接报错而不是降级运行,low才是有文档记录的替代取值。如果你的流量超过 272,000 个输入 token,在推算能省下多少钱之前,先查一下重新定价后的档位。如果你的产品依赖首 token 时间,发布前务必实测,因为董事会给出的 332 秒这个数字不是四舍五入的误差。如果你的评测集中含有 SciCode 形态或 GDPval 形态的切片,请把该切片在两个模型上都跑一遍,而不要轻信综合得分。
两个模型都在 OrcaRouter 上,按 OpenAI 自己的标价提供——GPT-6.1 Sol 为 $2.00 和 $10.00,缓存输入为 $0.10;GPT-5.6 Sol 为 $4.00 和 $20.00,缓存输入为 $0.40——采用直通模式,OpenAI 的价格一旦变动,当天就落到我们这边,而不是等经销商重新议价之后。因为价目表是原样直通,而不是加价,所以本文中的算术就是你实际得到的算术:同样的每任务 $0.72 模型,同样的减半,两边都没有叠加平台溢价。

把两者放在同一个端点之后的实际用处在于,比较始终是实时的。把新流量发送到 GPT-6.1 Sol,让 GPT-5.6 Sol 只差一次配置变更,作为回退方案和长上下文路径,并让自动故障转移覆盖这样一个窗口期:一款发布两个月的旗舰模型的可用性和 Enterprise 启用仍在逐步稳定。一次能把账单减半、却让两个子基准倒退的迁移,不是一个做一次就能忘掉的决定;它应该按路由逐一做出,而路由层正是让这件事变得成本低廉的东西。

每个所属的地方
• 通用智能体与终端工作 —— GPT-6.1 Sol。在 Terminal-Bench 4.0 上领先十六分,而价格只要一半,这可不是一个差距很小的选择。
• 事实可靠性、检索答案类产品 —— GPT-6.1 Sol,在 AA-Omniscience 上领先近二十分。
• 科学编程 —— 先检查你自己的评测。榜单显示有 2.9 分的下降,而综合分数不会把它反映出来。
• 具有经济价值的知识工作 —— 同样需谨慎。GDPval-AA Elo 回退了 36 分。
• 超过 272,000 个 token 的长上下文检索 —— 选 GPT-5.6 Sol,直到 GPT-6.1 Sol 在该区间有公布数据为止。
• 交互式、对延迟敏感的界面 —— 迁移前先测量。输出更快,但首 token 慢得多。
• 最便宜的非推理调用 —— 两者皆非。该配置在这个系列上已不复存在。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
