一个生成的双列对比计分板,标题为 GPT-6.1 Sol vs GPT-6 Sol — 计分板。
左列 GPT-6.1 Sol:各行内容为 发布日期:2026年9月29日、输入:每 1M $2.00、缓存输入:每 1M $0.10、上下文:1,050,000 个 token、推理:不支持 none、厂商峰值:DeepSWE +6.4 分。
右列 GPT-6 Sol:各行内容为 发布日期:2026年9月22日、输入:每 1M $2.00、缓存输入:每 1M $0.20、上下文:1,050,000 个 token、推理:支持 none、厂商峰值:基线。
页脚内容为 OpenAI 数据由厂商报告;截至 2026年9月30日,两款模型均无独立评分发布。
Guides & Insights

GPT-6.1 Sol 与 GPT-6 Sol:多一周的工作换来了什么,又没换来什么

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

如果你已把GPT-6 Sol如今投入生产环境,并且正在试图决定 GPT-6.1 Sol 是否值得迁移,那么答案完全取决于你的哪一项成本更大——而这两个模型的构建方式使得答案几乎从来不会是“两者皆是”。GPT-6 Sol 于 2026 年 9 月 22 日发布,价格为每百万输入 token 2.00 美元、缓存 0.20 美元、输出 10.00 美元。GPT-6.1 Sol 于 2026 年 9 月 29 日发布,价格为输入 2.00 美元、缓存 0.10 美元、输出 10.00 美元,并在更低推理投入下,在复杂软件工程任务上实现了厂商报告的 6.4 个百分点提升。输入和输出价格没有变化。缓存费率减半。唯一改变的那一行就是整个财务论证,而其他一切都是能力层面的论证;在本次发布的这个阶段,这些论证恰好来自一个来源。

有三件事发生了变化。其中一件是一项法案。

剥去营销成分后,这两个部署之间的差值短到能装进你脑子里。

• 缓存输入 — 在 GPT-6.1 Sol 上为每百万 token 0.10 美元,而 GPT-6 Sol 上为 0.20 美元。实测而非声称,也是唯一一个能以算术形式体现出来的变化。
• 厂商所述的能力 — OpenAI 报告称,在更低的推理投入和成本下,DeepSWE v1.1 上领先 6.4 个百分点;在最高投入下,Terminal-Bench Science 0.1 上的得分提高一倍以上;在最高投入下,OSWorld 2.0 离线集上领先七个百分点;在中等投入下,AutomationBench 上领先 4.8 个百分点;在刻意诱发错误的提示集上,事实错误率从 11.4% 降至 7.7%。所有这些均未获复现。
• 推理阶梯 — GPT-6.1 Sol 支持 low、medium、high、xhigh 和 max,但不支持 none;GPT-6 Sol 则六者全支持。正是这一差异会破坏代码,而它也是没人会写进发布稿里的那一个。

其余一切要么完全相同,要么几乎无异:同样是 1,050,000 个 token 的上下文窗口,同样是 128,000 个 token 的输出上限,同样是 2.50 美元的缓存写入费率,同样是 272K 个 token 的重新定价阈值——超过该阈值后,整个请求的输入和缓存按 2 倍计费、输出按 1.5 倍计费,工具调用同样要求使用 Responses-API,也同样不支持微调。知识截止点从 4 月 20 日移至 2026 年 4 月 30 日——十天,正是那种能说明这更多是一次改装而非重建的数字。

为什么缓存行的价值比看起来更高

A screenshot of OpenAI's developer model page for GPT-6.1 Sol showing the pricing block with input at $2.00, cached input at $0.10, cache writes at $2.50 and output at $10.00 per million tokens, the note that cached input tokens are priced at 5% of the uncached rate, the 272K-token repricing rule, and a 1,050,000-token context window with 128,000 max output tokens.

缓存读取价格减半,拿来作为一次产品更新的主打亮点,乍看有些奇怪——直到你看清 agent 流量到底是什么样子。一个 agent 循环会在每一轮重新发送一段稳定的前缀——系统提示词、工具 schema、检索到的上下文、对话历史——而在一次长会话中,同一段前缀会被计费几十次甚至上百次。正是在这种流量里,缓存命中率不再是账单上的零头,而成了发票上最主导的那一行。

算一笔账:单个长时间运行的智能体会话。假设一个 12 万 token 的前缀在 40 轮对话中复用,那么每个会话就是 480 万个缓存输入 token,再加上 15 万个新增输出 token,量并不大。在 GPT-6 Sol 上,缓存读取计费 0.96 美元,输出计费 1.50 美元——每个会话大约 2.46 美元。在 GPT-6.1 Sol 上,同一个会话的缓存读取计费 0.48 美元,输出同样是 1.50 美元:约 1.98 美元。单个会话相差 48 美分,这不足以成为决策依据。可要是把它乘以每月十万个会话,就是 48,000 美元——这就足以成为依据了。

有两个前提才能让这个说法站得住脚。缓存读取只有在前缀真正命中时才按缓存价格计费,所以你实际省下的钱等于命中率乘以差价,而不是差价本身。而且前缀必须低于 272,000 个 token,标准价格才有可能适用:一旦越过这条线,整个请求都会按输入和缓存 2 倍、输出 1.5 倍重新计价,这足以吞掉前缀上省下的区区 10 美分。长上下文会话恰恰是缓存账最不可能像宣传册上写得那么漂亮的情形。

基准差距是真实存在的,而且它只源于一处

OpenAI 的发布帖对其评估异常具体,这是它的一大优点;而那些数字每一个都是厂商在给自己的模型打分,这则是它的缺点。它们之间的模式始终一致:真正流传开来的对比总是与 GPT-6 Astra 进行,而 Astra 对比又总是成本对比。在 DeepSWE v1.1 上,其说法是以大约五分之一的成本达到与 Astra 相当的水平。在 GDP.pdf 上,其说法是以每任务约五分之一的成本接近 Astra 的最先进水平。在 OSWorld 2.0 上,其说法是每任务成本约为七分之一的情况下,与 Astra 相差 2.1 分以内。在事实性上,其说法是每任务成本不到五分之一的情况下,与 Astra 相差 1.9 分以内。这不是起草时的偶然,而是产品主张,并且是一个关于价格、而非关于能力领先的主张。

OpenAI唯一一次推翻自己的说法,值得肯定:在Terminal-Bench Science 0.1上,它直言GPT-6 Astra在受测模型中仍以68.1%保持最高分,应被用于最困难的科学研究。一篇会告诉你何时该买更贵那款的发布文,多少还是有点自律的。

具体到 GPT-6 Sol,这个比较的诚实状态是这样的——在这个配置下,两个模型都没有独立的评分。Artificial Analysis 对 GPT-6 Sol 在最高推理努力下做了完整评估:智能指数 48,每项指数任务 1.06 美元,生成输出 token 数为 7700 万,而榜单中位数为 8800 万,Coding Agent Index 为 57,每项任务 2.99 美元。截至 9 月 30 日,它完全没有 GPT-6.1 Sol 的条目;该模型的 slug 返回 404,这个字符串也没有出现在实时排行榜上。因此,今天唯一可用的、经过实测的第三方比较,是 GPT-6 Sol 与其他实验室的模型之间的比较——而不是 GPT-6 Sol 与其自身后继者之间的比较。现在任何人给你看的 6.1 对 6.0 图表,展示的都是 OpenAI 的幻灯片。

迁移只是一次字符串变更,除非情况并非如此。

在你切换标识符之前,OpenAI 自己为 GPT-6 系列提供的迁移指南值得一读,因为其中有两项内容会破坏正常运行的代码。第一项是推理阶梯:如果任何请求发送 reasoning_effort: "none",GPT-6.1 Sol 会拒绝它,而文档给出的补救措施是从 low 起步,并在代表性任务上进行比较,而不是想当然地认为最低设置是等效的。那些把 none 用作延迟基线的流程会失去这一基线。第二项是工具调用:GPT-6.1 Sol 支持 Chat Completions,但不支持通过它进行工具调用——工具需要借助 Responses API。如果你的技术栈在 /v1/chat/completions 上调用函数,那么你要做的不是替换一个字符串,而是移植一个端点。厂商对已经使用 GPT-6 Sol 的开发者给出的指示是:在切换之前先审阅该指南,这清楚地表明,这并非一周时间差所暗示的那种即插即用式更新。

其余参数的表现一致:reasoning effort、结构化输出、流式传输、提示缓存和工具集都会一并沿用,而且同一条 272K 重新定价规则对两个模型完全相同地适用。model设为 gpt-6.1-sol,在 effort 设置原本受支持的地方保留该设置,并移除 temperature、top_p和 top_logprobs,只要 effort 不为 none——最后这一点对两个模型都适用,也是任何推理模型迁移后出现 400 错误的常见根源。

在不拿生产路径冒险的情况下进行迁移

A screenshot of the OrcaRouter model page for GPT-6 Sol (openai/gpt-6-sol) showing the header 'by OpenAI - 2026-09-22', capability tags for vision, tools, JSON and reasoning, a 1,050,000-token context window with 128,000 maximum output tokens, a standard tier reading $2.00 input and $10.00 output per million tokens with $0.20 cached input, and a long-prompt tier reading $4.00 input and $15.00 output.

现实的迁移不是一次切换,而是一次影子运行:把一部分生产流量发送到新的标识符,让旧的作为实际应答的路径,并用自己的任务去做对比。这是一个路由问题,而且正是在这里,你所借以调用的平台会改变工作的形态。OrcaRouter 今天以 OpenAI 自己的标价、零加价提供 GPT-6 Sol——$2.00 / $0.20 / $10.00 的价目表,包含 272K 重新定价规则——因此对比中的基线臂与其他一切共享同一个密钥即可运行,而 6.1 臂只要可调用就能加入路由集合,无需第二份合同或第二个 SDK。在那之前,诚实的说法是:GPT-6 Sol 是当前可以调用的模型,这一点值得直说,而不是暗示其他:openai/gpt-6.1-sol今天在我们的公开 catalogue 端点返回 "model not found"。自动故障转移正是让影子运行在它真正落地时保持安全的东西——如果新路由出错,请求会在旧路由上完成,而你是从日志里、而不是从用户那里得知的。

现在该行动的是:成本主要由长智能体会话中的缓存输入主导的团队,以及工作流已在用 Responses API、且从不发送 none 的团队。对他们而言,这近乎一次免费升级——厂商报告了能力增益,缓存费率减半,而迁移只需改一个字符串。谁该等待:在延迟关键路径中带有 none 的团队,工具调用走 Chat Completions 的团队,以及任何在正式采用之前需要一份来自 OpenAI 之外的数据的人。对最后一类人来说,这场等待没有公布结束日期,而这段时间里明智的做法,是构建这场对比将会需要的评估集——因为当独立评分到来时,它针对的将是别人的流量。

A generated summary card titled 'What changed in one week' with five rows reading 'Cached input: $0.20 to $0.10 per 1M', 'DeepSWE v1.1: +6.4 points, vendor-reported', 'Terminal-Bench Science: more than doubled, vendor-reported', 'Context window: unchanged at 1,050,000', 'Input and output price: unchanged at $2.00 / $10.00', and a footer reading 'Vendor-reported figures only; no independent evaluation of GPT-6.1 Sol existed as of September 30, 2026.'

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新