
GPT-6.1 Sol 正式上线:性能接近 Astra,价格仅为五分之一,距其取代的模型发布仅一周
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 507 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 194 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
OpenAI 于 2026 年 9 月 29 日的 DevDay 2026 主题演讲上发布了 GPT-6.1 Sol——这是对 GPT-6 Sol 档位的更新,该档位恰好在一周前上线,价格没有任何调整,而新模型的矛头则直指一个价格高出五倍的模型。其核心数字与被它取代的模型完全一致:每百万输入 token 2.00 美元,每百万输出 token 10.00 美元。真正发生变动的数字,是大多数智能体工作负载实际支付的那一项:缓存输入从每百万 token 0.20 美元降至 0.10 美元,仅为 GPT-6 Sol 费率的一半、GPT-6 Astra 的十分之一。OpenAI 自己的说法是,GPT-6.1 Sol 在智能体编程、计算机使用和专业工作上的智能“几乎比肩”GPT-6 Astra,而价格只有 Astra 标准 token 价格的五分之一——这是厂商的说法,而非实测结论;截至 9 月 30 日,尚无独立评测机构公布该模型的任何一个分数。接下来,我们将把这两者区分开来。
已发布的内容,以及记录所在的位置

对于 DevDay 的发布来说,这次的文档记录异常详尽。几个小时内,developers.openai.com 上就有了模型页面,还有定价区块、deploymentsafety.openai.com 上的系统卡附录,以及供应商自家公开 API schema 中一条提交,标题为“Add gpt-6.1-sol model to model enums”,时间戳为 9 月 29 日 17:16 UTC。相比之下,OpenAI 的开发者 changelog 仍然止于 9 月 22 日宣布 GPT-6 Sol 和 GPT-6 Luna 的那条记录——6.1 的条目尚未在那里补写,因此模型页面和发布帖是主要记录。这一判定之所以重要,是因为并不存在可供指认的第二代快照:该页面的快照列表只包含一个标识符,gpt-6.1-sol,没有任何带日期的变体,所以你口中的“GPT-6.1 Sol”和你今天调用的部署就是同一个东西。
它的形状,与它所取代的东西并排对比:
• 标识符 — gpt-6.1-sol,单一快照,而 gpt-6-sol 同样没有带日期的变体
• 上下文 — 两者均为 1,050,000 个 token,最大输出 128,000 个 token;6.1 页面明确列出了这两个数字,而 6.0 页面记录的则是 922,000 个 token 的最大输入
• 知识截止日期 — 2026 年 4 月 30 日 vs 2026 年 4 月 20 日
• 推理强度 — low、medium(默认)、high、xhigh、max,且不支持 none 和 minimal vs 同样的档位外加 none
• 定价 — 每百万 token 输入 $2.00 / 缓存 $0.10 / 缓存写入 $2.50 / 输出 $10.00 vs $2.00 / $0.20 / $2.50 / $10.00
• 长提示词 — 输入 token 超过 272K 时,整个请求将按输入和缓存费率的 2 倍、输出费率的 1.5 倍重新计价,两个模型完全相同
• 可用性 — 在 ChatGPT Work 和 Codex 中面向 Plus、Pro、Business、Enterprise 和 Edu 提供,此外还有 API;明确不面向消费级 Chat 产品
• 数据驻留 — 支持美国和欧盟数据驻留,但在欧盟驻留下无法使用快速模式
• 工具 — 网络搜索、文件搜索、图像生成、代码解释器、托管 shell、apply patch、skills、computer use、MCP 和工具搜索,均可通过 Responses API 使用
• 微调 — 两者均不支持
迁移前有一个值得注意的 API 形态:GPT-6.1 Sol 支持 Chat Completions,但工具调用需要 Responses API。在 GPT-6 Sol 上,这一限制则与之相反且相邻——Chat Completions 中的函数调用仅在配合 reasoning_effort: "none" 时才能工作。如果你的技术栈通过 /v1/chat/completions 调用工具,那这是代码变更,而不是模型替换。
基准测试声明,被标记为声明
本节中的每一个数字都来自 OpenAI,发布在发布帖中,而 OpenAI 之外的任何人都尚未复现其中任何一个。它们值得完整阅读,因为贯穿它们的模式是一致的——相较 GPT-6 Sol 的提升是真实的,但传播开来的叙事框架却是与 Astra 的对比,而与 Astra 的对比永远是成本对比。
• DeepSWE v1.1,真实代码库中的复杂软件工程任务——OpenAI 报告称,GPT-6.1 Sol 以约五分之一的成本达到 GPT-6 Astra 的水平,并在更低的推理努力程度和更低的成本下,以 6.4 个百分点的优势超过 GPT-6 Sol 的最佳成绩。
• GDP.pdf,针对复杂 PDF 文档的专业问题——OpenAI 报告称,在所有测试的推理设置下,GPT-6.1 Sol 在带 fallback 时的得分高于 Claude Opus 5.5,而每任务成本不到其一半;并以约五分之一的每任务成本接近 Astra 的最先进结果。
• AutomationBench 1.0.6,跨 47 种工具的多步骤业务工作流——OpenAI 报告称,在中等推理努力程度下比 Claude Opus 5.5 高出 2.2 个百分点,成本约为其三分之一;在同一设置下比 GPT-6 Sol 高出 4.8 个百分点。
• OSWorld 2.0 离线集,长时程计算机使用——OpenAI 报告称,在最高推理努力程度下相比 GPT-6 Sol 提升 7 个百分点,成本不到其一半;并以约七分之一的每任务成本取得了与 Astra 相差 2.1 分以内的结果。
• Terminal-Bench Science 0.1,科学工作流——OpenAI 报告称,在最高努力程度下,GPT-6.1 Sol 的得分是 GPT-6 Sol 的两倍多,而每任务成本不到其一半:平均每任务 5.47 美元,相比之下 Claude Opus 5.5 为 23.21 美元,Astra 为 23.80 美元。OpenAI 还表示,在其测试过的模型中,Astra 仍以 68.1% 保持最高分,最困难的科学工作应使用它——这是一句很有用的、不像营销的话。
• Factuality ——在用户曾标记过某个早期模型错误的去标识化对话中,OpenAI 报告称,在低推理努力程度下,包含事实性错误的回复占比从 11.4% 降至 7.7%,降幅约 32%;在所有测试设置下,其错误率与 Astra 的差距保持在 1.9 个百分点以内,而每任务成本不到其五分之一。
其中两点值得解读。首先,事实性评估所用的提示词是刻意挑选的,因为之前的某个模型在这些提示词上出过错;OpenAI 在博文中也这么说,这意味着 11.4% 和 7.7% 描述的是一个刻意刁难的流量切片,而不是你的流量。其次,对模型最有利的那段文字,是安全附录里关于搜索工具透明度的内容:在那些为在最高推理力度下诱发失败而构建的任务中,GPT-6.1 Sol 有 2.1% 的情况未能告知用户其搜索工具已损坏,而 GPT-6 Sol 为 4.9%,GPT-6 Astra 为 1.5%,GPT-6 Luna 为 28.7%。这类数字决定了一个智能体能否部署,而且这同样又是厂商自己给出的数据。
独立记录是空的,而这就是故事的另一半

Artificial Analysis——本博客视作中立参考的第三方榜单——没有 GPT-6.1 Sol 的收录条目。其针对 6.1 Sol slug 的模型 URL 返回 404,而且该字符串并未出现在实时排行榜的 HTML 中。该榜单确实有的是对 GPT-6 Sol 在最高推理强度下的完整评估:智能指数为 48,每项指数任务成本为 1.06 美元,运行该指数时生成了 7700 万个输出 token,而榜单中位数为 8800 万个,以及编码代理指数为 57,每项任务成本为 2.99 美元。这些数字是 GPT-6.1 Sol 所取代模型最接近的独立锚点,任何关于 6.1 的说法最终都应以它们为衡量依据。
在那一项出现之前,任何拿 6.1 Sol 的分数去对比其他模型的人,都是在用 OpenAI 对比 OpenAI。这并不是怀疑那篇发布文章的理由;真正的理由是,在你改动生产路径之前,先跑一遍自己的评估集。厂商本身就给出了异常具体的指示:OpenAI 告诉已经在使用 GPT-6 Sol 的开发者,在切换之前先查阅迁移指南,而迁移指南则告诉他们,要在具有代表性的任务上比较各种配置,而不是想当然地认为最高档的投入就是最好的权衡。
缓存输入的折扣才是真正影响账单的部分
一份没有变动、缓存费率却减半的价目表很容易被一眼略过,但对任何运行智能体的人来说,这是本次发布中最具影响的一行。每百万 token 0.10 美元的缓存输入价格,是未缓存输入费率的 5%,是 GPT-6 Sol 缓存费率的一半,而且——相比 GPT-6 Astra 每百万 token 1.00 美元的缓存输入——只有这家旗舰的十分之一。那些会成千上万次重发同一稳定前缀的智能体循环,几乎完全依赖这一行。同一个每月 2 亿 token 的智能体用量,在 GPT-6 Sol 上缓存输入大约会计费 40 美元,在 GPT-6.1 Sol 上约为 20 美元;在 GPT-6 Astra 上,同样的缓存流量则是 200 美元。
在生产环境中,这笔账从来不会算得那么干净,因为缓存读取只有在前缀真正命中时才按该费率计费,而 OpenAI 指出,更改推理强度或可用工具集不再像以前那样使缓存条目失效——正是这一悄无声息的修复,才让缓存这一项在智能体循环中真正可用。另一个需要留意的阈值则没有变化:一旦输入 token 超过 272,000,整个请求就会按输入和缓存费率的 2 倍、输出费率的 1.5 倍重新计价。Batch 和 Flex 比标准费率低 50%,快速模式按标准费率的 2 倍计费,而区域处理在可用地区会额外加收 10% 的费用。
哪些内容尚未发布,以及这对路由意味着什么

OpenAI 表示,GPT-6.1 Sol Ultrafast 将在“未来几天”登陆 Codex,token 生成速度最高可提升至 8 倍,但未附价格。这是一个承诺,而不是产品,值得如此定性:如今 6.1 层级还没有 Ultrafast 的价目表,OpenAI 也未说明 8 倍这一数字是相对于标准速度还是快速模式测得,而后者本身定价就是标准价格的 2 倍。把这则公告视为排期信号,等出现具体数字时再为其定价。
说实话,在我们这边:GPT-6.1 Sol 尚未在 OrcaRouter 的路由上。公共目录端点对 openai/gpt-6.1-sol 目前返回“模型未找到”,而我们的 OpenAI 阵容包含 GPT-6 Astra、GPT-6 Sol 和 GPT-6 Luna。目前在 OrcaRouter 上可调用的是 GPT-6 Sol,按 OpenAI 自己的标价、零加价——即 $2.00 / $0.20 / $10.00 的价目表,以及 272K 重新计价规则,完全按供应商所列原样传递。这一点本周比平常更重要,原因很具体:同样的原样传递意味着,如果 OpenAI 下调 6.1 层级的价格,或给 Ultrafast 标上一个数字,这一变化在我们这边上线的时间与在 OpenAI 那边上线是同一天,无需再谈第二份合同。当 6.1 Sol 登陆这些路由时,它会像其他所有模型一样,以供应商的价格出现在 目录 中;而在此之前,诚实的回答是:它取代的那个模型,才是你现在可以调用的模型。
决策的实用版本:如果你已经在用 GPT-6 Sol,而且你的工作负载是缓存密集型、智能体式或长时程的,那么 6.1 更新恰好会改善你正在付费的那些维度,而迁移不过是一次模型字符串变更,再加上(如果你使用工具)从 Chat Completions 到 Responses 的切换。如果你的工作负载是复用很少的短提示生成,那么这个版本对你几乎没有任何改变——相同的输入价格、相同的输出价格、相同的窗口。而如果你一直在等第三方评分再做决定,那么这场等待仍未结束。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
