
GPT-6.1 Sol Ultrafast 向 API 推出,Codex 和 ChatGPT 工作
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
OpenAI 正在推出 Ultrafast 模式,面向GPT-6.1 Sol——这是它销售的最快服务层级,也是近 Astra Sol 层级首次拥有此类模式。此举将GPT-6.1 Sol与GPT-6 Astra Ultrafast置于同一档位,无论是在 API、Codex 还是 ChatGPT Work 中,并且随附公开价目表而非等待名单:每百万输入 token 12.00 美元,每百万输出 token 60.00 美元,恰好是标准GPT-6.1 Sol费用的六倍。宣传中的速度承诺是“最高 8 倍”。有趣的是这个说法衡量的是什么,而答案并不是你即将付费使用的那个模型。
开发者更新日志中有一条日期为 10 月 8 日的条目:“在 Responses API 中为 GPT-6.1 Sol 添加了 Ultrafast 模式。使用 gpt-6.1-sol 并设置 service_tier: "ultrafast" 以减少生成输出 token 之间的时间间隔。所有 API 用户均可使用,受速率限制约束,采用全球处理,数据驻留于美国和欧盟。”Ultrafast 文档页面现在写着“面向 GPT-6 Astra 和 GPT-6.1 Sol 广泛可用,GPT-5.6 Sol 可预览访问”,ChatGPT 侧的速度页面也证实了订阅相关部分:Ultrafast 可在 Pro $500 的 Codex 和 ChatGPT Work 中,以及符合条件的 Enterprise 和 Edu 计划中使用。
Ultrafast 是一个服务层级,而非第二个模型
权重没有任何变化。相同的检查点,相同的 1,050,000 词元上下文窗口,相同的 922,000 词元最大输入,相同的 128,000 词元输出上限,相同的 2026 年 4 月 30 日知识截止日期,相同的回答。你购买的是一种调度优先级:模型生成 词元 的速度更快,而 OpenAI 自己的措辞刻意保持狭窄——该档位“缩短生成输出词元之间的时间”。它不会让模型更聪明,也不会让思考阶段更短。
这种区别就是整个决策的关键。对于一个连续发起四十次工具调用的智能体循环,收益会不断累积,因为每一轮的输出都能更早到达。而对于一个把大部分实际耗时都花在推敲上的高难度推理请求,你可能要多付六倍的代价,却还是盯着同一个加载转圈。
层级阶梯,用通俗的话说一遍:
• Batch 和 Flex —— 只需 Standard 的一半,是处理无人等待任务的廉价通道
• 标准 — 每百万 token$2.00 输入 / $0.10 缓存 / $2.50 缓存写入 / $10.00 输出
• Fast — 是 Standard 的两倍,或 $4.00 / $0.20 / $5.00 / $20.00;OpenAI 于 2026 年 7 月 30 日将 Priority processing 更名为 Fast 模式
• 超快 — 标准版的六倍,或 $12.00 / $0.60 / $15.00 / $60.00
• 超过 272K 输入 token — 整个请求将按输入和缓存费率的 2 倍、输出费率的 1.5 倍重新计价;Ultrafast 长上下文为 $24.00 / $1.20 / $30.00 / $90.00
没人会写进营销页面的算术
以六倍的价格换取八倍的速度,既不是亏本交易,也不是免费午餐。Ultrafast 按 token 计费,所以一项在 Standard 下花费 1.00 美元的任务,在 Ultrafast 下要花费 6.00 美元——而完成时间大约只要八分之一。节省不在于账单,而在于实际耗时。你多付五美元,是为了消除那项任务七分之八的排队时间,而这究竟是划算还是荒唐,完全取决于在另一端等待的人或流水线每分钟值多少钱。
由此得出两点推论,而它们恰恰是最容易被忽略的:
• 交互式工作是最容易点头的场景。一位开发者盯着 diff 落地,一个 agent 读不到结果就无法继续——在这些场景里,延迟本身就是产品。在一个四十轮的循环中输出快八倍,对人类感知而言并非边际改进;它是「你会拿在手里用的工具」与「被你丢到后台的工具」之间的区别。
• 定时任务和批处理作业是最容易说“不”的。如果一项作业反正要到早上才需要完成,那 Ultrafast 就是白白多付 6 倍的账单,而半价的 Batch 通道就摆在那儿。
缓存输入值得再审视一番,因为它的价格同样会随档位变动:Ultrafast 上为每百万 $0.60,而 Standard 上为 $0.10,仍为未缓存输入费率的 5%。那些每一轮都重发大段系统提示词的提示缓存型智能体将会发现,缓存折扣是随档位同步缩放的,而非让它们免受其影响。

“最高可达 8 倍”这个数字从何而来
这是需要仔细阅读的部分,因为正是在这里,这次发布的标题与它的文档悄无声息地描述着不同的东西。
OpenAI 公布的唯一一项针对特定模型的速度指标,就是这句话:“GPT-6 Astra Ultrafast 在 Codex 中生成 token 的速度最高可达 GPT-6 Astra 在标准模式下的 8 倍。”这是 Astra 的数据,是在 Codex 中测得的。GPT-6.1 Sol 没有对应的已公布倍数。介绍该模型 Ultrafast 的文档称,它会缩短生成输出 token 之间的时间,并指向一张定价表;但文档没有给出具体数字。ChatGPT 侧的速度页面只是重复了 Astra 那句话,随后便没有更多内容。
因此,对“最高提速 8 倍”的诚实解读是:这是该档位的主打宣传语,源自那个自 9 月 29 日起就一直在 Ultrafast 上的同系列模型;而且这是一项厂商宣称,尚无独立第三方对这两个模型中的任何一个进行过复现。对 GPT-6.1 Sol 来说,这很可能确实成立——二者运行在同一套服务栈上,且该档位的机制相同——但 OpenAI 之外还没有人公布过 Sol 变体的每秒 token 数测量结果,而这句话里的“最高”起着实实在在的作用。
此外,按模型把这些层级分开来看也是值得的,因为较旧的那一款仍是一笔未了结的账。Ultrafast 于 2026 年 8 月 13 日发布,面向 GPT-5.6 Sol,宣称“最高比标准处理快 14 倍”,并以有限预览形式提供给部分客户。三个月后,文档中仍写着 GPT-5.6 Sol 拥有“预览权限”,而 Ultrafast 的价目表里只列了两行——GPT-6 Astra 和 GPT-6.1 Sol。一个从未正式可用、也没有公布价格的 14 倍数字,只是一句宣称,而不是一个产品。

到底谁能把它打开?
API 侧的范围很广;订阅侧的范围很窄,这一差异常让人措手不及。
• API — 所有 API 用户均可使用,基于 gpt-6.1-sol,其速率限制与 Standard 和 Fast 分开计算。这意味着你要盯的不只是第二个价格,还有第二份预算。
• GPT-6.1 Sol 的超高速速率限制——在 Build 层级为每分钟 1,000,000 个 token,Launch 为 4,000,000 个,Grow 为 40,000,000 个。OpenAI 于 10 月 6 日将其使用层级从五档简化为三档,因此这三个名称是当前的层级体系,而非遗留旧称。
• 数据驻留 — GPT-6.1 Sol 支持美国和欧盟数据驻留以及全球处理,包括在 Fast 和 Ultrafast 下。Astra 的 Ultrafast 不提供欧盟驻留,因此,如果你的工作负载固定于欧盟,这是你所能购买的首个 Ultrafast 配置。
• Codex 与 ChatGPT Work——超高速功能适用于 Pro 500 美元套餐以及符合条件的 Enterprise 和 Edu 套餐。企业管理员默认将其关闭,需按用户或按工作区手动启用。
• Chat — 不包含在内。GPT-6.1 Sol 本身位于 Work 和 Codex 中;面向消费者的 Chat 界面不在此范围内。
• 订阅情况下的计费方式——包含的用量按标准费率的 8 倍消耗,而购买的额度或 Enterprise 按量付费则按标准费率的 6 倍计费。在让它保持开启之前,这两个数字都值得了解。
一个实现细节决定了你是否能看到任何{{1}}好处{{/1}}。OpenAI 的指导对此很直白:使用 WebSockets,“尤其是对于在短时间内进行大量工具调用的智能体应用”,因为“如果没有持久连接,网络可能会降低延迟收益”。如果你的客户端每次调用都打开一个新的 HTTP 连接,那么每次请求的开销可能会吃掉你支付 6 倍费用所获得的全部优势。HTTP 仍然有效。只是可能不值得这个档位。
我们路由什么,不路由什么
标准层级 GPT-6.1 Sol 已上线 OrcaRouter,模型标识为 openai/gpt-6.1-sol,按供应商自身定价计费:输入每百万 token 2.00 美元、输出每百万 token 10.00 美元,以 0% 加价提供服务——即原厂标价原样透传,因此当 OpenAI 调整费率时,变更在登上价目表的当天就会反映到你的账单中,而不必等到下一次合同续签。同一个密钥和端点可承载 200 多个模型,因此 GPT-6.1 Sol 调用与 Claude 或 Qwen 调用都位于同一套集成之下,具备自动故障转移,且无需第二份合同;当任务需要不止一种意见时,路由 DSL 还能把多个模型组合进一次调用。
Ultrafast 并不属于那些模型,暗示它是也会误导人。它是 OpenAI 账户上的一个服务层级标志——你将 service_tier: "ultrafast"发送给 gpt-6.1-sol,OpenAI 会按上述费率向你自己的账户计费——因此它存在于你直接对接 OpenAI 的集成之中。如果你启用它,请把分层流量留在你的供应商密钥上,并将标准量级的流量通过我们路由。这才是诚实的划分,而且对于任何不等待人工处理的场景来说,它也更便宜。

今天拿它怎么办
如果你在 Pro $500 上拥有 Codex 或 ChatGPT 工作席位,那个开关本来就在,试用除了用量倍数之外不花你一分钱——用两种方式跑同一个任务,看看你实际运行的那个循环是否有足够的轮次让八倍提升显现出来。如果你用的是 API,那么值得做的实验比公告所暗示的要更窄:测量你的延迟中有多少来自 token 生成、多少来自模型思考,然后把 Ultrafast 用在它真正能压缩的那部分上。
而如果在同一个请求上,你可以在 2 倍的 Fast 和 6 倍的 Ultrafast 之间做选择,那么 Fast 是先来到这里的那个档位,也是仅凭一张费率表就能推断其行为的那个。Ultrafast 对这个模型来说是新的,没有任何人的独立测量为它定过价,它的价值一分不多一分不少,全看你自己的秒表怎么说。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
