一张生成的 hero 卡片,标题为“现已在最快档位上线”,副标题为“GPT-6.1 Sol Ultrafast 面向 API、Codex 和 ChatGPT Work 推出”,四个标签分别显示“每 100 万 tokens 12.00 美元 / 60.00 美元”、“6 倍 Standard”、“最高快 8 倍(Astra 测量)”和“API、Codex 和 ChatGPT Work”,下方页脚显示“可用性与价格依据 OpenAI 文档,2026 年 10 月 8 日”。
Guides & Insights

GPT-6.1 Sol Ultrafast 向 API 推出,Codex 和 ChatGPT 工作

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

OpenAI 正在推出 Ultrafast 模式,面向GPT-6.1 Sol——这是它销售的最快服务层级,也是近 Astra Sol 层级首次拥有此类模式。此举将GPT-6.1 Sol与GPT-6 Astra Ultrafast置于同一档位,无论是在 API、Codex 还是 ChatGPT Work 中,并且随附公开价目表而非等待名单:每百万输入 token 12.00 美元,每百万输出 token 60.00 美元,恰好是标准GPT-6.1 Sol费用的六倍。宣传中的速度承诺是“最高 8 倍”。有趣的是这个说法衡量的是什么,而答案并不是你即将付费使用的那个模型。

开发者更新日志中有一条日期为 10 月 8 日的条目:“在 Responses API 中为 GPT-6.1 Sol 添加了 Ultrafast 模式。使用 gpt-6.1-sol 并设置 service_tier: "ultrafast" 以减少生成输出 token 之间的时间间隔。所有 API 用户均可使用,受速率限制约束,采用全球处理,数据驻留于美国和欧盟。”Ultrafast 文档页面现在写着“面向 GPT-6 Astra 和 GPT-6.1 Sol 广泛可用,GPT-5.6 Sol 可预览访问”,ChatGPT 侧的速度页面也证实了订阅相关部分:Ultrafast 可在 Pro $500 的 Codex 和 ChatGPT Work 中,以及符合条件的 Enterprise 和 Edu 计划中使用。

Ultrafast 是一个服务层级,而非第二个模型

权重没有任何变化。相同的检查点,相同的 1,050,000 词元上下文窗口,相同的 922,000 词元最大输入,相同的 128,000 词元输出上限,相同的 2026 年 4 月 30 日知识截止日期,相同的回答。你购买的是一种调度优先级:模型生成 词元 的速度更快,而 OpenAI 自己的措辞刻意保持狭窄——该档位“缩短生成输出词元之间的时间”。它不会让模型更聪明,也不会让思考阶段更短。

这种区别就是整个决策的关键。对于一个连续发起四十次工具调用的智能体循环,收益会不断累积,因为每一轮的输出都能更早到达。而对于一个把大部分实际耗时都花在推敲上的高难度推理请求,你可能要多付六倍的代价,却还是盯着同一个加载转圈。

层级阶梯,用通俗的话说一遍:

• Batch 和 Flex —— 只需 Standard 的一半,是处理无人等待任务的廉价通道

• 标准 — 每百万 token$2.00 输入 / $0.10 缓存 / $2.50 缓存写入 / $10.00 输出

• Fast — 是 Standard 的两倍,或 $4.00 / $0.20 / $5.00 / $20.00;OpenAI 于 2026 年 7 月 30 日将 Priority processing 更名为 Fast 模式

• 超快 — 标准版的六倍,或 $12.00 / $0.60 / $15.00 / $60.00

• 超过 272K 输入 token — 整个请求将按输入和缓存费率的 2 倍、输出费率的 1.5 倍重新计价;Ultrafast 长上下文为 $24.00 / $1.20 / $30.00 / $90.00

没人会写进营销页面的算术

以六倍的价格换取八倍的速度,既不是亏本交易,也不是免费午餐。Ultrafast 按 token 计费,所以一项在 Standard 下花费 1.00 美元的任务,在 Ultrafast 下要花费 6.00 美元——而完成时间大约只要八分之一。节省不在于账单,而在于实际耗时。你多付五美元,是为了消除那项任务七分之八的排队时间,而这究竟是划算还是荒唐,完全取决于在另一端等待的人或流水线每分钟值多少钱。

由此得出两点推论,而它们恰恰是最容易被忽略的:

• 交互式工作是最容易点头的场景。一位开发者盯着 diff 落地,一个 agent 读不到结果就无法继续——在这些场景里,延迟本身就是产品。在一个四十轮的循环中输出快八倍,对人类感知而言并非边际改进;它是「你会拿在手里用的工具」与「被你丢到后台的工具」之间的区别。

• 定时任务和批处理作业是最容易说“不”的。如果一项作业反正要到早上才需要完成,那 Ultrafast 就是白白多付 6 倍的账单,而半价的 Batch 通道就摆在那儿。

缓存输入值得再审视一番,因为它的价格同样会随档位变动:Ultrafast 上为每百万 $0.60,而 Standard 上为 $0.10,仍为未缓存输入费率的 5%。那些每一轮都重发大段系统提示词的提示缓存型智能体将会发现,缓存折扣是随档位同步缩放的,而非让它们免受其影响。

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing two rows: gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens short-context, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, and gpt-6.1-sol at $12.00 / $0.60 / $15.00 / $60.00 short-context stepping to $24.00 / $1.20 / $30.00 / $90.00, alongside the page's notes that regional processing endpoints carry a 10% uplift, that FedRAMP endpoints carry a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

“最高可达 8 倍”这个数字从何而来

这是需要仔细阅读的部分,因为正是在这里,这次发布的标题与它的文档悄无声息地描述着不同的东西。

OpenAI 公布的唯一一项针对特定模型的速度指标,就是这句话:“GPT-6 Astra Ultrafast 在 Codex 中生成 token 的速度最高可达 GPT-6 Astra 在标准模式下的 8 倍。”这是 Astra 的数据,是在 Codex 中测得的。GPT-6.1 Sol 没有对应的已公布倍数。介绍该模型 Ultrafast 的文档称,它会缩短生成输出 token 之间的时间,并指向一张定价表;但文档没有给出具体数字。ChatGPT 侧的速度页面只是重复了 Astra 那句话,随后便没有更多内容。

因此,对“最高提速 8 倍”的诚实解读是:这是该档位的主打宣传语,源自那个自 9 月 29 日起就一直在 Ultrafast 上的同系列模型;而且这是一项厂商宣称,尚无独立第三方对这两个模型中的任何一个进行过复现。对 GPT-6.1 Sol 来说,这很可能确实成立——二者运行在同一套服务栈上,且该档位的机制相同——但 OpenAI 之外还没有人公布过 Sol 变体的每秒 token 数测量结果,而这句话里的“最高”起着实实在在的作用。

此外,按模型把这些层级分开来看也是值得的,因为较旧的那一款仍是一笔未了结的账。Ultrafast 于 2026 年 8 月 13 日发布,面向 GPT-5.6 Sol,宣称“最高比标准处理快 14 倍”,并以有限预览形式提供给部分客户。三个月后,文档中仍写着 GPT-5.6 Sol 拥有“预览权限”,而 Ultrafast 的价目表里只列了两行——GPT-6 Astra 和 GPT-6.1 Sol。一个从未正式可用、也没有公布价格的 14 倍数字,只是一句宣称,而不是一个产品。

A screenshot of OpenAI's Ultrafast mode documentation page, showing the sentence 'Ultrafast mode is the fastest service tier in the OpenAI API', the availability sentence naming broad availability for GPT-6 Astra and GPT-6.1 Sol with preview access for GPT-5.6 Sol, the statement that Ultrafast mode for GPT-6 Astra and GPT-6.1 Sol is available to all API users, the recommendation to use WebSockets because network overhead without a persistent connection can reduce the latency gains, the note that Ultrafast has separate rate limits from Standard and Fast modes, the GPT-6.1 Sol rate-limit row reading 1,000,000 / 4,000,000 / 40,000,000 tokens per minute and 5,000 / 20,000 / 200,000 requests per minute, the line that GPT-6.1 Sol supports US and EU data residency and global processing, and a code sample setting service_tier to 'ultrafast' with model 'gpt-6.1-sol'.

到底谁能把它打开?

API 侧的范围很广;订阅侧的范围很窄,这一差异常让人措手不及。

• API — 所有 API 用户均可使用,基于 gpt-6.1-sol,其速率限制与 Standard 和 Fast 分开计算。这意味着你要盯的不只是第二个价格,还有第二份预算。

• GPT-6.1 Sol 的超高速速率限制——在 Build 层级为每分钟 1,000,000 个 token,Launch 为 4,000,000 个,Grow 为 40,000,000 个。OpenAI 于 10 月 6 日将其使用层级从五档简化为三档,因此这三个名称是当前的层级体系,而非遗留旧称。

• 数据驻留 — GPT-6.1 Sol 支持美国和欧盟数据驻留以及全球处理,包括在 Fast 和 Ultrafast 下。Astra 的 Ultrafast 不提供欧盟驻留,因此,如果你的工作负载固定于欧盟,这是你所能购买的首个 Ultrafast 配置。

• Codex 与 ChatGPT Work——超高速功能适用于 Pro 500 美元套餐以及符合条件的 Enterprise 和 Edu 套餐。企业管理员默认将其关闭,需按用户或按工作区手动启用。

• Chat — 不包含在内。GPT-6.1 Sol 本身位于 Work 和 Codex 中;面向消费者的 Chat 界面不在此范围内。

• 订阅情况下的计费方式——包含的用量按标准费率的 8 倍消耗,而购买的额度或 Enterprise 按量付费则按标准费率的 6 倍计费。在让它保持开启之前,这两个数字都值得了解。

一个实现细节决定了你是否能看到任何{{1}}好处{{/1}}。OpenAI 的指导对此很直白:使用 WebSockets,“尤其是对于在短时间内进行大量工具调用的智能体应用”,因为“如果没有持久连接,网络可能会降低延迟收益”。如果你的客户端每次调用都打开一个新的 HTTP 连接,那么每次请求的开销可能会吃掉你支付 6 倍费用所获得的全部优势。HTTP 仍然有效。只是可能不值得这个档位。

我们路由什么,不路由什么

标准层级 GPT-6.1 Sol 已上线 OrcaRouter,模型标识为 openai/gpt-6.1-sol,按供应商自身定价计费:输入每百万 token 2.00 美元、输出每百万 token 10.00 美元,以 0% 加价提供服务——即原厂标价原样透传,因此当 O​penAI 调整费率时,变更在登上价目表的当天就会反映到你的账单中,而不必等到下一次合同续签。同一个密钥和端点可承载 200 多个模型,因此 GPT-6.1 Sol 调用与 Claude 或 Q​wen 调用都位于同一套集成之下,具备自动故障转移,且无需第二份合同;当任务需要不止一种意见时,路由 DSL 还能把多个模型组合进一次调用。

Ultrafast 并不属于那些模型,暗示它是也会误导人。它是 OpenAI 账户上的一个服务层级标志——你将 service_tier: "ultrafast"发送给 gpt-6.1-sol,OpenAI 会按上述费率向你自己的账户计费——因此它存在于你直接对接 OpenAI 的集成之中。如果你启用它,请把分层流量留在你的供应商密钥上,并将标准量级的流量通过我们路由。这才是诚实的划分,而且对于任何不等待人工处理的场景来说,它也更便宜。

A screenshot of the OrcaRouter model page for GPT-6.1 Sol, model id openai/gpt-6.1-sol, showing a 1M-token context window, 128K maximum output, text, image and file input with text output, vision, tools, JSON and reasoning capabilities, public benchmarks attributed to OpenAI dated 2026-09-29, input price $2.00 and output price $10.00 per 1M tokens, p50 time to first token 6.14 s, a 10.00 s figure, and 313.9M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

今天拿它怎么办

如果你在 Pro $500 上拥有 Codex 或 ChatGPT 工作席位,那个开关本来就在,试用除了用量倍数之外不花你一分钱——用两种方式跑同一个任务,看看你实际运行的那个循环是否有足够的轮次让八倍提升显现出来。如果你用的是 API,那么值得做的实验比公告所暗示的要更窄:测量你的延迟中有多少来自 token 生成、多少来自模型思考,然后把 Ultrafast 用在它真正能压缩的那部分上。

而如果在同一个请求上,你可以在 2 倍的 Fast 和 6 倍的 Ultrafast 之间做选择,那么 Fast 是先来到这里的那个档位,也是仅凭一张费率表就能推断其行为的那个。Ultrafast 对这个模型来说是新的,没有任何人的独立测量为它定过价,它的价值一分不多一分不少,全看你自己的秒表怎么说。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新