为 Ultrafast 档位生成的标题卡,主标题为“GPT-6 Astra Ultrafast”,副标题为“六倍速率,每一行皆然”,并带有两个徽章,分别写着“已定价并全面可用”和“快车道并非第二款模型”。
Guides & Insights

GPT-6 Astra Ultrafast 以 6 倍速运行:已公布的费率卡实际会让你付出多少成本

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

GPT-6 Astra Ultrafast 于 2026 年 9 月 29 日结束候补状态。它现在是一个可购买的服务层级,并公布了价格,而这个价格在每一条上都恰好是标准价的六倍。其底层模型——公司旗舰 GPT-6 Astra,于 2026 年 9 月 3 日发布——并未改变;DevDay 上改变的是,其上的快速通道已全面可用,而公司的 API 文档现在明确写道,Ultrafast“已广泛适用于 GPT-6 Astra,并为 GPT-5.6 Sol 提供预览访问”。首次,你可以将这个层级列入预算项,而要填的数字是每百万输入 token 60.00 美元、每百万输出 token 300.00 美元,这是从公司自己的定价页面于 2026 年 9 月 30 日读取的。

这使得它与发布报道所回答的问题截然不同。本周有趣的事实并非这个层级的存在——预览版于2026年8月13日发布,并被铺天盖地地报道过。有趣的事实是,一个原本没有定价的层级如今有了价格,而由此得出的算术结果以一种具体、可量化的方式令人难堪。六倍不是耸耸肩就能消化掉的溢价;它是一种你必须用更少的轮次赚回来的溢价,而你是否能做到,取决于你的工作负载,而非模型本身。

每条线路上都有多个支点,这是首先要明白的。

在 2026 年 9 月 30 日查看 OpenAI 的定价页面时,GPT-6 Astra 的 Ultrafast 列一律是 Standard 列的 6 倍,而不是对某些条目加价、对另一些条目不加价。这一点很重要,因为这意味着你无法通过改变请求的形态来靠优化摆脱它。

• GPT-6 Astra,标准服务,单次请求最高支持 272,000 个输入 token —— 每 100 万 token:输入 $10.00,缓存输入 $1.00,缓存写入 $12.50,输出 $50.00。

• GPT-6 Astra Ultrafast,相同阈值 — 每 100 万 tokens 输入 $60.00、缓存输入 $6.00、缓存写入 $75.00、输出 $300.00。四项均恰好为 6 倍。

• 当输入 token 超过 272,000 时,整个请求将重新计价 — Standard 调整为 $20.00 / $2.00 / $25.00 / $75.00,Ultrafast 调整为 $120.00 / $12.00 / $150.00 / $450.00。仍然是 6 倍。OpenAI 文档中针对 GPT-6 Astra 的长上下文规则是:一旦超过阈值,整个请求的输入和缓存费率均变为 2 倍,输出变为 1.5 倍,并且以相同方式适用于两个档位。

• 同一张卡上的其他层级——Batch 和 Flex 是 Standard 的 50%,而 Fast 模式是 Standard 的 2 倍。因此,这一个模型的倍率阶梯依次为 0.5x、1x、2x、6x,最后两档之间没有中间档位。

Ultrafast 没有与 Batch 对应的版本。Batch 和 Flex 是你在标准通道上以更宽松的调度换来的折扣;快速通道不存在慢速廉价的版本。如果你想要速度,你发送的每个 token 和返回的每个 token 都要支付 6 倍费用,而且任何缓存输入与新鲜输入的组合都无法改善这一比例。

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

一通电话究竟

用两个具体的请求来说明,这个抽象概念就更容易理解了。两者都采用 OpenAI 公布的每百万费率;计算过程则由我们自己完成。

一次调用包含 20,000 个输入 token 和 2,000 token 的回答,在 Standard 上计费为 $0.30 —— 20,000 个 token 按每百万 $10 计算为 $0.20,加上 2,000 个按每百万 $50 计算为 $0.10。同一次调用在 Ultrafast 上计费为 $1.80。正如宣传的那样,正好是六倍。

现在看真正描述 agent 循环的情况:一段 200,000 token 的对话,其中 190,000 token 是缓存前缀,只有 10,000 是新增的,产生一个 1,000 token 的步骤。Standard 对缓存读取计费 $0.19,对新输入计费 $0.10,对输出计费 $0.05——每步 $0.34。Ultrafast 计费 $1.14、$0.60 和 $0.30——每步 $2.04。同样是 6 倍,但看看这种组合带来了什么:缓存是这个模型上最有效的单一成本杠杆,而它在标准通道上依然恰好便宜 6 倍,因此一个大量使用缓存的 agent 从快速层级中按比例获得不了任何好处,也丝毫不能缓和溢价。

真正值得内化的是这个后果。因为倍率是固定的,盈亏平衡点根本与你的 token 组合无关。它完全取决于轮次数。只有在运行 Ultrafast 能将计费轮次数削减到大约六分之一时,它才能在某个工作负载中回本——要么把重试循环压缩成单次通过,要么用一次更快的交互式会话取代一连串简短的澄清调用。如果你的工作负载发出的轮次数与之前相同,只是更快了,那么你就是在以整整 6 倍的价格购买低延迟,别无其他。

速率限制和地理因素是未被明说的上限

有两个约束条件在价格之外,阅读费率表时很容易被忽略。

首先是吞吐量。面向 GPT-6 Astra 的 Ultrafast 已向所有 API 用户开放,但初始速率限制较低:OpenAI 的文档显示,第 1 至第 3 层级为每分钟 500,000 个 token,第 4 层级为 1,000,000 个,第 5 层级为 5,000,000 个。对于一个以速度为卖点的层级而言,这是一个实实在在的上限——在低层级下,以每分钟 50 万个 token 的速率处理 20 万个 token 的智能体上下文,相当于每分钟两个半请求。OpenAI 自己的指南则从另一面指出了同样的问题,强烈推荐使用 WebSockets,正是因为每次请求的网络开销可能会吃掉这一层级所换取的低延迟。

第二项是驻留。Ultrafast 仅支持美国数据驻留和全球处理。它不支持欧盟或其他非美国区域处理端点。如果你的部署依赖 GPT-6 Astra 的欧盟驻留端点,那么无论出价多高,这一层级都不可用,这是一条硬性边界,而不是配置选项。另请注意,对于 2026 年 3 月 5 日或之后发布的模型,驻留端点会加收 10% 费用,而 GPT-6 Astra 就属于此类模型。

速度方面的标题数据从14倍降至8倍

这一点值得仔细说明,因为大多数报道中流传的数字已经过时。OpenAI 的 Ultrafast 文档页面在今日发布的内容中写道:“我们最快的 API 服务层级,速度最高可达标准模式的 8 倍。”GPT-5.6 Sol 于 2026 年 8 月 13 日发布的预览公告曾承诺“比标准处理最高快 14 倍”,并可在 Cerebras 硬件上达到每秒最高 750 个输出 token。

那不是同一个说法,二者的差别与其说是撤回,不如说是换了话题。14 倍这个数字是在有限预览阶段于 GPT-5.6 Sol 上测得的;8 倍这个数字则是 OpenAI 针对当前这一档所公布的,其广泛可用的模型是 GPT-6 Astra。任何基于 Astra 上 14 倍来做预算的人,依据的都是 OpenAI 未针对 Astra 公布过的数字。诚实的解读是:这两个数字都是厂商自报的输出吞吐上限,二者都不能为你的工作负载提供延迟保证,而且端到端时间仍然包括输入处理、工具调用和你自己的编排。把 8 倍当作规划数字,把更好的情况当作意外之喜——要在你自己的流量上验证,而不是想当然。

这个周一怎么办

从这组算术中推导出的决策规则,比营销宣传所暗示的要窄得多,而且值得在有人提议在整个资产版图中启用 Ultrafast 之前,把它白纸黑字地写下来。

在工作负载对延迟敏感且具有交互性、同时有人在等待的场景下启用它。事件分诊、实时的支持升级、分析师在一次连续工作中反复迭代的研究循环——这些正是这样的情形:答案此刻到达而非四分钟后到达,其价值与 token 价格并不成正比,而少数轮次上高出 6 倍的费用,相对于等待者所付出的代价简直微不足道。OpenAI 在预览公告中给出的自家示例恰恰就是这种形态:在故障展开时阅读日志,把通宵的研究循环压缩成一次工作会话。

在吞吐量受限或呈批处理形态的工作负载上,就别开它。每晚的重新索引、批量分类作业、定时报告、数据回填——这些都不在乎墙钟延迟,全都由 token 数量主导,而且它们在 Batch 和 Flex 的同一张价目表上就摆着 0.5 倍的选项。为了更早跑完而支付 12 倍的批处理费率,是这张表里最明显的烧钱方式。

尴尬的中间地带是智能体编码循环,而正是在这里,轮次计数的算术决定了一切。如果这种速度真的消除了重试——如果模型在多文件改动上的首轮通过能更频繁地成功,因为它不必与超时抗争——那么 Ultrafast 按每个完成的任务计算可能更便宜,尽管按 token 计算要贵 6 倍。这是一个关于你自己追踪数据的可测量论断,而非普适论断,而且测量成本很低:统计两个层级上每个已完成任务的计费轮次,再乘以费率。如果这一比率并不接近六,那么快速层级就是在购买延迟,就应该按购买延迟来论证其合理性。

该层级已定价;围绕它的各条路径并非同一个问题

关于如何看待这一点,有一个实用提示:标准服务下的 GPT-6 Astra 已在 OrcaRouter 上线,即 openai/gpt-6-astra,按提供商自己的费率计费——每百万 token 输入 $10.00、输出 $50.00,272K 长上下文档位则为 $20.00 / $75.00——以 0% 加价提供服务,也就是说提供商的标价原样传递,供应商方面的任何价格变动都会在 OpenAI 价目表更新的当天就体现在你的账单上,而不是等到下一次合同续签。同一个密钥可访问 200 多个模型,因此标准层级可以与低价层级或竞争对手的模型共用同一个客户端,而无需第二次集成。

我们不做的,是提供 Ultrafast 层级。它是 OpenAI 账户上的一个服务层级标志,而非可单独路由的模型——你在发往 service_tier: "ultrafast" 的请求中把该标志设为 gpt-6-astra——并且由 OpenAI 按上述费率向你的自有账户计费。如果你启用它,它会存在于你直连 OpenAI 的集成中,而 OrcaRouter 则是承载你与之并行路由的标准层级流量的合适之处。把这一点讲清楚,比暗示一项我们并不具备的能力更有用。

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

决策规则,用一段话说明

六倍是某一档位的价格,而不是某个模型的价格:权重、1,050,000 token 的上下文窗口、128,000 token 的输出上限以及给出的回答,都与标准版 GPT-6 Astra 完全相同。你买到的是最高 8 倍的输出吞吐量,而价目表上每一项都是 6 倍,同时还受制于初期较低的速率限制,以及完全将欧盟排除在外的美国驻留限制。对于正在等待答案的人来说,这笔交易显然划算;对于有半价通道可用的定时批处理任务来说,显然不划算;而对于智能体循环来说则确实难以定论,因为答案取决于速度是否能减少轮次。在做出承诺之前,先在你自己的轨迹上测量轮次数量,其余请求按标价路由。

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新