
GPT-6 Astra Ultrafast 以 6 倍速运行:已公布的费率卡实际会让你付出多少成本
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 349 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 210 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
GPT-6 Astra Ultrafast 于 2026 年 9 月 29 日结束候补状态。它现在是一个可购买的服务层级,并公布了价格,而这个价格在每一条上都恰好是标准价的六倍。其底层模型——公司旗舰 GPT-6 Astra,于 2026 年 9 月 3 日发布——并未改变;DevDay 上改变的是,其上的快速通道已全面可用,而公司的 API 文档现在明确写道,Ultrafast“已广泛适用于 GPT-6 Astra,并为 GPT-5.6 Sol 提供预览访问”。首次,你可以将这个层级列入预算项,而要填的数字是每百万输入 token 60.00 美元、每百万输出 token 300.00 美元,这是从公司自己的定价页面于 2026 年 9 月 30 日读取的。
这使得它与发布报道所回答的问题截然不同。本周有趣的事实并非这个层级的存在——预览版于2026年8月13日发布,并被铺天盖地地报道过。有趣的事实是,一个原本没有定价的层级如今有了价格,而由此得出的算术结果以一种具体、可量化的方式令人难堪。六倍不是耸耸肩就能消化掉的溢价;它是一种你必须用更少的轮次赚回来的溢价,而你是否能做到,取决于你的工作负载,而非模型本身。
每条线路上都有多个支点,这是首先要明白的。
在 2026 年 9 月 30 日查看 OpenAI 的定价页面时,GPT-6 Astra 的 Ultrafast 列一律是 Standard 列的 6 倍,而不是对某些条目加价、对另一些条目不加价。这一点很重要,因为这意味着你无法通过改变请求的形态来靠优化摆脱它。
• GPT-6 Astra,标准服务,单次请求最高支持 272,000 个输入 token —— 每 100 万 token:输入 $10.00,缓存输入 $1.00,缓存写入 $12.50,输出 $50.00。
• GPT-6 Astra Ultrafast,相同阈值 — 每 100 万 tokens 输入 $60.00、缓存输入 $6.00、缓存写入 $75.00、输出 $300.00。四项均恰好为 6 倍。
• 当输入 token 超过 272,000 时,整个请求将重新计价 — Standard 调整为 $20.00 / $2.00 / $25.00 / $75.00,Ultrafast 调整为 $120.00 / $12.00 / $150.00 / $450.00。仍然是 6 倍。OpenAI 文档中针对 GPT-6 Astra 的长上下文规则是:一旦超过阈值,整个请求的输入和缓存费率均变为 2 倍,输出变为 1.5 倍,并且以相同方式适用于两个档位。
• 同一张卡上的其他层级——Batch 和 Flex 是 Standard 的 50%,而 Fast 模式是 Standard 的 2 倍。因此,这一个模型的倍率阶梯依次为 0.5x、1x、2x、6x,最后两档之间没有中间档位。
Ultrafast 没有与 Batch 对应的版本。Batch 和 Flex 是你在标准通道上以更宽松的调度换来的折扣;快速通道不存在慢速廉价的版本。如果你想要速度,你发送的每个 token 和返回的每个 token 都要支付 6 倍费用,而且任何缓存输入与新鲜输入的组合都无法改善这一比例。

一通电话究竟
用两个具体的请求来说明,这个抽象概念就更容易理解了。两者都采用 OpenAI 公布的每百万费率;计算过程则由我们自己完成。
一次调用包含 20,000 个输入 token 和 2,000 token 的回答,在 Standard 上计费为 $0.30 —— 20,000 个 token 按每百万 $10 计算为 $0.20,加上 2,000 个按每百万 $50 计算为 $0.10。同一次调用在 Ultrafast 上计费为 $1.80。正如宣传的那样,正好是六倍。
现在看真正描述 agent 循环的情况:一段 200,000 token 的对话,其中 190,000 token 是缓存前缀,只有 10,000 是新增的,产生一个 1,000 token 的步骤。Standard 对缓存读取计费 $0.19,对新输入计费 $0.10,对输出计费 $0.05——每步 $0.34。Ultrafast 计费 $1.14、$0.60 和 $0.30——每步 $2.04。同样是 6 倍,但看看这种组合带来了什么:缓存是这个模型上最有效的单一成本杠杆,而它在标准通道上依然恰好便宜 6 倍,因此一个大量使用缓存的 agent 从快速层级中按比例获得不了任何好处,也丝毫不能缓和溢价。
真正值得内化的是这个后果。因为倍率是固定的,盈亏平衡点根本与你的 token 组合无关。它完全取决于轮次数。只有在运行 Ultrafast 能将计费轮次数削减到大约六分之一时,它才能在某个工作负载中回本——要么把重试循环压缩成单次通过,要么用一次更快的交互式会话取代一连串简短的澄清调用。如果你的工作负载发出的轮次数与之前相同,只是更快了,那么你就是在以整整 6 倍的价格购买低延迟,别无其他。
速率限制和地理因素是未被明说的上限
有两个约束条件在价格之外,阅读费率表时很容易被忽略。
首先是吞吐量。面向 GPT-6 Astra 的 Ultrafast 已向所有 API 用户开放,但初始速率限制较低:OpenAI 的文档显示,第 1 至第 3 层级为每分钟 500,000 个 token,第 4 层级为 1,000,000 个,第 5 层级为 5,000,000 个。对于一个以速度为卖点的层级而言,这是一个实实在在的上限——在低层级下,以每分钟 50 万个 token 的速率处理 20 万个 token 的智能体上下文,相当于每分钟两个半请求。OpenAI 自己的指南则从另一面指出了同样的问题,强烈推荐使用 WebSockets,正是因为每次请求的网络开销可能会吃掉这一层级所换取的低延迟。
第二项是驻留。Ultrafast 仅支持美国数据驻留和全球处理。它不支持欧盟或其他非美国区域处理端点。如果你的部署依赖 GPT-6 Astra 的欧盟驻留端点,那么无论出价多高,这一层级都不可用,这是一条硬性边界,而不是配置选项。另请注意,对于 2026 年 3 月 5 日或之后发布的模型,驻留端点会加收 10% 费用,而 GPT-6 Astra 就属于此类模型。
速度方面的标题数据从14倍降至8倍
这一点值得仔细说明,因为大多数报道中流传的数字已经过时。OpenAI 的 Ultrafast 文档页面在今日发布的内容中写道:“我们最快的 API 服务层级,速度最高可达标准模式的 8 倍。”GPT-5.6 Sol 于 2026 年 8 月 13 日发布的预览公告曾承诺“比标准处理最高快 14 倍”,并可在 Cerebras 硬件上达到每秒最高 750 个输出 token。
那不是同一个说法,二者的差别与其说是撤回,不如说是换了话题。14 倍这个数字是在有限预览阶段于 GPT-5.6 Sol 上测得的;8 倍这个数字则是 OpenAI 针对当前这一档所公布的,其广泛可用的模型是 GPT-6 Astra。任何基于 Astra 上 14 倍来做预算的人,依据的都是 OpenAI 未针对 Astra 公布过的数字。诚实的解读是:这两个数字都是厂商自报的输出吞吐上限,二者都不能为你的工作负载提供延迟保证,而且端到端时间仍然包括输入处理、工具调用和你自己的编排。把 8 倍当作规划数字,把更好的情况当作意外之喜——要在你自己的流量上验证,而不是想当然。
这个周一怎么办
从这组算术中推导出的决策规则,比营销宣传所暗示的要窄得多,而且值得在有人提议在整个资产版图中启用 Ultrafast 之前,把它白纸黑字地写下来。
在工作负载对延迟敏感且具有交互性、同时有人在等待的场景下启用它。事件分诊、实时的支持升级、分析师在一次连续工作中反复迭代的研究循环——这些正是这样的情形:答案此刻到达而非四分钟后到达,其价值与 token 价格并不成正比,而少数轮次上高出 6 倍的费用,相对于等待者所付出的代价简直微不足道。OpenAI 在预览公告中给出的自家示例恰恰就是这种形态:在故障展开时阅读日志,把通宵的研究循环压缩成一次工作会话。
在吞吐量受限或呈批处理形态的工作负载上,就别开它。每晚的重新索引、批量分类作业、定时报告、数据回填——这些都不在乎墙钟延迟,全都由 token 数量主导,而且它们在 Batch 和 Flex 的同一张价目表上就摆着 0.5 倍的选项。为了更早跑完而支付 12 倍的批处理费率,是这张表里最明显的烧钱方式。
尴尬的中间地带是智能体编码循环,而正是在这里,轮次计数的算术决定了一切。如果这种速度真的消除了重试——如果模型在多文件改动上的首轮通过能更频繁地成功,因为它不必与超时抗争——那么 Ultrafast 按每个完成的任务计算可能更便宜,尽管按 token 计算要贵 6 倍。这是一个关于你自己追踪数据的可测量论断,而非普适论断,而且测量成本很低:统计两个层级上每个已完成任务的计费轮次,再乘以费率。如果这一比率并不接近六,那么快速层级就是在购买延迟,就应该按购买延迟来论证其合理性。
该层级已定价;围绕它的各条路径并非同一个问题
关于如何看待这一点,有一个实用提示:标准服务下的 GPT-6 Astra 已在 OrcaRouter 上线,即 openai/gpt-6-astra,按提供商自己的费率计费——每百万 token 输入 $10.00、输出 $50.00,272K 长上下文档位则为 $20.00 / $75.00——以 0% 加价提供服务,也就是说提供商的标价原样传递,供应商方面的任何价格变动都会在 OpenAI 价目表更新的当天就体现在你的账单上,而不是等到下一次合同续签。同一个密钥可访问 200 多个模型,因此标准层级可以与低价层级或竞争对手的模型共用同一个客户端,而无需第二次集成。
我们不做的,是提供 Ultrafast 层级。它是 OpenAI 账户上的一个服务层级标志,而非可单独路由的模型——你在发往 service_tier: "ultrafast" 的请求中把该标志设为 gpt-6-astra——并且由 OpenAI 按上述费率向你的自有账户计费。如果你启用它,它会存在于你直连 OpenAI 的集成中,而 OrcaRouter 则是承载你与之并行路由的标准层级流量的合适之处。把这一点讲清楚,比暗示一项我们并不具备的能力更有用。

决策规则,用一段话说明
六倍是某一档位的价格,而不是某个模型的价格:权重、1,050,000 token 的上下文窗口、128,000 token 的输出上限以及给出的回答,都与标准版 GPT-6 Astra 完全相同。你买到的是最高 8 倍的输出吞吐量,而价目表上每一项都是 6 倍,同时还受制于初期较低的速率限制,以及完全将欧盟排除在外的美国驻留限制。对于正在等待答案的人来说,这笔交易显然划算;对于有半价通道可用的定时批处理任务来说,显然不划算;而对于智能体循环来说则确实难以定论,因为答案取决于速度是否能减少轮次。在做出承诺之前,先在你自己的轨迹上测量轮次数量,其余请求按标价路由。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
