一张生成的标题卡,标题为“超高速 vs 标准”,副标题为“一个检查点,两种服务层级”,还有两个徽章,分别写着“相同权重,相同答案”和“只有服务路径发生变化”。
Guides & Insights

GPT-6 Astra Ultrafast 与 GPT-6 Astra:同一检查点,六倍速率

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

这是一次罕见的比较,因为比较的双方其实是同一个东西。GPT-6 Astra Ultrafast 不是模型;它是应用于 GPT-6 Astra 的服务层级,而 GPT-6 Astra 是该公司于 2026 年 9 月 3 日发布的旗舰产品,公司文档也直接说明了其机制:你将model设为gpt-6-astra,并添加service_tier: "ultrafast"。不存在单独的模型 ID,不存在单独的检查点,也不存在单独的上下文窗口。因此,一个标题为 GPT-6 Astra Ultrafast vs GPT-6 Astra 的页面不可能成为基准测试论证,因为并没有第二组可供基准测试的权重——而假装有,将会是本周写出误导性文章的最省事方式。

可供比较的内容比一张规格表更窄,也更有用:一张价目表对另一张价目表,一种可用性立场对另一种可用性立场,以及一个实际耗时差异,OpenAI 称其幅度为“最高可达 8 倍”。自 2026 年 9 月 29 日 Ultrafast for GPT-6 Astra 正式可用以来,这次比较的两边终于都附上了价格——而在 8 月该档位还仅限预览时,情况并非如此。这意味着问题的形态已经改变。它不再是“这个档位是否真实存在”,而是“在六倍费率下,我的工作负载必须具备哪些条件,快速通道才算是正确的购买选择。”

有差异的列,以及没有差异的那一列

将两条通道并排放置,几乎每一行在构造上都是相同的。而那些不相同的行,才是本文仅有的内容。

• 检查点——完全相同。GPT-6 Astra Ultrafast 运行的是标准版 GPT-6 Astra 的权重。相同的采样行为,相同的推理行为,对同一提示词在相同努力程度设置下给出相同的答案。

• 上下文、输出与输入——完全相同。两边均为 1,050,000 token 的输入窗口和 128,000 token 的输出上限,支持文本、图像和文件输入、文本输出,且无论哪个层级,知识截止日期均为 2026 年 4 月 30 日。

• 推理控制——完全一致。两端的 effort 档位均涵盖 low、medium、high、xhigh 和 max。该层级改变的是 token 的到达速度,而非模型的思考强度,因此一个 xhigh effort 的 Ultrafast 请求依然是一个 xhigh effort 请求。

• 价目表不同——而这正是整个决定的关键。标准版每 100 万 tokens 计费 $10.00 输入、$1.00 缓存输入、$12.50 缓存写入、$50.00 输出,上限为 272,000 输入 tokens;Ultrafast 则计费 $60.00 / $6.00 / $75.00 / $300.00。超过 272K 后,整个请求重新计价:标准版为 $20.00 / $2.00 / $25.00 / $75.00,Ultrafast 为 $120.00 / $12.00 / $150.00 / $450.00。所有四个计费项、两个上下文区间,都是六倍。

• 访问权限——各不相同。Standard 是默认通道,任何持有 API 密钥的人都可以调用。Ultrafast 曾设有候补名单,现已向所有 API 用户开放,但初期速率限制较低:OpenAI 的文档显示,API 层级 1 至 3 为每分钟 500,000 个 token,层级 4 为 1,000,000 个,层级 5 为 5,000,000 个。

• 地理区域——仅在一个方向上存在差异,因为该限制附加于该层级。Ultrafast 仅支持美国数据驻留和全球处理,不支持欧盟或其他美国境外的区域处理端点;标准通道则没有同等限制。

• 吞吐量——不同,且被表述为上限而非承诺。OpenAI 的 Ultrafast 文档将该档位描述为可提供“比标准模式最高快 8 倍的速度”。

• 基准测试——不是一行。没有什么可填进去的。在两个模型的对比页面上,本该有一张索引表,而这一页两边却是相同的数字,这正是重点所在,而不是数据中的空缺。

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

跨界,做得非常到位

因为倍率是固定的 6 倍,所以决策归结为一个不等式,而它值得被明确写出来,而不是含糊带过。当更早完成所带来的价值超过 token 账单的六倍时,购买 Ultrafast 就是正确的选择。其余都只是注解。

考虑一个具体的情形:一次智能体式执行摄入 100,000 token 的代码库上下文,并产出 5,000 token 的补丁,且代码库内容在多次尝试之间被缓存。在标准服务上,缓存读取计费 $0.10,全新输入计费 $0.10,输出计费 $0.25——每次尝试 $0.45。在 Ultrafast 上,同样的尝试计费为 $0.60、$0.60 和 $1.50——$2.70。差值是每次尝试 $2.25。如果速度只是让每次尝试更快完成,而尝试次数不变,那么你就是为延迟每次尝试支付了 $2.25,而唯一的正当理由就是等待时间的价值。

现在让速度发挥作用。如果更快的通道意味着模型的第一遍就能更常成功,因为它不必与缓慢的往返较劲,而通过次数从三次降到一次,那么标准方案完成该任务花费 1.35 美元,而 Ultrafast 为 2.70 美元。仍然更贵——但只是 2 倍,不是 6 倍,而现在的问题是,这两美元是否值得一次交互周期与一连串交互周期之间的差异。

这是各团队都会跳过的那道算术,而跳过它的诱惑在两头都存在。每一条上都一律按 6 倍计,会让这一档看起来处处昂贵——当它其实能省去轮次时,这种判断就是错的。而“最高 8 倍”的说法又会让它看起来一律便宜——当它并不便宜时,这种判断同样是错的。决定这件事的数字,是每个已完成任务所计费的轮次,在你自己的 trace 上测得,再乘以费率。如果这个比率没有逼近六,那么 Ultrafast 买的就是延迟,就应当按购买延迟来签字批准,并在等待的另一端安排一个具名的人。

“高达8倍”涵盖与不涵盖的内容

公布的速率声明是输出吞吐量的上限,而将吞吐量与延迟混为一谈,是关于这一层级最常见的错误。

吞吐量是指生成一旦运行起来后每秒的 token 数。延迟是发送请求到拿到答案之间的时间。Ultrafast 改善的是前者。OpenAI 自己的文档则把后者指为一个单独的问题,强烈建议为 Ultrafast 使用 WebSockets,正是因为每次请求的网络开销可能侵蚀延迟收益——如果该层级能让往返变得免费,这条建议本就没有必要。墙钟时间里还有两个部分完全在该层级之外:你自己的编排在调用之间花费的时间,以及工具调用在别人的服务器上花费的时间。对于单次长时间生成,吞吐量占了大部分。对于一个二十步的智能体循环,它只占其中一小部分,而这一小部分正是为什么上面的轮次数计算比 8x 这个头条数字更重要。

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

作为参照,请看下面这一档。Fast 模式于 2026 年 7 月 30 日从 Priority processing 更名而来,定价为标准档的 2 倍,文档称其速度最高为标准档的 2.5 倍。Ultrafast 的定价为标准档的 6 倍,文档称其速度最高为标准档的 8 倍。因此,从 Fast 升级到 Ultrafast,是花 3 倍的钱换取约 3.2 倍的速度——近乎线性的交换。相对于标准档的溢价并不是超线性的;它只是很大,而且仅在这一个模型系列上提供。OpenAI 的 Ultrafast 价格表只有一行,即 gpt-6-astra,这意味着该档位是当前旗舰模型的一项能力,而不是整条产品线上通用的服务级别选择。

两个工作负载,一个模型

进行这一比较的最清晰方式,是不要再问 Ultrafast 是否更好,而要开始问你的请求属于两种形态中的哪一种。

第一种形态是一个人在等待。故障正在蔓延时的事件分诊、客户在线等待的支持升级、分析师在一次会话中反复迭代——在这些工作负载中,答案在二十秒而非两分钟内到达,会改变这个人接下来能做什么;而且由于轮次很少,总的 token 账单也很小。相对于那个坐在那里的人的成本,几轮交互的 6 倍费率不过是个舍入误差。这正是该层级显然正确的地方,也正是 OpenAI 自己的预览材料所描述的那种形态。

第二种形态是按计划运行的机器。每晚重建索引、批量分类处理、必须在早上之前准备好的报告、数据回填。这些都无法感知延迟。它们全都由 token 数量主导。而且它们都有一个更好的选择,就在同一张价目表上:Batch 和 Flex,定价为标准价的 50%,即对于最高 272K 的 GPT-6 Astra,每百万输入 $5.00、输出 $25.00。当存在半价通道时,为了让一个无人关注的作业更快完成而支付 6 倍价格,是这张表里最昂贵的错误。

第三种形态是模糊的那种,也是大多数工程团队实际拥有的那种:智能体循环。正是在这里,决定因素的是交叉点算术,而不是经验法则;也正是在这里,测量足够廉价,以至于没有任何猜测的借口——对两条路径上每个已完成任务的轮次进行埋点统计,乘以费率,然后比较总数。GPT-6 Astra 的回答在两边完全相同,因此轮次上的任何差异都是模型耗时长短的差异,而不是其产出内容的差异,这使得它成为一个干净的实验,而不是一个有混杂因素的实验。

购买标准通道

有两点值得分开来看,而“Ultrafast pricing”这个说法恰恰容易把它们混为一谈:该档位的价格与模型本身的价格。标准版 GPT-6 Astra 是一个可路由模型,在 OrcaRouter 上以openai/gpt-6-astra上线,按提供方自己的费率计费——每百万 token 输入 $10.00、缓存输入 $1.00、输出 $50.00,并按文档说明,在输入超过 272,000 token 后步入长上下文档位,变为 $20.00 / $2.00 / $75.00。它以 0% 加价提供服务,这意味着提供方的标价原样传递,供应商调价当天就会反映到你的账单上,而不必等到下一次合同续签;而且同一个密钥还能访问 200 多个其他模型,因此以 Astra 起步的评估可以延伸到竞争对手的模型,而无需再做一次集成。

Ultrafast 层级本身并不是由我们路由的东西,原因在于结构,而非商业层面:它不是一个模型。它是 OpenAI 应用于其自有模型 ID 并计入你账户账单的一种受访问控制的服务层级标志,由调用方按请求启用。因此划分很清晰——如果你开启 Ultrafast,它存在于你与 OpenAI 的直接集成中,而你同时运行的标准层级流量,正是直通网关所擅长处理的那类东西。精确地说明这一边界,比用一段话来暗示快车道可以通过我们获得,要有用得多。

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

底部的线,它比页面短

GPT-6 Astra Ultrafast 与 GPT-6 Astra 是同一个模型,却有两份价目表。这个档位改变的是你拿到答案的快慢,而不是答案本身——相同的权重、相同的 1,050,000 token 上下文窗口、相同的 128,000 token 输出上限、相同的努力程度控制,以及相同的知识截止日期,输出吞吐量最高可达 8 倍,而每一行的价格正好是 6 倍,同时还受制于初期较低的速率限制和仅限美国的数据驻留要求,而标准通道并不附带这些。在有人正等待的场景,或在速度确实能减少计费轮次的场景,就选它;在任务按计划运行、且 Batch 或 Flex 可以以标准费率一半的价格使用的场景,就跳过它;并且要测量轮次数量,而不是凭空假设。这个对比唯一无法告诉你的是哪个模型更好,因为其中从来就只有一个模型。