
GPT-6 Astra Ultrafast 与 GPT-6 Astra:同一检查点,六倍速率
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 349 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 208 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
这是一次罕见的比较,因为比较的双方其实是同一个东西。GPT-6 Astra Ultrafast 不是模型;它是应用于 GPT-6 Astra 的服务层级,而 GPT-6 Astra 是该公司于 2026 年 9 月 3 日发布的旗舰产品,公司文档也直接说明了其机制:你将model设为gpt-6-astra,并添加service_tier: "ultrafast"。不存在单独的模型 ID,不存在单独的检查点,也不存在单独的上下文窗口。因此,一个标题为 GPT-6 Astra Ultrafast vs GPT-6 Astra 的页面不可能成为基准测试论证,因为并没有第二组可供基准测试的权重——而假装有,将会是本周写出误导性文章的最省事方式。
可供比较的内容比一张规格表更窄,也更有用:一张价目表对另一张价目表,一种可用性立场对另一种可用性立场,以及一个实际耗时差异,OpenAI 称其幅度为“最高可达 8 倍”。自 2026 年 9 月 29 日 Ultrafast for GPT-6 Astra 正式可用以来,这次比较的两边终于都附上了价格——而在 8 月该档位还仅限预览时,情况并非如此。这意味着问题的形态已经改变。它不再是“这个档位是否真实存在”,而是“在六倍费率下,我的工作负载必须具备哪些条件,快速通道才算是正确的购买选择。”
有差异的列,以及没有差异的那一列
将两条通道并排放置,几乎每一行在构造上都是相同的。而那些不相同的行,才是本文仅有的内容。
• 检查点——完全相同。GPT-6 Astra Ultrafast 运行的是标准版 GPT-6 Astra 的权重。相同的采样行为,相同的推理行为,对同一提示词在相同努力程度设置下给出相同的答案。
• 上下文、输出与输入——完全相同。两边均为 1,050,000 token 的输入窗口和 128,000 token 的输出上限,支持文本、图像和文件输入、文本输出,且无论哪个层级,知识截止日期均为 2026 年 4 月 30 日。
• 推理控制——完全一致。两端的 effort 档位均涵盖 low、medium、high、xhigh 和 max。该层级改变的是 token 的到达速度,而非模型的思考强度,因此一个 xhigh effort 的 Ultrafast 请求依然是一个 xhigh effort 请求。
• 价目表不同——而这正是整个决定的关键。标准版每 100 万 tokens 计费 $10.00 输入、$1.00 缓存输入、$12.50 缓存写入、$50.00 输出,上限为 272,000 输入 tokens;Ultrafast 则计费 $60.00 / $6.00 / $75.00 / $300.00。超过 272K 后,整个请求重新计价:标准版为 $20.00 / $2.00 / $25.00 / $75.00,Ultrafast 为 $120.00 / $12.00 / $150.00 / $450.00。所有四个计费项、两个上下文区间,都是六倍。
• 访问权限——各不相同。Standard 是默认通道,任何持有 API 密钥的人都可以调用。Ultrafast 曾设有候补名单,现已向所有 API 用户开放,但初期速率限制较低:OpenAI 的文档显示,API 层级 1 至 3 为每分钟 500,000 个 token,层级 4 为 1,000,000 个,层级 5 为 5,000,000 个。
• 地理区域——仅在一个方向上存在差异,因为该限制附加于该层级。Ultrafast 仅支持美国数据驻留和全球处理,不支持欧盟或其他美国境外的区域处理端点;标准通道则没有同等限制。
• 吞吐量——不同,且被表述为上限而非承诺。OpenAI 的 Ultrafast 文档将该档位描述为可提供“比标准模式最高快 8 倍的速度”。
• 基准测试——不是一行。没有什么可填进去的。在两个模型的对比页面上,本该有一张索引表,而这一页两边却是相同的数字,这正是重点所在,而不是数据中的空缺。

跨界,做得非常到位
因为倍率是固定的 6 倍,所以决策归结为一个不等式,而它值得被明确写出来,而不是含糊带过。当更早完成所带来的价值超过 token 账单的六倍时,购买 Ultrafast 就是正确的选择。其余都只是注解。
考虑一个具体的情形:一次智能体式执行摄入 100,000 token 的代码库上下文,并产出 5,000 token 的补丁,且代码库内容在多次尝试之间被缓存。在标准服务上,缓存读取计费 $0.10,全新输入计费 $0.10,输出计费 $0.25——每次尝试 $0.45。在 Ultrafast 上,同样的尝试计费为 $0.60、$0.60 和 $1.50——$2.70。差值是每次尝试 $2.25。如果速度只是让每次尝试更快完成,而尝试次数不变,那么你就是为延迟每次尝试支付了 $2.25,而唯一的正当理由就是等待时间的价值。
现在让速度发挥作用。如果更快的通道意味着模型的第一遍就能更常成功,因为它不必与缓慢的往返较劲,而通过次数从三次降到一次,那么标准方案完成该任务花费 1.35 美元,而 Ultrafast 为 2.70 美元。仍然更贵——但只是 2 倍,不是 6 倍,而现在的问题是,这两美元是否值得一次交互周期与一连串交互周期之间的差异。
这是各团队都会跳过的那道算术,而跳过它的诱惑在两头都存在。每一条上都一律按 6 倍计,会让这一档看起来处处昂贵——当它其实能省去轮次时,这种判断就是错的。而“最高 8 倍”的说法又会让它看起来一律便宜——当它并不便宜时,这种判断同样是错的。决定这件事的数字,是每个已完成任务所计费的轮次,在你自己的 trace 上测得,再乘以费率。如果这个比率没有逼近六,那么 Ultrafast 买的就是延迟,就应当按购买延迟来签字批准,并在等待的另一端安排一个具名的人。
“高达8倍”涵盖与不涵盖的内容
公布的速率声明是输出吞吐量的上限,而将吞吐量与延迟混为一谈,是关于这一层级最常见的错误。
吞吐量是指生成一旦运行起来后每秒的 token 数。延迟是发送请求到拿到答案之间的时间。Ultrafast 改善的是前者。OpenAI 自己的文档则把后者指为一个单独的问题,强烈建议为 Ultrafast 使用 WebSockets,正是因为每次请求的网络开销可能侵蚀延迟收益——如果该层级能让往返变得免费,这条建议本就没有必要。墙钟时间里还有两个部分完全在该层级之外:你自己的编排在调用之间花费的时间,以及工具调用在别人的服务器上花费的时间。对于单次长时间生成,吞吐量占了大部分。对于一个二十步的智能体循环,它只占其中一小部分,而这一小部分正是为什么上面的轮次数计算比 8x 这个头条数字更重要。

作为参照,请看下面这一档。Fast 模式于 2026 年 7 月 30 日从 Priority processing 更名而来,定价为标准档的 2 倍,文档称其速度最高为标准档的 2.5 倍。Ultrafast 的定价为标准档的 6 倍,文档称其速度最高为标准档的 8 倍。因此,从 Fast 升级到 Ultrafast,是花 3 倍的钱换取约 3.2 倍的速度——近乎线性的交换。相对于标准档的溢价并不是超线性的;它只是很大,而且仅在这一个模型系列上提供。OpenAI 的 Ultrafast 价格表只有一行,即 gpt-6-astra,这意味着该档位是当前旗舰模型的一项能力,而不是整条产品线上通用的服务级别选择。
两个工作负载,一个模型
进行这一比较的最清晰方式,是不要再问 Ultrafast 是否更好,而要开始问你的请求属于两种形态中的哪一种。
第一种形态是一个人在等待。故障正在蔓延时的事件分诊、客户在线等待的支持升级、分析师在一次会话中反复迭代——在这些工作负载中,答案在二十秒而非两分钟内到达,会改变这个人接下来能做什么;而且由于轮次很少,总的 token 账单也很小。相对于那个坐在那里的人的成本,几轮交互的 6 倍费率不过是个舍入误差。这正是该层级显然正确的地方,也正是 OpenAI 自己的预览材料所描述的那种形态。
第二种形态是按计划运行的机器。每晚重建索引、批量分类处理、必须在早上之前准备好的报告、数据回填。这些都无法感知延迟。它们全都由 token 数量主导。而且它们都有一个更好的选择,就在同一张价目表上:Batch 和 Flex,定价为标准价的 50%,即对于最高 272K 的 GPT-6 Astra,每百万输入 $5.00、输出 $25.00。当存在半价通道时,为了让一个无人关注的作业更快完成而支付 6 倍价格,是这张表里最昂贵的错误。
第三种形态是模糊的那种,也是大多数工程团队实际拥有的那种:智能体循环。正是在这里,决定因素的是交叉点算术,而不是经验法则;也正是在这里,测量足够廉价,以至于没有任何猜测的借口——对两条路径上每个已完成任务的轮次进行埋点统计,乘以费率,然后比较总数。GPT-6 Astra 的回答在两边完全相同,因此轮次上的任何差异都是模型耗时长短的差异,而不是其产出内容的差异,这使得它成为一个干净的实验,而不是一个有混杂因素的实验。
购买标准通道
有两点值得分开来看,而“Ultrafast pricing”这个说法恰恰容易把它们混为一谈:该档位的价格与模型本身的价格。标准版 GPT-6 Astra 是一个可路由模型,在 OrcaRouter 上以openai/gpt-6-astra上线,按提供方自己的费率计费——每百万 token 输入 $10.00、缓存输入 $1.00、输出 $50.00,并按文档说明,在输入超过 272,000 token 后步入长上下文档位,变为 $20.00 / $2.00 / $75.00。它以 0% 加价提供服务,这意味着提供方的标价原样传递,供应商调价当天就会反映到你的账单上,而不必等到下一次合同续签;而且同一个密钥还能访问 200 多个其他模型,因此以 Astra 起步的评估可以延伸到竞争对手的模型,而无需再做一次集成。
Ultrafast 层级本身并不是由我们路由的东西,原因在于结构,而非商业层面:它不是一个模型。它是 OpenAI 应用于其自有模型 ID 并计入你账户账单的一种受访问控制的服务层级标志,由调用方按请求启用。因此划分很清晰——如果你开启 Ultrafast,它存在于你与 OpenAI 的直接集成中,而你同时运行的标准层级流量,正是直通网关所擅长处理的那类东西。精确地说明这一边界,比用一段话来暗示快车道可以通过我们获得,要有用得多。

底部的线,它比页面短
GPT-6 Astra Ultrafast 与 GPT-6 Astra 是同一个模型,却有两份价目表。这个档位改变的是你拿到答案的快慢,而不是答案本身——相同的权重、相同的 1,050,000 token 上下文窗口、相同的 128,000 token 输出上限、相同的努力程度控制,以及相同的知识截止日期,输出吞吐量最高可达 8 倍,而每一行的价格正好是 6 倍,同时还受制于初期较低的速率限制和仅限美国的数据驻留要求,而标准通道并不附带这些。在有人正等待的场景,或在速度确实能减少计费轮次的场景,就选它;在任务按计划运行、且 Batch 或 Flex 可以以标准费率一半的价格使用的场景,就跳过它;并且要测量轮次数量,而不是凭空假设。这个对比唯一无法告诉你的是哪个模型更好,因为其中从来就只有一个模型。
