一张生成的标题卡,主标题为“GPT-6 Astra Ultrafast 在 Blackwell 上运行”,副标题为“NVIDIA 为 8 倍性能背后的硬件命名”,还有三张卡片分别写着“硬件:Blackwell GPU”、“价格倍数:标准费率的 6.00 倍”和“宣称速度:最高 8 倍”,页脚写着“NVIDIA 帖子,2026 年 10 月 1 日——厂商报告的数据”。
Guides & Insights

GPT-6 Astra Ultrafast 登陆 Blackwell:NVIDIA 揭晓 8 倍性能背后的硬件

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年10月1日,NVIDIA 发布了由 Dion Harris 撰写、题为《NVIDIA GPU 如何助力加速 OpenAI 的 GPT-6 Astra Ultrafast》的文章,而位于其核心的那句话,是两家公司首次说明该服务层级运行在什么之上:“GPT-6 Astra Ultrafast 运行在 NVIDIA Blackwell GPU 上,现已在 OpenAI API 中提供,并面向符合条件的 ChatGPT Work 和 Codex 用户开放。”这就是新闻,而且它比标题所暗示的要窄。模型 GPT-6 Astra 于2026年9月3日发布。其上的 Ultrafast 服务层级于2026年9月29日全面可用。速度宣称——token 生成速度最高可达 Astra 标准模式的 8 倍——在 NVIDIA 复述它时已经问世两天了。

这就引出了这篇文章真正要回答的问题:不是“它有多快”,而是“它是谁的芯片”。

A screenshot of OpenAI's Ultrafast mode documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the note that Ultrafast for GPT-6 Astra is currently available to all API users at low rate limits with higher limits or Sol preview access requestable through an OpenAI account team, the recommendation to use WebSockets because without a persistent connection network overhead can reduce the latency gains, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

这篇帖子实际补充的三件事

剔除重述内容后,10月1日的帖文贡献了三个事实。

• 硬件——Blackwell。OpenAI 自己于 9 月 30 日发布的 Ultrafast 文档描述了该档位的速度、配置和速率限制,却完全没有提到任何 GPU。因此,关于芯片的说法只有一个来源,即硬件供应商。这并不代表它是假的;只是说明它是供应商对自己设备的说法,理应如此标明。

• 两位具名工程师——Philippe Tillet,OpenAI 的推理负责人,以及 Uday Ruddarraju,OpenAI 的计算首席技术官,两人均公开具名地谈到了这种加速源自何处。

• 受众——"符合条件的 ChatGPT Work 和 Codex 用户",这一范围比该层级推出时仅限 API 的定位更广。OpenAI 自己的文档仍然写着,GPT-6 Astra 的 Ultrafast 功能"以较低的速率限制向所有 API 用户开放",而这一低限制的说明并未被公开撤销。

这两段引文,以及它们为何才是有趣的部分

Tillet 的贡献是一个循环,而非基准测试。他说,NVIDIA 在工具和文档上的投入“使我们能够让自己的模型在编程方面异常出色”,而 Astra 随后可以“把这种知识转化为高性能内核,让 NVIDIA 硬件变得极具吸引力”。Ruddarraju 对这项工作方向的表述更直白:“我们用自己的内部模型来优化 NVIDIA GPU 上的推理。”

连起来看,这是关于部署而非能力的论断:OpenAI 的前沿模型如今在编写 GPU 内核方面已经足够出色,以至于 OpenAI 会用它们来优化自己的服务栈。这也与 NVIDIA 博文中唯一一个完全无关发布周的部分相吻合——其中一个小标题写着“持续提升性能”,其论点是,已部署的推理会随着时间推移而变得更快,因为 OpenAI 不断让自家模型去优化其运行所依赖的 NVIDIA 软件。

这些都不是测量结果。这只是两名工程师在描述一个流程,而发布它的是销售这些 GPU 的公司。诚实的解读是:这个流程听起来合理、很容易让人相信,并且从外部无法证伪——这个故事里的每一个速度数字也同样如此。

Blackwell 在这里,Cerebras 在那里

这篇文章最有用的地方在于揭示了一个无人解释过的差异。2026年8月13日,OpenAI预览了一个基于不同模型的快速层级——GPT-5.6 Sol运行速度“最高提升14倍”——并指定Cerebras为其背后的合作伙伴,描述晶圆级硬件每秒生成最多750个输出token。七周后,基于Astra的快速层在Blackwell上运行,而数字是8倍。

两个快速层级,两种硬件答案,其中一个是专业合作伙伴,另一个是该公司自己最大的供应商。两家供应商都没有公布这两条服务路径之间的对比,也没有独立评估方对其中任何一条进行过实测。还要注意 NVIDIA 那篇帖子如何处理第二个名字:"Rubin" 只出现了一次,出现在 Tillet 的那句引述中,讲的是模型为 "Blackwell 和 Rubin GPU" 编写内核。这是一句关于 OpenAI 的模型能编写什么程序的表述,并不是说今天有任何东西正在 Rubin 上提供服务。

NVIDIA没有公布的那个数字

这个故事里有一个数字,两家公司都没有把它和 8 倍放在一起,而它恰恰是决定团队是否开启该档位的那个数字。OpenAI 公布的 Ultrafast 价目表列出 gpt-6-astra的价格为每百万输入 token 60.00 美元、缓存输入 6.00 美元、缓存写入 75.00 美元,输出 300.00 美元。同一模型在标准档位下为 10.00 美元和 50.00 美元,缓存输入为 1.00 美元,缓存写入为 12.50 美元。每一列都恰好是标准费率的六倍。

• 倍率 — 输入、输出、缓存输入和缓存写入均为 6.00 倍。不是“最高可达”。就是 6 倍。

• 上限——8 倍,两家供应商引用这个数字时都附带“最高可达”,却未说明条件。

• 这意味着什么—— 价格倍数低于该档位自身所宣称的最佳情形。在达到上限时,这笔交易是有利的;而在你的流量上,只要低于 6 倍,你为每单位节省时间所付出的代价就高于营销宣传所暗示的水平。正因如此,对这一档位唯一有意义的检验,是在你自己的请求上做一次实测。

• 长上下文阶梯 — 当输入 token 超过 272,000 时,Ultrafast 费率变为输入 $120.00、输出 $450.00,是标准层级自身阶梯费率的六倍。

• 运营细则 — OpenAI 在文档中列出了 Ultrafast 的每分钟 tokens 阶梯:使用层级 1 至 3 为 500,000,层级 4 为 1,000,000,层级 5 为 5,000,000;Ultrafast 仅支持美国数据驻留和全球处理,没有欧盟或其他非美国区域的处理端点;文档建议 Ultrafast 使用 WebSockets,“尤其是对于需要快速连续进行大量工具调用的智能体应用”,并警告称“如果没有持久连接,网络开销可能会削弱延迟方面的优势”。

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that regional processing endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP endpoints carry a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

最后一点才是需要付诸行动的那一个。如果团队启用了该层级,却在其下仍然沿用按请求建立的 HTTP 连接,那就等于付出了六倍的费率,却把一部分速度提升又拱手交还给了连接建立环节——这是一种有据可查、本可避免的浪费钱的方式。

从单个端点的角度来看这是什么样子

GPT-6 Astra 已在 OrcaRouter 上线,模型 ID 为 openai/gpt-6-astra:1,050,000 token 的上下文窗口,最多 128,000 个输出 token,支持文本、图像和文件输入,OpenAI 的标价按每百万 token 输入 $10.00、输出 $50.00 直接透传,输入 token 超过 272,000 后分别升至 $20.00 和 $75.00。其在模型目录中的主打基准成绩为 GPQA Diamond 上的 96.1。

Ultrafast 层级不在 OrcaRouter 上,也不可能在:它是 OpenAI 账户的一项访问受控属性,而不是模型 ID,因此openai/gpt-6-astra-ultrafast会返回模型未找到。如果你开启该层级,它存在于你的 OpenAI 直连集成中。在这种情况下,一个包含 200 多个模型的端点加上0% 加价带给你的不是快车道——而是控制权。由于提供商按标价透传而非加价,OpenAI 调价当天就会落到我们这边,与落到他们那边同步;而且由于标准 Astra 通道已经就位,决定这件事实验只需一行配置:同一个提示词、标准层级,再在旁边配一个更便宜的模型,用同一个密钥。这几乎是大多数团队会做的最接近延迟基准测试的事情,而且搭建成本为零。

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

还有什么尚未被测量

今天有三件事可以核实。这个档位确实存在,它就在价目表上,恰好是标准费率的六倍,并且自10月1日起,它被公开归因于NVIDIA Blackwell GPU。

有一件事并非如此:你流量上的那个倍数。没有任何厂商公布过在明确并发水平下该档位的延迟分布,也没有任何第三方复现过那 8 倍。同样,也没有任何基准测试把 Ultrafast 上的 Astra 与标准模式下的 Astra 放在一起比较,而且也不该出现一份往好里说的对比结果——那不过是同一个检查点跑在更快的路径上,所以相同的设置理应在不同速度下给出完全相同的答案。如果你这两条通道在相同提示词上出现分歧,那你手里拿到的是一份 bug 报告,而不是一项特性。

所以,10 月 1 日真正有用的总结比公告字面所呈现的要少。它还是同一档位、同一价格,速度上限也同样未经证实,只不过现在贴上了硬件标签。这个标签很重要——它告诉你 OpenAI 正在用哪条加速器产品线来扩展这项服务,也告诉你快速档位这件事在不到两个月内已从一家专业合作伙伴转向业内最大的 GPU 供应商。它只是完全没有告诉你任何关于你自己的延迟预算的信息,而任何帖子也不会告诉你。