一張生成的標題卡,主標題為「GPT-6 Astra Ultrafast 搭載 Blackwell 運行」,副標為「NVIDIA 公布這款 8 倍效能背後的硬體」,並有三張卡片分別寫著「硬體:Blackwell GPU」、「價格倍數:標準費率的 6.00 倍」與「宣稱速度:最高 8 倍」,頁腳則寫著「NVIDIA 貼文,2026 年 10 月 1 日——廠商自行公布的數據」。
Guides & Insights

GPT-6 Astra Ultrafast 在 Blackwell 上運行:NVIDIA 公布 8 倍效能背後的硬體

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026 年 10 月 1 日,NVIDIA 發布了一篇由 Dion Harris 撰寫、標題為「NVIDIA GPU 如何協助加速 Open​AI 的 GPT-6 Astra Ultrafast」的文章,而其中居於核心的那句話,是兩家公司首次說明該層級運行於什麼之上:「GPT-6 Astra Ultrafast 運行於 NVIDIA Blackwell GPU,現已在 Open​AI API 中提供,並開放給符合資格的 ChatGPT Work 與 Codex 使用者。」這就是那則新聞,而它比標題所暗示的範圍更窄。GPT-6 Astra 這個模型已於 2026 年 9 月 3 日發布。在它之上的 Ultrafast 服務層級已於 2026 年 9 月 29 日全面開放。那項速度宣稱——token 生成速度最高可達 Astra 標準模式的 8 倍——在 NVIDIA 重複這項說法時,已經存在兩天了。

這就帶出了這則貼文真正在回答的問題:不是「它有多快」,而是「它是誰的晶片」。

A screenshot of OpenAI's Ultrafast mode documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the note that Ultrafast for GPT-6 Astra is currently available to all API users at low rate limits with higher limits or Sol preview access requestable through an OpenAI account team, the recommendation to use WebSockets because without a persistent connection network overhead can reduce the latency gains, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

這篇貼文實際上新增的三件事

去掉重述的部分,10月1日的貼文就提供了三項事實。

• 硬體 — OpenAI 自家的 Ultrafast 文件於 9 月 30 日發布,內容描述了該層級的速度、配置與速率限制,且完全未提及任何 GPU。因此,這項矽晶歸屬僅有硬體供應商這一個來源。這並不代表它是錯的;這只是使它成為供應商對自家設備的說法,值得如此標註。

• 兩位具名工程師——OpenAI 推論負責人 Philippe Tillet,以及 OpenAI 運算技術長 Uday Ruddarraju,兩人均具名受訪,說明這項加速從何而來。

• 受眾 ——「符合資格的 ChatGPT Work 與 Codex 使用者」,這比該方案推出時僅限 API 的框架更為廣泛。OpenAI 自家的文件仍寫著,GPT-6 Astra 的 Ultrafast「以低速率限制提供給所有 API 使用者」,而這項低限制的但書並未正式撤除。

這兩段引文,以及為什麼它們才是有趣的部分

Tillet 的貢獻是一個迴圈,而非基準測試。他說,NVIDIA 在工具與文件方面的投資「讓我們得以讓我們的模型在程式設計方面表現得極為出色」,而 Astra 接著能「將那些知識轉化為高效能核心,讓 NVIDIA 硬體更具吸引力」。Ruddarraju 對這項工作的方向說得更直白:「我們用內部模型來最佳化 NVIDIA GPU 上的推論。」

合起來看,這是一個關於部署而非能力的說法:OpenAI 的前沿模型如今已很擅長撰寫 GPU 核心,足以讓 OpenAI 用它們來最佳化自家的服務堆疊。這也與 NVIDIA 文章中唯一完全不談發表週的一節相符——該節標題寫著「持續提升效能」,主張已部署的推論會隨時間變得更快,因為 OpenAI 不斷將自家模型指向其運行所用的 NVIDIA 軟體。

這一切都不是量測。這是兩名工程師在描述一個流程,而發表它的是賣出這些 GPU 的公司。誠實的解讀是:這個流程看似合理、很容易讓人相信,且從外部無法否證——這個故事裡的每一個速度數字也是如此。

Blackwell 在這邊,Cerebras 在那邊

這篇文章最有用之處,在於揭露了一個没人解釋過的分歧。2026 年 8 月 13 日,OpenAI 預覽了一個搭載於不同模型上的高速層級——運行速度「最高快 14 倍」的 GPT-5.6 Sol——並指名 Cerebras 為其背後的合作夥伴,描述其晶圓級硬體每秒可產生最多 750 個輸出 token。七週後,Astra 上的高速層級改由 Blackwell 運行,而數字是 8 倍。

兩種快速層級,兩套硬體解答:其中一個是專業合作夥伴,另一個則是該公司自家的最大供應商。兩家廠商都尚未公布這兩條服務路徑之間的比較,也沒有獨立評測者測量過任一者。另請注意 NVIDIA 的貼文如何處理第二個名字:「Rubin」只出現一次,就在 Tillet 那段關於模型為「Blackwell 與 Rubin GPU」撰寫核心的引述裡。這是在說明 OpenAI 的模型能撰寫什麼,並不是在說今天有任何東西正在 Rubin 上提供服務。

NVIDIA 未印出的數字

這個故事裡有一個數字,兩家公司都沒有把它放在 8x 旁邊,而這個數字正是決定團隊是否要開啟該層級的關鍵。OpenAI 公布的 Ultrafast 價目表列出 gpt-6-astra每百萬個輸入 token 為 60.00 美元、快取輸入 6.00 美元、快取寫入 75.00 美元,輸出則為 300.00 美元。同一模型在標準層級是 10.00 美元和 50.00 美元,快取輸入為 1.00 美元,快取寫入為 12.50 美元。每一欄都正好是標準費率的六倍。

• 倍數 — 輸入、輸出、快取輸入與快取寫入皆為 6.00 倍。不是「最高可達」。就是六倍。

• 上限——8 倍,這是兩家廠商都引用的數字,還附上「最高可達」,卻未說明任何條件。

• 這代表什麼——價格倍數低於該方案自己宣稱的最佳情況。在上限值時,這筆交易是有利的;但只要你的流量不到 6 倍,你為每單位省下的時間所付的代價,就比行銷話術所暗示的更高。這也是為什麼這個方案唯一有意義的檢驗,就是在你自己的請求上實測。

• 長上下文階段 — 當輸入超過 272,000 個 token 時,Ultrafast 的費率會變成輸入 $120.00、輸出 $450.00,是標準方案自身階梯費率的六倍。

• 營運層面的細節條款——OpenAI 的文件載明,Ultrafast 的每分鐘權杖數級距為:使用層級 1 至 3 為 500,000,層級 4 為 1,000,000,層級 5 為 5,000,000;Ultrafast 僅支援美國資料駐留與全球處理,沒有歐盟或其他非美國區域的處理端點;文件建議 Ultrafast 採用 WebSockets,「尤其是會快速連續發出大量工具呼叫的代理式應用程式」,並警告「若沒有持續連線,網路額外負荷可能會侵蝕延遲改善的成效」。

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that regional processing endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP endpoints carry a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

最後那一點才是該採取行動的重點。若團隊啟用了該層級,卻在其下保留逐請求 HTTP,就等於付了六倍的費率,把一部分加速成果交還給連線建立——這是有明確記載、可避免的浪費金錢方式。

從單一端點來看,這會是什麼樣子

GPT-6 Astra 已在 OrcaRouter 上推出,型號為 openai/gpt-6-astra:具備 1,050,000 個 token 的上下文視窗、最高 128,000 個輸出 token,支援文字、圖像與檔案輸入,並直接沿用 OpenAI 的定價,每百萬 token 輸入 $10.00、輸出 $50.00,當輸入超過 272,000 個 token 時則調整為 $20.00 與 $75.00。其型錄上的頭條基準測試成績為 GPQA Diamond 的 96.1。

Ultrafast 層級並不存在於 OrcaRouter 上,而且也不可能存在:它是 OpenAI 帳戶中受存取權控制的屬性,而不是模型 ID,這就是為什麼openai/gpt-6-astra-ultrafast會回傳找不到模型。如果你開啟了這個層級,它會存在於你直接連接的 OpenAI 整合中。在這種情況下,一個收錄 200 多個模型的端點加上0% 加成帶給你的並不是快速通道,而是掌控權。因為供應商的定價是原價直接轉嫁而非加價,OpenAI 的費率調整在他們那邊生效的同一天,就會反映到我們這邊;而且因為標準 Astra 通道本來就已經存在,能終結這個決定的實驗只需要一行設定:相同的提示詞、標準層級,再加上旁邊一個更便宜的模型,使用同一把金鑰。對大多數團隊而言,這是最接近延遲基準測試的做法,而且設定起來完全不花錢。

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

還有什麼尚未被測量?

今天有三件事可以查證:這個層級確實存在、它就在費率表上,正好是標準費率的六倍,而且自 10 月 1 日起,它被公開歸因於 NVIDIA Blackwell GPUs。

有一點並非如此:你流量上的倍數。沒有廠商曾公布在已說明的併發層級下,該層級的延遲分佈,也沒有第三方重現過那個 8 倍。此外,也沒有基準測試比較在 Ultrafast 上的 Astra 與標準模式下的 Astra,而且不應該出現一份吹捧它的結果——那是在更快路徑上的同一個檢查點,因此相同設定應該會在不同速度下產生相同答案。如果你的兩條通道在同一組提示上出現分歧,你手上的是錯誤回報,不是功能。

所以,10月1日那則消息真正有用的摘要,比公告讀起來的要小得多。同樣的層級、同樣的價格、同樣未經證實的速度上限,如今只是披上了一個硬體標籤。那個標籤很重要——它告訴你 OpenAI 正用哪條加速器產品線來擴展這件事,也告訴你快速層級的故事在不到兩個月內,從一家專業合作夥伴轉向了業界最大的 GPU 供應商。它只是沒有告訴你任何關於你自己延遲預算的事,而沒有哪篇貼文會告訴你。