
GPT-6 Astra Ultrafast 在 Blackwell 上運行:NVIDIA 公布 8 倍效能背後的硬體
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
2026 年 10 月 1 日,NVIDIA 發布了一篇由 Dion Harris 撰寫、標題為「NVIDIA GPU 如何協助加速 OpenAI 的 GPT-6 Astra Ultrafast」的文章,而其中居於核心的那句話,是兩家公司首次說明該層級運行於什麼之上:「GPT-6 Astra Ultrafast 運行於 NVIDIA Blackwell GPU,現已在 OpenAI API 中提供,並開放給符合資格的 ChatGPT Work 與 Codex 使用者。」這就是那則新聞,而它比標題所暗示的範圍更窄。GPT-6 Astra 這個模型已於 2026 年 9 月 3 日發布。在它之上的 Ultrafast 服務層級已於 2026 年 9 月 29 日全面開放。那項速度宣稱——token 生成速度最高可達 Astra 標準模式的 8 倍——在 NVIDIA 重複這項說法時,已經存在兩天了。
這就帶出了這則貼文真正在回答的問題:不是「它有多快」,而是「它是誰的晶片」。

這篇貼文實際上新增的三件事
去掉重述的部分,10月1日的貼文就提供了三項事實。
• 硬體 — OpenAI 自家的 Ultrafast 文件於 9 月 30 日發布,內容描述了該層級的速度、配置與速率限制,且完全未提及任何 GPU。因此,這項矽晶歸屬僅有硬體供應商這一個來源。這並不代表它是錯的;這只是使它成為供應商對自家設備的說法,值得如此標註。
• 兩位具名工程師——OpenAI 推論負責人 Philippe Tillet,以及 OpenAI 運算技術長 Uday Ruddarraju,兩人均具名受訪,說明這項加速從何而來。
• 受眾 ——「符合資格的 ChatGPT Work 與 Codex 使用者」,這比該方案推出時僅限 API 的框架更為廣泛。OpenAI 自家的文件仍寫著,GPT-6 Astra 的 Ultrafast「以低速率限制提供給所有 API 使用者」,而這項低限制的但書並未正式撤除。
這兩段引文,以及為什麼它們才是有趣的部分
Tillet 的貢獻是一個迴圈,而非基準測試。他說,NVIDIA 在工具與文件方面的投資「讓我們得以讓我們的模型在程式設計方面表現得極為出色」,而 Astra 接著能「將那些知識轉化為高效能核心,讓 NVIDIA 硬體更具吸引力」。Ruddarraju 對這項工作的方向說得更直白:「我們用內部模型來最佳化 NVIDIA GPU 上的推論。」
合起來看,這是一個關於部署而非能力的說法:OpenAI 的前沿模型如今已很擅長撰寫 GPU 核心,足以讓 OpenAI 用它們來最佳化自家的服務堆疊。這也與 NVIDIA 文章中唯一完全不談發表週的一節相符——該節標題寫著「持續提升效能」,主張已部署的推論會隨時間變得更快,因為 OpenAI 不斷將自家模型指向其運行所用的 NVIDIA 軟體。
這一切都不是量測。這是兩名工程師在描述一個流程,而發表它的是賣出這些 GPU 的公司。誠實的解讀是:這個流程看似合理、很容易讓人相信,且從外部無法否證——這個故事裡的每一個速度數字也是如此。
Blackwell 在這邊,Cerebras 在那邊
這篇文章最有用之處,在於揭露了一個没人解釋過的分歧。2026 年 8 月 13 日,OpenAI 預覽了一個搭載於不同模型上的高速層級——運行速度「最高快 14 倍」的 GPT-5.6 Sol——並指名 Cerebras 為其背後的合作夥伴,描述其晶圓級硬體每秒可產生最多 750 個輸出 token。七週後,Astra 上的高速層級改由 Blackwell 運行,而數字是 8 倍。
兩種快速層級,兩套硬體解答:其中一個是專業合作夥伴,另一個則是該公司自家的最大供應商。兩家廠商都尚未公布這兩條服務路徑之間的比較,也沒有獨立評測者測量過任一者。另請注意 NVIDIA 的貼文如何處理第二個名字:「Rubin」只出現一次,就在 Tillet 那段關於模型為「Blackwell 與 Rubin GPU」撰寫核心的引述裡。這是在說明 OpenAI 的模型能撰寫什麼,並不是在說今天有任何東西正在 Rubin 上提供服務。
NVIDIA 未印出的數字
這個故事裡有一個數字,兩家公司都沒有把它放在 8x 旁邊,而這個數字正是決定團隊是否要開啟該層級的關鍵。OpenAI 公布的 Ultrafast 價目表列出 gpt-6-astra每百萬個輸入 token 為 60.00 美元、快取輸入 6.00 美元、快取寫入 75.00 美元,輸出則為 300.00 美元。同一模型在標準層級是 10.00 美元和 50.00 美元,快取輸入為 1.00 美元,快取寫入為 12.50 美元。每一欄都正好是標準費率的六倍。
• 倍數 — 輸入、輸出、快取輸入與快取寫入皆為 6.00 倍。不是「最高可達」。就是六倍。
• 上限——8 倍,這是兩家廠商都引用的數字,還附上「最高可達」,卻未說明任何條件。
• 這代表什麼——價格倍數低於該方案自己宣稱的最佳情況。在上限值時,這筆交易是有利的;但只要你的流量不到 6 倍,你為每單位省下的時間所付的代價,就比行銷話術所暗示的更高。這也是為什麼這個方案唯一有意義的檢驗,就是在你自己的請求上實測。
• 長上下文階段 — 當輸入超過 272,000 個 token 時,Ultrafast 的費率會變成輸入 $120.00、輸出 $450.00,是標準方案自身階梯費率的六倍。
• 營運層面的細節條款——OpenAI 的文件載明,Ultrafast 的每分鐘權杖數級距為:使用層級 1 至 3 為 500,000,層級 4 為 1,000,000,層級 5 為 5,000,000;Ultrafast 僅支援美國資料駐留與全球處理,沒有歐盟或其他非美國區域的處理端點;文件建議 Ultrafast 採用 WebSockets,「尤其是會快速連續發出大量工具呼叫的代理式應用程式」,並警告「若沒有持續連線,網路額外負荷可能會侵蝕延遲改善的成效」。

最後那一點才是該採取行動的重點。若團隊啟用了該層級,卻在其下保留逐請求 HTTP,就等於付了六倍的費率,把一部分加速成果交還給連線建立——這是有明確記載、可避免的浪費金錢方式。
從單一端點來看,這會是什麼樣子
GPT-6 Astra 已在 OrcaRouter 上推出,型號為 openai/gpt-6-astra:具備 1,050,000 個 token 的上下文視窗、最高 128,000 個輸出 token,支援文字、圖像與檔案輸入,並直接沿用 OpenAI 的定價,每百萬 token 輸入 $10.00、輸出 $50.00,當輸入超過 272,000 個 token 時則調整為 $20.00 與 $75.00。其型錄上的頭條基準測試成績為 GPQA Diamond 的 96.1。
Ultrafast 層級並不存在於 OrcaRouter 上,而且也不可能存在:它是 OpenAI 帳戶中受存取權控制的屬性,而不是模型 ID,這就是為什麼openai/gpt-6-astra-ultrafast會回傳找不到模型。如果你開啟了這個層級,它會存在於你直接連接的 OpenAI 整合中。在這種情況下,一個收錄 200 多個模型的端點加上0% 加成帶給你的並不是快速通道,而是掌控權。因為供應商的定價是原價直接轉嫁而非加價,OpenAI 的費率調整在他們那邊生效的同一天,就會反映到我們這邊;而且因為標準 Astra 通道本來就已經存在,能終結這個決定的實驗只需要一行設定:相同的提示詞、標準層級,再加上旁邊一個更便宜的模型,使用同一把金鑰。對大多數團隊而言,這是最接近延遲基準測試的做法,而且設定起來完全不花錢。

還有什麼尚未被測量?
今天有三件事可以查證:這個層級確實存在、它就在費率表上,正好是標準費率的六倍,而且自 10 月 1 日起,它被公開歸因於 NVIDIA Blackwell GPUs。
有一點並非如此:你流量上的倍數。沒有廠商曾公布在已說明的併發層級下,該層級的延遲分佈,也沒有第三方重現過那個 8 倍。此外,也沒有基準測試比較在 Ultrafast 上的 Astra 與標準模式下的 Astra,而且不應該出現一份吹捧它的結果——那是在更快路徑上的同一個檢查點,因此相同設定應該會在不同速度下產生相同答案。如果你的兩條通道在同一組提示上出現分歧,你手上的是錯誤回報,不是功能。
所以,10月1日那則消息真正有用的摘要,比公告讀起來的要小得多。同樣的層級、同樣的價格、同樣未經證實的速度上限,如今只是披上了一個硬體標籤。那個標籤很重要——它告訴你 OpenAI 正用哪條加速器產品線來擴展這件事,也告訴你快速層級的故事在不到兩個月內,從一家專業合作夥伴轉向了業界最大的 GPU 供應商。它只是沒有告訴你任何關於你自己延遲預算的事,而沒有哪篇貼文會告訴你。
