為 Ultrafast 等級生成的一張標題卡,標題為「GPT-6 Astra Ultrafast」,副標題為「六倍速率,每一線皆然」,並有兩個徽章,分別寫著「已定價並全面開放使用」與「快速通道並非第二個模型」。
Guides & Insights

GPT-6 Astra Ultrafast 6 倍速:公佈的價目表實際上讓你付出多少代價

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

GPT-6 Astra Ultrafast 在 2026 年 9 月 29 日不再是候補名單。它現在是可購買的服務層級,並有已公布的價格,而該價格在每一個計價項目上都正好是標準版的六倍。其底層模型——GPT-6 Astra,該公司的旗艦模型,已於 2026 年 9 月 3 日推出——並未改變;DevDay 改變的是,其上的快速通道已正式全面開放,而該公司的 API 文件現在明白寫道,Ultrafast「已廣泛提供給 GPT-6 Astra,並為 GPT-5.6 Sol 提供預覽存取」。這是第一次你能將這個層級編入預算科目,而要填上的數字是每百萬輸入符元 60.00 美元與每百萬輸出符元 300.00 美元,讀自該公司自家在 2026 年 9 月 30 日的定價頁面。

這讓這個問題不同於上市報導所回答的那個問題。本週真正有意思的事實,並不是這個層級存在——preview 已於 2026 年 8 月 13 日發布,並被報導到爛。有意思的事實是,一個原本沒有價格的層級如今有了價格,而由此得出的算術結果,以一種具體且可量化的方式顯得難看。六倍不是你可以聳聳肩就吸收的溢價;那是你得在更少回合內賺回來的溢價,而你能不能做到,取決於你的工作負載,而不是模型本身。

每條路線上的多個支點,而這是首先要理解的事。

在 2026 年 9 月 30 日閱讀 OpenAI 的定價頁面時,GPT-6 Astra 的 Ultrafast 欄位是 Standard 欄位的固定 6 倍,而不是某些項目加價、某些項目不加價。這很重要,因為這意味著你無法透過改變請求的形態來最佳化並藉此擺脫它。

• GPT-6 Astra,標準服務,請求最多可達 272,000 個輸入 token —— 每 1M 個 token:輸入 $10.00、快取輸入 $1.00、快取寫入 $12.50、輸出 $50.00。

• GPT-6 Astra Ultrafast,相同的門檻 — 每 100 萬個 token 的輸入為 $60.00、快取輸入為 $6.00、快取寫入為 $75.00、輸出為 $300.00。四項數字皆恰好為 6 倍。

• 當輸入超過 272,000 個 token 時,整個請求會重新計價——Standard 調整為 $20.00 / $2.00 / $25.00 / $75.00,Ultrafast 調整為 $120.00 / $12.00 / $150.00 / $450.00。仍然是 6 倍。OpenAI 為 GPT-6 Astra 記載的長上下文規則為:一旦超過門檻,整個請求的輸入與快取費率為 2 倍、輸出為 1.5 倍,且對兩個層級一體適用。

• 同一張卡上的其他層級——Batch 和 Flex 是 Standard 的 50%,而 Fast 模式是 Standard 的 2 倍。因此這個模型的倍率階梯為 0.5x、1x、2x、6x,最後兩者之間沒有任何中間階級。

Ultrafast 沒有等同於 Batch 的方案。Batch 和 Flex 是你以較寬鬆的排程在標準通道上購買的折扣;快速通道並沒有慢而便宜的版本。如果你想要速度,你每送出一個 token、每取回一個 token,都要支付 6 倍費用,而且沒有任何快取輸入與全新輸入的混合方式能改善這個比例。

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

一通電話實際上要花多少錢

有了兩個具體請求,這個抽象概念就更容易推理。兩者都採用 OpenAI 公布的每百萬費率;計算則是我們自己做的。

單次呼叫若包含 20,000 個輸入 token 與 2,000 個 token 的回答,在 Standard 上計費為 $0.30——20,000 個 token 以每百萬 $10 計算為 $0.20,加上 2,000 個以每百萬 $50 計算為 $0.10。同樣的呼叫在 Ultrafast 上計費為 $1.80。正好是六倍,正如廣告所言。

現在來看真正能描述 agent 迴圈的情況:一場 200,000 token 的對話,其中 190,000 個 token 是快取前綴,只有 10,000 個是新鮮的,產生一個 1,000-token 的步驟。Standard 對快取讀取收費 $0.19、對新鮮輸入收費 $0.10、對輸出收費 $0.05 —— 每步 $0.34。Ultrafast 收費 $1.14、$0.60 和 $0.30 —— 每步 $2.04。同樣是 6 倍,但看看這樣的組合造成了什麼影響:快取是這個模型上最有效的單一成本槓桿,而它在 standard 通道上仍然恰好便宜 6 倍,所以一個高度快取化的 agent 無法從快速層級按比例獲得任何好處,也無法緩和這個溢價。

真正值得內化的是這個結果。由於倍率是固定的,損益兩平點完全不在於你的 token 組合,而是完全取決於回合數。Ultrafast 只有在某個工作負載中能將計費回合數削減約六倍時,才能回本——無論是將重試迴圈收攏為單次執行,或以一個更快的互動工作階段取代一連串簡短的釐清呼叫。如果你的工作負載發出的回合數和以前相同,只是更早發生,那你就是以正好 6 倍的成本購買延遲,除此之外別無其他。

速率限制與地理因素,是未公開的天花板。

有兩項限制位於價格之外,在閱讀價目表時很容易被忽略。

首先是吞吐量。GPT-6 Astra 的超高速模式已開放給所有 API 使用者,但初期速率限制很低:OpenAI 的文件載明,第 1 至第 3 級為每分鐘 500,000 個 token,第 4 級為 1,000,000 個,第 5 級則為 5,000,000 個。對於一個以速度為賣點的層級而言,這是實實在在的天花板——在低階層級上,每分鐘五十萬個 token 的速率碰上二十萬個 token 的代理上下文,等於每分鐘只能發出兩次半請求。OpenAI 自家的指引也從另一面指出了同一個問題,強烈建議採用 WebSockets,正是因為每個請求的網路額外負擔,可能吃掉這個層級所付費換來的低延遲。

第二個是資料落地。Ultrafast 僅支援美國資料落地與全球處理。它不支援歐盟或其他非美國區域的處理端點。如果你的部署依賴 GPT-6 Astra 的歐盟資料落地端點,那麼無論價格為何,你都無法使用這個層級,而這是硬性界線,而非配置選項。另請注意,對於 2026 年 3 月 5 日或之後發布的模型,資料落地端點會加收 10% 費用,而 GPT-6 Astra 正是其中之一。

速度的宣傳數字從 14 倍降到了 8 倍

這件事值得謹慎說明,因為大多數報導中流傳的數字已經過時。OpenAI 的 Ultrafast 文件頁面如今發布的內容寫著:「我們最快的 API 服務層級,速度最高可達 Standard 模式的 8 倍。」2026 年 8 月 13 日針對 GPT-5.6 Sol 的預覽公告則承諾「比 Standard 處理速度快上最高 14 倍」,並在 Cerebras 硬體上達到每秒最高 750 個輸出 token。

那些不是同一項主張,而其中的差異與其說是撤回,不如說是換了主題。14 倍這個數字是在有限預覽中的 GPT-5.6 Sol 上測得的;8 倍這個數字則是 OpenAI 針對目前這個層級所公布的數據,並以 GPT-6 Astra 作為其廣泛提供的模型。任何人若以 Astra 上的 14 倍來編列預算,就是在拿一個 OpenAI 尚未針對 Astra 公布的數字來編列預算。誠實的解讀是:這兩個數字都是供應商自行回報的輸出輸送量上限,兩者都不是針對你的工作負載的延遲保證,而且端到端時間仍然包含輸入處理、工具呼叫,以及你自己的編排作業。把 8 倍當作規劃數字,並把更好的任何數字當作額外紅利,要透過你自己的流量驗證,而不是憑空假設。

週一該怎麼處理這個?

從算術推導出的決策規則,比行銷所暗示的更狹窄,而且在有人提議在整個環境中啟用 Ultrafast 之前,值得把它寫下來。

在延遲敏感的工作負載上、以及在具互動性、且有人正在等待的情境下開啟它。事故分流、即時支援升級、分析師在同一場工作時段內反覆迭代的研究迴圈——這些正是「答案現在就到、而不是四分鐘後才到」的價值與 token 價格不成比例的情境,也是少數幾輪對話就產生 6 倍帳單,遠遠小於那個人枯等成本的情境。OpenAI 自己在預覽公告中的範例正是這種樣貌:在故障持續發展時讀取日誌、把徹夜進行的研究迴圈壓縮進一場工作時段裡。

在吞吐量受限或批次型態的工作負載上,就讓它保持關閉。夜間重新建立索引、大量分類處理、排程報告、回填——這些都不在意實際時鐘延遲,全都由 token 數量主導,而且它們都有一個 0.5 倍選項,就擺在 Batch 和 Flex 的同一份費率表上。為了更快完成而支付批次費率的 12 倍,是這張表裡最明顯的浪費錢方式。

尷尬的中間環節就是代理式編碼迴圈,而這正是回合數算術決定勝負的地方。如果這樣的速度真的能消除重試——如果模型對多檔案變更的第一次嘗試,因為不必再對抗逾時而更常成功——那麼 Ultrafast 即使每 token 貴 6 倍,換算成每項完成任務仍可能更便宜。這是關於你自己追蹤記錄的可量測主張,而非通則,而且量測成本很低:在兩個層級上計算每項完成任務的計費回合數,再乘以費率。如果比率不接近六,那麼快速層級買到的就是延遲,就應該以購買延遲來證明其合理性。

該層級已定價;繞行它的途徑並非同一個問題

關於如何看待這件事,有一點實務上的提醒。openai/gpt-6-astra以供應商自身的價格提供——每百萬個 token 輸入 $10.00、輸出 $50.00,272K 長上下文級距為 $20.00 / $75.00——並以 0% 加價供應,意思是供應商的定價會直接轉嫁,任何廠商調價都會在你帳單上、於其登上 OpenAI 價目表的同一天反映,而不是等到你下一次合約續約。同一把金鑰可存取超過 200 個模型因此標準層級可以與便宜層級或競爭對手的模型共用同一個用戶端,而不需要第二次整合。

我們不提供的,是 Ultrafast 層級。它是 OpenAI 帳戶上的一個服務層級旗標,而不是可另外路由的模型——你是在service_tier: "ultrafast"對gpt-6-astra發出的請求中設定它——而且 OpenAI 會按上述費率向你的自有帳戶收費。若你啟用它,它會存在於你直接與 OpenAI 的整合中,而 OrcaRouter 則是你同時路由的標準層級流量的正確去處。把事情講清楚,比暗示我們並不具備的能力更有用。

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

決策規則,用一段話來說明

六倍是一個層級的價格,不是一個模型的價格:權重、1,050,000-token 上下文視窗、128,000-token 輸出上限,以及回答本身,全都與標準 GPT-6 Astra 完全相同。你買到的是最高達 8 倍的輸出吞吐量,而價目表上每一行都是 6 倍,還附帶初期偏低的速率限制,以及一項把整個歐盟完全排除在外的美國駐留限制。這筆交易對正在等待答案的人來說顯然正確,對有半價通道可用的排程批次工作來說顯然錯誤,而對代理式迴圈則確實未有定論,因為答案取決於速度是否真能減少回合數。在決定投入之前,先在自己實際的追蹤紀錄上量測回合數,其餘的就按定價表價格路由。

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新