一張生成的標題卡,標題為「Ultrafast vs Standard」,副標題為「一個檢查點,兩種服務層級」,以及兩個徽章,分別寫著「相同權重,相同答案」和「只有服務路徑改變」。
Guides & Insights

GPT-6 Astra Ultrafast vs GPT-6 Astra:相同檢查點,六倍速率

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

這是罕見的一種比較,因為比較的兩邊其實是同一回事。GPT-6 Astra Ultrafast 不是一個模型;它是套用在 GPT-6 Astra 上的一種服務層級,而 GPT-6 Astra 是該公司於 2026 年 9 月 3 日發布的旗艦產品,該公司的文件也直接把這個機制講明:你把 model設為gpt-6-astra,再加上service_tier: "ultrafast"。並沒有個別的模型 ID、沒有個別的檢查點,也沒有個別的上下文視窗。因此,一篇標題為「GPT-6 Astra Ultrafast 對上 GPT-6 Astra」的文章,不可能是在做基準測試的論證,因為根本沒有第二組權重可供測試——而假裝有,會是這週寫出一篇誤導性文章最簡單的方式。

可供比較的內容比規格表更窄、也更有用:一份價目表對照另一份價目表,一種可用性立場對照另一種可用性立場,以及一個 OpenAI 聲稱「最高可達 8 倍」的實際耗時差異。自從 Ultrafast for GPT-6 Astra 於 2026 年 9 月 29 日正式全面推出後,這項比較的兩邊終於都附上了價格;這在八月該層級僅供預覽時並非如此。這意味著問題已經改變了形態。問題不再是「這個層級是真的嗎」,而是「在費率高出六倍的情況下,我的工作負載必須具備什麼條件,快速通道才會是正確的購買選擇」。

有差異的那些欄位,以及沒有差異的那一個

把這兩條車道並排放置後,幾乎每一列在構造上都是相同的。而那些不相同的列,就是這篇文章唯一的內容。

• 檢查點 — 完全相同。GPT-6 Astra Ultrafast 運行的是標準 GPT-6 Astra 的權重。相同的取樣行為,相同的推理行為,在相同的努力設定下,對相同的提示給出相同的答案。

• 上下文、輸出與輸入 —— 完全相同。雙方皆具備 1,050,000 個詞元的輸入視窗與 128,000 個詞元的輸出上限,支援文字、圖像與檔案輸入,輸出文字,且無論哪個方案層級,知識截止日期皆為 2026 年 4 月 30 日。

• 推理控制 —— 完全相同。兩邊的 effort 都提供 low、medium、high、xhigh 和 max。等級改變的是 token 送達的速度,而不是模型思考的深度,因此一個 xhigh effort 的 Ultrafast 請求仍然是一個 xhigh effort 的請求。

• 價目表——不同,而這就是整個決策的關鍵。Standard 對每 1M 個 token 收取 $10.00 輸入、$1.00 快取輸入、$12.50 快取寫入與 $50.00 輸出,適用於最多 272,000 個輸入 token;Ultrafast 則收 $60.00 / $6.00 / $75.00 / $300.00。超過 272K 後,整個請求會重新計價為 standard 的 $20.00 / $2.00 / $25.00 / $75.00,以及 Ultrafast 的 $120.00 / $12.00 / $150.00 / $450.00。六倍,在全部四條計價項目上,於兩個上下文區間皆是如此。

• 存取——有所不同。Standard 是預設通道,任何擁有 API 金鑰的人都能呼叫。Ultrafast 過去採用候補名單,現在已開放給所有 API 使用者,但初期速率限制較低:OpenAI 文件指出,API 級別 1 至 3 為每分鐘 500,000 個權杖,級別 4 為 1,000,000,級別 5 為 5,000,000。

• 地理 — 僅在單一方向上有所不同,因為此限制附屬於該層級。Ultrafast 僅支援美國資料駐留與全球處理,不支援歐盟或其他非美國區域處理端點;標準通道則沒有同等限制。

• 吞吐量 — 有所不同,而且是以上限而非承諾來表述。OpenAI 的 Ultrafast 文件將此層級描述為提供「比 Standard 模式快最多 8 倍的速度」。

• 基準測試——不是一列。沒有東西可以放進去。在兩個型號的比較頁面通常會有一個索引表,但這個頁面兩邊的數字相同,這正是重點,而不是資料的缺口。

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

分音器,運作正常

因為乘數是固定的 6x,這個決定會收斂成一個不等式,而且值得把它寫出來,而不是含糊帶過。當更快完成任務的價值超過代幣帳單的六倍時,Ultrafast 就是正確的購買選擇。其餘都只是註解。

考慮一個具體情境:一個代理式流程會讀取 100,000 個 token 的儲存庫上下文,並產生 5,000 個 token 的修補程式,且儲存庫內容會跨多次嘗試快取。在標準服務上,快取讀取收費 $0.10,全新輸入收費 $0.10,輸出收費 $0.25——每次嘗試共 $0.45。在 Ultrafast 上,同一次嘗試則收費 $0.60、$0.60 和 $1.50——共 $2.70。差額是每次嘗試 $2.25。如果速度的唯一作用只是讓每次嘗試更快完成,而嘗試次數不變,那麼你就是每次嘗試付了 $2.25 來換取延遲,而唯一的正當理由就是等待時間的價值。

現在讓速度發揮作用。如果更快的通道意味著模型的首輪推論更常一次到位,因為它不必對抗緩慢的往返延遲,而且通過次數從三次降到一次,那麼標準方案執行這項任務的成本是 $1.35,而 Ultrafast 則是 $2.70。仍然比較貴——但只貴 2 倍,不是 6 倍,而現在問題在於,兩美元是否值得換來一個互動週期與一連串互動週期之間的差異。

這就是團隊會跳過的算術,而跳過它的誘惑是雙向的。每一行一律套用 6 倍,會讓這個層級看起來一律昂貴,但當它能減少回合數時,這種看法就錯了。而「最高 8 倍」的標題則讓它看起來一律便宜,但當它做不到時,這種看法也錯了。真正能定奪的數字,是每個完成任務的計費回合數,以你自己的追蹤紀錄衡量,再乘上費率。如果那個比率沒有趨近六,Ultrafast 買的其實是延遲,就該以這個名義簽核,並在等待的另一端有個具名的人。

「最高 8 倍」涵蓋與不涵蓋的範圍

所公布的速率聲明是輸出輸送量上限,而將輸送量與延遲混為一談,是關於這個層級最常見的錯誤。

吞吐量是生成開始運轉後每秒的 token 數。延遲是從送出請求到取得答案之間的時間。Ultrafast 改善的是前者。OpenAI 自家的文件指出後者是另一個獨立問題,並強烈建議 Ultrafast 使用 WebSockets,正是因為每個請求的網路額外負擔可能侵蝕延遲改善——如果這個層級能讓往返傳輸變成免費,這項建議就沒有必要。實際耗時還有另外兩塊完全落在這個層級之外:你自己的編排流程在兩次呼叫之間花費的時間,以及工具呼叫在別人的伺服器上耗費的時間。對單一長時間生成而言,吞吐量占了故事的大部分。對二十步驟的 agent 迴圈來說,它只占其中一小部分,而那一小部分正是為什麼上述的回合數運算比 8 倍這個頭條數字更重要。

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

作為校準,請看下面這個層級。Fast 模式於 2026 年 7 月 30 日由 Priority processing 更名而來,定價為標準方案的 2 倍,文件記載最高可達 2.5 倍速度。Ultrafast 定價為標準方案的 6 倍,文件記載最高可達 8 倍速度。因此,從 Fast 進階到 Ultrafast,是花 3 倍的錢換取約 3.2 倍的速度——接近線性的交換關係。相對於標準方案的溢價並非超線性;它就只是很大,而且僅適用於這一個模型系列。OpenAI 的 Ultrafast 定價表只有一列,那就是 gpt-6-astra,這意味著該層級是當前旗艦模型的一項能力,而非整個產品線通用的服務層級選擇。

兩種工作負載,一個模型

最乾淨俐落的比較方式,就是別再問 Ultrafast 是否更好,而是開始問你的請求屬於兩種形態中的哪一種。

第一種形態是有人在等待。當故障正在擴大時進行事件分類、客戶正在線上等待的支援升級、分析師在一次工作階段內反覆迭代——這些都是這樣的工作負載:答案在二十秒而非兩分鐘內送達,會改變這個人接下來能做什麼;而且因為回合數很少,總 token 費用也很低。相較於坐在那裡的人的成本,少量回合上的 6 倍費率只是個捨入誤差。這正是該層級顯然正確的情境,也是 OpenAI 自家預覽資料所描述的那種形態。

第二種形態是按排程運轉的機器。夜間重新索引、大量分類批次作業、必須在隔天早上前準備好的報表、資料回填。這些都感受不到延遲。它們全都受 token 數量支配。而且它們全都在同一張價目表上有更好的選擇:Batch and Flex,價格為標準價的 50%,也就是 GPT-6 Astra 在 272K 以內每百萬 5.00 美元輸入與 25.00 美元輸出。明明有半價車道可用,卻付 6 倍價錢讓一個沒人盯著的工作早點完成,是這張表裡最昂貴的錯誤。

第三種形態是那個有歧義的,而且它正是大多數工程團隊實際擁有的形態:代理迴圈。這正是交叉計算能決定勝負、而非靠經驗法則判斷的地方,也是量測成本低到沒有藉口靠猜的地方——在兩條路徑上量測每項完成任務的回合數,乘上費率,再比較總數。GPT-6 Astra 的回答在兩邊都一樣,所以回合數若有任何差異,就是模型花了多久時間的差異,而不是它產出了什麼的差異,這使得這是一場乾淨的實驗,而非受到混淆的實驗。

購買標準車道

「Ultrafast pricing」這個說法容易把兩件事混為一談,值得分開來看:方案層級的價格,以及模型本身的價格。標準 GPT-6 Astra 是可路由的模型,在 OrcaRouter 上以 openai/gpt-6-astra這個名稱、依供應商自身的費率實際提供——每百萬個 token 輸入 $10.00、快取輸入 $1.00、輸出 $50.00,而根據文件記載,當輸入超過 272,000 個 token 時,長上下文費率會調整為 $20.00 / $2.00 / $75.00。它是以 0% 加價提供,這表示供應商的定價會原封不動地傳遞過來,供應商調整費率當天就會反映到你的帳單上,而不是等到下一次合約續約才調整;而且同一組金鑰還能存取其他 200 多個模型,因此從 Astra 開始的評估,不必再進行第二次整合,就能延伸到競爭對手的模型。

Ultrafast 層級本身不是我們會路由的東西,原因在於結構而非商業:它不是模型。它是 OpenAI 套用在自己模型 ID 上、並向你的帳戶收費的受存取控制服務層級旗標,由呼叫方按每次請求啟用。所以界線很清楚——如果你開啟 Ultrafast,它存在於你直接與 OpenAI 的整合中,而你在旁邊跑的標準層級流量,正是直通式閘道存在的用途。精確說明這條界線,比寫一段暗示可透過我們使用快速通道的文字更有用。

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

底線,比頁面短

GPT-6 Astra Ultrafast 與 GPT-6 Astra 是同一個模型,卻有兩套價目表。改變的是你拿到答案的時機,而不是答案本身——相同的權重、相同的 1,050,000 個 token 視窗、相同的 128,000 個 token 輸出上限、相同的運算強度控制項,以及相同的知識截止點,換來最高 8 倍的輸出吞吐量,代價是每一項定價都正好貴上 6 倍,但附帶初期較低的速率限制,以及標準通道所沒有的僅限美國地區限制。在人正在等待的地方,或速度確實能減少計費回合的地方,就採用它;若工作按排程執行,且 Batch 或 Flex 以標準費率的一半提供,就跳過它;並且要實際測量回合數,而不是憑假設。這項比較唯一無法告訴你的是哪個模型更好,因為從頭到尾就只有一個模型。