產生的標題卡標題為「Step 5 Preview 對比 GPT-6 Astra——十倍的價格」,內含兩欄:Step 5 Preview 的 AA Index 為 44,總參數 600B/啟動 27B,價格 $1.00/$2.70,混合價 $0.51,以及每秒 99.8 個 token;GPT-6 Astra 的 AA Index 為 53,價格 $10.00/$50.00,混合價 $7.70,以及每秒 59.3 個 token。頁尾寫著:「兩項數據均依 Artificial Analysis Intelligence Index;Astra 在輸入超過 272K token 時,價格升至 $20/$75。」
Guides & Insights

Step 5 Preview 對比 GPT-6 Astra:十倍的輸入價格,換來九個指數點

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這兩款模型的發表時間相隔十七天,價格卻像是為不同星球所訂。 Step 5 Preview,是 StepFun 於 2026 年 9 月 20 日發表的 600B 參數稀疏混合專家模型,每百萬輸入 token 收費 1.00 美元,每百萬輸出 token 收費 2.70 美元。 GPT-6 Astra則是該廠商的旗艦模型,於 2026 年 9 月 3 日推出,在 272K token 的輸入門檻以下,同樣的計費單位收費 10.00 美元與 50.00 美元——超過門檻則為 20.00 美元與 75.00 美元。這代表輸入價格是十倍,輸出價格約為十八倍,而這款模型在獨立的 Intelligence Index 上還高出九分,53 對 44。Astra 是否更好,並無疑問。但這個差距是否值得讓你的工作負載每百萬輸出 token 多付三十美元,則是另一回事;而在讀完這篇文章的過程中,答案會轉變兩次。

每個模型的用途

Step 5 Preview 是為代理式工作而打造並販售的:AI 程式開發、軟體工程、專業知識工作、金融。其架構正是為此調校——總參數達 600B,每個 token 約有 27B 處於啟用狀態,具備 1M token 的上下文、文字與圖像輸入,以及搭配延伸思考的推理能力。StepFun 跳過了整個 Step 4.x 系列才走到這一步,直接從 Step-3.7-Flash 推進到 Step 5。

GPT-6 Astra 是 OpenAI 的通用型旗艦模型:具備 100 萬個 token 的上下文、最高 128K 的輸出 token、輸入支援文字、圖像與檔案,輸出為文字,知識截止日期為 2026 年 4 月 30 日,並支援推理、程式編寫與代理式工作流程。當答案必須正確無誤,而 token 費用並非限制條件時,這就是企業會選擇的模型。

• 智慧指數 — Step 5 Preview 44 對 GPT-6 Astra 53

• 參數 — Step 5 Preview 總計 600B/啟用 27B,對比 GPT-6 Astra 未公開

• 上下文與輸出上限 — 兩者皆為 1M token 上下文;Astra 列出 1,050,000 token 的視窗與 128K 輸出上限,StepFun 則未公布輸出上限

• 輸入模式 — 文字與圖片對比文字、圖片與檔案

• 輸出速度 — Step 5 Preview 99.8 tokens/sec,對比 GPT-6 Astra 59.3 tokens/sec

• 每 100 萬個 token 的價格 — $1.00 輸入 / $2.70 輸出,對比輸入低於 272K 時的 $10.00 輸入 / $50.00 輸出,超過此數則升至 $20.00 / $75.00

• 快取 — Step 5 Preview 的 95% 折扣,相較於 GPT-6 Astra 的 90% 讀取折扣,並具有每百萬 $12.50 的快取寫入費率

• 每項 Intelligence Index 任務的成本 — Step 5 Preview $0.71 對比 GPT-6 Astra $3.26

Generated two-column comparison scoreboard titled 'Step 5 Preview vs GPT-6 Astra — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, parameters 600B total / 27B active, price $1.00 / $2.70, cache discount 95%, cost per index task $0.71 and output speed 99.8 tokens/sec. The right column gives GPT-6 Astra the rows AA Index 53, parameters undisclosed, price $10.00 / $50.00, cache discount 90%, cost per index task $3.26 and output speed 59.3 tokens/sec. A footer reads 'Both figures per Artificial Analysis Intelligence Index; Astra pricing rises to $20 / $75 above 272K input tokens.'

發票,逐行

Step 5 Preview 的定價固定且低廉:輸入 $1.00、輸出 $2.70,並有 95% 快取折扣,使快取輸入價格降至每百萬 token 約 $0.05。在 7:2:1 的快取命中、輸入與輸出組合下——這是本部落格用於 agent 流量的慣例——混合費率約落在每百萬 token $0.51,而每項 Intelligence Index 任務的成本為 $0.71,在 200 個模型中排名第 27。但要注意的是囉嗦程度:該模型在該 Index 上產生了 160M 輸出 token,而中位數為 92M,因此原始 token 數量高於標價所暗示的水準。

GPT-6 Astra 的定價採分層制,而分層方式才是值得細看的部分。每筆請求的輸入 token 低於 272K 時,價格為 $10.00 與 $50.00;超過此門檻則為 $20.00 與 $75.00。分層取決於每筆請求本身的輸入 token 數量;對於一個以 1M token 上下文為賣點的模型來說,這比聽起來更重要——單一次大上下文呼叫就會跨過門檻,並使整筆請求的費率加倍。快取讀取為每百萬 $1.00,相當於 90% 折扣;快取寫入為每百萬 $12.50。在相同的 7:2:1 混合比例下,混合費率約為每百萬 token $7.70,而每個 Index 任務的成本為 $3.26,在 200 個中排名第 71。

Astra 在冗長程度上則往相反方向走,而且是這裡較簡潔的模型:在 Index 上為 6,000 萬輸出 token,相較於 Step 5 Preview 的 1.6 億,在該指標上於 200 個模型中排名第 27。更少的 token 搭配更高的費率,以原始倍數所誇大的方式縮小了差距。它並未消除差距——每任務成本數據已經把冗長程度、快取行為與定價一併抵銷計算,而 3.26 美元對上 0.71 美元仍然是 4.6 倍的差距。

九個指數點能買到什麼

Astra 的頭條數據源自 OpenAI 自家且未經重現:GPQA Diamond 上 96.1、OSWorld 2.0 上 72.6%、FrontierMath Tier 4 上 97.6%、搭配工具時在 Humanity's Last Exam 上 57.2%,以及 Terminal-Bench 4.0 上約 57.9%。ARC-AGI-3 的數字則是最需要小心處理的一個——OpenAI 在自家的供應商轉接器測試框架下回報 99.9%,在標準測試框架下則是 62.7%,而不同測試框架之間出現 37 個百分點的擺盪,這至少同樣是在說明測試框架本身,而不只是在說明模型。

Step 5 Preview 公佈的數字在它為之構建的代理任務上落在相同的區間,並帶有同樣的但書:Terminal-Bench 4.0 上為 33.3%,ProgramBench 上為 80.5,DeepSWE v1.1 上為 67.7,StepCodeBench 上為 49.0,全部來自 StepFun,且無一被獨立重現。不同的供應商、不同的測試框架、沒有共用的執行——這正是為什麼獨立測量的九個百分點差距比這些任何數字都更有用。

那個差距是真實的,而且並不小。在一個涵蓋 200 個模型的排行榜上,53 和 44 分別位居第三與第二十四名,而這種差距體現在不同類別的任務上,而不是同一項任務上的分數差異:Astra 已公布的勝績集中在長時程推理與電腦使用,而這正是排行榜頂端拉開差距的地方。如果你的工作負載落在那裡,這九分比帳單更有價值。

關於 Astra 的分數,有一點要注意。Artificial Analysis 會修訂 Intelligence Index,而同一個模型的分數會隨著相隔數週取得的快照而變動——52.8、53 和 54.7 全都出現在同一個月內發表、關於這個模型的資料中。目前模型頁面上的 53 才是應該採用的數字,而任何把較舊的 Astra 快照與目前的 Step 5 Preview 數字並列比較的做法,都是在用兩把不同的尺測量。

Screenshot of the Artificial Analysis model page for GPT-6 Astra, showing OpenAI as the creator with a September 2026 release date, an Intelligence Index of 53 at rank 3 of 200, output speed 59.3 tokens per second at rank 101 of 200, cost per Intelligence Index task $3.26 at rank 71 of 200, verbosity 60M output tokens at rank 27 of 200, pricing of $10.00 per million input tokens and $50.00 per million output tokens with a 90% cache discount, and technical specifications listing reasoning, text and image input, a 1M-token context window and an April 30, 2026 knowledge cutoff.

速度與延遲是兩個不同的問題

在生成速度方面,獨立評測排行榜的結果毫不含糊:Step 5 Preview 每秒輸出 99.8 個 token,而 GPT-6 Astra 只有 59.3,後者也低於受測模型平均每秒 70 個 token 的水準。在互動式程式編寫迴圈中,這正是「隨手拋出建議」與「停頓等待」之間的差別,而且它會像快取折扣一樣,在整個工作階段中不斷疊加放大。

延遲是比較複雜的故事,單一數字會讓人對它產生誤解。Astra 會在輸出之前先進行推理,因此首個 token 的時間與取得可用答案的時間並不是同一種量測,而取決於是否把推理計算在內,它已公布的数字差距很大。在我們自己過去七天的流量中,GPT-6 Astra 的首個 token 時間中位數為 6.72 秒,第 95 百分位數為 10.00 秒——這是呼叫方透過我們的端點實際體驗到的數字。Artificial Analysis 在其自家測試框架上,將 Step 5 Preview 的首個 token 時間定為 2.96 秒,而這兩個數字並不是用相同方式量測的,因此不應將它們相減。

快取不對稱究竟落在何處

這兩個模型都對重複的前綴提供大幅折扣,也都會對寫入這些前綴收費,而它們在讀取上的差異達 20 倍。Step 5 Preview 的 95% 快取折扣讓快取輸入降至每百萬個 token 約 $0.05。GPT-6 Astra 讀取快取為每百萬 $1.00——相較於高十倍的基本費率享有 90% 折扣——寫入則為每百萬 $12.50。

對於每一回合都會重新傳送相同系統提示與儲存庫內容的代理迴圈而言,真正會複合累積的是讀取費率,而較便宜模型上的較深折扣,會比昂貴模型上的較淺折扣更有價值。Astra 的混合成本仍接近每百萬個 token 7.70 美元,相較之下,Step 5 Preview 在相同 7:2:1 混合比例下為 0.51 美元——這是十五倍的差距,長時間工作階段不但不會縮小,反而會擴大。

從一個按鍵同時執行兩者

GPT-6 Astra 已在 OrcaRouter 上線,模型代號為openai/gpt-6-astra,採用 OpenAI 的定價表費率——272K 門檻以下為每百萬 10.00 美元與 50.00 美元,超過門檻則為 20.00 美元與 75.00 美元——零加成原價轉嫁,因此供應商調價當天我們這邊即同步生效,而非等到下一個帳務週期。我們在該端點上自行取得的七日遙測資料,顯示出上述所述 6.72 秒的中位數與 10.00 秒的第 95 百分位首字時間,同時過去一週經由該端點的流量達 277.9M 個 token。

Step 5 Preview 並不在我們的目錄中,我們也不為它提供路由。它跑在 StepFun 自家的 API 與 Studio 上,而在 10 月 15 日那個檢查點到來之前,那是它唯一能運行的地方。這種不對稱並不是這項比較的缺陷;它就是這項比較本身。這場對決中便宜的那一半,正是你必須跑到別處才能呼叫的那一半,而今天就能投入生產的那一半則落在一個涵蓋超過 200 個模型的 API 之後:依上述費率計價的 GPT-6 Astra、以 $1.26 與 $3.96 計價的 GLM-5.3DeepSeek V4 ProClaude Opus 5 以及其他模型,還具備跨供應商的自動容錯移轉,在某家供應商的容量出現變化時仍能維持路徑穩定,而路由 DSL 則讓任務能以低成本起步,只在非升級不可時才升級。那條升級規則,才是應對十倍價差的真正答案:大多數工作負載並不需要排行榜最頂端的模型,而路由層正是讓你不再為不需要頂端的那部分付費的方法。

Screenshot of the OrcaRouter model page for GPT-6 Astra at www.orcarouter.ai/models/openai/gpt-6-astra, showing the model id openai/gpt-6-astra with NEW, FLAGSHIP and FEATURED badges, a 1M-token context and 128K max output, text, image and file input with text output, best-for tags for reasoning, coding and agentic work, input pricing of $10.00 and output pricing of $50.00 per million tokens, a seven-day median time to first token of 6.72 seconds and a 95th percentile of 10.00 seconds, 277.9M tokens of seven-day traffic, and the chat-completions and responses endpoints behind the OrcaRouter API.

該由誰來選擇哪一個

如果你的工作負載是必須正確完成艱難任務的長時程代理——電腦操作、多步驟研究、錯誤答案的代價高於詞元成本的工作——GPT-6 Astra 領先九個百分點只是這個決策中最便宜的一部分,而帳單才是這項能力真正的成本。把它當作升級目標來執行,而不是預設選項,並留意 272K 門檻:單一過大的請求會讓其中所有內容的費率加倍。

如果您的的工作負載是高吞吐量的代理式文字——程式碼生成、重構、結構化擷取、程式設計助理的內層迴圈——Step 5 Preview 在帳單和時鐘在意的一切上都領先,而且九個指數點不太可能在與一個不位於排行榜頂端的任務分佈接觸後倖存。問題不在效能:該模型是專有的,沒有公佈授權、沒有商業使用授權,且在10月15日之前沒有檢查點。你可以呼叫它;你不能擁有它、微調它或發布它的衍生品。

如果答案並不明顯,這個模式就是分層拆分,而不是二選一。將一般流量導向中階模型,並把 Astra 保留給需要頂尖效能的請求——這條規則的兩端在我們這邊都位於同一把金鑰之後,因此這種拆分只需一條路由規則,而不是第二份合約。為中階模型就能正確完成的工作支付旗艦級費率,才是這項比較真正要指出的錯誤。