
Step 5 Preview 對比 Claude Opus 5:七個指數點,換來七倍帳單
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
StepFun 為Step 5 Preview發布的資料,開頭就提出一項比較性主張:在其上執行單一任務的成本,是同一任務在Claude Opus 5上執行成本的八分之一。如今兩個模型都位於同一個獨立評測榜上,因此這項主張可以被查證,而不是只能爭論。Artificial Analysis 讓兩者各自跑過 Intelligence Index v4.3.2——十項評估——並公布了每次執行的成本,其中 Claude Opus 5 是在其自身最高推理努力設定下計分。Step 5 Preview:指數得分 44,完成該次執行耗費 $922.84。Claude Opus 5:指數得分 51,耗費 $7,274.74。這是以 7.9 倍的費用換取 7 分的分數,而 StepFun 所引用的倍率結果證明是準確的。這個倍率所隱藏的東西才是有趣之處,因為差距主要不是價格差距。它是披著價格差距外衣的冗長度差距,而將兩者分開來看,會改變你該把哪個模型放在哪種工作負載前面。
兩種執行成本、一塊板子,以及它們裡面究竟有什麼
總執行成本是這裡所能取得最純粹的單一比較,因為兩個模型都在相同的測試框架下回答了相同的問題,而且這個數字並非由任何一家廠商產出。它同時也是最可能被誤讀的數字,因此值得進一步拆解說明。
• 指標分數 — Step 5 Preview 44 對比 Claude Opus 5 51,Claude Opus 5 是在其最高推理強度設定下取得該分數
• 完成索引的總成本 — Step 5 Preview $922.84 對比 Claude Opus 5 $7,274.74
在 7:2:1 的快取命中/輸入/輸出混合比例下之混合價格 — Step 5 Preview 每 100 萬個 token 為 $0.51,相較於 Claude Opus 5 的 $3.85
• 索引執行期間產生的輸出權杖 — 步驟 5 預覽 1.6 億 vs Claude Opus 5 1.4 億
• 定價 — Step 5 Preview:輸入 $1.00 / 輸出 $2.70,對比 Claude Opus 5:輸入 $5.00 / 輸出 $25.00
把第三列和第五列放在一起看,算術就不再是單純的價格比較。Step 5 Preview 的混合費率便宜 7.5 倍,牌價費率則在輸入上便宜 5 倍、在輸出上便宜 9.3 倍——所以混合費率起了輸入價格所沒有的作用。這是因為混合費率偏重輸出,而輸出正是兩個模型差異最大的地方。Claude Opus 5 的收費是 Step 5 Preview 輸出費率的 9.3 倍,而且兩個模型都產出大量內容:Claude Opus 5 的輸出 token 為 140M,對比該指數所評分模型的中位數 92M;Step 5 Preview 則為 160M,對比同樣的 92M 中位數。
所以,誠實的解讀比「便宜模型就是撿到便宜」更狹窄。Step 5 Preview 在每個軸向上都更便宜,而且它不是一個節省的模型——相較於它所對比的樣本中位數模型,它多寫了 74% 的輸出,而這正是價格理應懲罰的行為。Claude Opus 5 比中位數多寫了 52%,並且對每一個那些 token 收取 9.3 倍的費用。限制輸出長度的呼叫方,與不限制的人相比,會得到不同的比率。
問題不在於哪個更好,而在於交叉點落在哪裡。
假設這項指標能合理代表你實際送出的工作——長時程代理型任務、程式碼、多步驟工具使用——那麼交叉點便不難說明:Claude Opus 5 每項任務的實用程度至少得高出 7.9 倍,才值得付它的帳單;而在這項指標上,它在滿分 100 分的量表上高出 7 分。這兩個事實未必指向同一方向,因為指標上 7 分的差距,並不等於在每件事上都好了 16%。它是十項評估的匯總,而組成比總分更重要。
這就是為什麼該關注兩個分數的分布形狀,而不是只看頭條數字。Step 5 Preview 在 Terminal-Bench 4.0 的讀數是 33.3%——這是貨真價實的代理任務成果,領先 DeepSeek V4.1 Flash 的 26.8%——但在已公布的紀錄中,還沒有任何內容顯示它能在 Anthropic 模型最擅長的長時程評估上與 Claude Opus 5 匹敵。StepFun 自家的資料在措辭上也承認了這一點:在 ALE-CLI、FrontierFinance 與 DRACO 上,該公司把 Step 5 Preview 排在第二,落後於 GPT-6 Astra 或 Claude Opus 5,但領先比較中的其他開放模型。以五分之一的價格拿下第二名,確實是很好的結果。但它終究不是第一名,而一個模型拿到第二名的任務,通常正是最需要第一名的任務。
另一種不對稱體現在呼叫出錯的時候。一個便宜模型花了四秒、用了 2,000 個 token 卻給出錯誤答案,你要付出的是重試的代價;同樣的錯誤答案若出自每百萬個輸出 token 要價 25 美元的 Claude Opus 5,你要付出的是重試再加上那番斟酌的代價。如果你的流程會在失敗時重試——大多數代理迴圈都會這麼做——那麼每次成功任務的有效成本才是真正關鍵的數字,而它與標價的比例並不相同,因為這兩個模型的失敗率不會一樣。目前還沒有人公布 Step 5 Preview 的這個數字。

規格對比,逐個維度
• Index 分數 — Step 5 Preview 44 對比 Claude Opus 5 51,兩者皆在 Intelligence Index v4.3.2 上,Claude Opus 5 在其最高推理努力設定下
• 每 100 萬個 token 的價格 — Step 5 Preview 輸入 $1.00 / 輸出 $2.70,對比 Claude Opus 5 輸入 $5.00 / 輸出 $25.00
• 快取折扣 — Step 5 Preview 95% 對比 Claude Opus 5 90%
• 上下文 —— 兩者皆為 1M tokens;StepFun 尚未公布輸出上限,而 Anthropic 的輸出上限為 128K
• 輸入 — 兩者皆接受文字與圖片;兩者僅輸出文字
• 輸出速度 — Step 5 Preview 99.8 tokens/秒,對比 Claude Opus 5 的 55.3 tokens/秒
• 控制介面 — Step 5 Preview 開放使用擴展思考;Claude Opus 5 以自適應推理投入度調節鈕取代 temperature 與 top_p
• 權重 — Step 5 Preview 今日關閉;BF16 檢查點預定於 10 月 15 日;Claude Opus 5 全程皆為專有
• 獨立證據 — 兩者皆由 Artificial Analysis 評分;StepFun 的代理型基準測試列由供應商自行執行且未經重現。
有兩列值得說明。速度差距確實存在,而且在實務上比表格所顯示的更大:每秒 99.8 個 token 對上 55.3,代表在相同輸出下,模型完成速度大約快上一倍;而 Step 5 Preview 的首個 token 時間為 2.96 秒,對比同一排行榜上 Claude Opus 5 的 56.84 秒,這又是不同量級的事——不過第二個數字量測的是最高強度推理設定,在這種設定下,模型會先深思熟慮,才會輸出任何內容。這不是正式生產環境呼叫會看到的延遲。若對照標準端點,我們自己的型錄回報 Claude Opus 5 的 p50 首個 token 時間為 6.73 秒;如果你並非刻意要求最大程度的深思推理,這才是你應該據以規劃的數字。
快取折扣那一列,才是默默決定重複工作負載的關鍵,而且它對 Step 5 Preview 較為有利,95% 對 90%。一個每次呼叫都重新傳送相同系統提示與儲存庫內容的代理迴圈,幾乎完全落在這項折扣之內,因此五個百分點的差距會在一段長時間的工作階段中不斷累積。

Claude Opus 5 依然是唯一答案的地方
上述內容沒有任何一點能反駁 Anthropic 的模型。它之所以是這個價格,是因為它做到了這個指數試圖衡量的那件事,而且還名列前茅——在 Intelligence Index v4.3.2 上拿到 51 分,領先 Step 5 Preview 七分,並逼近當前世代領導者的水準。在那些 7 分的總體差距低估了實際差異的工作負載中,往往是那些不容許有第二名答案的情境:長達數小時的重構,而失敗模式是細微的行為改變;一個推理鏈必須可稽核的財務模型;一次遷移,而錯誤決策要在一週後才被發現。在這些情境裡,重試並不便宜,而深思熟慮本身就是產物。
那些差距無關緊要的工作負載,是由許多微小決策構成的:分類與路由步驟、擷取、摘要、測試鷹架,以及代理在兩次真正重要的呼叫之間所做的那上千次呼叫。在這些工作上,一個處於 44 的模型能以一半時間、五分之一輸入價格作答,並不是妥協。它是正確的預設,而昂貴的模型則保留給必須做對的那個步驟。
執行拆分而不執行兩個整合
這種比較的實務版本是分層式管線,而團隊之所以沒建置這樣的做法,原因在於採購而非工程——兩家供應商、兩份合約、兩套 SDK、兩把需要輪替的金鑰。Claude Opus 5 在我們的目錄中,價格為 $5.00 和 $25.00,而你可能會放在它前面的較便宜文字模型也在同一份目錄裡,全部透過一把金鑰存取超過 200 個模型,並以 0% 加成直接轉嫁供應商定價。Step 5 Preview 不在那份清單上——它跑在 StepFun 自家的 API 上,而在權重釋出之前,那是它唯一能運行的地方。在我們確實有路由的模型之間組合分層,是路由 DSL 運算式而非程式碼變更——將例行呼叫送往小型模型,在信心或複雜度條件成立時升級到昂貴的模型,並讓兩條路徑都待在相同的端點後面。
自動容錯移轉在這裡之所以重要,是有其特定理由,而非只是個通用功能。Step 5 Preview 在發表當天就開放了 API,既未公布權重,也未揭露服務機群;它是個才問世幾天的預覽端點,而預覽端點在容量上所受的限制,是成熟端點所沒有的。Claude Opus 5 由許多獨立供應商提供服務,這正是預覽版無法提供的備援。將經過驗證的模型保留為備援的一環——在我們這邊,這意味著選用目錄中的正式生產模型,而非預覽版——這正是讓你在自有工作負載上取得真實品質訊號的方法,同時不必讓你的生產路徑依賴一個仍在調整規模的機群。

決策規則
如果你的工作量是少量極度困難的任務,Claude Opus 5 就不是昂貴的選項——它是便宜的那個,因為第二好的答案所付出的代價,比這個差額還要高。如果你的工作量是大量普通任務,其中只夾雜少量困難任務,那麼每百萬字元 $1.00 與 $2.70、附帶 95% 快取折扣的 Step 5 Preview 才是更好的預設選擇,而那 7 個百分點的差距,對於根本不需要它的工作來說,多半只是四捨五入的誤差。
會改變那項計算的,是關於失敗率以及長時程代理型任務列的獨立證據。StepFun 自家的數字讓該模型在其發表時所圍繞的各項評估中名列第二,而沒有任何第三方重現過這些數字。請關注 10 月 15 日的檢查點,留意兩件事:授權條款是否允許你進行微調,讓你能用自家資料彌補 7 個百分點的落差;以及一旦預覽版後綴拿掉後,那種冗長程度是否仍會維持。第一件事會改變那個比率;第二件事已經讓它變動過一次。
