
Step 5 預覽:StepFun 尚未發表的 600B 旗艦模型已登上排行榜
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Step 5 Preview擁有排行榜名次、已公布的價格、實測輸出速度,以及 44 分的 Intelligence Index 分數——與Kimi K3相同,而後者規模大約是它的五倍。它沒有的,是正式發布。StepFun 尚未宣布它,StepFun 自家的平台文件也未列出它,而且沒有權重可下載。以下每一項數字都來自第三方,該第三方在廠商公開發表任何說法之前就取得了存取權,這使得本文是一篇「目前已知」的整理報導,而非評測。請把這些數字視為即將到來之事的證據,而不是規格表。
洩密本身就是新聞
Step 5 Preview 的第一個公開蹤跡是一次評測執行。Artificial Analysis 為它開設了即時模型頁面,透過 StepFun 自家的 API 以測試標籤 step-5-preview-b 進行評分,該平台並將此模型的日期標定為 2026 年 9 月 18 日。本文中的 44、定價、速度測量值以及各項基準測試列,皆出自該頁面。
相對之下,供應商這一邊卻是一片空白。StepFun 的開發者文件列出模型只到 Step 3.7 Flash 與 Step 3.5 Flash 就停了——沒有step-5,也沒有預覽項目。stepfun-ai 的 Hugging Face 組織沒有 Step 5 的儲存庫,這與其說是疏忽,不如說符合封閉權重旗艦模型的情況。中國開發者論壇上的社群回報指出,9 月 19 日在上海舉行的 AGI Frontier 活動上可能會有發表,而那大約是在這些評估出現後一天。截至撰稿時,StepFun 之外的任何人都還沒有正式規格、正式價格,或出貨版本的正式名稱。
命名本身就是第一個線索,顯示這是預覽版而非正式發表。StepFun 完全跳過了 Step 4.x 系列,直接跳到 Step 5。一款以 Preview 後綴發布、在還沒有產品頁面之前就先行基準測試的模型,代表廠商仍在校準中——定價、路由與使用限制在正式上市前都可能有所變動。
就任何人所能判斷,這份規格看起來是什麼樣子
這些數字正在流傳,而它們是這起洩密事件中被重複最多次的說法——但這並不等同於其中最經證實的說法:
• 總參數量——約 600B,相較於 Kimi K3 的約 2.8T
• 每次推論啟動 — 約 27B,約占總量的 4.5%,是異常稀疏的專家混合比例
• 輸入模態 — 文字與圖像;輸出僅限文字
• 推理 — 是,使用擴展思考
• 上下文視窗 — 在 Artificial Analysis 上為 1M 個 token;一份在開發者工具中流通的獨立第三方組態列出 350,000,最大輸出為 64,000
• 權重可用性 — 已關閉,無儲存庫
那個上下文視窗的矛盾值得直接點明,因為至今沒有任何一方解決它。100 萬 token 的視窗和 35 萬 token 的視窗是不同的產品,記憶體成本也不同,而第二個數字還附帶 64k 的輸出上限,第一個則對此隻字未提。如果你正打算憑著 100 萬這個數字來規劃長文件處理流程,那麼 350k 這個配置正是你該等待官方頁面說明的原因。參數量的情況也有類似的模糊性:DataLearner 的追蹤頁仍將 Step 5 Preview 的 MoE 架構與參數量列為無法取得,這意味著 600B/27B 這組數字——關於這個模型最常被引用的單一事實——同時也是官方確認程度最低的資訊之一。
有趣的數字是 27B,而不是 600B
稀疏混合專家模型只會把運算花在詞元實際路由到的專家上,因此真正決定模型在正式環境中行為的是啟用參數數量。Step 5 Preview 以約 27B 的啟用參數,每個詞元的運算量與規模僅為其幾之一的模型落在同一級距,而 600B 的總參數則主要是記憶體佔用問題。
隨之而來有兩項後果,而兩者都體現在第三方測量中。服務成本與啟用參數數量相關,這也是價格落在目前水準的部分原因。而每詞元速度也同樣受益:Artificial Analysis 測得每秒 99.8 個輸出詞元,在 200 個模型中排名第 42,而中位數為 64.6。首詞元時間為 2.96 秒,中位數約為 3.57 秒。如果 600B/27B 的拆分準確,這是一個為了服務成本低廉、而非託管成本低廉而設計的模型——如果你付費的是 GPU 而不是詞元,這是一項重要區別。
它在智慧指數上的落點
Artificial Analysis 在 Intelligence Index v4.3 上給予 Step 5 Preview 44 分,該指數納入了十項評估。這在榜上 200 個模型中排名第 25,且遠高於該指數所評分模型的中位數,後者落在 25。
• 智慧指數 — Step 5 Preview 44 對比 Kimi K3 44
• 正上方 — GLM-5.3 與 Claude Opus 5,兩者皆為 45
• 緊接在下方——DeepSeek V4.1 Flash 為 40,DeepSeek V4 Pro 為 36
• Terminal-Bench 4.0 — Step 5 Preview 33.3%,對比 Kimi K3 約 12.6%,以及對比 DeepSeek V4.1 Flash 的 26.8%
• SciCode — Step 5 Preview 為 59%,與 Kimi K3 持平
• 輸出速度 — 每秒 99.8 個 token,同領域中位數為 64.6
頭條是與 Kimi K3 打成平手,但誠實的解讀比頭條所暗示的更狹隘。以總計 600B 的規模,在彙總指數上與 2.8T 參數模型匹敵,確實是一項真實的效率成果,但彙總數據掩蓋了它的樣貌:Terminal-Bench 4.0 中有利於 Step 5 Preview 的差距極為懸殊,而 SciCode 的結果則是難分軒輊。指數上的總體持平不等於處處持平,而預覽版建置正是最不適合假設這些差距會維持下去的時候。
還有一個值得點出的出入:Artificial Analysis 報告 44,而 DataLearner 的獨立追蹤器則把同一輪測試記錄為 43.6。這是四捨五入的差異,而不是對能力有不同看法,但這種情況正好說明了這個模型數字整體上的問題——它們是對一個尚未公布的模型所做的第三方讀數,取得時間略有不同,而且沒有任何一項獲得 StepFun 確認。這些基準測試全都不是廠商自行回報的,而這有一體兩面:StepFun 沒有人在此宣稱過任何數字,也沒有人為任何一個數字背書。

價格,以及蠶食它的冗言贅語。
定價是這次外洩中最快影響預算的部分。透過 StepFun 的 API,Artificial Analysis 記錄了以下內容:
輸入 — 每百萬個 token 1.00 美元,相較之下,同類模型的中位數為 1.88 美元
• 輸出 — 每百萬個字符 2.70 美元,而中位數為 10.00 美元
• 快取 — 95% 快取折扣,使快取命中約為每百萬個 token $0.05
• 混合計價——在快取命中:輸入:輸出為 7:2:1 的比例下,每百萬個 token 約 $0.51
• Intelligence Index 每項任務成本 — $0.71
• 完整索引執行的成本 — 總計 $918.34
輸出價格為 $2.70 是最重要的一項,因為它不到 Kimi K3 對同樣一百萬個詞元所收取 $15.00 的五分之一。但有一個逐詞元比較所掩蓋的陷阱,而 Artificial Analysis 直接衡量它:冗長度。Step 5 Preview 產生了 1.6 億個輸出詞元來完成 Intelligence Index,相較之下,該領域的中位數為 9,000 萬,且在該指標上排名為 200 之中的第 65 名。
把這個算清楚。以每百萬 $2.70 計算,160M 輸出 token 大約是 $432——大約是整個索引執行總成本 $918.34 的一半,花在模型自身的冗長輸出上,而不是在任務上。把同樣的 160M token 透過 Kimi K3 的 $15.00 輸出費率來計算,你就會得到 $2,400,這就是價格優勢的來源。但實際的警告是給那些透過從不同模型取得 token 數量來估算成本的人:Step 5 Preview 的輸出量大約是中位數的 1.8 倍,所以輸出密集的工作負載同時買到了更便宜的費率和更多的 token。折扣仍然存在,但它比 $1.00/$2.70 對比 $3.00/$15.00 看起來的要小,而且折扣的大小完全取決於你的提示讓模型變得多麼健談。
95% 的快取折扣是另一項手段,而且它積極得異乎尋常。對於提示重複使用率很高的工作負載——例如冗長的系統提示、固定的文件、共用的程式碼庫——其成本會遠更接近混合後的 $0.51,而非 $1.00 的輸入費率。那個混合數字假設了 7:2:1 的比例,這是一項建模假設而非保證,但用它來套算你自己的流量,在算術形式上仍是正確的做法。

早期測試者正面臨什麼問題
這些是外洩事件前後幾天來自開發者論壇和社群貼文的個別回報,並非測量數據,因此應據此調整其權重:
• 工具呼叫是最常被抱怨的問題——選錯工具名稱,以及在尚未讀取目標檔案前就嘗試編輯
• 據報在上下文超過約 340,000 個詞元後會出現錯誤;若 1M 視窗才是真正的數字,這就是值得留意的失效模式
• 內容篩選會在某些提示上截斷輸出
• 能力評價分歧:部分測試人員認為它優於 GLM-5.3 Flash,其他人則把它排在 DeepSeek V4.1 Flash 之下
一個尚未發布的預覽版建置在工具使用上失敗並不是醜聞——這正是預覽標籤的用途。但這確實意味著,44 不該被解讀為對代理式可靠性的承諾,因為 Intelligence Index 並沒有測試早期測試者最常抱怨的那件事。
你實際上會怎麼稱呼它——以及在那之前該用什麼
OrcaRouter 不會路由 Step 5 Preview。目前沒有公開端點,也沒有權重,因此沒有東西可供路由,而目前也沒有任何第三方平台能誠實地聲稱並非如此。今天任何告訴你該去哪裡呼叫它的人,所描述的都是一個評估端點,而不是一個產品。
用來與它比較的那些模型則是另一回事。Kimi K3、GLM-5.3 和 DeepSeek V4.1 Flash 都可透過 OrcaRouter 取得,與來自 15 家供應商的 199 個模型並列,只需一組 API 金鑰和一份帳單。定價以供應商的定價表原價轉嫁,零加成——這在像這樣的模型上比平常更為重要:如果 Step 5 Preview 的 $1.00/$2.70 在推出時維持不變、之後才變動,走轉嫁路線的價格會在同一天跟著調整,而不是跟著別人的重新定價時程走。
當它真的變成可呼叫的時候,執行一個「準未發布」模型的明智做法,就是執行任何你尚未信任的模型時會採用的做法——放在一條具備自動容錯切換的路由後面,這樣一來,工具呼叫失敗或長上下文錯誤就會落到一個能正常運作的模型上,而不是拖垮你的應用程式。這正是早期報告在此處特別主張的模式:一個據報有工具呼叫問題與長上下文錯誤的預覽版組建,正是你最希望後面有備援的模型,而不是你想讓它獨自待在正式環境路徑上的那種模型。

要怎樣才能讓這件事從外洩變成正式發布?
三件值得關注的事,依它們能釐清多少問題的順序排列。首先,StepFun 自家開發者平台上的模型頁面與定價——一旦step-5出現在模型清單中,供應商的規格表就會取代本文中所有第三方解讀,包括 600B/27B 這組數字以及 1M 上下文的說法。其次,1M 與 350k 上下文矛盾的釐清;在 1M 視窗下僅有 64k 的輸出上限,對任何打造長文件或代理式流程的人來說都是有意義的差異,而這個問題目前仍未解決。第三,這定價究竟是上市姿態還是永久定價——中國旗艦模型的預覽定價向來有在容量吃緊時變動的前例,而每百萬輸出 token 2.70 美元已經積極到足以引人提出這個問題。
至少在那些事情中第一項落地之前,誠實的總結是:Step 5 Preview 看起來像是一款真正高效的模型——總參數 600B,卻能執行 2.8T 級別的總體工作量,價格還比同業低了好幾倍——但規格未經證實,存在實實在在的冗長成本,而且工具呼叫方面的聲譽尚未建立。值得納入規劃。還不值得把正式生產路徑押在它身上。
本文中的比較4
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
