為 Step 5 Preview 生成的標題卡,寫著「Step 5 Preview — 目前為止的洩漏」,以標籤與數值列的形式列出六項規格:總參數約 600B,每次推論啟用約 27B,輸入文字與圖像,上下文視窗 1M tokens,AA Intelligence Index 44,以及價格每 1M tokens 輸入 $1.00、輸出 $2.70。頁腳寫著「所有數據均為第三方且未經審計 - StepFun 尚未宣布此模型。」OrcaRouter 標誌位於右下角。
Guides & Insights

Step 5 預覽:StepFun 尚未發表的 600B 旗艦模型已登上排行榜

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Step 5 Preview擁有排行榜名次、已公布的價格、實測輸出速度,以及 44 分的 Intelligence Index 分數——與Kimi K3相同,而後者規模大約是它的五倍。它沒有的,是正式發布。StepFun 尚未宣布它,StepFun 自家的平台文件也未列出它,而且沒有權重可下載。以下每一項數字都來自第三方,該第三方在廠商公開發表任何說法之前就取得了存取權,這使得本文是一篇「目前已知」的整理報導,而非評測。請把這些數字視為即將到來之事的證據,而不是規格表。

洩密本身就是新聞

Step 5 Preview 的第一個公開蹤跡是一次評測執行。Artificial Analysis 為它開設了即時模型頁面,透過 StepFun 自家的 API 以測試標籤 step-5-preview-b 進行評分,該平台並將此模型的日期標定為 2026 年 9 月 18 日。本文中的 44、定價、速度測量值以及各項基準測試列,皆出自該頁面。

相對之下,供應商這一邊卻是一片空白。StepFun 的開發者文件列出模型只到 Step 3.7 Flash 與 Step 3.5 Flash 就停了——沒有step-5,也沒有預覽項目。stepfun-ai 的 Hugging Face 組織沒有 Step 5 的儲存庫,這與其說是疏忽,不如說符合封閉權重旗艦模型的情況。中國開發者論壇上的社群回報指出,9 月 19 日在上海舉行的 AGI Frontier 活動上可能會有發表,而那大約是在這些評估出現後一天。截至撰稿時,StepFun 之外的任何人都還沒有正式規格、正式價格,或出貨版本的正式名稱。

命名本身就是第一個線索,顯示這是預覽版而非正式發表。StepFun 完全跳過了 Step 4.x 系列,直接跳到 Step 5。一款以 Preview 後綴發布、在還沒有產品頁面之前就先行基準測試的模型,代表廠商仍在校準中——定價、路由與使用限制在正式上市前都可能有所變動。

就任何人所能判斷,這份規格看起來是什麼樣子

這些數字正在流傳,而它們是這起洩密事件中被重複最多次的說法——但這並不等同於其中最經證實的說法:

• 總參數量——約 600B,相較於 Kimi K3 的約 2.8T

• 每次推論啟動 — 約 27B,約占總量的 4.5%,是異常稀疏的專家混合比例

• 輸入模態 — 文字與圖像;輸出僅限文字

• 推理 — 是,使用擴展思考

• 上下文視窗 — 在 Artificial Analysis 上為 1M 個 token;一份在開發者工具中流通的獨立第三方組態列出 350,000,最大輸出為 64,000

• 權重可用性 — 已關閉,無儲存庫

那個上下文視窗的矛盾值得直接點明,因為至今沒有任何一方解決它。100 萬 token 的視窗和 35 萬 token 的視窗是不同的產品,記憶體成本也不同,而第二個數字還附帶 64k 的輸出上限,第一個則對此隻字未提。如果你正打算憑著 100 萬這個數字來規劃長文件處理流程,那麼 350k 這個配置正是你該等待官方頁面說明的原因。參數量的情況也有類似的模糊性:DataLearner 的追蹤頁仍將 Step 5 Preview 的 MoE 架構與參數量列為無法取得,這意味著 600B/27B 這組數字——關於這個模型最常被引用的單一事實——同時也是官方確認程度最低的資訊之一。

有趣的數字是 27B,而不是 600B

稀疏混合專家模型只會把運算花在詞元實際路由到的專家上,因此真正決定模型在正式環境中行為的是啟用參數數量。Step 5 Preview 以約 27B 的啟用參數,每個詞元的運算量與規模僅為其幾之一的模型落在同一級距,而 600B 的總參數則主要是記憶體佔用問題。

隨之而來有兩項後果,而兩者都體現在第三方測量中。服務成本與啟用參數數量相關,這也是價格落在目前水準的部分原因。而每詞元速度也同樣受益:Artificial Analysis 測得每秒 99.8 個輸出詞元,在 200 個模型中排名第 42,而中位數為 64.6。首詞元時間為 2.96 秒,中位數約為 3.57 秒。如果 600B/27B 的拆分準確,這是一個為了服務成本低廉、而非託管成本低廉而設計的模型——如果你付費的是 GPU 而不是詞元,這是一項重要區別。

它在智慧指數上的落點

Artificial Analysis 在 Intelligence Index v4.3 上給予 Step 5 Preview 44 分,該指數納入了十項評估。這在榜上 200 個模型中排名第 25,且遠高於該指數所評分模型的中位數,後者落在 25。

• 智慧指數 — Step 5 Preview 44 對比 Kimi K3 44

• 正上方 — GLM-5.3Claude Opus 5,兩者皆為 45

• 緊接在下方——DeepSeek V4.1 Flash 為 40,DeepSeek V4 Pro 為 36

• Terminal-Bench 4.0 — Step 5 Preview 33.3%,對比 Kimi K3 約 12.6%,以及對比 DeepSeek V4.1 Flash 的 26.8%

• SciCode — Step 5 Preview 為 59%,與 Kimi K3 持平

• 輸出速度 — 每秒 99.8 個 token,同領域中位數為 64.6

頭條是與 Kimi K3 打成平手,但誠實的解讀比頭條所暗示的更狹隘。以總計 600B 的規模,在彙總指數上與 2.8T 參數模型匹敵,確實是一項真實的效率成果,但彙總數據掩蓋了它的樣貌:Terminal-Bench 4.0 中有利於 Step 5 Preview 的差距極為懸殊,而 SciCode 的結果則是難分軒輊。指數上的總體持平不等於處處持平,而預覽版建置正是最不適合假設這些差距會維持下去的時候。

還有一個值得點出的出入:Artificial Analysis 報告 44,而 DataLearner 的獨立追蹤器則把同一輪測試記錄為 43.6。這是四捨五入的差異,而不是對能力有不同看法,但這種情況正好說明了這個模型數字整體上的問題——它們是對一個尚未公布的模型所做的第三方讀數,取得時間略有不同,而且沒有任何一項獲得 StepFun 確認。這些基準測試全都不是廠商自行回報的,而這有一體兩面:StepFun 沒有人在此宣稱過任何數字,也沒有人為任何一個數字背書。

Screenshot of the Artificial Analysis model page for Step 5 Preview, headed 'Step 5 Preview Intelligence, Performance & Price Analysis', showing StepFun as the creator, a release date of September 2026, an Intelligence Index of 44 at rank 25 of 200, an output speed of 99.8 tokens per second at rank 42 of 200, input pricing of $1.00 and output pricing of $2.70 per million tokens with a 95% cache discount, $0.71 per Intelligence Index task, verbosity of 160M output tokens, and technical specifications listing reasoning as supported, input modality as text plus image, and a 1M token context window.

價格,以及蠶食它的冗言贅語。

定價是這次外洩中最快影響預算的部分。透過 StepFun 的 API,Artificial Analysis 記錄了以下內容:

輸入 — 每百萬個 token 1.00 美元,相較之下,同類模型的中位數為 1.88 美元

• 輸出 — 每百萬個字符 2.70 美元,而中位數為 10.00 美元

• 快取 — 95% 快取折扣,使快取命中約為每百萬個 token $0.05

• 混合計價——在快取命中:輸入:輸出為 7:2:1 的比例下,每百萬個 token 約 $0.51

• Intelligence Index 每項任務成本 — $0.71

• 完整索引執行的成本 — 總計 $918.34

輸出價格為 $2.70 是最重要的一項,因為它不到 Kimi K3 對同樣一百萬個詞元所收取 $15.00 的五分之一。但有一個逐詞元比較所掩蓋的陷阱,而 Artificial Analysis 直接衡量它:冗長度。Step 5 Preview 產生了 1.6 億個輸出詞元來完成 Intelligence Index,相較之下,該領域的中位數為 9,000 萬,且在該指標上排名為 200 之中的第 65 名。

把這個算清楚。以每百萬 $2.70 計算,160M 輸出 token 大約是 $432——大約是整個索引執行總成本 $918.34 的一半,花在模型自身的冗長輸出上,而不是在任務上。把同樣的 160M token 透過 Kimi K3 的 $15.00 輸出費率來計算,你就會得到 $2,400,這就是價格優勢的來源。但實際的警告是給那些透過從不同模型取得 token 數量來估算成本的人:Step 5 Preview 的輸出量大約是中位數的 1.8 倍,所以輸出密集的工作負載同時買到了更便宜的費率和更多的 token。折扣仍然存在,但它比 $1.00/$2.70 對比 $3.00/$15.00 看起來的要小,而且折扣的大小完全取決於你的提示讓模型變得多麼健談。

95% 的快取折扣是另一項手段,而且它積極得異乎尋常。對於提示重複使用率很高的工作負載——例如冗長的系統提示、固定的文件、共用的程式碼庫——其成本會遠更接近混合後的 $0.51,而非 $1.00 的輸入費率。那個混合數字假設了 7:2:1 的比例,這是一項建模假設而非保證,但用它來套算你自己的流量,在算術形式上仍是正確的做法。

A generated two-column comparison scoreboard titled 'Step 5 Preview vs Kimi K3 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, total params about 600B, active params about 27B, Terminal-Bench 4.0 33.3%, SciCode 59%, and price $1.00 / $2.70. The right column gives Kimi K3 the rows AA Index 44, total params about 2.8T, active params not disclosed, Terminal-Bench 4.0 about 12.6%, SciCode 59%, and price $3.00 / $15.00. A footer reads 'Step 5 Preview figures third-party via Artificial Analysis and unaudited; Kimi K3 figures per Artificial Analysis. Prices per 1M tokens.' The OrcaRouter logo sits in the bottom-right corner.

早期測試者正面臨什麼問題

這些是外洩事件前後幾天來自開發者論壇和社群貼文的個別回報,並非測量數據,因此應據此調整其權重:

• 工具呼叫是最常被抱怨的問題——選錯工具名稱,以及在尚未讀取目標檔案前就嘗試編輯

• 據報在上下文超過約 340,000 個詞元後會出現錯誤;若 1M 視窗才是真正的數字,這就是值得留意的失效模式

• 內容篩選會在某些提示上截斷輸出

• 能力評價分歧:部分測試人員認為它優於 GLM-5.3 Flash,其他人則把它排在 DeepSeek V4.1 Flash 之下

一個尚未發布的預覽版建置在工具使用上失敗並不是醜聞——這正是預覽標籤的用途。但這確實意味著,44 不該被解讀為對代理式可靠性的承諾,因為 Intelligence Index 並沒有測試早期測試者最常抱怨的那件事。

你實際上會怎麼稱呼它——以及在那之前該用什麼

OrcaRouter 不會路由 Step 5 Preview。目前沒有公開端點,也沒有權重,因此沒有東西可供路由,而目前也沒有任何第三方平台能誠實地聲稱並非如此。今天任何告訴你該去哪裡呼叫它的人,所描述的都是一個評估端點,而不是一個產品。

用來與它比較的那些模型則是另一回事。Kimi K3、GLM-5.3 和 DeepSeek V4.1 Flash 都可透過 OrcaRouter 取得,與來自 15 家供應商的 199 個模型並列,只需一組 API 金鑰和一份帳單。定價以供應商的定價表原價轉嫁,零加成——這在像這樣的模型上比平常更為重要:如果 Step 5 Preview 的 $1.00/$2.70 在推出時維持不變、之後才變動,走轉嫁路線的價格會在同一天跟著調整,而不是跟著別人的重新定價時程走。

當它真的變成可呼叫的時候,執行一個「準未發布」模型的明智做法,就是執行任何你尚未信任的模型時會採用的做法——放在一條具備自動容錯切換的路由後面,這樣一來,工具呼叫失敗或長上下文錯誤就會落到一個能正常運作的模型上,而不是拖垮你的應用程式。這正是早期報告在此處特別主張的模式:一個據報有工具呼叫問題與長上下文錯誤的預覽版組建,正是你最希望後面有備援的模型,而不是你想讓它獨自待在正式環境路徑上的那種模型。

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models showing 199 models from 15 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a 'How to call any model' card showing a POST request to the OrcaRouter chat completions endpoint.

要怎樣才能讓這件事從外洩變成正式發布?

三件值得關注的事,依它們能釐清多少問題的順序排列。首先,StepFun 自家開發者平台上的模型頁面與定價——一旦step-5出現在模型清單中,供應商的規格表就會取代本文中所有第三方解讀,包括 600B/27B 這組數字以及 1M 上下文的說法。其次,1M 與 350k 上下文矛盾的釐清;在 1M 視窗下僅有 64k 的輸出上限,對任何打造長文件或代理式流程的人來說都是有意義的差異,而這個問題目前仍未解決。第三,這定價究竟是上市姿態還是永久定價——中國旗艦模型的預覽定價向來有在容量吃緊時變動的前例,而每百萬輸出 token 2.70 美元已經積極到足以引人提出這個問題。

至少在那些事情中第一項落地之前,誠實的總結是:Step 5 Preview 看起來像是一款真正高效的模型——總參數 600B,卻能執行 2.8T 級別的總體工作量,價格還比同業低了好幾倍——但規格未經證實,存在實實在在的冗長成本,而且工具呼叫方面的聲譽尚未建立。值得納入規劃。還不值得把正式生產路徑押在它身上。

本文中的比較4

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新