
Step 5 Preview 正式發表:StepFun 的 600B 旗艦究竟實際推出了什麼,以及還缺少什麼
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
StepFun 於 2026 年 9 月 20 日宣布Step 5 Preview——一款 6000 億參數的稀疏混合專家旗艦模型,每個 token 啟用 270 億參數,具備 100 萬 token 上下文視窗、原生影像輸入,以及 Artificial Analysis Intelligence Index 44 分。API 同日開放。沒有開放的則是模型本身:Hugging Face 儲存庫stepfun-ai/Step-5-Preview-BF16在發布當天下午就已存在,且內容恰好只有一個檔案.gitattributes,沒有權重、沒有授權、沒有模型卡,也沒有設定檔。StepFun 自家資料將開放權重發布時間定在 2026 年 10 月 15 日。所以,對這次發布最誠實的一句話總結是:這個模型今天可以呼叫,大約三個半星期後可以下載,而這是兩件不同的事。這也是本部落格今天稍早以未經宣布的外洩形式報導過的同一款模型,當時在 StepFun 發布產品頁面之前,就以測試標籤進行了基準測試——這提醒我們,預覽版可以從外洩變成正式發布,而任何一個數字都沒有改變。
這個儲存庫只是個佔位符,而這就是事情的全貌。
當廠商發布權重時,儲存庫就是證據。裡面會有授權檔案、內含參數數量的設定檔、載明預期用途與評估表的 README,還有 safetensors 分片——其總大小能告訴你參數量的宣稱是否屬實。stepfun-ai/Step-5-Preview-BF16 這些全都沒有。它在 Hugging Face API 上的紀錄顯示建立時間戳為 2026-09-20T03:52Z、零次下載、兩個讚、空的 config 物件,沒有 pipeline_tag、沒有授權,而且只有單一個同層檔案。StepFun 組織頁面列出了它,卻沒有列出其他任何 Step 5 儲存庫——沒有 FP8 版本、沒有 NVFP4 版本、沒有 GGUF,也沒有六月伴隨 Step-3.7-Flash 推出的任何量化變體。
請把它解讀為時程安排,而不是謎團。儲存庫名稱中的 BF16 後綴就是明顯線索:一個打算先發布 bfloat16 檢查點的實驗室——也就是在 FP8 與 NVFP4 服務版本到來之前,你用來微調與量化的格式——會在建立時就把儲存庫命名成那樣,之後再補上內容。StepFun 已在自家公告資料中表示會在 10 月 15 日。在那之前,該儲存庫只是對一項意圖的宣稱,而它唯一證明的是 StepFun 已保留該命名空間。
這件事有一個實際的理由。預覽後綴與缺失的權重是同一個訊號,指向同一個方向:模型可以呼叫,定價已經拍板,而你可以在自己的硬體上執行的產物還不存在。任何假設能在十月中旬之前自行託管 Step 5 Preview 的計畫,都是背後沒有產物支撐的計畫。
實際上宣布了什麼
StepFun 的定位狹窄而明確:Step 5 Preview 是為真實世界的代理式工作而生的基礎模型——涵蓋 AI 程式設計、軟體工程、專業知識工作與金融——重點放在長上下文、多輪工具呼叫與持續執行,而非聊天品質。該公司完全跳過了 Step 4.x 系列,從 Step-3.7-Flash 直接跳到 Step 5,這本身即表態了它認為這是多大的一步。
有一個日期細節值得提出來,因為這種事很容易打亂採購時程:Artificial Analysis 將這個模型的日期訂為 2026 年 9 月 18 日,比 StepFun 自家發布公告早了兩天。這個榜單是在能夠取用某個模型時才對它評分,而那兩天的差距,就是模型變得可以呼叫與供應商撰文介紹之間常見的時滯。StepFun 的公告——9 月 20 日,API 與 Studio 同日開放——才是應該引用的日期,而 10 月 15 日的權重日期則出自同一批資料。
已發布的規格:
• 總參數量 — 600B,稀疏混合專家
• 每個 token 的活躍參數 — 27B,約佔總數的 4.5%,是異常稀疏的比例
• 上下文視窗 — 100 萬個 token
• 輸入 — 原生支援文字與圖片;輸出僅限文字
• 推理 — 是,使用擴展思考
• 價格 — 每百萬輸入 token $1.00,每百萬輸出 token $2.70,並享有 95% 快取折扣
• 可用性 — API 與 Studio 自 9 月 20 日起開放;權重預定於 10 月 15 日發布
StepFun 主打的效率主張是,600B/27B 的拆分讓模型站上帕雷托前沿——也就是每單位運算所能換得的能力——而該公司將此定位為同一項追求的第三個世代,從 Step-3.5-Flash 到 Step-3.7-Flash,再到這一代。這是一套連貫的敘事,而稀疏比例正是背後的機制:在 27B 啟用參數下,每 token 的服務成本落在規模小得多的模型區間,而 600B 的總參數量主要只是記憶體佔用的問題。
廠商聲稱,以及旁邊的第三方數據
發布資料中出現兩類數字,不應以相同方式解讀。StepFun 自家的評估屬於第一類:一項單一任務成本聲稱,為 Claude Opus 5 的八分之一;在 ALE-CLI、FrontierFinance 和 DRACO 上,排名第二,落後於 GPT-6 Astra 或 Claude Opus 5;一場為期 24 小時的 GPU 核心優化運行,將 MLA 核心峰值效能提升至 508 TFLOPS,而 Claude Opus 5 為 493;一項自動化後訓練實驗,使 Qwen3-30B-A3B 在 AIME24 上從 53.3% 提升至 60%;DeepSWE v1.1 達 67.7%,其內部 StepCodeBench 達 49.0%。StepFun 自行建構了 StepCodeBench——553 個程式碼儲存庫、九種任務類型、33 種程式語言——這使其成為衡量自家模型的合理工具,而非獨立工具。
第二類是由別人測量的,而這正是必須據以規劃的部分。Artificial Analysis 在 Intelligence Index v4.3.2 上給 Step 5 Preview 打了 44 分,將其排在 200 個模型中的第 24 名——與 Kimi K3 持平,落後 GLM-5.3 一分,並與 Claude Opus 5 的中等推理強度設定持平。在 Terminal-Bench 4.0 上,同一份榜單記錄到 33.3%,領先 DeepSeek V4.1 Flash 的 26.8%,也大幅領先 Kimi K3 約 12.6%。輸出速度測得每秒 99.8 個 token,首個 token 時間為 2.96 秒——兩者都來自同一次獨立測試,也都是決定 agent 迴圈是否感覺具互動性的那類數字。
第三方數據中有一項往反方向發展,值得與價格並列來看。同一輪索引測試中,Step 5 Preview 使用了 1.6 億個輸出 token,而所有受評模型的中位數為 9,200 萬個——這個模型很囉嗦。以每百萬輸出 token 2.70 美元計算,這種囉嗦並非免費:1.6 億個輸出 token 大約佔該輪測試總花費 922.84 美元中的 432 美元,而若用在收費高出三倍的模型上,這會是帳單上最大的一筆。低廉的標價與每項任務的高 token 用量是同一個數字的兩半,而每項索引任務的成本——0.71 美元——正是已同時包含這兩者的那個數字。

這份外洩資料說對了什麼,以及它未能釐清的一件事
本部落格先前的報導是根據一份在任何公告之前就出現的評測執行結果所寫,並且標示出它無法確認的說法。該公告釐清了其中大部分。600B/27B 這組數字現在是廠商明述,而非推論而來。1M token 上下文視窗現在已列於 StepFun 自家的規格中,而非僅見於第三方看板。$1.00 與 $2.70 的價格就是定價。名稱是 Step 5 Preview,不是傳聞中的替代名稱。
這份公告沒有做到的是,解決洩漏報導所提出的上下文視窗矛盾。開發者工具中流傳著另一份第三方設定,將該模型列為具備 350,000 個 token 的上下文,最大輸出為 64,000 個 token。1M 視窗和 350k 視窗是不同產品,記憶體成本也不同,而 64k 的輸出上限,對這款模型所主打的那種長時程代理式工作而言,正是硬性限制。StepFun 的公告說的是 1M,且未提及輸出上限。在建構依賴這個答案的流程之前,值得先知道你的路由最終會落在哪一個;而這個問題該去查供應商的文件,而不是排行榜。
這次發布沒有改變的另一件事,是獨立重現。上方每一列不是來自 Artificial Analysis 的基準測試資料,都是 StepFun 自家的,跑在 StepFun 的測試框架上,而且沒有第三方重現過這些代理式結果。今年中國實驗室旗艦模型的模式是:彙總指標站得住腳,而廠商主打宣傳的列則會漂移;請把彙總指標當作規劃時採用的數字。
今天就能呼叫的項目,以及在此期間該改為路由的項目
Step 5 Preview 並不在我們的目錄中,OrcaRouter 也不提供它的路由——StepFun 那邊有公開 API 和 Studio,那才是它運作的地方。我們真正擁有的,是它被拿來衡量的那一組模型,全都透過同一把金鑰取得:DeepSeek V4.1 Flash 每百萬輸入 $0.15、輸出 $0.60,GLM-5.3 為 $1.26 與 $3.96,對比 Z.ai 公布的 $1.40 與 $4.40,Claude Opus 5 為 $5.00 與 $25.00,還有 Kimi K3 與它們並列。這就是接下來三週的實際樣貌:一個你可以拿來做基準測試的預覽版,以及一組你真正能夠依賴的正式環境模型,可透過單一 API 觸及超過 200 個模型,並以 0% 加成直接傳遞供應商定價——因此,若 StepFun 的定價在十月前有變動,你應付的金額會在同一天跟著變動,而不是等到續約時才調整。
自動容錯移轉在這個時間窗口內比平時更有價值,因為預覽版的失效模式不是它很糟——而是它受到容量限制。一個在發布當天就開放 API、但還沒有權重的模型,是服務叢集仍在建置中的模型;而一個在凌晨兩點會效能劣化的預覽端點,會連帶拖垮你的代理迴圈。把預覽版放在路由器後面,並以經過驗證的模型作為備援,你就能在自己的工作負載上取得品質訊號,而不必把生產路徑押在未經證實的服務叢集上。

重要的日期是10月15日
以上種種在某個特定層面上都只是暫時的:權重才是讓模型成為永久存在的那個東西。$1.00 與 $2.70 的封閉預覽,對單一供應商而言是好價格;而一份在已公布授權下的 BF16 檢查點,則是任何單一供應商都已無法掌控的價格。StepFun 已承諾在 10 月 15 日實現後者,而它已經預留的儲存庫名稱,開頭寫的就是 bfloat16。
從現在到那時值得關注的事項既有限又可供查核。儲存庫是否會被填滿——以及採用什麼授權條款?設定檔是否確認總量 600B、啟用 27B?StepFun 是否會連同上下文視窗一併公布輸出上限,解決 350k/64k 的疑問?當預覽版去掉後綴後,價格是否仍能維持?這四個答案將決定 Step 5 Preview 會成為你自行託管的模型、你租用的模型,還是你跑過一次基準測試便略過的模型。在儲存庫中除了僅有一個 .gitattributes 之外還有更多內容之前,這項公告是故事的開端,而不是結尾。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
