
Step 5 Preview 對決 GLM-5.5:一款模型今日登場,另一款仍是紙上談兵
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Step 5 Preview於 2026 年 9 月 20 日開放其 API,正好是 StepFun 宣布它的同一天,而你今天下午就能透過單一端點呼叫它,價格為每百萬個輸入 token 收費 1.00 美元、每百萬個輸出 token 收費 2.70 美元。GLM-5.5並不存在。沒有模型卡、沒有 API 識別碼、沒有定價、沒有檢查點,也沒有授權檔案,而且 Z.ai 上沒有任何頁面使用這個名稱——因為 GLM-5.5 是社群簡稱,該公司從未採用過。這種不對稱正是本文的重點。接下來要談的是 StepFun 實際推出的內容、關於 Z.ai 下一代旗艦模型確切已確立的事實,以及你今天就能實際執行、取代標題中那場對決的正面較量。
GLM-5.5 是什麼,以及它不是什麼
這個名稱在2026年年中開始流傳,並附帶一個發布時間窗口,而這個窗口有可追溯的起源:一份於2026年6月25日轉述的分析師預測,將Z.ai的下一款旗艦產品指向八月。那是個觀察窗口,並非廠商的承諾,而八月過去了,它並未現身。Z.ai實際推出的反而是GLM-5.3,於8月14日發布,其API約在8月18日上線,開放權重則於8月28日釋出,接著是8月26日的GLM-5.3-Flash。在該廠商自家的Hugging Face組織中,並未出現任何GLM-5.5檢查點,那裡最新的儲存庫仍止於GLM-5.3系列。
命名同樣懸而未決。GLM-5.3、GLM-5.4、GLM-5.5 與 GLM-6 都曾在同一段時間內被提出,而 Z.ai 對這些名稱一概未予證實。公司方面唯一的訊號,是共同創辦人提及一次「epic plus」發布——那是一種氛圍,而非具體規格。分析師解讀該廠商的節奏——大約每 54 到 70 天推出一款旗艦——如今預測下一款模型將落在 2026 年 10 月 8 日至 11 月 9 日的區間,並預期其編號會是 GLM-5.4,而非 GLM-5.5。
有三項說法在外流傳,彷彿已獲證實,而這三項都值得精確以對。參數量這項最站不住腳:沒有任何官方說法支持「超過 1 兆」這個數字,而後來在社群貼文中把它膨脹到 3 兆以上的說法,則完全沒有引用任何來源。1M token 的上下文長度是最安全的假設,因為 GLM-5.2 與 GLM-5.3 都具備這項規格。開放權重是一種期待,而非承諾——Z.ai 過去幾代旗艦模型都釋出了權重,這是一種模式,而非保證。
Step 5 Preview 實際上推出了什麼
StepFun 的模型是這場比較中具體的那一半,而其規格相當不尋常。它是一個稀疏專家混合模型,總參數量 600B,每個 token 約有 27B 處於活躍狀態——激活比率接近 4.5%——建構於一個 92 層的窄而深 Transformer 之上,並採用稀疏分組查詢注意力與區塊式 token 合併。上下文視窗為 1M tokens,輸入是文字與圖像,輸出是文字,並以延伸思考進行推理。StepFun 跳過了整個 Step 4.x 系列才走到這裡,直接從 Step-3.7-Flash 跳到 Step 5。
• Intelligence Index — 於 Artificial Analysis 為 44,在 200 個受評模型中排名第 24,中位數為 24
• 輸出速度 — 每秒 99.8 個 token,在 200 個中排名第 45
• 首個 token 的時間 — 在同一次獨立執行中為 2.96 秒
• 價格 — 每 100 萬輸入權杖 $1.00,每 100 萬輸出權杖 $2.70,並享 95% 快取折扣
• 每個 Intelligence Index 任務的成本 — $0.71,200 個中排名第 27
• 權重 — 今日無;BF16 檢查點預定於 2026 年 10 月 15 日
• 授權 — 未發布。該模型為專有,未載明商業使用授權、再散布權或微調許可。
價格是引人注目的那一列,而另一列對 StepFun 的好處也不如乍看之下那麼大:在 Intelligence Index 上輸出 160M 個 token,對比中位數 92M,以該指標而言在 200 個中排名第 64。這個模型很冗長,而冗長正是在它主打販售的 agentic 工作負載中會造成成本倍增的因素。$0.71 的每任務成本數字已經把這點計算進去,這就是為什麼它比標價更值得引用,也是更誠實的數字。
StepFun 自家的評估結果未經重現,在有人獨立跑過之前,都應視為廠商資料來看待。他們把該模型在 ALE-CLI 上列為 29.5,在 FrontierFinance 上為 66.4,在 DRACO 上為 83.3,在 ProgramBench 上為 80.5,在 DeepSWE v1.1 上為 67.7,在 StepCodeBench 上為 49.0,另在 Terminal-Bench 4.0 上為 33.3%,在 GDPval-AA v2 上為 1571。StepFun 也回報,在一項 24 小時的 GPU kernel 最佳化任務中達到 508 TFLOPS 的 MLA 峰值,相較之下 Claude Opus 5 為 493。這些都是 StepFun 針對一個 StepFun 尚未公開的模型所給出的數字。

你可以改跑以取代這個的一對一對決
如果你想要標題所承諾的比較,誠實的替代方案是 Step 5 Preview 對上 GLM-5.3——Z.ai 實際推出的模型,仍是其當前開源旗艦,也是任何 GLM-5.5 會取代的那個。在獨立排行榜上,兩者只差一分。在其他幾乎所有方面,它們都不是。
• 智慧指數 — Step 5 Preview 44 對比 GLM-5.3 45
• 參數 — 總計 600B/啟用 27B 對比 總計 753B/啟用 40B
• 輸出速度 — 99.8 tokens/秒 對比 72.1 tokens/秒
• 首個 token 時間 — 2.96 秒對比 2.99 秒
• 每 100 萬個 token 的價格 — 輸入 $1.00 / 輸出 $2.70,對比輸入 $1.40 / 輸出 $4.40
• 快取折扣 — 95% 對 81%
• 每項 Intelligence Index 任務的成本 — $0.71 對比 $2.01
• 輸入模態 —— 文字與圖像 vs 僅文字
• 授權條款 — 未公佈任何授權條款,對比一個並非 MIT 的 Z.ai 自訂授權條款
這個態勢重複了 Step 5 Preview 發布時所建立的模式,而這模式在每一個曾與它對比評測的已推出模型上都成立:決定性的效率領先,以及能力上的統計平手。它生成 token 的速度約快 38%,雙向每百萬 token 的成本約只需一半,而對上 GLM-5.3 時,每個索引任務的成本便宜 2.8 倍——儘管得分低了一分。在排行榜上,那個 44 分也讓它與 Kimi K3 並列,這點值得先知道,再決定是否把兩者之一視為領先者。
Step 5 Preview 明確落後的那一列,正是你無法進行基準測試的一列。GLM-5.3 有授權條款檔案與可下載的權重;Step 5 Preview 則有一個 Hugging Face 儲存庫,裡面只含一個 .gitattributes,以及針對 BF16 檢查點所載明的 10 月 15 日這個日期。如果 Z.ai 的下一款旗艦模型以開放權重推出,並沿用其整年來一直使用的相同自訂條款,它就會落入 Step 5 Preview 目前唯一沒有答案的類別——而這正是 GLM-5.5 的比較值得等待、而非立即進行的真正原因。

為什麼等待 GLM-5.5 才是代價高昂的選擇
一個已經「還要再等兩個月」等了兩個月的模型,其實際問題在於:你的評估工作無法跟著它一起等。GLM-5.5 沒有端點,因此無法對它做基準測試、價格比較、負載測試,也無法把它放在備援規則後面。圍繞它規劃的每一週,都是因為一份預測而延後一週的決策——而那份預測已經錯過一個窗口。
相較之下,GLM-5.3 已在 OrcaRouter 上線,型號代碼為 z-ai/glm-5.3,輸入價格為 $1.26、輸出價格為 $3.96,對照 Z.ai 自家頁面上的 $1.40 與 $4.40 定價。這是零加價的原價轉嫁,也就是說,你看到的數字是供應商目前的費率,而不是我們自行設定的價格;供應商調價時,我們這邊當天就會同步生效,而不是等到下一個帳單週期。
Step 5 Preview 不在我們的目錄中,我們也不提供它的路由。它運行於 StepFun 自家的 API 與 Studio,而在 10 月 15 日的檢查點到來之前,那是它唯一運行的地方。在此期間,OrcaRouter 能為你提供的,是那項比較另一側的一切透過單一 API 即可存取超過 200 個模型:以上述費率提供的 GLM-5.3、GPT-6 Astra、DeepSeek V4 Pro、Claude Opus 5 以及其他模型,並具備跨供應商的自動容錯移轉,在預覽版的容量曲線仍屬未知之際,讓生產路徑保持穩定;而路由 DSL 則能將其中數個模型組成單一呼叫,而不必再另外做一次整合。用同一把金鑰將預覽版與生產模型做基準測試;讓生產路徑維持原狀。

什麼會改變答案?
兩個日期決定了這件事。10 月 15 日是 StepFun 所說 Step 5 Preview 的 BF16 檢查點發布之日,而隨之附帶的授權條款,則是這項比較中影響最為重大的未知數——寬鬆的授權會讓那 2.8 倍的每任務成本優勢成為你所擁有、而非租用的東西,並抹去 GLM-5.3 明顯領先的唯一一個面向。限制性的授權則會讓 GLM-5.3 成為這兩者中唯一能讓你據以打造產品的一個,並把那一分的差距化為無關緊要的枝節——畢竟這兩個模型,你本來就會以不同的方式使用。
第二個是針對 Z.ai 下一代旗艦、從 10 月 8 日到 11 月 9 日的分析師觀察窗口;它可能叫 GLM-5.5,也可能不叫,可能與傳聞相符,也可能不。如果它真的問世,它會以一個附有授權與檢查點的模型登場——這正是 Step 5 Preview 缺少的兩樣東西——屆時這項比較才會真正成立。
在兩者都獲得解決之前,有用的問題並不是兩者之中哪一個更好,因為其中一個無法執行。而是你現在應該以哪一個現有模型為基礎來建構,以及當下一個檢查點出現時,答案是否會改變。這個問題本週有一個可檢驗的答案,而且不需要等到某個名稱變成模型。
本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
