生成了一張標題卡,標題為「Step 5 Preview 對比 GLM-5.5——一個已推出,一個尚未推出」,包含兩欄:Step 5 Preview 位於 AA Index 44,總計 600B/活躍 27B,價格 $1.00/$2.70,輸出 99.8 tokens/秒,且自 9 月 20 日起提供上線的 API;GLM-5.5 的各列則顯示沒有模型卡、沒有 API 識別碼、沒有定價,也沒有已確認的名稱。頁腳寫著「Step 5 Preview 數據依據 Artificial Analysis;GLM-5.5 是未公告、未發布的模型。」
Guides & Insights

Step 5 Preview 對決 GLM-5.5:一款模型今日登場,另一款仍是紙上談兵

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Step 5 Preview於 2026 年 9 月 20 日開放其 API,正好是 StepFun 宣布它的同一天,而你今天下午就能透過單一端點呼叫它,價格為每百萬個輸入 token 收費 1.00 美元、每百萬個輸出 token 收費 2.70 美元。GLM-5.5並不存在。沒有模型卡、沒有 API 識別碼、沒有定價、沒有檢查點,也沒有授權檔案,而且 Z.ai 上沒有任何頁面使用這個名稱——因為 GLM-5.5 是社群簡稱,該公司從未採用過。這種不對稱正是本文的重點。接下來要談的是 StepFun 實際推出的內容、關於 Z.ai 下一代旗艦模型確切已確立的事實,以及你今天就能實際執行、取代標題中那場對決的正面較量。

GLM-5.5 是什麼,以及它不是什麼

這個名稱在2026年年中開始流傳,並附帶一個發布時間窗口,而這個窗口有可追溯的起源:一份於2026年6月25日轉述的分析師預測,將Z.ai的下一款旗艦產品指向八月。那是個觀察窗口,並非廠商的承諾,而八月過去了,它並未現身。Z.ai實際推出的反而是GLM-5.3,於8月14日發布,其API約在8月18日上線,開放權重則於8月28日釋出,接著是8月26日的GLM-5.3-Flash。在該廠商自家的Hugging Face組織中,並未出現任何GLM-5.5檢查點,那裡最新的儲存庫仍止於GLM-5.3系列。

命名同樣懸而未決。GLM-5.3、GLM-5.4、GLM-5.5 與 GLM-6 都曾在同一段時間內被提出,而 Z.ai 對這些名稱一概未予證實。公司方面唯一的訊號,是共同創辦人提及一次「epic plus」發布——那是一種氛圍,而非具體規格。分析師解讀該廠商的節奏——大約每 54 到 70 天推出一款旗艦——如今預測下一款模型將落在 2026 年 10 月 8 日至 11 月 9 日的區間,並預期其編號會是 GLM-5.4,而非 GLM-5.5。

有三項說法在外流傳,彷彿已獲證實,而這三項都值得精確以對。參數量這項最站不住腳:沒有任何官方說法支持「超過 1 兆」這個數字,而後來在社群貼文中把它膨脹到 3 兆以上的說法,則完全沒有引用任何來源。1M token 的上下文長度是最安全的假設,因為 GLM-5.2 與 GLM-5.3 都具備這項規格。開放權重是一種期待,而非承諾——Z.ai 過去幾代旗艦模型都釋出了權重,這是一種模式,而非保證。

Step 5 Preview 實際上推出了什麼

StepFun 的模型是這場比較中具體的那一半,而其規格相當不尋常。它是一個稀疏專家混合模型,總參數量 600B,每個 token 約有 27B 處於活躍狀態——激活比率接近 4.5%——建構於一個 92 層的窄而深 Transformer 之上,並採用稀疏分組查詢注意力與區塊式 token 合併。上下文視窗為 1M tokens,輸入是文字與圖像,輸出是文字,並以延伸思考進行推理。StepFun 跳過了整個 Step 4.x 系列才走到這裡,直接從 Step-3.7-Flash 跳到 Step 5。

• Intelligence Index — 於 Artificial Analysis 為 44,在 200 個受評模型中排名第 24,中位數為 24

• 輸出速度 — 每秒 99.8 個 token,在 200 個中排名第 45

• 首個 token 的時間 — 在同一次獨立執行中為 2.96 秒

• 價格 — 每 100 萬輸入權杖 $1.00,每 100 萬輸出權杖 $2.70,並享 95% 快取折扣

• 每個 Intelligence Index 任務的成本 — $0.71,200 個中排名第 27

• 權重 — 今日無;BF16 檢查點預定於 2026 年 10 月 15 日

• 授權 — 未發布。該模型為專有,未載明商業使用授權、再散布權或微調許可。

價格是引人注目的那一列,而另一列對 StepFun 的好處也不如乍看之下那麼大:在 Intelligence Index 上輸出 160M 個 token,對比中位數 92M,以該指標而言在 200 個中排名第 64。這個模型很冗長,而冗長正是在它主打販售的 agentic 工作負載中會造成成本倍增的因素。$0.71 的每任務成本數字已經把這點計算進去,這就是為什麼它比標價更值得引用,也是更誠實的數字。

StepFun 自家的評估結果未經重現,在有人獨立跑過之前,都應視為廠商資料來看待。他們把該模型在 ALE-CLI 上列為 29.5,在 FrontierFinance 上為 66.4,在 DRACO 上為 83.3,在 ProgramBench 上為 80.5,在 DeepSWE v1.1 上為 67.7,在 StepCodeBench 上為 49.0,另在 Terminal-Bench 4.0 上為 33.3%,在 GDPval-AA v2 上為 1571。StepFun 也回報,在一項 24 小時的 GPU kernel 最佳化任務中達到 508 TFLOPS 的 MLA 峰值,相較之下 Claude Opus 5 為 493。這些都是 StepFun 針對一個 StepFun 尚未公開的模型所給出的數字。

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator with a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second at rank 45 of 200, cost per Intelligence Index task $0.71 at rank 27 of 200, verbosity 160M output tokens against a 92M median, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning support, text and image input, and a 1M-token context window.

你可以改跑以取代這個的一對一對決

如果你想要標題所承諾的比較,誠實的替代方案是 Step 5 Preview 對上 GLM-5.3——Z.ai 實際推出的模型,仍是其當前開源旗艦,也是任何 GLM-5.5 會取代的那個。在獨立排行榜上,兩者只差一分。在其他幾乎所有方面,它們都不是。

• 智慧指數 — Step 5 Preview 44 對比 GLM-5.3 45

• 參數 — 總計 600B/啟用 27B 對比 總計 753B/啟用 40B

• 輸出速度 — 99.8 tokens/秒 對比 72.1 tokens/秒

• 首個 token 時間 — 2.96 秒對比 2.99 秒

• 每 100 萬個 token 的價格 — 輸入 $1.00 / 輸出 $2.70,對比輸入 $1.40 / 輸出 $4.40

• 快取折扣 — 95% 對 81%

• 每項 Intelligence Index 任務的成本 — $0.71 對比 $2.01

• 輸入模態 —— 文字與圖像 vs 僅文字

• 授權條款 — 未公佈任何授權條款,對比一個並非 MIT 的 Z.ai 自訂授權條款

這個態勢重複了 Step 5 Preview 發布時所建立的模式,而這模式在每一個曾與它對比評測的已推出模型上都成立:決定性的效率領先,以及能力上的統計平手。它生成 token 的速度約快 38%,雙向每百萬 token 的成本約只需一半,而對上 GLM-5.3 時,每個索引任務的成本便宜 2.8 倍——儘管得分低了一分。在排行榜上,那個 44 分也讓它與 Kimi K3 並列,這點值得先知道,再決定是否把兩者之一視為領先者。

Step 5 Preview 明確落後的那一列,正是你無法進行基準測試的一列。GLM-5.3 有授權條款檔案與可下載的權重;Step 5 Preview 則有一個 Hugging Face 儲存庫,裡面只含一個 .gitattributes,以及針對 BF16 檢查點所載明的 10 月 15 日這個日期。如果 Z.ai 的下一款旗艦模型以開放權重推出,並沿用其整年來一直使用的相同自訂條款,它就會落入 Step 5 Preview 目前唯一沒有答案的類別——而這正是 GLM-5.5 的比較值得等待、而非立即進行的真正原因。

Generated two-column comparison scoreboard titled 'Step 5 Preview vs GLM-5.5 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, parameters 600B total / 27B active, price $1.00 / $2.70, cache discount 95%, cost per index task $0.71, and API live since September 20. The right column gives GLM-5.5 the rows AA Index no model to score, parameters more than 1T rumored and unconfirmed, price none, cache discount none, cost per index task none, and availability not released. A footer reads 'Step 5 Preview figures per Artificial Analysis Intelligence Index; GLM-5.5 is an unannounced, unreleased model with no vendor or independent figures.'

為什麼等待 GLM-5.5 才是代價高昂的選擇

一個已經「還要再等兩個月」等了兩個月的模型,其實際問題在於:你的評估工作無法跟著它一起等。GLM-5.5 沒有端點,因此無法對它做基準測試、價格比較、負載測試,也無法把它放在備援規則後面。圍繞它規劃的每一週,都是因為一份預測而延後一週的決策——而那份預測已經錯過一個窗口。

相較之下,GLM-5.3 已在 OrcaRouter 上線,型號代碼為 z-ai/glm-5.3,輸入價格為 $1.26、輸出價格為 $3.96,對照 Z.ai 自家頁面上的 $1.40 與 $4.40 定價。這是零加價的原價轉嫁,也就是說,你看到的數字是供應商目前的費率,而不是我們自行設定的價格;供應商調價時,我們這邊當天就會同步生效,而不是等到下一個帳單週期。

Step 5 Preview 不在我們的目錄中,我們也不提供它的路由。它運行於 StepFun 自家的 API 與 Studio,而在 10 月 15 日的檢查點到來之前,那是它唯一運行的地方。在此期間,OrcaRouter 能為你提供的,是那項比較另一側的一切透過單一 API 即可存取超過 200 個模型:以上述費率提供的 GLM-5.3、GPT-6 Astra、DeepSeek V4 Pro、Claude Opus 5 以及其他模型,並具備跨供應商的自動容錯移轉,在預覽版的容量曲線仍屬未知之際,讓生產路徑保持穩定;而路由 DSL 則能將其中數個模型組成單一呼叫,而不必再另外做一次整合。用同一把金鑰將預覽版與生產模型做基準測試;讓生產路徑維持原狀。

Screenshot of the OrcaRouter model page for GLM-5.3 at www.orcarouter.ai/models/z-ai/glm-5.3, showing the model id z-ai/glm-5.3, a 1M-token context and 131.1K max output, input pricing of $1.26 and output pricing of $3.96 per million tokens against the crossed-out list rates of $1.40 and $4.40, a seven-day median time to first token of 3.68 seconds and a 95th percentile of 10.00 seconds, seven-day traffic of 2296.2M tokens, and the endpoints and SDK snippets behind the OrcaRouter API.

什麼會改變答案?

兩個日期決定了這件事。10 月 15 日是 StepFun 所說 Step 5 Preview 的 BF16 檢查點發布之日,而隨之附帶的授權條款,則是這項比較中影響最為重大的未知數——寬鬆的授權會讓那 2.8 倍的每任務成本優勢成為你所擁有、而非租用的東西,並抹去 GLM-5.3 明顯領先的唯一一個面向。限制性的授權則會讓 GLM-5.3 成為這兩者中唯一能讓你據以打造產品的一個,並把那一分的差距化為無關緊要的枝節——畢竟這兩個模型,你本來就會以不同的方式使用。

第二個是針對 Z.ai 下一代旗艦、從 10 月 8 日到 11 月 9 日的分析師觀察窗口;它可能叫 GLM-5.5,也可能不叫,可能與傳聞相符,也可能不。如果它真的問世,它會以一個附有授權與檢查點的模型登場——這正是 Step 5 Preview 缺少的兩樣東西——屆時這項比較才會真正成立。

在兩者都獲得解決之前,有用的問題並不是兩者之中哪一個更好,因為其中一個無法執行。而是你現在應該以哪一個現有模型為基礎來建構,以及當下一個檢查點出現時,答案是否會改變。這個問題本週有一個可檢驗的答案,而且不需要等到某個名稱變成模型。

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新