
Step 5 Preview 對上 GLM-5.3:僅一分之差,而只有其中一個有授權條款檔案
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
在獨立排行榜上,Step 5 Preview與GLM-5.3僅差一分:在 Artificial Analysis Intelligence Index v4.3.2 上為 44 對 45,其中 GLM-5.3 以 GLM-5.3 (max) 計分,而 Step 5 Preview 則完全沒有任何 effort 標籤。這是本系列中最小的差距,卻也是這場比較中最沒用的一個數字。真正決定一切的是:GLM-5.3 的權重你今天就能下載——由 Z.ai 以非 MIT 的客製授權條款發布——而 StepFun 於 2026 年 9 月 20 日發表的 Step 5 Preview,其 Hugging Face 儲存庫裡只有一個 .gitattributes,並註明 BF16 checkpoint 將於 10 月 15 日發布。StepFun 的發布資料將該模型形容為前三名的開源成果。它目前還稱不上開源。GLM-5.3 才是,而在你圍繞它做規劃之前,它的授權條款才是你該讀的東西。
一個指數點實際上能買到什麼
這兩個模型都由同一間實驗室進行了相同的十項評估,這使得這項比較同時顯得異常乾淨,卻也異常沒有幫助。
• 智慧指數 — Step 5 Preview 44 對比 GLM-5.3 45
• 排名位置 — GLM-5.3 領先 Step 5 Preview 一分;Step 5 Preview 與 Kimi K3 並列
• 參數 — Step 5 Preview 總計 600B / 27B 活躍 vs GLM-5.3 總計 753B / 40B 活躍
• 輸出速度 — Step 5 Preview 99.8 tokens/秒,對比 GLM-5.3 72.1 tokens/秒
• 首個詞元時間 — Step 5 Preview 2.96 秒 對比 GLM-5.3 2.99 秒
• 每 100 萬個 token 的價格 — Step 5 Preview 輸入 $1.00 / 輸出 $2.70,相較於 GLM-5.3 輸入 $1.40 / 輸出 $4.40
• 快取折扣 — Step 5 Preview 95% 對比 GLM-5.3 81%
• Intelligence Index 每項任務的成本 — Step 5 Preview $0.71 對比 GLM-5.3 $2.01
• 上下文 — 兩者皆為 1M tokens;我們的目錄列出 GLM-5.3,其輸出上限為 131.1K,StepFun 則尚未公佈
權重 — Step 5 Preview 已結束,BF16 檢查點預定於 10 月 15 日;GLM-5.3 依自訂 Z.ai 授權條款發布。
把這些列放在一起看,那一分的差距就不再是頭條。Step 5 Preview 的輸入成本便宜 29%,輸出成本便宜 39%,生成詞元的速度快 38%,而且快取折扣還深了 14 個百分點——至於每項索引任務成本這個把冗長度與快取行為折合為單一數字的指標,則低了 2.8 倍。它是在總參數量 600B、對比 GLM-5.3 的 753B 之下做到這一點,並以 27B 活躍參數對上 40B。在效率這條軸線上,這不是一場接近的對決;在能力上,這已是排行榜所能呈現的最接近差距。
Step 5 Preview 唯一未能勝出的那一列,正是最難修正的一列:GLM-5.3 有授權檔案,而 Step 5 Preview 沒有。
授權條款就是全部的差別所在,而且它不是 MIT。
人們很容易假設中國實驗室的開源旗艦模型是以 MIT 授權釋出,因為確實有幾家是如此。Z.ai 自家的 GLM-5.2 與 GLM-5.3-Flash 都採用 MIT 授權。但 GLM-5.3 旗艦版並非如此——它採用一套自訂的「glm-5.3」授權,允許商業使用,但附帶一連串限制。這份文件與其較小型號所採用的 MIT 條款有實質差異;對一家律師會先讀授權再讀 README 的公司而言,這是一場需要討論的事,而不是一道形式程序。
Step 5 Preview 目前完全沒有任何授權條款,這是另一個問題,而且顯然未必是較小的問題。限制性授權會告訴你可以做什麼,並讓你自己判斷這些條款是否可接受。沒有授權則什麼都沒告訴你:沒有商業使用授權、沒有再散布權、沒有微調許可,也無法評估 10 月 15 日的檢查點在實際出現之前,是否能供你的產品使用。StepFun 保留的儲存庫名稱——stepfun-ai/Step-5-Preview-BF16——所指的是 bfloat16 格式,那是你用來微調與量化的產物,而不是你實際部署服務的版本。這透露了此次發布的形態,卻沒有說明其條款。
所以,誠實的比較是介於一份你讀得到、也能不同意其內容的授權條款,以及一份根本不存在的授權條款之間。對需要微調、在受控環境中自架,或推出衍生產品的團隊而言,GLM-5.3 是這兩者中唯一有答案的,而那個答案是法律審查,而不是一盞綠燈。
效率差距是站得住腳的部分
效率宣稱比基準測試宣稱更值得懷疑,因為它們更容易提出,也更難查核。這兩項比大多數都更站得住腳,而其機制在架構中清晰可見。
稀疏混合專家模型只會把算力花在 token 路由到的專家上,因此啟用參數量決定實際執行行為,而總參數量主要只是記憶體問題。在 27B 啟用參數對上 GLM-5.3 的 40B 之下,Step 5 Preview 每個 token 的工作量大約少了三分之一,而量測結果也與此相符:每秒 99.8 個輸出 token 對上 72.1 個,以及每個索引任務成本 0.71 美元對上 2.01 美元。這是同一件事用三種方式陳述,也正是這讓它顯得可信,而不是單一討喜的數字。
快取折扣是對這兩款模型所販售的工作負載而言最關鍵的一列。代理迴圈在每一輪都重新送出相同的系統提示與儲存庫上下文,幾乎完全落在那個折扣之內,因此 95% 對上 81% 會在漫長的工作階段中產生複利效果,這是牌價所無法比擬的。在 7:2:1 的快取命中/輸入/輸出比例下,Step 5 Preview 的混合費率落在每百萬個 token 約 $0.51,相較於 GLM-5.3 明顯更高的混合費率——而且迴圈跑得越久,差距就拉得越大。
目前還無法驗證的是,這種效率能否在大規模應用下依然成立。Step 5 Preview 的 API 在發布當天就開放了,而且只有單一端點。GLM-5.3 自八月中以來便一直承載著生產環境流量,使用者是眾多獨立的呼叫方;而一個背後有五週真實負載的模型,其失效模式已為足夠龐大的人群所知,因而會公開浮現。一個才上線幾天的端點完全沒有這些。效率數字是比較好看的解讀;實際的運作紀錄才是比較有用的那一個。

今天你可以向各方尋求什麼
這是這項比較中唯一一處兩者並不對稱的地方,值得精確說明,而不是籠統地概括為「兩者皆可用」。
GLM-5.3 已在 OrcaRouter 上線,位於 z-ai/glm-5.3 模型頁面,輸入價格 $1.26、輸出價格 $3.96,對照模型頁面上 Z.ai 的 $1.40 與 $4.40 定價——零加成直通,因此你看到的數字是供應商目前的費率,而非我們自行選擇的價格。開放權重已發佈於 Hugging Face,因此同一個模型有三種取用方式:我們的端點、Z.ai 自家的 API,或你自己的硬體。
Step 5 Preview 不在我們的目錄中,我們也不為它安排路由。它跑在 StepFun 自家的 API 與 Studio 上,在權重釋出之前,那是它唯一會運行的地方。在我們這邊,與它並列的是它被拿來對照衡量的那一組模型,一把金鑰就能取用超過 200 個模型:GLM-5.3 適用上述折扣費率、DeepSeek V4 Pro 為 $0.66 與 $1.98,以及 Claude Opus 5 為 $5.00 與 $25.00。這正是讓接下來四週得以推展而非卡關的原因——你可以在同一把金鑰上,把這個預覽版拿來與正式生產模型做基準測試,並透過跨供應商的自動容錯移轉在預覽版容量曲線仍屬未知之際撐住生產路徑,還能用路由 DSL 把生產那一段組成單一呼叫,而不必另外再接一套整合。

在潛在客戶與過往實績之間做選擇
如果你正在微調、自行託管或打造衍生產品,GLM-5.3 就是答案,而且毫無懸念——不是因為它多拿了一分,而是因為兩者之中,只有它既有可閱讀的授權條款,又有可下載的檢查點。記得把法律審查編進預算,因為這些自訂條款不是 MIT,而這種差異會在採購稽核中浮現,而不是在基準測試裡。
如果你透過 API 呼叫模型,而且你的工作負載是大量的代理式文字,Step 5 Preview 在帳單與時鐘所關心的一切上都領先:每 token 更便宜、每項任務更便宜、生成速度更快,而且對填滿代理迴圈的重複前綴模式提供更深的快取折扣。相較於一個才推出幾天、單一來源、未公布輸出上限且沒有授權的端點,將其設為預設的論據,是關於基準測試的論據,而不是關於合約的論據。
會改變答案的是10月15日的檢查點。寬鬆的授權會讓效率領先優勢成為你能擁有而非租用的東西,屆時一分的落後就不再重要——一個在每項索引任務上便宜2.8倍、生成速度快38%的模型,並不需要贏得總體表現。限制性授權則使GLM-5.3成為這對模型中唯一能讓你建立產品的選擇,而那一分的差距就變成關於兩個你無論如何都會以不同方式使用的模型的瑣事。
唯一值得關注的規格是輸出上限。兩家廠商都宣稱具備 100 萬 token 的上下文。我們的產品目錄列出 GLM-5.3 的最大輸出為 131.1K;StepFun 的公告提到 100 萬上下文,且未設輸出上限,而外洩期間流傳的另一份第三方配置則列出 350,000 上下文與 64,000 的最大輸出。對於一對以長程代理式工作為賣點的模型而言,這個數字決定了你實際上能打造什麼,而目前只有一方給出了答案。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
