
GLM-5.3-Flash 揭曉:匿名「Ox Alpha」一直都是智譜的開放多模態前沿模型
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
一款在第三方程式碼平台使用榜單上稱霸一週的模型,終於有了正式名稱與定價。2026年8月26日,智譜AI證實,自8月20日起開發者們一直在密集使用的免費「Ox Alpha」模型,就是GLM-5.3-Flash——這是一個總參數3200億、啟用參數180億(320B-A18B)的混合專家模型,也是GLM-5系列中首個原生多模態版本,同時是推出時各費率表上最便宜的前沿級模型之一。智譜將GLM-5.3-Flash定價為旗艦GLM-5.3 API費率的十分之一,限時折扣期間更只要二十分之一;同日,MIT授權的開放權重也已上架Hugging Face。不同於權重仍要等到月底才會釋出的GLM-5.3,這款模型這週就能自行託管,不必等到下週。
簡短版本如下:Zhipu 開源了其迄今最便宜的大型模型;儘管只運行一小部分活躍參數,它在基準測試中卻勝過自家 GLM-5.2;據 Zhipu 的發布資料,該供應商將其 Artificial Analysis Intelligence Index 分數定為 57——與 Claude Opus 4.8 相當。截至撰寫本文時,這次發布所附的每一項基準測試數字皆為供應商自行報告,尚未獲得複現;價格與參數數量則是目前的事實。
實際發佈的內容
GLM-5.3-Flash 是一個總參數 320B / 活躍參數 18B 的 MoE 模型,具有 45 層,因此其活躍參數規模約為 GLM-5.2 約 32B 活躍參數的一半多一點。最引人注目的能力是模態:它原生支援文字、圖片和影片輸入——這是首款具備此能力的 GLM-5 模型——而非透過單獨的適配器處理視覺。上下文長度可達 100 萬個 token,智譜聲稱其長上下文服務成本約為 GLM-5.3 的三分之一。
在架構方面,智譜將其描述為首個採用混合稀疏注意力加線性注意力設計的開源前沿模型,搭配流形約束超連接(mHC)進行擴展,以及一個IndexPool機制,將四個索引器鍵向量壓縮為一個加權池,以降低長上下文延遲。預訓練使用了30萬億token的多模態語料庫。這些說法目前尚未經過獨立審計——僅是智譜對其自身模型的描述——但服務效率的主張足夠具體,一旦權重公開並進入開源推理堆疊,便可進行測試。
上市當天的規格表,一目了然:
• 參數 — 320B 總計 / 18B 啟用,45 層,MoE。
• 模態 — 原生文字、圖片和影片輸入;文字輸出。
• 上下文視窗 — 最多 1,000,000 個 token。
• 授權 — MIT,開放權重將於發布時在 Hugging Face 上線。
• 價格 — 每百萬個 token 為 $0.15 / $0.50(輸入/輸出),每百萬個快取輸入為 $0.03;截至 2026 年 9 月 9 日的五折優惠將其降至 $0.075 / $0.25 / $0.015。以定價來說,約為 GLM-5.3 的 $1.40 / $4.40 的十分之一。

Ox Alpha 週
這次公布為一週的猜測畫下句點。8月20日,一個匿名模型出現在第三方AI API平台上,具備100萬token的上下文窗口、文字/圖片/影片輸入功能,價格為零,並迅速成為該平台週榜上呼叫次數最多的模型。社群在48小時內透過指紋辨識將其追溯到智譜的GLM系列——這種「先匿名、後認領」的模式此前也曾識別出其他中國實驗室的模型——分析師普遍猜測這是GLM-5.3的Flash變體。8月26日的公告證實了這一猜測,並補充了細節:免費週是一次刻意的測試。智譜表示,這次匿名運行在提供服務的程式設計平台上創下了呼叫量紀錄,所有流量均由中國國產晶片承載。
免費週的脈絡對定價預期很重要。一個以$0免費提供一週的模型,隨後以旗艦機型費率的十分之一推出,並搭配限時二十分之一價格的折扣,是預算級別中刻意的造市舉動——而「限時」這個限定詞才是值得關注的部分。折扣是可以撤回的定價決策;MIT開放權重則不能。

以實際美元計算,它的成本是多少
智譜的定價表已以實際美元金額公布,而非僅是比率:每百萬輸入 token 0.15 美元、每百萬輸出 token 0.50 美元、每百萬快取輸入 token 0.03 美元。相較於 GLM-5.3 公布的 1.40 / 4.40 美元,這大約是牌價的十分之一;而截至 2026 年 9 月 9 日的上市五折促銷,更使其降至 0.075 / 0.25 / 0.015 美元——約為二十分之一。智譜亦公布該模型每項 AA Intelligence Index 任務的成本約為 0.045 美元(供應商回報數據),此即「Opus 4.8 的 1/40」說法背後所依據的數字。對於一個表現得分與定價高出 10 至 40 倍的其他模型處於同一水準的模型而言,其宣傳中的經濟效益是真實的;但細則在於:上市折扣只是暫時性的,且每項任務的實際成本取決於該模型在生產環境中輸出內容的冗長程度。
效率方面的敘事,是智譜宣稱成本優勢的來源。相較於 GLM-5.3,該廠商報告注意力計算量降低 3.0 倍、KV 快取降低 4.4 倍,並宣稱在所比較的入門級模型中——GLM-5.3、DeepSeek V4 Flash 與 Kimi K3——其注意力計算量為最低,同時也承認其 KV 快取仍略大於 DeepSeek V4 Flash 與 Kimi K3。在伺服器端方面,智譜報告在國產中國晶片上,端到端伺服效能較基準提升 3 倍,達到其所稱可與主流 NVIDIA GPU 相提並論的每 token 成本。這些皆為廠商自行報告的數據,尚未有任何獨立重現驗證;這些正是應對照開放權重來檢驗的數字。
為何此次揭露如此重要
撇開基準測試不談,這次發布仍在兩個層面改變了開放模型的格局。首先,它是一款處於前沿水準的開放權重多模態模型,價格卻十分親民——MIT 授權、1M 上下文、原生影像/影片輸入,加上每項任務僅需個位數美分的成本,這樣的組合在美國前沿實驗室中找不到直接對應的產品;它們同等級的多模態模型不僅貴上一個數量級,而且還是閉源發布。其次,它直接削弱了智譜自家旗艦的地位:GLM-5.3 是本月在 AA Intelligence Index 上取得獨立評測 60 分的 743B 模型,而 GLM-5.3-Flash 的定位正是對標同一家族的「前沿智能,閃電成本」。智譜的說法是,一個更小、更便宜的模型就能掌握旗艦模型的大部分能力——而如果這家廠商在程式碼與智能體方面的宣稱屬實,這正是業界一整年來反覆探討的「後訓練經濟」論點。
有一點需要留意,才能正確看待這件事。GLM-5.3-Flash 的 AA Index 分數 57 來自智譜自家的發布資料,而非 Artificial Analysis 排行榜;與 Claude Opus 4.8 的程式碼比較則是智譜內部 Z.ai Code Bench 的評測。在獨立評測出爐之前,應將 57 分和程式碼表現持平視為宣稱——該模型已廣泛接受匿名測試,因此第三方數據應該很快就會出爐。
試試看,以及路由層如何配合
首日存取可透過智譜自家的 API、Hugging Face 上的開放權重(zai-org/GLM-5.3-Flash,MIT)、以及智譜的程式設計產品——ZCode 與 GLM Coding Plan(內含一批每日體驗卡)來使用。至於自架部署,MIT 授權加上 vLLM 與 SGLang 的支援,代表上述的服務效率宣稱可以直接驗證。
在路由端,截至本次更新,GLM-5.3-Flash 本身尚未列入 OrcaRouter 的名單。GLM 系列的其他模型則已上線:GLM-5.3 在智譜 API 開放當天就已於我們這邊上線,按智譜的定價直接轉傳,0% 加價。這種轉傳機制正是這類發布的關鍵所在——無論折扣是否維持、費率表日後是否變動,供應商的價格變更都會在當天反映在我們這邊,無需重新談判。如果你希望在 Flash 上線後,用同一把金鑰將它與 GLM 系列其他模型一起運行,那就是這個配置;在那之前,Hugging Face 上的權重是自行測試最快的方式。

接下來要看什麼
未來幾週內,有三件事會揭曉真實情況。第一,獨立機構 Artificial Analysis 對 57 的評測——該模型已以 Ox Alpha 之名在實際環境中運行,所以排行榜應該很快就會追上。第二,目前設定於 2026 年 9 月 9 日截止的五折優惠是否會延長,因為這決定了 Flash 的常態成本。第三,GLM-5.3 的權重,仍承諾約在 8 月 28 日釋出——與 Flash 的 MIT 權重上線同一週,這將讓開放權重社群得以同時比較同一家族的兩個層級。
本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
