文章「Ox Alpha」的主視覺標題卡,副標題為「Z.ai 的 GLM-5.3-Flash 背後代號的權威參考頁面」,標籤寫著「自 2026 年 8 月 20 日起以 Ox Alpha 之名預覽」、「2026 年 8 月 26 日揭曉」、「總計 320B/活躍 18B,1M 上下文」以及「MIT 授權,開放權重」,頁腳一行寫著「封裝、模態、費率卡、端點介面與基準測試——已於 2026-09-28 驗證」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Ox Alpha:現以 GLM-5.3-Flash 出貨之匿蹤模型完整規格表

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Ox Alpha 是那個匿名名稱,GLM-5.3-Flash 便是以此名義預覽,並於 2026 年 8 月 26 日 揭露,且它不是你今天能呼叫的模型。帶有 Ox Alpha 名稱的預覽清單已不再提供它;其背後的模型有供應商頁面、MIT 授權的權重、已公佈的費率表,以及有文件記載的 API 介面,全都屬於 Z.ai。本頁是該模型的參考資料——適用範圍、模態、費率表、端點介面、每一項已公佈的基準測試數據及其所附的修訂版本或測試框架,而且,因為這個別名仍然只會傳回單薄且令人困惑的搜尋結果,所以也明確說明哪些內容在任何地方都沒有記載。以下所有內容均於 2026-09-28 讀取自 Z.ai 自家的模型文件與定價頁面、Hugging Face 上的 Z.ai 模型卡、Artificial Analysis,以及我們自家的目錄;供應商公佈的數據與獨立第三方測量的數據會分開標示,且本文沒有任何內容是從相似性推斷而來。

Ox Alpha 這個名稱現今指的是什麼

那個別名已退役,而將它退役的正是供應商本身。Z.ai 自家針對 GLM-5.3-Flash 的文件指出,該模型在發布前曾以 ox-alpha 之名匿名測試,以蒐集使用者回饋,而那次匿名運行成為當週最受歡迎的模型。可供定年的錨點簡短而明確:那份隱蔽上架清單顯示 Ox Alpha 於 2026 年 8 月 20 日發布,而正式揭曉落在 8 月 26 日——這與 Z.ai 文件頁面所載的日期相同,也與我們自家目錄為 z-ai/glm-5.3-flash 記錄的發布日期一致。

由此可得出兩件事,而這兩件事對搜尋這個名字的讀者都很重要。

• 別名不是路由。我們的目錄對 stealth/ox-alpha 查詢回傳「model not found」,讀取於 2026-09-28。那個名稱底下沒有可呼叫的項目,因為廠商的產品帶的是廠商自己的名稱。

• 在該別名下同樣沒有廠商自有的權重儲存庫。在 Hugging Face 搜尋 ox-alpha,會找到 2026 年 8 月下旬潛行期間所建立的社群上傳內容,以及一個 2026 年 9 月 27 日、僅含模型卡的儲存庫,該儲存庫不含權重,並指向 Z.ai 的官方發布。儲存庫名稱是上傳者自行選擇的標籤;它並不構成任何事物的證明文件。Z.ai 自身的組織將該模型發布為 zai-org/GLM-5.3-Flash,該儲存庫建立於 2026-08-25(UTC)。

主宰匿名週的供應商問題已經落幕,而且是以尋常方式落幕:一家實驗室站出來,把名字掛在模型上。剩下的是規格,而這正是本頁涵蓋的內容。發現過程——揭露之前的指紋辨識、它所屬的匿名模型譜系,以及隨之而來的伺服硬體披露——刊載於我們先前關於 Ox Alpha 調查的文章,而本頁不會重新爭論其中任何一點。

封套,如廠商文件所述

A screenshot of Z.ai's official developer documentation page for GLM-5.3-Flash, showing the Model Overview section with the four spec rows on the right reading Input Modality 'Video / Image / Text / File', Output Modality 'Text', Context Length '1M' and Maximum Output Tokens '128K', alongside vendor-stated architecture notes describing 320B total parameters with 18B activated and a hybrid sparse-and-linear attention design that reduces attention computation and KV cache by 3.01x and 4.44x versus GLM-5.3.

這些是 Z.ai 回報的數字,於 2026-09-28 從廠商自家的文件頁面讀取;而四個規格維度中有三個已獲獨立佐證——Artificial Analysis 的模型紀錄載有相同的 320B 總參數、18B 啟用參數、1,000,000 token 上下文與 MIT 授權,我們自家的型錄卡也載有上下文與輸出限制。

• 上下文視窗 — 1,000,000 tokens(Z.ai 文件;Artificial Analysis;我們自己的型錄卡,其中列出 1,000,000)

• 最大輸出 — 128K tokens(Z.ai 文件);我們的卡片記錄為 128,000

• 輸入 — 文字、圖像、影片與檔案(Z.ai 文件,讀取於 2026-09-28);我們的卡片列出文字、圖像與影片,並未聲稱支援檔案輸入

• 輸出 — 僅限文字,每個來源皆如此

• 參數 — 總計 320B,每個 token 啟用 18B(Z.ai 文件與模型卡;Artificial Analysis 獨立記錄 320B 與 18B)

• 授權條款 — MIT,權重發佈於 Hugging Face(廠商模型卡;Artificial Analysis 將此模型歸類為採用寬鬆授權的開放權重模型)

• 架構——稀疏注意力與線性注意力的混合體,Z.ai 稱其為首個結合兩者的開源前沿模型,相較於 GLM-5.3,可將注意力運算量降低 3.01 倍、KV 快取降低 4.44 倍,另有一個 IndexPool 步驟,能在長上下文時將四個索引器鍵向量壓縮為一,以及用於提升擴展效率的 Manifold-Constrained Hyper-Connections。以上皆為廠商說法;目前沒有可引用的獨立架構審查。

• 預訓練——一個 30 兆 token 的多模態語料庫(Z.ai 所述)。除了 320B/18B 這個主要數字之外,該廠商未公布總訓練算力數據,也未公布逐層參數明細。

有一項概括性主張自發布以來已收窄,而目前的文件才是應引用的版本。8 月流傳的服務硬體披露,將匿名週的產能定在約 10 萬顆中國國產晶片。Z.ai 如今所載的文件表示,該模型是在「數萬個國產自主開發的加速器」上提供服務,在相同硬體上,相較供應商自家基準,端到端服務改善達 3×,且每 token 成本被供應商形容為可與主流 NVIDIA GPU 相比。數萬是該頁面現在所說的數字;較大的數字是發布時期的數字。兩者都是公司說法,兩者都未經獨立查核,而修訂方向是向下。

費率卡,以及為什麼實際投放的數字才是關鍵

Z.ai 的定價頁面列出 GLM-5.3-Flash 為每百萬輸入 token 0.15 美元、每百萬快取輸入 token 0.03 美元,以及每百萬輸出 token 0.50 美元;同系列的 FlashX 層級則為 0.37 / 0.075 / 1.25 美元。這是供應商公布的定價,擷取自供應商自家頁面,日期為 2026-09-28。

我們的路由今天實際供應的費率較低,而這正是本節的實際重點。根據 2026-09-28 的資料,OrcaRouter 上 z-ai/glm-5.3-flash 的價目卡將輸入定價為 $0.075 每百萬 token,輸出為 $0.25 每百萬 token,快取讀取則為 $0.0173 每百萬 token。這同樣是同一模型、同一天,卻是供應商定價表的一半——是折扣後的數字,而非公告價,且卡片上沒有任何促銷標示。我們先前對這款模型的報導曾指出,在所述促銷期結束後仍存在同樣的落差;這個觀察至今依然成立,而我們仍無法查出原因,因此我們報導實際供應的數字,並讓原因保持未解。

快取輸入正是三個來源明顯不一致之處,這也適時提醒我們,表格中的「$0.03」未必是任何人實際支付的價格。供應商的頁面寫的是每百萬個快取輸入權杖 $0.03;Artificial Analysis 的模型紀錄所列的快取命中價格是 $0.026;我們的路由提供的快取讀取價格則是 $0.0173。這三筆資料的讀取時間都在 2026-09-28 當天或之前不久,且全部由供應商或平台回報。我們將供應商的定價表數字引用為定價表數字,並將實際供應的數字引用為呼叫方實際被計費的金額。

對一個具代表性的代理任務進行計算——100,000 個輸入 token 和 10,000 個輸出 token,沒有快取命中:

• 以供應商表定費率計算——100,000 個 token × $0.15/1M = $0.015,加上 10,000 × $0.50/1M = $0.005,因此每次呼叫為 $0.020

• 以我們的路由目前提供的費率來看——$0.0075 加上 $0.0025,也就是每通電話 $0.010,正好是一半

這就是為什麼在評估工作負載規模之前,必須查看實際供應價格而不是定價的全部原因:對於每天執行數千次呼叫的長時程代理而言,這兩個數字之間的差距,就是兩種預算之間的差距。OrcaRouter 以 0% 加價直接傳遞供應商的定價,因此廠商正在提供的折扣會顯示在我們的價目表上,而不是被吸收在中間某處。

模態與端點介面

供應商記載了一種介面形式與兩個模型代碼:glm-5.3-flash和glm-5.3-flashx,兩者皆透過 Chat Completion API 提供服務。圖片會以 type 為 image_url 的內容區塊放入 message content 陣列中,可採用 URL(供應商建議的方式)或 base64 data URL,且一則訊息中可傳送多個圖片區塊。支援串流,而 Z.ai 建議串流請求時同時啟用 stream 與 tool_stream。工具呼叫、上下文快取與結構化 JSON 輸出皆為文件所記載的功能;thinking 受支援,但如下一節所述,並非可選。

FlashX 是同一個模型的一個獨立服務層級,而不是一項獨立功能:Z.ai 的文件記載其速度為每秒 200 個 token,並表示它尚未在 GLM Coding Plan 上提供。它不是我們目錄所收錄的層級,也不是本頁數字所描述的內容。

在我們的路由上,端點範圍較窄,值得精確說明。z-ai/glm-5.3-flash 的卡片揭露 POST /v1/chat/completions——僅限聊天補全,沒有第二個協定端點——並接受 reasoning、reasoning_effort、include_reasoning、tools、tool_choice、response_format、stream、temperature、top_p、max_tokens 和 stop。卡片上的能力標籤為 vision、tools、JSON 和 reasoning。上下文為 1,000,000 個 token,最大輸出為 128,000,與廠商文件相符。

投入程度與思考:決定每個基準測試分數的設定

這是規格中對你解讀分數影響最大的部分,而且廠商有精確記載。GLM-5.3-Flash 採用 reasoning_effort 參數,具有三個層級——低、高與 max——若你未傳入任何值,或傳入任何不是低或高的值,預設即為 max。思考無法關閉:廠商表示 thinking.type 僅支援 enabled。聊天範本的 clear_thinking 旗標預設為 false,Z.ai 建議在聊天情境中明確傳入 true。廠商建議的取樣設定為 temperature 1 與 top_p 0.95,並直接表明基準測試與排行榜重現應維持預設的 max 等級。

把這兩項事實放在一起看,對任何比較數字的人來說,後果都無可避免:未註明 effort 等級的分數並不是完整的量測,因為 low、high 和 max 設定是同一模型的不同運作點,而預設值是三者中最昂貴的。我們的模型卡在其支援的參數中列出了 reasoning 和 reasoning_effort,因此可透過路由觸及該設定,而不僅是透過供應商。

基準表,附上修訂版

Z.ai 為 GLM-5.3-Flash 發布了一份基準測試表,而這份表格完全由廠商自行提報——Artificial Analysis 的獨立紀錄並未重現這些項目。該廠商最受矚目的程式編寫與代理式數字為:DeepSWE v1.1 達 63.4,對比 GLM-5.2 的 46.2;以及 AutomationBench v1.0.6 達 48.8,對比 GLM-5.2 的 26.2。至於表上其餘內容,就如我們自家目錄所收錄、並以 Z.ai 為具名來源的那樣:Humanity's Last Exam with tools 55.3、Agents' Last Exam 26.3、NL2Repo 56.3、Chartography with tools 78、CharXiv reasoning with tools 89.4,而在視覺方面則是 MMVU 80.5、MVBench 77.8 與 BabyVision 53.4。

有兩列廠商資料值得把其註腳一併帶進句子裡,因為它們正是讀者最可能在不帶註腳的情況下引用的內容。Z.ai 自家的程式碼評測 Z.ai Code Bench v1.0,在最大努力設定下,把 GLM-5.3-Flash 列為 29.0,對上 Claude Opus 4.8 的 29.5——在該廠商自家測試框架上幾乎打成平手,執行於 Claude Code 2.1.207,由該廠商自行呈報。這不是獨立比較,也不是由第三方執行的同等努力比較;這是 Z.ai 在自家評測上,拿自己的模型與競爭對手做基準測試。而該廠商引用的是 Artificial Analysis Intelligence Index 的 57,每項任務 $0.045,並指明修訂版本為 v4.1.1。

最後那個數字必須與 Artificial Analysis 今天公布的數字分開看,因為兩者不能當作同一項變動並列比較。Artificial Analysis 自己在 GLM-5.3-Flash 的頁面,於 2026-09-28 讀取時,報告的 Intelligence Index 為 41.8 在 Index v4.3.2 上,以最大努力程度記錄。v4.3.2 納入十項評估——AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 與 AA-LCR v1.1——而 v4.1.1 並未納入。兩次 Index 修訂、兩套任務集、兩個數字。兩者都沒有錯;它們不是同一種測量,而把 57 與 41.8 並列引用,彷彿模型有所變動,無論朝哪個方向解讀都會是錯誤。

獨立記錄所佐證的是整體規格範圍,而非分數:Artificial Analysis 獨立記錄了 320B 總參數、18B 啟用參數、1,000,000 個詞元的上下文視窗、MIT 授權、開放權重,以及 2026-08-26 的發布日期,並列出供應商定價為每百萬詞元輸入 $0.15、輸出 $0.50,快取命中價格為 $0.026。在供應商公布分數而獨立第三方未公布之處,我們會據實說明;在獨立第三方確認某項規格之處,那是本頁最強等級的事實。

這裡沒有旗鼓相當的正面對決,而直言這一點比硬做出一個來更有用。沒有人公開發表過 GLM-5.3-Flash 對上 Claude Opus 4.8、GPT-6 Sol 或 Grok 4.7,並在共享測試框架上以明示努力程度進行的測試結果——Z.ai 自家的比較是在自家基準上、以最高努力程度、對上競爭對手的預設值。在情況改變之前,這個模型與其他任何模型之間誠實的比較,只能落在價格、規格範圍與端點介面上,而這三件事正是本頁每個人都能從同一組數字讀出來的。

未記載之事,直白說明

對於資訊量單薄的模型來說,參考頁面唯有誠實面對缺口才有用,而這個頁面就有好幾個缺口。

• 沒有廠商公布的知識截止時間。Z.ai 的文件與 Hugging Face 模型卡都未載明,Artificial Analysis 的紀錄也將該欄位留空。來自隱蔽期的估計是社群成果,不是廠商數據,而本頁不會把它當作廠商數據般重述。

• 大部分基準表都沒有測試框架註腳。模型卡確實有 HLE 搭配工具執行的註腳——temperature 1.0、top_p 0.95、最大生成長度 163,840 個 token、在最高 300,000 個 token 的上下文下評估並採用上下文管理策略,以及由 GPT-5.6 Luna 以中等推理強度擔任評審模型——也有 NL2Repo 與 DeepSWE 的註腳,供應商表示後者是使用 mini-swe-agent 測試框架執行的。其餘列則只有單純的百分比,未附上測試框架或推理強度。

• 未解釋快取輸入價格價差。同一模型、同一數量出現三個數字,卻沒有任何來源說明它們為何不同。

• 沒有針對匿名服務期間的獨立基準測試。該隱蔽上架已消失;它當時所測量到的任何內容都無法再次測量,而且也沒有第三方在該別名仍上線時,發表過針對它的測試。

• 未進行同等投入的第三方比較,理由如上所述。

• 沒有廠商證實發布當時的晶片數量。文件指出有數萬個國產加速器;十萬這個數字並未出現在該頁面上。

就這樣定案:我們目錄供應的內容,今日已驗證。

A single-column reference scoreboard titled 'GLM-5.3-Flash, the model behind Ox Alpha', with six rows reading 'Context: 1,000,000 tokens', 'Max output: 128K tokens', 'Input / output: text, image, video in / text out', 'Parameters: 320B total, 18B active, MIT licence', 'Vendor list price: $0.15 in / $0.50 out per 1M, $0.03 cached', and 'Served on OrcaRouter: $0.075 in / $0.25 out per 1M'. A footer line reads 'Z.ai-reported envelope and list price; OrcaRouter card read 2026-09-28; Artificial Analysis independently confirms 320B/18B, 1M context and MIT.' The OrcaRouter logo is composited in the bottom-right corner.

Ox Alpha 背後的模型已以自身名稱在我們的目錄中上線,這是今日查核而非假定。於 2026-09-28 讀取 OrcaRouter 模型 API 中 z-ai/glm-5.3-flash 的資料,完整回傳了其資訊卡:1,000,000 詞元上下文、128,000 最大輸出、文字、圖像與影片輸入並輸出文字、能力標籤為視覺、工具、JSON 與推理,發布日期為 2026-08-26,未棄用且未下架,定價為每百萬輸入詞元 $0.075、每百萬輸出詞元 $0.25,以及每百萬快取輸入詞元 $0.0173,透過單一端點 POST /v1/chat/completions 提供。

我們自己在該卡片上進行的七天 playground 量測,在同一期間測得每秒 61.8 個輸出 token、首次 token 時間的 p50 為 7.39 秒,以及 1.47% 的錯誤率。這些是關於我們服務的第一方數據,不是廠商數字,也不是獨立基準測試;因此,它們是本頁唯一的速度數據。

這個別名本身不在路由上。如果你是搜尋 Ox Alpha 而來到這裡,要呼叫的模型是 z-ai/glm-5.3-flash,而請求格式就是上方所述的那一種。它和目錄中其他所有項目使用同一把金鑰—— 單一 API,涵蓋 200+ 個模型,供應商價格原樣傳遞,不額外加價,並且供應商停滯時自動容錯移轉,因此你正在試用的模型不必是你的生產路徑所依賴的模型。

A screenshot of the OrcaRouter model page for Z.ai GLM-5.3-Flash (z-ai/glm-5.3-flash), showing the model name and provider, a 1M-token context window with 128K maximum output, text, image and video input with text output, a stat strip reading $0.075 input and $0.25 output per million tokens, the capability chips Vision, Tools, JSON and Reasoning, a release date of 2026-08-26 and a supported-endpoint line reading POST /v1/chat/completions, with a code sample against the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

關於這個頁面究竟是什麼,有一點需要先釐清,因為從模型本身名稱連過來的讀者理當得到這個說明。這是一個已經在模型目錄中的模型參考頁面,而不是發布報導:GLM-5.3-Flash 來自 2026 年 8 月 26 日,它會出現在這裡,是因為 Ox Alpha 這個名稱一直有人搜尋,卻沒有專屬頁面可以落腳,而不是因為這個發布有多新。上方的日期是用來標定該模型的日期,不是當成新聞。會改變這個頁面的情況有四種——在明確標示的 effort 設定下進行的獨立基準測試、供應商明示的知識截止日期、服務費率的變動,或 Z.ai 決定說明發布當時的晶片數量究竟是多少。在上述任何一項出現之前,上方的規格就是供應商所記載的全部內容,而前一節所列出的缺口,與那些數字一樣,都是答案的一部分。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新