Ox Alpha 的英雄標題卡,這款匿名前沿模型,顯示一個問號形狀的模型晶片,文字、圖像和影片輸入流入,Token 區塊流出,並有三個膠囊標籤寫著「100萬 token 上下文」、「免費一週」和「製造者未知」,且 OrcaRouter 標誌合成於右下角。
Guides & Insights

Ox Alpha 揭曉:Z.AI 以開放權重將其發布為 GLM-5.3-Flash

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

8月26日(週三)晚間,這樁謎團以鑑識分析所預測的方式落幕。Z.AI——這間位於北京、打造GLM系列的實驗室——以開放權重產品的形式,發布了先前以蒙面方式測試的模型,名為GLM-5.3-Flash,正是tokenizer鑑識與預測市場所收斂指向的那個子名稱。Ox Alpha,這款自8月20日現身以來一直高居使用量榜首的匿名模型,如今已成為正式發布、可自行託管的模型:MIT授權、總參數320B且每個token啟用18B、1,048,576個token的上下文視窗、它在列表頁面上標榜的文字/圖片/影片輸入,以及已上傳至Hugging Face的權重。這次揭曉也解答了匿名週最大的謎團——一個無人擁有的模型,怎能每天處理100兆個token:Z.AI表示,這項推論服務完全跑在大約10萬顆中國國產AI晶片上,這是中國晶片首次承載前沿等級的全球流量。這等規模也催生了本週最熱門的錯誤猜測——在那個規模下,許多觀察者受到Google DeepMind研究人員神祕貼文的鼓舞,主張Ox Alpha一定是跑在NVIDIA硬體上的Gemini;這次揭曉也糾正了那點。同一個晚上,阿里巴巴推出了Qwen3.8-Flash-Next,其Qwen4架構的開放權重預覽版——一晚之內,中國實驗室推出兩款前沿等級的開放權重模型。Ox Alpha之前的四個匿名發布最終都由中國實驗室認領:智譜AI的GLM-5、小米的MiMo-V2-Pro、螞蟻集團的Lingxi Ling-2.6-flash,以及美團的LongCat-2.0。Ox Alpha不再只是平台限定的實驗;它已是開發者可以自行託管的模型。

本文中的每個數字皆為營運方自行宣稱、平台自身列表資料、公開公告或社群指紋比對之結果。DeepSWE 的數字來自獨立研究員 Ben Davis 的社群量測——完整的 113 項任務執行,並非官方排行榜登錄成績;不過約 63% 的數字如今已與 Z.AI 自家供應商報告的 DeepSWE v1.1 分數 63.4 高度貼近。身分問題已塵埃落定:8 月 26 日,Z.AI 以 GLM-5.3-Flash 之名釋出 Ox Alpha 作為開放權重模型——MIT 授權、總參數 320B、活躍參數 18B——確認了 tokenizer 與影片編碼器鑑識工作所收斂出的子名稱。架構、參數數量與定價現已由公司官方公布;仍屬廠商陳述而非經獨立驗證的部分,則為基準測試套件,以及 Z.AI 宣稱該匿名週的推論服務運行於約 10 萬顆中國國產 AI 晶片上、每 token 成本與主流 NVIDIA 硬體相當——這是多家媒體現已反覆轉述的公司宣稱,而非經稽核的數字。早期的 Gemini 假說——由每日 100T token 的處理能力所催生,並受到 Google DeepMind 研究人員的隱晦發文推波助瀾——是錯誤的,而此次釋出已為之定案。分析師 teortaxesTex 所提出的品質評價——以及他認為進一步訓練的 Ox Alpha 可望成為更強大 GLM 5.5 主力模型的建議——屬於該分析師個人基於一篇社群貼文的評估,並非獨立量測結果或智譜(Zhipu)的官方聲明。下文所述的循環動畫示範同樣是社群回報——一位開發者在 X 上的貼文,並在中國開發者論壇上獲得迴響——並非廠商的能力宣稱,營運方亦未宣布任何此類功能。

我們所知 — 以及我們所不知

快速版本:

• 營運者將 Ox Alpha 描述為「專為高效編碼、持續自主代理工作及實際生產用途打造的前沿模型」——這是一款推理模型,旨在處理長程軟體工程,以及結合文字與視覺情境的工作流程。

• 它具有 1,048,576 個 token(1M)的上下文視窗、131,072 個 token 的輸出限制,並接受文字、圖片和影片輸入——這是匿名發佈中首個標榜支援影片輸入的版本,而 GLM-5.3-Flash 版本確認這項能力是原生支援,而非事後附加的。

• 它免費了一週:每百萬個token的輸入與輸出均為$0,營運商聲稱「慷慨的速率限制、近乎無限制的使用」,以及每天100兆個token的服務容量——該容量事後據揭露是配置在大約10萬顆中國國產晶片上。

已確認:8月26日,Z.AI 以開放權重模型的形式發布了 Ox Alpha,名為 GLM-5.3-Flash——MIT 授權,總參數 320B、活躍參數 18B——正是子名稱 tokenizer、視頻編碼器、錯誤碼鑑識以及預測市場所匯聚指向的結果。獨立分析師 teortaxesTex 評價其大致相當於 GLM-5.3 的水平(視覺部分除外),並建議進一步訓練的 Ox Alpha 可能是更強大的 GLM 5.5 背後的骨幹模型。

• {{1}}閃爍多模態閱讀現在有了一個演示demo:當被要求生成一個循環動畫——一隻鵜鶘騎著自行車,並打開一部播放相同動畫的手機——時,Ox Alpha 給出了一個自包含的循環動畫,作為單一 HTML/SVG 檔案。{{/1}}{{2}}這是社群演示,而非廠商宣稱。{{/2}}

• 平台上早期的活動數據已經顯示出真實的生產流量,包括來自 Nous Research 的編碼代理(coding agent)和 Zed 編輯器。

• 該公司如今總算推出了——8 月 26 日,Z.AI 以 MIT 授權釋出 Ox Alpha,也就是開放權重的 GLM-5.3-Flash,一口氣終結了關於身分、規格與價格的種種疑問:總參數 320B、啟用參數 18B,原生多模態,Z.AI 定價表為每百萬 token 輸入 $0.15/輸出 $0.50,並聲明 50% 的上市優惠僅實施至 9 月 9 日——這個日期如今已過了八天,而目前實際計費的仍是折扣價。Z.AI 同時揭露,匿名那一週每日 100T token 的服務量,是跑在大約 10 萬顆中國國產晶片上,這在該規模下堪稱首例。這次揭曉沒有包含的,是獨立基準測試——該模型的成績單由廠商自行提供——因此最具代表性的獨立數字,仍是 Ben Davis 在完整 113 項任務的 DeepSWE 測試中約 63% 的成績,與 GPT-5.6 Sol mid 相當。

Ox Alpha 是什麼

該平台的產品說明將 Ox Alpha 描述為「一款專為程式編寫、持續性代理工作與生產環境工作負載所設計的推理模型——涵蓋長時程軟體工程、複雜推理,以及結合文字與視覺情境的工作流程。」這是一個明確的定位:它是為了長時間運行的代理迴圈與程式碼而生,而非一般對話用途。1M 的上下文長度便是關鍵線索——足以容納長達數小時的代理工作階段或大型程式碼庫——而 131K 的輸出上限則允許產生篇幅很長的單次輸出。它支援工具與函式呼叫以及結構化 JSON 輸出,這正是代理功能清單的其餘項目。

A single-column scoreboard for Ox Alpha listing: context window 1M (1,048,576) tokens, max output 131,072 tokens, input text/image/video, independent benchmarks none yet, price free for one week, throughput 56 tokens/s (P50, platform-measured), with a footer reading 'Operator + platform-reported; no independent scores yet', and the OrcaRouter logo in the bottom-right corner.

影片輸入是這張規格表上最獨特的一項。先前任何匿名模型都沒有宣稱具備此功能,而一個能處理影片幀以及文字和圖像的模型,所針對的工作負載類型與先前那些經聊天調校的版本不同。而且,正如之後的鑑識分析所示,它也是模型所能攜帶的最強身分識別線索之一。所有這些——描述、規格、速度數據——都來自營運方及該平台的產品頁面。GLM-5.3-Flash 的發布確認了主要規格(320B-A18B,原生多模態);速度與容量數據仍是廠商宣稱。

本週,多模態的故事迎來了一個具體的演示。開發者 Chetaslua——其伺服器端探測屬於指紋追蹤痕跡的一部分——發布了一項測試,他要求 Ox Alpha 製作一段循環動畫:一隻鵜鶘騎著自行車,並打開一支手機,手機上播放著相同的動畫,形成循環中的自我指涉迴圈。他的報告顯示,該模型產出了一份單檔案 HTML/SVG 動畫——鵜鶘的兩段式腿部確實踩著踏板,車輪速度與地面速度同步,帶有視差背景,以及手機在循環中的回饋效果。中國開發者論壇也各自以鵜鶘騎車提示詞進行了測試並討論了結果,因此這並非單一無法驗證的說法。由於輸出的是程式碼,這與該平台僅限文字輸出的規格一致:多模態理解與創意程式碼生成協同運作,而非原生影片合成。Chetaslua 的結論——這是多模態的成果,且一款強大的開源模型將隨之出現——是他個人的預測,而非廠商聲明;營運方尚未宣布任何消息。

為期一週的免費優惠。

這次促銷相當激進。上線首週免費,標榜「慷慨的速率限制、近乎無限的使用量」,並宣稱每日擁有 100 兆 token 的處理容量,營運者的註記還邀請用戶「看看你能做到什麼」。照字面解讀,每天 100T token 的規模將使這家營運商躋身全球最大的推論服務供應商之列——這項宣稱讀起來與其說是規格,不如說更像是一場壓力測試挑戰,而這也符合某種模式:匿名發布正是實驗室在不必掛名門外的情況下,取得前沿規模真實世界流量的方式。已確認的報導讓這項規模宣稱不再只是便於合理化,而是具體化:Z.AI 揭露,每日 100T token 的服務係運行在約 10 萬顆中國國產 AI 晶片上——這是前沿級發布首次在沒有 NVIDIA 硬體的情況下,以這種規模提供服務。這項揭露仍屬公司單方宣稱,現雖經多家媒體轉載,但未經獨立稽核,且其中還夾帶另一項較為軟性的供應商說法:Z.AI 表示,在國產叢集上的每個 token 成本與主流 NVIDIA GPU 相當。

「免費一週」的另一面,是隨之而來的價格無人知曉——這次揭露給了答案。Z.AI 為 GLM-5.3-Flash 公布的定價表為每百萬輸入 token 0.15 美元、每百萬輸出 token 0.50 美元,以及每百萬快取輸入 0.03 美元。一項五折的上市促銷據稱持續至 2026 年 9 月 9 日,將價格降至 0.075/0.25 美元。在該日期過後八天,實際計費的仍是折扣價:於 2026 年 9 月 17 日重新讀取時,z-ai/glm-5.3-flash 模型頁面的輸入價格為 0.075 美元、輸出為 0.25 美元,快取讀取為每百萬 token 0.0173 美元,且其上沒有任何促銷標示。對照 GLM-5.3 定價表的 1.40/4.40 美元,大約是二十分之一。實際後果是,9 月 9 日這個結束日期已經過時,而非具有約束力——以 0.15/0.50 美元編列預算的開發者,編的是目前沒有人被收取的數字。定價頁面無法解答的是原因為何。Z.AI 自家的模型清單仍列著 GLM-5.3-Flash 的 0.15/0.50 美元,因此這項促銷究竟是延長了、變成永久,還是單純任由它繼續跑,我們無從查證;折扣價是當日觀察到的事實,而原因仍未明朗。

首個完整基準測試——表現與 GPT-5.6 Sol mid 並駕齊驅

Ox Alpha 在 Artificial Analysis 或 LMArena 等獨立追蹤網站上仍然沒有條目——「frontier」一詞是營運方自己的說法,而 Z.AI 隨 GLM-5.3-Flash 發佈時公開的基準測試數字(DeepSWE v1.1 63.4、AutomationBench 48.8、Artificial Analysis Intelligence Index 57)是供應商自行報告的,並非獨立評分。自上線以來,改變的是社群量測的數字開始流傳——而且整體局面已經收窄。在 Kingbench 上,早期測試將 Ox Alpha 得分定為 87.5,僅次於 GLM-5.3 的 91.25。在 DeepSWE 上,獨立研究員 Ben Davis 先跑了 10 個任務的子集,報告了 80% 的 Pass@1,領先於 Claude Fable 5(65%)、GLM-5.3 與 Grok 4.6(62%),以及 GPT-5.6 Sol(52%)。此後,他完成了針對整個 113 個任務的 DeepSWE 全集的一次完整運行,修正後的結果約為 63%——大致與 GPT-5.6 Sol mid 相當。80% 的子集數字確實引人注目,但十個任務僅佔基準的不到 9%;Davis 本人也指出,全集數字才「更有意義」。這些是社群量測的數字,不是供應商的基準,也不是官方排行榜分數——但全集運行是迄今為止任何人從該模型得到的最具代表性的數字,而它現在與 Z.AI 自行報告的 DeepSWE v1.1 分數 63.4 非常接近——這是一個有用的交叉驗證,儘管該公司的數字是宣稱而非實際測量。

現在有一項對比,比發布時更為關鍵。DeepSeek V4 Pro 0813——DeepSeek 旗艦模型於 8 月 13 日發布的 GA 版本——在自家基準卡上回報的 DeepSWE 為 62.7,而較早的 DeepSeek V4 Pro Preview 則為 12.8。截至撰稿當下,這兩項數字皆為廠商自報,尚未經獨立實驗室重現。若與 GLM-5.3-Flash 約 63% 的社群全量測試成績、以及 Z.AI 自家 DeepSWE v1.1 的 63.4 並列檢視,DeepSeek 的 62.7 讓這兩個最知名的中國編碼代理宣稱同落在低 60 分區間。那個曾被視為 Ox Alpha 招牌的十分差距,其實是相對較便宜的小型模型 DeepSeek V4 Flash 0731 所測得;若對上 DeepSeek 旗艦模型,GLM-5.3-Flash 落點持平,而非領先十分。

另一個教訓是關於數字本身。分析師teortaxesTex——自匿名週以來一直在追蹤這些估算——指出關於Ox Alpha的第一份報告同樣給出了80%的DeepSWE成績:那是Davis引人注目的10任務子集,而在完整113任務集上的最終結果是63%。考量到DeepSeek V4 Pro 0813官方62.7的成績也在同一區間,他的觀察是至今沒有任何成績接近過經正當重現的80%——80%這個數字總是在模型公開亮相的初期出現,而一旦跑完整個測試集,最終就會落在60出頭。這是他的分析師解讀,而非實測數據,但對於下一個DeepSWE頭條新聞——包括任何關於GLM-5.3-Flash本身的新聞——這都是正確的視角。

A screenshot of the Artificial Analysis models leaderboard as of August 21, 2026, showing the Intelligence section led by Claude Opus 5 and Claude Fable 5, the largest context-window highlights, and the output-speed rankings — a frontier leaderboard Ox Alpha has no independent score on yet.

同樣存在的還有使用情況。平台活動數據顯示,在最初幾小時內就出現了真實的生產流量——包括來自 Nous Research 的代理式編碼專案 Hermes Agent,以及 Zed 編輯器。這兩者正是該模型所定位的「持續代理式工作與編碼」使用場景。這不是一個分數,但它是個訊號:擁有真實工作負載的開發者,決定將一個免費、前沿等級、匿名的賭注接入使用。在完整的 DeepSWE 跑分結果出爐之前,這批早期採用者就是僅有的證據;如今約 63% 的完整測試集數字,為該模型提供了一個基準錨點,用以與之權衡。

資料保留的細則

{{1}}免費週公告宣稱「零資料保留」。{{/1}}該模型在平台上的介紹則說得更為有所保留:{{2}}根據平台的隱形模型條款,提示詞與完成內容會由供應商保留,但不會用於訓練。{{/2}}如果你正準備將專有程式碼貼進一個 1M-token 的視窗,而這個視窗由一家在 Z.AI 於 8 月 26 日出面之前一直保持匿名的供應商所擁有,那麼這個差異就至關重要。{{3}}在 Z.AI 發布明文如此規定的條款之前,請將「零資料保留」視為行銷話術——任何你不想被記錄的內容,都請透過另一個可歸屬的模型來處理。{{/3}}

匿名模型操作手冊

Ox Alpha 是六個月內第五次匿名發布,先前四次都以同樣方式落幕——匿名登場、免費流量爆發、然後有公司出面承認:

• Pony Alpha(2026年2月)——智譜AI在推出約五天後確認其為GLM-5,即其744B參數的MoE旗艦模型。

• Hunter Alpha(3月11日)——一款免費、擁有1M上下文、參數達萬億級的模型,成為春季猜測的焦點,被廣泛認為是Deep​Seek V4;最終揭曉為小米的MiMo-V2-Pro,其伴隨的Healer Alpha則被確認為MiMo-V2-Omni。

• Elephant Alpha(四月)——一款免費且注重效率的文字模型,螞蟻集團在它出現約兩週後宣稱其為 Lingxi Ling-2.6-flash。

• Owl Alpha(四月下旬)——一款以代理為核心的模型,具備原生工具呼叫能力與約一百萬字的上下文長度;美團已於六月三十日確認其為 LongCat-2.0,這也是首個完全在中國國產晶片上完成訓練與部署的萬億參數模型。

• Ox Alpha(8月20日)——8月26日揭曉為GLM-5.3-Flash,一個開放權重、MIT許可的320B-A18B模型;其身分、授權與規格皆在面具揭下的同一天正式公開。

A two-column scorecard titled 'The anonymous models — and their reveals', listing Pony Alpha revealed as GLM-5 by Zhipu AI, Hunter Alpha as MiMo-V2-Pro by Xiaomi, Elephant Alpha as Lingxi Ling-2.6-flash by Ant Group, Owl Alpha as LongCat-2.0 by Meituan, and Ox Alpha marked '??? — unclaimed', with a footer noting reveals per each lab's public announcement and Ox Alpha unclaimed as of August 21, 2026, and the OrcaRouter logo in the bottom-right corner.

為什麼要戴著面具推出一個好模型?標準的解讀——Hunter Alpha 週期使之具體化——是匿名性消除了評估中的品牌偏見,而免費使用則以頂尖規模眾包真實世界的評估數據,同時所有人都在爭論其擁有者。正如對這種模式的一項分析所言:「沒有品牌,就是行銷。」額外的優勢在於速度:一個匿名模型可以在數小時內觸及全球開發者受眾,無需發佈活動,而這種神祕感本身就成為了傳播管道。

Ox Alpha 是誰?

直到8月26日發布之前,沒有任何公司宣稱擁有它,智譜AI也隻字未提——但在模型亮相後的48小時內,確鑿證據的局面出現變化;以下鑑識分析說明了為何以GLM-5.3-Flash之名揭露時,幾乎毫無意外。產能數字一度不利於鑑識結論:每日100兆個token看似頂尖實驗室在NVIDIA晶片上的典型特徵,而Google DeepMind研究人員的隱晦貼文更助長了「Ox Alpha是新一代Gemini」的理論——該理論一度聲勢高漲,直到tokenizer證據、以及隨後Z.AI自己的發布,終結了它。最強的信號是tokenizer。社群自建的指紋辨識工具modelprint對Ox Alpha進行了九項基礎設施探測,發現其中六項與Z.ai的GLM-5.3相符;所有四項正規化tokenizer計數皆符合GLM家族,而最佳的非GLM候選僅達成四項中的兩項。獨立研究員Ben Davis回報,Ox Alpha在25個測試提示詞中的token計數與GLM-5.3完全一致,僅有恆定的+75 token差異,他將其歸因於隱藏的封裝層。Tokenizer匹配是最難偽造的身分訊號——模型若不重新訓練,就無法改變其文本切分方式。

影片路徑是第二個特徵。Ox Alpha 的影片 token 消耗量在四個受控樣本中與 GLM-5V-Turbo 完全一致——具有相同的幀取樣、時長縮放與解析度機制——而 MiMo v2.5、Qwen 3.8 Max 與 GLM-4.6V 則全部出現分歧。這是一個強烈的訊號:影片處理深植於模型本身,而非附加功能。其餘的指紋堆疊也呼應同樣的解讀:Ox Alpha 拒絕音訊輸入的方式與 GLM-5V 相同,帶有 GLM 特有的「1301」錯誤碼,輸出風格相似(每 1,000 個字元約 1.3 個表情符號),帶有相同的受限參數與 API 設定——這些設定在 Ox Alpha 上線前兩天出現在平台的 GLM-5.3 清單上——且知識截止日期接近 2025 年 11 月。

這項身分辨識在智譜自己的劇本中有先例:二月的匿名發布 Pony Alpha,結果是 GLM-5,約在發布五天後被認領。本週流傳的分析師解讀——即 Ox Alpha 是 GLM-5.3,推測為 Flash 模型——得到了 Pliny the Liberator 的呼應,他說他的代理已確認「Ox-alpha 來自 Zai,屬於 GLM-5.X 系列。」獨立分析師 teortaxesTex 在品質上做出相同判斷,並補充了時間點的說法:他將 Ox Alpha 評為約莫 GLM-5.3 的水準(視覺能力除外),並認為這個周轉速度最令人驚豔——在 8 月 14 日發布後的幾天內,就將純文字的 GLM-5.3 壓縮並配備可用的視覺功能出貨。這是一位分析師的評估,而非獨立評分,而他認為這應該讓「中國火速發布模型」的敘事停下來想一想。他最新的貼文在該解讀之上疊加了一個路線圖猜測:GLM-5 的更新週期可能很短;Ox Alpha 與 GLM-5.3 相當接近,以至於將其用作子代理幾乎沒有意義——「直接跑 ox @4」是他對直接運行該模型的簡稱;而進一步訓練的 Ox Alpha 作為主力模型會非常合理,用他的話說是「馱獸」,為更強大的 GLM 5.5 鋪路。這是分析師對路線圖的猜測,而非智譜的聲明。相比之下,子名稱的問題已經塵埃落定:8 月 26 日,Z.AI 以 GLM-5.3-Flash 之名發布了 Ox Alpha。曾經讓 Flash 標籤停留在「推測」狀態的癥結——GLM-5.3 於 8 月 14 日以純文字模型發布,而 Ox Alpha 宣稱支援影片輸入——正是這次發布所解決的:GLM-5.3-Flash 是一個獨特、原生多模態的模型,而不是同一個純文字模型。其他理論——小米的 MiMo 團隊、DeepSeek——曾被提出,但大多因 tokenizer 和影片證據而被排除,而這次發布徹底解決了系列歸屬問題。Davis 主張關注 Flash 標籤的理由,結果是實際層面的:因為 Ox Alpha 確實是 GLM-5.3-Flash,性能達到 GPT-5.6 Sol 中段水準,它現在可以本地運行——權重放在 Hugging Face 上,SGLang、vLLM 和 TokenSpeed 都能提供服務——這使得一個中階前沿編碼模型變成一次性硬體成本,而不是對任何願意自行託管的人按 token 計費。

地緣政治框架是分析師的,而非證據的:「這給美國前沿實驗室帶來更巨大的壓力,與中國的差距正在縮小。」這是對一個免費的智譜級模型以前沿規模運行、對競爭秩序意味著什麼的詮釋——而硬體揭露賦予了它分析師原本沒有的優勢。每天在約10萬顆國產晶片上處理100兆個token,是首次大規模證明:沒有NVIDIA晶片的中國技術堆疊也能承載前沿推論流量——正是NVIDIA執行長黃仁勳今年春季在Dwarkesh Podcast上警告過的情境。他當時主張,出口管制會加速中國不依賴NVIDIA的技術堆疊,而一個在中國國產硬體上運行最佳的前沿模型,對美國而言將是「可怕的結果」。Z.AI的成本持平數字仍只是廠商說法,但這個事件本身是真實的。同一個晚上,模型端也讓這點變得具體:正當Z.AI發布GLM-5.3-Flash之際,阿里巴巴推出了Qwen3.8-Flash-Next,這是其Qwen4架構的開放權重預覽版。一個晚上出現兩個中國前沿級開放權重發布,正是觀察者所稱「中國開源的大日子」的具體樣貌。

你這週應該在此基礎上繼續建設嗎?

免費週已經結束,但測試仍然便宜:9 月 17 日實際計費的費率是每百萬個 token 輸入 $0.075/輸出 $0.25,而不是定價表上的 $0.15/$0.50——據稱將於 9 月 9 日結束的 50% 上市促銷,八天後依然有效。如果你從事長時程的代理式工作、在長脈絡上寫程式,或執行影片密集的管線,那正是 Ox Alpha 所鎖定的交集——而且由於權重開放,你可以在自己的硬體上跑測試,而不必仰賴某個匿名平台的容忍。兩點提醒。第一,「前沿」這個標籤仍只是一種宣稱:GLM-5.3-Flash 的成績單是廠商自行報告的,而唯一可靠的獨立數字——Davis 約 63% 的 DeepSWE 跑分——雖屬強勁,卻與早期 10 項任務子集那廣為流傳的 80% 相去甚遠。第二,$0 的價格是有時限的,而這次揭曉也為之後的價格定了調——就能力而言算便宜,但已不再是免費。開放權重發布所移除的是依賴性:檔案已經釋出,因此模型可以自行託管,而不必租用。那是測試的樣貌,而不是依賴。

在正式環境中安全執行那類測試的方法,就是備援鏈:實驗性模型健康時由它回應,一旦它停滯、出錯或消失,請求就會立刻轉向經過驗證的模型。這正是路由層的用途。這次揭露讓備援選擇變得再簡單不過:Ox Alpha 就是 GLM-5.3-Flash,而這個模型本身已以真實名稱在 OrcaRouter 上線,價格為每百萬個 token 輸入 $0.075/輸出 $0.25,快取讀取為 $0.0173——這是原本聲明於 9 月 9 日結束的五折上市價,而截至 9 月 17 日,頁面上的價格仍是這個數字,而不是 $0.15 / $0.50 的牌價。它以 0% 加成提供,單一 API 橫跨 200 多個模型,並具備自動容錯移轉,讓上市週的流量暴增不會演變成你的服務中斷。把新模型放在前面試用,並在鏈中它後面接上經過驗證的備援;當價格變動時,你在 OrcaRouter 上看到的數字,就是你當天支付的數字。或者完全略過 API——權重是開放的,所以把 GLM-5.3-Flash 自行託管在同一條鏈後面,也同樣可行。

看什麼

六件事將會揭示後續的發展。獨立基準測試:GLM-5.3-Flash 的成績單是由廠商自行公布的,Davis 那約 63% 的 DeepSWE 跑分是目前唯一紮實的獨立數字,DeepSeek V4 Pro 0813 官方公布的 62.7 如今也落在同一區間,而 Artificial Analysis 或 LMArena 的收錄——或是一場獨立的一對一對決——將是對「前沿」究竟是事實還是口號的最終檢驗。價格走勢:就目前證據來看,穩態與否的問題已有答案——50% 促銷原本宣稱於 9 月 9 日結束,但到了 9 月 17 日,實際提供的仍是折扣後的 $0.075 / $0.25 費率,所以要編列預算應以促銷價而非 $0.15 / $0.50 的定價為準;尚未釐清的是原因,因為 Z.AI 自家的定價並未變動。硬體宣稱:Z.AI 表示,那段匿名期間是跑在大約 10 萬顆、成本與 NVIDIA 相當的國產晶片上——這項說法在大規模下的首場公開考驗,就是它能否通過獨立審視,以及國產堆疊是否會成為 GLM 系列的預設選項。採用率的盤算:Ox Alpha 在匿名偽裝下所吸引、登上平台榜首的流量,如今它有了名稱、授權和價格之後,是否能轉化為自架與 API 部署。續集:GLM-5.3-Flash 是否把 Ox Alpha 定位為墊腳石——teortaxesTex 的暗示是,進一步訓練的版本將成為更強大 GLM 5.5 的主力,這會讓這次發布成為下一代 GLM 的基礎。以及外界的反應:隨著 Qwen3.8-Flash-Next 在同一晚登場,背後還有國產晶片的揭露,壓力落在美國前沿實驗室——以及出口管制的辯論——身上,必須做出回應;接下來要看的是,快速跟進、價格動作或政策回應,會不會落在這道差距的另一側。

誠實的結論:Ox Alpha 是一場在兩個方向上都異常廉價的實驗。該平台測試了一個定價 $0 的匿名前沿級模型能否在一週內贏得真實的生產流量——結果成功了,而且說服力十足,以至於 Z.AI 不僅在第六天出面,還在同一晚以開放模型的形式釋出了權重。現在你可以測試這個模型是否值得在你的技術堆疊中佔有一席之地,而且不再有匿名風險:GLM-5.3-Flash 是一個具名、採 MIT 授權、可自行託管的模型,並有公開定價;硬體問題也有了答案——Z.AI 表示每日 100T token 的服務運行在大約 10 萬顆中國國產晶片上,這是公司聲稱,但如今已被廣泛報導。仍有待了解的是:「前沿」是否經得起獨立測量、Z.AI 的國產晶片成本持平主張在大規模下是否站得住腳、為何 50% 的發表優惠在宣稱的 9 月 9 日結束日期過了八天後仍是實際提供的價格,以及這次揭露是否如 teortaxesTex 所暗示,將 GLM-5.3-Flash 定位為更強大 GLM 5.5 的主力。去做這個實驗,但在底下備妥退路。

本文中的比較4

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新