Union Alpha 對比 GLM-5.3-Flash 的主視覺標題卡,在一行統計數據上方寫著「免費,直到有人認領為止」,該統計數據對比了 Union Alpha 的 262K 上下文、$0 價格與缺少的基準測試,以及 GLM-5.3-Flash 的 1M 上下文、$0.075 / $0.25 定價與 MIT 權重。
Guides & Insights

Union Alpha 對決 GLM-5.3-Flash:免費,直到有人認領為止

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Only one of these two models can be taken away from you. Union Alpha is an unclaimed stealth listing that appeared on 16 September 2026 and became routable on 17 September 2026. It costs nothing and belongs to nobody who will admit it. GLM-5.3-Flash costs $0.075 per million input tokens and $0.25 per million output tokens, and Z.ai published its weights under MIT on 26 August 2026 — which means if the API ever gets worse, more expensive or disappears, you can download it and serve it yourself. Everything else about this matchup is close. That one difference is not, and it is the reason the answer to "which should I call today" splits cleanly in two.

這種配對並非任意為之。GLM-5.3-Flash 生命中的頭六天,正是在 Union Alpha 如今所處的一模一樣條件下度過的:一個名為 Ox Alpha 的匿名上架項目、供應商欄位寫著「Stealth」、沒有實驗室、沒有模型卡、沒有權重。Z.ai 於 8 月 26 日揭露自身身分,匿名上架項目也就讓位給一個公開的模型,附帶公開的定價。一個月後,Union Alpha 正在同一個平台上搬演同一套劇本,而且這回對外宣傳的規模更小——而這一次,沒有人公布任何容量數字,也沒有任何與之搭配的「近乎無限」承諾。

所以免費端點並不是付費端點的較便宜版本。它是不同類型的東西,有不同的到期期限,而那些有所不同的規格,正是能告訴你它是為了什麼而打造的規格。

What the two spec sheets actually say

Both figures below are read off the live model pages on our routing layer on 17 September 2026, plus the vendor's own release material for the parts a routing layer does not publish.

• 上下文視窗 — Union Alpha 262,144 個 token(262K)對比 GLM-5.3-Flash 1,048,576 個 token(1M)。僅有其四分之一的視窗。

• Maximum output — Union Alpha 131K tokens vs GLM-5.3-Flash 128K. Effectively level, and the one row where the stealth model is nominally ahead.

• 輸入模態 — Union Alpha 接受文字與圖像,而 GLM-5.3-Flash 則接受文字、圖像與影片。Union Alpha 僅輸出文字,GLM-5.3-Flash 亦然。

• 價格 — Union Alpha 在明確設有速率限制的免費方案中為 $0,超額請求會回傳 HTTP 429。GLM-5.3-Flash 每 100 萬個 token 為 $0.075 輸入 / $0.25 輸出,快取讀取則為 $0.017。

• 推理控制 — Union Alpha 未提供任何此類控制。其接受的參數為 tools、tool_choice、response_format、temperature、top_p 與 max_tokens,這就是完整清單。GLM-5.3-Flash 則提供推理控制,具有 low、high 與 max effort,預設為 max。

• 權重 — Union Alpha 沒有發布任何儲存庫、授權條款、參數數量或架構說明。GLM-5.3-Flash 是 320B 參數的稀疏混合專家模型,每個 token 約有 18B 活躍參數,採用 MIT 授權,可供下載。

• 基準測試 — Union Alpha 的基準測試欄位顯示「待定」。GLM-5.3-Flash 則已公布一組結果。

• 我們層級上的過去一週流量 — Union Alpha 1.2M tokens 對比 GLM-5.3-Flash 18,128.8M tokens。仔細看這點:GLM-5.3-Flash 已經全面開放三週,而 Union Alpha 僅自 9 月 17 日 05:32 UTC 起才可用,因此這個差距衡量的是有多少生產流量有時間累積,而不是任一模型有多好。

往下讀那份清單,Union Alpha 的輪廓是自洽的。262K 視窗、圖像輸入、沒有影片、沒有推理旋鈕、也沒有權重,這樣的規格是快速層級或同系列變體的樣貌,而非前沿旗艦——這正是 GLM-5.3-Flash 在其自身家族中所佔的相同結構位置。那是從宣傳表面得出的假設,不是研究發現,而值得點名競爭解釋:營運商也可能特意裁剪預覽版的宣傳表面,正是為了阻撓指紋辨識。兩種解讀目前都還沒有證據支持。

Two-column scoreboard comparing Union Alpha and GLM-5.3-Flash: Union Alpha shows $0 rate-limited, 262K tokens, text + image, 10.00 s p50 first token, no reasoning control and benchmarks pending; GLM-5.3-Flash shows $0.075 in / $0.25 out, 1M tokens, text + image + video, 6.49 s p50 first token, low / high / max reasoning control and published benchmarks, eight of them measured independently of the vendor.

延遲的情況出現反轉,而其中一個數字正顯得不尋常

This is where the matchup gets more interesting than the spec sheet suggests, and where you should be suspicious of the headline figure.

Union Alpha 的頁面回報 p50 首次 token 時間為 10.00 秒——而 p95 也是 10.00 秒。百分位數完全相同,正是樣本量單薄的典型樣貌:當時間窗內幾乎每個請求都落在同一個分桶裡,中位數與尾端就會彼此塌縮重合。請把那個 10 秒的數字理解為「起步偏慢,確切數值仍未底定」,而不是一個精確的中位數。GLM-5.3-Flash 在同樣類型的時間窗內量測,p50 回報 6.49 秒,對比 p95 的 10.00 秒——這才是具有真實離散程度的真實分布。

接著是輸出速度,而這一點各方說法確實存在分歧。我們的 routing layer 在過去一週測得 Union Alpha 為每秒 225 個 token。獨立測試者在發表當天直接呼叫該端點,形容的速度則慢得多——需要排隊,而且連 trivial prompt 都要等上好幾分鐘。我們不會假裝這兩者能夠吻合。最可能的解釋是,rolling window 大多落在離峰時段,對比的是上線時刻的壅塞;而誠實的立場是,Union Alpha 的吞吐量在它上線足夠久、可供測量之前,仍屬未定。GLM-5.3-Flash 回報每秒 77.8 個 token、錯誤率 0.27%,而 Union Alpha 則為 1.1%。

沒有爭議的是取捨的方向。GLM-5.3-Flash 更早開始產生輸出,而且產出穩定。Union Alpha 的免費方案在未壅塞時可能爆發得更快,而且在你已經送出請求之前,它不會告訴你你正處於哪種模式。

免費不是一種價格——而是一組你還沒讀過的條款。

「$0,受速率限制,超過上限即回傳 HTTP 429」就是Union Alpha 模型頁面上全部的定價說明。沒有公布速率上限、沒有每分鐘請求數、沒有容量數字,也沒有結束日期。隱蔽預覽沒有資料處理協議、沒有載明的保留期限、沒有管轄權、沒有 SLA、沒有支援管道,也沒有通知期,因為根本沒有具名的締約方可以要求它遵守這一切。這不是避開它的理由,而是你必須清楚知道自己究竟在交易什麼的理由。

這個具體風險並非假設,因為我們親眼看著它發生。當 Ox Alpha 的營運者在 8 月 26 日現身時,免費方案並沒有挺過那項公告——匿名上架消失了,取而代之的是 GLM-5.3-Flash 的付費定價。如今指向 Union Alpha 的正式環境路徑,有著一個沒有人公布過的到期日。為 404 而建置。

還有第二項、較不顯眼的成本:沒有推理參數,就意味著無法把思考調低。在一個總是全力推理的模型上,你每次呼叫都得用輸出權杖為這份深思付費——這在 GLM-5.3-Flash 上是實實在在的支出項目,而在 Union Alpha 上則在結構上不可能產生,因為那個旋鈕根本不存在。這究竟是一項折扣,還是少了一個控制項,取決於模型是否需要這份深思;而由於 Union Alpha 尚未公布任何基準測試資料,目前沒有人能告訴你答案。

OrcaRouter model page for stealth/union-alpha-free captured 17 September 2026: context 262K tokens, max output 131K, input text + image, output text, p50 TTFT 10.00 s, price Free and rate-limited, P50 and P95 TTFT both 10.00 s over 7 days, traffic 1.2M tokens / 7d, supported parameters limited to max_tokens, response_format, temperature, tool_choice, tools and top_p, and an over-limit note reading HTTP 429 when a limit is hit.

GLM-5.3-Flash 的 0.075 美元實際上能買到什麼

以每百萬 token 輸入 $0.075、輸出 $0.25,快取讀取為 $0.017 的價格來看,GLM-5.3-Flash 的定價像入門廉價模型,規格卻像另一回事:100 萬 token 的脈絡視窗、影片輸入,以及 MIT 授權的權重。我們自家模型頁面的成本計算工具,在其預設假設下,具代表性的工作負載在啟用提示快取時每月約 $1.07,未啟用時則約 $1.28——這種差距唯有在大量使用時才顯重要,但蒐集它不需任何成本,因為快取只是一個旗標,而非需要重新架構。

The part that is not on the pricing page: because the weights are MIT and downloadable, $0.075/$0.25 is a ceiling, not a floor. If Z.ai raises the API price, or the endpoint degrades, or you simply outgrow metered inference, the same model runs on your own hardware with no one's permission. That option does not exist for Union Alpha at any price, and it is why "free" and "cheap" are not the same axis in this comparison.

兩個模型都放在 OrcaRouter 上同一把金鑰後面,該平台以 0% 加成路由 200 多個模型 —— 供應商標價原樣傳遞。對這場對決中付費的那一半來說,這點比免費的那一半更重要:如果 Z.ai 調降或調漲 GLM-5.3-Flash 的價格,我們頁面上的數字當天就會換成新的,而且不必再簽第二份合約、不用另一套 SDK,也不必為了跟上而進行移轉。而且因為兩者都能透過同一個端點存取,你可以評估 Union Alpha,然後只改一個模型字串就退回 GLM-5.3-Flash,其他什麼都不必動。

OrcaRouter model page for z-ai/glm-5.3-flash captured 17 September 2026: released 2026-08-26 by Z.ai, 320B total / 18B active parameters, 1M-token context, 128K max output, text + image + video input, text output, p50 TTFT 6.49 s and p95 10.00 s over 7 days, traffic 18,128.8M tokens / 7d, input $0.07 per 1M, output $0.25 per 1M and cache read $0.017 per 1M.

The benchmark question is the honest differentiator

Union Alpha 沒有基準測試數字。其模型頁面的基準測試欄位顯示「待定」,而在營運方自己的刊登資訊之外,沒有任何來源產生過可重現的分數。你現在看到任何流傳的這個模型數字,都未經證實——包括那些聽起來最亮眼的數字。這不是在貶低這個模型。這只是推出一天後的證據狀態,也是目前還不該以它為基礎來開發的最重要理由。

GLM-5.3-Flash 所公布的一組數據並非全部由廠商自行回報,而這項區別會改變你能拿它來做什麼。我們的模型頁面會為每一筆項目標註其來源,其中八筆來自 Artificial Analysis,而非 Z.ai:GPQA Diamond 91.2、AA Coding 71.5、AA Intelligence 41.9、SciCode 51.6、Long-Context Recall 80、Humanity's Last Exam 39.9、tau_banking 47.2,以及 terminalbench_v2_1 84.27。這些數據是由第三方實測,而非由打造該模型的實驗室回報,這使它們與清單上其他所有項目分屬不同類別。

其餘部分則是 Z.ai 自己公布的數據:DeepSWE v1.1 63.4、Terminal-Bench 2.1 84.3、AutomationBench v1.0.6 48.8、Agents' Last Exam 26.3、BabyVision 53.4、Chartography 78、CharXiv Reasoning 89.4、HLE with tools 55.3、MMVU 80.5、MVBench 77.8、NL2Repo 56.3、OfficeQA Pro 62.4 以及 Toolathlon Verified 78.4。我們沒有重新跑過其中任何一項,而它們是一項背後有方法論支撐的聲稱——比完全沒有聲稱更強,但比你自己掌控的測試框架更弱。把這兩份清單拿來跟 Union Alpha 對照,這種不對稱就是整個關鍵:GLM-5.3-Flash 有第三方測出的分數,而 Union Alpha 則完全沒有——不是廠商自行回報的,也不是獨立測量的,什麼都沒有。

實際的結果是,你目前無法就品質比較這兩個模型。你可以比較它們的價格、上下文、模態、延遲和條款,而這些比較才是決策真正取決於的依據。如果你需要的是品質比較,那麼今天的答案是:這種比較並不存在。

Union Alpha 真正勝出之處

三個地方,而且它們都不小。

首先是實驗成本,而這正好是零。如果你想知道一個 262K 視窗的模型如何處理你的儲存庫、你的提示詞形態或你的工具結構定義,Union Alpha 今天就會免費告訴你,無須綁定任何信用卡。在 GLM-5.3-Flash 上,同樣的探索則要計量收費——雖然便宜,但並非免費,而且累積幾百次失敗的 agent 執行後就很可觀。

第二點是輸出上限。Union Alpha 的 131K token 最大輸出在名目上大於 GLM-5.3-Flash 的 128K,而對於長時間的單次生成——一整份檔案、一份冗長的結構化文件、一段必須在一輪內完成的代理對話紀錄——這一列決定了你是否會遇到截斷。

第三點是沒有推理稅。如果你的工作負載具備高流量、低難度且可容忍延遲的特性,那麼一個沒有深思調節鈕的模型就無法為深思向你收費。它也無法被調校,而這就是取捨所在。

在 GLM-5.3-Flash 勝出的地方,也就是其餘大多數情況

四倍的上下文視窗,這正是能否容納中型程式庫與大型程式庫之間的差別。視訊輸入,而 Union Alpha 完全沒有這項功能。可調降的推理控制,這既是成本調節桿,也是品質調節桿。可自行持有的權重,這把供應商關係轉化為資產。公開的基準測試,其中八項由獨立於供應商的第三方測定。6.49 秒的中位數啟動時間,相較於固定不變的 10 秒。以及一個可辨識的交易對象,具備授權、司法管轄區與支援管道——這個不耀眼的東西,才能把原型變成一套系統。

How to take both without betting on either

在此可能犯的錯誤,就是把這項選擇當成非此即彼。事實並非如此,而工具鏈讓人不費吹灰之力就能不再那樣看待它。

把你的評估流量導向 Union Alpha,因為它免費,而且可能會證明它非常出色。把 GLM-5.3-Flash 放在它後面作為備援,因為它便宜、規格明確,而且無法從你身邊撤走。接著,讓切換成為一項設定,而不是一次重寫。這正是路由 DSL 的用途——在單一端點後面組合多個模型,讓請求可以先嘗試未經證實的那個,並在它限流、回傳 429 或不再存在時,落到已證實的那個上。跨供應商的自動容錯轉移也能做到同樣的事,而無需你撰寫重試邏輯,而且這正是讓匿名端點得以安全評估的特定機制:你不是在承諾某個模型,你是在承諾一個 socket。

Union Alpha 私下其實是 GLM-5.3-Flash 嗎?

幾乎可以肯定不是同一個模型,而規格表就是原因。Union Alpha 的上下文只有 GLM-5.3-Flash 的四分之一,沒有視訊輸入,也沒有推理參數。一個就是 GLM-5.3-Flash 的模型,不會在被拿掉這三樣東西的情況下推出。一個同家族、定位在其下方的模型,更符合所宣傳的內容——但沒有人公布指紋,「Union」這個名字打破了過去一年來一直沿用的動物代號命名慣例,而且兩種說法都沒有證據。本週你讀到的任何篤定歸因,包括篤定的否認,都當成猜測。

預覽結束後,Union Alpha 會怎麼樣?

先例是本文中最有用的東西。Ox Alpha 於 8 月 20 日出現,於 8 月 26 日揭曉,而它的免費方案並未比揭曉活得更久。從頭到尾,六天。如果 Union Alpha 循著同樣的軌跡,免費窗口將以天計算,而最可能的結果是:具名供應商、價格、公布權重,或該上架項目直接消失。這四者中任何一項都會改變你能用它做什麼。它們全都不會事先公告。

把你重視的工作交給 Union Alpha 安全嗎?

只有在你可以接受把那樣的工作交給一個身分不明的營運方——沒有明示的保留政策、沒有司法管轄權歸屬,也沒有任何協議——時,才可以這麼做。模型頁面明白表示,在模型接受評估期間不會揭露供應商,而且功能與可用性可能未經通知就變更——這是合理的警告,而不是危險警訊。合理的界線是你可以承受遺失的程式碼與資料:公開儲存庫、合成測試資料、用完即丟的分支。客戶資料、憑證,以及任何受合規義務約束的內容,都應該留在這個比較中付費、可歸屬的那一邊。

今天要打給哪一位

If you want to know whether a 262K-window image-capable model is useful to you, call Union Alpha right now and pay nothing. Do it behind a fallback, expect a 429 eventually, assume the free tier dies without notice, and do not let anything you cannot lose touch it. That is a genuinely good deal and it expires on a schedule nobody has published.

If you need a model you can commit to — 1M of context, video, a reasoning lever, published scores, an MIT licence and weights that make the price a ceiling rather than a floor — GLM-5.3-Flash is the one, and at $0.075/$0.25 with $0.017 cache reads it is not an expensive commitment. Half the benchmark set is a claim rather than a measurement, but the other half was measured by someone other than Z.ai, and the rest you can check against your own workload for a few cents.

這篇文章真正值得帶走的不對稱,並不是免費與付費之分,而在於這兩個模型當中,一個是試用,另一個是購買。Union Alpha 在有人認領之前都是免費的。GLM-5.3-Flash 則可以留著。