GLM 5.3 Prime 與 GLM-5.3-Flash 的英雄標題卡,標題寫著「GLM 5.3 Prime vs GLM-5.3-Flash:18 倍的差距」,副標題為「一個是純文字的服務通道,另一個是多模態模型」,並有三個標籤寫著「價格 / 1M:$2.80 / $8.80 vs $0.15 / $0.50」、「模態:僅文字 vs 文字、圖像、影片」以及「授權:專屬訂製 vs MIT」,頁尾一行寫著「GLM-5.3 於 2026 年 8 月 14 日發布;GLM-5.3-Flash 於 2026 年 8 月 26 日推出。」
Guides & Insights

GLM 5.3 Prime 對上 GLM-5.3-Flash:兩款不同模型之間存在 18 倍的價格差距

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

如果各位前來時購買決定已經做了一半,這裡用一行話說明比較結果:GLM 5.3 PrimeGLM-5.3 的旗艦權重,透過加速服務層級販售,每百萬 token 分別為 $2.80 與 $8.80,而 GLM-5.3-Flash則是另一個獨立的原生多模態模型,擁有自己的開放權重,價格為 $0.15 與 $0.50。兩者之間的差距在輸入與輸出上大約都是十八倍。那不是層級上的差異——而是在同一家族中處於不同位置的另一個模型;這兩個名稱之所以會在模型清單上並列,唯一的原因是兩者出現的時間相隔不到六週。

把這件事搞錯,兩個方向的代價都很高。把 Flash 當成 Prime 的廉價版,你會對它辦不到的事感到意外。把 Prime 當成更快的 Flash,你就會為一個無法看見圖像的模型,付出高出十八倍的價格。

先從每一個實際上究竟是什麼開始

GLM-5.3-Flash 是一款擁有 3200 億參數、180 億活躍參數的多模態混合專家模型,於 2026 年 8 月 26 日依 MIT 授權條款發布,權重託管於 Hugging Face 與 ModelScope。它能在同一次請求中原生接受文字、圖像、影片與檔案,具備 1,000,000 個 token 的上下文視窗與 128,000 個 token 的輸出上限,而且是獨立預訓練而成,並非從旗艦模型蒸餾而來。其混合線性加稀疏注意力設計,將注意力運算量削減至約三分之一,並讓 KV 快取相較於 GLM-5.3 縮小至不到四分之一——這正是其成本優勢在架構層面的來源,而非來自折扣。

GLM 5.3 Prime 就是 GLM-5.3——一個擁有 400 億活躍參數的稀疏混合專家模型,於 2026 年 8 月 14 日宣布,自 8 月 18 日起在 API 中提供,權重於 8 月 25 日開放——透過高速通道提供服務。同樣的 1,000,000 token 上下文,同樣的 131,072 token 輸出上限,文字輸入與文字輸出,推理必須採用最高強度,並以最高為預設。Z.ai 自家文件並未列出 Prime SKU;此層級存在於第三方平台上,該平台指名其背後為單一上游供應商。

計分板

A two-column scoreboard titled 'GLM 5.3 Prime vs GLM-5.3-Flash - the scoreboard'. The GLM 5.3 Prime column reads 'Price / 1M: $2.80 / $8.80', 'Cached input: $0.56', 'Modality: text only', 'Weights: none', 'Intelligence Index: 45, same as GLM-5.3', 'Speed: 1.5-2x, vendor-reported'; the GLM-5.3-Flash column reads 'Price / 1M: $0.15 / $0.50', 'Cached input: $0.03', 'Modality: text, image, video, file', 'Weights: open, MIT', 'Intelligence Index: 42', 'Speed: 46 tokens/sec, independently measured'; the footer reads 'Flash figures per Artificial Analysis v4.3.2; Prime speed is vendor-reported with no independent measurement.'

• 價格 — GLM 5.3 Prime 每 1M 為 $2.80 / $8.80,對比 GLM-5.3-Flash 每 1M 為 $0.15 / $0.50
• 快取輸入 — 每 1M 為 $0.56,對比每 1M 為 $0.03
• 倍率 — 在任何快取之前,輸入與輸出約為 18×
• 模態 — 僅文字,對比文字、圖像、影片與檔案輸入
• 參數 — 旗艦級 MoE 啟用 40B,對比總計 320B / 啟用 18B
• 權重 — 開放,採用帶營收門檻的客製授權,對比 MIT,今日即可下載
• 最大輸出 — 131,072 tokens,對比 128,000 tokens
• 上下文 — 兩者皆為 1,000,000 tokens
• 智慧指數 — GLM-5.3 在 v4.3.2 指數上得分 45;GLM-5.3-Flash 得分 42
• 每項 Index 任務成本 — 旗艦版為 $2.01,對比 Flash 為 $0.25
• 速度 — 約每秒 61 個輸出 tokens,對比約 46,兩者皆為獨立測量的中位數
• 訂閱存取 — Prime 不在 Z.ai 的 Coding Plan 中;Flash 有,且配額為 3×

那份清單中有兩列值得多說幾句,不該只用一個項目符號帶過。第一項是智慧差距:在 v4.3.2 修訂版下,Artificial Analysis Intelligence Index 上的三分之差,45 對 42。同一指數較早的修訂版把這些模型列為 60 和 57,而那組較舊的數字仍在發表報導中廣泛流傳——切勿將兩者混為一談,因為不同修訂版之間的數字無法互相比較。三分是很窄的差距,其展現方式是在極長的代理式鏈條上稍微更容易漂移,以及對模稜兩可的指令更為敏感,而不是屬於不同等級的模型。

第二點是速度,而這顛覆了名稱所帶來的直覺。在獨立測量中,Flash 是兩者中較慢的——每秒約 46 個輸出 token,而旗艦模型是 61,在此類別中平均為 67。Flash 之名是靠價格與多模態能力贏得的,而非延遲。這對比較很重要,因為通常會選用小模型的原因是它回答得更快,而在這裡並非如此。

真正該由你做出的決定

因為這兩個模型同時在三個軸向上有所不同——模態、授權和價格——所以選擇通常在第一個軸向上就底定,從來不會進到算術那一步。Flash 能讀取影像和視訊;Prime 除了文字以外什麼都讀不了。如果你的工作負載會碰到螢幕截圖、掃描頁面、UI 擷取畫面或視訊影格,那麼在價格還沒進場之前,比較就已經結束了,而你買的是 Flash。

如果你的工作負載純粹是文字,而問題確實關乎品質,那麼誠實的答案是:三點的指標差距就是你花 18 倍價格所買到的全部。這是否值得,完全取決於你能否驗證輸出。在答案可檢查的情況下——可編譯的程式碼、會傳回資料列的查詢、能依據結構描述驗證的結構化擷取——Flash 偶爾的失誤很容易發現,也很容易重試,而且價格只有十八分之一,你可以重試非常多次。當輸出是需要人來評判的文字,或是沒有中間檢查的漫長多步驟計畫時,這個差距更難彌補,而溢價也更容易合理化。

開放權重改變算式的地方

Flash 採用 MIT 授權,而它最小可行的量化需要約 93 GB 的加速器記憶體——對許多團隊來說是一台大記憶體節點,對某些人而言卻只是帳單上的零頭。GLM-5.3 採用專門訂製的授權條款,要求營收超過門檻的大型模型即服務營運商必須通過安全審查,而它最小可行的量化約需 217 GB,對大多數人來說屬於多節點部署。

這種不對稱意味著,對高用量團隊來說,真正的比較並不是 Prime 的 $8.80 對上 Flash 的 $0.50。而是 Prime 的 $8.80 對上你在自己已擁有的硬體上,執行你今天就能下載、無需進行授權洽談的權重時,每百萬輸出 token 的攤銷成本。對同時擁有硬體與用量的團隊而言,這個數字往往是三者中最小的,而且它只存在於這個比較的 Flash 這一側。

兩者都購買,以及一起購買它們

A screenshot of the OrcaRouter model page for GLM 5.3 Flash (z-ai/glm-5.3-flash, captured September 24, 2026) showing the 1M-token context badge, a 128K max output, text, image and video input with text output, a 2026-08-26 date beside 'Public benchmarks by Z.ai', a 320B total / 18B active parameter line, a p50 time to first token of 6.86 seconds, and a stat strip reading $0.07 input, $0.25 output, 6.86 s p50 TTFT, 10.00 s p95 TTFT and 22,120.9M tokens.

大多數正式環境系統不需要做選擇。適合這對組合的模式是路由器:在文字與多模態工作的預設路徑上使用 Flash,當任務屬於長時程,或第一次嘗試未通過檢查時,升級使用旗艦模型。這就是兩個模型 ID 和一個決策函式,而把這個拆分稍微弄錯的代價,是每千次請求多花幾美分,而不是架構問題。

我們以每百萬個 token 0.07 美元與 0.25 美元的價格託管 GLM-5.3-Flash——低於供應商自家的 0.15 美元與 0.50 美元定價——而 GLM-5.3 則依供應商 1.40 美元與 4.40 美元的定價提供,兩者我們都不加價——供應商的定價直接轉嫁而非重新定價,因此供應商調價時,我們這邊會在他們調價的同一天同步生效。這兩個 ID 與其他 200 多個模型一樣,都放在同一把金鑰之後,這讓從 Flash 升級到旗艦款的動作,只是在同一條呼叫路徑中更改模型名稱,而不必再做一次整合。自動容錯移轉可因應快速層級背後單一上游供應商效能劣化的情況,而對於像 Prime 這樣只列出單一供應商的層級而言,這絕非假設性的顧慮。

我們應該直言那樣的限制:OrcaRouter 並不託管 GLM 5.3 Prime,我們也不託管 GLM-5.3-FlashX。這兩個模型頁面在此都會回傳 404。如果你需要的是 Prime 的加速功能,你得向販售它的平台購買。

我們實際上會告訴你的話

A screenshot of the Artificial Analysis model page for GLM 5.3 Flash (captured September 24, 2026) showing an Intelligence Index score of 42 against a class median of 18, 180M tokens generated during evaluation, a 1M-token context window, $0.15 per 1M input and $0.50 per 1M output tokens with an 83% cache discount, and the comparison line 'At 46 tokens per second, GLM 5.3 Flash is notably slow (67).'

如果你一路讀到這裡,是想找出贏家,答案就是:這兩者從來不是一場較量。Flash 在成本、模態、授權與可部署性上都勝出,而且這四項都大幅領先。旗艦款的唯一說法,是三個指數點,以及每秒多約 15 個輸出 token,卻為此收取十八倍的價格。對絕大多數文字工作負載而言,Flash 才是正確的預設選擇,舉證責任落在昂貴的那個選項上。

需要留意的是中間地帶。一個團隊若在文字上需要旗艦級的推理品質,同時又需要讀取圖片,最後就會同時運行兩個模型,而誘惑在於把所有工作都導向旗艦模型,因為它才是享有口碑的那一個。18× 的差距就是在這裡悄悄變成真正的預算項目。把多模態工作導向 Flash,失敗時再升級,並且在你假設升級率很高之前,先檢查實際的升級率是多少。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新