
GLM 5.3 Prime 與 GLM-5.3:兩倍的價格,相同的權重,外加一個碼錶
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
這項比較中沒有品質疑慮,而這正是它不尋常的地方。GLM 5.3 Prime 與 GLM-5.3 是同一個模型——相同的權重、相同的 1,000,000 詞元上下文、相同的 131,072 詞元輸出上限、相同的強制推理與相同的三個努力等級、在每個已發布基準測試上相同的分數。GLM-5.3 於 2026 年 8 月 14 日發布,8 月 18 日在 API 上線,並於 8 月 25 日開放權重;Prime ID 在 9 月下旬出現,成為購買完全相同東西的第二種方式。比較中唯一不同的那一列,正是會影響你帳單的那一列,而且它正好相差 2.0 倍。
所以問題不在於該用哪個模型。而在於一條宣稱能提供 1.5–2 倍輸出吞吐量的服務通道,是否值得付出 2 倍的價格;而這是一段話就能算清的算術。關於這兩者的大多數評析都略過這道算術,反而爭論一些從設計上來說本就完全相同的基準測試。以下是總和。
唯一不同的列

• 價格 — GLM 5.3 Prime 每 1M 為 $2.80 / $8.80,對比 GLM-5.3 每 1M 為 $1.40 / $4.40
• 快取輸入 — 每 1M 為 $0.56,對比每 1M 為 $0.26
• 倍率 — 每一行皆為 2.0×,雙向皆然,毫無例外
• 輸送量 — 廠商報告在加速通道上為標準通道的 1.5–2 倍;目前並無針對 Prime ID 的獨立測量結果
• Intelligence Index — 兩者皆為 45,因為它是同一個模型,只評分一次
• 上下文 — 兩者皆為 1,000,000 個 token
• 最大輸出 — 兩者皆為 131,072 個 token
• 推理 — 兩者皆為強制啟用,low / high / max,預設為 max,兩者皆然
• 模態 — 兩者皆為文字輸入、文字輸出
• 權重 — GLM-5.3 的權重可依特定授權條款下載;Prime 則完全沒有權重
• 可用性 — GLM-5.3 在 Z.ai 自家 API 及所有提供它的平台上皆可使用;Prime 則僅在單一平台上提供,且須經由一個具名的上游供應商
請注意這些完全相同的列對一般比較文章造成了什麼影響。這裡沒有推理深度論點,沒有長上下文論點,沒有工具呼叫論點,也沒有服務授權論點能把這兩項產品區分開來,因為服務通道不會改變模型的行為。如果你讀過這對產品的正面對決,而其中發現 Prime 在某項任務上「能力更強」,那個發現只是雜訊——相同的權重不會產生不同的分佈,而它們唯一的不同之處,在於詞元送達的速度,以及預設推理強度讓模型輸出多少個詞元。
損益兩平,正確做法
把這兩個通道按每單位工作量來定價,整件事就會收斂成一個比率。如果 Prime 以 2.0× 的價格提供 2.0× 的吞吐量,你就是在以相同成本購買相同產出,只是用金錢換取實際時間——純粹購買延遲,既沒有溢價也沒有折扣。如果 Prime 以 2.0× 的價格提供 1.5× 的吞吐量,你每 token 每秒大約要付 1.33×,也就是為了少等一點而支付三分之一的溢價。這些是廠商自己聲稱範圍的兩端,而且兩端都是最佳情況,因為它們假設 1.5–2× 在你的工作負載上成立,而不是在廠商的基準測試條件下成立。
實務上,溢價比那還糟,原因只有一個:吞吐量是在熱啟動、短、無競爭的請求上測得的,而它正是對其他一切最敏感的指標。長上下文的代理工作階段每一回合都會重新讀取不斷增長的對話紀錄,這會把負載壓在預填充與快取讀取上,而不是穩態解碼——而 Prime 對快取讀取也收取雙倍費用。對基礎模型的獨立測量顯示,GLM-5.3 大約為每秒 61 個輸出 token,而同級平均為 67,但那個數字是標準化評估集上的中位數,不是你在負載下會碰到的尾端表現。誠實的總結是:Prime 每單位吞吐量的成本介於基礎通道的 1.0 倍到 1.33 倍之間,而 1.0 倍那一端需要廠商的最佳情況完全成立。
同樣的重量,意義比聽起來更重大

共用權重集的實際好處在於,你針對 GLM-5.3 所打造的一切,在雙向切換後都能沿用。提示詞形態可以移轉,工具結構描述可以移轉,快取鍵可以移轉,而你當初為了證明旗艦模型合理性所執行的評估,在兩個 ID 上也仍然有效。不必重新調校,不必重新建立基準,失敗模式也不會出現意外,因為失敗模式屬於模型本身,而不是屬於提供服務的通道。
這是一把雙面刃,而第二個方向才是你該內化的。如果 GLM-5.3 的推理預設值 max 讓它在你的任務上變得冗長,Prime 也會連同其他一切一併繼承這份冗長。一條產生比你所需更多 token 的更快通道,端到端並不會更快。在為加速付出 2 倍代價之前,先把 effort 等級降到 high 或 low 再實測——effort 設定對端到端延遲的影響通常比 serving lane 更大,而且完全不花成本。
價目表上看不到的那一項不對稱
GLM-5.3 的權重已開放。任何擁有硬體的人都能下載它們,並以成本價提供該模型服務,沒有按 token 計費的帳單,也不必在服務路線之間做選擇。最小可行的量化約落在 217 GB 的加速器記憶體範圍,對多數團隊而言這是多節點部署,對某些團隊來說則不過是零頭;而該授權設有營收門檻,大型模型即服務營運商一旦超過此門檻,就必須先通過安全審查,才能在商業上提供該模型的服務。
Prime 沒有權重。它是別人部署上的一條代管通道,而它的上架資訊在端點背後只載明了一家上游供應商。這正是值得點名的不對稱:對基礎模型而言,你是在每 token 價格與自家攤銷成本之間做選擇;而對 Prime 而言,你是在每 token 價格與別無其他之間做選擇。一個已經在自己的硬體上跑 GLM-5.3 的團隊,在這項比較中還有價目表從未顯示的第三個選項,而它通常是三者中最便宜的。
碼錶真正勝出的地方
有些工作負載中,每個 token 多付 1.33× 的溢價顯然是正確的,而它們都有一個共同特性:瓶頸在於 token 預算以外的某個東西。像是有人在聊天介面裡等待回應。像是管線中的某個同步步驟,在模型回傳之前,下一階段無法開始。像是一個代理迴圈發出十次循序呼叫,其中每次呼叫的延遲都會乘以鏈路長度,而使用者實際感受到的是總掛鐘時間。在這些情況下,你買的不是 token,而是買回那些 token 原本要耗費的時間,而帳單上的 2× 並不是決定這項功能能否成立的數字。
在那種模式之外,這筆帳很快就會對 Prime 不利。隔夜批次生成不在乎任何單一請求回傳得多快。大量分類也一樣不在乎,而且在大規模下,快取讀取的 2× 溢價會累積成一筆實際的支出項目。而任何以模型自身推理長度為主導項的工作負載——一道難解的數學題、一條漫長的規劃鏈——都是在為請求中從來就不是慢的那個部分支付加速費用。
雙通道,一組金鑰,無需二次整合

大多數團隊最終解決這個問題的方式,並不是選定單一管道,而是在兩者之間進行路由,而這只有在兩個 ID 都能以相同方式觸達時才說得通。OrcaRouter 提供 GLM-5.3 採用供應商的表定價格,每百萬 token 為 1.40 美元與 4.40 美元,我們不收取任何加成——直接沿用供應商的表定價格,而非重新定價,因此供應商一調價,我方當天即同步生效。GLM-5.3-Flash 也在這裡,價格為 0.07 美元與 0.25 美元,這點很重要,因為從便宜模型升級到旗艦模型的這條路由,正是大多數正式環境流量真正想要的形態。
這兩個 ID 與其他 200 多個模型一樣,都共用同一把 API 金鑰,這讓通道決策變成單一呼叫路徑內的模型名稱變更,而不是第二份合約與第二套整合。路由 DSL 正是這對模型能發揮用處的地方:把延遲敏感的呼叫送往加速通道,其餘全送到標準通道,或在檢查失敗時升級處理,而不是憑猜測升級。自動容錯移轉涵蓋單一上游供應商效能劣化的情況,這正是單一供應商快速層級所承擔的特定風險。
有一件事我們不會暗示:OrcaRouter 並不代管 GLM 5.3 Prime,而且其模型頁面在這裡會回傳 404。如果你要的是加速通道,就得向販售它的平台購買。我們能做的是提供你基礎通道、Flash 模型,以及一個能在兩者之間路由的地方。
如何在三十秒內決定
先問問是否有任何東西正在等待這個回應。如果有人或下游服務因此受阻,而且這個工作負載是延遲受限而非吞吐量受限,再加上你已經確認過推理投入量並不是延遲的真正驅動因素,那麼 Prime 的溢價就是這項功能該付的代價,你應該付。如果沒有任何東西在等——批次作業、離線評估、大量擷取,任何由佇列吸收延遲的情況——那你就是在為一個永遠不會有人看的數字,為每單位吞吐量多付三分之一的溢價,這時候基礎通道才是正確的答案。
更宏觀的問題在於這個系列是如何被販售的。GLM-5.3 只在八月推出過一次,而到了九月,它已經至少出現四種截然不同的價格,取決於你走的是哪條通道、哪個平台,以及最後落在哪個同系列兄弟模型上。Prime 是其中最貴、也最缺乏文件說明的,因為把名字掛在權重上的那家公司並沒有把它列出來。這並不是反對購買它的理由。這是一個理由,要你在把正式環境流量導向它之前先弄清楚:相較於基礎模型,你唯一多買到的東西只是一支碼錶——而這支碼錶是按 token 計費的。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
