生成的標題卡寫著「GPT-6 vs GLM 5.3」,其中一個標籤寫著「GLM 5.3:開放權重,2026-08-18 發布」,另一個標籤寫著「GPT-6:封閉權重,2026-09-22 推出」,頁腳寫著「AA 同儕群組不同:開放權重與專有模型的分數無法相減。」OrcaRouter 標誌合成於右下角。
Guides & Insights

GPT-6 對上 GLM 5.3:其中一款你能下載,而價格差距比指數差距還小

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

把GPT-6拿來與GLM 5.3對比的理由,不在於那張基準測試表。而在於 GLM 5.3 是這個價位區間裡唯一能把權重帶回家的模型,而 GPT-6 則是封閉的一代,旗下三個成員只能透過 API 取得。這項差異所左右的採購決策,比任何指數差距都來得多,而這也正是兩者分數無法直接互相比較的原因——而這恰恰是大多數這對模型的公開比較文章搞錯的地方。

雙方,確切地說

GLM 5.3 是 Z.ai 的旗艦模型,於 2026 年 8 月 18 日發布,權重約一週後公開。它是純文字模型——不支援圖像輸入——具有 1,000,000 個詞元的上下文視窗,以及 128,000 個詞元的輸出上限;Z.ai 標價為每百萬輸入詞元 1.40 美元、每百萬輸出詞元 4.40 美元,快取輸入費率為每百萬 0.234 美元。它以下列模型 ID 提供服務:z-ai/glm-5.3。

GPT-6 是一個世代,而非一款模型。GPT-6 Astra、GPT-6 Sol 與 GPT-6 Luna 是三個價位的三個 id,均於 2026 年 9 月 22 日發布,輸入端皆為多模態(文字、圖像與檔案),皆具備約 1,050,000 個 token 的上下文視窗,以及 128,000 個 token 的輸出上限。並沒有 openai/gpt-6 端點。當有人在價格討論中說「GPT-6」時,幾乎總是指 GPT-6 Sol,也就是 $2.00 / $10.00 的中階版本——因此只要需要單一 id,本比較就會採用這個成員。

• 權重 — GLM 5.3 開放,可下載且可自行部署;GPT-6 為封閉式,僅提供 API
• 輸入模態 — GLM 5.3 僅支援文字;GPT-6 的三個層級皆接受文字、圖像與檔案
• 輸入價格 — GLM 5.3 每百萬 $1.40,GPT-6 Sol 每百萬 $2.00
• 輸出價格 — GLM 5.3 每百萬 $4.40,GPT-6 Sol 每百萬 $10.00
• 快取輸入 — GLM 5.3 每百萬 $0.234,GPT-6 Sol 每百萬 $0.20
• 上下文長度 — GLM 5.3 為 1,000,000 個 token,GPT-6 Sol 為 1,050,000 個 token
• 長請求級距 — GLM 5.3 在其公開規格卡上並無此級距;GPT-6 Sol 在輸入超過 272,000 個 token 時,會將整筆請求重新計價為 $4.00 / $15.00
• 授權條款 — GLM 5.3 依 Z.ai 自家的开放授權條款發布;GPT-6 沒有授權檔案,因為根本沒有東西可授權

請注意價格行上的但書,因為這是真實存在的問題,而且本部落格以前就遇過:OrcaRouter 的模型頁面不一定總是與供應商自家的價目表同步;具體就 GLM 5.3 而言,我們的型錄列出的是 $1.26 / $3.96,而 Z.ai 公布的金額是 $1.40 / $4.40。當兩者不一致時,請在正文中引用供應商的數字——上方項目符號正是如此——並將頁面上的數字解讀為該頁面自身的數值。兩者都站得住腳;只是它們不是同一個數字。

為什麼指數比較需要警告標籤

陷阱就在這裡。在 Artificial Analysis 智慧指數上,GLM 5.3 拿下 44.8,而 GPT-6 Sol 拿下 47.6——兩者相差 2.8 分。這看似是一個封閉模型與一個開放模型之間的勢均力敵,而後者的輸出價格大約只有前者的五分之一;而這也正是大多數針對這組模型的比較所止步的那句話。

這不是有效的相減。Artificial Analysis 只會將開放權重模型與同一尺寸級別的其他開放權重模型互相比較排名,而專有模型則是在專有區間內、以混合的 3:1 輸入對輸出價格比來排名。GLM 5.3 的 44.8 是開放權重分數。GPT-6 Sol 的 47.6 是專有區間分數。它們位於不同的量表上,而兩者之間的差距並不是能力衡量。同樣的注意事項也適用於 OrcaRouter 目錄條目中的這兩個數字,上述兩個數字正是出自該處。

你能在那條線上比較的是成本會計與費率卡,其次是以相同方式執行相同評估的那些列。請閱讀這兩頁:

• AA Coding Index — GLM 5.3 74.8 對比 GPT-6 Sol 60.0
• GPQA Diamond — GLM 5.3 91.7
• Humanity's Last Exam — GLM 5.3 42.3 對比 GPT-6 Sol 47.9
• Terminal-Bench 2.1 — GLM 5.3 83.9
• Terminal-Bench 4.0 — GLM 5.3 41.9 對比 GPT-6 Sol 43.9
• τ-bench 銀行業 — GLM 5.3 50.3
• SciCode — GLM 5.3 59.0 對比 GPT-6 Sol 57.6
• 長上下文召回 — GLM 5.3 79.7 對比 GPT-6 Sol 83.7

要把它讀成一種整體形貌,而不是分數差異:GLM 5.3 在代理與程式編寫評估上表現強勁——τ-bench banking 與 SciCode 都偏向它,而它的 Coding Index 遠高於 Sol 的——而 GPT-6 Sol 則在長上下文召回與 Humanity's Last Exam 這兩列上佔優。這兩種讀法都不是定論。它們是兩組不同的強項,由第三方衡量,分別落在一個你能下載的模型,以及一個你不能下載的模型上。

在這裡,哪些開放權重才真正值得?

關心 GLM 5.3 授權條款的理由無關意識形態。而是當權重屬於你之後,有三件具體的事情不再由供應商決定。

首先是資料駐留。自架式的 GLM 5.3 在你放置的地方運行,沒有任何資料處理協議規範什麼會離開你的網路。GPT-6 沒有對等的選項——唯一能呼叫它的方式是透過 API,而資料會流向你無法掌控的地方。對於受監管的工作負載而言,這往往就是決定的一切,而這正是該指數從未捕捉到的決定。

第二個是價格曲線。API 費率表是供應商開出的數字,供應商可以隨時調整;已公布的 GPT-6 費率雖由供應商聲稱為永久而非促銷,但那是意圖的表達,不是合約。自有權重有固定成本,且這項成本不會隨 token 用量持續增加;交叉點取決於你的用量,而不是任何人的定價決策。這就是為什麼 $1.40 / $4.40 的價目表其實不是真正的比較——真正的比較,是 $1.40 / $4.40 對上你自己按自身流量攤銷的硬體成本。

第三點是故障模式。託管模型可能被棄用、受到速率限制,或因服務變更而效能降低。GLM 5.3 自 8 月 18 日起即可呼叫,背後有公開檢查點;如果 Z.ai 變更了你不同意的內容,你當初據以驗證的檢查點仍保存在磁碟上。

那種自由的成本也是真實的,而且值得直白說明。GLM 5.3 僅支援文字,因此若工作負載需要把螢幕截圖或 PDF 餵進模型,在這個比較的開放權重這一側根本沒有可行路徑。自行服務 1,000,000 個 token 的上下文並不是筆電就能辦到的事。而你下載的模型就是你要負責的模型——評估、安全過濾、正常運行時間與升級全都變成你的責任,這是一筆實實在在的工程預算,並未包含在 API 價格裡。

GPT-6 在哪些方面值得其溢價

與此相對,支持封閉一方的理由比其價格所暗示的更狹隘,但並非空泛。

多模態輸入是最具體的一項。GPT-6 的三個層級都原生支援影像與檔案,而 GLM 5.3 兩者都不支援。一個能在同一次呼叫中讀取圖表、螢幕截圖或掃描文件並據以推理的流程,無法以目前發布的 GLM 5.3 來建置。

長上下文召回是第二項。GPT-6 Sol 在該項目上以四分領先 GLM 5.3,而這一項決定了極大的上下文究竟是真正可用,還是僅止於被接受。一個會遺失文件中段的 1,000,000 token 視窗,仍比一個不會如此的 100,000 token 視窗來得更大。

而這個世代有不止一個價位。$2.00 / $10.00 的 Sol 方案通常是人們拿來與 GLM 5.3 比較的那個,但 GPT-6 Luna 落在 $0.10 / $0.50——比 GLM 5.3 的輸入費率低一個數量級,比其輸出費率低將近九倍——而 9 月 29 日推出的 GPT-6.1 Sol,在 Sol 的價格下於同一指數上得分 51.8。如果問題純粹是「最便宜且夠勝任的 token」,GPT-6 世代有一個 GLM 5.3 沒有的答案。

A generated two-column comparison scoreboard titled "GPT-6 Sol vs GLM 5.3 — the scoreboard". The left column, GPT-6 Sol, reads Weights closed, Input $2.00, Output $10.00, AA Intelligence 47.6, AA Coding 60.0, Long-context recall 83.7. The right column, GLM 5.3, reads Weights open, Input $1.40, Output $4.40, AA Intelligence 44.8, AA Coding 74.8, Long-context recall 79.7. A footer line reads "AA ranks open-weights and proprietary models on different peer scales; the two Intelligence figures are not subtractable." The OrcaRouter logo is composited in the bottom-right corner.

把它們合併運行,是多數團隊最終得出的答案

這個比較在實務上的結論是,兩者並非互斥。GLM 5.3 一直帶來非常大的用量——OrcaRouter 的目錄記錄到在七天期間內約有 19 億個 token 被路由到它,而 GPT-6 Sol 約為 210 萬個——這正是開放權重模型搭配低廉輸出費率時,團隊把大量工作交給它會呈現的樣子。同一期間內,GPT-6 的流量集中在較高階的層級上,那裡的工作屬於需要多模態輸入或頂級模型的那種。

兩者都是同一份目錄中已上線的路由,位於 OrcaRouter 上:一個 API 置於 200 多個模型前面,可透過與 OpenAI 相容的端點呼叫,並以 0% 加價原樣傳遞供應商的定價,因此供應商價格變動時,我們這邊當天就會生效,而不是等到你的下一個帳單週期。在這次特定比較中,這點比平常更重要,因為整個 GLM 5.3 價格問題牽涉一個變動因素——目錄數字和供應商數字已經相差約 10%——而直通式路由意味著你是按供應商的數字計費,而不是支付會把它隱藏起來的加價。

路由 DSL 正是讓這道分界變得明確的關鍵:把大量、純文字的歸類與擷取流量送往 GLM 5.3,並把多模態或長脈絡召回的工作交給 GPT-6 等級的模型,而且是依每次請求而非每季調整,同時讓自動容錯移轉涵蓋任一方。開源權重與 API 之爭不再是全有或全無的架構承諾,而是變成一條你下週就能更改的路由規則。

Screenshot of the OrcaRouter model page for z-ai/glm-5.3, showing the Z.ai vendor label, a 2026-08-18 catalogue release date, a context of 1M tokens, a 128K maximum output, text-only input, Tools, JSON and Reasoning badges, and a rate strip reading $1.26 per million input tokens, $3.96 per million output tokens, a 4.54 s median time to first token, a 10.00 s p95, and 1,903.6M tokens routed in seven days.

裁決,也就是一個關於你限制條件的問題

如果你能夠自行託管、需要大規模的純文字吞吐量,或有 API 無法滿足的資料駐留要求,那麼 GLM 5.3 就是答案,而且價差大到足以支撐自行維運模型的工作。如果你需要圖像與檔案輸入、長脈絡召回是關鍵支柱,或者你完全不想自己維運模型,那麼 GPT-6 就是答案,而你付出的溢價買到的是具體的東西,而不是品牌。

兩個答案都不是:「GPT-6 得分高出 2.8 分」。這種減法並不可行,因為這兩個數字來自同一個排行榜上的不同同儕群組——而建立在它之上的比較,會是在引用一個數字,彷彿它衡量了它其實並未衡量的東西。費率卡是可比的。授權狀態也是可比的,因為它截然不同。指數列則不然。

Screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1,050,000-token context window (shown as 1.05M-token context in the model blurb), a 128K maximum output, text, image and file input, and a rate strip reading $2.00 per million input, $10.00 per million output, a 6.79 s median time to first token, a 10.00 s p95, and 2.1M tokens routed in seven days.

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新