一張生成的主視覺標題卡,寫著「GPT-6 Luna vs GLM-5.3」,副標題為「多八個索引點,每項任務成本卻高十倍,而權重仍未公開。」,標籤顯示 Luna 為每 1M $0.10/$0.50、索引 37,GLM-5.3 為每 1M $1.40/$4.40、索引 45,每項索引任務成本為 $0.07 對 $0.68,OrcaRouter 標誌位於右下角。
Guides & Insights

GPT-6 Luna 對決 GLM-5.3:你仍然無法下載的開放權重模型

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

GLM-5.3是更出色的模型。在最大努力設定下,它在 Artificial Analysis 智慧指數上拿下 45 分,勝過GPT-6 Luna的 37 分;根據 Z.ai 的說法,它在部分資安評測上與 Mythos 5 不相上下,並在數個綜合排行榜上都是領先的開放權重模型。但此刻,它仍是你租用的 API,而不是你擁有的模型:Z.ai 因資安方面的疑慮,把權重發布延後了大約兩週,而那個本應是開放權重旗艦機種存在意義所在的下載,至今仍不見蹤影。

那個延遲就是這場對決的關鍵,而且它改變了計算方式,這是價格表所忽略的。GPT-6 Luna 於 2026 年 9 月 22 日推出,每百萬輸入 token 為 0.10 美元,每百萬輸出為 0.50 美元,全面開放使用,沒有任何附加條件。GLM-5.3 於 2026 年 8 月 18 日推出,價格為 1.40 美元和 4.40 美元——是 Luna 輸入費率的十四倍,輸出費率則將近九倍——但其權重並未釋出。所以這並不是開放模型對上封閉模型的比較。而是你可以今天以十分之一成本呼叫的封閉模型,對上你今天只能呼叫的開放模型,而後者的定價彷彿你買的是那個你還無法擁有的東西。

兩款型號,相隔一個月,兩筆截然不同的交易

GPT-6 Luna 是 OpenAI GPT-6 世代中的小型等級,與 GPT-6 Sol 一同推出,價格為 $2.00/$10.00,並位居旗艦級 GPT-6 Astra($10.00/$50.00)之下。它具備 1,050,000 個權杖的上下文視窗、128,000 個權杖的輸出上限、文字與圖片輸入,以及從 none 到 low、medium、high、xhigh 和 max 的推理階梯,並以 medium 為預設值。OpenAI 稱其為家族中最高效的模型,適合專注且高吞吐量的工作,而費率表也印證了這點:每百萬個權杖的快取輸入為 $0.01,是原本已相當低廉的非快取費率的十分之一。

GLM-5.3 是 Z.ai 目前針對複雜軟體工程與長時程代理式工作的旗艦模型,於 2026 年 8 月 18 日發布。它採文字輸入、文字輸出,具備 100 萬 token 的上下文視窗,輸出上限為 128,000 token,且推理始終開啟——沒有非推理模式。Z.ai 形容其程式設計體驗相較 GLM-5.2 提升約 50%,並將其定位於儲存庫規模的程式設計與自主多步驟工程。權重推出時將是主打亮點;目前正式上線的是 API。

這兩份費率表實際上寫了些什麼

每個維度一行,每一行兩側都要顯示:

• 每 1M 輸入 — GPT-6 Luna $0.10 vs GLM-5.3 $1.40

• 每 1M 輸出 — GPT-6 Luna $0.50 對比 GLM-5.3 $4.40

• 快取輸入 — GPT-6 Luna 每 1M 為 $0.01,相較於 GLM-5.3 每 1M 為 $0.26,其自身輸入費率即享有 81% 折扣

• AA Intelligence Index — GPT-6 Luna 在最高強度下為 37,對比 GLM-5.3 在最高強度下為 45

• 預設努力分數 — GPT-6 Luna 29 在其中等預設值下 vs GLM-5.3 的常開推理,在最大設定下測量

• 索引執行時的輸出 token 數 — GPT-6 Luna 150M 對比 GLM-5.3 210M,而排行榜中位數為 140M

• 執行索引的成本——GPT-6 Luna $122.39 對比 GLM-5.3 $2,503.48

• 每項索引任務的成本 — GPT-6 Luna 約 $0.07,而 GLM-5.3 約 $0.68

• 上下文與輸出 —— GPT-6 Luna 1,050,000 輸入 / 128,000 輸出 對比 GLM-5.3 1M 輸入 / 128,000 輸出

• 長上下文條款 — GPT-6 Luna 的輸入與快取為 2 倍,輸入超過 272K 時輸出為 1.5 倍;整筆請求方面,對比 GLM-5.3 在公布的計價卡上並無等效條款

• 推理關閉開關 — GPT-6 Luna 從 none 到 max,相較於 GLM-5.3 始終開啟,沒有非推理模式

• 權重 — GPT-6 Luna 封閉、僅提供 API,相較於 GLM-5.3 承諾開放,發布延後

A generated single-panel scoreboard card headed 'Same suite, ten times the task cost' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M with index 37 at max effort; GLM-5.3 $1.40 in / $4.40 out per 1M with index 45 at max effort; cost per completed index task about $0.07 against about $0.68; output tokens on the index run Luna 150M against GLM-5.3's 210M and a board median of 140M; reasoning configuration Luna none through max against GLM-5.3 always on with no off switch; and weights, Luna closed and API-only against GLM-5.3 open by commitment with the release delayed. Footer: 'Index and cost per task per Artificial Analysis; prices per OpenAI and Z.ai.'

冗長稅是決定這件事的數字。

指數上八個百分點的差距確實存在,價格差距則更大,但這兩者都不是最重要的數字。真正重要的是每完成一項任務的輸出 token 數,因為八個百分點的能力優勢能否回本,就取決於此。

Artificial Analysis 的 index run 是目前最乾淨的受控比較:同一套測試套件、同一套測試框架,分別對兩個模型執行。GLM-5.3 完成這項測試時產生了 2.1 億個輸出 token。GPT-6 Luna 則產生了 1.5 億個。對照排行榜中位數的 1.4 億,兩者都算多話——GLM-5.3 比中位數多出一半,GPT-6 Luna 則多出約十分之一。但這道差異的方向,在價格上對 Z.ai 的模型形成加乘效應:它多輸出 40% 的 token,而每個 token 的收費卻是 8.8 倍。

把兩者放在一起看,每完成一項索引任務的成本,GLM-5.3 約為 0.68 美元,而 GPT-6 Luna 約為 0.07 美元——差距約十倍,比原始價目表上的比率還大,因為較貴的模型也是較冗長的那一個。這就是這個組合真實的樣貌。GLM-5.3 讓你以每件完成工作十倍的金錢,換來八個索引分數;而這是不是一筆好買賣,完全取決於你的工作負載是否屬於那種八分就是能不能運作的差別。

對大量正式環境流量來說,並不是。對一個在模型能力極限邊緣處理儲存庫的編碼代理而言,這往往正是如此;而無論價格優勢有多大,都無法弭平在會失敗的任務上的能力差距。

為什麼開放權重會改變答案,以及為什麼延遲會把它改回來

開放權重旗艦模型的標準論點是:每 token 的價格只是暫時的。你先租用,直到你的用量大到足以證明買下來是合理的,然後你下載模型,每個 token 的邊際成本就變成電力。按這種論點,GLM-5.3 的 $1.40/$4.40 其實並不是 GPT-6 Luna 的 $0.10 的十四倍——它是通往零的過渡價格,而封閉模型較便宜的費率則是一場沒有退場機制的租賃。

那個論點是正確的,而且它目前處於擱置狀態。Z.ai 因網路安全方面的發現,將權重延後發布了大約兩週,這意味著那個足以支撐此溢價的退場機制尚不存在。在它出現之前,GLM-5.3 是一個按量計費的 API,其每項任務成本是某個模型的十倍——而那個模型在通用排行榜上落後它四個指數點,在程式碼排行榜上落後它一個點——而買家付的是開放權重的價格,換取的卻是封閉權重的使用權。

有一個二階論點值得點明。延後發布並不是醜聞;這是供應商認真看待一項能力發現,而一個能妥善找出漏洞的模型,正是實驗室在將其以可下載檔案形式發布時應該格外謹慎的那種模型。但這確實意味著,權重的發布日期如今是這項比較中最重要的單一日期,而它並未公布。一支以十二個月為期程、在這兩個模型之間做選擇的團隊,其實是在一個條款可能下個月就改變的模型,與一個條款不會改變的模型之間做選擇——而只有其中一者的定價反映了這一點。

遷移表面很小

兩個模型都提供 OpenAI 相容的對話補全介面,也都具備 1M 級別的上下文視窗,並同樣將輸出上限設在 128,000 個 token,因此在兩者之間移植更像是調整設定,而非重寫。真正會帶來麻煩的差異在於行為,而非結構。

GPT-6 Luna 的長上下文條款是昂貴的那一項:輸入權杖超過 272,000 的請求,整筆請求會以兩倍的輸入與快取費率,以及 1.5 倍的輸出費率計費,因此一次 300,000 權杖的呼叫,成本是相同工作拆成兩次時的兩倍。GLM-5.3 公開的規格卡沒有對應條款,這在真正龐大的單一請求上會大幅縮小價差,甚至在輸出密集型工作上可能逆轉價格差距。

推理設定則往相反方向發展。GLM-5.3 的推理永遠開啟,而且無法關閉,這對任何對延遲敏感的應用來說都是硬性限制——分類器或路由器都無法使用它。GPT-6 Luna 提供 none、low、medium、high、xhigh 和 max,預設為 medium,而在該設定下它得分 29 而非 37。這單一參數就是 GPT-6 Luna 落後 Z.ai 模型八個指數點、與落後十六個指數點之間的差別;而一支在遷移時沒有明確設定該參數的團隊,實際上跑的是第二種組態,卻以為自己買到的是第一種。

GLM-5.3 已在 OrcaRouter 上以 Z.ai 的定價提供,採用直通式定價,讓供應商的費率變動當天就反映在我們這邊,而不必等經銷商重新協商——對一個指標數字預計會隨權重發布而變動的模型來說,這比平常更重要。截至本文撰寫時,GPT-6 Luna 尚未收錄在我們的目錄中,須透過 OpenAI 自家的 API 才能使用。同時運行兩者的團隊——有鑑於兩者在極端情境上有多麼不同,這在此處是合理的配置——會為 GLM-5.3 使用一組金鑰,並搭配其原本用於 OpenAI 的既有方式,只需變更路由,而不必重新部署,就能在五分錢的分類器與儲存庫規模的程式碼代理之間轉移流量

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

那通電話

凡是供程式取用且高流量的工作,就採用 GPT-6 Luna。分類、擷取、路由、批次摘要,以及代理的內層迴圈。價格為 $0.10/$0.50,快取輸入只需一美分,Batch 則是標準費率的一半,每完成一項任務的成本比 GLM-5.3 便宜一個數量級,而那八點的指數差距在你的評估中根本看不出來。請明確設定 effort 參數,並讓你的長時間呼叫保持在 272,000 個權杖以下。

當任務屬於困難的那一類,而答案比帳單更重要時,就選 GLM-5.3。儲存庫規模的軟體工程、自主的多步驟工作,任何八個指標分數就是任務完成與任務失敗之間差異的場合。冗長是實實在在的負擔,十倍的任務成本也是真的,但能完成的模型,比必須重試的模型更便宜。

而且要留意權重。Z.ai 發布 GLM-5.3 下載的那一天,就是這項比較的核心事實改變的那一天,而這是本頁唯一還沒登上行事曆的日期。

A screenshot of the OrcaRouter model page for GLM-5.3 (z-ai/glm-5.3), showing the Tools, JSON and Reasoning badges, a 2026-08-18 catalogue date, 1M-token context with 128K maximum output, list pricing of $1.26 input and $3.96 output per 1M tokens, a p50 time to first token of 3.99s, 1807.1M tokens of traffic, and the description of GLM-5.3 as Z.ai's flagship model for complex software engineering and long-horizon agentic tasks.

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新